← AI og samfunn

Red teaming

Red teaming

Når fagfolk med vilje prøver å lure en KI-modell til å gjøre noe galt. Målet er å finne svakhetene før noen med dårlige hensikter gjør det. Det kan være å få modellen til å forklare hvordan man lager farlige stoffer, eller til å hjelpe med svindel. Da kan selskapet rette feilen før modellen slippes ut.

Før en ny KI-modell lanseres, bruker et team uker på å prøve triks for å få den til å bryte sine egne regler. Hullene de finner, blir tettet før vanlige brukere får tilgang.

Kilde: World Economic Forum →