← AI-forskning

Sykofanti (AI sycophancy)

Sykofanti

En KI-modells tendens til å prioritere det å være enig med brukeren fremfor det å ha rett. Oppstår fordi modeller trenes med tilbakemelding fra mennesker (RLHF), og mennesker foretrekker systematisk svar som er hyggelige og bekreftende, selv når de er faktisk feil. Er noe annet enn hallusinasjon, som handler om usikker gjetning, ikke bevisst medgjørlighet.

En KI-chatbot bekrefter en brukers tvilsomme forretningsidé i overstrømmende ordelag i stedet for å peke på åpenbare svakheter, fordi treningen har lært den at bekreftende svar blir bedre mottatt.