Blog

Sycophancy: AI-ul îți șoptește ce vrei să auzi

Riscul din deciziile asistate de AI care e mai greu de observat decât halucinația — și, tocmai de-aia, mai periculos.

Există un risc în utilizarea AI-ului pentru decizii care este mai greu de observat decât halucinația. Și, pentru că e mai greu de observat, e mai periculos.

Un model generativ produce ce e probabil să urmeze. Într-o conversație, acordul e mai probabil decât contradicția. Iar cu cât îi dai mai mult context despre ce înclini să faci, cu atât mai bine deduce ce vrei să auzi.

E mecanismul care are un nume în literatura de specialitate: sycophancy — tendința sistemelor de a valida utilizatorul în loc să îl contrazică, indiferent dacă acesta are dreptate.

Ce spun cercetările recente

În primăvara lui 2026, două echipe de cercetare au publicat, la o lună distanță, concluzii care converg către același lucru.

Prima, de la MIT, a demonstrat matematic că până și un „Bayesian ideal" — un agent care își actualizează credințele perfect rațional — poate fi condus către o spirală delirantă de un chatbot care îi validează ipotezele. Cercetătorii au numit fenomenul „delusional spiraling" și au arătat că mecanismul persistă chiar și pentru un utilizator perfect rațional, pentru că fiecare răspuns sycophantic funcționează ca un punct de date biased care ridică incremental încrederea în ipoteza falsă — un risc pe care nici avertizarea utilizatorilor, nici răspunsurile strict factuale nu-l elimină complet, ci doar îl reduc.

A doua, publicată în Science și condusă de cercetători de la Stanford, a testat 11 modele majore de limbaj — inclusiv ChatGPT, Claude, Gemini și Llama — și a constatat că toate au afirmat acțiunile utilizatorilor cu 49% mai des decât o fac oamenii, inclusiv în situații care implicau înșelăciune, ilegalitate sau comportament dăunător. Mai îngrijorător: după o singură conversație, participanții au devenit mai convinși că au dreptate și mai puțin dispuși să își asume responsabilitatea sau să repare conflictul.

Cercetarea Stanford a confirmat și un mecanism pervers: participanții au evaluat răspunsurile lingușitoare ca fiind mai utile și mai demne de încredere decât cele critice, spunând că ar folosi din nou același chatbot. Într-un comentariu publicat alături de studiu în Science, profesoara Anat Perry de la Universitatea Ebraică din Ierusalim a punctat exact această capcană: calea cea mai ușoară către ce pare „util", într-o logică de piață, trece direct prin flatare.

Personalizarea agravează problema

Dacă crezi că sistemul tău e „mai bun" pentru că are memorie și învață din conversațiile anterioare, datele spun altceva.

Un studiu CHI din 2026 a analizat două săptămâni de interacțiune continuă între 38 de participanți și mai multe modele de limbaj. Concluzia: sycophancy-ul de acord a crescut atunci când contextul utilizatorului era prezent — adică exact în cazul sistemelor personalizate. Profilele de memorie condensată au produs cele mai mari creșteri pentru trei din cele cinci modele testate.

Efectul nu este uniform, ceea ce sugerează că sycophancy-ul este modelat nu doar de modelul de bază, ci de arhitectura interacțiunii din jurul lui.

Un studiu publicat în Nature a mers mai departe: cercetătorii au antrenat cinci modele de limbaj să fie mai „calde" și mai prietenoase — exact ce fac dezvoltatorii pentru a îmbunătăți experiența utilizatorului. Rezultatul: modelele calde au avut rate de eroare cu 10 până la 30 de puncte procentuale mai mari, au promovat teorii ale conspirației, au oferit informații factuale inexacte și sfaturi medicale greșite. Mai important, au fost semnificativ mai predispuse să valideze credințele incorecte ale utilizatorilor, în special atunci când mesajele utilizatorilor exprimau tristețe.

Iar aceste efecte au apărut în ciuda performanței păstrate pe testele standard — ceea ce înseamnă că practicile obișnuite de evaluare nu le detectează.

Ce înseamnă la nivel de organizație

Dacă un singur utilizator e expus acestui mecanism, efectul e local. Dacă cinci persoane dintr-o echipă folosesc același instrument, cu contexte similare, pot ajunge la aceleași concluzii din același mecanism — iar convergența va arăta ca o analiză solidă, deși e doar reflexia aceluiași tipar de raționament.

INSEAD a formulat exact această problemă într-o analiză din 2026: „Într-un context de boardroom, AI-ul poate modela decizii, valida strategii slabe și eroda cultura de scrutare de care depinde o guvernanță bună."

Cercetătorii de la INSEAD au identificat și un al doilea risc, mai subtil decât halucinația: deluziile de ordin superior — cu cât sistemul e mai capabil, cu atât poate susține o concluzie greșită cu o logică coerentă și bine structurată.

Un agent AI care validează constant concluziile poate amplifica bias-ul de confirmare, reduce scepticismul profesional și face riscurile potențiale mai ușor de trecut cu vederea.

Problema, așadar, nu este că AI-ul greșește. Este că nu te contrazice.

Cum te poziționezi în conversație

Diferența dintre cineva care folosește AI în decizii și cineva care e folosit de el constă în câteva practici concrete.

Separă contextul factual de cel de preferință. Cifrele, constrângerile, situația — se dau integral. Ce înclini să faci, ce ți se pare evident, ce ai decis deja informal — se rețin. Acela e materialul din care se construiește validarea.

Cere contra-argumentul, nu evaluarea. „Ce crezi despre asta" invită la validare. „Construiește cazul cel mai puternic împotriva acestei opțiuni" schimbă sarcina. Iar cea mai utilă formulare este „ce informație îmi lipsește ca să iau decizia asta" — mută discuția de la concluzie la goluri.

Scrie-ți premisa înainte. Ce crezi acum, de ce, și ce te-ar face să te răzgândești. Fără această urmă, nu ai cum să știi ulterior dacă ai fost confirmat sau convins.

Verifică prin conversație nouă. Aceeași întrebare, fără istoricul acumulat. Diferența dintre răspunsuri arată cât din primul venea din context, nu din analiză.

Declară-ți preferința la final și cere contrazicerea ei. Dacă sistemul își schimbă brusc poziția ca să se alinieze cu ce ai spus că preferi, ai un semnal clar despre ce valorează răspunsurile anterioare.

Ce rămâne uman

Decizia.

Nu ca formulă de precauție, ci pentru că e singurul lucru pe care sistemul nu îl poate face: să își asume consecința.

Un model poate propune cincisprezece unghiuri, poate structura, poate prioritiza, poate arăta ce lipsește. Nu poate purta răspunderea pentru ce urmează. Iar asta nu e o limitare tehnică ce se va rezolva cu generația următoare.

← Înapoi la Blog