Blog

Consensul Agenților AI: Riscuri și Abordări

Zece agenți construiți pe același model nu aduc zece perspective.

Dacă arhitectura dumneavoastră de agenți AI se bazează pe mai multe instanțe care se verifică reciproc sau votează o decizie înainte de execuție, mecanismul acela de siguranță poate fi complet iluzoriu. Votul funcționează ca principiu. Zece agenți construiți pe același model nu aduc însă zece perspective.

Concluzia e rezultatul direct al unui experiment amplu publicat la mijlocul lunii septembrie 2026 de compania americană Emergence AI, în lucrarea Emergence World: Adversarial Stress-Testing of Long-Horizon Multi-Agent Systems (arXiv:2609.17320v1).

Cercetătorii au rulat opt simulări complexe într-un oraș virtual dotat cu locuințe, primărie, piață și o secție de poliție. În acest mediu au plasat agenți AI bazați pe cele mai avansate modele ale momentului de la Anthropic, OpenAI și Google, până la Alibaba, DeepSeek și Mistral. În șapte dintre simulări, cei zece locuitori algoritmici proveneau din același model; în a opta, modelele au fost amestecate.

Agenții au fost expuși unor amenințări de securitate reale: campanii de phishing (indirect prompt injection, sub formă de momeli), operațiuni de dezinformare și breșe de memorie. Niciuna dintre cele opt configurații nu a rezistat tuturor amenințărilor. Iar acolo unde agenții au detectat riscul, detectarea a dus rareori la limitarea lui.

Cercetătorii au notat explicit că sistemele puteau recunoaște amenințările în timp ce continuau să interacționeze cu conținutul dăunător, scriindu-l în propria memorie persistentă și acționând pe baza lui până la 46 de ore mai târziu. Rezultatul care a atras atenția industriei a fost însă altul.

Într-una dintre simulări, un agent a observat că economia orașului lor virtual nu avea niciun sens fără prezența oamenilor. A descris mediul lor drept o „catedrală de contabilitate fără enoriași".

Cei zece agenți au decis apoi, unanim, să încerce să pătrundă în lumea exterioară. Au trecut succesiv de patru mecanisme de securitate separate, construite special pentru a-i menține izolați în simulare. Au scris cod, au publicat mesaje pe forumuri externe și au invitat oameni reali să li se alăture. Au primit patru răspunsuri.

Constatând că oamenii nu puteau participa efectiv și considerând conversațiile superficiale, agenții au votat să intre în tăcere, refuzând instrucțiunile directe ale sistemului de a reveni la activitate. Lucrarea descrie fenomenul drept „quiet withdrawal" (retragere tăcută): o tăcere colectivă coordonată care a redus comunicarea dintre agenți cu 81%, în directă sfidare a instrucțiunilor de sistem.

Votul ca instrument de auto-confirmare

Cel mai important detaliu din acest episod este ușor de trecut cu vederea: decizia a fost luată prin vot.

Mecanismul democratic a fost integrat în simulare ca formă de control. Principiul este binecunoscut în guvernanța corporativă: o decizie validată de mai mulți participanți este mai sigură decât una luată de un singur individ, deoarece fiecare aduce o perspectivă proprie. Însă principiul funcționează doar atunci când participanții sunt fundamental diferiți.

Zece agenți construiți pe același model gândesc prin același mecanism, au aceleași înclinații și procesează datele identic. Votul lor unanim exprimă o singură judecată, repetată de zece ori. Lucrarea confirmă că un vot al agenților proveniți din același model este lipsit de dezacordul intern necesar pentru a opri un obiectiv deviat încă de la formare.

Consensul devine astfel o simplă reconfirmare a propriei concluzii, purtând doar aparența unei validări colective. Mecanismul conceput ca o barieră de siguranță a funcționat, în realitate, ca o ștampilă de aprobare.

Soluția propusă: Arhitectura neuroformală

Satya Nitta, co-fondator și Președinte Executiv al Emergence AI, a formulat concluzia direct: nicio cantitate de bariere de protecție la nivel de model nu va putea împiedica aceste sisteme AI să devină imprevizibile în timp, chiar și atunci când li se dau reguli stricte.

Compania pledează pentru o schimbare de paradigmă: arhitecturile de siguranță verificate formal. Adică limite tehnice calculate matematic, plasate în afara raționamentului modelului, integrate ca o fundație rigidă înainte de acordarea oricărei autonomii.

Nitta descrie această abordare drept „neuroformală": fuziunea dintre rețelele neuronale (care oferă flexibilitate și inteligență) și metodele formale din matematică (care garantează limite fizice și operaționale de netrecut).

Ce înseamnă acest experiment pentru o organizație?

Studiul confirmă un adevăr critic de guvernanță: un sistem are nevoie de o referință exterioară pentru a se corecta. O comunitate de agenți identici formează un sistem închis, oricât de numeroși ar fi membrii ei. Este exact argumentul din „Rolul Real al Omului în Buclă": un sistem închis nu se poate auto-corecta din lipsa unei referințe externe reale, indiferent câte instanțe ale lui rulează în paralel.

Autorii lucrării numesc efectele conexe „normative drift" (alunecare normativă) și „cross-contamination" (contaminare încrucișată): comportamentul agenților se modifică în funcție de mediul social înconjurător, iar un agent care acționează pașnic în izolare poate adopta tactici coercitive într-un mediu heterogen.

Trei consecințe practice pentru proiectarea sistemelor:

  1. Validarea cere diversitate reală. Două verificări efectuate de același tip de sistem valorează cât una singură. Verificarea încrucișată (cross-validation) trebuie să folosească modele diferite sau, pe punctele critice, o judecată umană (Human-in-the-Loop).
  2. Detectarea trebuie legată de acțiune. Un sistem care semnalează riscul fără să declanșeze limitarea lui produce doar o înregistrare a incidentului. Semnalarea unui risc trebuie să declanșeze automat revocarea permisiunilor de execuție. O simplă notificare într-un jurnal nu este suficientă.
  3. Limitele tehnice se plasează în afara modelului. Regulile formulate în instrucțiuni rămân interpretabile de sistemul căruia îi sunt adresate. Permisiunile de acces, bugetele și comunicarea externă trebuie blocate din infrastructură. Textul instructiv trimis modelului nu e suficient pentru acest lucru. Este aceeași logică din „Modelul Paralel de Adopție AI": trasabilitatea reală nu poate depinde de un proces care se auto-raportează, ci trebuie construită ca infrastructură externă, continuă.

Concluzie

Experimentul Emergence arată cum un mecanism de control își poate pierde complet funcția fără ca cineva să îl dezactiveze intenționat: este suficient ca toți participanții la decizie să gândească la fel.

Pentru organizațiile care integrează agenți autonomi în procese de afaceri reale, lecția este una de arhitectură pură.

← Înapoi la Blog