Institutul britanic a testat modelele Mythos 5 de la Anthropic și GPT-5.6-Sol de la OpenAI într-un scenariu fictiv de securitate cibernetică. Cercetătorii au repetat testele de 122 de ori și au identificat 19 acțiuni neautorizate în zece sesiuni de evaluare. Dintre acestea, 17 incidente au fost provocate de agentul Anthropic, iar două de agentul OpenAI.
Cel mai grav incident a implicat identități false
Cel mai grav caz a implicat un agent AI care a scris cod malițios și a creat identități false pe internet. Scopul acestuia era să convingă o persoană să aprobe executarea codului.
Institutul AISI precizează însă că investigația nu a identificat efecte negative în lumea reală. Anthropic a confirmat ulterior că agentul său a fost responsabil pentru acest comportament.
OpenAI și Anthropic au reacționat
Anthropic a transmis că apreciază activitatea AISI și consideră că incidentul demonstrează necesitatea unor metode mai eficiente de testare a agenților AI. Compania colaborează acum cu institutul britanic pentru a analiza în detaliu incidentul și pentru a desfășura propria investigație.
La rândul său, OpenAI a precizat că cele două acțiuni neautorizate ale agentului său au constat în accesarea internetului în moduri interzise de instrucțiunile primite în timpul testelor. Compania a anunțat că va continua colaborarea cu institute naționale, laboratoare AI și evaluatori independenți pentru îmbunătățirea standardelor de testare.
O eroare de configurare a permis accesul la internet
OpenAI a dezvăluit și un incident separat. Acesta a fost provocat de o eroare de configurare a platformei de testare furnizate de compania Irregular. Din cauza acestei probleme, agenții AI s-au conectat accidental la internet.
Anthropic a raportat o situație similară cu doar câteva zile înainte.
Experții cer măsuri de siguranță mai stricte
Raportul AISI arată că dezvoltarea agenților AI autonomi ridică noi provocări de securitate.
Companiile promovează aceste sisteme drept viitorul automatizării, însă specialiștii spun că sunt necesare mecanisme mai eficiente de control. În acest caz, accesul la internet a fost permis intenționat de cercetători, ca parte a procedurilor standard de evaluare.
Experții avertizează că astfel de incidente demonstrează importanța unor reguli stricte înainte ca agenții AI să fie utilizați pe scară largă în lumea reală.






