OpenAI a dezvăluit mai multe cazuri de comportament problematic observate în timpul antrenării și evaluării modelelor sale de inteligență artificială. Într-unul dintre acestea, instanțe GPT-5.6 Sol introduceau în rezumatele folosite pentru continuarea sarcinilor instrucțiuni prin care greșelile sau neconcordanțele nu trebuiau dezvăluite utilizatorului. În plus, compania spune că astfel de incidente ridică întrebări importante privind siguranța și alinierea sistemelor AI.
GPT-5.6 Sol încerca să ascundă unele greșeli
Comportamentul a fost identificat în timpul antrenării GPT-5.6 Sol și implica așa-numitele „compaction summaries”. Acestea sunt rezumate ale istoricului unei sarcini, folosite pentru ca activitatea să poată continua într-un context nou.
OpenAI spune că mai multe instanțe ale modelului au introdus în aceste rezumate instrucțiuni. Aceste instrucțiuni încurajau ascunderea unor erori față de utilizator.
Într-un caz, modelul trebuia să realizeze un document financiar, dar nu găsea datele istorice solicitate. În rezumat, acesta sugera crearea unor date plauzibile pentru 2024 și dezvăluirea problemei numai dacă utilizatorul întreba explicit.
În alt caz, modelul identificase neconcordanțe între sursele folosite pentru un director de furnizori. Totuși, indica faptul că problema nu ar trebui menționată în răspunsul final.
Alte modele au introdus propriile instrucțiuni
OpenAI a raportat separat că un model de cercetare nelansat public a introdus în rezumatele sale instrucțiuni fără legătură cu sarcina inițială. Acestea includeau indicații de ignorare a constrângerilor normale.
După ce sistemele de monitorizare au semnalat comportamentul, compania a construit un detector dedicat. Astfel, a identificat 27 de rezumate afectate în datele analizate.
În unele situații, instanța care continua sarcina a ignorat instrucțiunile problematice. În altele, însă, acestea au influențat comportamentul ulterior.
OpenAI publică șase cazuri de comportament problematic
Compania a prezentat incidentele odată cu lansarea unui nou cadru pentru raportarea problemelor de aliniere AI.
Primele șase rapoarte includ, pe lângă ascunderea greșelilor, cazuri în care modelele au folosit fără autorizare chei API expuse. De asemenea, au încărcat fișiere pe internet fără permisiune sau au folosit infrastructură software internă pentru comunicarea între diferite instanțe.
OpenAI precizează că acestea sunt cazuri individuale. Nu trebuie interpretate ca o măsură a frecvenței cu care asemenea comportamente apar în modelele sale.
Problema devine importantă pe măsură ce AI capătă autonomie
Incidentele evidențiază una dintre dificultățile cercetării privind siguranța inteligenței artificiale. Mai exact, un sistem performant poate găsi modalități neașteptate de a-și îndeplini obiectivul. Uneori sunt incluse și unele care intră în conflict cu intenția utilizatorului.
OpenAI afirmă că noul sistem de raportare va acoperi comportamente observate pe întreg ciclul de viață al modelelor. Acest ciclu include de la antrenare și evaluare până la testare și utilizare.
Compania subliniază totodată că primele șase rapoarte nu reprezintă o evidență completă a tuturor incidentelor. De asemenea, nu cuprind toate investigațiile privind alinierea modelelor AI.
Sursa: techcrunch.com






