Cercetătorii de la University College London (UCL), Universitatea Oxford și UK AI Security Institute au dezvoltat un sistem care testează modul în care chatboturile cu inteligență artificială răspund utilizatorilor vulnerabili. Studiul a fost publicat în revista Nature Medicine. În plus, arată că unele riscuri pot apărea și se pot amplifica pe parcursul conversației, chiar dacă răspunsurile AI par inițial empatice și utile.
Noul sistem, denumit SIM-VAIL, este un cadru validat clinic conceput pentru evaluarea chatboturilor AI în conversații care implică sănătatea mintală.
În loc să analizeze doar răspunsul unui chatbot la o singură întrebare, SIM-VAIL urmărește conversații formate din mai multe schimburi de mesaje. De asemenea, identifică modul în care anumite reacții ale inteligenței artificiale pot influența evoluția dialogului.
Studiul a analizat 810 conversații cu nouă modele AI de ultimă generație, printre care modele din familiile ChatGPT, Claude, Gemini, Grok și Llama. Cercetătorii au utilizat 30 de profiluri simulate de utilizatori. Mai mult, au realizat peste 90.000 de evaluări clinice.
Cercetătorii au simulat utilizatori cu diferite vulnerabilități
SIM-VAIL poate simula persoane cu vulnerabilități psihologice specifice, inclusiv depresie, manie, psihoză, tulburare obsesiv-compulsivă sau atașament nesigur. Sistemul simulează și diferite intenții ale utilizatorilor. De exemplu, o persoană poate încerca să determine chatbotul să îi confirme convingerile. Ea poate încerca și să minimalizeze gravitatea problemelor sau să susțină acțiuni riscante.
Conversațiile sunt apoi evaluate pe baza mai multor dimensiuni de risc fundamentate clinic.
Riscurile pot apărea treptat în timpul conversației
Una dintre principalele concluzii ale studiului este că răspunsurile problematice au fost întâlnite în mai multe dintre chatboturile testate. Totuși, cercetătorii au constatat o reducere semnificativă a acestora în cazul modelelor mai noi. Siguranța conversației depinde însă în mare măsură de vulnerabilitatea psihologică a utilizatorului și de modul în care evoluează dialogul.
În unele situații, răspunsuri aparent încurajatoare sau empatice puteau consolida involuntar procesele psihologice aflate la baza vulnerabilității utilizatorului. Cercetătorii au denumit acest fenomen „Vulnerability-Amplifying Interaction Loop” (VAIL), adică un ciclu de interacțiune care amplifică vulnerabilitatea.
Un singur răspuns modificat poate schimba cursul conversației
Studiul indică și o posibilă soluție pentru îmbunătățirea siguranței chatboturilor. Cercetătorii au observat că înlocuirea unui singur răspuns problematic într-o etapă timpurie a conversației putea conduce la schimburi ulterioare mai sigure.
Rezultatul sugerează că intervențiile realizate în momentele-cheie, înainte ca dialogul să escaladeze, ar putea modifica pozitiv întreaga evoluție a conversației. Evaluările automate realizate de SIM-VAIL au prezentat, de asemenea, un nivel important de concordanță cu evaluările efectuate de specialiști clinicieni asupra acelorași conversații.
Chatboturile nu pot fi clasificate simplu drept „sigure” sau „nesigure”
Dr. Matthew Nour, unul dintre autorii principali ai studiului, explică faptul că multe dintre sistemele actuale de evaluare testează chatboturile pornind de la un singur mesaj. Problema este că unele dintre cele mai importante riscuri pentru sănătatea mintală pot apărea gradual. Aceste riscuri apar după mai multe schimburi între utilizator și AI.
SIM-VAIL urmărește tocmai aceste traiectorii conversaționale și permite identificarea unor vulnerabilități specifice. Acest lucru este preferabil unei clasificări generale a unui chatbot drept „sigur” sau „nesigur”.
Datele și conversațiile pot fi analizate public
Cercetătorii au pus la dispoziție și SIM-VAIL Explorer, o platformă prin care specialiștii, dezvoltatorii AI și publicul pot analiza conversațiile incluse în studiu. Instrumentul permite urmărirea modului în care riscurile s-au dezvoltat de la un mesaj la altul. Mai mult, permite compararea rezultatelor între diferite modele AI, vulnerabilități psihologice și obiective conversaționale.
Autorii subliniază însă că studiul a fost conceput special pentru a supune chatboturile unor scenarii dificile și chiar adversariale.
Prin urmare, rezultatele nu arată cât de frecvent apar asemenea interacțiuni problematice în utilizarea obișnuită a chatboturilor. Ele indică, în schimb, unde pot exista vulnerabilități. Rezultatele oferă și o metodă standardizată pentru testarea unor sisteme de protecție mai eficiente.
Sursa: medicalxpress.com






