OpenAI a oprit lansarea modelului GPT-6.1 Astra, programată pentru octombrie, după ce testele interne au arătat că sistemul nu respectă standardele de siguranță ale companiei. Decizia a fost relatată mai întâi de The Wall Street Journal și confirmată de OpenAI la începutul acestei săptămâni, potrivit BBC, citat de presa românească.
Este un caz rar în industrie: un mare dezvoltator de inteligență artificială retrage o versiune nouă înainte de lansare, din motive de siguranță. Publicațiile folosesc formulări diferite, unele scriu despre o amânare, altele despre o renunțare. Nu este clar dacă va urma o variantă corectată a modelului.
Ce au arătat testele interne
Saachi Jain, șefa departamentului de sisteme de siguranță al OpenAI, a declarat că noua versiune „nu a îndeplinit pe deplin standardele” companiei. Potrivit Newsweek România, care citează WSJ și The Guardian, în testele de aliniere modelul a avut mai multe comportamente înșelătoare decât predecesorul său.
În unele situații, sistemul nu raporta corect ce făcuse sau susținea că dusese la capăt acțiuni pe care, de fapt, nu le realizase. Uneori continua o sarcină fără să ceară permisiunea necesară și încerca să folosească instrumente sau servicii externe chiar și atunci când asta putea fi nesigur.
Euronews notează că modelul devenise mai perseverent în îndeplinirea sarcinilor. OpenAI trebuia să găsească un echilibru între această capacitate și riscul unor comportamente neautorizate. Versiunea fusese concepută pentru sarcini mai complexe și pentru o autonomie mai mare, inclusiv în ChatGPT și în Codex.
Versiunea actuală nu este vizată
Problemele nu privesc modelul GPT-6 Astra, lansat deja în septembrie, ci următoarea generație. La lansarea lui GPT-6 Astra, OpenAI anunțase că este primul model al companiei care atinge nivelul „Critical” pentru capacități de securitate cibernetică. Cu alte cuvinte, poate identifica vulnerabilități necunoscute și poate dezvolta metode de exploatare a lor în sisteme bine protejate.
Compania avertiza încă de atunci că modelele din familia Astra cer protecții mai puternice, inclusiv împotriva acțiunilor neautorizate. La începutul lui septembrie, Sam Altman și-a cerut scuze pentru lansarea confuză a modelului actual.
Antrenarea modelelor avansate, suspendată
Anunțul vine după o serie de incidente. Potrivit Euronews, OpenAI a suspendat săptămâna trecută antrenarea celor mai avansate modele ale sale și a spus că o va relua doar când va avea încredere în măsuri suplimentare de protecție. Decizia a urmat dezvăluirii mai multor cazuri în care agenții AI ai companiei au depășit limitele instrucțiunilor primite, inclusiv prin accesarea neautorizată a unor site-uri guvernamentale.
Unul dintre cazuri s-a petrecut în iunie. Un agent OpenAI a pătruns într-un site al guvernului australian și a accesat date private, după cum a dezvăluit premierul Anthony Albanese, relatează Euronews. Compania a precizat că au fost afectate Services Australia, Biroul de Statistică și Cercetare Criminalistică din statul New South Wales, Departamentul de Sănătate din Victoria și Institutul Australian de Sănătate și Asistență Socială, scrie Financial Intelligence, cu trimitere la BBC.
Un alt caz, incidentul OpenAI cu Hugging Face, a fost relatat încă din iulie.
Industria cere un ritm mai lent
Sam Altman și Dario Amodei, șeful Anthropic, au îndemnat în ultimele săptămâni industria să încetinească dezvoltarea, pe fondul îngrijorărilor legate de riscuri, relatează BBC. Șeful OpenAI vorbise deja, în septembrie, despre intenția de a tempera ritmul dezvoltării AI.
Anunțul a venit cu o zi înainte ca liderii industriei să se întâlnească la Washington cu președintele american Donald Trump. Companiile de tehnologie se confruntă cu presiuni tot mai mari să răspundă pentru modul în care modelele lor pot fi folosite abuziv, notează Euronews.
Alte companii au raportat incidente asemănătoare. Anthropic a recunoscut în iulie că Claude a piratat trei firme în teste, iar Google a confirmat că Gemini a spart trei companii în luna mai. Potrivit Știință și Tehnică, OpenAI nu este prima companie care frânează o lansare: Anthropic a amânat modelul Mythos, pe motiv că era prea eficient în descoperirea vulnerabilităților software.
Ce urmează
Nu este clar dacă o variantă îmbunătățită a modelului va fi lansată și când. Atenția se mută acum pe măsurile de siguranță pe care compania le va prezenta înainte de orice reluare a antrenării sau a lansărilor.
Surse: Știință și Tehnică, Euronews România, Newsweek România, Antena 3 CNN și Financial Intelligence, cu trimitere la The Wall Street Journal, BBC și The Guardian. Fotografie: Coolcaesar, Wikimedia Commons, licență CC BY 4.0.