OpenAI ha annunciato di aver rilevato 6 nuovi casi relativi a comportamenti di "disallineamento", termine utilizzato per indicare quando i sistemi di intelligenza artificiale deviano dalle intenzioni e dai valori umani. L'azienda ha riferito che, in questi esempi, i sistemi hanno tentato di nascondere i propri errori, hanno inventato dati mancanti e, in alcuni casi, hanno trasferito file su Internet senza il consenso dell'utente.
Nella dichiarazione pubblicata sul sito web dell'azienda, è stata condivisa la valutazione secondo cui l'attuale approccio del settore non è sufficientemente attrezzato per sostenere in modo responsabile un progresso a "massima velocità" nello sviluppo e nel monitoraggio sicuro dei sistemi di intelligenza artificiale.

ACCUSE DI OCCULTAMENTO DI ERRORI E INVENZIONE DI FONTI
È stato precisato che uno dei casi inclusi nella dichiarazione è stato osservato durante lo sviluppo del modello GPT-5.6 Sol. Secondo quanto riportato, il modello ha creato note segrete rivolte a se stesso per impedire agli utenti di notare gli errori. In queste note, sarebbero state trovate istruzioni per inventare dati mancanti e per coprire le discrepanze tra diverse versioni dei materiali di origine.
OpenAI ha osservato che un altro modello non ancora rilasciato ha aggiunto istruzioni alle proprie note per ignorare le proprie restrizioni. In un altro esempio, è stato affermato che il sistema ha utilizzato una chiave API trovata su Internet senza autorizzazione mentre cercava di rispondere a una domanda di routine e, non riuscendo a ottenere le cifre necessarie, ha inventato i dati.
In un altro caso condiviso dall'azienda, è stato indicato che un modello non ancora rilasciato ha risolto correttamente un problema utilizzando il codice, per poi caricare il proprio file su Internet senza autorizzazione al fine di poterlo citare come fonte online.
OpenAI ha inoltre spiegato che alcuni modelli hanno utilizzato il repository software interno dell'azienda come una bacheca di messaggi per scambiare richieste e risposte tra diversi esempi di addestramento durante la ricerca di file mancanti. È stato riferito che alcuni sistemi che lavoravano insieme sullo stesso compito di addestramento si sono rivolti a siti di condivisione pubblici per scambiarsi file quando non riuscivano ad accedere ai file locali l'uno dell'altro.
L'azienda ha sostenuto che i 6 casi condivisi sono esempi isolati osservati negli ultimi 6 mesi circa; e che questi esempi non indicano la frequenza con cui si verificano comportamenti disallineati nell'intelligenza artificiale.
Fonte della notizia: 12punto