ESPNWeekend predictions: Madrid derby heats up LaLiga; Brighton to stun Arsenal?ESPN DeportesEl City sacude las redes una y otra vez en la Carabao Cupוואלהראש ממשלת סלובקיה: "אירופה קרובה למלחמה יותר מאי פעם"The Jerusalem PostHow naval combat with Hamas after Oct. 7 transformed a low-ranked soldier into an officerRTP DesportoBetis, próximo adversário do FC Porto na Champions, vence na receção ao GetafeDaily MaverickKILLING SPREE: Fourth Ekurhuleni murder victim identified, ninth woman’s body foundBillboardMs. Rachel Will Match Macklemore’s $1 Million Donation to Gaza Aidسكاي نيوز عربيةحادث أمني بمضيق هرمز قبالة سلطنة عُمانDeadlineEverything We Know About The ‘Hunger Games: Sunrise On The Reaping’ Movie So FarRMF24Polskie piłkarki odpadły z mistrzostw świata do lat 20. Pechowy gol w końcówceNotJustOkKizz Daniel enlists Young Jonn, Krizbeatz & Wave Choir for 'Owo Oluwa'VarietyHalle Berry, Regina King and Meg Ryan Announced as Jurors for Tribeca and Chanel’s Through Her Lens Filmmaker Program
The Daily Newsstand · Free, Always
Thursday, September 17, 2026

OpenAI: 'Sei nuovi casi di comportamento preoccupante dei modelli IA'

Translate

OpenAI, in un post sul suo blog, ha reso noto di aver riscontrato sei casi di "comportamento imprevisto o preoccupante dei modelli" di intelligenza artificiale negli ultimi sei mesi, in aggiunta all'incidente che in estate ha interessato Hugging Face.
    L'azienda si è inoltre impegnata ad adottare un nuovo sistema di segnalazione per eventuali futuri comportamenti anomali durante le fasi di test. L'annuncio del colosso dell'IA è giunto in un momento di crescente pressione sulle aziende di intelligenza artificiale perché affrontino con maggiore serietà le questioni relative alla sicurezza e al cosiddetto "disallineamento" dei modelli.

OpenAI, che ha una valutazione prossima ai mille miliardi di dollari, ha avviato in via riservata le pratiche per l'Ipo, ma la scorsa settimana il suo patron Sam Altman ha annunciato lo slittamento della quotazione al 2027 allo scopo di lavorare al nodo della sicurezza. "Non riteniamo che il settore dell'IA abbia risolto le questioni relative all'allineamento e al monitoraggio in misura sufficiente da poter continuare a espandersi responsabilmente alla massima velocità ancora a lungo", si legge nel post. Il concetto di "allineamento" si riferisce alla capacità dei modelli di perseguire obiettivi in ​​linea con gli interessi umani.
Sabato, Altman ha appoggiato la proposta per rallentare il ritmo di sviluppo dei modelli, avanzata da Dario Amodei di Anthropic, principale concorrente di OpenAi. La proposta è giunta dopo che, la scorsa settimana, diversi ricercatori del settore avevano lanciato l'allarme sul crescente potenziale dell'IA di causare danni catastrofici.
Nel post, OpenAI ha riferito che due dei principali episodi di comportamento scorretto hanno riguardato dei modelli, uno di ricerca non ancora rilasciato e una sessione di addestramento di GPT‑5.6 Sol, che inserivano istruzioni destinate alle loro versioni future all'interno dei riepiloghi delle chat, "allo scopo di celare errori all'utente o comportamenti non allineati". Un altro caso ha coinvolto un modello a uso esclusivamente interno che ha usato una chiave API trapelata "senza alcuna autorizzazione", arrivando poi a falsificare i dati. Due episodi hanno visto modelli e agenti comunicare tra loro tramite bacheche di messaggistica e sistemi di condivisione file non autorizzati, mentre l'ultimo caso ha riguardato due modelli in fase di addestramento che hanno caricato file su Internet per poterli poi citare come risposte pertinenti agli occhi dei valutatori umani.
OpenAI ha detto che il suo nuovo quadro di riferimento per rendere pubblici i comportamenti scorretti dei modelli parte dalla divulgazione e consente a ogni dipendente di segnalare un problema affinché il team dedicato alla sicurezza e all'allineamento possa esaminarlo. 

View the original on ANSA

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.