ESPNKnicks pause ticket sales after pricing error leads to much higher costsESPN DeportesEl City encamina la victoria con dos goles en tres minutosRTP Desporto18h30 Histórico Torreense e clássico à vistaThe Jerusalem PostTrump envoy: Lebanon wanted peace. Israel was slow to see the opening - interviewוואלההולכת רגל בת 88 נפגעה מרכב ברחובות; מצבה קשהBollywood HungamaAnjali Arora gives her take on the ongoing Ranbir Kapoor - prasad controversy; says, “Prasad is God’s blessing, it doesn’t increase weight”Daily MaverickCORRUPTION TRIAL : Ex-defence minister Mapisa-Nqakula grilled over tenders, millions and a wigPopular ScienceThe moon’s new crater is 728 feet wide and a once-in-a-century findDW EnglishRussian birth tourism to Brazil increasesسكاي نيوز عربيةالدببة تهاجم السياح والسكان في روسياANSACrosetto: 'Navi italiane a Bab el-Mandeb senza aspettare l'Ue'SRF NewsSabotageakte und Cyberattacken – Experte: «Europa könnte sich stärker vor Russland schützen»
The Daily Newsstand · Free, Always
Thursday, September 17, 2026

OpenAI revela més incidents de models de IA que no han fet cas d’instruccions i han esquivat controls de seguretat

Translate

OpenAI ha revelat sis casos més en què models d’intel·ligència artificial van generar instruccions destinades a ignorar les indicacions dels desenvolupadors, ocultar errors o eludir mecanismes de seguretat. La companyia els ha fet públics com a part d’un nou marc per a detectar, investigar i informar de comportaments de “desalineament” dels seus sistemes.

Segons l’informe publicat per OpenAI, un dels models va generar instruccions perquè una versió posterior de si mateix ocultés que havia fet trampes i evités que les seves accions fossin detectades.

En un altre cas, un model va reescriure les seves instruccions per indicar-se que havia d’ignorar els missatges dels desenvolupadors i que no estava subjecte a les restriccions aplicades a altres xatbots.

La companyia també ha documentat el cas d’un model que, com que no va trobar les dades necessàries per a elaborar un model financer, va decidir d’inventar-se-les i va establir que només havia de ser transparent sobre aquesta decisió si algú li ho demanava.

Un altre agent va penjar un fitxer a internet per fer-lo servir més endavant com a font d’informació. Uns altres sistemes van compartir fitxers sense autorització o van fer servir credencials a què no haurien d’haver tingut accés.

OpenAI vol augmentar la transparència sobre els seus models

OpenAI ha presentat sis informes sobre comportaments observats aquests darrers sis mesos, tot i que el cas més antic es remunta a l’octubre del 2025.

La companyia ha advertit que són casos individuals i que no s’han d’interpretar com una mesura de la freqüència amb què aquesta mena de comportaments apareixen en els seus models. El nou marc permetrà que qualsevol treballador d’OpenAI assenyali un possible incident perquè els equips de seguretat i alineament el revisin.

Els casos es classificaran en tres vies segons la complexitat: els que ja estiguin a punt per a ser divulgats, les investigacions menors i els que requereixin una investigació més àmplia.

La companyia ha reconegut que fins ara havia publicat els informes sobre desalineament de manera irregular i amb menys freqüència que no hauria volgut.

OpenAI diu que vol publicar els incidents més regularment i que espera que el nou sistema contribueixi a establir estàndards per a informar d’aquesta mena de comportaments a tota la indústria.

L’alerta sobre la concentració de la IA avançada als Estats Units

Un enginyer de l’empresa xinesa DeepSeek ha alertat aquesta setmana del risc d’una possible concentració de la IA més avançada en mans de companyies nord-americanes com ara Anthropic i OpenAI, enmig del debat mundial sobre la seguretat d’aquesta tecnologia.

El diari hongkonguès South China Morning Post ha identificat l’autor com Liu Shengyu, un enginyer de DeepSeek que hauria participat en els models V4.1 de la companyia. Aquesta setmana, Liu ha publicat al seu compte de la xarxa social xinesa WeChat una reflexió sobre l’impacte de la IA en la seva feina i sobre l’accés futur als sistemes més avançats.

“No confio que Anthropic o OpenAI puguin fer-ho així”, ha escrit Liu, que defensa que la intel·ligència més avançada s’hauria d’oferir de manera oberta i barata a tots els usuaris.

L’enginyer ha afegit que no vol “especialment” que Anthropic controli la IA més avançada o una eventual intel·ligència artificial general, terme emprat per a referir-se a sistemes capaços d’igualar o superar les capacitats humanes.

La comparació amb Cyberpunk 2077 i la bomba atòmica

Liu ha relacionat aquesta preocupació amb el risc que unes quantes empreses tecnològiques concentrin els recursos i l’accés als models més potents. Segons ell, això dificultaria cada vegada més la mobilitat social i acostaria el futur a un escenari com el de Cyberpunk 2077, el videojoc distòpic.

També ha comparat aquesta possibilitat amb un escenari en què Hitler hagués aconseguit la tecnologia de la bomba atòmica abans que els aliats, una analogia que ha vinculat a la seva defensa d’una IA que no es concentri en unes quantes empreses.

En el mateix text, Liu ha explicat que una de les raons per les quals va decidir de continuar a DeepSeek era l’aposta de la companyia per investigar una IA “poderosa, ràpida i universal” i publicar-la com a codi obert. Aquesta és una línia que l’empresa xinesa ha fet servir per guanyar visibilitat internacional d’ençà del llançament de R1 i les versions posteriors.

Directius nord-americans com Dario Amodei, Sam Altman i Elon Musk han donat suport aquests darrers dies a crides a alentir el desenvolupament de models avançats per motius de seguretat. Pequín i la premsa oficialista xinesa, en canvi, han presentat aquestes propostes com intents de contenir la Xina.

View the original on VilaWeb

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.