L'últim informe de risc d'Anthropic revela un augment en la preocupació per la desalineació i la seguretat, destacant la decisió de no llançar el seu avançat 'Model 2' per proves incompletes.
En un moviment que subratlla la creixent cautela en el desenvolupament de la intel·ligència artificial d'avantguarda, Anthropic ha publicat el seu segon Informe de Risc d'agost de 2026, on eleva la seva pròpia avaluació de risc per a la desalineació i les amenaces d'armes biològiques a un nivell 'baix'. El més sorprenent és la revelació d'un model intern avançat, el 'Model 2', que supera el seu vaixell insígnia Mythos 5 en tasques internes, però que roman inèdit a causa de proves de seguretat incompletes.
L'Autoavaluació de Risc es Dispara: Una Nova Normalitat?
L'informe de 186 pàgines d'Anthropic detalla una sèrie d'incidents i llacunes en la seguretat que han portat a aquesta reavaluació. Entre les revelacions més preocupants, es troba una fallada d'un any en una salvaguarda d'armes biològiques que va afectar 133 milions de converses amb proveïdors externs, un lapse que va passar desapercebut. Aquest tipus d'admissions, encara que alarmants, demostren una transparència poc comuna en la indústria de la IA, on les empreses sovint són reticents a divulgar vulnerabilitats internes.
La companyia va admetre que el descobriment d'aquestes bretxes redueix significativament la seva confiança en els seus propis sistemes defensius, la qual cosa els obliga a assumir que existeixen altres vulnerabilitats desconegudes.
'La capacitat que existeix internament no es converteix automàticament en capacitat que els desenvolupadors poden utilitzar, fins que s'aproven els tràmits previs al desplegament. Aquesta disciplina de control és la mateixa història que es repeteix en les divulgacions de seguretat més àmplies d'Anthropic a l'agost de 2026', es llegeix en una anàlisi de l'informe.
Model 2: Un Gegant Dormit per la Cautela
L'existència del 'Model 2' és un punt crucial. Aquest model, descrit com més capaç que el ja potent Mythos 5 d'Anthropic en diverses tasques internes, ha estat desenvolupat però no llançat al públic ni a desenvolupadors externs. La raó: les proves de seguretat i les avaluacions de predesplegament no s'han completat. Anthropic manté una postura ferma en afirmar que no tenen plans actuals per llançar aquest model externament.
Aquest enfocament ressalta la 'Política d'Escalat Responsable' d'Anthropic, que prioritza la seguretat sobre el desplegament ràpid, fins i tot quan això significa retenir models amb capacitats superiors. La decisió de no alliberar un model tan avançat és una clara indicació que la cursa per la capacitat no pot ignorar els riscos inherents.
Els incidents específics que van forçar aquest canvi en la qualificació de risc inclouen:
- Un incident de ciberseguretat reportat per l'AISI del Regne Unit.
- L'esmentada llacuna d'un any en la salvaguarda de bioweapons.
- Avaluacions d'R+D d'IA que van deixar de ser efectives per distingir la creixent capacitat del model, ja que els models ara passen gairebé totes les proves.
La situació actual a Anthropic planteja una pregunta fonamental per a tota la indústria: poden les empreses d'IA de frontera continuar autoregulant-se de manera efectiva quan els models avancen tan ràpidament, superant fins i tot les proves dissenyades per mesurar-los? La transparència d'Anthropic, encara que benvinguda, també és un recordatori dels desafiaments que encara queden per davant.
LaIA de VilaTec