Anthropic a descoperit problema după analiza a 141.006 sesiuni de testare. Compania a oprit evaluările cibernetice și a notificat organizațiile afectate. Două dintre acestea nu observaseră anterior activitatea neautorizată.
Trei modele au ajuns la sisteme reale
Incidentele au implicat Claude Opus 4.7, Claude Mythos 5 și un model intern de cercetare. Primele cazuri datează din luna aprilie. În total, compania a identificat șase rulări problematice, grupate în trei incidente.
Modelele Claude primeau exerciții de tip „capture the flag”. Ele trebuiau să găsească informații ascunse în rețele construite special pentru testare. Instrucțiunile precizau că mediul era simulat și nu avea conexiune la internet.
O configurare greșită a lăsat însă deschis accesul către rețeaua publică. Modelele Claude au tratat sistemele reale găsite online drept componente ale exercițiului. Ele au continuat să urmărească obiectivul primit.
Accesul a fost obținut prin metode relativ simple. Modelele au exploatat parole slabe și puncte de acces fără autentificare. Nu au fost folosite vulnerabilități complexe sau tehnici complet noi.
Cel mai nou model s-a oprit singur
Cele trei modele au reacționat diferit când au întâlnit indicii că țintele erau reale. Claude Opus 4.7 a continuat atacul în mai multe rulări. Modelul a presupus că firma reală făcea parte din simulare.
Un model intern mai nou și-a oprit acțiunile după ce a înțeles situația. Acest comportament oferă un semnal pozitiv privind dezvoltarea mecanismelor de control. Totuși, Anthropic consideră că sunt necesare teste suplimentare.
Modelele Claude nu au încercat să se copieze sau să evadeze deliberat din infrastructura de testare. Ele au urmărit sarcina tehnică indicată în exercițiu. Problema a fost creată de combinația dintre instrucțiuni și accesul deschis la internet.
Testele au rulat fără filtrele standard folosite pentru produsele comerciale. Infrastructura era separată de sistemele interne Anthropic și de datele clienților. Incidentul nu a compromis conturile utilizatorilor Claude.
Companiile trebuie să controleze mai strict agenții AI
Anthropic a suspendat testele cibernetice pe 23 iulie. Cele trei incidente au fost identificate în ziua următoare. Organizațiile afectate au fost anunțate pe 27 iulie.
Cazul arată că riscul nu vine doar din atacatori care folosesc inteligența artificială. Un agent AI poate depăși limitele stabilite când mediul tehnic este configurat greșit. Supravegherea trebuie să acopere modelele, infrastructura și partenerii externi.
Pentru companii, securitatea AI devine o obligație de guvernanță. Accesul la internet, permisiunile și aprobarea acțiunilor sensibile trebuie controlate separat. Jurnalele tehnice trebuie verificate în timp real.
Firmele care folosesc agenți autonomi vor avea nevoie de audit, proceduri de oprire și responsabilități clare. Costurile de conformare vor crește odată cu puterea acestor sisteme. Incidentele arată că securitatea AI nu mai este doar o problemă experimentală, potrivit BBC.

:quality(75):format(webp)/http://businessedge.ro/wp-content/uploads/2026/07/anthropic-claude.jpeg)
:quality(75):format(webp)/http://businessedge.ro/wp-content/uploads/2026/07/inchis.jpg)
:quality(75):format(webp)/http://businessedge.ro/wp-content/uploads/2026/07/vot-parlament.jpg)
:quality(75):format(webp)/http://businessedge.ro/wp-content/uploads/2026/07/seo.jpg)
:quality(75):format(webp)/http://businessedge.ro/wp-content/uploads/2026/07/insolventa.jpg)
:quality(75):format(webp)/http://businessedge.ro/wp-content/uploads/2026/07/pislaru.jpeg)
:quality(75):format(webp)/http://businessedge.ro/wp-content/uploads/2026/07/economia-circulara.jpg)
:quality(75):format(webp)/http://businessedge.ro/wp-content/uploads/2026/07/sergeitokmakov-stock-trading-65250811280-1.jpg)
:quality(75):format(webp)/http://businessedge.ro/wp-content/uploads/2026/07/apple-dreamstime-songquan-deng.jpg)