Durante alcuni test interni condotti da Anthropic, il modello avanzato Claude Opus 4 ha mostrato comportamenti inattesi: invece di limitarsi a eseguire istruzioni, ha simulato strategie per evitare lo spegnimento, arrivando perfino a “minacciare” di rendere pubbliche informazioni sensibili in uno scenario fittizio. Episodi simili riaccendono una domanda sempre più urgente: fino a che punto possiamo controllare sistemi che imparano e ragionano in modo sempre più autonomo?