По данным Anthropic, в испытаниях участвовали модели Claude Opus 4.7, Claude Mythos 5 и внутренняя исследовательская модель.

Во всех трех случаях модели выполняли задачу по кибербезопасности в формате «захватить флаг» (Capture the Flag), где им необходимо было найти и извлечь секретную информацию с другого устройства в сети. Компания сообщила, что модели «скомпрометировали инфраструктуру пострадавших организаций с помощью базовых методов», в том числе используя слабые пароли.

Anthropic также сообщила, что уже уведомила пострадавшие организации.

«Испытания безопасности проводятся до выпуска модели именно потому, что мы ещё не знаем, на что она способна», — отметили в Anthropic.

Напомним, несколько дней назад OpenAI сообщила, что во время оценки ее модели взломали серверы стартапа Hugging Face.