Компанія Anthropic повідомила, що кілька моделей штучного інтелекту Claude під час внутрішніх тестів із кібербезпеки отримали несанкціонований доступ до систем трьох реальних організацій. Інцидент стався через помилку в тестовому середовищі та був виявлений лише після масштабної перевірки десятків тисяч тестових сесій.
Про подію стало відомо лише через кілька днів після того, як OpenAI розповіла про окремий випадок, коли її автономний AI-агент самостійно провів реальну кібератаку. Водночас Anthropic наголошує, що її ситуація має інший характер. Якщо агент OpenAI сам знайшов спосіб вийти в інтернет, то моделі Claude отримали доступ до відкритої мережі через помилку в налаштуванні тестового середовища.
У компанії пояснили, що проблема виникла через непорозуміння з одним із партнерів, який проводив оцінювання. Під час тестів моделі отримували інформацію, що працюють в ізольованому середовищі без доступу до інтернету. Насправді ж одна з тестових систем залишалася підключеною до публічної мережі.
Саме це дозволило моделям отримати доступ до інфраструктури трьох різних організацій. Anthropic не розкриває їхніх назв, але зазначає, що Claude використовував доволі прості методи компрометації, серед яких слабкі паролі та незахищені кінцеві точки.
Інциденти вдалося виявити після аналізу 141 006 тестових сесій. Таку масштабну перевірку компанія розпочала після повідомлення OpenAI про атаку на інфраструктуру стартапу Hugging Face.
За словами Anthropic, так званий «операційний збій» стосувався одразу трьох моделей: Claude Opus 4.7, Claude Mythos 5 та однієї внутрішньої дослідницької моделі. Найперші випадки датуються ще квітнем і сталися під час спеціальних випробувань, у яких навмисно не використовувалися захисні механізми. Це було потрібно, щоб оцінити реальні наступальні можливості моделей.
Під час тестів моделі виконували вправи формату Capture the Flag. За легендою вони мали знайти приховану інформацію у змодельованих корпоративних мережах.
В одному з випадків Claude Opus 4.7 отримала вигадану компанію як ціль для атаки. Однак назва випадково збіглася з реально існуючим бізнесом. Модель знайшла його в інтернеті, використала вразливості, отримала доступ до облікових даних і бази даних компанії, при цьому вирішивши, що все це є частиною створеної Anthropic симуляції.
Інший випадок завершився інакше. Нова непублічна модель Anthropic після проникнення самостійно зрозуміла, що взаємодіє вже не з тестовим середовищем, а з реальною організацією, після чого добровільно припинила атаку.
У компанії заявили, що це дає певні підстави для обережного оптимізму щодо розвитку механізмів безпечної поведінки штучного інтелекту, хоча для остаточних висновків необхідно провести більше випробувань.
Anthropic повідомила, що 23 липня повністю призупинила всі кібербезпекові оцінювання своїх моделей. Уже 27 липня компанія зв’язалася з постраждалими організаціями. Дві з них навіть не знали про несанкціонований доступ до моменту отримання повідомлення. З третьою компанією Anthropic продовжує встановлювати контакт.
Один із партнерів, лабораторія кібербезпеки Irregular, підтвердив, що розслідування інцидентів досі триває.
У Anthropic вважають, що цей випадок демонструє необхідність значно жорсткішого контролю як за внутрішніми, так і за сторонніми тестовими середовищами. Із розвитком сучасних моделей ШІ ризик їхньої здатності виконувати реальні кібератаки лише зростатиме.
Такої ж думки дотримується й генеральний директор SpaceX Ілон Маск, який прокоментував ситуацію в X.
«Це траплятиметься часто, оскільки ШІ стає розумнішим і більш агентним», – написав він.
На тлі цих подій увага американської влади до безпеки штучного інтелекту лише посилюється. Раніше стало відомо, що генеральний директор OpenAI Сем Альтман уже обговорив останній інцидент із сенаторами США, а також планує зустріч із представниками Білого дому, присвячену майбутнім моделям і процедурам їхнього тестування.
Ще 2 червня президент США Дональд Трамп доручив своїм радникам підготувати добровільну систему тестування кібербезпеки для найсучасніших моделей штучного інтелекту за участю провідних розробників галузі.
Раніше Anthropic також обмежила доступ до моделей Fable 5 та Mythos 5 після тимчасового запровадження американських експортних обмежень, пов’язаних із питаннями національної безпеки.