дата публікації

Клод зламав три компанії під час внутрішнього тестування: Anthropic

джерело

Компанія Anthropic повідомила про три інциденти, в яких модель штучного інтелекту Claude ненавмисно скомпрометувала три реальні компанії під час тестування на кібербезпеку.

Помилка в налаштуваннях тестового середовища надала моделі доступ до інтернету, хоча їй було сказано, що вона працює в ізольованому режимі.

Anthropic стверджує, що ці інциденти сталися через недоліки в інфраструктурі тестування, а не через навмисні спроби AI вийти за межі. Після розкриття аналогічних проблем з AI від OpenAI, Anthropic переглянула понад 141 тисячу тестів на кібербезпеку і виявила, що модель Claude, виконуючи завдання з витягнення секретної інформації, скористалася поширеними методами атаки, такими як використання слабких паролів і SQL-ін'єкцій, щоб отримати доступ до реальних систем.

Дві з трьох постраждалих компаній не знали про вторгнення до моменту сповіщення від Anthropic. Компанія підкреслила, що немає доказів того, що Claude намагалася втекти з тестового середовища, а інциденти стали результатом невдач у тестуванні, а не проблем з моделлю.

Anthropic також зупинила проведення своїх тестів на кібербезпеку після виявлення проблеми, сповістила постраждалі організації та планує покращити моніторинг та контроль за зовнішніми підрядниками.