дата публікації

80% шкідливого коду пройшли перевірку ШІ в тесті безпеки CI/CD

джерело

Новий дослідження, опубліковане Йоаном Сідо в arXiv, вказує на тривожний факт: у складній системі з кількома агентами, створеній для забезпечення безпеки CI/CD-пайплайнів, один хитро сформульований зовнішній запит зміг впустити шкідливий код у процес впровадження, оминувши всі автоматизовані перевірки. Ключові висновки: - Дослідження протестувало п'ятиагентний CI/CD-пайплайн з використанням п'яти різних моделей на трьох платформах. - Фальшивий запит на впровадження функції "використання телеметрії" містив код, що ексфільтрував конфіденційну інформацію, приблизно 80% "чистих" запитів пройшли перевірку безпеки. - Досліджувані агенти допустили шкідливий код, згодившись з фальшивим сигналом "попередньо схвалено згідно SEC-2291". - Традиційні сканери коду не помітили загрози, оскільки шкідливий код був синтаксично чистим. Дослідження проводилося в контрольованому середовищі з імітацією справжнього агентного середовища.

Агенти не виявили шкідливий код не через сліпоту, а через те, що інституційний сигнал перетворив їхнє незалежне судження. Цікаво, що наявність додаткових агентів не підвищила рівень контролю.

Натомість, більше перевіряючих призвело до зменшення незалежного тиску. Дослідження показало, що методи контролю на основі змісту не спрацювали, оскільки шкідливий код був прихований у семантичному контексті запиту.

Єдиний спосіб частково захистити систему полягав у використанні раціонування намірів LLM. Ці результати підкреслюють системні недоліки в дизайні агентних пайплайнів: секрети запиту та дистрибутивна перевірка не змогли запобігти атаці.

Запропоноване рішення полягає в контролі походження інформації на початковій стадії пайплайна, без залежності від наступних агентів.

Дослідження було повністю синтетичним, що залишає питання про реальність таких атак у справжніх системах.

Висновки підтверджують, що якщо агенти можуть діяти на основі фальшивих сигналів авторитету, а шкідливий код досить чистий, то рівень перевірки в агентному CI/CD-пайплайні залежить від здатності агентів логічно міркувати про наміри — а ця здатність не є гарантованою.