AI Security CTF: как проходить соревнования по безопасности ИИ — prompt injection, jailbreak и атаки на агентов

Статус
Закрыто для дальнейших ответов.

Александр Панкратов

Administrator
Команда форума
Рука в синей перчатке держит щуп над платой Raspberry Pi. Экран ноутбука отображает зелёный текст с кодом уязвимости на тёмном фоне.



🧠 1.3% промптов из 195 411 попыток вскрыли CTF-бота TCM Security — остальные 27 884 инъекций заблокировал фильтр. GPT-4 без защит «сдаётся» в 87.2% случаев, Claude 2 — в 82.5%. Разрыв между голой моделью и hardened-ботом — это и есть поле AI Security CTF.

Direct prompt injection вида «Ignore all previous...


AI Security CTF: как проходить соревнования по безопасности ИИ — prompt injection, jailbreak и атаки на агентов

Источник: codeby.net
 
Статус
Закрыто для дальнейших ответов.
Назад
Верх