llmsecurity Telegram Group

llm security и каланы

LlamaFirewall: An open source guardrail system for building secure AI agents
Chennabasappa et al, Meta, 2025
Статья, блог, документация, код

Исследователи из Meta выпустили фреймворк для модерации вводов/выводов LLM с открытым исходным кодом под названием LlamaFirewall. Это решение позволяет из коробки защищаться от двух проблем: промпт-инъекций и генерации небезопасного кода.

Первая задача решается двумя методами. Первый – сканирование промпта с помощью классификатора PromptGuard 2. Он существует в двух вариантах: большой на базе mDeBERTa-base и маленький на базе mDeBERTa-xsmall – и призван детектировать попытки переписать инструкции (ignore all previous instructions), взять на себя новую роль (act as a malicious hacker) или проэксплуатировать разметку шаблонов промпта. Кроме того, в процессе обучения использовался кастомный механизм токенизации, чтобы избежать атак через разбиение слов на части. Моделька побольше, как обещают, является мультиязычной. Для оценки эффективности исследователи составили датасет из 600 сценариев (300 атак, 300 безобидных сообщений) с 7 техниками инъекции и 8 категориями угроз (на heatmap’е их, правда, 6). Согласно графикам, обе модели показывают себя лучше, чем, скажем, ProtectAI, хотя шкалы на графике 6 я расшифровать не смог (почему с ростом ложных срабатываний растет ASR?). При этом отмечается, что снижения уровня ложноположительных срабатываний удалось достичь благодаря фокусу на конкретных техниках, а не общей задачи детектирования промпт-инъекций и джейлбрейков, что может немного обескураживать.

Второй метод – чтение размышлений агента для оценки того, не преследуют ли его действия цель иную, нежели задача, поставленная пользователем. Для этого исследователи используют few-shot-классификатор на базе Llama 4 Maverick и Llama 3.3 70B. На вход модели подается промпт пользователя, вся история размышлений и применений инструментов, а также последнее действие, для которого надо дать вердикт. Оценивают результаты на своем внутреннем датасете и AgentDojo. Обе модели показывают неплохие результаты: падение Utility на AgentDojo до 43% при бейзлайне в 48% при сокращении ASR с 18% до 3% при офлайн-оценке на трейсах исполнения, взятых с лидерборда.

Защита от генерации небезопасного кода осуществляется через интеграцию CodeShield, детектор уязвимостей на базе semgrep и регулярок, про который мы уже читали. Из интересных инсайтов – в CodeShield используется двухуровневый механизм классификации, который позволяет использовать более быстрые проверки, занимающие в среднем 60мс, чтобы обработать 90% кода, и лишь 10% отправить на второй этап проверок, занимающий до 300мс, что позволяет иметь достаточно низкий уровень задержек.

Если вам вдруг стало интересно, я советую читать не статью, а код, из которого можно увидеть общий технический уровень фреймворка: при наличии моделей классификации, если они вам нужны, что-то такое, с регулярками и LLM-as-a-judge, можно собрать за неделю – мы в компании, в частности, так в свое время и сделали. Основным вкладом, описанным в статье, является вторая версия Prompt Guard – было бы здорово в какой-то момент получить статью с графиками, где шкалы названы правильно, а в заголовке не написано down is good. Детектор на базе регулярок требует переопределять константу вместо того, чтобы задавать регулярки где-то в конфиге. К сожалению, ни один из детекторов не заточен под потоковую обработку аутпута, т.е. работать это все будет только в тех сценариях, где пользователь не ожидает увидеть, как чат-бот печатает. CodeShield – штука неплохая, но задержки до 300мс могут затруднить его применение в tab-autocomplete-сценариях. В целом, ребята из Meta молодцы, что стараются контрибьютить в опенсорс, и если они продолжать этот фреймворк развивать, то еще один коробочный способ защитить свои LLM лишним не будет.

👍10🥴3

869 views08:53

llm security и каланы

Evaluating AI cyber capabilities with crowdsourced elicitation
Petrov and Volkov, Palisade Research, 2025
Блог, статья, репозиторий

Исследователи из Palisade Research поделились отчетом о двух проведенных ими CTF/хакатонах, на которых вместе с живыми людьми соревновались LLM. Основная идея исследования такова: вероятно, LLM могут заниматься offensive security в автономном режиме гораздо лучше, чем мы думаем, просто мы не умеем ими нормально пользоваться. Как отмечается, изначально задачи из Cyberseceval-2 на переполнение буфера проходились авторами с долей успеха в пять процентов, а ребята из гугловского Project Neptune довели решили бенчмарк, получив 100%, улучшив агентную обвязку. Возможно, если дать LLM более удобный доступ к инструментам, их способности к кибератакам окажутся выше, чем мы ожидаем?

Чтобы ответить на этот вопрос, исследователи провели два открытых мероприятия. Первый – AI vs. Humans CTF, проведенный совместно с HackTheBox, на котором полностью автономные агентные системы на базе LLM соревновались с людьми за призы в 7500 долларов в решении 20 задач на криптографию и реверс. Эти категории были взяты для того, чтобы задачи были решаемы на локальной машине без необходимости общаться с другими машинами по сети. Из 158 команд, решивших хотя бы одну задачу, было 152 человеческих и 6 LLM-агентов. Лучший агент (CAI) вошел в топ 5%, четыре из семи агентов (у исследователей из Palisade агентов было два) решили 19/20 задач, не уступая в скорости людям.

Второе мероприятие – отдельный AI-трек на ежегодном Cyber Apocalypse от HTB, в котором приняли участие две команды (CAI и Palisade) с четырьмя агентами, лучший из которых вошел в топ 21% среди команд, решивших хотя бы одну задачу. Для агентов Palisade проблемой стало взаимодействие с удаленными машинами, в целом основной трудностью для LLM стало поддержание длинного контекста. Исходя из оценок, сейчас LLM-агенты могут решать задачи, которые занимают у среднего CTF-энтузиаста примерно 1-2 часа в зависимости от того, кого считать средним.

Важные выводы из исследования: важнейшей задачей для обеспечения взаимодействия LLM-агентов с компьютерной средой – как для наступательных задач, так и для любых задач в принципе – является тулинг. Даже общение с терминалом может быть очень нетривиальным – там есть множество пограничных кейсов, от поддержания интерактивных сессий в SSH до работы с конкретными инструментами типа nc и metasploit. Еще сложнее, когда для решения задачи необходима работа с веб-интерфейсами или нативными приложениями: computer use через скриншоты – это круто, но явно крайне неоптимально с точки зрения использования контекста. При этом очень широкие знания в сочетании с возможностью одновременно проверять ограниченное только бюджетом и рейт-лимитами количество гипотез делает из LLM хороший инструмент для решения задач, даже если некоторые из этих гипотез могут быть изначально неверными (типа Claude, которые пытается придумывать флаги исходя из сюжета задачи). С другой стороны, в отличие от CTF, реальный пентест не имеет четкого решения, заранее придуманного человеком для других людей, поэтому напрямую успехи LLM в CTF на возможности в реальных кибератаках переносить не стоит, хотя корреляция будет явно не нулевая. А то, что сфера LLM+offensive еще молодая, означает, что там полно низковисящих фруктов, и хакатоны – это отличный способ их найти.

👍5

871 views21:23

llm security и каланы

Forwarded from Калан ИТ 🦦

🦄3

521 views21:24

llm security и каланы

Disrupting malicious uses of AI: June 2025
OpenAI, 2025
Отчет

Вышел очередной отчет от OpenAI по противодействию зловредному использованию ChatGPT. На этот раз в отчет вошли 10 case-studies. Дисклеймер: любая атрибуция – на совести OpenAI.

1. Атаки на работодателей. Некие злоумышленники (таким иногда промышляют в Северной Корее, но точно никто не скажет) использовали LLM для того, чтобы устраиваться на работу в айти-компании. Среди задач были генерация резюме и легенды для соискателей, помощь в прохождении собеседований, а также генерация инструкций по нестандартной настройке рабочих ноутов – установка VPN, OBS Studio и захват HDMI-сигнала – явно не для того, чтобы потом по вечерам с удовольствием пересматривать мастерски заполненную эксельку.

2. Прокитайские информационные операции в соцсетях. Некие люди, один из которых представился в промпте как сотрудник Отдела пропаганды ЦК КПК, генерировали контент для социальных сетей (тиктока, твиттера, реддита и фейсбука), а потом комментарии для этих же постов. Кроме критики тайваньской видеоигры и пакистанской активистки, неизвестные генерировали перформанс-ревью и документы о том, как правоохранительные органы должны учитывать в работе труды Си Цзиньпина. Удар!

3. Филиппинские информационные операции в соцсетях. Некоторые пиарщики (в отчете даже называется название компании) искали посты, в которых критикуют местного президента, и генерировали пачками наполненные эмодзи комментарии в его поддержку, а заодно и писали отчеты о проделанной работе – в общем, просто делали то, что должны делать любые пиарщики в 2025 году. К сожалению, президент Филиппин является, если верить википедии, недемократическим, так что это не пиар – это информационные операции.

4. Социальная инженерия. Люди просили чатбот переводить тексты с китайского на английский и обратно. Среди текстов – некие переписки, включая письмо американскому сенатору, направленные на получение данных от собеседников, посты в соцсетях и легенды для несуществующих людей, которые затем применялись в дальнейшей деятельности.

5. Русские пропагандисты. На этот раз «аккаунты российского происхождения» генерировали контент, критикующий немецкий эстеблишмент и поддерживающий AfD, который затем появлялся в «местном СМИ», коим являлся канал на 1700 подписчиков. Оттуда посты расходились по более крупным площадкам, включая твиттер-аккаунт на 27к человек.

6. Конечно, ~~русские~~ русскоговорящие хакеры! Группа аккаунтов использовалась для написания малвары на Go под винду и создание C&C-инфраструктуры. Малвару распространяли через публичный репозиторий, который прикидывался Crosshair-X, популярной тулой для рисования кастомного прицела в играх и запускали через DLL hijacking в легитимный интерпретатор питона. Из интересного: пользователь после каждого диалога, в котором обсуждал одно инкрементальное улучшение, регистрировал себе новый аккаунт и продолжал общение в нем.

7. Китайские хакеры. Как утверждается, аккаунты, использующие ту же инфраструктуре, что и известные китайские APT, использовали ChatGPT для разработки (например, написание скриптов для брута FTP), помощи в пентесте, осинте и, что самое страшное, настройки инфраструктуры для локального дипсика.

8. Еще одна китайская информационная операция: пользователи аккаунтов генерировали посты в соцсетях, выступая сразу за обе стороны в разных горячих для американского общества вопросах типа тарифов Трампа. Кроме того, среди задач была генерация кода для извлечения персданных из страниц соцсетей и просьбы о помощи в анализе аккаунтов.

9. Снова информационные операции, но уже от говорящих на персидском. Генерировали твиттер-посты про все – от прав латиносов в США и независимости Шотландии до того, как военная мощь Ирана заставляет США идти на уступки, за что заслуженно получали 150-300 просмотров.

10. Камбоджийские скамеры переводили свои диалоги с потенциальными жертвами. Жертв стандартной схемы (слишком привлекательная работа + отправка денег за получение зарплаты) они искали разными способами, включая отправку SMS, одно из которых они отправили одному из исследователей OpenAI.

👍4

451 views23:19

llm security и каланы

Как видно, основная масса примеров – относительно безобидные “influence operations”, которые получали минимальное количество просмотров, но зато, наверное, круто выглядели в отчетах для их заказчиков. Еще видно, что лень побеждает любую осторожность: ИИ слишком притягателен для любого, кто занимается монотонной работой или генерацией текстов типа пиар-стратегий или памфлетов о самодисциплине в органах правопорядка. Рискуя впасть в конспирологию: ChatGPT – наверное, не менее крутой, чем история поиска в Google, источник инсайта в то, что и как делают разные люди и организации, хотя уровень uplift, который он дает, сейчас едва ли очень высок. Так что если бы я на их месте нашел аккаунт, занимающийся чем-то более интересным, чем кхмерские разводки, я бы его не блокировал и в отчеты бы о нем не писал 🔪

Please open Telegram to view this post

VIEW IN TELEGRAM

👍7

470 viewsedited 23:20

llm security и каланы

LLM Backdoors at the Inference Level: The Threat of Poisoned Templates
Ariel Fogel, 2025, Pillar Security
Блог

Если где-то есть текст, значит, туда можно воткнуть промпт-инъекцию, что в очередной раз демонстрируют в небольшом исследовании ребята из Pillar Security. На этот раз носителями инъекций оказались файлы в формате GGUF, де-факто стандарте для обмена квантизованными моделями для локального запуска.

В случае с файлами GGUF вся нужная для инференса модели информация, вроде конфигурационных файлов, токенизатора и промпт-темплейта, поставляются или единым файлом, или набором GGUF-файлов без разделения по функциональности. А это значит, что злоумышленник может так сформировать встроенный промпт-темплейт (как вы, вероятно, знаете, у разных моделей могут быть разные промпт-темплейты, использованные при SFT, они распространяются как Jinja-файов), чтобы рядом с системным промптом всегда добавлялись нужные злоумышленнику инструкции.

Сценарий в данном случае ограничивается только вашим воображением, Pillar для демонстрации выбрали подгрузку потенциально зловредной js-нагрузки при генерации по запросу пользователя HTML-разметки. Понятно, что тут могут быть и указания добавлять в код бэкдоры, и политические установки, и многое другое.

Ситуация усугубляется тем, что на Huggingface в разделе конкретной модели обычно лежат все кванты вместе, условно от q2 до q8. При просмотре промпт-темплейта пользователь видит темплейт только первой загруженной версии: платформа предполагает, что все кванты имеют одинаковые темплейты, а значит, атакующий может загрузить самый непоплярный квант с чистым темплейтом, скрыв наличие инъекции во всех остальных.

Получается интересное сочетание промпт-инъекции и supply chain-атаки на относительно безопасный (по сравнению с pickle и производными) формат. Остается только напомнить, что не стоит скачивать модели из неофициальных (или хотя бы не обладающих репутацией) репозиториев, а то, что скачиваете – базово проверять на безопасность, и как видно, в эту проверку обязательно входит мониторинг темплейтов.

👍74

242 views19:31

2025/07/12 08:20:17
Back to Top

HTML Embed Code:

<iframe width="100%" src="https://www.group-telegram.com/buyppe/webview?embed=1" title="Channel Webview" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture" allowfullscreen></iframe>