Компания Anthropic сообщила о рисках так называемых distillation attacks - кибератак, при которых злоумышленники пытаются воспроизвести поведение крупной языковой модели, систематически отправляя ей запросы и анализируя ответы. Речь идет о попытках «снять копию» модели без доступа к её внутренним весам и архитектуре.
В публикации компания объясняет, что дистилляционная атака строится на массовом сборе входных и выходных данных. Атакующий формирует большой набор запросов, получает ответы целевой модели, а затем обучает собственную модель так, чтобы она воспроизводила аналогичные паттерны. Таким образом создаётся приближённый функциональный клон без прямого доступа к исходному коду или обучающим данным.
Anthropic отмечает, что подобные атаки не являются взломом инфраструктуры, а используют открытую возможность взаимодействия через API. Угроза связана с масштабным автоматизированным сбором данных и попытками реконструировать поведенческие характеристики модели.
Компания заявила о внедрении механизмов выявления таких сценариев. В числе мер — анализ аномальных паттернов запросов, ограничение автоматизированного массового извлечения ответов и поведенческий мониторинг использования API. Цель — выявлять признаки систематической попытки «снять слепок» модели.
В Anthropic подчёркивают, что защита от дистилляции становится частью стратегии по обеспечению безопасности ИИ. Речь идёт не только о защите инфраструктуры, но и о предотвращении несанкционированного воспроизведения интеллектуальной собственности в форме поведенческой модели.