Xora AI Искусственный
интеллект
Проверить готовность
01ИИ-трансформация 02Направления 03Продукты 04Обучение 05Кейсы 06Блог 07Контакты
Проверить готовность

Новости ИИ

Targeted Distillation-атаки: новая угроза ИИ-активам

Anthropic выявила масштабные кампании по краже ИИ-IP через дистилляцию моделей Opus. Это новая категория киберугроз, где объектом атаки становятся сами модели, что требует пересмотра подходов к защите для российских разработчиков.

Что произошло

16 сентября 2026 года компания Anthropic опубликовала свой ежеквартальный threat intelligence report, в котором отдельный блок посвящён ранее не анализировавшемуся масштабному явлению — целевым дистилляционным атакам на фронтальные модели. В отчёте утверждается, что с февраля 2026 года было выявлено и пресечено семь несанкционированных кампаний по извлечению знаний из моделей Claude, включая наиболее продвинутую commercially available модель Opus. Атаки с высокой степенью уверенности связываются с лабораториями, базирующимися в КНР. Ключевая цель кампаний — не кража данных пользователей, а копирование дифференцирующих возможностей самой модели, её интеллектуальной собственности, накопленной в результате исследований на миллиарды долларов.

Ещё 23 февраля 2026 года Anthropic выпустила специальное уведомление «Detecting and preventing distillation attacks», где прямо назвала три китайские компании — DeepSeek, Moonshot AI и MiniMax — организаторами промышленной дистилляции. По данным Cloud Security Alliance, которые ссылаются на это расследование, было зафиксировано 16,55 млн запросов к Claude API, отправленных через примерно 24 000 поддельных аккаунтов. В сентябрьском отчёте Anthropic оценила общий объём скомпрометированных обменов (prompt-response пар) в 190 млн. Эти цифры демонстрируют не единичные инциденты, а системную, промышленно организованную деятельность по обходу лицензионных соглашений и экспортных ограничений для получения frontier-возможностей без затрат на их разработку.

Событие вызвало реакцию на государственном уровне. Агентства национальной безопасности США (NSA), Федеральное бюро расследований (FBI) и Агентство по кибербезопасности и защите инфраструктуры (CISA) выпустили совместный advisory, квалифицирующий подобные действия как направленную атаку на ИИ-интеллектуальную собственность. В документе рекомендуется провайдерам моделей внедрять системы детектирования аномальной активности и обмениваться разведывательными данными об атакующих. Таким образом, модельная ИС становится самостоятельным объектом защиты наравне с кодом, патентами и коммерческими тайнами, что формирует новый вектор рисков для любой компании, развивающей собственные ИИ-продукты.

Как это устроено

Механика дистилляции как атаки

В основе атаки лежит легитимная машинно-обучающая техника — knowledge distillation. Злоумышленник использует мощную модель-«учитель» (в данном случае Claude Opus) для генерации обучающего датасета. Массово создавая высококачественные, многошаговые промпты, атакующий собирает пары «запрос-ответ». Эти данные затем используются для обучения собственной, менее дорогой в разработке модели-«студента». Цель — не просто скопировать поведение, а воспроизвести ключевые способности: сложное рассуждение (reasoning), генерацию кода, использование инструментов (tool use) и агентное поведение. В результате атакующий получает модель с функциональностью, сопоставимой с оригиналом, но без встроенных механизмов безопасности и с несоизмеримо меньшими первоначальными вложениями.

Экономика целевой атаки

Разработка frontier-моделей уровня Opus требует, по оценкам самих лабораторий, миллиардов долларов на вычислительные ресурсы и исследования. Targeted distillation-атака позволяет обойти эти затраты. По нашему опыту проектов, основная стоимость переносится в этап сбора данных через API и последующего дообучения, что на порядки дешевле создания модели с нуля. Атакующие таргетируют «generally available models», такие как Opus, Sonnet и Haiku, которые не подпадают под прямые экспортные запреты, но содержат в себе большую часть возможностей, присущих закрытым моделям. Это позволяет эффективно обходить санкционные барьеры, получая доступ к передовым технологиям через легальные каналы.

Отличие от классических атак

Традиционные атаки на ИИ-системы фокусировались на извлечении весов модели (model extraction), инъекциях промптов (prompt injection) или утечке обучающих данных. Distillation-атака принципиально отличается. Она происходит в рамках формально легального использования API: атакующий покупает подписки, создаёт аккаунты и действует в пределах установленных лимитов. Ущерб наносится не конфиденциальности данных клиентов, а ценности нематериального актива — самой модели. Классические средства защиты, такие как WAF или системы предотвращения вторжений, неэффективны, так как трафик выглядит как обычный пользовательский.

Инструменты и индикаторы compromises

Детектирование таких атак требует аналитики поведения, а не сигнатур. Ключевые индикаторы, описанные в рекомендациях американских ведомств и CSA, включают: аномально высокий объём запросов с одного аккаунта или группы аккаунтов, особенно если они новые или используют анонимные методы оплаты; аномальное соотношение между стоимостью подписки и объёмом потребления (например, базовый тариф с enterprise-уровнем нагрузки); однотипность и высокая сложность промптов, направленных на извлечение конкретной способности (например, генерация сложного кода без реального проектного контекста). По нашему опыту, именно такие паттерны «low and slow» или «high and fast» являются маркерами дистилляционной кампании.

Роль водяных знаков и деградации

Одним из методов противодействия, предложенных CSA, является output watermarking — внедрение в ответы модели скрытых, криптографически проверяемых меток. Эти метки сохраняются даже после дистилляции, что позволяет доказать происхождение модели. Другой метод — response degradation. Для подозрительных сессий система может намеренно выдавать более упрощённые, менее точные или зашумлённые ответы. Это снижает ценность собранных данных для обучения «студента», делая атаку экономически нецелесообразной. В типовом сценарии, система динамически снижает качество ответа, если обнаруживает признаки автоматической генерации промптов или аномально высокую частоту запросов.

Как это выглядит на практике

Сценарий 1: Быстрый выход на рынок. Российский стартап разрабатывает узкоспециализированную модель для анализа финансовой отчётности, обладающую уникальной точностью. Крупный конкурент, не имеющий времени на собственные R&D, регистрирует несколько десятков аккаунтов через посредников. Используя автоматизированные скрипты, конкурент отправляет модели сотни тысяч сложных запросов, имитирующих работу аналитиков. За 2-3 месяца собирается датасет, достаточный для обучения базовой версии модели-конкурента, которая быстро выводится на рынок, снижая уникальность и ценность продукта стартапа.

Сценарий 2: Государственно-ориентированная кампания. Организация, связанная с государством, стремится получить доступ к передовым агентным возможностям для использования в системах кибершпионажа. Прямой доступ к frontier-моделям заблокирован санкциями. Организация использует сеть резидентных в дружественных юрисдикциях компаний для легального доступа к API публичных моделей. Через массированную дистилляцию они извлекают не только знания, но и паттерны рассуждений, перенося их в локальную, неограниченную модель, которая затем используется для автономных операций. Ущерб заключается не только в краже IP, но и в создании неуправляемой и небезопасной системы.

Сценарий 3: Поставщик встраиваемых решений. Компания разрабатывает и продаёт API-доступ к своей модели для юридических консультаций. Один из клиентов, крупная IT-корпорация, в договоре на использование API не прописывает прямой запрет на дистилляцию. Внутри корпорации запускается проект по созданию собственного «юридического ассистента». Используя корпоративный аккаунт, они систематически «прокачивают» модель-студента ответами API-провайдера, эффективно копируя его ядро и выводя из рынка поставщика, который остаётся с затратами на поддержку и развитие модели, но без дохода от крупного клиента.

Что это значит для российской компании

Для российского ИИ-сообщества это событие — сигнал о том, что ценность смещается от данных к модели. В условиях импортозамещения и фокуса на «суверенный ИИ», отечественные разработки (например, модели от Сбера, Яндекс, SberDevices) становятся стратегическими активами, а следовательно, и привлекательными целями. Даже если компания не является фронтиром, но обладает уникальной доменной экспертизой, закодированной в модели (медицина, геология, промышленность), она рискует стать объектом целевой дистилляции. Санкционные ограничения на доступ к иностранным чипам и frontier-моделям только повышают ценность отечественных наработок и мотивируют потенциальных злоумышленников к их копированию.

Правовые аспекты в России находятся в стадии формирования. Хотя кража интеллектуальной собственности преследуется по закону, квалифицировать дистилляцию через API как таковую пока сложно. Это требует сбора технических доказательств, таких как логи запросов и анализ «украденной» модели на наличие водяных знаков. Поэтому превентивные технические и договорные меры защиты выходят на первый план. Бюджеты на кибербезопасность ИИ-проектов должны включать не только защиту инфраструктуры и данных, но и затраты на внедрение систем мониторинга поведения, watermarking и юридическую проработку API-лицензий.

Тип компании Основной риск Ключевые последствия Приоритетные действия
Разработчик собственной модели (B2B/B2C) Прямая кража IP, потеря конкурентного преимущества Снижение уникальности продукта, потеря доли рынка, неоправданные R&D-затраты Сегментация API, watermarking, детектирование аномалий, усиленные EULA
Интегратор/Пользователь зарубежных API Нарушение комплаенса, использование скомпрометированной модели Юридические риски, репутационный ущерб, блокировка аккаунта провайдером Проверка поставщика на наличие защитных механизмов, контроль использования API
Компания с уникальной доменной моделью Целевая кража нишевой экспертизы Потеря монополии на вертикальное решение, появление прямых конкурентов Ограничение доступа к «ценным» эндпоинтам, KYC для клиентов, мониторинг паттернов

Что делать: пошагово

  1. Включите дистилляцию в модель угроз. При проектировании любой ИИ-системы с API-доступом рассматривайте модель как ценный актив, уязвимый к targeted distillation. Это должно быть зафиксировано в реестре рисков.
  2. Сегментируйте API-доступ. Разделите функциональность на tiers. Базовые возможности доступны всем, а наиболее ценные (сложный reasoning, генерация кода) — только верифицированным enterprise-клиентам после процедуры KYC.
  3. Внедрите поведенческую аналитику. Настройте систему мониторинга на поиск аномалий: резкие всплески потребления, высокая частота запросов от новых аккаунтов, однотипность сложных промптов, не характерных для обычного бизнес-юзкейса.
  4. Используйте технологию watermarking. Интегрируйте в ответы модели невидимые метки, которые позволят в будущем доказать, что другая модель была обучена на ваших данных. Это мощный сдерживающий фактор.
  5. Применяйте динамическую деградацию. Для сессий, классифицированных как подозрительные, автоматически снижайте качество или полноту ответов. Это делает собранные данные бесполезными для обучения.
  6. Усилите юридическую базу. Включите в условия использования API (EULA) прямой запрет на использование ответов для обучения, тонкой настройки или создания конкурирующих моделей. Пропишите право на блокировку при нарушении.
  7. Организуйте сбор и анализ логов. Детально логируйте все запросы, включая метаданные (таймстемппы, IP-адреса, подписки). Эти данные — основа для расследования и возможных судебных разбирательств.
  8. Планируйте инцидент-ответ. Разработайте чёткий план действий на случай обнаружения дистилляционной кампании: от блокировки аккаунтов и уведомления правоохранителей до публичных заявлений.

Типичные ошибки

  • Рассматривать модель как «чёрный ящик». Игнорирование того, что внутри модели — ценнейший актив, приводит к отсутствию какой-либо защиты от копирования через API.
  • Применять единые лимиты для всех. Установка одинаковых квот на запросы для новых анонимных пользователей и для долгосрочных партнёров упрощает атакующему задачу маскировки под легитимный трафик.
  • Полагаться только на традиционную ИБ. Межсетевые экраны и антивирусы не видят разницы между легитимным и злоумышленным использованием API, так как атака происходит на прикладном уровне.
  • Пренебрегать юридическими инструментами. Отсутствие в EULA пунктов о запрете дистилляции лишает компанию правовых рычагов воздействия на злоумышленника даже после обнаружения факта атаки.
  • Искать только быстрые и массовые атаки. «Low and slow» кампании, растянутые на месяцы с небольшим объёмом запросов в день от множества аккаунтов, часто остаются незамеченными системами, настроенными на пиковые нагрузки.
  • Считать, что маленькая модель не является целью. Даже модель среднего размера может содержать уникальную и высокоценную доменную экспертизу, копирование которой для конкурента гораздо выгоднее, чем разработка с нуля.

Как понять, что вы на верном пути

  • Targeted distillation зафиксирована в вашей реестре моделей угроз как актуальный риск для ИИ-активов.
  • У вас есть как минимум два уровня доступа к API: публичный и верифицированный, с разными наборами возможностей и лимитов.
  • Система мониторинга способна выявлять группы аккаунтов с аномально схожим поведением и высоким потреблением.
  • В юридическом отделе утверждены и используются шаблоны API-лицензий с прямыми запретами на использование данных для обучения конкурирующих систем.
  • Вы технически готовы внедрить или уже внедрили систему выходных водяных знаков для ваших ключевых моделей.
  • Бюджет на кибербезопасность ИИ-проекта включает статью расходов на защиту модели, а не только на инфраструктуру.

Вопросы, которые нам задают

Насколько этот риск актуален для моделей, не являющихся фронтальными?

Риск высок, если ваша модель обладает уникальной коммерчески ценной способностью, даже если она уступает Opus по общим параметрам. Стоимость атаки на такую модель пропорционально ниже, что делает её ещё более привлекательной целью для быстрого копирования.

Можно ли полностью защититься от дистилляции?

Полной защиты не существует, так как атака использует легитимный функционал. Цель — не блокировать её на 100%, а резко повысить стоимость и временные затраты для атакующего, сделав атаку экономически нецелесообразной.

Что делать, если мы используем только зарубежные модели через API?

В этом случае ваш риск — это комплаенс и возможная блокировка со стороны провайдера, если ваш трафик будет ошибочно классифицирован как дистилляционный. Важно работать только с провайдерами, которые публично заявляют о мерах по защите от таких атак, и соблюдать их условия использования.

Как доказать факт кражи в суде, если это произойдёт?

Основное доказательство — техническое. Необходимо иметь детальные логи запросов и доказать, что «украденная» модель содержит ваши выходные водяные знаки. Юридическая практика по таким делам только формируется, поэтому техническая доказательная база имеет решающее значение.

Источники

Вывод

Защита модели — это новая защита бизнеса; игнорировать — значит добровольно делиться конкурентным преимуществом.

По теме

Ещё о том же

17 сентября 2026

Стандарты безопасности ИИ по модели FINRA: влияние на бизнес

OpenAI, Anthropic и Google DeepMind создают орган саморегулирования для тестирования ИИ. Для российского бизнеса это сигнал к пересмотру комплаенса и переходу на отечественные модели с прозрачными протоколами безопасности.

15 сентября 2026

GitHub Actions с ИИ-агентами: новые риски и правила для РФ

GitHub интегрировал кодовых агентов в Actions, сместив ИИ от ассистента к участнику CI/CD. Это меняет процессы разработки, создаёт новые векторы атак и требует пересмотра подходов к безопасности и комплаенсу, особенно для российских компаний в условиях 243-ФЗ.

Проверка готовности

Проверьте, готова ли ваша компания к AI

15 вопросов, 4 минуты. На выходе — где главное ограничение, какие AI-сценарии реалистичны, какой эффект можно ожидать и что закрыть в первую очередь.