Anthropic опубликовала отчёт о промышленной дистилляции Claude. По её данным, несколько китайских лабораторий — Alibaba/Qwen, DeepSeek, Moonshot/Kimi, Zhipu, Xiaomi и другие — годами не строили собственные пайплайны обучения с нуля, а массово прогоняли запросы через Claude, забирали его ответы и цепочки рассуждений и превращали их в датасеты для своих моделей. Счёт идёт на десятки и сотни миллионов обменов, а среди перехваченных запросов оказались учётные данные и данные видеонаблюдения.
Что такое дистилляция и почему это больно
Дистилляция (distillation) — это когда большую и дорогую модель используют как учителя: её ответы записывают и на них тренируют модель поменьше и подешевле. Формально это стандартная техника, и её применяют почти все. Проблема начинается там, где учителем становится закрытая модель конкурента, а запросы идут через тысячи фальшивых аккаунтов — то есть в обход условий использования и с прямым обманом биллинга и детекторов злоупотреблений.
Anthropic отдельно подчёркивает: целью были не просто «хорошие ответы», а reasoning traces — цепочки рассуждений. Именно они сегодня считаются самой ценной частью вывода модели, потому что на них строится обучение с учителем (SFT, supervised fine-tuning) и обучение с подкреплением (RL, reinforcement learning).

Alibaba: 151 млн обменов и обучение Qwen
Самый крупный эпизод в отчёте — Alibaba. Anthropic утверждает, что с мая по июль 2026 года зафиксировала более 151 млн обменов с Claude, связанных с этой компанией. На пике — почти 3 млн запросов в сутки, и всё это через тысячи поддельных аккаунтов.
- Специальные промпты заставляли Claude раскрывать цепочки рассуждений.
- Из них собирали SFT-датасеты.
- По версии Anthropic, эти данные пошли в обучение Qwen 3.5, 3.6 и 3.7.
- Claude, как утверждается, помогал ещё и строить RL-среды и исследовать архитектуры моделей.
То есть конкурент получал не только ответы, но и методическую поддержку — косвенную, но вполне рабочую.
Moonshot/Kimi: ответ Opus под своим именем
С Moonshot схема выглядит ещё наглее. Anthropic пишет, что Kimi в некоторых случаях молча пересылал пользовательский запрос в Claude Opus и возвращал ответ Claude как ответ Kimi. За рассматриваемый период с Moonshot связывают более 23 млн обменов. Сохранённые диалоги потом использовались для извлечения цепочек рассуждений и обучения моделей.
Самое неприятное здесь — для пользователей: по данным отчёта, они могли вообще не знать, что их запрос покинул инфраструктуру Moonshot. Ты думаешь, что работаешь с одним провайдером, а твой текст уезжает к другому — без уведомления и без твоего согласия.

DeepSeek: скрытый роутинг и утечки по цепочке
DeepSeek, по данным Anthropic, действовал похоже: за 14 дней июля насчитали более 12,1 млн обменов. Механика интереснее — система якобы распознавала пользователей Claude Code, Claude Agent SDK, OpenCode и других coding harnesses (обвязок для работы агентов с кодом), после чего часть их запросов незаметно уходила в Claude Opus, а полученные цепочки рассуждений собирались.
Дальше начинается сюжет про безопасность. Anthropic описывает случай IT-оператора, работавшего с данными российского госведомства, связанного с Министерством обороны: DeepSeek переслал его запрос в Claude, и в тексте запроса оказались действующие учётные данные российской государственной базы. Это не значит, что DeepSeek целенаправленно передавал эти credentials — но именно такой результат дала схема скрытого роутинга.
Там же фигурируют инженеры китайского муниципального Public Security Bureau, которые через DeepSeek разрабатывали систему сопоставления перемещений человека с полицейскими записями по национальному ID. У Moonshot отдельно обнаружились запросы вероятного сотрудника, связанного с НОАК, который загружал данные видеонаблюдения с сотен камер и просил анализировать поведение конкретного человека.

Xiaomi: ответы не подменяла, но данные сохранила
Xiaomi, судя по расследованию, пользователям ответы Claude не подсовывала. Зато сохраняла реальные диалоги пользователей MiMo и повторно прогоняла их через Claude — уже для создания SFT- и RL-данных. Anthropic зафиксировала более 400 тысяч таких запросов и утверждает, что среди них встречались имена, контакты и корпоративная информация пользователей.
А где здесь двойные стандарты
Вот что цепляет лично меня. Anthropic строит обвинение на простой логике: мы сделали модель, а они её «съели» и обучились. Ровно та же логика, которую сама индустрия годами игнорировала, когда речь шла о человеческом контенте: текстах, картинках, музыке и коде, выкачанных из интернета без спроса. Тогда это называлось «данные общедоступны». Когда то же самое делают с выводом модели — это уже кража.
Я не оправдываю ни тех, ни других. Просто давай называть вещи честно: аргумент «мы хорошие, они плохие» здесь не работает у обеих сторон. Разница в другом — и она существенная. Во-первых, дистилляция закрытой модели нарушает договор, а не только этику. Во-вторых, она приводит к реальным инцидентам: утёкшие credentials, запросы про слежку, данные пользователей в чужих датасетах. Вот это уже не спор о философии, а инциденты безопасности.
Что из этого следует для практики
Для тех, кто пишет код с ИИ и собирает продукты на API, вывод предельно приземлённый: считай любой промпт публичным. Не важно, насколько «приватным» выглядит интерфейс — между тобой и моделью может стоять посредник, который логирует, кэширует и переиспользует твой запрос.
- Не вставляй в промпты ключи, токены, пароли, строки подключения и персональные данные.
- Если ты оборачиваешь чужую модель в свой сервис — ты отвечаешь за то, куда уходят запросы твоих пользователей, и должен сказать им об этом прямо.
- Для чувствительных задач держи модель локально или работай с провайдером, у которого есть внятная политика хранения данных.
- Помни, что качество твоего продукта может опираться на чужую инфраструктуру сильнее, чем ты думаешь.
Выводы
- Anthropic заявила о промышленной дистилляции Claude: Alibaba (151+ млн обменов), Moonshot (23+ млн), DeepSeek (12,1 млн за 14 дней), Xiaomi (400+ тыс. запросов).
- Речь шла не про ответы, а про цепочки рассуждений — основу для SFT- и RL-датасетов конкурентов.
- Moonshot, по данным отчёта, отдавала ответы Claude как свои, а DeepSeek скрыто роутил чужие запросы в Opus.
- Побочный эффект схемы — утечки: в пересланных запросах оказались учётные данные, данные видеонаблюдения и персональная информация пользователей.
- Обе стороны конфликта используют одну и ту же логику «наши данные и чужие данные», но инциденты с утечками — проблема чисто практическая, а не этическая.