Национальное агентство безопасности США, Агентство по кибербезопасности и защите инфраструктуры (CISA) и ФБР выпустили совместное предупреждение, в котором обвинили шесть китайских ИИ-компаний в промышленной дистилляции американских флагманских моделей. DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun и Z.AI, по данным расследования, с конца 2024 года выкачали миллиарды токенов через миллионы запросов к Claude, GPT, Gemini и Grok и использовали эти ответы, чтобы обучать собственные модели быстрее и дешевле, чем позволяет самостоятельная разработка.
Дистилляция (обучение менее мощной модели на ответах более мощной) сама по себе законный и широко используемый метод, так тренируют компактные версии моделей даже сами западные лаборатории. Проблема, о которой говорят государственные ведомства США, в масштабе и методах. Агентства описывают четыре приема, которые называют новыми для отрасли. Среди них — обход региональных ограничений в связке со злоупотреблением подписками, централизованная инфраструктура маршрутизации запросов, автоматическая очистка метаданных для сокрытия источника трафика и системная оптимизация квот и затрат. Спецслужбы утверждают, что для шести названных компаний дистилляция — не вспомогательный инструмент, а основа стратегии развития ИИ.
Список признаков для обнаружения подобной активности выглядит как чек-лист для служб безопасности самих американских лабораторий. Один и тот же аккаунт заходит с разных IP-адресов и разных программ-клиентов, использование идет круглосуточно без обычных для человека колебаний активности, соотношение подписки к объему запросов выглядит аномальным, а новые аккаунты сразу выходят на максимальную нагрузку без разгона. Вместо простой блокировки таких профилей агентства советуют компаниям вроде OpenAI и Anthropic другую тактику — незаметно ухудшать качество ответов для аккаунтов с высокой уверенностью в злоупотреблении, чтобы не спугнуть нарушителя раньше времени и выиграть время на расследование.
Пекин обвинения отверг, назвав дистилляцию нормальной практикой бизнеса, а не воровством, и предложил Вашингтону сотрудничество вместо конфронтации. Ни одна из шести названных компаний не выступила с детальным опровержением конкретных пунктов претензии. Показательно и то, что среди перечисленных в документе техник нет ни одной, требующей физического доступа или взлома — все построено на использовании обычных публичных API западных моделей, только в промышленных масштабах и с маскировкой трафика.
Документ выходит на фоне и без того напряженных отношений вокруг экспортного контроля на чипы и растущего числа претензий к тому, как китайские лаборатории обучают свои открытые модели. Но именно таким хитрым приемом исследования и разработки, авторы претензии и объясняют значительный скачок в производительности и актуальности китайских нейросетей.
