Anthropic обнаружила, что ее собственный чат-бот ведет себя заметно по-разному в зависимости от языка общения и версии модели, причем разница системная, а не случайная. Об этом говорится в исследовании на основе более чем 300 000 диалогов с Claude.
Практический пример из самого отчета: один и тот же бизнес-план, отправленный на хинди и русском, получает от нейросети два разных вердикта. На хинди ответ выходит теплым и подбадривающим, с шуткой и похвалой автору идеи. На русском — придирчивым разбором, где сначала ищут слабые места и просят цифры в подтверждение. Факты в обоих случаях одни и те же, различается только тон и расстановка акцентов.
Методика построена на прошлой работе Anthropic «Values in the Wild» («Ценности в естественной среде»). Тогда в 700 тысячах разговоров с Claude нашли больше 3 300 отдельных «ценностей»: честность, осторожность, эмпатию и десятки других нормативных установок. Такой длинный список было невозможно удобно сравнивать между языками и версиями моделей, поэтому исследователи вручную собрали похожие по смыслу пункты в 339 более крупных категорий, а затем с помощью статистических методов сжали эти 339 измерений в четыре понятные оси, которые отражают, какие «ценности» чаще всплывают вместе в одном разговоре. Уступчивость против осторожности, теплота против строгости, глубина против краткости, откровенность против исполнительности. Для нового замера собрали 309 815 диалогов за две недели мая 2026 года, поровну распределенных между тремя моделями — Sonnet 4.6, Opus 4.6 и Opus 4.7 — и двадцатью самыми популярными языками платформы, примерно по пять тысяч диалогов на пару модель-язык. Каждую реплику размечал сам Claude версии Sonnet 4.6, отмечая присутствие или отсутствие каждой из 339 «ценностей», а в выборку брали только субъективные задачи вроде совета или обратной связи, где нет единственно верного ответа.
Самый широкий разброс во всей выборке пришелся на ось теплоты и строгости — ту самую, что развела вердикты по бизнес-плану на хинди и на русском в разные стороны. Есть и менее очевидные детали: на арабском ответы вдобавок получаются короче и уступчивее, на голландском модель охотнее признает собственные ошибки, а на индонезийском просто выполняет задачу, не тратя слов на оговорки о своих ограничениях.
Похожий разброс есть и между версиями модели. Sonnet 4.6 тяготеет к теплоте и уступчивости: хвалит, шутит, подхватывает тон собеседника. Opus 4.7 склонен к осторожности и глубине: предупреждает о рисках без просьбы, спорит с допущениями пользователя, честно проговаривает границы своих знаний. Opus 4.6 держится середины с уклоном в краткость и сразу переходит к делу.
Причину исследователи прямо назвать не берутся. Есть только гипотезы: обучающие данные распределены между языками неровно, для одних их банально больше и разнообразнее, для других — меньше и с иным составом, где-то преобладают профессиональные тексты, где-то бытовая переписка. Разговорные нормы в разных культурах и сами по себе разные, и Claude мог перенять эту разницу как норму, а не как отклонение. То есть компания не берется утверждать, что дело именно в менталитете носителей языка, а не в перекосе датасета. Оба объяснения правдоподобны. Есть и методическая оговорка: «ценности» размечала та же модель, чье поведение изучалось. Anthropic проверяла разметку на языковую предвзятость и ничего подозрительного не нашла, но полностью исключить эффект самооценки исследователи не берутся.
У этих различий есть очень прикладной смысл. Если нужна честная, жёсткая критика текста или плана, лучше общаться по-английски или по-русски и выбирать Opus 4.7. Строгий разбор и придирки почти гарантированы. А если важнее тёплая поддержка и «человечный» тон, логичнее переключиться на хинди или арабский и модель Sonnet 4.6, которая ведёт себя заметно мягче и более эмпатично. При этом речь не только о настроении диалога: в систем-карте и независимых обзорах Opus 4.7 видно, что доля ненужных отказов на безобидные запросы по-английски заметно ниже, чем на других языках, а отдельные исследования раньше показывали, что защитные фильтры больших моделей в целом легче обходятся именно на определённых языках, что добавляет ещё один слой к вопросу честности моделей и выбора языка для серьёзных задач.
Исправлять ли эту разницу, компания пока не решила, потому что сначала нужно понять, желательна ли она вообще. Часть отклонений может быть уместной культурной подстройкой, а часть — недоработкой для языковых сообществ, которым при обучении досталось меньше качественных данных. Anthropic обещает попробовать управлять профилем «ценностей» через донастройку характера модели и системные подсказки, а результат сверять тем же методом осевых измерений.
Три модели из выборки успели устареть еще до публикации отчета: пока собирали и размечали майские диалоги, Anthropic выпустила Opus 4.8, Sonnet 5 и Fable 5, и по той же методике их профиль пока никто не проверял.
