
Русскоязычные запросы к зарубежным нейросетям обходятся пользователям в разы дороже английских. Особенно это заметно с Claude Opus 5: он «весит» русский текст почти в четыре раза тяжелее, чем GPT-5.5. Причина оказалась не в жадности разработчиков, а в алгоритмах работы с токенами.
Как сообщает CNews, на проблему обратил внимание пользователь Habr под псевдонимом donseo. Он выяснил, что проблема скрывается в том, что нейросети совершенно по-разному работают с токенами.
Токкенизатор используется для разделения текста на отдельные фрагменты непосредственно перед обработкой нейросетью. В одних случаях текст делится на крупные фрагменты, в других — на совсем короткие, из-за чего происходит переплата.
Одинаковый текст он загрузил в Claude Opus 5 и GPT-5.5. Первый насчитал в нем на 390% (в 3,9 раза) больше токенов по сравнению с результатом в GPT-5.5. Таким образом оказалось, что при одинаковой цене за токен счет за русскоязычный продукт будет разный, поскольку у разных моделей разные токенизаторы.
В общей сложности donseo сравнил 11 популярных нейросетей, в том числе российские GigaChat (Сбербанк) и YandexGPT («Яндекс»). Исследование показало, что русский текст «весит» почти в три раза больше. В российских нейросетях все наоборот: русский текст в них «весит» меньше английского.
Ранее «ГлагоL» сообщал, что создатель ChatGPT компания OpenAI подтвердила отказ от выпуска модели искусственного интеллекта (ИИ) нового поколения GPT-6.1 Astra, дебют которой планировали в октябре. Внутреннее тестирование показало, что система не соответствует стандартам безопасности и согласованности действий разработчика.




