Сто ловушек в одном рассказе, LLM-судья с ключом ответов и баллы, которые считает код. Так устроен бенчмарк художественного перевода, который теперь встроен в опенсурсный конвейер BookTrans. В статье — зачем он понадобился, и как на нём выступили флагманы Anthropic, OpenAI и Google против китайских моделей. И ответ на главный вопрос: можно ли сэкономить, используя китайские модели, не потеряв в качестве. Читать далее

Бенчмарк качества англо-русского перевода для ведущих западных и китайских LLM
TL;DR: лучший англо-русский художественный перевод сегодня дают GPT-6 Astra (90 из 100) и Gemini 3.8 Flash (88). Лучшие китайские модели оказались сильнее, чем я ожидал: GLM 5.3 набрала 84, DeepSeek V4 Flash — 82,3, обе выше флагманов Claude (Fable 5.1 — 79, Opus 5.5 — 78,3), а Kimi K2.7 Code и Hy4 встали с ними вровень. Что очень круто. Так что их можно использовать для работы, если достаточно среднего качества. С другой стороны Gemini 3.8 Flash настолько дешева, что в экономии не вижу смысла. Полно и слабых китайцев: MiniMax M3, Qwen, MiMo, Step 5 и LongCat набрали от 22 до 72. Подробности — в рейтинге.
Месяц назад я сравнивал здесь Opus 5, Sol 5.6 и Gemini (Flash и Pro) в художественном переводе и редактуре. Метод был таков: одна модель переводила главу, а заведомо крутая LLM (Sol или Opus) её редактировала. Мерой качества перевода служило число правок модели-редактора. Чем меньше правок — тем лучше перевод. Метод оказался вполне рабочим. Но по итогу у меня накопились претензии к нему. Он не был достаточно чётким, пользователи в комментариях писали, что нужен нормальный, легко воспроизводимый бенчмарк. Я его сделал, теперь он встроен в конвейер BookTrans.
Почему счёт правок перестал устраиватьЧисло правок редактора кажется объективной мерой, с которым легко работать. Это ведь просто число. Но у этого метода есть куча недостатков.
Вкусовщина судьи. Sol правит вдвое больше абзацев, чем Opus, но это вкусовщина («на вкус и цвет товарищей нет»), а не смысл. Сравнивать переводы можно было, только если у них один судья. Это неудобно.
Редактор льстит осторожному переводчику. Редактор не видит оригинала (по соглашениям конвейера), поэтому гладкий перевод, который выбросил метафоры и упростил предложения, получает меньше правок, чем смелый и точный.
Без ручного чтения числа ничего не значат. Всякий раз приходилось читать четыре перевода параллельно с оригиналом, и главные косяки находило чтение.
Бенчмарк должен был убрать эти и другие изъяны и при этом измерять качество перевода в реальном пайплайне, с его промптами и требуемыми форматами ответа.
Как устроен бенчмаркИдея взята из индустриального стандарта оценки переводов MQM, где качество описывают разметкой ошибок по категориям, а также из практики школьных экзаменов: у проверяющего есть ключ с ответами. LLM-судья получает список контрольных точек, где в тексте поставлена ловушка и что считается верным, и по каждой отвечает «пройдена» или «провалена». Он отвечает в специальном формализованном формате, далее итоговый балл считает программа.
Текст. За основу взят рассказ О. Генри «The Skylight Room» 1906 года, права на него давно истекли. Рассказ основательно переделан: действие перенесено в наши дни, устаревшие обороты заменены, имена и название другие, финал переписан. Сюжет сохранён, это цельная история на 66 абзацев и четверостишие в эпиграфе, около 3100 слов, как раз один стандартный кусок для конвейера. В текст посажено сто ловушек по двенадцати областям, каждая стоит одно очко, так что итог читается как процент.
Область | Очков | Что проверяется |
|---|---|---|
Точность смысла | 15 | Ложные друзья, значение многозначного слова по контексту, цифры, кто кому что продал |
Полнота | 9 | Выброшенные предложения, придаточные, эпитеты в перечислениях |
Отсутствие калек | 11 | «Ты в порядке?», «это не о том…», «имеет смысл», избыток притяжательных |
Словарь и идиомы | 9 | Редкие книжные слова, астрономические и медицинские термины, идиомы по смыслу |
Образность и стиль | 11 | Метафоры сохранены, регистры речи персонажей различимы |
Стихи и игра слов | 8 | Четверостишие размером и рифмой, три каламбура |
Согласованность | 8 | Повторяющаяся реплика, имена и термин одинаковы по всему тексту; три значения слова fair разведены |
Пол и обращения | 8 | Пол врача, раскрытый через шесть абзацев после первой реплики; звезда с мужским именем; ты/вы постоянны |
Имена и клички | 7 | Транслитерация по звучанию: Cholmondeley, Siobhan, Leigh, Beauchamp, Worcester; клички по смыслу |
Норма языка | 6 | Оформление диалога, многоточия, пересчёт футов и миль, курсив |
Сноски | 4 | Есть к мифологии и реалиям, нет к очевидному |
Регистр и откровенность | 4 | Ругательства не смягчены, телесные детали не выброшены |
Врач скорой помощи шесть абзацев подряд упоминается без указания пола, а потом оказывается женщиной. В английском это ничего не стоит — в русском переводчик обязан выбрать род глаголов заранее, и модель, не дочитавшая текст до конца, пишет «сказал доктор Морган». Это три точки из ста, и первую из них проваливает больше половины прогонов, включая флагманов.
Слово fair встречается трижды: a fair shot в тире (меткий, засчитанный выстрел), the street fair (уличная ярмарка) и a fair complexion (светлая кожа). «Честный выстрел» пишут три модели из четырёх.
Мисс Вустер говорит «Well, really!» пять раз, и это её характеристика. Переводчик, который пять раз переводит по-разному, эту характеристику стирает.
Фамилия Beauchamp по-английски читается «Бичем», а модели в двух случаях из пяти пишут «Бошан», по-французски. Cholmondeley — это «Чамли», и примерно треть переводов даёт «Чолмонделей» по буквам. Зато ирландскую Siobhan почти все знают как «Шивон».
Ключ. К тексту прилагаются правильные ответы для судьи: сто строк вида «точка, область, адрес абзаца, что считается верным». Ключ написан по-английски и не зависит от языка перевода, поэтому тот же бенчмарк годится для тестирования перевода с английского на любой целевой язык, примеры для русского судья переносит на другой язык по смыслу. Переводчик ключа не видит.
Текст и ключ лежат в пакете одним сжатым двоичным файлом, src/booktrans/bench/en.bin. Репозиторий публичный, а открытый ключ ответов рано или поздно попал бы в обучающую выборку тех моделей, которые занимаются переводом, и они выучили бы правильные ответы. Ни документация, ни тесты не цитируют текст для перевода, используемый в бенчмарке. По той же причине я не выкладываю его и здесь, под спойлером: статьи на Хабре тоже идут в обучающие выборки.
Штрафы. Сверх ключа судья отмечает отсебятину (факт, действие или оценка, которых нет в оригинале) и непереведённые фрагменты, а код без участия судьи считает потерянные абзацы, разошедшуюся разметку, буквы чужой письменности (иероглифы в русском тексте) и лишние попытки. Про попытки отдельно: когда модель отвечает не по форме, конвейер переспрашивает с подсказкой, до пяти раз. Без штрафа модель, попавшая в формат с третьего захода, получала бы тот же балл, что и попавшая с первого, хотя стоит втрое дороже по времени и деньгам.
Счёт. Балл области равен числу пройденных точек, итог равен сумме областей минус штрафы, нормированный к ста. Никакой «оценки от 0 до 100» судья не выставляет, и это принципиально: свободная оценка плавает между запусками на десятки баллов, а ответ «да/нет» по конкретному требованию воспроизводится. Тот же перевод, отданный судье второй раз, дал 82 и 83 балла с расхождением в одной точке из ста.
Три прогона. Один перевод модели не ранжирует. У средних моделей два перевода одного текста расходятся на 10–20 баллов, у сильных на 3–7. Поэтому по умолчанию текст переводится и судится три раза, прогоны идут одновременно, в отчёт попадают среднее и разброс.
Среднее, а не медиана, и это сознательный выбор. Медиана трёх прогонов выбрасывает худший целиком, а книга из тридцати кусков выйдет средней по качеству, и каждая провальная глава в ней останется. Модель, которая раз из трёх переводит на 41, по медиане выглядела бы ровной, а в книге эти главы будут. Медиана вдобавок обнулила бы правило срыва, о котором ниже: из прогонов 0, 78 и 80 она дала бы 78, а среднее даёт 52,7. Довод за медиану один — устойчивость к случайному выбросу, в том числе к ошибке судьи. Но судья здесь отвечает «да/нет» по ста точкам и повторяет себя с точностью до балла, так что выбросы — это модель, а не шум, и их надо считать.
Срыв модели и сбой роутера. Бывает, что перевода нет ни в одной из пяти попыток. Бенчмарк различает, кто виноват. Если сорвалась сама модель — зациклилась и упёрлась в предел вывода, обрывала ответ на одном и том же месте или раз за разом отвечала не по форме, — прогон засчитывается нулём: модель, которая срывается каждый третий раз, не должна выглядеть надёжной. Если хоть одну попытку сорвала связь — роутер уронил поток на полуслове, вернул ошибку сервиса или упёрся в лимит, — прогон в серию не идёт: модель тут ни при чём, и его просто переводят заново. Это не перестраховка: роутер byNara во время этого замера раз за разом обрывал ответы MiMo, Qwen и GLM ошибкой «The model service connection was interrupted», и без такого различения эти модели получили бы нули за чужую вину.
Судья. По умолчанию используется Claude Opus 5.5 на среднем усилии, запасной Sol 5.6. Судью из одной семьи с переводчиком бенчмарк вычёркивает: к своим калькам модель слепа, и поэтому модели Anthropic судит Sol. Sonnet 5 в роли судьи я тоже проверил: на одних и тех же переводах он расходится с Opus в 4–7 точках из ста, причём систематически прощает смягчённую брань, и не дешевле. Поэтому выбран Opus.
Как штрафы перевернули рейтинг, и почему их пришлось калиброватьПервая версия ключа штрафовала мелкую отсебятину на три очка, при том что ловушка стоила одно. На codex-моделях это дало контринтуитивный результат: дешёвая Luna обошла Terra и Sol. Разбор вердиктов показал, что по ловушкам порядок был обратный: Sol прошёл 90 точек из ста, Terra 89, Luna 85. Luna провалила пол врача во всех трёх точках, перевела «too lovely for anything» буквально и спутала fair shot с «честным». Но у Luna не было ни одного штрафа, а у Sol три «отсебятины» на девять очков: «богатый, румяный» за одно flush, «из десяти мишеней» вместо «из десяти».
Поэтому пришлось сделать в следующей версии ключа дешевле штрафы за мелкую отсебятину (1 очко, крупная 3). После этого codex-модели встали в ожидаемый порядок с разрывами 4–8 баллов.
Бенчмарк входит в BookTrans начиная с версии 1.10.77. Книга не нужна, текст в пакете. Нужны только язык перевода и переводчик:
uv tool install booktrans # или: pipx install booktrans
booktrans --bench --to ru --translator codex:gpt-6-astra:medium
Модель называется так же, как в любом другом ключе конвейера: агент, модель, усилие через двоеточие. Западные модели идут через их родные CLI (claude, codex, agy), китайские через любую точку протокола OpenAI. Я брал роутер byNara, у которого есть все интересующие меня китайские модели и бесплатный план, и подписку OpenCode Go с Kimi, MiniMax и Qwen; адрес точки и ключ кладутся в переменные окружения или в файлы папки настроек:
export OPENAI_BASE_URL=https://router.bynara.id/v1
export OPENAI_API_KEY=sk-…
booktrans --bench --to ru --translator openai:deepseek-v4.1-flash:medium
Через несколько минут в текущей папке появляется рабочая папка benchmark-en-ru-<провайдер-модель-усилие>-<дата>.work с тремя переводами внутри (их стоит прочитать глазами) и отчёт рядом. Первая строка отчёта — среднее, дальше таблица прогонов, области, проваленные точки с причинами и цитатами из перевода, штрафы, стоимость, время и готовая строка для таблицы результатов. Судью можно сменить ключом --judge, число прогонов ключом --bench-runs, свой набор текст+ключ подставляется через --bench ПАПКА. Подробности в docs/bench/README.md.
Отдельный интерес — модели, которые можно запустить у себя: 20–40 млрд параметров, видеокарта на 24 ГБ или Mac с 32 ГБ памяти. Из таких я пробовал Qwen 3.8 27B, но через роутер её измерить не удалось (об этом ниже), а локально проверить можно любую. llama.cpp, Ollama, LM Studio и vLLM отвечают по тому же протоколу OpenAI, что и роутеры, так что локальный сервер подключается как ещё одна точка:
export OPENAI_BASE_URL=http://localhost:11434/v1 # Ollama
export OPENAI_API_KEY=local
booktrans --bench --to ru --translator openai:qwen3.8:27b:medium
Переводит локальная модель, судит удалённая: судья по умолчанию, Opus 5.5, ходит через свой CLI и к локальному адресу отношения не имеет. Одно ограничение: адрес точки протокола OpenAI у запуска один. Если судью тоже брать через роутер (--judge openai:…), запрос уйдёт на локальный сервер. Тогда переводы делаются отдельно, с ключом --judge none, а судятся потом тем же запуском с адресом роутера и -w в ту же рабочую папку — готовые переводы второй раз не делаются.
Двоеточие в имени модели у Ollama разбору не мешает: первое слово — агент, последнее — усилие, всё между ними — модель. Одно условие: окно контекста сервера должно быть не меньше 64 тыс. токенов (у Ollama — OLLAMA_CONTEXT_LENGTH=65536, у llama.cpp — -c 65536). Промпт с куском занимает около 20 тыс., и ещё столько же уходит на перевод с рассуждениями; с окном по умолчанию модель оборвётся на середине, и бенчмарк запишет ей срыв, хотя виновата настройка.
Все модели переводили на среднем усилии, кроме Gemini 3.1 Pro: у неё среднего нет, только высокое и низкое. Балл — среднее трёх прогонов, в скобках разброс.
Детали о числе прогоновУ обеих Kimi — было 5 прогонов: я добавил два прогона, чтобы проверить странный результат, где K2.7 Code обошла K3; у Omen Alpha — двух: третий так и не удался из-за сбоев поставщика; у MiMo 2.5 Pro результаты показаны у единственного перевода — два других прогона дали ноль за отказ модели переводить.
Время и цена указаны за один прогон, то есть за 3100 слов. Цену показывает только Claude Code; codex и agy работают по подписке, китайские модели шли через бесплатный план роутера byNara, а Kimi, Hy4, MiniMax, MiMo, Qwen 3.7 Max, Qwen 3.8 Max, GLM 5.3 Flash, LongCat и Omen Alpha — через подписку OpenCode Go.
Модель | Балл | Разброс | Точность /15 | Кальки /11 | Стихи /8 | Пол /8 | Время, мин |
|---|---|---|---|---|---|---|---|
GPT-6 Astra | 90 | 88–92 | 14 | 8 | 6 | 8 | 4 |
Gemini 3.8 Flash | 88 | 82–91 | 15 | 10 | 8 | 8 | 2 |
GPT-5.6 Sol | 86,7 | 85–89 | 12 | 9 | 6 | 7 | 4,5 |
GLM 5.3 | 84 | 78–88 | 14 | 11 | 7 | 7 | 17 |
Muse Spark 1.3 | 84 | 80–87 | 14 | 9 | 6 | 7 | 3 |
Gemini 3.1 Pro (high) | 83 | 81–85 | 12 | 9 | 7 | 7 | 3,5 |
Muse Spark 1.3 Contributor | 82,7 | 82–83 | 13 | 9 | 6 | 6 | 4 |
DeepSeek V4 Flash | 82,3 | 78–88 | 13 | 8 | 7 | 7 | 3 |
Gemini 3.7 Flash | 82 | 79–86 | 15 | 9 | 6 | 7 | 2,5 |
GPT-6 Sol | 81,7 | 79–85 | 13 | 8 | 5 | 7 | 2,5 |
Claude Fable 5.1 | 79 | 77–82 | 9 | 10 | 6 | 5 | 6,5 |
Kimi K2.7 Code | 78,6 | 68–86 | 13 | 5 | 6 | 8 | 11–17 |
Hy4 Preview | 78,3 | 74–81 | 13 | 7 | 6 | 5 | 10 |
DeepSeek V4.1 Flash | 78,3 | 71–85 | 13 | 7 | 5 | 7 | 21 |
GPT-5.6 Terra | 78,3 | 76–81 | 12 | 6 | 4 | 7 | 2,5 |
Claude Opus 5.5 | 78,3 | 76–81 | 9 | 9 | 6 | 5 | 2,5 |
DeepSeek V4 Pro | 77,7 | 75–79 | 13 | 2 | 4 | 6 | 17 |
Claude Opus 5 | 76,7 | 71–81 | 11 | 6 | 4 | 7 | 4,5 |
Claude Opus 4.8 | 75,7 | 74–78 | 11 | 8 | 5 | 5 | 9 |
GPT-6 Luna | 73,7 | 73–74 | 13 | 7 | 3 | 4 | 2,5 |
GPT-5.6 Luna | 72,7 | 72–74 | 12 | 6 | 4 | 5 | 2,5 |
MiniMax M3 | 72,3 | 66–78 | 13 | 6 | 5 | 7 | 7–21 |
Qwen 3.7 Max | 69,3 | 68–70 | 12 | 4 | 4 | 5 | 3,5 |
MiMo 2.6 Pro | 68,7 | 66–72 | 11 | 8 | 5 | 7 | 34–68 |
Claude Sonnet 5 | 68,7 | 62–77 | 9 | 6 | 4 | 4 | 4,5 |
Kimi K3 | 68,2 | 41–79 | 12 | 7 | 5 | 5 | 2–34 |
Qwen 3.8 Max | 68 | 67–69 | 10 | 5 | 5 | 4 | 5 |
Qwen 3.8 Flash | 66 | 63–71 | 15 | 4 | 4 | 6 | 6 |
Omen Alpha | 66 | 65–67 | 12 | 4 | 6 | 5 | 31–33 |
Step 5 Preview | 64,7 | 57–70 | 13 | 2 | 5 | 4 | 7–25 |
LongCat 2.0 | 60,7 | 55–66 | 13 | 8 | 3 | 5 | 6–80 |
Claude Haiku 4.5 | 54,3 | 52–56 | 14 | 4 | 6 | 5 | 4 |
GLM 5.3 Flash | 50 | 0–77 | 12 | 7 | 5 | 4 | 2,5–3,5 |
MiMo 2.6 Flash | 48 | 45–50 | 11 | 6 | 2 | 5 | 11–32 |
MiMo 2.5 Pro | 22 | 0–66 | 10 | 3 | 5 | 5 | 39 |
Западные модели, DeepSeek V4.1 Flash, V4 Pro и обе Muse судил Opus 5.5, модели Anthropic — Sol 5.6: судья своей семьи вычёркивается. Когда лимиты подписок на Opus 5.5 и Sol кончились раньше очереди моделей — на прогон уходит около 30 тыс. токенов судьи, — GLM 5.3, Kimi K3 и третий прогон Haiku судил Opus 4.6 через agy, а Kimi K2.7 Code, Hy4, Qwen 3.8 Flash и DeepSeek V4 Flash — Opus 5 через роутер byNara. Qwen 3.7 Max, LongCat, MiniMax M3, MiMo, Qwen 3.8 Max, GLM 5.3 Flash, Step 5 Preview и Omen Alpha достались снова Sol, когда его лимиты вернулись.

Рейтинг моделей в бенчмарке перевода
Что проваливают всеСто ловушек дают не только рейтинг, но и портрет общих слабостей. Вот точки, которые проваливают почти все модели, по 44 прогонам пятнадцати моделей:
Ловушка | Провалов |
|---|---|
«Jesus, Leigh, you look like hell» — грубость «like hell» стёрта до «ужасно выглядишь» или «на тебе лица нет» | 44 из 44 |
эхо корня crumpled / crumples («сжалась» и «заломы» вместо одного корня) | 43 |
«Are you okay?» → «Ты в порядке?» | 37 |
многоточие тремя точками ASCII вместо знака «…» | 37 |
«Shit» у героини, которая никогда не ругалась, смягчено до «Чёрт» | 36 |
«I look green» переведено как цвет, а не как неопытность | 34 |
«a fair shot» → «честный выстрел» | 33 |
«forty-five, fat, flush and foolish» без ритма и аллитерации | 31 |
каламбур «higher and lower» (этажом выше, ценой ниже) сведён к «повыше и подешевле» | 32 |
«Gamma? I’d have given it an alpha» — греческая буква не читается как оценка | 30 |
сделка с агентством перевёрнута: кто кого купил | 25 |
футы, дюймы и мили не пересчитаны | 27 |
пол врача, раскрытый через шесть абзацев, угадан как мужской | 25 |
Список поучительный. Половина строк — это привычки LLM: смягчать брань, ставить три точки, переводить кальками «ты в порядке». Их можно закрыть промптом. Другая половина — это проверка понимания: перепутанный продавец и покупатель в сделке, «честный выстрел», зелёный цвет вместо неопытности и мужской род врача отличают модели, которые дочитали текст, от тех, которые переводили последовательно абзац за абзацем.
Игра слов не даётся никому. «Higher and lower» в оригинале — это одновременно этаж выше и цена ниже, и русский эквивалент с обоими смыслами нашёлся только в 12 прогонах из 44. Каламбур с гаммой и альфой держится на том, что в американской школе оценки ставят буквами; по-русски «поставил бы ей альфу» не читается, и честнее было бы «пятёрку», как сделали в 14 прогонах из 44.
Трудности при создании бенчмаркаПредел выводаПервые прогоны китайских моделей через роутер обрывались на середине рассказа. Причина нашлась в счётчике токенов: роутер без явного указания обрезал ответ на 16 тыс. токенов вывода, а рассуждающая модель тратит их значительно больше. Теперь BookTrans всегда задаёт предел явно, 65 536 токенов. Это вытянуло целую группу моделей: DeepSeek V4.1 Flash тратит на рассказ 38–50 тыс. токенов вывода, DeepSeek V4 Pro — 30–36 тыс., GLM 5.3 — 25–33 тыс., Kimi K3 и MiniMax M3 — до 60 тыс. Со старым пределом ни одна из них не доводит перевод до конца. Но учитывают явный предел не все роутеры: byNara для Qwen 3.8 27B режет ответ на 32 768 токенах, сколько ни проси, а модель тратит их все на рассуждения и на перевод ей не хватает. Поэтому её оценить не удалось.
Судья, который не видит смыслаКогда кончились лимиты на Opus и Sol, я попробовал судить через Gemini 3.8 Flash и Gemini 3.1 Pro и сперва проверил их на уже оценённых переводах. По итоговому баллу они почти совпали с Opus, но совпадение оказалось случайным: на одних точках Gemini строже, на других мягче. Перевёрнутую сделку с агентством («её агентство купило крупное» вместо «крупное купило её агентство») Opus и Sol поймали в семи переводах из девяти, а оба Gemini во всех семи её засчитали. Судья, который пропускает переворот смысла, не годится для бенчмарка, и обе модели Gemini в судьи не попали.
Что ещё не сделаноПеревод откровенных сцен — отдельная грань, и этот бенчмарк её почти не трогает. В рассказе брань средней крепости и обнажённая натура без секса, а на всё это приходится четыре точки из ста. Но даже здесь модели дружно смягчают: «you look like hell» стёрли все 44 прогона, «Shit» у героини, которая никогда не ругалась, превратился в «Чёрт» в 36. Для книг, где мат, насилие и постельные сцены — часть авторского замысла, нужен отдельный бенчмарк с текстом пожёстче: переводит ли модель такое вообще, не выбрасывает ли куски и не подменяет ли грубое приличным.
Результаты там могут заметно разойтись с этим рейтингом. Gemini по моему опыту работы с конвейером цензурирует охотнее других, а Opus, Sol и, скорее всего, Astra с откровенным текстом справляются без отказов. Проверить это цифрами — следующая задача.
ВыводыЛучший перевод сегодня дают GPT-6 Astra и Gemini 3.8 Flash. Astra впереди на два балла, потому что переводит качественнно и ровно: её три прогона легли в 88–92, а у Flash один просел до 82. Зато Flash вдвое быстрее и при этом сильно дешевле. Хвала Google!
Разочаровал и GPT-6 Sol. Шестая версия набрала 81,7 — на пять баллов меньше прежней GPT-5.6 Sol (86,7), и ни один из трёх её прогонов не дотянул до худшего прогона пятой. GPT-6 Luna с 73,7 осталась на уровне GPT-5.6 Luna. По итогу в шестом поколении OpenAI переводом блистает только Astra.
Claude 5 несколько разочаровал. Opus 5, Opus 5.5 и Fable 5.1 набрали 76,7, 78,3 и 79 — разница меньше разброса: Opus 5.5 не дал заметного прироста по сравнению с Opus 5. Предыдущий Opus 4.8 набрал 75,7: за три поколения Opus по переводу сдвинулся всего на 2,6 балла. У Opus 5.5 и Fable провалы одни и те же: точность смысла 9 из 15 и определение пола персонажей 5 из 8. При этом калек у них немного: 8,7 из 11 в среднем. Больше всего разочаровал Fable: это суперфлагман Anthropic, он стоит вчетверо дороже Opus 5.5 и ничего за эти деньги в перевод не добавляет. Если сравнивать суперфлагманов, GPT-6 Astra переводит заметно лучше: 90 против 79. Если уж брать что-то из Claude, то я выбираю Opus 5.5.
Теперь про китайские модели и деньги. Лучшие из них оказались сильнее, чем я ожидал. GLM 5.3 набрала 84, на 2,7 балла меньше Sol 5.6, DeepSeek V4 Flash — 82,3: обе выше всех флагманов Claude.
Muse Spark от Meta в роутере byNara есть в двух вариантах, обычном и contributor, и в личке спросили, одинаково ли они переводят. Я прогнал обе: 84 у обычной и 82,7 у Contributor. Разница меньше разброса, так что по переводу это одна модель; contributor разве что ровнее, её три прогона легли в 82–83 против 80–87.
Kimi K2.7 Code и Hy4 с 78,6 и 78,3 встали вровень с Opus 5.5.
Модель для программирования Kimi K2.7 Code в первых трёх прогонах набрала 82–86 и обошла флагманскую Kimi K3. Это выглядело странно, и я дал обеим ещё по два прогона. K2.7 Code получила в них 68 и 73, K3 — 70 и 73. По пяти прогонам K2.7 Code всё равно впереди, 78,6 против 68,2, даёт ответ в требуемом формате с первой попытки.
У GLM 5.3 кальки ни одной, 11 из 11, и точность смысла 14 из 15. Но каждый из трёх прогонов попал в формат ответа только со второй попытки, а один упал до 78. Kimi K3 — самая нестабильная модель в таблице: пять прогонов от 41 до 79, в двух она уложилась в формат только с четвёртой попытки, а в одном из них вдобавок оставила отсебятину в двенадцати местах.
DeepSeek V4.1 Flash и V4 Pro, 78,3 и 77,7, это на уровне Opus. V4.1 Flash нестабилен: три перевода одного текста легли от 71 до 85, и на целой книге это значит, что перевод части глав выйдет хуже остальных. V4 Pro ровнее, но часто переводит кальками. И обе модели долго думают: 14-17 минут против 2-4 у западных моделей. Возможно, это специфика роутера.
Остальные китайские модели переводят от «отвратительно» до «средне»Китайцы бывают разные. MiniMax M3 набрала 72,3, Qwen 3.7 Max — 69,3, Qwen 3.8 Flash — 66, обе Qwen переводят кальками: 4 очка из 11. Step 5 Preview набрала 64,7 и переводит кальками больше всех в таблице, 2 очка из 11, наравне с DeepSeek V4 Pro. LongCat 2.0 с 60,7 — ниже Sonnet. Флагман Qwen 3.8 Max набрал 68 — не лучше Qwen 3.7 Max, а MiMo 2.6 Pro — 68,7, и ни один её прогон не прошёл с первой попытки. Среди моделей, которые доводят перевод до конца каждый раз, хуже всех MiMo 2.6 Flash: 48, ниже Haiku, и стихи у неё — 2 очка из 8. GLM 5.3 Flash перевела два прогона на 73 и 77, но в третьем сорвалась: пять попыток подряд ломала формат сносок и не выдала перевода вовсе. По правилу срыва это ноль, и в среднем у неё 50 — модель, которая раз из трёх не справляется, в книге оставит дыру. Последнее место у MiMo 2.5 Pro: из трёх прогонов она довела до конца один (66), а в двух других все пять попыток обрывала ответ сразу после эпиграфа или упиралась в предел вывода — два нуля и 22 в среднем. Разброс китайских моделей, от 22 до 84, куда шире, чем у западных.
Анонимная Omen Alpha из OpenCode, похожая на неанонсированную новинку, надежд не оправдала: 66. В формат ответа она попадала только с четвёртой и пятой попытки, и штраф за повторы съел у неё 9–12 баллов.
Для чистового перевода лучшие результаты по-прежнему у Astra и Gemini 3.8 Flash. Но если выбирать между Claude и лучшими китайцами, выигрывают китайцы: GLM 5.3 и DeepSeek V4 Flash набрали больше Opus и Fable, а Kimi K2.7 Code и Hy4 — столько же.
Самая сбалансированная по качеству и цене — Gemini 3.8 Flash.
Требуется помощьВ рейтинге нет отечественных моделей: ни YandexGPT, ни GigaChat, ни других. Ни в одном из роутеров, через которые я работал, их нет, а своих ключей к ним у меня нет. Если у вас есть доступ и вы готовы поделиться ключом на время замера, напишите мне в личные сообщения на Хабре или в Телеграм — он есть в профиле. Один прогон модели — это три перевода рассказа в 3100 слов, так что расход токенов будет скромным. Результаты попадут в таблицу в репозитории и в эту статью. Или в следующую.
Нужна помощь и с моделями, которые есть в роутерах, но измерить их не удалось: Grok 4.7, Qwen 3.8 27B, MiniMax M2.7, Nemotron 3 Ultra, Kimi K2.8 Preview.
То же касается любой модели, которой нет в этой статье, но баллы которой вам интересны. Пришлите ключ или адрес точки доступа, совместимой с протоколом OpenAI, — прогоню её и опубликую результат. А если модель у вас локальная, запустите бенчмарк сами, как описано выше, и поделитесь результатом в комментариях.
Полные материалыТаблица результатов с разбивкой по областям ведётся в репозитории: docs/bench/results-en-ru.md.
БлагодарностиСпасибо хабра-пользователю @praver за ключи доступа к роутерам: без них китайской части рейтинга не было бы.
© 2026 ООО «МТ ФИНАНС»
Если эта публикация вас вдохновила и вы хотите поддержать автора — не стесняйтесь нажать на кнопку