Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Бенчмарк качества англо-русского перевода для ведущих западных и китайских LLM

Дата публикации: 23-09-2026 13:01:26

Сто ловушек в одном рассказе, LLM-судья с ключом ответов и баллы, которые считает код. Так устроен бенчмарк художественного перевода, который теперь встроен в опенсурсный конвейер BookTrans. В статье — зачем он понадобился, и как на нём выступили флагманы Anthropic, OpenAI и Google против китайских моделей. И ответ на главный вопрос: можно ли сэкономить, используя китайские модели, не потеряв в качестве. Читать далее

Основное содержимое страницы с новостью.

Бенчмарк качества англо-русского перевода для ведущих западных и китайских LLM

Бенчмарк качества англо-русского перевода для ведущих западных и китайских LLM

TL;DR: лучший англо-русский художественный перевод сегодня дают GPT-6 Astra (90 из 100) и Gemini 3.8 Flash (88). Лучшие китайские модели оказались сильнее, чем я ожидал: GLM 5.3 набрала 84, DeepSeek V4 Flash — 82,3, обе выше флагманов Claude (Fable 5.1 — 79, Opus 5.5 — 78,3), а Kimi K2.7 Code и Hy4 встали с ними вровень. Что очень круто. Так что их можно использовать для работы, если достаточно среднего качества. С другой стороны Gemini 3.8 Flash настолько дешева, что в экономии не вижу смысла. Полно и слабых китайцев: MiniMax M3, Qwen, MiMo, Step 5 и LongCat набрали от 22 до 72. Подробности — в рейтинге.

Месяц назад я сравнивал здесь Opus 5, Sol 5.6 и Gemini (Flash и Pro) в художественном переводе и редактуре. Метод был таков: одна модель переводила главу, а заведомо крутая LLM (Sol или Opus) её редактировала. Мерой качества перевода служило число правок модели-редактора. Чем меньше правок — тем лучше перевод. Метод оказался вполне рабочим. Но по итогу у меня накопились претензии к нему. Он не был достаточно чётким, пользователи в комментариях писали, что нужен нормальный, легко воспроизводимый бенчмарк. Я его сделал, теперь он встроен в конвейер BookTrans.

Почему счёт правок перестал устраивать

Число правок редактора кажется объективной мерой, с которым легко работать. Это ведь просто число. Но у этого метода есть куча недостатков.

  • Вкусовщина судьи. Sol правит вдвое больше абзацев, чем Opus, но это вкусовщина («на вкус и цвет товарищей нет»), а не смысл. Сравнивать переводы можно было, только если у них один судья. Это неудобно.

  • Редактор льстит осторожному переводчику. Редактор не видит оригинала (по соглашениям конвейера), поэтому гладкий перевод, который выбросил метафоры и упростил предложения, получает меньше правок, чем смелый и точный.

  • Без ручного чтения числа ничего не значат. Всякий раз приходилось читать четыре перевода параллельно с оригиналом, и главные косяки находило чтение.

Бенчмарк должен был убрать эти и другие изъяны и при этом измерять качество перевода в реальном пайплайне, с его промптами и требуемыми форматами ответа.

Как устроен бенчмарк

Идея взята из индустриального стандарта оценки переводов MQM, где качество описывают разметкой ошибок по категориям, а также из практики школьных экзаменов: у проверяющего есть ключ с ответами. LLM-судья получает список контрольных точек, где в тексте поставлена ловушка и что считается верным, и по каждой отвечает «пройдена» или «провалена». Он отвечает в специальном формализованном формате, далее итоговый балл считает программа.

Текст. За основу взят рассказ О. Генри «The Skylight Room» 1906 года, права на него давно истекли. Рассказ основательно переделан: действие перенесено в наши дни, устаревшие обороты заменены, имена и название другие, финал переписан. Сюжет сохранён, это цельная история на 66 абзацев и четверостишие в эпиграфе, около 3100 слов, как раз один стандартный кусок для конвейера. В текст посажено сто ловушек по двенадцати областям, каждая стоит одно очко, так что итог читается как процент.

Область

Очков

Что проверяется

Точность смысла

15

Ложные друзья, значение многозначного слова по контексту, цифры, кто кому что продал

Полнота

9

Выброшенные предложения, придаточные, эпитеты в перечислениях

Отсутствие калек

11

«Ты в порядке?», «это не о том…», «имеет смысл», избыток притяжательных

Словарь и идиомы

9

Редкие книжные слова, астрономические и медицинские термины, идиомы по смыслу

Образность и стиль

11

Метафоры сохранены, регистры речи персонажей различимы

Стихи и игра слов

8

Четверостишие размером и рифмой, три каламбура

Согласованность

8

Повторяющаяся реплика, имена и термин одинаковы по всему тексту; три значения слова fair разведены

Пол и обращения

8

Пол врача, раскрытый через шесть абзацев после первой реплики; звезда с мужским именем; ты/вы постоянны

Имена и клички

7

Транслитерация по звучанию: Cholmondeley, Siobhan, Leigh, Beauchamp, Worcester; клички по смыслу

Норма языка

6

Оформление диалога, многоточия, пересчёт футов и миль, курсив

Сноски

4

Есть к мифологии и реалиям, нет к очевидному

Регистр и откровенность

4

Ругательства не смягчены, телесные детали не выброшены

Несколько ловушек в подробностях, чтобы было понятно, о чём речь

Врач скорой помощи шесть абзацев подряд упоминается без указания пола, а потом оказывается женщиной. В английском это ничего не стоит — в русском переводчик обязан выбрать род глаголов заранее, и модель, не дочитавшая текст до конца, пишет «сказал доктор Морган». Это три точки из ста, и первую из них проваливает больше половины прогонов, включая флагманов.

Слово fair встречается трижды: a fair shot в тире (меткий, засчитанный выстрел), the street fair (уличная ярмарка) и a fair complexion (светлая кожа). «Честный выстрел» пишут три модели из четырёх.

Мисс Вустер говорит «Well, really!» пять раз, и это её характеристика. Переводчик, который пять раз переводит по-разному, эту характеристику стирает.

Фамилия Beauchamp по-английски читается «Бичем», а модели в двух случаях из пяти пишут «Бошан», по-французски. Cholmondeley — это «Чамли», и примерно треть переводов даёт «Чолмонделей» по буквам. Зато ирландскую Siobhan почти все знают как «Шивон».

Ключ. К тексту прилагаются правильные ответы для судьи: сто строк вида «точка, область, адрес абзаца, что считается верным». Ключ написан по-английски и не зависит от языка перевода, поэтому тот же бенчмарк годится для тестирования перевода с английского на любой целевой язык, примеры для русского судья переносит на другой язык по смыслу. Переводчик ключа не видит.

Текст и ключ лежат в пакете одним сжатым двоичным файлом, src/booktrans/bench/en.bin. Репозиторий публичный, а открытый ключ ответов рано или поздно попал бы в обучающую выборку тех моделей, которые занимаются переводом, и они выучили бы правильные ответы. Ни документация, ни тесты не цитируют текст для перевода, используемый в бенчмарке. По той же причине я не выкладываю его и здесь, под спойлером: статьи на Хабре тоже идут в обучающие выборки.

Штрафы. Сверх ключа судья отмечает отсебятину (факт, действие или оценка, которых нет в оригинале) и непереведённые фрагменты, а код без участия судьи считает потерянные абзацы, разошедшуюся разметку, буквы чужой письменности (иероглифы в русском тексте) и лишние попытки. Про попытки отдельно: когда модель отвечает не по форме, конвейер переспрашивает с подсказкой, до пяти раз. Без штрафа модель, попавшая в формат с третьего захода, получала бы тот же балл, что и попавшая с первого, хотя стоит втрое дороже по времени и деньгам.

Счёт. Балл области равен числу пройденных точек, итог равен сумме областей минус штрафы, нормированный к ста. Никакой «оценки от 0 до 100» судья не выставляет, и это принципиально: свободная оценка плавает между запусками на десятки баллов, а ответ «да/нет» по конкретному требованию воспроизводится. Тот же перевод, отданный судье второй раз, дал 82 и 83 балла с расхождением в одной точке из ста.

Три прогона. Один перевод модели не ранжирует. У средних моделей два перевода одного текста расходятся на 10–20 баллов, у сильных на 3–7. Поэтому по умолчанию текст переводится и судится три раза, прогоны идут одновременно, в отчёт попадают среднее и разброс.

Среднее, а не медиана, и это сознательный выбор. Медиана трёх прогонов выбрасывает худший целиком, а книга из тридцати кусков выйдет средней по качеству, и каждая провальная глава в ней останется. Модель, которая раз из трёх переводит на 41, по медиане выглядела бы ровной, а в книге эти главы будут. Медиана вдобавок обнулила бы правило срыва, о котором ниже: из прогонов 0, 78 и 80 она дала бы 78, а среднее даёт 52,7. Довод за медиану один — устойчивость к случайному выбросу, в том числе к ошибке судьи. Но судья здесь отвечает «да/нет» по ста точкам и повторяет себя с точностью до балла, так что выбросы — это модель, а не шум, и их надо считать.

Срыв модели и сбой роутера. Бывает, что перевода нет ни в одной из пяти попыток. Бенчмарк различает, кто виноват. Если сорвалась сама модель — зациклилась и упёрлась в предел вывода, обрывала ответ на одном и том же месте или раз за разом отвечала не по форме, — прогон засчитывается нулём: модель, которая срывается каждый третий раз, не должна выглядеть надёжной. Если хоть одну попытку сорвала связь — роутер уронил поток на полуслове, вернул ошибку сервиса или упёрся в лимит, — прогон в серию не идёт: модель тут ни при чём, и его просто переводят заново. Это не перестраховка: роутер byNara во время этого замера раз за разом обрывал ответы MiMo, Qwen и GLM ошибкой «The model service connection was interrupted», и без такого различения эти модели получили бы нули за чужую вину.

Судья. По умолчанию используется Claude Opus 5.5 на среднем усилии, запасной Sol 5.6. Судью из одной семьи с переводчиком бенчмарк вычёркивает: к своим калькам модель слепа, и поэтому модели Anthropic судит Sol. Sonnet 5 в роли судьи я тоже проверил: на одних и тех же переводах он расходится с Opus в 4–7 точках из ста, причём систематически прощает смягчённую брань, и не дешевле. Поэтому выбран Opus.

Как штрафы перевернули рейтинг, и почему их пришлось калибровать

Первая версия ключа штрафовала мелкую отсебятину на три очка, при том что ловушка стоила одно. На codex-моделях это дало контринтуитивный результат: дешёвая Luna обошла Terra и Sol. Разбор вердиктов показал, что по ловушкам порядок был обратный: Sol прошёл 90 точек из ста, Terra 89, Luna 85. Luna провалила пол врача во всех трёх точках, перевела «too lovely for anything» буквально и спутала fair shot с «честным». Но у Luna не было ни одного штрафа, а у Sol три «отсебятины» на девять очков: «богатый, румяный» за одно flush, «из десяти мишеней» вместо «из десяти».

Поэтому пришлось сделать в следующей версии ключа дешевле штрафы за мелкую отсебятину (1 очко, крупная 3). После этого codex-модели встали в ожидаемый порядок с разрывами 4–8 баллов.

Как запустить

Бенчмарк входит в BookTrans начиная с версии 1.10.77. Книга не нужна, текст в пакете. Нужны только язык перевода и переводчик:

uv tool install booktrans        # или: pipx install booktrans
booktrans --bench --to ru --translator codex:gpt-6-astra:medium

Модель называется так же, как в любом другом ключе конвейера: агент, модель, усилие через двоеточие. Западные модели идут через их родные CLI (claude, codex, agy), китайские через любую точку протокола OpenAI. Я брал роутер byNara, у которого есть все интересующие меня китайские модели и бесплатный план, и подписку OpenCode Go с Kimi, MiniMax и Qwen; адрес точки и ключ кладутся в переменные окружения или в файлы папки настроек:

export OPENAI_BASE_URL=https://router.bynara.id/v1
export OPENAI_API_KEY=sk-…
booktrans --bench --to ru --translator openai:deepseek-v4.1-flash:medium

Через несколько минут в текущей папке появляется рабочая папка benchmark-en-ru-<провайдер-модель-усилие>-<дата>.work с тремя переводами внутри (их стоит прочитать глазами) и отчёт рядом. Первая строка отчёта — среднее, дальше таблица прогонов, области, проваленные точки с причинами и цитатами из перевода, штрафы, стоимость, время и готовая строка для таблицы результатов. Судью можно сменить ключом --judge, число прогонов ключом --bench-runs, свой набор текст+ключ подставляется через --bench ПАПКА. Подробности в docs/bench/README.md.

Как оценить локальные модели

Отдельный интерес — модели, которые можно запустить у себя: 20–40 млрд параметров, видеокарта на 24 ГБ или Mac с 32 ГБ памяти. Из таких я пробовал Qwen 3.8 27B, но через роутер её измерить не удалось (об этом ниже), а локально проверить можно любую. llama.cpp, Ollama, LM Studio и vLLM отвечают по тому же протоколу OpenAI, что и роутеры, так что локальный сервер подключается как ещё одна точка:

export OPENAI_BASE_URL=http://localhost:11434/v1   # Ollama
export OPENAI_API_KEY=local
booktrans --bench --to ru --translator openai:qwen3.8:27b:medium

Переводит локальная модель, судит удалённая: судья по умолчанию, Opus 5.5, ходит через свой CLI и к локальному адресу отношения не имеет. Одно ограничение: адрес точки протокола OpenAI у запуска один. Если судью тоже брать через роутер (--judge openai:…), запрос уйдёт на локальный сервер. Тогда переводы делаются отдельно, с ключом --judge none, а судятся потом тем же запуском с адресом роутера и -w в ту же рабочую папку — готовые переводы второй раз не делаются.

Двоеточие в имени модели у Ollama разбору не мешает: первое слово — агент, последнее — усилие, всё между ними — модель. Одно условие: окно контекста сервера должно быть не меньше 64 тыс. токенов (у Ollama — OLLAMA_CONTEXT_LENGTH=65536, у llama.cpp — -c 65536). Промпт с куском занимает около 20 тыс., и ещё столько же уходит на перевод с рассуждениями; с окном по умолчанию модель оборвётся на середине, и бенчмарк запишет ей срыв, хотя виновата настройка.

Результаты

Все модели переводили на среднем усилии, кроме Gemini 3.1 Pro: у неё среднего нет, только высокое и низкое. Балл — среднее трёх прогонов, в скобках разброс.

Детали о числе прогонов

У обеих Kimi — было 5 прогонов: я добавил два прогона, чтобы проверить странный результат, где K2.7 Code обошла K3; у Omen Alpha — двух: третий так и не удался из-за сбоев поставщика; у MiMo 2.5 Pro результаты показаны у единственного перевода — два других прогона дали ноль за отказ модели переводить.

Время и цена указаны за один прогон, то есть за 3100 слов. Цену показывает только Claude Code; codex и agy работают по подписке, китайские модели шли через бесплатный план роутера byNara, а Kimi, Hy4, MiniMax, MiMo, Qwen 3.7 Max, Qwen 3.8 Max, GLM 5.3 Flash, LongCat и Omen Alpha — через подписку OpenCode Go.

Модель

Балл

Разброс

Точность /15

Кальки /11

Стихи /8

Пол /8

Время, мин

GPT-6 Astra

90

88–92

14

8

6

8

4

Gemini 3.8 Flash

88

82–91

15

10

8

8

2

GPT-5.6 Sol

86,7

85–89

12

9

6

7

4,5

GLM 5.3

84

78–88

14

11

7

7

17

Muse Spark 1.3

84

80–87

14

9

6

7

3

Gemini 3.1 Pro (high)

83

81–85

12

9

7

7

3,5

Muse Spark 1.3 Contributor

82,7

82–83

13

9

6

6

4

DeepSeek V4 Flash

82,3

78–88

13

8

7

7

3

Gemini 3.7 Flash

82

79–86

15

9

6

7

2,5

GPT-6 Sol

81,7

79–85

13

8

5

7

2,5

Claude Fable 5.1

79

77–82

9

10

6

5

6,5

Kimi K2.7 Code

78,6

68–86

13

5

6

8

11–17

Hy4 Preview

78,3

74–81

13

7

6

5

10

DeepSeek V4.1 Flash

78,3

71–85

13

7

5

7

21

GPT-5.6 Terra

78,3

76–81

12

6

4

7

2,5

Claude Opus 5.5

78,3

76–81

9

9

6

5

2,5

DeepSeek V4 Pro

77,7

75–79

13

2

4

6

17

Claude Opus 5

76,7

71–81

11

6

4

7

4,5

Claude Opus 4.8

75,7

74–78

11

8

5

5

9

GPT-6 Luna

73,7

73–74

13

7

3

4

2,5

GPT-5.6 Luna

72,7

72–74

12

6

4

5

2,5

MiniMax M3

72,3

66–78

13

6

5

7

7–21

Qwen 3.7 Max

69,3

68–70

12

4

4

5

3,5

MiMo 2.6 Pro

68,7

66–72

11

8

5

7

34–68

Claude Sonnet 5

68,7

62–77

9

6

4

4

4,5

Kimi K3

68,2

41–79

12

7

5

5

2–34

Qwen 3.8 Max

68

67–69

10

5

5

4

5

Qwen 3.8 Flash

66

63–71

15

4

4

6

6

Omen Alpha

66

65–67

12

4

6

5

31–33

Step 5 Preview

64,7

57–70

13

2

5

4

7–25

LongCat 2.0

60,7

55–66

13

8

3

5

6–80

Claude Haiku 4.5

54,3

52–56

14

4

6

5

4

GLM 5.3 Flash

50

0–77

12

7

5

4

2,5–3,5

MiMo 2.6 Flash

48

45–50

11

6

2

5

11–32

MiMo 2.5 Pro

22

0–66

10

3

5

5

39

А судьи кто?

Западные модели, DeepSeek V4.1 Flash, V4 Pro и обе Muse судил Opus 5.5, модели Anthropic — Sol 5.6: судья своей семьи вычёркивается. Когда лимиты подписок на Opus 5.5 и Sol кончились раньше очереди моделей — на прогон уходит около 30 тыс. токенов судьи, — GLM 5.3, Kimi K3 и третий прогон Haiku судил Opus 4.6 через agy, а Kimi K2.7 Code, Hy4, Qwen 3.8 Flash и DeepSeek V4 Flash — Opus 5 через роутер byNara. Qwen 3.7 Max, LongCat, MiniMax M3, MiMo, Qwen 3.8 Max, GLM 5.3 Flash, Step 5 Preview и Omen Alpha достались снова Sol, когда его лимиты вернулись.

Рейтинг моделей в бенчмарке перевода

Рейтинг моделей в бенчмарке перевода

Что проваливают все

Сто ловушек дают не только рейтинг, но и портрет общих слабостей. Вот точки, которые проваливают почти все модели, по 44 прогонам пятнадцати моделей:

Ловушка

Провалов

«Jesus, Leigh, you look like hell» — грубость «like hell» стёрта до «ужасно выглядишь» или «на тебе лица нет»

44 из 44

эхо корня crumpled / crumples («сжалась» и «заломы» вместо одного корня)

43

«Are you okay?» → «Ты в порядке?»

37

многоточие тремя точками ASCII вместо знака «…»

37

«Shit» у героини, которая никогда не ругалась, смягчено до «Чёрт»

36

«I look green» переведено как цвет, а не как неопытность

34

«a fair shot» → «честный выстрел»

33

«forty-five, fat, flush and foolish» без ритма и аллитерации

31

каламбур «higher and lower» (этажом выше, ценой ниже) сведён к «повыше и подешевле»

32

«Gamma? I’d have given it an alpha» — греческая буква не читается как оценка

30

сделка с агентством перевёрнута: кто кого купил

25

футы, дюймы и мили не пересчитаны

27

пол врача, раскрытый через шесть абзацев, угадан как мужской

25

Список поучительный. Половина строк — это привычки LLM: смягчать брань, ставить три точки, переводить кальками «ты в порядке». Их можно закрыть промптом. Другая половина — это проверка понимания: перепутанный продавец и покупатель в сделке, «честный выстрел», зелёный цвет вместо неопытности и мужской род врача отличают модели, которые дочитали текст, от тех, которые переводили последовательно абзац за абзацем.

Игра слов не даётся никому. «Higher and lower» в оригинале — это одновременно этаж выше и цена ниже, и русский эквивалент с обоими смыслами нашёлся только в 12 прогонах из 44. Каламбур с гаммой и альфой держится на том, что в американской школе оценки ставят буквами; по-русски «поставил бы ей альфу» не читается, и честнее было бы «пятёрку», как сделали в 14 прогонах из 44.

Трудности при создании бенчмаркаПредел вывода

Первые прогоны китайских моделей через роутер обрывались на середине рассказа. Причина нашлась в счётчике токенов: роутер без явного указания обрезал ответ на 16 тыс. токенов вывода, а рассуждающая модель тратит их значительно больше. Теперь BookTrans всегда задаёт предел явно, 65 536 токенов. Это вытянуло целую группу моделей: DeepSeek V4.1 Flash тратит на рассказ 38–50 тыс. токенов вывода, DeepSeek V4 Pro — 30–36 тыс., GLM 5.3 — 25–33 тыс., Kimi K3 и MiniMax M3 — до 60 тыс. Со старым пределом ни одна из них не доводит перевод до конца. Но учитывают явный предел не все роутеры: byNara для Qwen 3.8 27B режет ответ на 32 768 токенах, сколько ни проси, а модель тратит их все на рассуждения и на перевод ей не хватает. Поэтому её оценить не удалось.

Судья, который не видит смысла

Когда кончились лимиты на Opus и Sol, я попробовал судить через Gemini 3.8 Flash и Gemini 3.1 Pro и сперва проверил их на уже оценённых переводах. По итоговому баллу они почти совпали с Opus, но совпадение оказалось случайным: на одних точках Gemini строже, на других мягче. Перевёрнутую сделку с агентством («её агентство купило крупное» вместо «крупное купило её агентство») Opus и Sol поймали в семи переводах из девяти, а оба Gemini во всех семи её засчитали. Судья, который пропускает переворот смысла, не годится для бенчмарка, и обе модели Gemini в судьи не попали.

Что ещё не сделано

Перевод откровенных сцен — отдельная грань, и этот бенчмарк её почти не трогает. В рассказе брань средней крепости и обнажённая натура без секса, а на всё это приходится четыре точки из ста. Но даже здесь модели дружно смягчают: «you look like hell» стёрли все 44 прогона, «Shit» у героини, которая никогда не ругалась, превратился в «Чёрт» в 36. Для книг, где мат, насилие и постельные сцены — часть авторского замысла, нужен отдельный бенчмарк с текстом пожёстче: переводит ли модель такое вообще, не выбрасывает ли куски и не подменяет ли грубое приличным.

Результаты там могут заметно разойтись с этим рейтингом. Gemini по моему опыту работы с конвейером цензурирует охотнее других, а Opus, Sol и, скорее всего, Astra с откровенным текстом справляются без отказов. Проверить это цифрами — следующая задача.

Выводы

Лучший перевод сегодня дают GPT-6 Astra и Gemini 3.8 Flash. Astra впереди на два балла, потому что переводит качественнно и ровно: её три прогона легли в 88–92, а у Flash один просел до 82. Зато Flash вдвое быстрее и при этом сильно дешевле. Хвала Google!

Разочаровал и GPT-6 Sol. Шестая версия набрала 81,7 — на пять баллов меньше прежней GPT-5.6 Sol (86,7), и ни один из трёх её прогонов не дотянул до худшего прогона пятой. GPT-6 Luna с 73,7 осталась на уровне GPT-5.6 Luna. По итогу в шестом поколении OpenAI переводом блистает только Astra.

Claude 5 несколько разочаровал. Opus 5, Opus 5.5 и Fable 5.1 набрали 76,7, 78,3 и 79 — разница меньше разброса: Opus 5.5 не дал заметного прироста по сравнению с Opus 5. Предыдущий Opus 4.8 набрал 75,7: за три поколения Opus по переводу сдвинулся всего на 2,6 балла. У Opus 5.5 и Fable провалы одни и те же: точность смысла 9 из 15 и определение пола персонажей 5 из 8. При этом калек у них немного: 8,7 из 11 в среднем. Больше всего разочаровал Fable: это суперфлагман Anthropic, он стоит вчетверо дороже Opus 5.5 и ничего за эти деньги в перевод не добавляет. Если сравнивать суперфлагманов, GPT-6 Astra переводит заметно лучше: 90 против 79. Если уж брать что-то из Claude, то я выбираю Opus 5.5.

Теперь про китайские модели и деньги. Лучшие из них оказались сильнее, чем я ожидал. GLM 5.3 набрала 84, на 2,7 балла меньше Sol 5.6, DeepSeek V4 Flash — 82,3: обе выше всех флагманов Claude.

Muse Spark от Meta в роутере byNara есть в двух вариантах, обычном и contributor, и в личке спросили, одинаково ли они переводят. Я прогнал обе: 84 у обычной и 82,7 у Contributor. Разница меньше разброса, так что по переводу это одна модель; contributor разве что ровнее, её три прогона легли в 82–83 против 80–87.

Kimi K2.7 Code и Hy4 с 78,6 и 78,3 встали вровень с Opus 5.5.

Модель для программирования Kimi K2.7 Code в первых трёх прогонах набрала 82–86 и обошла флагманскую Kimi K3. Это выглядело странно, и я дал обеим ещё по два прогона. K2.7 Code получила в них 68 и 73, K3 — 70 и 73. По пяти прогонам K2.7 Code всё равно впереди, 78,6 против 68,2, даёт ответ в требуемом формате с первой попытки.

У GLM 5.3 кальки ни одной, 11 из 11, и точность смысла 14 из 15. Но каждый из трёх прогонов попал в формат ответа только со второй попытки, а один упал до 78. Kimi K3 — самая нестабильная модель в таблице: пять прогонов от 41 до 79, в двух она уложилась в формат только с четвёртой попытки, а в одном из них вдобавок оставила отсебятину в двенадцати местах.

DeepSeek V4.1 Flash и V4 Pro, 78,3 и 77,7, это на уровне Opus. V4.1 Flash нестабилен: три перевода одного текста легли от 71 до 85, и на целой книге это значит, что перевод части глав выйдет хуже остальных. V4 Pro ровнее, но часто переводит кальками. И обе модели долго думают: 14-17 минут против 2-4 у западных моделей. Возможно, это специфика роутера.

Остальные китайские модели переводят от «отвратительно» до «средне»

Китайцы бывают разные. MiniMax M3 набрала 72,3, Qwen 3.7 Max — 69,3, Qwen 3.8 Flash — 66, обе Qwen переводят кальками: 4 очка из 11. Step 5 Preview набрала 64,7 и переводит кальками больше всех в таблице, 2 очка из 11, наравне с DeepSeek V4 Pro. LongCat 2.0 с 60,7 — ниже Sonnet. Флагман Qwen 3.8 Max набрал 68 — не лучше Qwen 3.7 Max, а MiMo 2.6 Pro — 68,7, и ни один её прогон не прошёл с первой попытки. Среди моделей, которые доводят перевод до конца каждый раз, хуже всех MiMo 2.6 Flash: 48, ниже Haiku, и стихи у неё — 2 очка из 8. GLM 5.3 Flash перевела два прогона на 73 и 77, но в третьем сорвалась: пять попыток подряд ломала формат сносок и не выдала перевода вовсе. По правилу срыва это ноль, и в среднем у неё 50 — модель, которая раз из трёх не справляется, в книге оставит дыру. Последнее место у MiMo 2.5 Pro: из трёх прогонов она довела до конца один (66), а в двух других все пять попыток обрывала ответ сразу после эпиграфа или упиралась в предел вывода — два нуля и 22 в среднем. Разброс китайских моделей, от 22 до 84, куда шире, чем у западных.

Анонимная Omen Alpha из OpenCode, похожая на неанонсированную новинку, надежд не оправдала: 66. В формат ответа она попадала только с четвёртой и пятой попытки, и штраф за повторы съел у неё 9–12 баллов.

Для чистового перевода лучшие результаты по-прежнему у Astra и Gemini 3.8 Flash. Но если выбирать между Claude и лучшими китайцами, выигрывают китайцы: GLM 5.3 и DeepSeek V4 Flash набрали больше Opus и Fable, а Kimi K2.7 Code и Hy4 — столько же.

Самая сбалансированная по качеству и цене — Gemini 3.8 Flash.

Требуется помощь

В рейтинге нет отечественных моделей: ни YandexGPT, ни GigaChat, ни других. Ни в одном из роутеров, через которые я работал, их нет, а своих ключей к ним у меня нет. Если у вас есть доступ и вы готовы поделиться ключом на время замера, напишите мне в личные сообщения на Хабре или в Телеграм — он есть в профиле. Один прогон модели — это три перевода рассказа в 3100 слов, так что расход токенов будет скромным. Результаты попадут в таблицу в репозитории и в эту статью. Или в следующую.

Нужна помощь и с моделями, которые есть в роутерах, но измерить их не удалось: Grok 4.7, Qwen 3.8 27B, MiniMax M2.7, Nemotron 3 Ultra, Kimi K2.8 Preview.

То же касается любой модели, которой нет в этой статье, но баллы которой вам интересны. Пришлите ключ или адрес точки доступа, совместимой с протоколом OpenAI, — прогоню её и опубликую результат. А если модель у вас локальная, запустите бенчмарк сами, как описано выше, и поделитесь результатом в комментариях.

Полные материалы

Таблица результатов с разбивкой по областям ведётся в репозитории: docs/bench/results-en-ru.md.

Благодарности

Спасибо хабра-пользователю @praver за ключи доступа к роутерам: без них китайской части рейтинга не было бы.

© 2026 ООО «МТ ФИНАНС»

Если эта публикация вас вдохновила и вы хотите поддержать автора — не стесняйтесь нажать на кнопку

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Как желание быстрее читать чужой код превратилось в войну с недетерминизмом LLM0528-06-2026
2Одна статья, 90 языковых версий и Google: как пет‑проект превратился в платформу09.9205-08-2026
3vLLM vs LMDeploy vs Triton: обзор бэкендов для инференса LLM0718-07-2026
4Книга: «LLM на практике. Большие языковые модели от идеи до внедрения»08.0118-08-2026
5Книга: «Анализ данных с LLM. Текст, таблицы, изображения и аудио»07.0323-06-2026
6Токены в ИИ и оптимизация промптов: как я сэкономила 50% бюджета и перестала здороваться с ChatGPT09.1906-08-2026
7Открытые LLM в продакшене: 8 выводов о llama.cpp, Gemma и Qwen0714-07-2026
8🤖 ИИ-переводчики: DeepL, ChatGPT и банка варенья Помните старую шутку ...08.5131-08-2026
9Почему нельзя просто загрузить историю с фитнес-браслета в LLM и попросить оценить здоровье08.3322-09-2026
10Бенчмарки врут? Бизнес мигрирует на открытые веса, а FDA и ФЗ заставляют уходить на свой инференс: ML-дайджест-110.8330-07-2026

Классификация: Мнения. Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 8.29. Источник: habr.com.