В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему. Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что, как мне кажется, не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что, а задумчивой ее никак не назовешь. Читать далее
В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему. Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что, как мне кажется, не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что а задумчивой она не кажется.
ЗагрузкаТак получилось, что я не использую GGUF файлы от Unsloth. Как-то давно я попробовал их GGUF и качество мне очень не понравилось, не знаю уж как они его готовят, но почему-то качество работы той старой модели было не очень (много галлюцинаций и повторов), поэтому я обычно конвертирую gguf самостоятельно (прошу не ругаться и тапками не кидаться).
Сообщение о том что модель доступна для скачивания пришло минут на 40 раньше чем я ожидал, ну окей, создал новую папку и загрузил веса.
hf download Qwen/Qwen3.8-27B --repo-type model --local-dir ./Qwen3.8-27B_official_sources_from_QwenДалее создал gguf файл:
pipenv run python convert_hf_to_gguf.py ~/models1/Qwen3.8-27B/Qwen3.8-27B_official_sources_from_Qwen/ --outfile ~/models1/Qwen3.8-27B/my_conversions/Qwen3.8-27B-F16.gguf --outtype f16Насколько я понимаю данная операция просто переупаковывает тензоры в один файл формата GGUF с точностью F16, GPU на этом этапе не используется и скорость зависит только от CPU и диска. В моем случае это заняло примерно 14 минут.
Я запускаю модель на старенькой 4090, поэтому следующим шагом идет квантование. Использую Q4_K_M, поэтому следующей командой, которую я запустил была:
llama-quantize Qwen3.8-27B-F16.gguf Qwen3.8-27B-Q4_K_M.gguf Q4_K_Mтут пришлось еще минут 5 подождать.
ЗапускИ вот модель готова к запуску! Я дрожащими руками настраиваю llama.cpp… Шучу конечно! Но мне действительно не терпелось запустить модель, поэтому я тупо скопировал файл настроек для 3.6 поменял обозначение модели на 3.8 и запустил как есть. Собственно вот настройки:
llama-server -m ~/models1/Qwen3.8-27B/my_conversions/Qwen3.8-27B-Q4_K_M.gguf \
-ngl 99 \
--port 8882 \
--temp 0.6 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.00 \
-t 6 \
-c 180000 \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--parallel 1 \
--flash-attn on \
--presence-penalty 0.52 \
--repeat-penalty 1.0 \
--repeat-last-n 206 \
--reasoning-budget 4096 \
--reasoning-budget-message "Let's move on to the final answer."
--cache-ram 32768 Ну и оно заработало! Без Overthinking, без галлюцинаций, практически идеально! За прошедшие 3 дня я прогнал модель почти по всем сценариям в которых я ее использую и со всеми скиллами, которые я написал за последние месяцы. Во всех случаях модель существенно превосходила 3.6.
Больше всего меня впечатлила работа модели в агентном режиме. У меня есть довольно длинный сценарий из 27 шагов, в ходе которого модель должна скачивать данные из интернета, заполнять таблицу в csv файле, использовать Python и статистические методы для анализа данных и по результатам формировать отчет. Qwen3.6 не справлялась с полным сценарием и обычно останавливалась после 8-12 шагов, пришлось разбить сценарий на фазы и запускать их по-очереди. Qwen3.8 справилась с полным сценарием и за 22 минуты корректно выполнила все 27 шагов с логгированием промежуточных результатов в markdown файл и построением финального отчета.
reasoning-budgetОтдельно нужно сказать про такой параметр как reasoning-budget. В Qwen3.6-27B я добавил этот параметр потому, что модель довольно долго думала. Значение параметра для 3.6 было 2048 с ним модель думала примерно 20-30 секунд до начала ответа, и мысли модели мне не очень нравились, она периодически зацикливалась и ее приходилось останавливать, пришлось даже добавить: --presence-penalty 0.52, --repeat-penalty 1.0, --repeat-last-n 206 (вы можете видеть эти параметры в моих настройках). Однако новая Qwen3.8-27B меня очень приятно удивила. Она начала отвечать сразу! Т.е. 3.6 даже на простой вопрос - сначала думала (да не так долго, но думала), а 3.8 ответила сразу, размышление 1 секунда. Поэтому в данный момент я увеличил лимит рассуждения до 4090 токенов (можно видеть в настройках llama.cpp) и честно сказать подумываю о том, чтобы увеличить его еще в 2 раза, или вообще убрать.
Я не претендую на то, что параметры запуска, которые я привел, единственно правильные, более того, они не совпадают с официально рекомендованными, и получились случайно (как я сказал - я скопировал настройки, которые использовал для 3.6) но для меня они работают очень хорошо. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что, как мне кажется, не совсем корректно), поэтому я решил поделиться настройками, которые работают, надеюсь они будут кому-нибудь полезны.
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить | 1 | 8.01 | 11-08-2026 |
| 2 | Alibaba представила обновленную большую языковую модель Qwen3.8-Max | 0 | 13.96 | 03-08-2026 |
| 3 | Qwen 3.6 27b на 8-12gb vram в llama.cpp до 256к контекста | 0 | 20.06 | 16-07-2026 |
| 4 | Alibaba releases Qwen3.8-Max, challenging GPT-5.6 Sol and Claude Fable 5 on AI benchmarks | 0 | 21.32 | 03-08-2026 |
| 5 | Погружаем модели в сказки русские, да рассказы древние – тестируем возможности Qwen и Whisper на дореволюционномъ | 0 | 7 | 24-06-2026 |
| 6 | 7 месяцев вайбкодинга: как в одиночку делать то, что раньше требовало команду | 0 | 9 | 01-08-2026 |
| 7 | Вышла ИИ-модель Alibaba Qwen3.8-Max с 2,4 трлн параметров. Скоро станет открытой | 0 | 18.55 | 03-08-2026 |
| 8 | Qwen3-Coder-Next: el modelo open source de Alibaba que apuesta por velocidad, contexto gigante y entrenamiento “agéntico” para programar mejor | 0 | 20.06 | 06-02-2026 |
| 9 | Мне надоело писать один и тот же код. Поэтому я сделал Featuregen | 3 | 6 | 09-07-2026 |