Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Маленькая модель на 0.6B держит квантование лучше, чем «крупная» на 1B: измерил деградацию function-calling на 4 ГБ VRAM

Дата публикации: 07-07-2026 14:38:15

Как квантование ломает function-calling у LLM? Собрал бенчмарк QuantCall, протестировав модели на 4 ГБ VRAM. Главный инсайт: устойчивость к квантам зависит не от размера, а от семейства. Меньшая Qwen3-0.6B стабильно генерирует валидный JSON даже на Q4, а более крупная Llama-3.2-1B деградирует уже на Q8, путая типы данных. Также GBNF-грамматики не спасают от ошибок, но заметно замедляют инференс. Читать далее

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Qwen 3.6 27b на 8-12gb vram в llama.cpp до 256к контекста020.0616-07-2026
2Открытые LLM в продакшене: 8 выводов о llama.cpp, Gemma и Qwen0714-07-2026
3Как оптимизировать инференс LLM: кеширование, время ответа и GPU-ресурсы011.508-07-2026
4Я устал писать одноразовые скрипты для бенчмарков LLM и собрал харнесс, который сам считает Pareto-front0727-06-2026
5vLLM vs LMDeploy vs Triton: обзор бэкендов для инференса LLM0718-07-2026
6LLM не научились врать. Они научились говорить-18.1509-08-2026
7А мы и не заметили, или о том, какие ИИ живут в вашем кармане0517-07-2026
8[Перевод] Как на самом деле работают LLM0707-07-2026
9Как я смог запустить 32b модель и сделать ее умнее в два раза на 305005.9529-07-2026
10Локальная Gemma 4 на MacBook читает графики и таблицы — и врёт красивее, чем говорит правду09.9308-06-2026

Классификация: Наука. Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 7. Источник: habr.com.