Как квантование ломает function-calling у LLM? Собрал бенчмарк QuantCall, протестировав модели на 4 ГБ VRAM. Главный инсайт: устойчивость к квантам зависит не от размера, а от семейства. Меньшая Qwen3-0.6B стабильно генерирует валидный JSON даже на Q4, а более крупная Llama-3.2-1B деградирует уже на Q8, путая типы данных. Также GBNF-грамматики не спасают от ошибок, но заметно замедляют инференс. Читать далее
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Qwen 3.6 27b на 8-12gb vram в llama.cpp до 256к контекста | 0 | 20.06 | 16-07-2026 |
| 2 | Открытые LLM в продакшене: 8 выводов о llama.cpp, Gemma и Qwen | 0 | 7 | 14-07-2026 |
| 3 | Как оптимизировать инференс LLM: кеширование, время ответа и GPU-ресурсы | 0 | 11.5 | 08-07-2026 |
| 4 | Я устал писать одноразовые скрипты для бенчмарков LLM и собрал харнесс, который сам считает Pareto-front | 0 | 7 | 27-06-2026 |
| 5 | vLLM vs LMDeploy vs Triton: обзор бэкендов для инференса LLM | 0 | 7 | 18-07-2026 |
| 6 | LLM не научились врать. Они научились говорить | -1 | 8.15 | 09-08-2026 |
| 7 | А мы и не заметили, или о том, какие ИИ живут в вашем кармане | 0 | 5 | 17-07-2026 |
| 8 | [Перевод] Как на самом деле работают LLM | 0 | 7 | 07-07-2026 |
| 9 | Как я смог запустить 32b модель и сделать ее умнее в два раза на 3050 | 0 | 5.95 | 29-07-2026 |
| 10 | Локальная Gemma 4 на MacBook читает графики и таблицы — и врёт красивее, чем говорит правду | 0 | 9.93 | 08-06-2026 |