В 2022 году существовал ровно один способ сделать языковую модель «хорошей» — RLHF. Один. Если вы хотели, чтобы ваша LLM отвечала адекватно и хотя бы делала вид, что понимает вопрос, — вам нужны были армия аннотаторов и бюджет уровня OpenAI.Четыре года спустя у нас зоопарк из десятка методов выравнивания, половину из которых можно запустить на одной RTX 4090 за выходные. DPO убрал reward model. SimPO убрал reference model. GRPO и DeepSeek R1 доказали, что RL жив — но в новой форме. Anthropic опубликовала конституцию Claude на ~80 страниц в открытом доступе и сменила парадигму: от правил к причинам.
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | LLM-судье нельзя верить на слово: как построить надёжный гейт и проверить сами тесты | 0 | 12.53 | 28-07-2026 |
| 2 | Как дообучить LLM. Рассказываю шаг за шагом | 0 | 8.7 | 08-06-2026 |
| 3 | Как заставить LLM считать точно: генерация кода вместо генерации ответов | 0 | 11.55 | 28-03-2026 |
| 4 | Собственная облачная LLM на 16 ГБ VRAM — часть 1: базовая сборка, tools и MCP | -1 | 14.47 | 09-03-2026 |
| 5 | Anthropic пожаловалась сенаторам США на китайского конкурента — Alibaba незаконно вытащила миллионы ответов Claude, чтобы обучить на них свою модель | -3 | 7 | 25-06-2026 |
| 6 | В чём реальная проблема ЛЛМ | -5 | 7 | 03-07-2026 |
| 7 | Как заставить LLM сортировать данные: от наивного подхода до TrueSkill | 0 | 9.74 | 23-01-2026 |
| 8 | Как желание быстрее читать чужой код превратилось в войну с недетерминизмом LLM | 0 | 5 | 28-06-2026 |
| 9 | LLMs as Clinical Instruments—Toward Verifiable Reasoning | 0 | 8.16 | 29-07-2026 |
| 10 | Anthropic launches Claude Opus 5 with near-Fable intelligence at half the price | 0 | 20.02 | 24-07-2026 |