Это подробный разбор одного эксперимента. Я взял god node из реального LangGraph агента и попросил 5 американских и 6 китайских моделей сначала предложить, как её распутать, а потом оценить предложения друг друга. Дальше тремя разными способами пытался понять, кому из них в этом деле верить.
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Harness кодинг‑агента: разобрал исходники Codex, OpenCode, Pi и свою собственную | 0 | 5.18 | 19-07-2026 |
| 2 | LLM-судье нельзя верить на слово: как построить надёжный гейт и проверить сами тесты | 0 | 12.53 | 28-07-2026 |
| 3 | Как желание быстрее читать чужой код превратилось в войну с недетерминизмом LLM | 0 | 5 | 28-06-2026 |
| 4 | Локальный Deep Research. Совершенствуем собственный ИИ-поисковик | 0 | 7 | 04-06-2026 |
| 5 | Ваш AI-агент не понимает код. Он просто очень уверенно угадывает — поэтому мы создали SLICER | 1 | 15.66 | 25-07-2026 |
| 6 | Google is changing how it judges AI models for Android coding, updates list with Fable 5 | 0 | 11.25 | 08-07-2026 |
| 7 | В чём реальная проблема ЛЛМ | -5 | 7 | 03-07-2026 |
| 8 | Сравниваем LLM, 12 тестов для среднего класса: три Sonnet против GigaChat 2 MAX и YandexGPT Pro 5.1 | 0 | 8 | 15-07-2026 |
| 9 | **🚀 Kimi K3 vs Fable 5: кто кого на этот ... | 0 | 11.39 | 28-07-2026 |