Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Мы взяли книгу, нарезали её на куски 100, 300 и ...

Дата публикации: 08-10-2026 11:22:05

Мы взяли книгу, нарезали её на куски 100, 300 и 600 тысяч знаков и заставили модель отвечать. Разницы — ноль. И это важнее, чем кажется.
Все спорят, у какой модели «окно» больше: 128 тысяч токенов, миллион, четыре миллиона. Мы решили не спорить,
а измерить. Взяли настоящий текст, задали 10 вопросов и прогнали на трёх длинах.
Результат: 50 % верных на 100 тысячах знаков, 50 % на 300, 50 % на 600. Никакого падения.
То есть на этом объёме «размер окна» вообще не влияет — влияет что именно вы спрашиваете.
Дальше стало интереснее. Мы разделили вопросы на два типа:
* вопрос, ответ на который лежит в одном месте текста — модель ответила верно в 3 случаях из 20;
* вопрос, который требует связать два места, разнесённых на сотни тысяч знаков — верно в 13 из 20.
Казалось бы, должно быть наоборот: чем сложнее задача, тем хуже результат. Но модель «спотыкается»
именно на близкой информации — и не потому, что не видит её, а потому что у неё нет задачи её держать.
Она уверенно пересказывает общий контекст и теряет мелкую деталь. А далёкую связь находит, потому что
вопрос прямо заставляет искать.
Что это значит практически. Когда вам говорят «у нас контекст на миллион токенов», это не про то,
что модель качественно отработает ваш документ. Проверять надо не размер окна, а свой тип вопроса.
И проверять — на своём тексте, а не на чужой картинке с графиком.
Мы для этого сделали тест: документ, 30 вопросов с точным указанием места ответа, шесть метрик,
сырые данные и скрипт, которым всё воспроизводится. Один прогон стоит дешевле обеда.
Вопрос к вам: есть ли у вас (или в вашей работе) документ, на котором ломается любая модель —
договор, отчёт, инструкция, чужой длинный код? Напишите в комментариях, что это за тип документа —
нам интересно собрать статистику «где именно ломается» на реальных примерах, а не на синтетике.
#ии #нейросети #разбор #длинныйконтекст

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Мы посчитали, за что платим, когда ИИ работает. Оказалось — ...014.4908-10-2026
285 % на шаг — это 20 % на десяти ...113.6108-10-2026
3Мы прочесали базу из 2 816 научных работ, на которые ...-17.9408-10-2026
4Когда подписи недостаточно: как мы расчищали «серую зону» в Поиске по картинкам07.9210-08-2026
5Про ИИ и нейросети... Я очень часто встречаюсь с заблуждениями ...05.4401-10-2026
6Омнимодель для Алисы AI: как нам удалось подружить VLM и LLM07.403-09-2026
7Специалист Гусев: расшифровки совещаний с помощью ИИ создают риски011.3302-10-2026
8Как мы дописываем оборванные ответы языковой модели и почему склейка оказалась сложнее, чем кажется0624-09-2026
9OpenAI доказала 377 математических теорем за раз и ввела ученых ...012.3608-10-2026
10«Нейросеть словила депрессию и ПТСР» — мы это проверили на ...05.0809-10-2026

Классификация: Мнения. Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 12.62. Источник: vk.com.