Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

85 % на шаг — это 20 % на десяти ...

Дата публикации: 08-10-2026 11:24:00

85 % на шаг — это 20 % на десяти шагах. Именно поэтому «умный агент» без проверки — лотерея.
Вышел разбор a16z про то, умеют ли агенты пользоваться компьютером. Данные такие: год назад лучший агент выполнял 42 % задач на стандартном тесте OSWorld, сейчас — 85 %. Человек на тех же задачах набирает около 72 %. Звучит как победа, и в этом месте обычно заканчиваются новости.
Но тест считает выполненные задачи, а не надёжность процесса. 85 % — это пятнадцать провалов из ста, и процесс доходит до конца только если удались ВСЕ шаги. Дальше арифметика, которую в отчётах не пишут:
— 5 шагов по 85 % — процесс целиком проходит в 44 % случаев;
— 10 шагов — в 20 %;
— 20 шагов — в 4 %.
При 95 % на шаг десять шагов дают уже 60 %, при 99 % — 90 %. Разница между «демо» и «работает в продакшене» живёт вот в этой таблице, а не в красивом числе из лидерборда.
a16z называют и два режима отказа, которые нам особенно близки. Первый: результат нельзя перепроверить внешне. Агент читает в договоре «net 60», переносит в систему «net 30» — запись выглядит идеально, проходит любую визуальную проверку, и ошибка всплывает только когда уходит неверный счёт. Второй: нет сигнала успеха в момент работы. Портал отвечает «принято», задача закрыта — а через два дня звонит инспектор, и никто не знает, что заявка повисла.
Их экономика: агент стоит 6–8 долларов за час работы, офшорный подрядчик — около 10, офисный сотрудник в США — 30–45. Но самое важное в статье не это, а вывод: модель перестала быть узким местом. Крупные пользователи вообще не смотрят на лидерборд — вендор меняет модель у них под капотом, как облако меняет железо. Платят за другое: за проверку, эскалацию, права доступа и обработку сбоев.
Наши собственные цифры для сравнения: один запрос к модели стоит у нас 0,16 ₽, то есть 117–293 ₽ за активный час работы. И это тот случай, когда мы готовы говорить о себе прямо: узкое место сегодня — не «написать», а «поручиться за результат».
Вопрос к вам: сколько шагов в вашем процессе и что происходит, когда один из них врёт так правдоподобно, что никто не замечает?
Источник: a16z, «Can Agents Use a Computer Yet? We've Got the Data», август 2026 — https://www.a16z.news/p/can-agents-use-a-computer-yet-weve
#КнигаМКС #ПроксиПротивЦели #ии #разбор

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Мы посчитали, за что платим, когда ИИ работает. Оказалось — ...014.4908-10-2026
2Особенности агентской разработки ПО, обеспечивающей соответствие замыслу и требованиям07.3926-09-2026
3Мы взяли книгу, нарезали её на куски 100, 300 и ...012.6208-10-2026
4Мой личный «железный человек»: как я научил нейросеть быть моим ...08.1106-10-2026
5Про ИИ и нейросети... Я очень часто встречаюсь с заблуждениями ...05.4401-10-2026
6Почему нельзя отдавать 100% мышления ИИ: ловушка слепого доверия к AI-ассистентам07.8226-09-2026
7Как ИИ-агенты превращают ваш трафик в продажи, пока вы спите ...06.7306-10-2026
8AI-агент с доступом к базе: как не дать ему лишнего010.6301-10-2026
9В России ИИ-агенты уперлись в процессы: компании начинают трансформацию регламентов012.6708-10-2026
10В России ИИ-агенты уперлись в процессы: компании начинают трансформацию регламентов012.6708-10-2026

Классификация: Мнения. Схожих патентов: 0. Схожих новостей: 10. Тональность: 1. Информативность: 13.61. Источник: vk.com.