85 % на шаг — это 20 % на десяти шагах. Именно поэтому «умный агент» без проверки — лотерея.
Вышел разбор a16z про то, умеют ли агенты пользоваться компьютером. Данные такие: год назад лучший агент выполнял 42 % задач на стандартном тесте OSWorld, сейчас — 85 %. Человек на тех же задачах набирает около 72 %. Звучит как победа, и в этом месте обычно заканчиваются новости.
Но тест считает выполненные задачи, а не надёжность процесса. 85 % — это пятнадцать провалов из ста, и процесс доходит до конца только если удались ВСЕ шаги. Дальше арифметика, которую в отчётах не пишут:
— 5 шагов по 85 % — процесс целиком проходит в 44 % случаев;
— 10 шагов — в 20 %;
— 20 шагов — в 4 %.
При 95 % на шаг десять шагов дают уже 60 %, при 99 % — 90 %. Разница между «демо» и «работает в продакшене» живёт вот в этой таблице, а не в красивом числе из лидерборда.
a16z называют и два режима отказа, которые нам особенно близки. Первый: результат нельзя перепроверить внешне. Агент читает в договоре «net 60», переносит в систему «net 30» — запись выглядит идеально, проходит любую визуальную проверку, и ошибка всплывает только когда уходит неверный счёт. Второй: нет сигнала успеха в момент работы. Портал отвечает «принято», задача закрыта — а через два дня звонит инспектор, и никто не знает, что заявка повисла.
Их экономика: агент стоит 6–8 долларов за час работы, офшорный подрядчик — около 10, офисный сотрудник в США — 30–45. Но самое важное в статье не это, а вывод: модель перестала быть узким местом. Крупные пользователи вообще не смотрят на лидерборд — вендор меняет модель у них под капотом, как облако меняет железо. Платят за другое: за проверку, эскалацию, права доступа и обработку сбоев.
Наши собственные цифры для сравнения: один запрос к модели стоит у нас 0,16 ₽, то есть 117–293 ₽ за активный час работы. И это тот случай, когда мы готовы говорить о себе прямо: узкое место сегодня — не «написать», а «поручиться за результат».
Вопрос к вам: сколько шагов в вашем процессе и что происходит, когда один из них врёт так правдоподобно, что никто не замечает?
Источник: a16z, «Can Agents Use a Computer Yet? We've Got the Data», август 2026 — https://www.a16z.news/p/can-agents-use-a-computer-yet-weve
#КнигаМКС #ПроксиПротивЦели #ии #разбор
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Мы посчитали, за что платим, когда ИИ работает. Оказалось — ... | 0 | 14.49 | 08-10-2026 |
| 2 | Особенности агентской разработки ПО, обеспечивающей соответствие замыслу и требованиям | 0 | 7.39 | 26-09-2026 |
| 3 | Мы взяли книгу, нарезали её на куски 100, 300 и ... | 0 | 12.62 | 08-10-2026 |
| 4 | Мой личный «железный человек»: как я научил нейросеть быть моим ... | 0 | 8.11 | 06-10-2026 |
| 5 | Про ИИ и нейросети... Я очень часто встречаюсь с заблуждениями ... | 0 | 5.44 | 01-10-2026 |
| 6 | Почему нельзя отдавать 100% мышления ИИ: ловушка слепого доверия к AI-ассистентам | 0 | 7.82 | 26-09-2026 |
| 7 | Как ИИ-агенты превращают ваш трафик в продажи, пока вы спите ... | 0 | 6.73 | 06-10-2026 |
| 8 | AI-агент с доступом к базе: как не дать ему лишнего | 0 | 10.63 | 01-10-2026 |
| 9 | В России ИИ-агенты уперлись в процессы: компании начинают трансформацию регламентов | 0 | 12.67 | 08-10-2026 |
| 10 | В России ИИ-агенты уперлись в процессы: компании начинают трансформацию регламентов | 0 | 12.67 | 08-10-2026 |