Агент на основе модели Claude Fable 5 выполняет офисные задачи на компьютере точнее человека и дешевле индийского аутсорсинга: 85% успешных завершений на тесте OSWorld-Verified (369 задач в средах Ubuntu, Windows и macOS), где проверяется способность реального использования компьютера, против 72% у живых тестировщиков, при стоимости $6-8 в час против $8-15 у офшорного BPO (аутсорсинга бизнес-процессов) в Индии. Это выводы нового исследования Фабрицио Серафини, партнера венчурного фонда Andreessen Horowitz.
Год назад лучшая модель решала только 42% задач того же теста. Этот рывок Серафини объясняет не столько ростом способностей самих нейросетей, сколько обвязкой вокруг них: песочницами с виртуальными машинами, проверкой результата и эскалацией сложных случаев на человека. Модели, по словам одного из опрошенных Серафини разработчиков, стали пригодны для реальной работы без постоянного присмотра только с выходом Claude Opus 4.6 в феврале 2026 года. Штатный сотрудник бэк-офиса в США обходится компании в $30-45 в час, поэтому даже в самом дорогом режиме — покадровой обработке скриншотов топовой моделью — агент дает 70-80% экономии против штатного найма.
Экономят на харнессе (программная обвязка вокруг нейросети), а не на самой модели. Агент один раз проходит процесс вручную, дорогой вызов модели фиксируется как обычный детерминированный код, и дальше задача выполняется этим кодом почти бесплатно. Нейросеть подключается заново только когда что-то в интерфейсе сломалось. Отсюда 15-20 миллионов автоматизированных обращений к порталам поставщиков в месяц у одной потребительской компании, которая за счет этого вдвое сократила команду поддержки скрейперов (программы, которые автоматически забирают нужные данные с веб-страниц и превращают их в структурированный вид).
Схема работает там, где путь к результату стандартный и есть четкий признак успеха: заказы через порталы, тикеты техподдержки, сверка счетов, карточки сделок в CRM. Ломается она там, где успех нельзя проверить сразу. Серафини приводит пример: агент подает заявку на страховую выплату, система показывает «заявка получена», а через два дня специалист звонит уточнить номер полиса. Агент об этом звонке не узнает, и заявка неделями стоит без движения.
Именно из этой особенности растет главный риск для рынка фриланса. Биржи вроде Upwork десятилетиями держались на потоке однотипных задач с человеком за компьютером: перенос данных между таблицами, поиск лидов, модерация контента, чужие CRM и календари. Ставки за такую работу давно лежат в том же коридоре $3-15 в час, что и офшорный BPO у Серафини, а сама работа протокольная и повторяемая. Именно ее автоматизируют в первую очередь. При этом в 10-30% случаев, которые агент закрыть не может, кто-то должен разобрать исключение и понять контекст заказчика — эту роль пока не умеет исполнять ни одна модель. Фрилансеру, знающему специфику клиента изнутри, придется превращаться из исполнителя рутины в того, кто настраивает и чинит агента.
Ту же модель Claude Fable 5 компания Anthropic почти на три недели отключала в июне из-за требований американского экспортного контроля и вернула только в начале июля. Судьба лидера рейтинга невольно подтверждает главный тезис отчета: важнее не бренд нейросети, а надежность системы вокруг нее. Один из операторов, прогоняющих через агентов миллионы задач в месяц, что не знает, какая модель у него под капотом. Поставщик меняет их так же, как облачный провайдер меняет «железо».
Точность дальше будут поднимать через самопроверку, а задержку уже снижают переходом с покадровых скриншотов на чтение дерева доступности интерфейса. Модель для управления компьютером компания Standard Intelligence обучила на 11 миллионах часов видео и запустила на скорости 30 кадров в секунду — сигнал, что скриншот-петля, тормозящая сегодняшних агентов, не постоянный потолок, а решаемая задача.
