Что произошло
По отраслевым опросам, 62% компаний в той или иной форме работают с ИИ-агентами: тестируют, запускают пилоты, используют в отдельных процессах. Масштабируют — переводят в промышленную эксплуатацию на значимом объёме операций — 23%. Разрыв между этими цифрами стал одним из главных сюжетов года, и объяснения ему предлагаются разные: незрелость моделей, нехватка интеграций, сопротивление сотрудников, недостаток бюджета.
По нашему опыту проектов, эти объяснения описывают симптомы. Причина в другом. Пилот с одним агентом на одном процессе работает, потому что каждый его результат проверяет человек — владелец процесса, который затеял пилот. Когда агентов становится десять, а результатов — тысячи в день, эта проверка либо исчезает, и тогда ошибки уходят в производство, либо остаётся, и тогда она стоит дороже, чем экономия от агента. Компания останавливается на пилоте не потому, что модель не справляется, а потому что не справляется проверка.
Плато, на котором оказалось большинство компаний, работающих с агентами, — это плато стоимости верификации. Модели за год стали лучше, дешевле и быстрее; стоимость генерации результата снижается. Стоимость проверки результата, если она построена на человеке, не снижается вовсе. В какой-то точке масштабирования проверка становится главной статьёй затрат, и именно в этой точке проекты замирают.
Экономика верификации: почему масштаб ломает пилот
Стоимость операции агента складывается из трёх частей
Стоимость одной операции, выполненной агентом, — это стоимость генерации, стоимость проверки и ожидаемая стоимость ошибки, прошедшей проверку. В пилоте видна только первая: токены, инференс, инфраструктура. Вторая скрыта, потому что проверяет тот же человек, что раньше выполнял операцию, и его время никто не считает. Третья не видна, потому что объём мал и ошибки единичны.
При масштабировании соотношение переворачивается. Генерация дешевеет с ростом объёма. Проверка человеком растёт линейно с объёмом: каждый результат требует времени. Ожидаемая стоимость ошибки растёт с объёмом и с автономностью агента: чем больше действий он совершает без проверки, тем дороже одна пропущенная ошибка. В результате на масштабе доминируют вторая и третья части, а не первая.
| Компонент стоимости | В пилоте | На масштабе | Что с этим делать |
|---|---|---|---|
| Генерация | Основная видимая статья | Снижается на единицу результата | Оптимизировать, но не она определяет экономику |
| Проверка | Скрыта, делается владельцем пилота | Растёт линейно при ручной проверке | Перевести на автоматическую и выборочную |
| Ошибка, прошедшая проверку | Единична, исправляется вручную | Растёт с объёмом и автономностью | Порог ошибок и правило остановки |
Автоматическая проверка по критериям против человека
Проверка масштабируется, только если большая её часть выполняется без человека. Это возможно там, где критерий правильности формализуем.
Что проверяется автоматически: соответствие результата схеме или формату; наличие обязательных полей и ссылок на источники; согласованность с данными учётных систем — сумма, контрагент, дата совпадают с записью в системе; соблюдение бизнес-правил — лимиты, запрещённые действия, обязательные согласования; оценка отдельной модели-проверяющего по зафиксированным критериям, например, подтверждает ли источник утверждение.
Что проверяется только человеком: решения, требующие суждения без формального критерия; случаи, когда автоматические проверки дали противоречивый результат; случаи, попавшие в выборочный контроль; случаи, помеченные агентом как неуверенные.
Ключевое условие — модель-проверяющий сама должна быть проверена. Её точность измеряется на выборке, размеченной людьми, и если она не подтверждена, её оценки не могут заменять проверку человеком. По нашему опыту, компании, которые ввели автоматического проверяющего без измерения его точности, получили две системы, ошибающиеся согласованно: агент и проверяющий делили одни и те же слепые зоны, и проверка превратилась в формальность.
Выборочный контроль и разбор спорных случаев
Сплошная проверка человеком — это пилот. Промышленная эксплуатация строится на выборочном контроле по той же логике, что контроль качества на производстве: проверяется выборка, по ней оценивается доля дефектов, при превышении порога включается сплошная проверка и разбор.
Выборка не должна быть равномерно случайной. Она стратифицируется: чаще проверяются операции с высокой стоимостью ошибки, новые типы запросов, результаты после любого изменения агента, случаи, где автоматические проверки сработали на границе. Размер выборки определяется требуемой точностью оценки доли ошибок, а не доступным временем проверяющих — иначе выборка сокращается до нуля при первой перегрузке.
Случаи, где автоматическая проверка и человек разошлись, где агент ошибся, где результат потребовал вмешательства, — это самый ценный материал в системе. Они размечаются: что было на входе, что сделал агент, что должен был сделать, почему. Размеченные случаи пополняют эталонный набор для регрессионного контроля и становятся данными для дообучения агента или уточнения его инструкций.
Так возникает контур: агент работает, выборка и автоматические проверки выявляют спорные случаи, спорные случаи размечаются, разметка улучшает агента и проверяющего, доля спорных случаев снижается, стоимость проверки падает. Без этого контура доля ошибок не меняется, и проверка остаётся постоянной статьёй затрат.
Порог ошибок и правило остановки
Каждому агенту нужен зафиксированный порог ошибок: доля результатов, признанных неверными в выборке, при превышении которой агент останавливается, а операции возвращаются к людям. Порог задаётся относительно базовой линии — доли ошибок людей на этом процессе — и стоимости одной ошибки.
Правило остановки — это не страховка на крайний случай, а условие, без которого агент не может быть допущен в эксплуатацию. Оно работает и в обратную сторону: агент, который ни разу не остановился за длительный период, вызывает вопрос, измеряется ли его качество вообще. Данные, справочники и модели меняются, и агент, никогда не пересекающий порог, скорее всего, работает с порогом, который никогда не проверяется.
На масштабе агент стоит столько, сколько стоит его проверка. Модель, генерирующая результат, — самая дешёвая часть конструкции.
Организационная готовность
Верификация — это не только техника, но и структура. Чтобы десять агентов работали, а не десять пилотов, у каждого должен быть:
- владелец — руководитель, отвечающий за результат процесса, в котором работает агент, и за решение о его остановке;
- метрика — доля ошибок, доля эскалаций, стоимость операции, измеряемые регулярно и сравниваемые с базовой линией;
- бюджет — лимит на генерацию и на проверку, при исчерпании которого агент останавливается;
- правило остановки — порог и процедура возврата операций людям;
- канал разбора — куда попадают спорные случаи, кто их размечает, как разметка возвращается в систему.
Компании из числа масштабирующих отличаются от остальных не моделями. У них есть функция верификации — люди, процедуры и инструменты, которые проверяют работу агентов так же, как служба качества проверяет работу производства.
Как это выглядит на практике
Банк из первой сотни, обработка обращений. Пилот с одним агентом на одном типе обращений работал полгода: результаты проверял руководитель отдела. При расширении на несколько типов обращений проверка стала занимать больше времени, чем экономил агент. Решение — разделение на автоматические проверки (соответствие регламенту, наличие обязательных реквизитов, согласованность с данными клиента) и выборочный контроль с фокусом на обращениях с финансовыми последствиями. Доля ручной проверки снизилась в разы, спорные случаи начали размечаться и еженедельно возвращаться в инструкции агента.
Производственная компания, обработка заявок на закупку. Агент формировал заявки по стандартным позициям. Порог ошибок не был задан, и рост доли неверных заявок после изменения справочника номенклатуры заметили по жалобам склада через несколько недель. После введения порога и правила остановки аналогичная ситуация при следующем изменении справочника привела к автоматической остановке агента в тот же день и возврату операций людям до исправления.
Сеть клиник, несколько агентов одновременно. Компания запустила агентов для записи, напоминаний и подготовки документов, каждый — с отдельным владельцем-инициатором. Метрики не были унифицированы, спорные случаи не разбирались, и через квартал никто не мог сказать, какой агент приносит эффект, а какой создаёт работу. Введение единой функции верификации с общими метриками и еженедельным разбором позволило закрыть одного агента и масштабировать двух.
Что это значит для российской компании
Закрытый контур. Агенты, работающие с данными клиентов, сотрудников, финансов, размещаются в контуре, и проверяющие модели — тоже. Это удваивает нагрузку на инфраструктуру инференса: каждый результат агента проходит через модель-проверяющего. Экономика контура должна считаться с учётом проверки, а не только генерации.
Регуляторика. Для финансового сектора, медицины, объектов КИИ автономные действия агентов требуют объяснимости и контролируемости. Правило остановки, журнал спорных случаев, результаты выборочного контроля — это доказательная база при проверках. Агент без этих элементов не проходит комплаенс независимо от качества модели.
Кадры. Функция верификации требует людей: тех, кто размечает спорные случаи, тех, кто владеет метриками, тех, кто поддерживает автоматические проверки. Это не новые должности, а новые обязанности владельцев процессов и службы качества, и их нужно заложить в план, иначе проверка ляжет на тех, кто уже перегружен.
Отечественный стек. Модели с открытыми весами, средства инференса, векторные базы, шины данных — всё доступно для размещения в контуре. Ограничение не в инструментах, а в способности организации построить вокруг них процедуру проверки. Стек одинаков у тех, кто масштабирует, и у тех, кто остался на пилоте.
Что делать: пошагово
- Посчитайте полную стоимость операции агента в пилоте. Генерация, время человека на проверку, стоимость исправленных ошибок. Если проверка не считалась, посчитайте её сейчас: это главная цифра для решения о масштабировании.
- Формализуйте критерии правильности. Для каждого типа результата — что можно проверить автоматически (формат, поля, согласованность с системами, правила), что требует суждения. Чем больше доля первого, тем дешевле масштаб.
- Постройте автоматическую проверку и измерьте её точность. Модель-проверяющий или набор правил, точность которых подтверждена на выборке, размеченной людьми.
- Введите выборочный контроль. Стратифицированная выборка, размер от требуемой точности оценки, повышенная доля для операций с высокой стоимостью ошибки и после изменений.
- Задайте порог ошибок и правило остановки. Относительно базовой линии людей и стоимости ошибки. Процедура остановки и возврата операций людям — описана и проверена на практике, а не только на бумаге.
- Организуйте разбор спорных случаев. Регулярный, с разметкой, с возвратом результатов в инструкции агента, в проверяющую модель, в эталонный набор.
- Назначьте владельцев и метрики. Каждый агент — с владельцем, бюджетом, метриками, сравниваемыми с базовой линией. Единая функция верификации для всех агентов, а не отдельная на каждый пилот.
- Масштабируйте по одному. Следующий агент запускается, когда предыдущий вышел на целевую долю автоматической проверки и стабильную долю ошибок. Одновременный запуск нескольких агентов без функции верификации — путь к плато.
Типичные ошибки
- Считать только генерацию. Почему: на масштабе проверка и ошибки стоят больше генерации. Что вместо: полная стоимость операции из трёх частей.
- Масштабировать сплошную ручную проверку. Почему: она растёт линейно и съедает эффект. Что вместо: автоматическая проверка по критериям плюс выборочный контроль.
- Проверяющая модель без измерения точности. Почему: две модели могут ошибаться согласованно, и проверка становится формальностью. Что вместо: точность проверяющего измерена на разметке людей и контролируется.
- Агент без порога ошибок. Почему: деградация после изменения данных или модели обнаружится по жалобам через недели. Что вместо: порог, выборка, автоматическая остановка.
- Спорные случаи без разметки. Почему: доля ошибок не снижается, проверка остаётся постоянной статьёй затрат. Что вместо: регулярный разбор с возвратом в систему.
- Несколько пилотов вместо одного масштабирования. Почему: у каждого свой владелец и свои метрики, эффект не сравним, проверка не унифицирована. Что вместо: единая функция верификации и последовательный запуск.
Как понять, что вы на верном пути
- Стоимость проверки на одну операцию известна и снижается от квартала к кварталу.
- Большая часть результатов проходит автоматическую проверку, точность которой подтверждена на разметке людей.
- Выборочный контроль стратифицирован и не сокращается при перегрузке проверяющих.
- У каждого агента есть порог ошибок, и хотя бы один агент за период останавливался по правилу.
- Спорные случаи размечаются регулярно, и разметка возвращается в инструкции агента и в эталонный набор.
- У каждого агента есть владелец, бюджет и метрики, сравниваемые с базовой линией процесса.
- Решение о запуске следующего агента принимается по показателям предыдущего, а не по инициативе подразделения.
Вопросы, которые нам задают
Можно ли обойтись без проверяющей модели и полагаться на правила?
Там, где результат структурирован и критерии формализуемы полностью — да, правила надёжнее и дешевле. Проверяющая модель нужна там, где критерий требует интерпретации текста: подтверждает ли источник утверждение, соответствует ли ответ регламенту по смыслу. Начинать стоит с правил и добавлять модель только для того, что правилами не покрывается, и только после измерения её точности.
Какой размер выборки нужен для выборочного контроля?
Такой, который даёт оценку доли ошибок с точностью, достаточной для решения об остановке. Это зависит от порога, от ожидаемой доли ошибок и от стоимости одной ошибки: для операций с высокой ценой ошибки выборка больше. Размер должен быть зафиксирован как требование к процессу, а не определяться доступным временем проверяющих.
Почему агент, который ни разу не остановился, вызывает вопросы?
Потому что данные, модели и справочники меняются, и агент, который работал год без единой остановки, скорее всего, либо не измеряется, либо порог задан так высоко, что не срабатывает. Остановка по правилу — признак работающего контроля, а не сбоя. Её отсутствие требует проверки того, что порог реален и выборка действительно проверяется.
С чего начать, если у нас уже несколько агентов и ни одной метрики?
С остановки расширения и с инвентаризации: какие агенты работают, у кого владелец, что проверяется, где спорные случаи. Затем — полная стоимость операции для каждого, порог ошибок и выборочный контроль. По результатам часть агентов будет закрыта, часть — масштабирована. Это займёт квартал, и это дешевле, чем ещё год на плато с десятком пилотов, которые никто не проверяет.