Что произошло
Стоимость ИИ-операции принято обсуждать в цене за токены. Поставщики публикуют тарифы, снижают их с каждым поколением моделей, и на этом фоне кажется, что экономика любого сценария сходится: генерация стала почти бесплатной. Компании, которые довели сценарии до промышленной эксплуатации, обнаружили другое: счёт за токены оказался самой малой и самой быстро сокращающейся частью себестоимости, а основные затраты лежали там, где их не считали, — в проверке результата и в последствиях ошибок.
Это сдвиг в самом способе считать. Пока ИИ был пилотом, стоимость операции сводилась к инфраструктуре: остальное оплачивалось из бюджета инноваций и не попадало в калькуляцию. Когда сценарий стал частью процесса, в калькуляцию вошли время эксперта, который проверяет каждый результат, и цена ошибок, которые он пропустил. Себестоимость выросла в разы, и часть сценариев, «окупавшихся» на пилоте, перестала окупаться вообще.
Поэтому правильная единица — не стоимость запроса к модели, а unit cost когнитивной операции: полная себестоимость одного результата, доведённого до состояния, в котором его можно использовать. Она складывается из трёх слагаемых, и только первое из них измеряется в токенах.
Как это устроено
Первое слагаемое: стоимость генерации
Это то, что принято считать. Во внешнем сервисе — тариф, умноженный на объём токенов на входе и выходе. В собственном контуре — доля амортизации оборудования, энергии и обслуживания, приходящаяся на одну операцию при данной загрузке.
Три вещи о генерации важны для расчёта. Она зависит от устройства сценария сильнее, чем от модели: разбор документа с десятком связанных файлов стоит на порядок дороже разбора одного, агент с несколькими итерациями — на порядок дороже одного запроса. Она падает с каждым поколением моделей. И она почти никогда не определяет, окупится ли сценарий: разница между дорогой и дешёвой моделью — в разы, а между дешёвой и дорогой верификацией — на порядки.
Второе слагаемое: стоимость верификации
Результат генеративной модели нельзя использовать, пока кто-то не убедился, что он верен. Этот «кто-то» — либо человек, либо автоматика, и оба стоят денег.
Если проверяет человек, стоимость верификации — его ставка, умноженная на время проверки. Время проверки зависит от формы результата, и здесь лежит главный рычаг всей экономики. Свободный текст без ссылок на источник проверяется перечитыванием исходного материала — то есть повторением работы, которую должна была сэкономить модель. Структурированный результат с привязкой каждой находки к конкретному месту в источнике проверяется точечно: эксперт смотрит на пункт, на находку, принимает решение. Разница во времени — в разы, а иногда на порядок, при одном и том же качестве модели.
Если проверяет автоматика — правила, сверка с учётной системой, второй независимый прогон, тесты, — стоимость верификации это стоимость построения и поддержки этой автоматики, разнесённая на объём: высокая на входе и низкая на единицу при большом потоке. Она возможна там, где правильность формально проверяема; там, где правильность — экспертное суждение, остаётся человек.
Ключевое свойство верификации: её стоимость не падает с развитием моделей. Час юриста через год будет стоить не меньше. Сценарий, экономика которого держится на дорогой ручной проверке, не станет выгоднее от удешевления токенов.
Третье слагаемое: ожидаемая стоимость ошибки
Верификация снижает вероятность ошибки, но не обнуляет её: часть ошибок проходит через проверку и попадает в процесс. Ожидаемая стоимость ошибки — вероятность того, что ошибка дойдёт до последствий, умноженная на цену этих последствий.
Обе величины важны, и их часто путают. Вероятность — это доля ошибок после верификации, а не до неё: качество модели само по себе ничего не говорит, пока не учтена проверка. Цена — не стоимость исправления, а полные последствия: в черновике письма — минута на правку; в ответе клиенту — потерянный клиент и репутационный след; в проверке договора — условие, которое компания приняла и обязана исполнять; в проводке документа — претензия, штраф, испорченные отношения с контрагентом.
Особенность этого слагаемого — распределение. Большинство ошибок дёшевы, а редкие — очень дороги, и именно они определяют ожидаемую стоимость. Сценарий, где модель ошибается редко, но каждая ошибка стоит как годовая экономия, не окупается, даже если средний результат отличный. Снижают эту величину независимые проверки: если результат проходит через модель, затем через правила, затем через выборочный контроль человека, и ошибки этих этапов не коррелируют, вероятность пропуска падает в разы. Это дороже одной проверки, но дешевле одной дорогой ошибки.
Формула unit cost
Словами: полная себестоимость одной когнитивной операции равна стоимости генерации плюс стоимости верификации плюс произведению вероятности пропущенной ошибки на её цену.
| Слагаемое | Из чего складывается | Чем управляется | Как меняется со временем |
|---|---|---|---|
| Стоимость генерации | Токены или амортизация контура, число итераций, объём контекста | Выбор модели, устройство сценария, длина контекста | Падает с каждым поколением моделей |
| Стоимость верификации | Ставка проверяющего, умноженная на время, или стоимость автоматики на операцию | Форма результата: структура, привязка к источнику, точечность проверки | Не падает; растёт вместе со ставкой эксперта |
| Ожидаемая стоимость ошибки | Вероятность пропуска после проверки, умноженная на цену последствий | Число независимых проверок, ограничение зоны применения, цена ошибки в процессе | Падает с числом проверок, растёт с расширением зоны применения |
Из таблицы видно, где лежат рычаги. Первое слагаемое улучшается само. Второе — проектированием формы результата. Третье — архитектурой проверок и выбором процессов, где цена ошибки ограничена.
Как сравнивать сценарии
Unit cost имеет смысл только в сравнении: тот же результат, полученный вручную, против того же результата, полученного с ИИ.
Ручной процесс тоже имеет три слагаемых, их просто не называли так. Генерация — время эксперта на выполнение работы. Верификация — время второго эксперта или руководителя, если проверка есть; если нет — ноль, но тогда вероятность ошибки выше. Ожидаемая стоимость ошибки — та же формула. Компании обычно знают первое слагаемое ручного процесса и почти никогда не знают третье, что делает сравнение нечестным в пользу ручного труда.
Сравнение показывает три типа сценариев. Первый: верификация дешёвая, цена ошибки низкая — черновики, классификация, поиск. Unit cost с ИИ ниже ручного в разы, окупается сразу. Второй: верификация дешёвая при правильной форме результата, цена ошибки высокая — проверка договоров, разбор финансовых документов. Окупается, если результат спроектирован под точечную проверку и есть независимые контуры. Третий: верификация дорогая, потому что результат нельзя проверить иначе как повторением работы, — открытые экспертные суждения, рекомендации без проверяемого основания. Не окупается при любой стоимости генерации: экономия на первом слагаемом съедается вторым.
Как это выглядит на практике: проверка договора
Возьмём обобщённый сценарий юридической функции: проверка входящего договора контрагента на отклонения от типовых условий компании. Величины ниже — условные единицы для иллюстрации механики, а не результат замера; важны пропорции, а не значения.
Как есть. Юрист читает договор целиком, сверяет с типовой формой, готовит замечания. Примем стоимость его времени на один договор за 100 условных единиц. Верификации почти нет — руководитель смотрит выборочно, это ещё несколько единиц. Цена пропущенного условия — в десятки раз выше стоимости проверки: условие уже принято и действует. Ожидаемая стоимость ошибки при заметной доле пропусков сопоставима со стоимостью самой работы.
С ИИ, без привязки. Модель готовит отчёт об отклонениях в свободной форме. Генерация — доли единицы. Но юрист не может доверять отчёту без проверки, а проверить свободный текст можно только перечитав договор. Верификация — почти те же 100 единиц. Вероятность ошибки не снизилась: юрист либо читает всё сам (тогда ИИ ничего не сэкономил), либо доверяет отчёту (тогда ошибки модели проходят насквозь). Unit cost не изменился или вырос.
С ИИ, с привязкой. Модель извлекает условия по заранее заданному перечню, каждую находку привязывает к пункту договора и к пункту типовой формы, помечает уверенность. Юрист проверяет находки, а не документ: открывает пункт, сравнивает, принимает решение. Верификация — в разы меньше ручного чтения, условно 20–30 единиц. Дополнительно результат проходит два независимых контура: правила и второй прогон модели по другому перечню. Ошибка проходит, только если её пропустили все три этапа — вероятность падает в разы. Генерация выросла из-за второго прогона, но осталась порядка единицы.
| Слагаемое | Ручная проверка | ИИ без привязки | ИИ с привязкой и тремя контурами |
|---|---|---|---|
| Генерация | 100 (время юриста) | доли единицы | около единицы |
| Верификация | несколько единиц (выборочно) | около 100 (перечитывание) | 20–30 (точечная проверка) |
| Ожидаемая стоимость ошибки | высокая: заметная доля пропусков при дорогом условии | не ниже ручной | в разы ниже: три независимых этапа |
| Итог | около 100 плюс ошибки | около 100 плюс ошибки | около трети от ручного плюс сниженные ошибки |
Экономика сходится не потому, что генерация дешёвая. В обоих вариантах с ИИ она почти нулевая, но один не окупается, а второй окупается в разы. Разница целиком в форме результата и архитектуре проверок — во втором и третьем слагаемых.
Два коротких примера для контраста. Черновик ответа на типовое обращение клиента: генерация — доли единицы, верификация — оператор читает один абзац, цена ошибки — одна правка; все три слагаемых малы, окупается с первого дня. Автоматическая проводка первичных документов: верификация автоматическая — сверка с учётной системой и справочниками, цена ошибки высокая, но зона применения ограничена документами, прошедшими сверку; остальные уходят человеку. Окупается при большом потоке.
Что это значит для российской компании
В собственном контуре первое слагаемое перестаёт быть тарифом и становится амортизацией: стоимость генерации фиксируется при известном объёме и не зависит от поставщика. Это упрощает расчёт, но не меняет выводов — рычаги по-прежнему во втором и третьем слагаемых.
Второе слагаемое в России упирается в кадры. Эксперты, чья работа автоматизируется, — юристы, аналитики, инженеры — дефицитны, и их время дорожает. Сценарий с дорогой ручной верификацией не просто не окупается: он занимает самых дефицитных людей проверкой вместо работы. Проектирование формы результата под точечную проверку — в первую очередь способ беречь экспертов.
Третье слагаемое в регулируемых отраслях включает санкции: нарушение 152-ФЗ при обработке персональных данных в ответе модели, предписание регулятора, претензия по договору, принятому с пропущенным условием. Цена ошибки в таких процессах задана извне, и снижать ожидаемую стоимость можно только вероятностью — числом независимых проверок и ограничением зоны, где ИИ действует без человека.
Считать unit cost — значит заранее знать, какие сценарии не окупятся, и не тратить на них квартал пилота.
Что делать: пошагово
- Опишите когнитивную операцию как единицу. Один договор, одно обращение, один документ, одна проводка. Unit cost считается на неё; без единицы сравнение невозможно.
- Посчитайте ручной процесс по трём слагаемым. Время эксперта, время проверки, доля ошибок и их полная цена. Третье слагаемое обычно неизвестно — оцените его по инцидентам за год. Это базовый замер.
- Спроектируйте форму результата под проверку. Структурированный вывод, привязка каждой находки к источнику, отметка уверенности, перечень того, что проверялось. Форма определяется до выбора модели.
- Замерьте время верификации на выборке. Дайте эксперту результаты в спроектированной форме и зафиксируйте, сколько занимает проверка одного. Если оно близко к ручному выполнению — форма не работает, вернитесь к шагу 3.
- Оцените вероятность ошибки после проверки. На эталонной выборке с известными ответами прогоните весь конвейер, включая человека, и посчитайте долю пропусков. Не качество модели, а качество всего процесса.
- Добавьте независимые контуры там, где цена ошибки высока. Правила, сверка с системами, второй прогон, выборочный контроль. Проверьте, что ошибки контуров не коррелируют — одинаковые проверки не считаются.
- Сравните unit cost и примите решение. Если с ИИ ниже в разы — запускайте. Если сопоставим — ищите форму результата с более дешёвой проверкой. Если верификация неустранимо дорога — сценарий откладывается, и это экономит квартал.
- Пересчитывайте после запуска. Фактическое время проверки, фактические пропуски, фактическая стоимость генерации. Unit cost — метрика эксплуатации, а не разовый расчёт.
Типичные ошибки
- Считать только первое слагаемое. Оно самое малое и единственное, которое падает само; решения на его основе систематически неверны. Вместо этого — три слагаемых в одной таблице.
- Выдавать свободный текст без привязки к источнику. Проверка превращается в повторение работы, и экономия исчезает. Вместо этого — структура и ссылка на пункт для каждой находки.
- Оценивать вероятность ошибки по качеству модели. Значение имеет доля пропусков после всего конвейера с человеком. Вместо этого — эталонная выборка, прогнанная через весь процесс.
- Ставить несколько одинаковых проверок. Две модели с одним промптом ошибаются одинаково; вероятность не падает. Вместо этого — разные по природе контуры: модель, правила, человек.
Как понять, что вы на верном пути
- Для каждого сценария есть таблица с тремя слагаемыми для ручного процесса и для процесса с ИИ.
- Форма результата спроектирована до выбора модели, и каждая находка привязана к источнику.
- Время верификации одного результата замерено на эксперте и в разы меньше ручного выполнения.
- Вероятность пропуска посчитана после всего конвейера на эталонной выборке с известными ответами.
- Там, где цена ошибки высока, стоят как минимум два независимых по природе контура проверки.
- Цена ошибки в ручном процессе оценена по фактическим инцидентам, а не принята за ноль.
- Сценарии с неустранимо дорогой верификацией отклонены до пилота, а не после.
Вопросы, которые нам задают
Модели дешевеют. Не изменит ли это выводы через год? Дешевеет только первое слагаемое, и оно уже сейчас редко определяет результат. Ставка эксперта и цена ошибки не падают. Сценарий, не окупающийся из-за дорогой верификации, через год будет не окупаться точно так же. Изменить его экономику могут только форма результата и архитектура проверок.
Как оценить цену ошибки, если инцидентов ещё не было? По аналогии с ручным процессом: какие последствия наступали при пропусках у людей. Если и таких данных нет — по худшему реалистичному сценарию для этого класса документов, с явной пометкой, что это оценка. Оценка с пометкой лучше нуля: ноль означает, что ошибки не считаются вообще.
Можно ли считать unit cost для агентов с несколькими шагами? Нужно, и особенно тщательно: генерация растёт с числом итераций, а вероятность ошибки накапливается на каждом шаге. Верификация промежуточных результатов дешевле финальной, поэтому агентные сценарии окупаются там, где каждый шаг можно проверить автоматически. Где этого нет — горизонт автономной работы надо укорачивать.
Возьмите один сценарий из плана — тот, который считается самым очевидным, — и заполните для него таблицу из трёх строк для ручного процесса и для процесса с ИИ. Если во второй строке стоит «эксперт перечитывает всё», сценарий в текущем виде не окупится, и это лучше узнать за час расчёта, чем за квартал пилота.