Что произошло
25 сентября 2026 года Сбер официально объявил о запуске на горячей линии «Справочная 900» универсального ИИ-помощника. Сервис позиционируется как полнофункциональный голосовой ассистент, доступный для звонков с любого телефона, в том числе без подключения к интернету. По заявлению компании, это первый в России запуск универсального агента на банковской горячей линии, расширяющий её функции за пределы чисто финансовых консультаций. Проект прошёл пилотную фазу перед публичным стартом.
Ключевая особенность решения — универсальность и открытый доступ. Позвонить на номер 900 и активировать помощника голосовой командой «Справочная» может любой желающий, а не только клиент банка. Система поддерживает пять языков: русский, узбекский, казахский, таджикский и киргизский, что делает её релевантной для многонациональной аудитории. Помощник способен отвечать на вопросы из различных областей, а также перенаправлять вызов на другие голосовые сервисы Сбера, например виртуального экскурсовода Артура или СберКота.
Запуск трансформирует номер 900 из специализированного канала поддержки клиентов банка в публичный интерфейс доступа к информации. Это демонстрирует стратегический сдвиг от узкоспециализированных автоматизированных сценариев к созданию многофункциональных платформных агентов. По нашему опыту, такой шаг требует значительной перестройки как технической инфраструктуры, так и бизнес-процессов контакт-центра, переходя от простого IVR (Interactive Voice Response) к полноценному диалоговому ИИ.
Для контекста, в 2023 году виртуальный ассистент Афина в контакт-центре Сбера обрабатывал около 19 млн звонков в месяц и исчерпывающе отвечал на 68% запросов без эскалации на оператора. Новый проект является эволюцией этого подхода, но с выходом за рамки банковских тем и добавлением мультиязычности, что существенно усложняет задачу.
Как это устроено
Голосовой стек и интеграция с телефонией
В основе решения лежит классическая для голосовых ИИ-систем архитектура, адаптированная к работе через традиционную телефонную сеть (PSTN). Звонок поступает на медиашлюз, который преобразует аудиопоток в формат, понятный для распознавания речи (ASR, Automatic Speech Recognition). В типовом сценарии используется ASR-сервис, оптимизированный для работы в условиях шума и разного качества канала связи, что критически важно для массового сервиса. После распознавания текстовый запрос передаётся в ядро системы для обработки.
Следующий этап — синтез речи (TTS, Text-to-Speech), который преобразует сгенерированный текстовый ответ обратно в аудио. Качество и естественность голоса напрямую влияют на пользовательский опыт (CSAT). Сбер, вероятно, использует собственные разработки в этой области, интегрированные с единой платформой речевых технологий. Весь цикл «распознавание-обработка-синтез» должен происходить с минимальной задержкой, чтобы диалог ощущался как живое общение.
Ядровая языковая модель и оркестрация
Центральным элементом является большая языковая модель (LLM), ответственная за понимание намерения пользователя, извлечение сущностей и генерацию ответа. Хотя Сбером не было раскрыто название конкретной модели, по нашему опыту, для таких задач применяются специализированные версии генеративных моделей, дообученные на диалоговых данных и предметных областях. Ключевая задача — не просто сгенерировать текст, а поддерживать осмысленный многоходовой диалог.
Над моделью находится слой оркестрации, который управляет логикой сессии. Этот модуль определяет, может ли универсальный помощник ответить на запрос самостоятельно, следует ли подключить внешнюю систему (например, базу данных организаций) или перенаправить вызов на другого голосового агента, такого как Артур. Именно оркестратор реализует сценарий эскалации на оператора, если ИИ не справляется с задачей или пользователь запрашивает общение с человеком.
Мультиязычность и управление знаниями
Поддержка пяти языков является технически сложной задачей. Вероятнее всего, используется либо одна мощная мультязычная модель, либо ансамбль специализированных моделей для каждого языка с последующим переключением в зависимости от результата детекции языка на первом шаге. В типовом сценарии система сначала определяет язык речи, а затем маршрутизирует запрос в соответствующий языковой конвейер обработки.
Для обеспечения достоверности ответов используется механизм, основанный на поиске по базе знаний (RAG, Retrieval-Augmented Generation). Модель не генерирует ответ «из головы», а ищет релевантные фрагменты в проверенных источниках, а затем на их основе формирует итоговый текст. Это снижает риск «галлюцинаций» и позволяет оперативно обновлять информацию без полного переобучения модели. Владение и актуализация базы знаний становятся таким же важным активом, как и сама модель.
Экономика и ROI-модель
Экономический эффект от внедрения универсального агента формируется за счёт сокращения операционных расходов. Прямая экономия возникает от снижения доли звонков, обрабатываемых операторами, чья зарплата составляет основную стоимость контакт-центра. Сбер в 2023 году закрывал 68% звонков без оператора; новый сервис призван повысить этот показатель за счёт расширения спектра решаемых задач. Расчёт ROI должен учитывать не только экономию ФОТ, но и рост доступности сервиса 24/7.
Совокупная стоимость владения (TCO) включает в себя затраты на инфраструктуру (GPU-серверы или облачные вычисления), лицензии на программное обеспечение, разработку и поддержку интеграций, а также расходы на телефонию и обеспечение информационной безопасности. Формула ROI выглядит так: ROI = (Экономия на операционных затратах + Дополнительный доход – TCO) / TCO. Поскольку Сбером не были раскрыты конкретные цифры, для российской компании будет корректно построить собственную финансовую модель, опираясь на текущие метрики контакт-центра (среднее время обработки, стоимость контакта, уровень первой линии).
Ограничения и риски
Универсальность решения порождает специфические риски. Во-первых, это стоимость инференса. Открытый доступ для всех желающих может привести к неконтролируемому росту нагрузки и, как следствие, к высоким операционным расходам на GPU-мощности и трафик телефонии. Во-вторых, сложность контроля качества ответов в широком спектре тем. Ошибочный ответ в медицинской или юридической сфере может иметь гораздо более серьёзные последствия, чем в справочном запросе.
Существуют и технологические ограничения: качество распознавания речи падает при сильном шуме, диалектах или код-свитчинге (переключении языков в рамках одной фразы). Также остаётся открытым вопрос обработки и хранения персональных данных, которые пользователи могут случайно или намеренно сообщить в ходе диалога. Без чёткой политики анонимизации и защиты данных проект рискует нарушить законодательство.
Как это выглядит на практике
Сценарий 1: Информационный запрос
Абонент звонит на номер 900 с мобильного телефона, не имея доступа к интернету. После гудка он произносит: «Справочная». На приветствие ИИ-ассистента он спрашивает: «Подскажи, пожалуйста, часы работы МФЦ в городе Казани». Система распознаёт речь, определяет намерение (запрос часов работы) и сущности (МФЦ, Казань). Оркестратор отправляет запрос в базу данных организаций, находит релевантную запись и формирует ответ: «Многофункциональный центр предоставления государственных услуг в Казани работает по будням с 9 до 18, обед с 13 до 14». Ответ синтезируется в речь и озвучивается абоненту.
Сценарий 2: Межсервисная маршрутизация
Пользователь звонит и спрашивает: «Расскажи что-нибудь интересное о Эрмитаже». Универсальный помощник определяет, что запрос относится к сфере культуры и туризма, и говорит: «Сейчас я соединю вас с виртуальным экскурсоводом Артуром, он расскажет об Эрмитаже». Вызов перенаправляется на сервис Артура с сохранением контекста, если это технически реализовано, либо пользователь начинает новый диалог с другим агентом. Это демонстрирует платформенный подход, где ИИ-помощник выступает в роли маршрутизатора по экосистеме сервисов.
Сценарий 3: Эскалация на оператора
Клиент Сбера звонит и пытается выяснить причину списания комиссии, но формулирует запрос нечётко: «У меня деньги списали, что за фигня?». Универсальный помощник, не имея доступа к персональным данным и не будучи обучен на финансовых транзакциях, не может дать точный ответ. После нескольких неудачных попыток помочь он распознаёт фрустрацию в голосе или по ключевым словам и говорит: «Я не могу решить ваш вопрос. Соединить вас с оператором?». Звонок переводится в очередь на живого специалиста с возможной передачей расшифровки диалога для ускорения решения.
Что это значит для российской компании
Запуск универсального ИИ-агента Сбером имеет прямые импликации для средних и крупных российских компаний, рассматривающих автоматизацию клиентского сервиса. Во-первых, это демонстрация зрелости российских речевых и языковых технологий, способных работать в нагруженных публичных сервисах. Во-вторых, это подтверждение тренда на создание универсальных, а не узкоспециализированных ботов, которые могут стать единой точкой входа для клиентов. Важно понимать, что такое решение — это не просто ИИ, а комплексная интеграция с legacy-системами.
Санкционные ограничения делают критически важным выбор технологического стека. Архитектура должна базироваться на отечественных моделях, облачных платформах или on-premise решениях, чтобы избежать зависимости от зарубежных поставщиков, которые могут уйти с рынка. Использование российского ПО для защиты информации и сертифицированных средств коммуникации также становится обязательным требованием для многих отраслей, особенно финансового сектора и госуслуг.
Экономически проект меняет парадигму затрат. Вместо линейного роста расходов при расширении штата операторов, компания инвестирует в инфраструктуру с фиксированной или предсказуемо растущей стоимостью, которая позволяет обслуживать практически неограниченное количество запросов. Это особенно актуально для компаний с сезонными пиками нагрузки или для тех, кто стремится предоставить круглосуточную поддержку без содержания трёх смен персонала.
| Подход к внедрению | Преимущества | Недостатки | Оптимальное применение |
|---|---|---|---|
| Покупка готовой платформы (Sber, Yandex, МТС) | Быстрый запуск, предсказуемый бюджет, техническая поддержка вендора | Меньшая гибкость, зависимость от поставщика, возможные ограничения по кастомизации | Компании без сильной ИИ-команды, для быстрого тестирования гипотезы |
| Сборка на open-source моделях (например, от FSD или Salute) | Полный контроль над стеком, отсутствие лицензионных платежей, возможность тонкой настройки | Требует сильной команды разработчиков и ML-инженеров, высокие затраты на поддержку и безопасность | Крупные компании с собственным R&D-центром и уникальными бизнес-процессами |
| Разработка с нуля | Максимальная адаптация под задачи, полное владение интеллектуальной собственностью | Очень высокие инвестиции и риски, длительные сроки, необходимость招募 редких специалистов | Госкорпорации и технологические лидеры рынка, для которых ИИ является ключевым конкурентным преимуществом |
Что делать: пошагово
- Аудит и сегментация обращений. Проанализируйте текущие потоки звонков в контакт-центр. Выделите 10–20 наиболее частых и простых информационных сценариев, которые составляют значительную долю трафика, но не требуют доступа к персональным данным или выполнения транзакций.
- Формирование базы знаний. Создайте и структурируйте единый источник правды для этих сценариев. Назначьте владельцев контента и установите регулярную процедуру его актуализации. Качество ответов напрямую зависит от качества исходных данных.
- Определение технического стека. Выберите между готовой платформой, сборкой на open-stack или разработкой с нуля. Оцените свои ресурсы, экспертизу и требования к безопасности. Для первого пилота часто оптимальна готовая платформа.
- Проектирование API-слоя. Не предоставляйте ИИ-модели прямой доступ к вашим основным CRM, ERP или бухгалтерским системам. Разработайте промежуточный API-слой с чётко определёнными правами доступа, который будет отдавать только те данные, которые необходимы для ответа на запрос.
- Внедрение мер безопасности. Сразу спроектируйте систему анонимизации и удаления персональных данных из расшифровок звонков. Настройте фильтры для предотвращения генерации нежелательного или опасного контента.
- Запуск в теневом режиме. Запустите систему параллельно с операторами, не давая ей отвечать клиентам напрямую. ИИ будет генерировать ответы, которые будут оцениваться супервайзерами для проверки качества и дообучения модели.
- Пилот на ограниченном трафике. После успешной работы в теневом режиме переведите систему на обработку небольшого процента (например, 5–10%) реальных звонков в низко-рискованные часы. Собирайте метрики качества и экономической эффективности.
- Постепенное масштабирование и KPI. На основе данных пилота принимайте решение о постепенном увеличении доли трафика, обрабатываемой ИИ. Основными KPI должны быть не только CSAT, но и доля решённых на первом контакте вопросов (FCR) и среднее время обработки (AHT).
Типичные ошибки
- Старт со сложных транзакционных сценариев. Попытка сразу научить ИИ проводить платежи или изменять данные в договорах многократно повышает риск дорогостоящих ошибок и репутационного ущерба. Начинать следует с информационных запросов.
- Пренебрежение качеством базы знаний. Модель, обученная на устаревших или противоречивых данных, будет давать неверные ответы, что подорвёт доверие клиентов к сервису. «Мусор на входе — мусор на выходе».
- Недооценка стоимости интеграции. Часто фокусируются на стоимости самой модели, забывая, что основная работа и расходы лежат в области интеграции с десятком legacy-систем через нестабильные API.
- Отсутствие чёткой стратегии эскалации. Если пользователь не понимает, как перейти к оператору, или если этот процесс слишком долгий, это приводит к резкому падению CSAT. Путь к человеку должен быть простым и быстрым.
- Игнорирование тестов на безопасность. Проведение red-team тестов на предмет утечек данных или prompt injection-атак откладывается на потом. Это может привести к компрометации данных клиентов на ранних этапах эксплуатации.
- Экономия на качестве синтеза речи. Роботизированный, неестественный голос раздражает пользователей и снижает воспринимаемую ценность сервиса, даже если ответы по сути верные.
Как понять, что вы на верном пути
- Снижается среднее время обработки (AHT) звонков, которые полностью автоматизированы, при этом растёт или остаётся стабильным уровень удовлетворённости (CSAT) по этим взаимодействиям.
- Увеличивается доля запросов, решённых при первом контакте (FCR), за счёт того, что ИИ-агент способен самостоятельно закрыть большее число типовых обращений.
- Снижается нагрузка на операторов первой линии: они начинают заниматься более сложными и ценными задачами, а не отвечать на однотипные вопросы.
- Количество обращений в службу поддержки с жалобами на работу голосового ассистента остаётся на низком уровне или уменьшается после начального периода адаптации.
- Экономическая модель показывает положительный или близкий к нулю ROI на пилотном сегменте трафика, что подтверждает жизнеспособность масштабирования проекта.
Вопросы, которые нам задают
Какая модель лучше — своя или готовая от вендора?
Выбор зависит от ресурсов, экспертизы и стратегических приоритетов. Готовая платформа от Сбера, «Яндекса» или МТС позволяет запустить пилот за 1–3 месяца с предсказуемыми затратами. Собственная разработка на open-source моделях даёт полный контроль и гибкость, но требует сильной команды и инвестиций на 12–18 месяцев. Для старта почти всегда выгоднее опробовать готовое решение.
Насколько это дорого в сравнении с оператором?
Прямое сравнение зарплаты оператора и стоимости минуты работы GPU некорректно. Совокупная стоимость владения (TCO) ИИ-системы включает инфраструктуру, разработку и поддержку, и она выше на старте. Однако предельная стоимость обработки одного дополнительного звонка у ИИ стремится к нулю, в то время как у оператора она постоянна. Экономия достигается за счёт масштаба и работы 24/7 без линейного роста ФОТ.
Что делать с персональными данными, которые озвучивают в звонке?
Необходимо внедрить систему автоматической анонимизации или псевдонимизации в процессе расшифровки речи. Чувствительные данные (ФИО, номера паспортов, телефоны) должны заменяться на токены или полностью удаляться из логов перед тем, как текст попадёт в модель. Также следует разработать и довести до пользователя политику хранения и обработки аудиозаписей.
Как убедиться, что ИИ не скажет что-то не то?
Основной механизм — ограничение генерации утверждённой базой знаний (RAG). Модель не сочиняет факты, а пересказывает то, что найдено в проверенных источниках. Дополнительно используются выходные фильтры, блокирующие нежелательный контент, и система мониторинга качества, где супервайзеры проверяют случайные выборки диалогов.
Источники
- Сбер запустил универсального ИИ-помощника на горячей линии «900
- В любой непонятной ситуации звони на 900: Сбер первым в России запустил универсального ИИ-помощника на горячей линии
- Кейс: Виртуальный ассистент Афина в контакт-центре Сбера
- Генеральные прокуроры 23 штатов США потребовали федерального регулирования ИИ
- Инвестиции в инфраструктуру ИИ могут достигнуть $10,3 трлн в 2025–2032 годах
- Рынок ИИ-ускорителей в 2026 году может превысить $200 млрд