Xora AI Искусственный
интеллект
Проверить готовность
01ИИ-трансформация02Направления03Продукты04Инфраструктура05Кейсы06Контакты
Проверить готовность

Корпоративный AI

AI нужен не только модели. Ему нужен контур

Проектируем и создаём корпоративный AI-контур: модели, данные, интеграции, доступы, инфраструктура и безопасность — внутри вашего периметра. Новые решения подключаются к готовой основе, а не строятся с нуля.

Как устроен

Одна основа. Много AI-задач

Контур связывает модели, данные, инфраструктуру и бизнес-системы компании.

Корпоративный AI-контур

МоделиДанныеИнтеграцииАрхитектураБезопасностьДоступыМониторинг
LegalSalesDocumentsKnowledgeOperationsDevelopment

Контур создаётся вместе с первым решением. Дальше новые задачи подключаются к уже готовой основе — без повторного строительства всего технологического фундамента.

Первый проект создаёт основу. Следующие используют её повторно.

Объём

Что делаем

On-premise развёртывание моделейПодбор модели под задачу и бюджетРоссийские и open-weight моделиМаскирование данныхРазграничение доступа по ролямСоответствие 152-ФЗ и требованиям к КИИМониторинг и контроль стоимости

Регулируемые отрасли

Финансы, медицина, ТЭК, госсектор — там, где внешние сервисы запрещены.

Коммерческая тайна

Любая компания, работающая с чувствительными данными.

Локализация

Организации с требованиями к размещению данных.

Экономика

Сколько это стоит в эксплуатации

Считать нужно не развёртывание, а год работы: оборудование, инференс, обслуживание, обновление моделей, мониторинг.

Расчёты, где эта часть не учтена, ошибаются кратно — и именно на них ломается большинство проектов. Мы даём оценку стоимости владения на год вперёд до начала работ.

Состав услуг

Что входит в инженерное направление

01

Аудит и рекомендации

Разбираем ИТ-контур, данные, модели потребления и нагрузку. За 1–2 недели выдаём архитектурную схему, спецификацию оборудования, смету и план внедрения — с вариантами «бюджет / оптимум / премиум» и обоснованием каждого решения.

02

Выбор варианта контура

Помогаем выбрать между облачной LLM, облаком с маскированием, on-premise / air-gap и гибридом с локальным оркестратором. Все варианты собраны на одном стеке, поэтому переход между ними не требует переписывать систему.

03

Расчёт под нагрузку

Считаем от бизнеса: пользователи × частота обращений × длина ответа → токены в секунду → необходимое число и класс GPU. Даём три уровня бюджета и предлагаем замерить реальную нагрузку в аренде до покупки оборудования.

04

Корпоративный доступ к ИИ

Единый интерфейс для команд с политиками MASK / BLOCK / ALLOW, шлюзом маскирования данных, оркестратором провайдеров и подписок, аудитом и контролем расходов по отделам.

05

Развёртывание

Разворачиваем в SaaS, российском облаке (Cloud.ru, Yandex Cloud, Selectel) или on-premise у вас. Стек контейнеризирован — вариант меняется без переписывания, переносятся те же контейнеры в более закрытый периметр.

06

Поставка GPU и серверов

Поставляем от одной карты до кластера: L4, L40S, A100, RTX PRO 6000, H100, H200, HGX-серверы, B200 / B300 и стойки GB200 / GB300 NVL72. Монтаж, тесты, запуск; возможна поэтапная оплата.

07

Эксплуатация и SLA

Берём на сопровождение: мониторинг (Prometheus, Grafana, Langfuse), обновление моделей без простоя, масштабирование и резервирование. SLA 99,5–99,9% с последующей передачей команде заказчика.

08

AI-ЦОД и GPU-кластеры

Проектируем вычислительное ядро: обучающие кластеры с NVLink и InfiniBand, мультиарендность, биллинг GPU-часов, приёмочные испытания и ввод в эксплуатацию.

Варианты контура

Четыре варианта ИИ-контура на одном стеке

Стоимость (GPU или плата за токены) и то, покидает ли чувствительный контекст периметр, определяет генеративная LLM. Поэтому деление на варианты относится именно к ней — данные, retrieval, агенты и приложение остаются в контуре компании во всех вариантах.

ВариантГде генеративная LLMЧто в контуре компанииКогда выбирать
A Облачная LLM напрямую GigaChat, YandexGPT или DeepSeek; запрос с контекстом уходит через egress-firewall без маскирования. Qdrant, Redis, MinIO, PostgreSQL, FastAPI и GPU-узел под эмбеддинги и reranker. Нечувствительные данные, пилот, обучение. Появились ПДн — переход на B без изменения остального.
B Облако + маскирование · рекомендуемый старт Внешняя модель получает только обезличенные токены; ответ демаскируется внутри контура. Всё из A плюс Masking Gateway, mTLS, NetworkPolicy, RBAC и Vault. Есть ПДн и коммерческая тайна, но пока нет готовности к капзатратам на большие GPU.
C On-premise / air-gap vLLM с локальной моделью 32–72B или MoE на GPU-узлах (A100, H100, H200, NVLink); выхода в интернет нет. HA-кластер Kubernetes: control-plane ×3, CPU-узлы, GPU node-pool, offline-реестр образов и весов, бэкап и DR. Чувствительные данные, импортонезависимость, стабильно высокая нагрузка — окупаются свои GPU.
D Локальный оркестратор + облако Малая LLM берёт классификацию, оценку чувствительности и простые ответы; топ-модель — только на ключевой запрос через маскирование. Как в B плюс локальная модель и TEI на одном GPU-узле. Нужна сила топовой модели на главном шаге, есть ПДн и важно не переплачивать за токены.

Переход A → B → C меняет только LLM-звено и периметр. Хранилище данных, RAG, агенты и интеграции остаются прежними — инвестиции в контур не теряются при ужесточении требований.

Единый стек

Один стек, разный периметр

Контур контейнеризирован и одинаков во всех вариантах: меняется только, где работает генеративная модель. Переход между облаком, гибридом и on-premise — это перенос тех же контейнеров, а не переписывание системы.

DockerKubernetesFastAPILangChain / LangGraphvLLMTEIQdrantRedisMinIOPostgreSQLLangfuseKeycloakVaultGitLab CIPrometheusGrafana

Расчёт под нагрузку

Считаем от бизнеса, а не от железа

Пользователи × частота обращений × длина ответа → токены в секунду → необходимое число и класс GPU. Три уровня бюджета, а реальную нагрузку можно замерить в аренде до покупки оборудования.

Бюджет

Минимальная конфигурация под старт и пилот: экономичные карты (L4, L40S, A100), инференс средних моделей, базовый мониторинг.

Оптимум

Баланс цены и запаса: H100 / H200, NVLink, резервирование по питанию и сети, SLA и предсказуемая стоимость владения на год.

Премиум

Максимальная плотность и скорость: HGX B200 / B300, InfiniBand, кластерная файловая система, SLA 24×7 и выделенный инженер.

Развёртывание

Где разворачиваем контур

SaaS

Быстрый старт без закупки оборудования — платите за использование. Подходит для пилота и нечувствительных задач.

Российское облако

Cloud.ru, Yandex Cloud, Selectel — аренда GPU и инфраструктуры в РФ-периметре, соответствие требованиям к размещению данных.

On-premise

Контур у вас: модели, данные и генерация внутри периметра, прозрачная стоимость владения и полный контроль.

Air-gap

Изолированный контур без выхода в интернет — для чувствительных данных, импортонезависимости и требований к КИИ.

Эксплуатация и SLA

Сопровождаем, а не бросаем после запуска

Берём контур на сопровождение и доводим до SLA, затем передаём команде заказчика — с документацией и обучением.

  • Мониторинг: Prometheus, Grafana, Langfuse — метрики, трейсинг LLM и алерты до аварии, а не после
  • Обновление моделей и компонентов без простоя, откат на предыдущую версию
  • Масштабирование узлов и реплик под рост нагрузки, резервирование по питанию и сети
  • SLA 99,5–99,9%, регламент реакции и восстановления
  • Передача контура команде заказчика с документацией и обучением

AI-ЦОД и GPU-кластеры

Вычислительное ядро под обучение и инференс

Проектируем и строим вычислительное ядро: от отдельного GPU-узла до обучающего кластера с мультиарендностью и биллингом GPU-часов.

  • Проектирование вычислительного ядра: топология, питание, охлаждение (воздух / СЖО), стойки
  • Обучающие кластеры с NVLink внутри узла и InfiniBand между узлами
  • Мультиарендность и изоляция проектов, квоты и приоритеты
  • Биллинг GPU-часов и прозрачный учёт потребления по командам
  • Приёмочные испытания, нагрузочное тестирование и ввод в эксплуатацию

Подбор

Выбор модели

Самая сильная модель не всегда нужная. Под задачу классификации избыточна модель, которая пишет тексты.

Мы подбираем по соотношению качества, скорости и стоимости инференса на вашей нагрузке.

Оборудование

GPU, серверы и конфигуратор

Подбираем и поставляем железо под контур — от одной карты до кластера. Популярные модели с ориентировочными ценами в магазине, своя сборка — в конфигураторе.

Проверка готовности

Проверьте, готова ли ваша компания к AI

15 вопросов, 4 минуты. На выходе — где главное ограничение, какие AI-сценарии реалистичны, какой эффект можно ожидать и что закрыть в первую очередь. Результат отправляется на рабочую почту.

Без продажи проекта. Сначала результат.