Корпоративный AI
AI нужен не только модели. Ему нужен контур
Проектируем и создаём корпоративный AI-контур: модели, данные, интеграции, доступы, инфраструктура и безопасность — внутри вашего периметра. Новые решения подключаются к готовой основе, а не строятся с нуля.
Как устроен
Одна основа. Много AI-задач
Контур связывает модели, данные, инфраструктуру и бизнес-системы компании.
Корпоративный AI-контур
Контур создаётся вместе с первым решением. Дальше новые задачи подключаются к уже готовой основе — без повторного строительства всего технологического фундамента.
Первый проект создаёт основу. Следующие используют её повторно.
Объём
Что делаем
Регулируемые отрасли
Финансы, медицина, ТЭК, госсектор — там, где внешние сервисы запрещены.
Коммерческая тайна
Любая компания, работающая с чувствительными данными.
Локализация
Организации с требованиями к размещению данных.
Экономика
Сколько это стоит в эксплуатации
Считать нужно не развёртывание, а год работы: оборудование, инференс, обслуживание, обновление моделей, мониторинг.
Состав услуг
Что входит в инженерное направление
Аудит и рекомендации
Разбираем ИТ-контур, данные, модели потребления и нагрузку. За 1–2 недели выдаём архитектурную схему, спецификацию оборудования, смету и план внедрения — с вариантами «бюджет / оптимум / премиум» и обоснованием каждого решения.
Выбор варианта контура
Помогаем выбрать между облачной LLM, облаком с маскированием, on-premise / air-gap и гибридом с локальным оркестратором. Все варианты собраны на одном стеке, поэтому переход между ними не требует переписывать систему.
Расчёт под нагрузку
Считаем от бизнеса: пользователи × частота обращений × длина ответа → токены в секунду → необходимое число и класс GPU. Даём три уровня бюджета и предлагаем замерить реальную нагрузку в аренде до покупки оборудования.
Корпоративный доступ к ИИ
Единый интерфейс для команд с политиками MASK / BLOCK / ALLOW, шлюзом маскирования данных, оркестратором провайдеров и подписок, аудитом и контролем расходов по отделам.
Развёртывание
Разворачиваем в SaaS, российском облаке (Cloud.ru, Yandex Cloud, Selectel) или on-premise у вас. Стек контейнеризирован — вариант меняется без переписывания, переносятся те же контейнеры в более закрытый периметр.
Поставка GPU и серверов
Поставляем от одной карты до кластера: L4, L40S, A100, RTX PRO 6000, H100, H200, HGX-серверы, B200 / B300 и стойки GB200 / GB300 NVL72. Монтаж, тесты, запуск; возможна поэтапная оплата.
Эксплуатация и SLA
Берём на сопровождение: мониторинг (Prometheus, Grafana, Langfuse), обновление моделей без простоя, масштабирование и резервирование. SLA 99,5–99,9% с последующей передачей команде заказчика.
AI-ЦОД и GPU-кластеры
Проектируем вычислительное ядро: обучающие кластеры с NVLink и InfiniBand, мультиарендность, биллинг GPU-часов, приёмочные испытания и ввод в эксплуатацию.
Варианты контура
Четыре варианта ИИ-контура на одном стеке
Стоимость (GPU или плата за токены) и то, покидает ли чувствительный контекст периметр, определяет генеративная LLM. Поэтому деление на варианты относится именно к ней — данные, retrieval, агенты и приложение остаются в контуре компании во всех вариантах.
| Вариант | Где генеративная LLM | Что в контуре компании | Когда выбирать | |
|---|---|---|---|---|
| A | Облачная LLM напрямую | GigaChat, YandexGPT или DeepSeek; запрос с контекстом уходит через egress-firewall без маскирования. | Qdrant, Redis, MinIO, PostgreSQL, FastAPI и GPU-узел под эмбеддинги и reranker. | Нечувствительные данные, пилот, обучение. Появились ПДн — переход на B без изменения остального. |
| B | Облако + маскирование · рекомендуемый старт | Внешняя модель получает только обезличенные токены; ответ демаскируется внутри контура. | Всё из A плюс Masking Gateway, mTLS, NetworkPolicy, RBAC и Vault. | Есть ПДн и коммерческая тайна, но пока нет готовности к капзатратам на большие GPU. |
| C | On-premise / air-gap | vLLM с локальной моделью 32–72B или MoE на GPU-узлах (A100, H100, H200, NVLink); выхода в интернет нет. | HA-кластер Kubernetes: control-plane ×3, CPU-узлы, GPU node-pool, offline-реестр образов и весов, бэкап и DR. | Чувствительные данные, импортонезависимость, стабильно высокая нагрузка — окупаются свои GPU. |
| D | Локальный оркестратор + облако | Малая LLM берёт классификацию, оценку чувствительности и простые ответы; топ-модель — только на ключевой запрос через маскирование. | Как в B плюс локальная модель и TEI на одном GPU-узле. | Нужна сила топовой модели на главном шаге, есть ПДн и важно не переплачивать за токены. |
Переход A → B → C меняет только LLM-звено и периметр. Хранилище данных, RAG, агенты и интеграции остаются прежними — инвестиции в контур не теряются при ужесточении требований.
Единый стек
Один стек, разный периметр
Контур контейнеризирован и одинаков во всех вариантах: меняется только, где работает генеративная модель. Переход между облаком, гибридом и on-premise — это перенос тех же контейнеров, а не переписывание системы.
Расчёт под нагрузку
Считаем от бизнеса, а не от железа
Пользователи × частота обращений × длина ответа → токены в секунду → необходимое число и класс GPU. Три уровня бюджета, а реальную нагрузку можно замерить в аренде до покупки оборудования.
Бюджет
Минимальная конфигурация под старт и пилот: экономичные карты (L4, L40S, A100), инференс средних моделей, базовый мониторинг.
Оптимум
Баланс цены и запаса: H100 / H200, NVLink, резервирование по питанию и сети, SLA и предсказуемая стоимость владения на год.
Премиум
Максимальная плотность и скорость: HGX B200 / B300, InfiniBand, кластерная файловая система, SLA 24×7 и выделенный инженер.
Развёртывание
Где разворачиваем контур
SaaS
Быстрый старт без закупки оборудования — платите за использование. Подходит для пилота и нечувствительных задач.
Российское облако
Cloud.ru, Yandex Cloud, Selectel — аренда GPU и инфраструктуры в РФ-периметре, соответствие требованиям к размещению данных.
On-premise
Контур у вас: модели, данные и генерация внутри периметра, прозрачная стоимость владения и полный контроль.
Air-gap
Изолированный контур без выхода в интернет — для чувствительных данных, импортонезависимости и требований к КИИ.
Эксплуатация и SLA
Сопровождаем, а не бросаем после запуска
Берём контур на сопровождение и доводим до SLA, затем передаём команде заказчика — с документацией и обучением.
- Мониторинг: Prometheus, Grafana, Langfuse — метрики, трейсинг LLM и алерты до аварии, а не после
- Обновление моделей и компонентов без простоя, откат на предыдущую версию
- Масштабирование узлов и реплик под рост нагрузки, резервирование по питанию и сети
- SLA 99,5–99,9%, регламент реакции и восстановления
- Передача контура команде заказчика с документацией и обучением
AI-ЦОД и GPU-кластеры
Вычислительное ядро под обучение и инференс
Проектируем и строим вычислительное ядро: от отдельного GPU-узла до обучающего кластера с мультиарендностью и биллингом GPU-часов.
- Проектирование вычислительного ядра: топология, питание, охлаждение (воздух / СЖО), стойки
- Обучающие кластеры с NVLink внутри узла и InfiniBand между узлами
- Мультиарендность и изоляция проектов, квоты и приоритеты
- Биллинг GPU-часов и прозрачный учёт потребления по командам
- Приёмочные испытания, нагрузочное тестирование и ввод в эксплуатацию
Подбор
Выбор модели
Самая сильная модель не всегда нужная. Под задачу классификации избыточна модель, которая пишет тексты.
Мы подбираем по соотношению качества, скорости и стоимости инференса на вашей нагрузке.
Оборудование
GPU, серверы и конфигуратор
Подбираем и поставляем железо под контур — от одной карты до кластера. Популярные модели с ориентировочными ценами в магазине, своя сборка — в конфигураторе.
Проверка готовности
Проверьте, готова ли ваша компания к AI
15 вопросов, 4 минуты. На выходе — где главное ограничение, какие AI-сценарии реалистичны, какой эффект можно ожидать и что закрыть в первую очередь. Результат отправляется на рабочую почту.
Без продажи проекта. Сначала результат.