Xora AI Искусственный
интеллект
Проверить готовность
01ИИ-трансформация 02Направления 03Продукты 04Обучение 05Кейсы 06Блог 07Контакты
Проверить готовность

Новости ИИ

Дефицит GPU для ИИ в России: стратегии выживания и роста бизнеса

29.09.2026 Герман Греф констатировал острый дефицит вычислительных мощностей для ИИ в России из-за санкций. Для среднего и крупного бизнеса это означает необходимость перехода от стратегии закупки оборудования к управлению дефицитом через оптимизацию моделей, гибридную инфраструктуру и тестирование китайских и суверенных решений.

Что произошло

29 сентября 2026 года глава Сбербанка Герман Греф публично заявил, что развитие искусственного интеллекта в России сдерживается дефицитом вычислительных мощностей, нехваткой современных видеокарт и трудностями с закупкой передовых чипов из-за санкционных ограничений. Он отметил, что проблема затрагивает не только Сбер, но и другие крупные технологические компании, включая «Яндекс». Ранее Сбер уже сообщал о планах использовать китайские чипы для развития своей модели GigaChat, что подтверждает поиск альтернативных путей. Это заявление стало официальным подтверждением проблемы, с которой российский ИИ-сектор сталкивается уже несколько лет.

Ситуация является следствием экспортного контроля, введённого США и их союзниками после 2022 года. Ограничения затронули поставки в Россию передовых GPU, таких как NVIDIA H100 и A100, а также оборудования для производства полупроводников. Российские разработчики процессоров, включая МЦСТ и «Байкал Электроникс», потеряли доступ к производственным мощностям TSMC, а у «Байкала» была приостановлена лицензия на архитектуру ARM. Эти меры создали системный барьер для наращивания вычислительной базы, необходимой для обучения и инференса современных моделей.

Проблема усугубляется сокращением каналов параллельного импорта. По данным отраслевых изданий, поставки серверов через этот канал упали с тысяч единиц в 2024 году до десятков в 2026 году. В мае 2026 года из перечня параллельного импорта были исключены ключевые позиции: серверы, материнские платы, процессоры и накопители ряда западных брендов, включая HP, HPE, Intel и Cisco. Это сделало закупку даже не самых новых компонентов рискованной и непредсказуемой, превратив дефицит из временного явления в хроническое.

По оценкам, Китай обеспечивает около 90% санкционных технологических импортов России, однако китайские государственные и аффилированные с государством структуры способны переплачивать за оборудование в 2–3 раза, вытесняя российских частных покупателей с рынка. В результате даже доступные китайские решения становятся дорогими и дефицитными. Констатация Грефа о том, что китайские компании не испытывают ограничений в мощностях в отличие от российских, подчёркивает растущий технологический разрыв.

Как это устроено

Санкционная блокада и цепочки поставок

Основной механизм дефицита — экспортный контроль США, который запрещает продажу в Россию высокопроизводительных GPU и связанных технологий. Это касается не только готовых видеокарт, но и компонентов для их создания, а также программного обеспечения. Параллельный импорт, который временно смягчал ситуацию, сейчас практически исчерпан из-за усиления контроля со стороны производителей и логистических компаний. Исключение серверных компонентов из официального списка параллельного импорта в мае 2026 года легализовало риски и сделало крупные закупки юридически небезопасными для большинства корпораций. Доступ к мощностям превратился из операционной задачи в задачу управления рисками.

Экономика дефицита и ценовая инфляция

Ограниченное предложение и высокий спрос привели к резкому росту цен. Если в 2025 году минимальная конфигурация на базе NVIDIA для запуска одной передовой модели стоила около 13,7 млн рублей, то в 2026 году её стоимость достигла 38,8 млн рублей. Для развёртывания моделей, требующих восемь ускорителей B300 или H200, затраты оцениваются в 55–80 млн рублей. Наценка на оборудование, поставляемое через серые каналы, может достигать 250% от базовой цены на американском рынке. Это делает классический подход «купить и масштабировать» экономически нецелесообразным для большинства компаний, за исключением крупнейших госкорпораций.

Техническая сложность построения кластера

Промышленный ИИ-кластер — это не просто набор видеокарт. Его эффективность зависит от множества компонентов: высокоскоростных сетевых интерфейсов (NVLink, InfiniBand), объёма и скорости памяти HBM, производительности систем хранения, эффективности охлаждения и стабильности электропитания. Дефицит распространяется на все эти элементы. Закупка ускорителей без сопутствующей инфраструктуры приводит к тому, что кластер работает с низкой утилизацией, а его производительность ограничивается медленными узлами или узкими местами в сети. Простое наличие GPU не гарантирует полезную вычислительную мощность без сбалансированной архитектуры.

Китайский стек: альтернатива с оговорками

Китайский аппаратно-программный стек, в первую очередь на базе ускорителей Huawei Ascend, является основной альтернативой NVIDIA. Однако переход на него не является прямым заменителем. Ускорители Huawei используют собственную программную экосистему CANN (Compute Architecture for Neural Networks), которая несовместима с CUDA. Перенос существующих CUDA-ориентированных приложений требует глубокой адаптации кода, операторов и библиотек. Тесты показывают, что для ряда задач может требоваться большее количество ускорителей Huawei по сравнению с NVIDIA для достижения сопоставимой производительности, а совместимость подтверждается не для всех моделей. Это создаёт дополнительные затраты на разработку и необходимость наличия инженеров с компетенциями в экосистеме Huawei.

Суверенные решения: текущий статус и перспективы

Российские разработки в области ускорителей и процессоров важны для обеспечения технологического суверенитета, особенно в контурах обработки критически важных данных. Однако в открытых источниках на сегодняшний день отсутствуют подтверждённые данные, свидетельствующие о сопоставимости их производительности с NVIDIA H100/H200 в задачах обучения крупных языковых или фундаментальных моделей. Поэтому суверенные решения следует рассматривать в первую очередь как инструмент для обеспечения безопасности данных, работы в изолированных сред и снижения рисков отключения зарубежных сервисов. Они не могут в полной мере заменить глобальную инфраструктуру для обучения передовых моделей в среднесрочной перспективе.

Как это выглядит на практике

Сценарий 1: Средняя ритейл-компания

Компания внедряет систему персональных рекомендаций и чат-бота для клиентской поддержки. По нашему опыту проектов, для таких задач не требуется обучение с нуля. Стратегия заключается в использовании открытой языковой модели и её дообучении (fine-tuning) на внутренних данных о покупках и клиентских запросах. Для этого формируется небольшой кластер из 4–8 GPU предыдущих поколений (например, NVIDIA A40 или A30), приобретённых через параллельный импорт. Основной фокус делается на оптимизации: применяются техники LoRA (Low-Rank Adaptation) для параметрэффективного дообучения и квантование модели для инференса. Инференс разворачивается на серверах с менее мощными GPU или даже на CPU для обработки простых запросов, что позволяет значительно сократить совладающую стоимость владения (TCO).

Сценарий 2: Крупное промышленное предприятие

Предприятие внедряет систему компьютерного зрения для контроля качества на конвейере и модель предиктивной аналитики для прогнозирования поломок оборудования. Данные с производственных линий являются критически важными и не могут покидать периметр компании. Здесь применяется гибридный подход. Для инференса моделей компьютерного зрения непосредственно на производстве используется серверная инфраструктура на базе российских процессоров и ускорителей, где это возможно. Для обучения более сложной предиктивной модели, требующей значительных вычислительных ресурсов, выделяется отдельный контур. Компания арендует вычислительные мощности в партнёрском ЦОДе, который имеет доступ к кластеру на базе китайских ускорителей Huawei Ascend. Перед передачей данных в арендуемый кластер они проходят процедуру анонимизации и агрегации.

Сценарий 3: Финансовая корпорация

Корпорация разрабатывает большую языковую модель для анализа нормативно-правовой документации и внутреннего корпоративного поиска. Масштаб задачи требует значительных вычислений. Стратегия заключается в построении гетерогенной инфраструктуры. Основной кластер для предварительного обучения модели формируется из доступных ускорителей NVIDIA, закупленных по высоким ценам. Параллельно создаётся пилотный кластер на базе Huawei Ascend для тестирования перенода части рабочих нагрузок и снижения зависимости от одного поставщика. Компания инвестирует в MLOps-платформу, способную управлять задачами на разных архитектурах, и активно применяет дистилляцию и квантование для создания более компактных специализированных моделей для инференса, которые работают на менее дефицитном оборудовании.

Что это значит для российской компании

Дефицит вычислительных мощностей кардинально меняет подходы к планированию ИИ-инициатив. Прямая закупка западного оборудования стала высокорисковой и дорогостоящей. Параллельный импорт больше не является надёжным каналом, его объёмы сокращаются, а юридические риски растут. Китайские решения, будучи основной доступной альтернативой, требуют существенных инвестиций в адаптацию ПО и обучение персонала под свою экосистему, не гарантируя при этом производительности на уровне NVIDIA. Суверенные чипы и процессоры подходят для решения задач с ограниченными вычислительными требованиями в изолированных контурах, но не готовы заменить мировых лидеров в训练大型模型.

Бюджеты проектов смещаются от капитальных затрат (CAPEX) на закупку «железа» в сторону операционных расходов (OPEX) на разработку, оптимизацию и управление гетерогенной средой. Процесс закупки превращается из чисто коммерческой функции в задачу управления рисками, требующую юридической и технической экспертизы. Компании вынуждены пересматривать свои ИИ-стратегии, отдавая приоритет не максимальной мощности, а её эффективному использованию.

Стратегия Доступность в России Риски производительности Структура затрат Санкционные и правовые ограничения
NVIDIA (параллельный импорт) Низкая, каналы непрозрачны Минимальны (золотой стандарт) Высокие CAPEX (инфляция 2.5x) и OPEX (риск простоя) Высокие риски вторичных санкций, отсутствие гарантии и поддержки
Китайский стек (Huawei Ascend) Средняя, но с конкуренцией со стороны гос-структур Китая Средние (требует больше чипов, проблемы с портированием ПО) Высокие CAPEX, высокие OPEX на адаптацию ПО и персонал Более низкие прямые санкционные риски, но риск зависимости от одного поставщика
Суверенные решения Низкая (серийное производство не налажено) Высокие (нет данных о производительности на уровне H100 для LLM) Средние CAPEX, низкие OPEX (для совместимых задач) Минимальные, поддерживается государством

Что делать: пошагово

  1. Провести полный аудит текущих и планируемых на 2–3 года вперёд ИИ-проектов с детализацией требуемых вычислительных ресурсов для обучения и инференса.
  2. Классифицировать все рабочие нагрузки по критериям критичности, требований к безопасности данных и чувствительности к производительности.
  3. Приоритизировать архитектурную оптимизацию: внедрить LoRA/Adapters для дообучения, квантование и дистилляцию для инференса, а также RAG для снижения требований на размер модели.
  4. Разработать гибридную инфраструктурную стратегию, чётко разделив контуры: чувствительные данные и критичный инференс — on-premise (в том числе на суверенных решениях), пиковые нагрузки и обучение — в арендованных или партнёрских ЦОД.
  5. Запустить пилотный проект на альтернативном аппаратном обеспечении (например, кластер из 2–4 узлов Huawei Ascend) для оценки реальной производительности и сложности переноса ваших ключевых моделей.
  6. Инвестировать в платформенную инженерию и MLOps: создать единый слой оркестрации для управления задачами на разнородном оборудовании, внедрить системы мониторинга и профилирования.
  7. Диверсифицировать каналы закупки, постоянно оценивая юридические и операционные риски каждого из них, и формировать стратегический запас критически важных компонентов.
  8. Начать развивать внутренние компетенции по работе с альтернативными программными стеками (CANN, фреймворки под российские архитектуры), снизив зависимость от CUDA-экосистемы.

Типичные ошибки

  1. Попытка построить кластер «по старым лекалам». Стремление закупить однородный кластер из десятков современных NVIDIA GPU приводит к провалу проектов из-за нереалистичных сроков, бюджетов и высокого риска срыва поставок.
  2. Пренебрежение оптимизацией моделей. Обучение больших моделей с нуля вместо дообучения открытых или использования техник parameter-efficient fine-tuning ведёт к колоссальной и неоправданной трате дефицитных вычислительных ресурсов.
  3. Слепая вера в «drop-in» заменители. Предположение, что китайские ускорители являются полным аналогом NVIDIA, приводит к потере времени и денег на интеграцию, несовместимость ПО и неоправданным ожиданиям производительности.
  4. Фокус только на GPU. Закупка ускорителей без должного внимания к сети, хранению, охлаждению и электропитанию создаёт инфраструктурные бутылочные горлышки, и дорогие GPU простаивают без дела.
  5. Недооценка программной блокировки. Игнорирование затрат на перенос кода с CUDA на другие платформы (например, CANN) становится скрытой статьёй расходов, которая может превысить экономию на аппаратном обеспечении.
  6. Зависимость от одного канала снабжения. Полная опора на одного поставщика в условиях параллельного импорта создаёт единую точку отказа: его проблемы с логистикой или правоохранительными органами остановят весь ваш ИИ-проект.

Как понять, что вы на верном пути

  1. Стоимость инференса на один запрос или обработки одного единицы данных стабильно снижается благодаря оптимизации и использованию более дешёвых контуров.
  2. Время вывода на рынок новых ИИ-функций не увеличивается, несмотря на ограничения по «железу», за счёт отлаженных процессов и гибкой инфраструктуры.
  3. Ваша команда способна безболезненно разворачивать и поддерживать модели как минимум на двух различных аппаратных платформах (например, NVIDIA и Ascend).
  4. Процесс закупки вычислительных мощностей включает оценку рисков и имеет несколько взаимозаменяемых вариантов, а не зависит от одного «серого» импортёра.
  5. Вы достигаете сопоставимых или лучших бизнес-результатов, используя меньше вычислительных ресурсов, чем год назад, за счёт более эффективных архитектур и моделей.
  6. Ваша стратегия управления данными чётко определяет, какие нагрузки должны исполняться исключительно на суверенной инфраструктуре, а для каких допустимы гибридные схемы.

Вопросы, которые нам задают

Стоит ли сейчас вкладываться в NVIDIA, если удастся найти надёжный канал?

Да, но с оговорками. Вкладываться имеет смысл для критически важных задач, где производительность и зрелость экосистемы CUDA являются решающими факторами и не могут быть заменены. Однако не следует делать это единственной стратегией. Рассматривайте такие закупки как дорогостоящий актив высокого риска, который необходимо использовать максимально эффективно и который обязательно должен быть подкреплён планами по переходу на альтернативы.

Насколько реально полностью перейти на Huawei Ascend?

Полный переход возможен для узкого круга задач, не требующих сложной экосистемы или специфических библиотек из мира NVIDIA. Для большинства компаний, уже использующих CUDA, реалистичнее выглядит стратегия постепенного переноса отдельных некритичных рабочих нагрузок. Это требует пилотного проекта, инвестиций в обучение команды под CANN и готовности к тому, что производительность может оказаться ниже, а затраты на разработку — выше первоначальных оценок.

Когда российские чипы смогут заменить иностранные для обучения больших моделей?

На основе имеющихся на сегодняшний день открытых данных, невозможно назвать реалистичные сроки. Российские разработчики делают шаги в создании собственных ускорителей, но их производительность и серийность пока не сопоставимы с мировыми лидерами в сегменте обучения LLM. Стратегически правильным считать их развитие и применять там, где они уже сейчас конкурентоспособны: в задачах инференса для компьютерного зрения, в контроллерах и в системах с ограниченными требованиями к вычислениям. Рассчитывать на замену NVIDIA в обучении фундаментальных моделей в ближайшие 1–2 года не стоит.

Источники

Вывод

Выигрывает не тот, у кого больше GPU, а тот, кто эффективнее использует каждый доступный ускоритель.

По теме

Ещё о том же

8 октября 2026

Суверенный и национальный ИИ в РФ: руководство по выбору для бизнеса

1 сентября 2026 года в РФ вступил в силу закон, вводящий статусы «суверенной» и «национальной» ИИ-модели. Это определяет новые правила для закупок, архитектуры и комплаенса, делая выбор ИИ-решения юридически значимым решением.

8 октября 2026

Пожар в дата-центре Яндекса: системный риск для ИИ-инфраструктуры и стратегии устойчивости

8 октября 2026 года атака БПЛА на дата-центр «Яндекса» в Сасове полностью остановила площадку и зону Yandex Cloud ru-central1-b. Инцидент обнажил системный риск российского бизнеса: физическую концентрацию ИИ-вычислений в едином контуре без подготовленного резервирования.

7 октября 2026

Mistral Large 4: экономика open-weight для российского бизнеса

Mistral AI представила open-weight-модель триллионного масштаба. Для российского бизнеса это создаёт новую альтернативу импортным API, но требует оценки рисков, затрат и соответствия регуляторным требованиям.

Проверка готовности

Проверьте, готова ли ваша компания к AI

15 вопросов, 4 минуты. На выходе — где главное ограничение, какие AI-сценарии реалистичны, какой эффект можно ожидать и что закрыть в первую очередь.