Импортозамещение в ИИ-инфраструктуре: GPU, серверы и ПО для on-premise LLM в 2026
Что реально доступно для закрытого контура: альтернативы NVIDIA, российские серверы из реестра, программный стек и гибридные сценарии — без маркетинга и выдуманных бенчмарков
Собрать on-premise LLM в закрытом контуре можно уже сегодня, но «полностью отечественного» стека под тяжёлые нагрузки в 2026 году на рынке нет. Слабое звено — не серверы (их в реестре Минпромторга достаточно) и не операционные системы, а сами ускорители и зрелость софта под них. Реалистичный путь для КИИ и госсектора — гибрид: российское шасси из реестра плюс доступные GPU, где NVIDIA закрывает обучение, а альтернативы вроде Huawei Ascend — inference, с оговорками по поддержке и совместимости. Все конкретные модели, характеристики и требования реестров нужно перепроверять на дату закупки: они меняются каждый квартал.
Три ограничения, на пересечении которых живёт решение
Инфраструктуру под ИИ обычно вспоминают последней. Модель выбрали, пилот на арендованных мощностях отработал, спонсор проекта уже показал результат правлению — и тут выясняется, что для промышленного запуска в своём контуре нужно железо, которого либо нет в поставке, либо оно не проходит по реестру.
«Купить сервер с GPU» оказывается не строчкой в заявке, а развилкой. У коммерческой компании выбор упирается в цену и сроки. У КИИ-объекта или госзаказчика поверх этого ложится реестр, балльная система локализации и приоритет отечественной продукции на торгах — и это меняет всю логику подбора.
Техника
Производительность под профиль нагрузки, объём и пропускная способность памяти ускорителя, топология узла.
Провал: Модель не влезает или работает медленно; переплата за неиспользуемую мощность.
Реестр и закупка
Запись в реестре Минпромторга (ГИСП), баллы локализации под действующую редакцию правил, приоритет отечественной продукции на торгах.
Провал: Позиция отклоняется на торгах или признаётся иностранной для целей закупки.
Эксплуатация
Сервис и ЗИП на территории РФ, гарантия при параллельном импорте, документация, подтверждённая совместимость с отечественной ОС.
Провал: Через два-три года оборудование превращается в неподдерживаемый риск.
Из этого следует неприятная для планирования вещь: оптимум по одному ограничению легко проваливается по другому. Самая быстрая карта не проходит по реестру или остаётся без сервиса. Идеально «реестровая» конфигурация не тянет нагрузку. Оптимизировать приходится по всем трём сразу — именно поэтому «просто купить помощнее» здесь не работает.
Конкретный перечень того, что обязательно, а что даёт преимущество на торгах, зависит от типа заказчика (44-ФЗ или 223-ФЗ), категории значимости объекта КИИ и актуальной редакции подзаконных актов. Правила менялись несколько раз, поэтому единственно верный источник — свежая выписка из реестра и действующая редакция постановлений на дату публикации извещения. Не статья в блоге и не презентация поставщика.
GPU-ускорители: что реально доступно
Базовая точка отсчёта — ускорители NVIDIA (H100 и новее) с экосистемой CUDA. Не из-за маркетинга, а потому что вокруг них за пятнадцать с лишним лет сложился зрелый софтверный слой: cuDNN, NCCL, TensorRT, глубокая интеграция с PyTorch. Любая альтернатива сравнивается именно с этой базой — и чаще проигрывает не в цифрах, а в предсказуемости.
Отдельно про цифры. Характеристики неамериканских ускорителей в открытых источниках расходятся в разы: для одного и того же чипа встречаются и 256, и 800 TFLOPS в FP16 — смотря кто считает и в какой конфигурации. Поэтому в таблице ниже даны ориентиры относительно H100, а не «точные» значения, и каждое из них требует подтверждения бенчмарком на вашей задаче.
| Вариант | Память | Производительность | Софт и зрелость | Доступность в РФ | Назначение | Ключевые риски |
|---|---|---|---|---|---|---|
| NVIDIA H100 / новее | 80–96 ГБ HBM | Промышленный эталон | CUDA, PyTorch «из коробки». Зрелость высокая | Только параллельный импорт | Обучение + inference | Цена, гарантия при параллельном импорте, санкционная доступность |
| Huawei Ascend 910C | до ~128 ГБ HBM (в сервере Atlas) | ~60–70% H100 на inference по независимым оценкам; заявления вендора выше | CANN + torch_npu, MindSpore. Зрелость средняя | Через Atlas и параллельные каналы | Прежде всего inference | Незрелый софт, стабильность torch_npu, поддержка |
| Ascend 910B | до 64 ГБ HBM | Ниже 910C | CANN + torch_npu. Зрелость средняя | Ограниченно | Inference | Те же, что у 910C, поколение старше |
| Moore Threads / Iluvatar | Зависит от модели | Требует проверки | Собственные стеки, частичный PyTorch. Зрелость низкая для LLM | Экзотика для российского рынка | Нишевый inference | Доступность, поддержка, софт |
| МЦСТ «Эльбрус» (CPU) | Системная RAM | Не GPU-класс | LCC, нативная сборка. Своя экосистема | Есть в реестре | CPU-нагрузки, не тяжёлый LLM | Не заменяет GPU под LLM |
Диапазоны и оценки — на дату публикации. Заявления вендоров отделены от независимых оценок; и те и другие требуют проверки на конкретной нагрузке.
Частое заблуждение: «Эльбрус» как замена GPU
«Эльбрус» — это универсальный процессор (архитектура VLIW), а не GPU-ускоритель. На нём запускают отдельные нейросетевые задачи, и есть работы по оптимизации моделей под эту архитектуру. Но обучение и высоконагруженный inference больших языковых моделей — не его класс задач. Для доверенных CPU-нагрузок в госсегменте он полезен; как замену GPU под LLM его закладывать не стоит. Анонсированный «Эльбрус-Б» — проект с горизонтом 2027+, в критический путь закупки на 2026 год он не встаёт.
Практический ориентир, который часто теряется за спорами о TFLOPS: объём памяти ускорителя обычно важнее пиковой мощности. Для inference LLM решает, сколько параметров и какой длины контекст физически помещается в карту и с какой скоростью до них добираешься. Отсюда, кстати, и интерес к платформам с большим суммарным HBM в одном узле — на них влезает крупная модель без дробления по картам.
Серверные платформы: где импортозамещение работает
Парадокс: с серверами ситуация заметно здоровее, чем с ускорителями. Российские вендоры выпускают серверные платформы, внесённые в реестр Минпромторга, в том числе шасси под несколько GPU. Встречаются модели с поддержкой до восьми полноразмерных ускорителей, а материнские платы собственной разработки уже попадают в реестр как продукция с российским уровнем локализации.
Нюанс, который важно проговорить до отчётности: «российский сервер» — это чаще всего про шасси, материнскую плату, BMC, прошивку и локальную сборку. Процессоры в таких платформах, как правило, Intel Xeon или AMD EPYC; отечественные CPU в GPU-серверах пока встречаются реже. Сам ускоритель в подавляющем большинстве случаев остаётся импортным. Реестровая запись подтверждает происхождение платформы, но не делает импортный GPU внутри неё отечественным.
Питание и охлаждение
GPU-узел на шесть-восемь карт — это десятки киловатт: у плотных inference-платформ энергопотребление узла доходит до ~15 кВт. Отсюда отдельные требования к стойке, электрике и охлаждению ЦОДа. Типовой срыв выглядит так: узел подобрали по производительности, он прошёл по реестру, а на этапе размещения выяснилось, что в серверной нет стойки, которая держит такую плотность по питанию и теплу — и монтаж уехал на квартал под реконструкцию электрики. GPU в прайсе видно, а киловатты и стойку — нет.
Топология и межсоединения
Сколько GPU в узле, как они связаны (PCIe, аналоги NVLink, внешние PCIe-фабрики), хватает ли пропускной способности под вашу модель. Для крупной модели, которую придётся дробить по картам, это критично.
Сервис и гарантия
На шасси у российского вендора это решается лучше, чем на самом GPU. Проверять нужно контур целиком, вместе с ускорителем — включая условия гарантии при параллельном импорте.
По серверной платформе импортозамещение реально работает и подтверждается реестром. Слабое звено «отечественности» сидит внутри узла — в самом ускорителе. Для 2026 года это нормальная и честная конфигурация. Важно только не подменять понятия: «реестровый сервер с импортным GPU» — это не «полностью отечественная ИИ-инфраструктура». На защите проекта эту разницу лучше проговорить самому, чем услышать вопрос от проверяющего.
Программный стек: настоящая граница импортозамещения
Про железо спорят на совещаниях, а срывает сроки обычно софт. Базовый стек индустрии — PyTorch поверх CUDA; за пятнадцать лет он оброс библиотеками и отлажен так, что «просто работает». Именно с этим «просто работает» и сравнивается любая альтернатива.
Для Ascend альтернатива существует: связка CANN (аналог CUDA от Huawei) и адаптера torch_npu, который запускает PyTorch-модели на NPU через механизм PrivateUse1. Huawei в 2025 году открыл исходники CANN — шаг стратегически верный, но зрелость пока отстаёт. Адаптер живёт вне основного дерева PyTorch, поэтому изменения в ядре не тестируются на совместимость автоматически, а часть публичных моделей требует ручной адаптации. Миграция рабочей нагрузки с CUDA на Ascend — это не «сменили драйвер», а проект с портированием, отладкой операторов и просадками, которые всплывают не вовремя.
| Слой стека | Статус импортозамещения | Комментарий |
|---|---|---|
| Обучение и inference на NVIDIA (CUDA + PyTorch) | Импортное, но зрелое | Эталон предсказуемости, с которым сравнивают остальное |
| Inference на Ascend (CANN + torch_npu) | Доступно, зрелость средняя | Работает на типовых открытых моделях; нетривиальный кастом требует усилий |
| Inference-движки (vLLM, TGI и аналоги) | Открытый софт | Заменять по сути нечего: стек и так открытый |
| Контейнеризация (Docker, Kubernetes) | Открытый софт на российском Linux | Живёт на Astra Linux, РЕД ОС и других дистрибутивах |
| Мониторинг (Prometheus, Grafana, Zabbix) | Открытый софт | Проблемы импортозамещения здесь нет |
Так что если честно обозначать предел импортозамещения, он проходит именно здесь — по софту под неNVIDIA-ускорители. Железо купить можно. Заставить его стабильно и предсказуемо крутить вашу конкретную нагрузку — отдельная работа со своим бюджетом, сроками и рисками. Её и планировать надо как проект, а не как строчку «установка и настройка» в смете.
Гибридная архитектура: четыре рабочих сценария
Раз «чистого» отечественного стека под тяжёлый ИИ в 2026 году нет, разумная архитектура — гибридная. Четыре варианта, от самого прагматичного к самому амбициозному.
NVIDIA под обучение, альтернативы под inference
Тяжёлый fine-tuning и обучение остаются на NVIDIA, где критична предсказуемость. Высоконагруженный inference уже обученной модели уходит на Ascend или отечественные ускорители, где софт вытягивает. Разделение идёт по типу нагрузки, а не по вендору.
Российское шасси плюс доступные GPU
Серверная платформа из реестра Минпромторга даёт баллы локализации и проходит по закупке, а внутрь ставятся те ускорители, что реально доступны в поставке. Компромисс, честно проходящий и по реестру, и по технике.
On-premise inference плюс внешние эксперименты
Чувствительные данные обрабатываются только в закрытом контуре на своём железе. Ресурсоёмкие эксперименты и обучение на обезличенных или синтетических данных выносятся во внешнюю инфраструктуру. Экономит CAPEX на пиковые нагрузки.
Постепенная миграция на отечественный стек
Начать с гибрида и переносить нагрузки по мере созревания российских и доступных альтернатив вместе с их софтом. Это многолетняя программа с контрольными точками, а не разовое переключение.
Схема гибридной архитектуры в закрытом контуре
Внешняя рамка — закрытый контур КИИ: сегментация сетей, контроль доступа, журналирование.
Слой платформы — отечественный сервер из реестра Минпромторга. Внутри узла два блока ускорителей: NVIDIA под обучение и fine-tuning, Ascend или отечественные ускорители под inference.
Слой софта — открытый стек на российском Linux: PyTorch, vLLM или TGI, Kubernetes, Prometheus и Grafana для мониторинга.
Гибрид часто воспринимают как «недоимпортозамещение», временный компромисс до лучших времён. На деле это просто инженерно честный ответ на реальность 2026 года: запустить ИИ в контуре сейчас, набрать баллы локализации на уровне платформы и не захлопнуть дверь для миграции, когда альтернативы дозреют. Ждать «полностью отечественный стек», простаивая, — решение хуже любого из четырёх сценариев выше.
Структура расчёта стоимости
Готовых цен здесь не будет намеренно: рынок GPU волатилен, курс и каналы поставки меняют смету на десятки процентов за квартал, и любая «средняя цифра» вводила бы в заблуждение. Полезнее структура, по которой считать под свой проект — общую методику разбора бюджета мы давали в статье про стоимость внедрения on-premise LLM.
| Статья | Что входит | Где чаще всего недосчитывают |
|---|---|---|
| CAPEX | Ускорители, серверные платформы, сеть, СХД, стойки | Модернизация электрики и охлаждения ЦОДа |
| OPEX | Электроэнергия, охлаждение, аренда и амортизация ЦОДа | Энергопотребление GPU-узлов — заметная статья |
| Поддержка и сервис | Контракты на обслуживание, ЗИП | Риски параллельного импорта по гарантии |
| Лицензии и софт | В основном открытый софт | Время инженеров на портирование и стабилизацию под железо |
| Команда эксплуатации | MLOps и инфраструктурные инженеры | Самая дефицитная и недооценённая статья |
| Риск поставки | Резерв на срыв или удорожание поставки ускорителей | Альтернативную конфигурацию закладывают редко |
Парадокс сметы в том, что опаснее всего не строчка с GPU, хотя она самая крупная. Бюджет пилота чаще срывают три невидимые в прайсе вещи: инфраструктура ЦОДа (питание и охлаждение), стоимость портирования софта под неNVIDIA-железо и люди на эксплуатацию. Их не видно, пока не столкнёшься — поэтому закладывать их нужно на старте.
Что блокирует полное импортозамещение в 2026
Если коротко и честно — полностью отечественного стека под тяжёлый ИИ в 2026 году нет. Вот из чего складывается разрыв.
Ускорители
Российского GPU-ускорителя промышленного класса под обучение LLM, сопоставимого с NVIDIA, на рынке нет. Есть импортные, есть китайские альтернативы, есть отдельные программно-аппаратные комплексы.
Совместимость софта
CANN, torch_npu и другие альтернативы CUDA моложе и менее стабильны. Портирование нетривиальных нагрузок стоит времени и денег.
Производительность и предсказуемость
Альтернативы догоняют, но разрыв на обучении и на нестандартных задачах пока реальный.
Доступность
Логистика ускорителей нестабильна, сроки и цены прыгают в пределах квартала.
Кадры
Инженеров, умеющих поднимать и эксплуатировать ИИ-инфраструктуру, особенно на неNVIDIA-стеке, остро не хватает.
Документация и экосистема
Сообщество, примеры и готовые рецепты вокруг альтернатив пока тонкие — каждую проблему решаешь первым.
Это не приговор импортозамещению, а описание точки, из которой стартуем. Платформенный уровень — серверы, операционные системы, открытый софт — замещается уже сейчас. Уровень ускорителей и специализированного софта под них — вопрос нескольких лет.
Чек-лист перед закупкой ИИ-инфраструктуры
- Определить профиль нагрузки: обучение, fine-tuning, inference — и в каких пропорциях.
- Подобрать ускоритель под этот профиль, а не наоборот.
- Проверить актуальную реестровую запись (ГИСП) по каждой позиции на дату извещения.
- Рассчитать баллы локализации под действующую редакцию правил, а не под прошлогоднюю.
- Подтвердить наличие сервиса и ЗИП на территории РФ.
- Проверить совместимость с целевой ОС протоколами испытаний, а не маркетингом.
- Прогнать бенчмарк софт-стека на своей модели, а не на абстрактном тесте.
- Оценить питание и охлаждение ЦОДа под реальный TDP узла.
- Заложить риск поставки и заранее продумать альтернативную конфигурацию.
- Посчитать команду эксплуатации, а не только железо.
- Развести в ТЗ и отчётности «российское шасси» и «российская инфраструктура целиком».
- Согласовать путь миграции на случай, если альтернативы дозреют — или наоборот.
Дорожная карта 2026–2028
Краткосрочно: гибридная архитектура
- Российское шасси из реестра плюс доступные ускорители
- Разделение нагрузок обучение / inference по типу, а не по вендору
- Запуск в закрытом контуре сейчас, не дожидаясь «идеального» стека
Среднесрочно: стандартизация
- Стандартизация платформ и софт-обвязки
- Накопление собственных бенчмарков под альтернативные ускорители
- Отработка портирования inference на неNVIDIA-железо на некритичных нагрузках
Долгосрочно: миграция по факту зрелости
- Перенос нагрузок на зрелые отечественные и доступные альтернативы
- Решение принимается по результатам реальных пилотов, а не по анонсам
- Проекты вроде «Эльбрус-Б» держать в поле зрения, но не в критическом пути
Частые вопросы
Можно ли заменить NVIDIA для LLM в 2026 году?
Полностью — нет. Для обучения и высоконагруженного inference NVIDIA остаётся эталоном из-за зрелости CUDA. Альтернативы, прежде всего Huawei Ascend, применимы под inference с оговорками по софту и поддержке. Любую замену нужно проверять бенчмарком на своей задаче, а не по презентации вендора.
Какие GPU подходят для on-premise LLM?
Зависит от нагрузки. Для обучения — NVIDIA. Для inference — NVIDIA либо Ascend при наличии поставки и сервиса. Для КИИ решает обычно не пиковая мощность в TFLOPS, а объём памяти ускорителя, реальная доступность в поставке и совместимость с вашим программным стеком.
Что важнее: GPU или программный стек?
Чаще именно софт. Железо можно купить, но заставить конкретную нагрузку стабильно работать на неNVIDIA-ускорителе — отдельный проект с портированием и отладкой. Разрыв между CUDA и альтернативами вроде CANN и torch_npu в 2026 году всё ещё заметный.
Как закупать ИИ-инфраструктуру для КИИ?
Через проверку каждой позиции по актуальной реестровой записи в ГИСП и балльной системе локализации на дату извещения, с подтверждённым сервисом в РФ и совместимостью с отечественной ОС. Правила менялись несколько раз — ориентируйтесь на действующую редакцию и профильных специалистов, а не на прошлогодние разборы.
Можно ли строить гибридную архитектуру ИИ-инфраструктуры?
Да, и в 2026 году это самый практичный вариант: российское серверное шасси из реестра плюс доступные ускорители, с разделением нагрузок обучение и inference. Это позволяет пройти по закупке, набрать баллы локализации на уровне платформы и запустить ИИ в контуре уже сейчас.
Является ли «Эльбрус» заменой GPU для нейросетей?
Нет. «Эльбрус» — это универсальный процессор, а не GPU-ускоритель. На нём запускают отдельные нейросетевые задачи, но обучение и тяжёлый inference больших языковых моделей — не его класс. Для доверенных CPU-нагрузок в госсегменте он полезен, но как замену GPU под LLM его рассматривать не стоит.
Актуальность материала
- Материал подготовлен по состоянию на июль 2026 года.
- Характеристики ускорителей в открытых источниках расходятся в разы. Заявления вендоров отделены от независимых оценок; и те и другие требуют подтверждения бенчмарком на конкретной нагрузке.
- Цены не приводятся намеренно: рынок GPU волатилен, любая «средняя цифра» вводила бы в заблуждение.
- Реестровые записи, пороги баллов локализации и правила национального режима в закупках менялись многократно. Сверяйте действующую редакцию и выписку из ГИСП на дату публикации извещения, вместе с профильными специалистами по закупкам и ИБ.
- Совместимость конкретного GPU-стека с отечественными ОС подтверждается протоколами испытаний, а не заявлениями в маркетинговых материалах.
Технический документ: Отечественный стек для ИИ 2026 — GPU, серверы, ПО
PDF, 8 страниц для ИТ-директоров КИИ, закупки и инфраструктурных архитекторов. Сравнение GPU-альтернатив, российские серверы из реестра, матрица проверки и чек-лист перед закупкой.
Собрать конфигурацию под вашу инфраструктуру
Экспресс-аудит вводных, проверка кандидатов по реестру и совместимости, архитектура пилота в закрытом контуре. Лицензии ФСТЭК, ФСБ и МО РФ. Опыт работы с объектами КИИ.