Назад к блогу
LLMopen-source LLMon-premise LLMGigaChatYandexGPTLlamaRAGfine-tuning

Open-source vs коммерческие LLM в России 2026: что выбрать для on‑premise

Лицензии, доступность весов, требования к GPU, качество на русском и совместимость с RAG — как архитектору выбрать класс модели под закрытый контур

2 июня 2026 Обновлено 11 июля 2026 13 мин чтения
Коротко

Выбор LLM для закрытого контура определяется не строчкой в лидерборде, а четырьмя вещами: доступны ли веса, что разрешает лицензия, сколько GPU вы готовы держать и как модель справляется с вашим русским текстом. Коммерческие API вроде YandexGPT Pro дают качество и быстрый старт, но в закрытый контур их не поставить. Open-source (Qwen, DeepSeek, Llama) и российские модели с открытыми весами (GigaChat 3.5 Ultra/Lightning, YandexGPT Lite) дают контроль ценой инфраструктуры и эксплуатации. Финальное решение принимается не по бенчмаркам, а по пилоту на ваших данных.

Open-source против коммерческих LLM для on-premise в России 2026 — обложка статьи AZONE AI

На совещании выбор модели обычно звучит как спор о брендах: «возьмём GigaChat», «нет, Qwen сильнее», «а давайте YandexGPT, он же про русский». Спор длится полчаса, пока кто-нибудь из инженеров не уточняет, что половину названных моделей нельзя поставить в контур — у них просто нет открытых весов. И обсуждение «лучшей нейросети» превращается в разговор об ограничениях.

Эта статья — для тех, кто принимает архитектурное решение: CTO, ML-инженера, ИТ-архитектора. Не про то, какая модель набрала больше баллов на очередной арене, а про то, какой класс моделей подойдёт под ваш сценарий, ваше железо и ваши требования ИБ. После прочтения у вас будет рабочая система координат: по каким критериям сравнивать, какие компромиссы у каждого варианта и какие конфигурации имеют смысл под пилот, корпоративного ассистента и нагруженный закрытый контур.

Почему выбор LLM для on‑premise — это архитектурное решение

Модель тянет за собой инфраструктуру. Разница между моделью на 8 млрд параметров и MoE на 700 млрд — это разница между одним ускорителем в стойке и многоузловым GPU-кластером с продуманным охлаждением, сетью и резервированием. Выбрав модель «по качеству», легко обнаружить, что под неё нужен ЦОД, которого нет.

Лицензия определяет юридические риски. Apache 2.0 и MIT позволяют использовать модель в коммерческом продукте практически без оговорок. Кастомные лицензии — например, у семейства Llama — добавляют условия, которые в корпоративном контексте лучше показать юристу до старта, а не после.

Доступность весов — это вопрос «можно ли вообще». Для закрытого контура нужна модель, которую физически можно скачать и запустить на своём железе. Самая удобная облачная модель здесь бесполезна, если она живёт только за чужим API.

И наконец, качество на русском напрямую влияет на бизнес-результат. Модель, которая хорошо пишет код, может посредственно извлекать реквизиты из договора и путаться в юридических формулировках. «Понимает русский» — слишком общая характеристика, чтобы на неё опираться.

Вывод. Сначала отсекайте по ограничениям — контур, лицензия, железо — и только потом сравнивайте оставшихся кандидатов по качеству. Обратный порядок почти всегда приводит к модели, которую нельзя внедрить.

Критерии сравнения LLM для корпоративного контура

Эти восемь критериев — не равнозначны. Первые два (веса и лицензия) работают как фильтр: модель либо проходит, либо нет. Если открытых весов нет, остальные семь пунктов можно даже не открывать — для закрытого контура такой модели уже нет в списке. Дальше — взвешивание компромиссов внутри тех, кто фильтр прошёл.

1
Доступность весов
Без открытых весов закрытый контур невозможен в принципе
2
Лицензия
Apache 2.0 / MIT против кастомных ограничений на коммерцию
3
Русский язык
Деловой текст, терминология, юридический контекст
4
VRAM и железо
Сколько GPU нужно под нужную пропускную способность
5
Стоимость эксплуатации
Не цена токена, а полная стоимость владения
6
Совместимость с RAG
Эмбеддинги, длина контекста, следование инструкциям
7
Поддержка fine-tuning
LoRA / QLoRA, доступность тренировочного стека
8
Зрелость для production
vLLM/SGLang, мониторинг, сообщество, обновления

Сравнительная таблица моделей

Данные приведены по состоянию на июнь 2026 года. Рынок движется быстро: версии, лицензии и доступность весов меняются за месяцы, поэтому перед внедрением сверяйтесь с карточкой модели на первоисточнике. Требования к VRAM — ориентировочные и сильно зависят от квантизации и длины контекста.

Модель Лицензия Веса Русский VRAM (ориентир) Развёртывание Комментарий
Llama 3.x / 4 Llama Community License Открыты (HF) Средний ~40 ГБ (Q4) / ~140 ГБ (FP16) On-premise Лимит 700 млн MAU; русский слабее, чем у локальных моделей
Qwen 3.6 Apache 2.0 (open-weight) Открыты (HF) Хороший От 8 ГБ (4–8B) до сотен ГБ (MoE) On-premise Открытая линейка. Более поздняя 3.7 — только по API, весов нет
DeepSeek V4 (Pro / Flash) MIT (веса) Открыты (HF) Хороший Flash — 284B (13B актив.); Pro — 1,6T (49B актив.) On-premise (Flash реалистичен, Pro — кластер) Контекст 1M. Flash самостоятельно хостится после квантования
GigaChat 3.5 Ultra MIT (веса) Открыты (HF, GitVerse) Высокий Сотни ГБ (432B MoE, 28B активных) On-premise Флагман с июля 2026: линейное внимание, контекст 262K, почти вдвое компактнее 3.1
GigaChat 3.1 Lightning MIT (веса) Открыты (HF, GitVerse) Высокий От ~12 ГБ (10B MoE, 1.8B активных) On-premise Компактная MoE, контекст до 256K, подходит под скромное железо
YandexGPT 5.1 Pro Проприетарная Закрыты Высокий Только Yandex Cloud API OpenAI-совместимый API; on-premise нет
YandexGPT 5 Lite Открытая (см. карточку) Открыты (HF) Высокий ~16 ГБ (8B-класс) On-premise Pretrain и Instruct; дообучение через LoRA
Mistral / Mixtral Apache 2.0 (часть линейки) Открыты (часть) Средний От ~8 ГБ до десятков ГБ On-premise Часть моделей — закрытые; проверять лицензию по конкретной версии
T-lite / T-pro (Т-Банк) Открытая (Apache 2.0, см. карточку) Открыты (HF) Высокий От ~16 ГБ On-premise Дообучены на русском поверх Qwen; проверять условия по версии

Происхождение моделей: Llama — Meta; Qwen — Alibaba; DeepSeek — DeepSeek; GigaChat — Сбер; YandexGPT — Яндекс; Mistral — Mistral AI; T-lite/T-pro — Т-Технологии.

Open-source LLM: сильные стороны и ограничения

Главный аргумент за open-source — контроль. Веса лежат на вашем железе, данные не покидают периметр, телеметрии нет, обновляете вы тогда, когда сами решите. Для организаций с персональными данными, КИИ или коммерческой тайной это часто единственный допустимый вариант — остальное не проходит согласование ИБ. Сюда добавляется гибкость: модель можно дообучить под свою доменную лексику, квантовать под имеющиеся GPU, встроить в любой пайплайн без оглядки на квоты чужого API.

Обратная сторона — вся ответственность теперь ваша. За инфраструктуру, за качество ответов, за безопасность вывода. У open-source-модели нет вендора, которому можно позвонить в три часа ночи, когда инференс встал под нагрузкой: дежурство, откат на прошлую версию, разбор инцидента — это теперь ваша зона. Нужен MLOps: развёртывание через vLLM или SGLang, мониторинг, версионирование, регламент обновлений. На пилоте это выглядит как «поднять контейнер», в эксплуатации — как отдельная функция в команде. Лицензии нет, но GPU-кластер, инженеры и дежурство стоят вполне конкретных денег каждый месяц.

Вывод. Open-source даёт контроль и независимость ценой эксплуатации. Считать нужно не цену лицензии (её нет), а полную стоимость владения железом и людьми.

Коммерческие LLM и API-модели: когда они уместны

Коммерческий API — это про скорость и качество без забот об инфраструктуре. YandexGPT 5.1 Pro доступен через Yandex Cloud с OpenAI-совместимым API: подключился, начал слать запросы, не держишь ни одной GPU. Для прототипа, для сценария без чувствительных данных, для задачи, которую нужно проверить за неделю, — это часто разумный старт.

Проблема в том, что для закрытого контура такой вариант не работает по определению. Данные уходят на сторону провайдера, веса вам недоступны, а это сразу конфликтует с требованиями по персональным данным, КИИ и коммерческой тайне. Даже при размещении в российском ЦОД служба ИБ часто упирается в простое: данные физически покидают периметр, а значит, нужны договор об обработке, оценка рисков передачи и отдельное обоснование — на это уходят недели, и нередко проект на этом и встаёт. Варианты вроде выделенного развёртывания в частном облаке стоит обсуждать предметно с вендором — условия и доступность здесь индивидуальны, и их нужно проверять, а не принимать на веру.

Вывод. Коммерческий API уместен для быстрого старта и нечувствительных сценариев. Как только в игру входят персональные данные или закрытый контур — это путь к моделям с открытыми весами.

Российские LLM: что учитывать

За последний год российские модели заметно сдвинулись в сторону открытости. Сбер выложил GigaChat 3.1 Ultra (MoE на 702 млрд параметров, около 36 млрд активных) и компактную GigaChat 3.1 Lightning под лицензией MIT — то есть с открытыми весами, пригодными для развёртывания в собственном контуре. Это принципиально меняет картину: раньше «российская модель» почти всегда означала «через чужой API», теперь появился полноценный on-premise-вариант с сильным русским.

У Яндекса логика иная. Флагман YandexGPT 5.1 Pro остаётся закрытым и доступен только через Yandex Cloud. Зато YandexGPT 5 Lite выложен в открытый доступ — в вариантах Pretrain и Instruct, с возможностью дообучения через LoRA. Для on-premise это рабочий кандидат, если по качеству Lite закрывает задачу. Отдельно стоит линейка T-lite/T-pro от Т-Технологий — модели, дообученные на русском поверх Qwen; условия лицензии нужно сверять по конкретной версии.

У российской модели есть и регуляторный угол: реестры доверенных моделей и будущее регулирование ИИ бьют ровно по тем, кто ставит ИИ в чувствительный контур. Это не повод откладывать пилот, но повод закладывать гибкость — чтобы при изменении требований можно было заменить модель без переписывания всего решения.

Вывод. Для закрытого контура с упором на русский в 2026 появился реальный отечественный выбор — GigaChat Ultra/Lightning с открытыми весами. YandexGPT Pro остаётся облачным, его open-source-часть — это Lite.

Бенчмарки на русскоязычных задачах

С публичными бенчмарками есть одна неприятная закономерность: чем громче заявленный результат, тем меньше он говорит о вашей задаче. Русскоязычные наборы вроде MERA и RussianSuperGLUE полезны для первичного отсева, но ни один из них не тестирует модель на ваших договорах, тикетах и регламентах.

MERA

Сводный русскоязычный бенчмарк; покрывает рассуждение, знания, понимание текста. Полезен для грубого отсева, но публичные лидерборды меняются и не отражают ваши документы.

RussianSuperGLUE

Набор задач на понимание русского языка. Старше MERA, частично перекрыт более новыми моделями. Использовать как исторический ориентир.

Внутренний бенчмарк

Ваш корпус: договоры, тикеты, регламенты. Единственная метрика, которая отражает реальную задачу. Без него выбор по публичным числам — гадание.

Важно. Конкретные числа лидербордов в этой статье намеренно не приводятся: они меняются от релиза к релизу и устаревают быстрее, чем выходит статья. Актуальные результаты смотрите на официальных страницах бенчмарков, а решение принимайте по своему корпусу. Открытые бенчмарки не покрывают большинство корпоративных сценариев.

Что выбирать под разные задачи

Класс модели определяется задачей, а не наоборот. Под классификацию обращений нет смысла поднимать MoE на сотни ГБ — справится компактная модель, и на потоке она окажется кратно дешевле.

Задача Подход Класс модели Комментарий
Документооборот, извлечение реквизитов RAG + дообучение под формат GigaChat Lightning / Qwen 3.6 / T-pro Важна стабильность формата вывода, а не размер модели
Классификация обращений Малая модель + few-shot или дообучение Qwen 3.6 8–14B / YandexGPT Lite Массовая задача, чувствительна к стоимости на потоке
Корпоративный поиск RAG, упор на эмбеддинги и reranker Любая с хорошим следованием контексту Качество поиска определяется ретривером, а не только LLM
Диалоговый ассистент RAG + длинный контекст GigaChat 3.5 Ultra / Qwen 3.6 MoE Нужна модель с уверенным русским и function calling
Генерация и ревью кода Специализированная модель Qwen-Coder / DeepSeek Русский здесь вторичен, важнее качество кода
Суммаризация длинных документов Длинный контекст + RAG-chunking DeepSeek / GigaChat 3.5 Ultra Следить за деградацией на «середине» длинного контекста
Договорная аналитика RAG + дообучение на разметке GigaChat 3.5 Ultra / Qwen 3.6 + LoRA Цена ошибки высокая, нужна верификация юристом
ИБ-аналитика логов Малая модель + строгие промпты Qwen 3.6 14–32B on-premise Закрытый контур обязателен, телеметрия недопустима

Пример из практики: договорную аналитику собирали на Qwen с LoRA под формат конкретного заказчика — на чистых PDF модель уверенно вытаскивала стороны, суммы и сроки. Спотыкалась она там, где половина договоров приходила сканами с печатями поверх текста и рукописными правками на полях. Лечилось это не заменой модели, а нормальным слоем распознавания и предобработки до LLM. На слайде архитектура выглядит чисто; в пилоте выясняется, что входные данные грязнее, чем кто-либо ожидал.

Почти во всех строках выше задача решается связкой «модель + RAG», а не одной моделью. Как собрать ретривер, где он ломается на пилотах и почему чувствительные документы остаются в контуре — разбор в статье про RAG-архитектуру. Когда RAG не хватает и нужно именно дообучение — смотрите материал про fine-tuning на корпоративных данных.

Лицензионные нюансы

Apache 2.0 и MIT — самые «спокойные» для бизнеса лицензии. Они разрешают коммерческое использование, модификацию и распространение с минимальными требованиями (по сути — сохранить уведомление об авторстве). Под ними выходят, в частности, open-weight модели Qwen, веса DeepSeek и открытые GigaChat Ultra/Lightning.

Кастомные лицензии — отдельная история. Llama распространяется под собственной Community License: коммерческое использование разрешено, но с оговорками — например, при превышении порога в 700 млн активных пользователей в месяц требуется отдельное разрешение Meta. Для большинства компаний этот порог нерелевантен, но сам факт нестандартных условий означает, что лицензию нужно прочитать целиком, а не по заголовку. Часть моделей Mistral открыта под Apache 2.0, часть — закрыта; здесь важно смотреть на конкретную версию, а не на «бренд Mistral» в целом.

Юрист перед внедрением должен проверить как минимум: разрешено ли коммерческое использование, есть ли ограничения по отраслям или объёму, можно ли дообучать модель и распространять результат, нет ли запрета на использование вывода модели для обучения других моделей.

Оговорка. Это не юридическое заключение. Лицензионные условия меняются вместе с версиями моделей, и окончательную оценку рисков для вашего сценария должен дать юрист по тексту действующей лицензии.

Три типовые конфигурации

Small — пилот / ограниченный RAG

Класс модели: Компактная open-source (8–14B) или GigaChat Lightning

Инфраструктура: 1× GPU 24–48 ГБ (например, один профессиональный ускоритель)

Плюсы: Быстрый старт, дёшево, легко обновлять

Ограничения: Ограниченная пропускная способность, проще «спотыкается» на сложных запросах

Что проверить: Хватит ли качества на ваших документах при таком размере модели

Medium — корпоративный ассистент

Класс модели: Qwen 3.6 32B / YandexGPT Lite / T-pro или GigaChat Lightning в проде

Инфраструктура: 2–4× GPU, балансировщик, отдельный узел под векторную БД

Плюсы: Разумный баланс качества и стоимости, реальная многопользовательская нагрузка

Ограничения: Нужен MLOps: мониторинг, обновления, дежурство

Что проверить: Кто эксплуатирует контур после пилота и по каким SLA

Enterprise — закрытый контур, high-load

Класс модели: GigaChat 3.5 Ultra / DeepSeek / Qwen 3.6 MoE

Инфраструктура: GPU-кластер (несколько узлов), tensor/expert parallelism, резервирование

Плюсы: Высокое качество, несколько сценариев на одной платформе, полный контроль

Ограничения: Дорого по железу и людям; требования к ЦОД, охлаждению, ИБ-аттестации

Что проверить: Готова ли инфраструктура и команда к эксплуатации MoE на сотни ГБ VRAM

Чек-лист выбора модели

1

Веса модели реально доступны для скачивания и развёртывания в вашем контуре

2

Лицензию прочитал юрист, а не только инженер — особенно по коммерческому использованию

3

Проверено качество на ваших документах, а не только на публичных бенчмарках

4

Посчитана не цена токена, а полная стоимость владения на горизонте 1–2 лет

5

Оценен объём VRAM под целевую пропускную способность, а не под демо

6

Понятно, кто эксплуатирует контур и по каким SLA после пилота

7

Проверена совместимость с выбранным RAG-стеком (эмбеддинги, контекст, формат вывода)

8

Ясно, нужен ли fine-tuning или задача закрывается качественным RAG

9

Учтены требования ИБ: отсутствие телеметрии, изоляция, аудит, аттестация при необходимости

10

Есть план обновления модели — рынок меняется каждые несколько месяцев

Выводы

«Лучшей модели» нет — есть модель, проходящая ваши фильтры по контуру, лицензии и железу, и уже среди них — лучшая на вашей задаче.

Закрытый контур отсекает коммерческие API — остаются модели с открытыми весами: Qwen, DeepSeek, Llama, GigaChat Ultra/Lightning, YandexGPT Lite.

В 2026 у российского on-premise появился сильный игрок — GigaChat с открытыми весами под MIT, с вариантом под скромное железо (Lightning) и под кластер (Ultra).

Публичные бенчмарки — инструмент отсева, а не решения. Финальный выбор — по пилоту на реальных документах.

Большинство задач решает связка «модель + RAG»; дообучение нужно реже, чем кажется на старте.

Что делать дальше

  1. Зафиксируйте ограничения контура — это сразу сократит список моделей.
  2. Выберите 2–3 кандидата из прошедших фильтр и соберите небольшой тестовый корпус из своих документов.
  3. Проведите пилот, измеряя не только качество, но и стоимость владения и готовность инфраструктуры.
  4. Заложите возможность замены модели — рынок и регулирование меняются.

Подобрать LLM под ваш кейс

AZONE AI поможет отобрать класс модели под ваш контур, провести пилот на ваших данных и предложить архитектуру в закрытом контуре.

Оставить заявку

Скачать сравнительную таблицу 2026

PDF на 4 страницы: модели, лицензии, веса, требования к VRAM и комментарии по on-premise. Обновляем раз в полгода.

Получить таблицу

Частые вопросы

Какая LLM лучше для on-premise?

Универсального ответа нет. Под закрытый контур подходят только модели с открытыми весами: Qwen 3.6, DeepSeek V4, Llama 4, GigaChat 3.5 Ultra/Lightning, YandexGPT Lite. Выбор внутри этого списка определяется качеством на ваших документах, доступным железом и лицензией.

Можно ли использовать open-source LLM в коммерческом проекте?

Часто да, но зависит от лицензии. Apache 2.0 и MIT разрешают коммерческое использование почти без ограничений. Llama Community License добавляет порог по числу пользователей. Условия по конкретной версии должен проверить юрист перед внедрением.

Что важнее: бенчмарк или качество на собственных данных?

Качество на ваших данных. Публичные бенчмарки полезны для первичного отсева кандидатов, но они не отражают специфику ваших договоров, тикетов или регламентов. Финальное решение принимается по пилоту на реальном корпусе.

Можно ли заменить fine-tuning хорошим RAG?

Во многих корпоративных сценариях — да. RAG решает задачу доступа к актуальным знаниям без переобучения модели. Дообучение нужно, когда требуется устойчивый стиль, формат вывода или доменная терминология. Подробный разбор — в статье про fine-tuning.

Какие модели лучше работают с русским языком?

На русском уверенно работают GigaChat, YandexGPT и дообученные на русском версии вроде T-pro. Среди зарубежных open-source русский неплохо тянут Qwen и DeepSeek. Llama без дообучения на русском обычно слабее.

Актуальность материала

  • Материал подготовлен по состоянию на июнь 2026 года.
  • Версии моделей, лицензии, доступность весов и бенчмарки меняются за месяцы — перед внедрением сверяйтесь с карточкой модели на первоисточнике.
  • Окончательный выбор делайте по пилотному тестированию на ваших данных и задачах.
AZONE AI — подбор LLM под кейс и пилот в закрытом контуре

Не знаете, какую LLM выбрать?

Поможем отобрать класс модели под ваш контур, протестировать 2–3 кандидата на ваших данных и развернуть решение внутри периметра.

Подобрать LLM под кейс