Сравнительная таблица · PDF, 10 страниц
LLM для on-premise 2026: что реально поставить в контур
Открытые, коммерческие и российские модели на одном развороте: лицензия, доступность весов, память под модель и пригодность к закрытому контуру. Плюс методика расчёта видеопамяти: почему MoE-модель считают по всем весам и когда флагману нужен кластер. Редакция 09.2026, PDF, 10 страниц.
Что внутри
- Таблица из 12 позиций: GigaChat 3.5 Ultra, DeepSeek V4 Flash и Pro, Qwen3.8, модели Яндекса, Llama и другие — лицензия, веса, параметры, память с запасом и класс железа.
- Методика расчёта видеопамяти с примером по шагам: почему MoE-модель считают по всем весам, а не по активным параметрам.
- Ориентиры по флагманам и две поправки к расчёту: где запас избыточен, а где для длинных документов KV-кэш нужно считать отдельно.
- Форматы весов BF16, FP8 и FP4 и какие ускорители их поддерживают.
- 8 критериев выбора — первые два работают как фильтр, остальные как взвешивание компромиссов.
- Три типовые конфигурации: один сервер, узел на 8 ускорителей, кластер — с ограничениями каждой.
- Подбор кандидатов под 8 типовых задач и чек-лист из 10 пунктов перед пилотом.
Кому будет полезен
- CTO и ИТ-архитекторы — выбор класса модели под контур, лицензию и доступное железо.
- ML-инженеры — расчёт памяти под выбранную модель, форматы весов и совместимость с RAG-стеком.
- CISO и специалисты по ИБ — какие модели вообще применимы в закрытом периметре.
Данные — по состоянию на 25 сентября 2026 года (редакция 09.2026, плановый пересмотр — 12.2026). Версии моделей и условия лицензий меняются за месяцы — перед внедрением сверяйтесь с карточкой модели на первоисточнике. Расчёты памяти ориентировочные и не заменяют нагрузочного теста. Методика — в статье «Сколько видеопамяти нужно LLM в своём контуре», критерии и лицензии — в статье «Open-source vs коммерческие LLM».
Получить таблицу на email
Заполните форму — откроется страница со ссылкой на скачивание PDF.