TL;DR

Self-hosted LLM в 2026 — это не «модно», это конкретный инструмент для конкретных случаев:
– Когда данные не должны выходить за периметр (медицина, госконтракты, финансы)
– Когда нужна скорость на больших объёмах и API-задержки убивают экономику
– Когда общий объём запросов настолько велик, что API становится дороже железа

Для всех остальных случаев в 2026 году правильный ответ — API (Yandex GPT / Claude / GPT-4o с маршрутизацией, мы писали про это отдельно).

Реалистичные модели для self-hosted в 2026:
Llama 3.3 70B / 405B — лидер по качеству, требует A100/H100
Mistral Large / Mistral Small — отличный баланс качество/железо
Saiga 3 / Vikhr — русскоязычные fine-tunes, на средние задачи отличны
Qwen 2.5 / Qwen 3 — сильны в коде, есть варианты от 7B до 110B

Железо: от 600 тыс ₽ (одна 4090 на 13B-модель) до 12 млн ₽ (сервер с 4×H100 на 70B-405B).

Ниже разбор, кому реально нужен self-hosted, какой стек выбирать, и что не сработает.

Когда self-hosted реально нужен

Из практики 2026 — 4 случая:

Случай 1: данные не должны покидать периметр

Медицина, финансы, юристы на крупных корпоративных клиентах, оборонка, госсектор. Не «не должны по идее», а буквально нельзя по договору или законодательству.

Сценарии:
– Клиника обрабатывает медкарты пациентов через LLM
– Банк работает с банковской тайной
– Юристы крупных клиентов с NDA, запрещающим обработку через сторонние API

В этих случаях API даже Yandex GPT — это вопрос договоров. On-premise — закрывает вопрос окончательно.

Случай 2: огромные объёмы, экономика API не сходится

Расчёт простой: возьмите ваш объём токенов в день × цена API. Если получается больше 60–80 тыс ₽/мес — начинайте смотреть в сторону self-hosted.

Пример: контактный центр, 50 000 диалогов в день, средний диалог 4 тыс. токенов. Итого 200 млн токенов/день, 6 млрд токенов/мес. На GPT-4o-mini это ~350 тыс ₽/мес, на Claude — 8 млн ₽/мес. Дешёвая модель — окупается железо за 4 месяца. Дорогая — за 1 неделю.

Случай 3: критичная задержка

API имеют латентность 0.5–3 секунды плюс сеть. Если у вас задача с SLA «ответ за 200 мс» — API не вариант. Локальный сервер с правильно подобранной моделью даёт 100–300 мс на 7B-модели.

Сценарии:
– Голосовой агент в реальном времени
– Триггеры на бирже/трейдинге
– Real-time антифрод

Случай 4: нужен fine-tune, который не делает облако

Если вам нужна модель, дообученная на 100 000 ваших размеченных диалогов под конкретный домен — self-hosted единственный путь. На Yandex GPT fine-tune ограничен, на Claude / GPT-4o есть, но дорогой и без полного контроля.

Реальные модели 2026

Llama 3.3 (70B / 405B)

  • Лидер open-source. На большинстве benchmark-ов сопоставима с GPT-4o.
  • 70B-версия — золотой стандарт, требует 1×H100 80GB или 2×A100.
  • 405B — для тех, кто хочет «прямо как GPT-4», но потребует 4×H100 минимум.
  • Лицензия — коммерческая, бесплатная при выручке клиента до 700 млн пользователей/мес.

Для каких задач: универсал, агентные сценарии, длинный контекст до 128K.

Mistral Large / Small / Codestral

  • Качество — на 90% от Llama 70B.
  • Меньше требований к железу (Mistral Small работает на 1×4090).
  • Codestral — специализирована на коде, обходит большинство универсальных моделей.

Для каких задач: задачи с предсказуемым промптом, кодовые задачи, средний контекст.

Saiga 3 / Vikhr / RuAdapt

  • Русскоязычные fine-tunes на базе Llama / Mistral / Qwen.
  • Качество русского — близко к коммерческим. Часто лучше «голой» Llama, потому что Llama сильно англоцентрична.
  • Размеры от 7B до 70B.
  • Лицензии: все CC-BY или Apache, можно коммерчески использовать.

Для каких задач: русскоязычные сценарии с фокусом на чат, генерацию, Q&A.

Qwen 2.5 / Qwen 3

  • Китайские, но при этом неплохо работают с русским и отлично с английским.
  • Сильны в коде и математике.
  • Размеры от 0.5B до 110B.
  • Лицензия — Apache 2.0.

Для каких задач: код, математика, бэкграунд-обработка.

DeepSeek V3 / R1

  • В 2026 — обладает «reasoning»-режимом, близким к o1.
  • На сложных задачах конкурентоспособен с Claude Sonnet 4.6.
  • Требования к железу — высокие (модель большая).

Для каких задач: рассуждения, аналитика, инженерные задачи.

Железо: реалистичные сборки 2026

Сборка 1: «лёгкая» (1×RTX 4090)

  • GPU: 1×RTX 4090 (24GB VRAM)
  • CPU: AMD Ryzen 9 / Intel Core i9
  • RAM: 64GB
  • SSD: 2TB NVMe
  • Сервер или мощный десктоп

Цена: 600–900 тыс ₽
Тянет: Mistral 7B / Llama 8B / Saiga 7B / Qwen 7B-14B (квантованные)
Производительность: ~30 токенов/сек на 7B, ~10 токенов/сек на 14B
Под какие задачи: классификация, простые ответы, базовый Q&A, до 200 пользователей одновременно

Сборка 2: «средняя» (2×4090 или 1×H100)

  • GPU: 2×RTX 4090 (48GB combined) или 1×H100 80GB
  • CPU: AMD EPYC / Intel Xeon
  • RAM: 128GB
  • SSD: 4TB NVMe

Цена: 2.5–4.5 млн ₽
Тянет: Llama 70B (4-bit quantized) / Mistral Large / Qwen 32B
Производительность: 15–25 токенов/сек на 70B
Под какие задачи: универсальный сценарий, агентные задачи, до 500–1000 пользователей одновременно

Сборка 3: «тяжёлая» (4×H100 или DGX)

  • GPU: 4×H100 80GB (320GB combined) или Nvidia DGX
  • CPU: 2×AMD EPYC
  • RAM: 512GB+
  • Сетевая инфраструктура

Цена: 8–14 млн ₽
Тянет: Llama 405B / DeepSeek V3 (full precision) / 2-3 одновременные модели
Производительность: 20–40 токенов/сек на 405B
Под какие задачи: production высоконагрузочный сценарий, корпоративный AI-помощник для тысяч пользователей

Альтернатива: облако с GPU

Если не хотите капекс — берёте сервер с GPU в облаке (Selectel, MWS, Yandex Cloud). Цена: 80–400 тыс ₽/мес в зависимости от размера.

Плюс: можно масштабироваться. Минус: если объём стабильный — за год переплатите как за свой сервер. Если объём колеблется — облако выгоднее.

Стек: что ставить кроме самой модели

  • Сервинг: vLLM, TGI (Text Generation Inference), llama.cpp в зависимости от модели
  • Оркестратор: FastAPI / litellm proxy / Ollama для простых сценариев
  • Мониторинг: Prometheus + Grafana + кастомные метрики (latency, throughput, error rate)
  • Логирование: запросы и ответы для отладки и дальнейшего fine-tune (с учётом приватности)
  • RAG-слой: pgvector / Qdrant (если нужно — мы писали про RAG)
  • Балансировщик: nginx или Traefik

Без оркестратора голая модель — это игрушка. Production-стек собирается так же серьёзно, как любая микросервисная архитектура.

Реальный кейс: банк, on-premise LLM

Региональный банк, 800 операторов поддержки, 12 тыс. обращений/день. Внедряли AI-помощник для операторов.

Что было: пилот на Claude через корпоративную подписку. Качество — отличное, но юристы заблокировали продакшн (банковская тайна не должна уходить в США).

Что сделали:
– Купили сервер 2×H100 (3.8 млн ₽)
– Поставили Llama 70B + Saiga 3 70B для русскоязычных задач
– Развернули vLLM, FastAPI-оркестратор, мониторинг
– Подключили RAG на pgvector (база знаний банка)
– Интеграция с CRM, документами, операторскими интерфейсами

Сроки: 4 месяца от закупки железа до production.

Результат через 6 месяцев:
– Среднее время обработки обращения: 6 → 2.8 минут (–53%)
– Удовлетворённость операторов: 4.1 → 4.6 из 5
– Точность ответов AI: 91% (по сравнению с 88% на Claude)
– Полное соответствие требованиям ФСТЭК и банковской тайны
– TCO: 4.2 млн ₽ единовременно + 280 тыс ₽/мес (инженер по поддержке + электричество + амортизация)

Эквивалент в API: было бы ~1.4 млн ₽/мес. Окупаемость железа: 3.5 месяца.

Что НЕ работает в self-hosted

Ошибка 1: «купим железо и наймём студента-DevOps».
Self-hosted LLM в продакшн — это инженерия. Нужны люди, которые умеют тюнить vLLM, понимают GPU-память, могут диагностировать падения throughput. Дешёвых таких нет, реальная зарплата в РФ — 400–700 тыс ₽/мес.

Ошибка 2: ставить топ-модель «потому что хочется».
Если задачу закрывает Mistral 7B — нет смысла ставить Llama 405B. Окупаемость рухнет, латентность вырастет, проблем будет в 10 раз больше.

Ошибка 3: пытаться обогнать API на сложных задачах.
На многошаговом рассуждении, на больших агентных сценариях, на коде — Claude Sonnet 4.6 / GPT-4o пока сильнее любой open-source модели. Если у вас 80% задач — рассуждение и код, self-hosted не выгоден.

Ошибка 4: недооценить затраты на поддержку.
TCO self-hosted = железо + электричество + амортизация (3–4 года) + инженер + мониторинг + обновления моделей. Реальный месячный TCO — 200–500 тыс ₽ на средней сборке.

Ошибка 5: забить на безопасность модели.
Open-source модели могут «галлюцинировать», выдавать неуместное, попадать в jailbreak. Без guardrails (NeMo Guardrails, LangSmith, кастомные фильтры) в продакшн нельзя.

Когда self-hosted НЕ нужен

  • Объём меньше 10 млн токенов/мес — экономика не сходится
  • Задачи требуют топ-моделей (агенты, код, длинный контекст с консистентностью)
  • Нет компетенции в DevOps/MLOps — поддержка станет проблемой
  • Данные можно обрабатывать через Yandex GPT (152-ФЗ) — не усложняйте

В этих случаях правильное решение — API с маршрутизацией задач между Yandex GPT (для данных в РФ), GPT-4o-mini (для массовых дешёвых), Claude (для сложных).

Как решить, идти или не идти

Простой чек-лист:

  1. Объём токенов/мес: < 10 млн — API, > 50 млн — рассматриваем on-premise
  2. Требования по данным: можно ли в Yandex GPT? Если нет — on-premise обязателен
  3. Латентность: нужен ответ за 200 мс? Только on-premise
  4. Компетенции в команде: есть ML/DevOps уровня senior? Если нет — нужен партнёр или API
  5. Готов на капекс: 600 тыс — 14 млн ₽ на железо плюс полгода на внедрение

Если 2+ пункта «за on-premise» — есть смысл считать экономику.

FAQ

А Llama / Saiga точно бесплатные?
Лицензии разрешают коммерческое использование с оговорками. Llama 3.x — бесплатно при выручке клиента < 700 млн пользователей/мес. Saiga / Vikhr — Apache 2.0. То есть для подавляющего большинства бизнесов — бесплатно.

Что выгоднее — купить сервер или арендовать GPU в облаке?
Если стабильная нагрузка 24/7 — за 14 месяцев свой сервер окупает облако. Если нагрузка плавающая — облако дешевле, потому что платите только за использованные часы.

Можно ли в РФ свободно скачать веса моделей?
Да, Llama / Mistral / Qwen / DeepSeek доступны через Hugging Face. Иногда через зеркала. Прецедентов блокировок нет на 2026 год.

Сколько электричества жрёт сервер с 4×H100?
~3.5 кВт под полной нагрузкой. В месяц на коммерческом тарифе РФ — ~25 тыс ₽. По сравнению с амортизацией железа — копейки.

Можно ли запустить Llama 70B на M3 Max или M4 Max (Apple Silicon)?
Да, через MLX или llama.cpp. Производительность — 5–10 токенов/сек, для пилотов годится, для production — нет.


Хотите оценить, нужен ли вам self-hosted или хватит API? Напишите — посчитаем TCO и сравним с альтернативами на ваших объёмах.