TL;DR
Self-hosted LLM в 2026 — это не «модно», это конкретный инструмент для конкретных случаев:
– Когда данные не должны выходить за периметр (медицина, госконтракты, финансы)
– Когда нужна скорость на больших объёмах и API-задержки убивают экономику
– Когда общий объём запросов настолько велик, что API становится дороже железа
Для всех остальных случаев в 2026 году правильный ответ — API (Yandex GPT / Claude / GPT-4o с маршрутизацией, мы писали про это отдельно).
Реалистичные модели для self-hosted в 2026:
– Llama 3.3 70B / 405B — лидер по качеству, требует A100/H100
– Mistral Large / Mistral Small — отличный баланс качество/железо
– Saiga 3 / Vikhr — русскоязычные fine-tunes, на средние задачи отличны
– Qwen 2.5 / Qwen 3 — сильны в коде, есть варианты от 7B до 110B
Железо: от 600 тыс ₽ (одна 4090 на 13B-модель) до 12 млн ₽ (сервер с 4×H100 на 70B-405B).
Ниже разбор, кому реально нужен self-hosted, какой стек выбирать, и что не сработает.
Когда self-hosted реально нужен
Из практики 2026 — 4 случая:
Случай 1: данные не должны покидать периметр
Медицина, финансы, юристы на крупных корпоративных клиентах, оборонка, госсектор. Не «не должны по идее», а буквально нельзя по договору или законодательству.
Сценарии:
– Клиника обрабатывает медкарты пациентов через LLM
– Банк работает с банковской тайной
– Юристы крупных клиентов с NDA, запрещающим обработку через сторонние API
В этих случаях API даже Yandex GPT — это вопрос договоров. On-premise — закрывает вопрос окончательно.
Случай 2: огромные объёмы, экономика API не сходится
Расчёт простой: возьмите ваш объём токенов в день × цена API. Если получается больше 60–80 тыс ₽/мес — начинайте смотреть в сторону self-hosted.
Пример: контактный центр, 50 000 диалогов в день, средний диалог 4 тыс. токенов. Итого 200 млн токенов/день, 6 млрд токенов/мес. На GPT-4o-mini это ~350 тыс ₽/мес, на Claude — 8 млн ₽/мес. Дешёвая модель — окупается железо за 4 месяца. Дорогая — за 1 неделю.
Случай 3: критичная задержка
API имеют латентность 0.5–3 секунды плюс сеть. Если у вас задача с SLA «ответ за 200 мс» — API не вариант. Локальный сервер с правильно подобранной моделью даёт 100–300 мс на 7B-модели.
Сценарии:
– Голосовой агент в реальном времени
– Триггеры на бирже/трейдинге
– Real-time антифрод
Случай 4: нужен fine-tune, который не делает облако
Если вам нужна модель, дообученная на 100 000 ваших размеченных диалогов под конкретный домен — self-hosted единственный путь. На Yandex GPT fine-tune ограничен, на Claude / GPT-4o есть, но дорогой и без полного контроля.
Реальные модели 2026
Llama 3.3 (70B / 405B)
- Лидер open-source. На большинстве benchmark-ов сопоставима с GPT-4o.
- 70B-версия — золотой стандарт, требует 1×H100 80GB или 2×A100.
- 405B — для тех, кто хочет «прямо как GPT-4», но потребует 4×H100 минимум.
- Лицензия — коммерческая, бесплатная при выручке клиента до 700 млн пользователей/мес.
Для каких задач: универсал, агентные сценарии, длинный контекст до 128K.
Mistral Large / Small / Codestral
- Качество — на 90% от Llama 70B.
- Меньше требований к железу (Mistral Small работает на 1×4090).
- Codestral — специализирована на коде, обходит большинство универсальных моделей.
Для каких задач: задачи с предсказуемым промптом, кодовые задачи, средний контекст.
Saiga 3 / Vikhr / RuAdapt
- Русскоязычные fine-tunes на базе Llama / Mistral / Qwen.
- Качество русского — близко к коммерческим. Часто лучше «голой» Llama, потому что Llama сильно англоцентрична.
- Размеры от 7B до 70B.
- Лицензии: все CC-BY или Apache, можно коммерчески использовать.
Для каких задач: русскоязычные сценарии с фокусом на чат, генерацию, Q&A.
Qwen 2.5 / Qwen 3
- Китайские, но при этом неплохо работают с русским и отлично с английским.
- Сильны в коде и математике.
- Размеры от 0.5B до 110B.
- Лицензия — Apache 2.0.
Для каких задач: код, математика, бэкграунд-обработка.
DeepSeek V3 / R1
- В 2026 — обладает «reasoning»-режимом, близким к o1.
- На сложных задачах конкурентоспособен с Claude Sonnet 4.6.
- Требования к железу — высокие (модель большая).
Для каких задач: рассуждения, аналитика, инженерные задачи.
Железо: реалистичные сборки 2026
Сборка 1: «лёгкая» (1×RTX 4090)
- GPU: 1×RTX 4090 (24GB VRAM)
- CPU: AMD Ryzen 9 / Intel Core i9
- RAM: 64GB
- SSD: 2TB NVMe
- Сервер или мощный десктоп
Цена: 600–900 тыс ₽
Тянет: Mistral 7B / Llama 8B / Saiga 7B / Qwen 7B-14B (квантованные)
Производительность: ~30 токенов/сек на 7B, ~10 токенов/сек на 14B
Под какие задачи: классификация, простые ответы, базовый Q&A, до 200 пользователей одновременно
Сборка 2: «средняя» (2×4090 или 1×H100)
- GPU: 2×RTX 4090 (48GB combined) или 1×H100 80GB
- CPU: AMD EPYC / Intel Xeon
- RAM: 128GB
- SSD: 4TB NVMe
Цена: 2.5–4.5 млн ₽
Тянет: Llama 70B (4-bit quantized) / Mistral Large / Qwen 32B
Производительность: 15–25 токенов/сек на 70B
Под какие задачи: универсальный сценарий, агентные задачи, до 500–1000 пользователей одновременно
Сборка 3: «тяжёлая» (4×H100 или DGX)
- GPU: 4×H100 80GB (320GB combined) или Nvidia DGX
- CPU: 2×AMD EPYC
- RAM: 512GB+
- Сетевая инфраструктура
Цена: 8–14 млн ₽
Тянет: Llama 405B / DeepSeek V3 (full precision) / 2-3 одновременные модели
Производительность: 20–40 токенов/сек на 405B
Под какие задачи: production высоконагрузочный сценарий, корпоративный AI-помощник для тысяч пользователей
Альтернатива: облако с GPU
Если не хотите капекс — берёте сервер с GPU в облаке (Selectel, MWS, Yandex Cloud). Цена: 80–400 тыс ₽/мес в зависимости от размера.
Плюс: можно масштабироваться. Минус: если объём стабильный — за год переплатите как за свой сервер. Если объём колеблется — облако выгоднее.
Стек: что ставить кроме самой модели
- Сервинг: vLLM, TGI (Text Generation Inference), llama.cpp в зависимости от модели
- Оркестратор: FastAPI / litellm proxy / Ollama для простых сценариев
- Мониторинг: Prometheus + Grafana + кастомные метрики (latency, throughput, error rate)
- Логирование: запросы и ответы для отладки и дальнейшего fine-tune (с учётом приватности)
- RAG-слой: pgvector / Qdrant (если нужно — мы писали про RAG)
- Балансировщик: nginx или Traefik
Без оркестратора голая модель — это игрушка. Production-стек собирается так же серьёзно, как любая микросервисная архитектура.
Реальный кейс: банк, on-premise LLM
Региональный банк, 800 операторов поддержки, 12 тыс. обращений/день. Внедряли AI-помощник для операторов.
Что было: пилот на Claude через корпоративную подписку. Качество — отличное, но юристы заблокировали продакшн (банковская тайна не должна уходить в США).
Что сделали:
– Купили сервер 2×H100 (3.8 млн ₽)
– Поставили Llama 70B + Saiga 3 70B для русскоязычных задач
– Развернули vLLM, FastAPI-оркестратор, мониторинг
– Подключили RAG на pgvector (база знаний банка)
– Интеграция с CRM, документами, операторскими интерфейсами
Сроки: 4 месяца от закупки железа до production.
Результат через 6 месяцев:
– Среднее время обработки обращения: 6 → 2.8 минут (–53%)
– Удовлетворённость операторов: 4.1 → 4.6 из 5
– Точность ответов AI: 91% (по сравнению с 88% на Claude)
– Полное соответствие требованиям ФСТЭК и банковской тайны
– TCO: 4.2 млн ₽ единовременно + 280 тыс ₽/мес (инженер по поддержке + электричество + амортизация)
Эквивалент в API: было бы ~1.4 млн ₽/мес. Окупаемость железа: 3.5 месяца.
Что НЕ работает в self-hosted
Ошибка 1: «купим железо и наймём студента-DevOps».
Self-hosted LLM в продакшн — это инженерия. Нужны люди, которые умеют тюнить vLLM, понимают GPU-память, могут диагностировать падения throughput. Дешёвых таких нет, реальная зарплата в РФ — 400–700 тыс ₽/мес.
Ошибка 2: ставить топ-модель «потому что хочется».
Если задачу закрывает Mistral 7B — нет смысла ставить Llama 405B. Окупаемость рухнет, латентность вырастет, проблем будет в 10 раз больше.
Ошибка 3: пытаться обогнать API на сложных задачах.
На многошаговом рассуждении, на больших агентных сценариях, на коде — Claude Sonnet 4.6 / GPT-4o пока сильнее любой open-source модели. Если у вас 80% задач — рассуждение и код, self-hosted не выгоден.
Ошибка 4: недооценить затраты на поддержку.
TCO self-hosted = железо + электричество + амортизация (3–4 года) + инженер + мониторинг + обновления моделей. Реальный месячный TCO — 200–500 тыс ₽ на средней сборке.
Ошибка 5: забить на безопасность модели.
Open-source модели могут «галлюцинировать», выдавать неуместное, попадать в jailbreak. Без guardrails (NeMo Guardrails, LangSmith, кастомные фильтры) в продакшн нельзя.
Когда self-hosted НЕ нужен
- Объём меньше 10 млн токенов/мес — экономика не сходится
- Задачи требуют топ-моделей (агенты, код, длинный контекст с консистентностью)
- Нет компетенции в DevOps/MLOps — поддержка станет проблемой
- Данные можно обрабатывать через Yandex GPT (152-ФЗ) — не усложняйте
В этих случаях правильное решение — API с маршрутизацией задач между Yandex GPT (для данных в РФ), GPT-4o-mini (для массовых дешёвых), Claude (для сложных).
Как решить, идти или не идти
Простой чек-лист:
- Объём токенов/мес: < 10 млн — API, > 50 млн — рассматриваем on-premise
- Требования по данным: можно ли в Yandex GPT? Если нет — on-premise обязателен
- Латентность: нужен ответ за 200 мс? Только on-premise
- Компетенции в команде: есть ML/DevOps уровня senior? Если нет — нужен партнёр или API
- Готов на капекс: 600 тыс — 14 млн ₽ на железо плюс полгода на внедрение
Если 2+ пункта «за on-premise» — есть смысл считать экономику.
FAQ
А Llama / Saiga точно бесплатные?
Лицензии разрешают коммерческое использование с оговорками. Llama 3.x — бесплатно при выручке клиента < 700 млн пользователей/мес. Saiga / Vikhr — Apache 2.0. То есть для подавляющего большинства бизнесов — бесплатно.
Что выгоднее — купить сервер или арендовать GPU в облаке?
Если стабильная нагрузка 24/7 — за 14 месяцев свой сервер окупает облако. Если нагрузка плавающая — облако дешевле, потому что платите только за использованные часы.
Можно ли в РФ свободно скачать веса моделей?
Да, Llama / Mistral / Qwen / DeepSeek доступны через Hugging Face. Иногда через зеркала. Прецедентов блокировок нет на 2026 год.
Сколько электричества жрёт сервер с 4×H100?
~3.5 кВт под полной нагрузкой. В месяц на коммерческом тарифе РФ — ~25 тыс ₽. По сравнению с амортизацией железа — копейки.
Можно ли запустить Llama 70B на M3 Max или M4 Max (Apple Silicon)?
Да, через MLX или llama.cpp. Производительность — 5–10 токенов/сек, для пилотов годится, для production — нет.
Хотите оценить, нужен ли вам self-hosted или хватит API? Напишите — посчитаем TCO и сравним с альтернативами на ваших объёмах.