Локальная нейросеть — это большая языковая модель (LLM), развёрнутая на собственном GPU-сервере внутри контура компании, без отправки данных во внешнее облако. Для этого берут open-source модель (DeepSeek, Qwen, GigaChat, Saiga и подобные — товарные знаки принадлежат правообладателям), подбирают сервер с достаточным объёмом видеопамяти под её размер и точность, разворачивают инференс-сервер (например, vLLM или Ollama) и подключают к нему внутренние сервисы по API. Прикинуть нужный объём VRAM и число GPU удобно калькулятором ниже.
Калькулятор GPU под локальную LLM
Оценка для инференса с запасом ~30 % на контекст и служебные буферы (KV-cache). Точную конфигурацию под вашу модель подберёт инженер ВИСТЛАН.
Зачем компании локальная LLM
Облачные ИИ-сервисы удобны, но при работе с чувствительными данными они создают риски: запросы и документы уходят на внешнюю инфраструктуру, часть из которой расположена за рубежом. Для B2B и госсектора это вопрос не только удобства, но и соблюдения требований к обработке информации. Локальная нейросеть закрывает эти задачи:
- данные остаются внутри периметра — ничего не уходит в чужое облако;
- нет зависимости от внешних API, тарифов и блокировок — это часть импортозамещения облачных ИИ;
- модель можно дообучить на своих документах и регламентах;
- предсказуемая стоимость: вы платите за железо и электричество, а не за токены;
- интеграция с внутренними системами (1С, СЭД, базой знаний, чат-ботом поддержки) по API внутри сети.
Какие open-source модели берут
Запускают именно открытые модели с разрешающей лицензией — их можно скачать и развернуть локально. Конкретный выбор зависит от задачи: генерация текста, работа с кодом, суммаризация, RAG по базе знаний. Все названия ниже — товарные знаки соответствующих правообладателей.
| Класс модели | Примеры | Типичная задача |
|---|---|---|
| Универсальные чат-модели | Qwen, DeepSeek, Llama-подобные | Ответы, суммаризация, ассистент |
| Российские модели | GigaChat, YandexGPT-подобные, Saiga | Русскоязычные сценарии, RAG |
| Модели под код | DeepSeek-Coder, Qwen-Coder и аналоги | Подсказки разработчику, ревью |
| Компактные модели | 7–14 млрд параметров | Лёгкие задачи на одной карте |
Часть российских моделей доступна в открытых версиях для локального запуска, часть — только как облачный сервис; это уточняется у правообладателя перед внедрением.
Требования к GPU-серверу
Ключевой ресурс для LLM — объём видеопамяти (VRAM). Модель должна целиком поместиться в память GPU вместе с контекстом (KV-cache). Чем больше параметров и выше точность, тем больше VRAM нужно. Снизить требования помогает квантизация — перевод весов в INT8 или INT4, что в разы уменьшает объём памяти при небольшой потере качества.
| Размер модели | INT4, ориентир VRAM | FP16, ориентир VRAM | Сценарий |
|---|---|---|---|
| 7–8 млрд | ~6–8 ГБ | ~16 ГБ | Одна карта 24 ГБ |
| 14 млрд | ~10–12 ГБ | ~28 ГБ | Одна карта 24–48 ГБ |
| 32 млрд | ~20–24 ГБ | ~64 ГБ | 1–2 карты по 48 ГБ |
| 70 млрд | ~40–48 ГБ | ~140 ГБ | 2+ карты 48–80 ГБ |
Помимо GPU важны: оперативная память сервера (обычно в 1,5–2 раза больше суммарной VRAM), быстрые NVMe-диски под веса моделей, достаточное питание и охлаждение. Для серьёзных нагрузок и нескольких моделей собирают GPU-кластер для ML и LLM. Подобрать готовый сервер помогает обзор GPU-серверов для ИИ и локальных LLM.
Инференс или обучение
Это две разные по требованиям задачи:
- Инференс — запуск готовой модели для ответов. Нужен достаточный объём VRAM, требования умеренные. Большинству компаний нужно именно это.
- Обучение и дообучение — настройка модели под свои данные. Требует кратно больше памяти и вычислений; чаще применяют экономные методы (LoRA, QLoRA), которые позволяют дообучать на меньшем железе.
Для старта обычно берут инференс существующей модели, а дообучение под свои документы подключают позже через RAG (поиск по базе знаний) или лёгкий fine-tuning.
Безопасность и контур
- сервер размещают во внутренней сети, без прямого доступа из интернета;
- доступ к API модели — только для внутренних сервисов и по аутентификации;
- логи запросов и ответов хранятся на вашей стороне согласно политикам;
- модель и веса — на ваших дисках, обновления контролируете вы;
- при необходимости — изоляция от внешней сети полностью (air-gap).
Подберём и соберём GPU-сервер под вашу локальную LLM — с настройкой инференса под ключ.
Частые вопросы
Сколько видеопамяти нужно для локальной LLM?
Зависит от размера модели и точности. Модель 7–8 млрд параметров в квантизации INT4 умещается в ~6–8 ГБ VRAM, модель 70 млрд требует уже 40 ГБ и больше. Точную оценку с запасом на контекст даёт калькулятор выше.
Можно ли запустить нейросеть без доступа в интернет?
Да. После загрузки весов модель работает полностью офлайн, в изолированном контуре. Это один из ключевых сценариев для госсектора и субъектов КИИ, где важно, чтобы данные не покидали периметр.
Чем локальная LLM лучше облачного сервиса?
Данные остаются внутри компании, нет зависимости от внешних API и тарифов, стоимость предсказуема, модель можно дообучить на своих документах. Это часть импортозамещения облачных ИИ-сервисов.
Нужно ли дообучать модель или хватит готовой?
Для большинства задач достаточно инференса готовой open-source модели, дополненной поиском по вашей базе знаний (RAG). Дообучение под свои данные подключают позже, когда сформированы сценарии использования.
Какие модели можно развернуть локально?
Открытые модели с разрешающей лицензией: DeepSeek, Qwen, Saiga, ряд российских моделей и их аналоги. Названия — товарные знаки правообладателей; доступность открытой версии уточняется перед внедрением.
