Локальная нейросеть на вашем сервере
Корпоративный AI, который работает без интернета и не отдаёт ваши данные наружу. Устанавливаем под ключ: железо, модели, интеграции, поддержка.
Почему облачный AI не подходит бизнесу
ChatGPT и облачные сервисы удобны, пока речь не заходит о коммерческой тайне и персональных данных.
Данные уходят в чужое облако
Договоры, персональные данные и переписка отправляются на серверы OpenAI или Яндекса. Для 152-ФЗ, банков и медицины это неприемлемо.
Платите за каждый запрос
Облачные модели тарифицируются по токенам. Чем активнее работают сотрудники — тем больше счёт, и он растёт бесконечно.
Зависимость от доступа
Блокировки, санкции, проблемы с оплатой зарубежных сервисов картой РФ — и корпоративный AI встаёт.
Свой сервер с нейросетью внутри периметра
Мы ставим языковую модель на ваше оборудование. Сотрудники работают через привычный чат, но каждый запрос обрабатывается локально — ни один символ не уходит во внешние сервисы. Сервер можно полностью отключить от интернета, нейросеть продолжит работать.
- Подбор конфигурации сервера под ваши задачи и число пользователей
- Установка и настройка моделей (текст, зрение, распознавание речи)
- Веб-интерфейс чата для сотрудников + разграничение доступа
- Подключение к вашей базе знаний и документам (RAG)
- Интеграция с 1С, CRM, Telegram — по необходимости
- Обучение сотрудников и техподдержка
Когда нужна модель мощнее — данные всё равно не утекают
Рутину закрывает локальная модель внутри периметра. Но если задача требует топовой нейросети (сложный анализ, редкая экспертиза) — запрос уходит наружу только после двойной очистки от персональных и конфиденциальных данных.
Локальная модель, без интернета
- Сервер физически изолирован (air-gap) или закрыт файрволом
- Обрабатывает 80–90% типовых задач: документы, ответы, поиск по базе
- Персональные данные и коммерческая тайна не покидают контур
Топовая модель через API — с санитизацией
- Запрос очищается от ФИО, телефонов, адресов, счетов, реквизитов
- Чувствительные сущности заменяются плейсхолдерами (маскирование)
- Ответ возвращается в контур и данные восстанавливаются локально
Двойной контроль очистки — прежде чем запрос уйдёт наружу
Детектор ПДн
Правила и словари находят ФИО, телефоны, e-mail, ИНН, счета, адреса, номера договоров
Проверка моделью
Локальная нейросеть перечитывает текст и ищет то, что пропустили правила — контекстные утечки
Маскирование
Найденное заменяется на метки вида [КЛИЕНТ_1], [СЧЁТ_2]. Наружу уходит обезличенный текст
Аудит-лог
Что именно ушло во внешний API — фиксируется. Можно проверить постфактум и отозвать доступ
Если детектор или модель сомневаются — запрос не уходит наружу, а обрабатывается локально. Политику можно ужесточить до полного запрета внешних вызовов для отдельных отделов.
Что реально делают на локальном AI-сервере
Один сервер закрывает задачи сразу нескольких отделов — модель одна, сценариев много.
База знаний и регламенты
Поиск по внутренним документам, ответы сотрудникам «как у нас принято», сводка по инструкциям вместо чтения 200 страниц
Юридический отдел
Анализ договоров, сравнение редакций, поиск рисков, подготовка типовых документов по шаблонам компании
Бухгалтерия и документооборот
Распознавание накладных, счетов и УПД с фото, сверка сумм и НДС, выгрузка в учётную систему
Продажи и КП
Подготовка коммерческих предложений, ответы на запросы клиентов, разбор переписки и выделение договорённостей
Поддержка клиентов
Ответы на типовые обращения по вашей документации на сайте и в мессенджерах, эскалация сложного
HR и кадры
Скрининг резюме по критериям, ответы сотрудникам по кадровым вопросам, черновики вакансий и офферов
Разработка
Код-ассистент внутри периметра: исходники не уходят наружу, работает с вашей кодовой базой и стандартами
Инженеры и производство
Поиск по техдокументации и ГОСТам, помощь в подборе оборудования, разбор регламентов и паспортов
Аналитика
Отчёты словами вместо таблиц, поиск аномалий в данных, ответы на вопросы «почему упали продажи в мае»
Контент и маркетинг
Статьи, описания товаров, рассылки, переводы на другие языки — в стиле вашего бренда
Телефония и звонки
Расшифровка разговоров, краткое содержание, контроль качества, автоматическое заполнение CRM
ИБ и логи
Разбор логов и инцидентов, объяснение подозрительной активности человеческим языком
Какая модель что умеет и сколько ей нужно видеопамяти
Главный ресурс локального AI — видеопамять (VRAM). Ниже реальные ориентиры для сжатых (квантизованных) моделей — именно в таком виде их и запускают в продакшене.
| Класс модели | VRAM | Что тянет |
|---|---|---|
| 7–9B | 6–8 ГБ | Чат, суммаризация, классификация, простые ответы по базе знаний. Быстрая и дешёвая, но путается в длинных инструкциях. |
| 12–14B | 9–12 ГБ | Уверенная работа с документами, разбор писем, черновики текстов, базовый код. Рабочий минимум для бизнеса. |
| 27–32B | 18–24 ГБ | Рабочая лошадка: анализ договоров, сложные инструкции, распознавание изображений, длинный контекст. Наш основной выбор. |
| 70B | 40–48 ГБ | Близко к топовым облачным моделям на большинстве деловых задач. Нужны две карты или профессиональный ускоритель. |
| 100B+ (MoE) | 80 ГБ и выше | Максимальное качество рассуждений. Серверные ускорители, отдельное охлаждение и питание. |
Важно: цифры выше — на одного-двух одновременных пользователей. При десятках параллельных запросов память расходуется быстрее, и запас планируется отдельно.
Сколько стоит сервер под ваши задачи
Ориентиры под ключ: железо, сборка, установка моделей, настройка и запуск. Итоговая смета зависит от курса, наличия карт и требований к отказоустойчивости — считаем под конкретную задачу.
Старт
- ·Модели до 14B свободно
- ·27B в сжатии
- ·База знаний, поддержка, тексты
Рабочий
чаще всего- ·27–32B комфортно
- ·Зрение + распознавание речи
- ·Договоры, первичка, аналитика
Продвинутый
- ·70B модели
- ·Несколько моделей параллельно
- ·Высокая нагрузка отделов
Максимум
- ·100B+ MoE
- ·Отказоустойчивость
- ·Отдельная стойка, питание, охлаждение
Если у вас уже есть подходящий сервер — разворачиваем на нём, тогда остаётся только стоимость внедрения. Возможна аренда мощностей на нашей площадке в России на время пилота.
Настольный сервер или в стойку
Одну и ту же нейросеть мы собираем в двух исполнениях. Выбор зависит от того, где сервер будет стоять и сколько людей на нём работают. Поможем определиться на бесплатной консультации.
Настольный (Tower)
Мощная рабочая станция в напольном корпусе. Ставится прямо в кабинете или небольшой серверной, работает от обычной розетки, не требует стойки и профессионального охлаждения.
- ✓Не нужна серверная стойка и её инфраструктура
- ✓Тихая работа — можно поставить в офисе
- ✓Дешевле в закупке и обслуживании
- ✓Быстрый запуск: привезли, подключили, работает
- ✓1–2 видеокарты — модели до 70B
Стоечный (Rack, 4U)
Серверное исполнение для монтажа в стойку 19″. Резервируемое питание, горячая замена дисков, профессиональное охлаждение под круглосуточную нагрузку и плотную установку нескольких GPU.
- ✓Резервирование питания и отказоустойчивость
- ✓2–8 видеокарт — модели 70B–100B+ параллельно
- ✓Рассчитан на работу 24/7 под нагрузкой
- ✓Масштабирование: добавление карт и узлов
- ✓Штатное место в серверной / ЦОД
Из чего складывается цена «под ключ»
Мы работаем прозрачно: в смете отдельно комплектующие по актуальному прайсу и отдельно наша работа. Вы видите, за что платите, и не переплачиваете за «чёрный ящик».
Стоимость сборки и настройки — фиксированная доля от бюджета проекта, известна заранее. Именно за подбор конфигурации, безошибочную сборку и рабочую настройку моделей вы и платите — это то, где самостоятельная закупка комплектующих чаще всего оборачивается потерянными неделями и переплатой.
«Купим карту и поставим сами» — где обычно спотыкаются
Запустить модель на своей машине действительно можно за вечер. Проблемы начинаются, когда с ней должны работать реальные отделы каждый день. Вот что съедает недели и приводит к тому, что проект глохнет:
Подбор модели и сжатия
Слишком сильное сжатие убивает качество на ваших задачах, слабое — не влезает в память. Точка баланса подбирается тестами на ваших документах, а не по обзорам.
Поиск по вашим документам
Ответы «из головы» вместо фактов — типичная беда самосборных решений. Корректная нарезка документов, эмбеддинги и переранжирование — отдельная инженерная работа.
Несколько пользователей сразу
То, что летает у одного, встаёт колом на пятнадцати. Нужны очереди, батчинг и расчёт памяти под конкурентные запросы.
Очистка от ПДн для внешних моделей
Если хотя бы иногда обращаетесь к облачным моделям — нужен контур санитизации с двойной проверкой и аудитом. Ошибка здесь — это утечка.
Интеграции и доступы
1С, CRM, почта, Telegram, разграничение прав по отделам — здесь заканчивается «поставил модель» и начинается система.
Поддержка и обновления
Модели и библиотеки обновляются, железо деградирует, задачи меняются. Без сопровождения решение устаревает за полгода.
Мы проходили это на своей инфраструктуре: у нас работает собственный сервер с локальной моделью, на котором крутятся наши же продукты. Поэтому конфигурацию подбираем не по спецификациям с сайта производителя, а по тому, как оно ведёт себя под реальной нагрузкой.
Кому нужна корпоративная нейросеть
Банки и финансы
Работа с клиентскими данными без передачи третьим лицам
Медицина
Медицинские записи и снимки не покидают клинику
Юристы
Анализ договоров и дел под адвокатской тайной
Ритейл и услуги
Клиентские базы и программы лояльности обрабатываются без передачи вовне
Производство
Техдокументация, регламенты, помощь инженерам
IT и разработка
Код-ассистент без утечки исходников наружу
Частые вопросы
Рассчитаем конфигурацию под ваши задачи
Расскажите, сколько сотрудников будет пользоваться и с какими документами работать — подберём сервер и посчитаем стоимость. Консультация бесплатная.
Смотрите также: другие AI-решения Stitex