S
Stitex
Изолированный AI · 152-ФЗ

Локальная нейросеть на вашем сервере

Корпоративный AI, который работает без интернета и не отдаёт ваши данные наружу. Устанавливаем под ключ: железо, модели, интеграции, поддержка.

Данные остаются в компанииРаботает без интернетаБез оплаты за токены

Почему облачный AI не подходит бизнесу

ChatGPT и облачные сервисы удобны, пока речь не заходит о коммерческой тайне и персональных данных.

Данные уходят в чужое облако

Договоры, персональные данные и переписка отправляются на серверы OpenAI или Яндекса. Для 152-ФЗ, банков и медицины это неприемлемо.

Платите за каждый запрос

Облачные модели тарифицируются по токенам. Чем активнее работают сотрудники — тем больше счёт, и он растёт бесконечно.

Зависимость от доступа

Блокировки, санкции, проблемы с оплатой зарубежных сервисов картой РФ — и корпоративный AI встаёт.

Решение

Свой сервер с нейросетью внутри периметра

Мы ставим языковую модель на ваше оборудование. Сотрудники работают через привычный чат, но каждый запрос обрабатывается локально — ни один символ не уходит во внешние сервисы. Сервер можно полностью отключить от интернета, нейросеть продолжит работать.

  • Подбор конфигурации сервера под ваши задачи и число пользователей
  • Установка и настройка моделей (текст, зрение, распознавание речи)
  • Веб-интерфейс чата для сотрудников + разграничение доступа
  • Подключение к вашей базе знаний и документам (RAG)
  • Интеграция с 1С, CRM, Telegram — по необходимости
  • Обучение сотрудников и техподдержка
Облако vs локальная нейросеть
Где данныеСерверы за рубежомВнутри вашей компании
ОплатаЗа каждый запросОдин раз за сервер
Без интернетаНе работаетРаботает
152-ФЗ / тайнаРискСоответствует
Гибридный контур

Когда нужна модель мощнее — данные всё равно не утекают

Рутину закрывает локальная модель внутри периметра. Но если задача требует топовой нейросети (сложный анализ, редкая экспертиза) — запрос уходит наружу только после двойной очистки от персональных и конфиденциальных данных.

Контур 1 · Автономный

Локальная модель, без интернета

  • Сервер физически изолирован (air-gap) или закрыт файрволом
  • Обрабатывает 80–90% типовых задач: документы, ответы, поиск по базе
  • Персональные данные и коммерческая тайна не покидают контур
Контур 2 · Усиленный

Топовая модель через API — с санитизацией

  • Запрос очищается от ФИО, телефонов, адресов, счетов, реквизитов
  • Чувствительные сущности заменяются плейсхолдерами (маскирование)
  • Ответ возвращается в контур и данные восстанавливаются локально

Двойной контроль очистки — прежде чем запрос уйдёт наружу

1

Детектор ПДн

Правила и словари находят ФИО, телефоны, e-mail, ИНН, счета, адреса, номера договоров

2

Проверка моделью

Локальная нейросеть перечитывает текст и ищет то, что пропустили правила — контекстные утечки

3

Маскирование

Найденное заменяется на метки вида [КЛИЕНТ_1], [СЧЁТ_2]. Наружу уходит обезличенный текст

4

Аудит-лог

Что именно ушло во внешний API — фиксируется. Можно проверить постфактум и отозвать доступ

Если детектор или модель сомневаются — запрос не уходит наружу, а обрабатывается локально. Политику можно ужесточить до полного запрета внешних вызовов для отдельных отделов.

Применения

Что реально делают на локальном AI-сервере

Один сервер закрывает задачи сразу нескольких отделов — модель одна, сценариев много.

📚

База знаний и регламенты

Поиск по внутренним документам, ответы сотрудникам «как у нас принято», сводка по инструкциям вместо чтения 200 страниц

⚖️

Юридический отдел

Анализ договоров, сравнение редакций, поиск рисков, подготовка типовых документов по шаблонам компании

📑

Бухгалтерия и документооборот

Распознавание накладных, счетов и УПД с фото, сверка сумм и НДС, выгрузка в учётную систему

💼

Продажи и КП

Подготовка коммерческих предложений, ответы на запросы клиентов, разбор переписки и выделение договорённостей

💬

Поддержка клиентов

Ответы на типовые обращения по вашей документации на сайте и в мессенджерах, эскалация сложного

👥

HR и кадры

Скрининг резюме по критериям, ответы сотрудникам по кадровым вопросам, черновики вакансий и офферов

💻

Разработка

Код-ассистент внутри периметра: исходники не уходят наружу, работает с вашей кодовой базой и стандартами

🏭

Инженеры и производство

Поиск по техдокументации и ГОСТам, помощь в подборе оборудования, разбор регламентов и паспортов

📊

Аналитика

Отчёты словами вместо таблиц, поиск аномалий в данных, ответы на вопросы «почему упали продажи в мае»

✍️

Контент и маркетинг

Статьи, описания товаров, рассылки, переводы на другие языки — в стиле вашего бренда

📞

Телефония и звонки

Расшифровка разговоров, краткое содержание, контроль качества, автоматическое заполнение CRM

🛡

ИБ и логи

Разбор логов и инцидентов, объяснение подозрительной активности человеческим языком

Модели и память

Какая модель что умеет и сколько ей нужно видеопамяти

Главный ресурс локального AI — видеопамять (VRAM). Ниже реальные ориентиры для сжатых (квантизованных) моделей — именно в таком виде их и запускают в продакшене.

Класс моделиVRAMЧто тянет
7–9B6–8 ГБЧат, суммаризация, классификация, простые ответы по базе знаний. Быстрая и дешёвая, но путается в длинных инструкциях.
12–14B9–12 ГБУверенная работа с документами, разбор писем, черновики текстов, базовый код. Рабочий минимум для бизнеса.
27–32B18–24 ГБРабочая лошадка: анализ договоров, сложные инструкции, распознавание изображений, длинный контекст. Наш основной выбор.
70B40–48 ГББлизко к топовым облачным моделям на большинстве деловых задач. Нужны две карты или профессиональный ускоритель.
100B+ (MoE)80 ГБ и вышеМаксимальное качество рассуждений. Серверные ускорители, отдельное охлаждение и питание.
Зрение (документы, фото)
обычно та же модель или +2–6 ГБ на отдельную
Распознавание речи
2–10 ГБ, часто выносим на процессор
Поиск по базе знаний
1–2 ГБ на модель эмбеддингов

Важно: цифры выше — на одного-двух одновременных пользователей. При десятках параллельных запросов память расходуется быстрее, и запас планируется отдельно.

Конфигурации и бюджет

Сколько стоит сервер под ваши задачи

Ориентиры под ключ: железо, сборка, установка моделей, настройка и запуск. Итоговая смета зависит от курса, наличия карт и требований к отказоустойчивости — считаем под конкретную задачу.

Старт

1 карта · 24 ГБ
5–15 человек
  • ·Модели до 14B свободно
  • ·27B в сжатии
  • ·База знаний, поддержка, тексты
от 450 000 ₽
под ключ, ориентир

Рабочий

чаще всего
1 карта · 32 ГБ
15–50 человек
  • ·27–32B комфортно
  • ·Зрение + распознавание речи
  • ·Договоры, первичка, аналитика
от 800 000 ₽
под ключ, ориентир

Продвинутый

2 карты · 48+ ГБ
50–150 человек
  • ·70B модели
  • ·Несколько моделей параллельно
  • ·Высокая нагрузка отделов
от 2 000 000 ₽
под ключ, ориентир

Максимум

серверные 80 ГБ+
от 150 человек
  • ·100B+ MoE
  • ·Отказоустойчивость
  • ·Отдельная стойка, питание, охлаждение
от 5 000 000 ₽
под ключ, ориентир

Если у вас уже есть подходящий сервер — разворачиваем на нём, тогда остаётся только стоимость внедрения. Возможна аренда мощностей на нашей площадке в России на время пилота.

Форм-фактор

Настольный сервер или в стойку

Одну и ту же нейросеть мы собираем в двух исполнениях. Выбор зависит от того, где сервер будет стоять и сколько людей на нём работают. Поможем определиться на бесплатной консультации.

Настольный (Tower)

Малый и средний бизнес, 5–50 пользователей

Мощная рабочая станция в напольном корпусе. Ставится прямо в кабинете или небольшой серверной, работает от обычной розетки, не требует стойки и профессионального охлаждения.

  • Не нужна серверная стойка и её инфраструктура
  • Тихая работа — можно поставить в офисе
  • Дешевле в закупке и обслуживании
  • Быстрый запуск: привезли, подключили, работает
  • 1–2 видеокарты — модели до 70B
Оптимально для конфигураций Старт и Рабочий

Стоечный (Rack, 4U)

Нагруженные отделы и 24/7, от 50 пользователей

Серверное исполнение для монтажа в стойку 19″. Резервируемое питание, горячая замена дисков, профессиональное охлаждение под круглосуточную нагрузку и плотную установку нескольких GPU.

  • Резервирование питания и отказоустойчивость
  • 2–8 видеокарт — модели 70B–100B+ параллельно
  • Рассчитан на работу 24/7 под нагрузкой
  • Масштабирование: добавление карт и узлов
  • Штатное место в серверной / ЦОД
Оптимально для конфигураций Продвинутый и Максимум

Из чего складывается цена «под ключ»

Мы работаем прозрачно: в смете отдельно комплектующие по актуальному прайсу и отдельно наша работа. Вы видите, за что платите, и не переплачиваете за «чёрный ящик».

1. Комплектующие
Подбор и закупка железа под вашу задачу: видеокарты, процессор, память, диски, питание, охлаждение. По прайсу, без скрытой наценки на компоненты.
2. Сборка и тест
Профессиональная сборка, прогон под нагрузкой, стресс-тест стабильности и температур. На выходе — проверенный сервер, а не набор деталей.
3. Настройка ПО
Установка моделей в нужном сжатии, веб-интерфейс, подключение к вашим документам (RAG), разграничение доступа, интеграции с 1С/CRM/Telegram.
4. Гарантия и поддержка
Гарантия на сборку, обучение сотрудников, удалённое сопровождение и обновление моделей. Сервер остаётся рабочим инструментом, а не разовой поставкой.

Стоимость сборки и настройки — фиксированная доля от бюджета проекта, известна заранее. Именно за подбор конфигурации, безошибочную сборку и рабочую настройку моделей вы и платите — это то, где самостоятельная закупка комплектующих чаще всего оборачивается потерянными неделями и переплатой.

«Купим карту и поставим сами» — где обычно спотыкаются

Запустить модель на своей машине действительно можно за вечер. Проблемы начинаются, когда с ней должны работать реальные отделы каждый день. Вот что съедает недели и приводит к тому, что проект глохнет:

Подбор модели и сжатия

Слишком сильное сжатие убивает качество на ваших задачах, слабое — не влезает в память. Точка баланса подбирается тестами на ваших документах, а не по обзорам.

Поиск по вашим документам

Ответы «из головы» вместо фактов — типичная беда самосборных решений. Корректная нарезка документов, эмбеддинги и переранжирование — отдельная инженерная работа.

Несколько пользователей сразу

То, что летает у одного, встаёт колом на пятнадцати. Нужны очереди, батчинг и расчёт памяти под конкурентные запросы.

Очистка от ПДн для внешних моделей

Если хотя бы иногда обращаетесь к облачным моделям — нужен контур санитизации с двойной проверкой и аудитом. Ошибка здесь — это утечка.

Интеграции и доступы

1С, CRM, почта, Telegram, разграничение прав по отделам — здесь заканчивается «поставил модель» и начинается система.

Поддержка и обновления

Модели и библиотеки обновляются, железо деградирует, задачи меняются. Без сопровождения решение устаревает за полгода.

Мы проходили это на своей инфраструктуре: у нас работает собственный сервер с локальной моделью, на котором крутятся наши же продукты. Поэтому конфигурацию подбираем не по спецификациям с сайта производителя, а по тому, как оно ведёт себя под реальной нагрузкой.

Кому нужна корпоративная нейросеть

Банки и финансы

Работа с клиентскими данными без передачи третьим лицам

Медицина

Медицинские записи и снимки не покидают клинику

Юристы

Анализ договоров и дел под адвокатской тайной

Ритейл и услуги

Клиентские базы и программы лояльности обрабатываются без передачи вовне

Производство

Техдокументация, регламенты, помощь инженерам

IT и разработка

Код-ассистент без утечки исходников наружу

Частые вопросы

Это языковая модель (LLM), которая работает на вашем собственном сервере, а не в облаке OpenAI или Яндекса. Все запросы и документы обрабатываются внутри вашей инфраструктуры и никуда не передаются.

Рассчитаем конфигурацию под ваши задачи

Расскажите, сколько сотрудников будет пользоваться и с какими документами работать — подберём сервер и посчитаем стоимость. Консультация бесплатная.

Смотрите также: другие AI-решения Stitex