S
Stitex
Инфраструктура

Как сделать свой AI-сервер для компании: пошаговое руководство

Запустить нейросеть на своём железе можно за вечер — но чтобы ей ежедневно пользовались реальные отделы, нужен не только «поставить модель». Разбираем весь путь: от выбора модели под задачи до безопасности, с конкретными конфигурациями и ценами. Гайд написан по нашему опыту — мы сами держим локальный сервер, на котором работают наши продукты.

21 июля 202613 минутStitex Technologies

Зачем компании свой AI-сервер

Свой AI-сервер решает три задачи, которые облачный ChatGPT закрыть не может. Первое — данные не уходят наружу: договоры, персональные данные и переписка обрабатываются внутри периметра, что критично для 152-ФЗ, банков, медицины и юристов. Второе — фиксированная стоимость: вы платите один раз за железо, а не за токены, счёт по которым растёт с каждым активным сотрудником. Третье — независимость: сервер работает при блокировках, без интернета и без привязки к оплате зарубежного сервиса картой РФ.

Если вы ещё выбираете между облаком и своим сервером, посмотрите отдельное сравнение с расчётом стоимости владения на три года: локальная нейросеть или ChatGPT. Ниже — про то, как свой сервер собрать.

Шаг 1. Определить задачи и число пользователей

Это главный шаг: именно задачи и число одновременных пользователей определяют, какая нужна модель и, следовательно, какое железо. Ошибка здесь стоит либо переплаты за лишние видеокарты, либо купленного сервера, который «тормозит на пятнадцати сотрудниках».

Соберите список реальных сценариев. На практике он почти всегда сводится к нескольким группам:

  • Работа с документами и базой знаний — поиск, ответы «как у нас принято», сводки по регламентам,
  • Юридические и бухгалтерские задачи — анализ договоров, распознавание первички, сверка,
  • Клиентские процессы — поддержка, подготовка КП, разбор переписки,
  • Разработка — код-ассистент без утечки исходников наружу,
  • Аналитика — отчёты словами, поиск аномалий в данных.

Отдельно зафиксируйте пиковое число одновременных запросов. Пять человек, изредка задающих вопросы, и пятьдесят, работающих в AI постоянно, — это принципиально разное железо.

Шаг 2. Выбрать класс модели

Локальные модели различаются по числу параметров (в миллиардах, B). Чем больше — тем умнее и тем больше нужно видеопамяти. Для бизнеса почти всегда оптимальны модели «рабочего класса» 27–32B: они уверенно закрывают большинство задач и по-русски работают свободно.

Класс моделиНа что хватает
7–9BЧат, суммаризация, простые ответы по базе. Быстрая и дешёвая, путается в длинных инструкциях.
12–14BУверенная работа с документами, письма, черновики, базовый код. Рабочий минимум.
27–32BАнализ договоров, сложные инструкции, зрение, длинный контекст. Оптимум для бизнеса.
70BБлизко к топовым облачным моделям на большинстве деловых задач. Нужны две карты.
100B+ (MoE)Максимальное качество рассуждений. Серверные ускорители, отдельное питание.

Хорошая новость: почти все сильные модели 2026 года — открытые (семейства Qwen, Llama, DeepSeek, Gemma, Mistral) и бесплатны для коммерческого использования. Платите вы за железо и настройку, а не за лицензию на модель.

Шаг 3. Посчитать видеопамять и подобрать железо

Главный ресурс локального AI — не процессор и не оперативная память, а видеопамять (VRAM): модель должна поместиться в память видеокарты целиком. Грубый ориентир для сжатых (квантизованных) моделей — примерно столько же гигабайт VRAM, сколько миллиардов параметров, плюс запас на контекст и одновременных пользователей.

Точный расчёт памяти
Как считать VRAM под модель, зрение, распознавание речи и десятки параллельных пользователей — с таблицами и примерами разобрали в отдельном гайде: сколько видеопамяти нужно для локальной нейросети.

Помимо видеокарты сервер собирается из процессора, оперативной памяти (обычно вдвое больше суммарной VRAM), быстрых NVMe-дисков под модели и данные, надёжного блока питания и охлаждения под нагрузку. Но именно видеокарта задаёт и потолок качества, и большую часть бюджета.

Шаг 4. Выбрать форм-фактор: системник или в стойку

Одну и ту же нейросеть собирают в двух исполнениях — выбор зависит от того, где сервер будет стоять.

Настольный сервер (Tower)

Мощная рабочая станция в напольном корпусе. Ставится прямо в кабинете, работает от обычной розетки, не требует стойки и профессионального охлаждения. Тихая, дешевле в закупке, быстро запускается. 1–2 видеокарты — модели до 70B. Оптимально для 5–50 пользователей.

Стоечный сервер (Rack, 4U)

Серверное исполнение для монтажа в стойку 19″: резервируемое питание, горячая замена дисков, профессиональное охлаждение под работу 24/7 и плотную установку 2–8 видеокарт. Для нагруженных отделов и масштабирования — от 50 пользователей и выше.

Шаг 5. Собрать софт-стек

«Поставить модель» — это меньшая часть. Рабочий AI-сервер — это система из нескольких слоёв:

  • Движок инференса — запускает модель и обслуживает запросы (очереди, батчинг под нескольких пользователей),
  • Веб-интерфейс чата для сотрудников с разграничением доступа по отделам,
  • Поиск по вашим документам (RAG) — модель отвечает по вашим файлам, а не «из головы»,
  • Модели зрения и распознавания речи — если нужны фото, сканы, расшифровка звонков,
  • Интеграции — 1С, CRM, почта, Telegram — по необходимости.

Шаг 6. Обучить на своих данных

Ценность корпоративного AI не в «голой» модели, а в том, что она знает вашу компанию. В большинстве случаев это делается не переобучением весов (дорого и редко нужно), а через RAG: ваши сайты, каталог продуктов, документы, регламенты и база знаний индексируются, и модель отвечает, опираясь на них. Так она говорит вашими фактами и не выдумывает — а обновить знания можно, просто добавив документы.

Ключ к качеству RAG — корректная нарезка документов, хорошие эмбеддинги и переранжирование результатов. Это отдельная инженерная работа: именно здесь самосборные решения чаще всего начинают «отвечать мимо».

Шаг 7. Настроить безопасность

Смысл своего сервера — конфиденциальность, поэтому политику доступа настраивают жёстко. Возможны три режима, вплоть до полной изоляции:

  • Автономный (air-gap): сервер физически отключён от интернета, ни один запрос не уходит наружу — максимальная защита,
  • Гибридный: рутину делает локальная модель, а для редких топ-задач запрос уходит во внешнюю модель только после двойной очистки от ФИО, реквизитов и сумм,
  • С аудит-логом: фиксируется, что именно и когда уходило во внешний API — для проверки постфактум.

Готовые конфигурации и цены

Чтобы не собирать вслепую — ориентиры под ключ (железо, сборка, установка моделей, настройка). Итоговая смета зависит от курса и наличия карт, но порядок цифр такой:

КонфигурацияЖелезоПользователиЦена под ключ
Старт1 карта · 24 ГБ5–15 человекот 450 000 ₽
Рабочий1 карта · 32 ГБ15–50 человекот 800 000 ₽
Продвинутый2 карты · 48+ ГБ50–150 человекот 2 000 000 ₽
Максимумсерверные 80 ГБ+от 150 человекот 5 000 000 ₽

Мы работаем прозрачно: комплектующие — по актуальному прайсу без скрытой наценки на железо, отдельно — наша работа за подбор, сборку, тестирование и настройку моделей. Есть свой подходящий сервер — развернём на нём, тогда остаётся только внедрение.

«Купим карту и поставим сами» — где обычно спотыкаются

Запустить модель на одной машине для одного человека действительно просто. Проблемы начинаются, когда с ней должны работать отделы каждый день. Вот что чаще всего съедает недели:

  • Подбор модели и степени сжатия — сильное сжатие убивает качество, слабое не влезает в память; точка баланса ищется тестами на ваших задачах,
  • Поиск по документам — без корректного RAG модель отвечает «из головы» вместо фактов,
  • Несколько пользователей сразу — то, что летает у одного, встаёт колом на пятнадцати без очередей и расчёта памяти,
  • Интеграции и доступы — 1С, CRM, права по отделам; здесь заканчивается «поставил модель» и начинается система,
  • Поддержка — модели и библиотеки обновляются, без сопровождения решение устаревает за полгода.

Итог

Свой AI-сервер — это семь шагов: задачи → модель → видеопамять → форм-фактор → софт-стек → обучение на своих данных → безопасность. Технически это доступно любой компании, а окупается уже на 10–15 активных пользователях. Сложность не в «запустить», а в том, чтобы сервер стабильно работал под реальной нагрузкой отделов и отвечал вашими фактами. Если не хотите проходить эти грабли самостоятельно — мы собираем такие серверы под ключ и сопровождаем.

Подберём и соберём под вашу задачу

Расскажите, сколько сотрудников и с какими документами будут работать — рассчитаем конфигурацию и цену под ключ. Консультация бесплатная.