Почему именно видеопамять
Нейросеть работает быстро только тогда, когда помещается в память видеокарты целиком. Веса модели — это миллиарды чисел, и при генерации ответа они должны быть под рукой у GPU. Как только модель не влезает в VRAM и «вываливается» в обычную оперативную память или на диск, скорость падает в десятки раз — из «отвечает за секунду» получается «отвечает за минуту».
Поэтому при выборе железа для локального AI смотрят не на процессор и не на объём ОЗУ в первую очередь, а на объём видеопамяти. Он задаёт потолок: какого класса модель вы вообще сможете запустить.
Как прикинуть память под модель
Грубый ориентир для сжатых (квантизованных) моделей: примерно столько гигабайт VRAM, сколько у модели миллиардов параметров, плюс запас на контекст. Модель на 32 млрд параметров в типичном сжатии занимает порядка 18–24 ГБ. Точная цифра зависит от степени сжатия и длины контекста, но порядок именно такой.
Сколько VRAM нужно моделям разных классов
Ориентиры для квантизованных моделей — именно в таком виде их запускают в продакшене:
| Класс модели | VRAM | Что тянет |
|---|---|---|
| 7–9B | 6–8 ГБ | Чат, суммаризация, классификация, простые ответы по базе знаний. |
| 12–14B | 9–12 ГБ | Уверенная работа с документами, письма, черновики, базовый код. Рабочий минимум. |
| 27–32B | 18–24 ГБ | Анализ договоров, сложные инструкции, зрение, длинный контекст. Оптимум для бизнеса. |
| 70B | 40–48 ГБ | Близко к топовым облачным моделям. Нужны две карты или профессиональный ускоритель. |
| 100B+ (MoE) | 80 ГБ и выше | Максимальное качество рассуждений. Серверные ускорители, отдельное питание. |
Не только модель: зрение, речь, поиск
Если сервер должен не только отвечать текстом, заложите память на дополнительные задачи:
- •Зрение (документы, фото, сканы) — обычно та же модель или +2–6 ГБ на отдельную,
- •Распознавание речи (расшифровка звонков) — 2–10 ГБ, часто выносится на процессор,
- •Поиск по базе знаний (RAG) — около 1–2 ГБ на модель эмбеддингов.
Главный подвох: несколько пользователей сразу
Цифры из таблицы — это память под саму модель на одного-двух одновременных пользователей. Но каждый активный запрос дополнительно расходует VRAM под так называемый контекст (KV-кэш) — и при десятках параллельных обращений память тает заметно быстрее.
Именно здесь ломаются самосборные решения: модель, которая «летала» при тестах у одного человека, встаёт колом на пятнадцати сотрудниках. Поэтому под многопользовательский режим память планируют с запасом, а на движке инференса настраивают очереди и батчинг. Правило простое: берите VRAM с запасом под пиковую нагрузку, а не впритык под модель.
Какая видеокарта под какой класс
| Видеопамять | Что комфортно запускать | Типичный сценарий |
|---|---|---|
| 24 ГБ | до 14B свободно, 27B в сжатии | команда 5–15 человек, базовые задачи |
| 32 ГБ | 27–32B + зрение и речь | рабочая лошадка для 15–50 человек |
| 48+ ГБ (2 карты) | 70B модели, несколько моделей сразу | нагруженные отделы, 50–150 человек |
| 80 ГБ и выше | 100B+ MoE, отказоустойчивость | от 150 человек, требования дата-центра |
Готовые конфигурации под ключ
Чтобы соотнести память с бюджетом — ориентиры сервера под ключ (железо, сборка, установка моделей, настройка):
| Конфигурация | Видеопамять | Пользователи | Цена под ключ |
|---|---|---|---|
| Старт | 1 карта · 24 ГБ | 5–15 человек | от 450 000 ₽ |
| Рабочий | 1 карта · 32 ГБ | 15–50 человек | от 800 000 ₽ |
| Продвинутый | 2 карты · 48+ ГБ | 50–150 человек | от 2 000 000 ₽ |
| Максимум | серверные 80 ГБ+ | от 150 человек | от 5 000 000 ₽ |
Как выбрать между настольным и стоечным исполнением и что входит в сборку — в гайде как сделать свой AI-сервер.
Итог
Видеопамять — это потолок вашего локального AI. Для большинства компаний оптимальны 24–32 ГБ: этого хватает на модель рабочего класса 27–32B со зрением и распознаванием речи. Главное — не считать память впритык под модель: заложите запас под контекст и одновременных пользователей, иначе сервер «поедет» на реальной нагрузке. А точную цифру под ваши задачи и число сотрудников лучше считать вместе с теми, кто уже собирал такие серверы.