S
Stitex
Инфраструктура

Сколько видеопамяти нужно для локальной нейросети

Первый вопрос при сборке локального AI: какую видеокарту брать. Ответ упирается в одну цифру — объём видеопамяти. Разбираем, сколько VRAM нужно моделям разных классов, что такое квантизация, как заложить память под зрение, речь и десятки пользователей, и какая карта под какую задачу.

21 июля 202610 минутStitex Technologies

Почему именно видеопамять

Нейросеть работает быстро только тогда, когда помещается в память видеокарты целиком. Веса модели — это миллиарды чисел, и при генерации ответа они должны быть под рукой у GPU. Как только модель не влезает в VRAM и «вываливается» в обычную оперативную память или на диск, скорость падает в десятки раз — из «отвечает за секунду» получается «отвечает за минуту».

Поэтому при выборе железа для локального AI смотрят не на процессор и не на объём ОЗУ в первую очередь, а на объём видеопамяти. Он задаёт потолок: какого класса модель вы вообще сможете запустить.

Как прикинуть память под модель

Грубый ориентир для сжатых (квантизованных) моделей: примерно столько гигабайт VRAM, сколько у модели миллиардов параметров, плюс запас на контекст. Модель на 32 млрд параметров в типичном сжатии занимает порядка 18–24 ГБ. Точная цифра зависит от степени сжатия и длины контекста, но порядок именно такой.

Что такое квантизация
Квантизация — это сжатие весов модели: вместо 16 бит на число используют 8, 5 или 4 бита. Модель занимает в 2–4 раза меньше памяти почти без потери качества на деловых задачах. В продакшене локальные модели почти всегда запускают именно в сжатом виде (Q4–Q8) — это стандарт, а не компромисс «на бедность».

Сколько VRAM нужно моделям разных классов

Ориентиры для квантизованных моделей — именно в таком виде их запускают в продакшене:

Класс моделиVRAMЧто тянет
7–9B6–8 ГБЧат, суммаризация, классификация, простые ответы по базе знаний.
12–14B9–12 ГБУверенная работа с документами, письма, черновики, базовый код. Рабочий минимум.
27–32B18–24 ГБАнализ договоров, сложные инструкции, зрение, длинный контекст. Оптимум для бизнеса.
70B40–48 ГББлизко к топовым облачным моделям. Нужны две карты или профессиональный ускоритель.
100B+ (MoE)80 ГБ и вышеМаксимальное качество рассуждений. Серверные ускорители, отдельное питание.

Не только модель: зрение, речь, поиск

Если сервер должен не только отвечать текстом, заложите память на дополнительные задачи:

  • Зрение (документы, фото, сканы) — обычно та же модель или +2–6 ГБ на отдельную,
  • Распознавание речи (расшифровка звонков) — 2–10 ГБ, часто выносится на процессор,
  • Поиск по базе знаний (RAG) — около 1–2 ГБ на модель эмбеддингов.

Главный подвох: несколько пользователей сразу

Цифры из таблицы — это память под саму модель на одного-двух одновременных пользователей. Но каждый активный запрос дополнительно расходует VRAM под так называемый контекст (KV-кэш) — и при десятках параллельных обращений память тает заметно быстрее.

Именно здесь ломаются самосборные решения: модель, которая «летала» при тестах у одного человека, встаёт колом на пятнадцати сотрудниках. Поэтому под многопользовательский режим память планируют с запасом, а на движке инференса настраивают очереди и батчинг. Правило простое: берите VRAM с запасом под пиковую нагрузку, а не впритык под модель.

Какая видеокарта под какой класс

ВидеопамятьЧто комфортно запускатьТипичный сценарий
24 ГБдо 14B свободно, 27B в сжатиикоманда 5–15 человек, базовые задачи
32 ГБ27–32B + зрение и речьрабочая лошадка для 15–50 человек
48+ ГБ (2 карты)70B модели, несколько моделей сразунагруженные отделы, 50–150 человек
80 ГБ и выше100B+ MoE, отказоустойчивостьот 150 человек, требования дата-центра

Готовые конфигурации под ключ

Чтобы соотнести память с бюджетом — ориентиры сервера под ключ (железо, сборка, установка моделей, настройка):

КонфигурацияВидеопамятьПользователиЦена под ключ
Старт1 карта · 24 ГБ5–15 человекот 450 000 ₽
Рабочий1 карта · 32 ГБ15–50 человекот 800 000 ₽
Продвинутый2 карты · 48+ ГБ50–150 человекот 2 000 000 ₽
Максимумсерверные 80 ГБ+от 150 человекот 5 000 000 ₽

Как выбрать между настольным и стоечным исполнением и что входит в сборку — в гайде как сделать свой AI-сервер.

Итог

Видеопамять — это потолок вашего локального AI. Для большинства компаний оптимальны 24–32 ГБ: этого хватает на модель рабочего класса 27–32B со зрением и распознаванием речи. Главное — не считать память впритык под модель: заложите запас под контекст и одновременных пользователей, иначе сервер «поедет» на реальной нагрузке. А точную цифру под ваши задачи и число сотрудников лучше считать вместе с теми, кто уже собирал такие серверы.

Подберём видеокарту под ваши задачи

Скажите, что модель должна делать и сколько человек будут работать — рассчитаем нужную видеопамять и конфигурацию сервера под ключ.