S
Stitex
Инфраструктура

Квантизация нейросетей: Q4 или Q8 и что теряется

Короткий ответ: квантизация — это сжатие весов модели, чтобы она влезла в видеопамять. Q4 занимает вдвое меньше, чем Q8, почти без потери качества на деловых задачах — поэтому в продакшене чаще всего используют именно сжатые версии. Разбираем, как выбрать степень.

21 июля 20269 минутStitex Technologies

Зачем сжимать модель

Веса модели по умолчанию хранятся с высокой точностью (16 бит на число), и тогда она занимает очень много видеопамяти. Квантизация уменьшает точность до 8, 5 или 4 бит — модель занимает в 2–4 раза меньше и влезает в доступную карту. Потеря качества при этом на деловых задачах обычно незначительна.

Что означают Q4, Q6, Q8

КвантизацияПамятьКачество
FP16 (без сжатия)максимумэталон, но избыточно
Q8высокаяпрактически как эталон
Q6средняяочень близко к Q8
Q4низкая (вдвое меньше Q8)на бизнес-задачах разница едва заметна
Практическое правило
Для рабочих задач берут Q4–Q6 — это лучший баланс «влезло в память / сохранило качество». Более высокая точность (Q8) имеет смысл, когда есть запас VRAM и важны сложные рассуждения.

Как это связано с видеопамятью

Именно благодаря квантизации модель на 32 млрд параметров помещается в 18–24 ГБ, а не требует 60+ ГБ. Полные ориентиры по памяти — в статье сколько видеопамяти нужно для нейросети, а обзор самих моделей — в статье open-source нейросети 2026.

Где легко ошибиться

  • Слишком сильное сжатие маленькой модели заметно роняет качество — на 7–9B это чувствительнее, чем на 70B,
  • Экономия памяти впритык под модель не оставляет запаса на контекст и пользователей,
  • Точку баланса нельзя брать «по обзорам» — её проверяют на ваших реальных задачах.

Мы подбираем модель и квантизацию под задачу и железо — подробнее на странице AI-сервера.

Частые вопросы

Q4 сильно хуже Q8?

Для большинства деловых задач разница между Q4 и Q8 у крупных моделей едва заметна, зато Q4 занимает вдвое меньше памяти. На сложных рассуждениях и коде более высокая точность может дать небольшой выигрыш. Оптимум подбирается тестом на ваших задачах.

Что такое GGUF?

Это популярный формат хранения квантизованных моделей для локального запуска. В нём модель поставляется в разных степенях сжатия (Q4, Q5, Q6, Q8), из которых вы выбираете под своё железо.

Можно ли запускать без квантизации?

Можно, в полной точности (FP16), но это требует в 2–4 раза больше видеопамяти и почти не даёт выигрыша в качестве на бизнес-задачах. Поэтому в продакшене почти всегда используют квантизацию.

Подберём модель и сжатие под ваше железо

Протестируем модели в разных квантизациях на ваших задачах и выберем баланс качества и памяти. Развернём под ключ.