Локальная модель решает ровно одну задачу — данные не выходят за периметр компании. Денег она не экономит почти никогда: свой контур средней конфигурации стоит фиксированные 89 700 ₽ в месяц независимо от нагрузки, а облачный счёт за модель на потоке в 6 000 обращений — 16 920 ₽. Разница в пять раз, и она не в пользу собственного железа.

Квантование — это способ сделать локальный вариант хотя бы не абсурдно дорогим. Оно втискивает большую модель в меньшую видеопамять, позволяя обойтись конфигурацией классом ниже: 2 017 200 ₽ в год против 1 076 400 ₽. За экономию в 940 800 ₽ платят частью качества, и вопрос всегда один — какой именно частью и на каких задачах она заметна.

Дальше — что происходит с моделью при квантовании на понятной аналогии; сколько видеопамяти нужно по формуле, а не по обещаниям поставщика; что реально разворачивают в России и на чём; с какого облачного счёта свой контур перестаёт быть дороже; и как за один день и 29 200 ₽ проверить потерю качества на своих задачах вместо чужих бенчмарков.

Квантование: та же модель, записанная грубее

Что это значитКвантование

Хранение весов модели с меньшей точностью. В исходном виде каждое из миллиардов чисел занимает 16 бит — 2 байта. Квантование записывает те же числа в 8 бит или в 4 бита, то есть в два или четыре раза компактнее. Модель не переучивается и не сокращается: у неё остаётся столько же параметров, просто каждый из них описан грубее.

Понятная аналогия — прайс, в котором цены округлили до сотен рублей. Файл стал вчетверо легче, открывается мгновенно, и на позициях за 40 000 ₽ округление никто не заметит. А вот на метизах по 12 ₽ округление до сотни убивает прайс целиком. Квантование ведёт себя точно так же: потеря не размазана ровным слоем, она собирается на конкретных типах задач. Средняя точность почти не двигается — и именно поэтому смотреть надо не на среднюю.

Ходовые режимы на сентябрь 2026 — 8 бит и 4 бита. Восьмибитный вариант считается почти безболезненным, четырёхбитный — рабочим компромиссом, который и используют в большинстве установок, потому что именно он позволяет обойтись одной картой вместо двух. Более агрессивные режимы существуют, но за пределами лабораторий встречаются редко и в производственный контур их брать не стоит.

Сколько видеопамяти нужно на самом деле

Считается это арифметикой, а не на глаз. Объём весов равен числу параметров, умноженному на байты на параметр: 2 ГБ на миллиард без квантования, 1 ГБ в 8 битах, около 0,6 ГБ в 4 битах с учётом служебных данных. Сверху добавляется 15–30 % на контекст — чем длиннее запросы, тем больше. В таблице ниже взяты 20 % как рабочая середина.

Размер моделиБез квантования8 бит4 бита4 бита с контекстом
8 млрд параметров16 ГБ8 ГБ4,8 ГБ5,8 ГБ
14 млрд параметров28 ГБ14 ГБ8,4 ГБ10,1 ГБ
32 млрд параметров64 ГБ32 ГБ19,2 ГБ23,0 ГБ
70 млрд параметров140 ГБ70 ГБ42,0 ГБ50,4 ГБ
графикkvantovanie-i-lokalnyy-zapusk-modeli--01
Видеопамять под модель на 32 млрд параметров: 64 ГБ, 32 ГБ и 23 ГБ при разной разрядности

Три вертикальных столбца одной шкалы, ось в гигабайтах видеопамяти от 0 до 70. Общий подзаголовок «Модель на 32 млрд параметров». Столбцы подписаны снизу: «Без квантования — 64 ГБ», «8 бит — 38,4 ГБ с контекстом», «4 бита — 23,0 ГБ с контекстом». Поперёк всех трёх столбцов идут две горизонтальные штриховые линии с подписями справа: «карта 24 ГБ» и «карта 48 ГБ». Видно, что третий столбец проходит под первой линией, второй — под второй, первый не проходит ни под одной. Внизу сноска «0,6 ГБ на миллиард параметров в 4 битах плюс 20 % на контекст». Чертёжный стиль, все подписи по-русски.

Одна и та же модель: справа она влезает в одну карту, слева не влезает никуда

Последняя строка объясняет главную практическую разницу. Модель на 32 млрд параметров в 8 битах требует 38,4 ГБ с контекстом — это карта на 48 ГБ, то есть тяжёлая конфигурация. Она же в 4 битах занимает 23,0 ГБ и укладывается в карту на 24 ГБ, то есть в среднюю. Между этими двумя вариантами проходит вся денежная разница разговора, и именно поэтому квантование обсуждают не разработчики, а те, кто подписывает счёт на железо.

Влезло — не значит работает с нужной скоростью

Расчёт «23,0 ГБ в карту на 24 ГБ» верен по объёму и опасен на практике: свободного места остаётся меньше гигабайта, и любой всплеск длины контекста или вторая одновременная сессия упирают систему в потолок. Рабочее правило — оставлять запас не меньше 20 % сверх расчёта, то есть под ту же модель брать карту на 32 ГБ. Конфигурация выбирается по пиковой одновременной нагрузке; как её посчитать из своей статистики, разобрано в материале про сервер под свою нейросеть.

Что реально ставят в России и на чём

Стек здесь устоявшийся и на сентябрь 2026 меняется мало. Модели — Qwen 3, Llama, DeepSeek и Mistral в открытых весах; запускаются они через Ollama, который скрывает возню с разрядностью и отдаёт наружу обычный интерфейс. Векторное хранилище кладут рядом на pgvector — расширение к той же PostgreSQL, которая у вас уже работает; отдельная векторная база при корпоративных объёмах почти никогда не нужна.

схема процессаkvantovanie-i-lokalnyy-zapusk-modeli--02
Поток данных локального контура: вопрос, поиск в pgvector, модель в Ollama, ответ — всё внутри периметра

Схема потока данных слева направо, целиком заключённая в толстую пунктирную рамку с подписью «сеть компании». Внутри рамки блоки со стрелками: «Вопрос сотрудника» → «Приложение» → «PostgreSQL с pgvector: поиск фрагментов» → «Ollama на GPU-узле: модель 32 млрд параметров в 4 битах, 23,0 ГБ видеопамяти» → «Ответ со ссылкой на документ». От блока Ollama вниз отходит отдельный блок «Обновление весов раз в квартал: 20–40 ГБ, 4 часа инженера, прогон регресс-набора». За пределами рамки нарисовано облако с подписью «внешний провайдер модели», к нему ведёт стрелка, перечёркнутая крестом, с подписью «данные не покидают периметр». Чертёжный стиль, все подписи по-русски.

Ни одна стрелка не пересекает границу сети — это единственное, за что здесь платят
Строка сметы, о которой вспоминают на шестой месяц

Открытые модели обновляются, и обновление весов — это не «нажать кнопку». Скачать 20–40 ГБ, развернуть, прогнать регресс-набор и решить, переходить ли, — это 4 часа инженера и 3 240 ₽ на прогон, то есть около 15 240 ₽ за квартал. В полной стоимости владения эта строка учтена, но она же первой выпадает из реальной жизни: контур, за которым никто не следит, через полгода работает на устаревших весах и без наблюдения.

Смета контура против облачного счёта: где проходит порог

Свой контур — это не цена железа, а полная стоимость владения: амортизация узла, размещение и электричество, администратор, обновления моделей, резервный контур и дежурство. Железо в этой сумме занимает только 35–51 % годовой цены — остальное расходуется равномерно и не зависит от того, сколько обращений через контур прошло.

Цена одной ступени разрядности: модель на 32 млрд параметров
Вариант в 8 битах: 38,4 ГБ с контекстом, тяжёлая конфигурация2 017 200 ₽ в год
Вариант в 4 битах: 23,0 ГБ с контекстом, средняя конфигурация1 076 400 ₽ в год
Разница по полной стоимости владения940 800 ₽ в год
Из них капитальная часть: железо 2 400 000–3 800 000 ₽ против 1 100 000–1 600 000 ₽1 300 000–2 200 000 ₽ разово
Проверка потери качества на своих задачах: один день29 200 ₽
Итого940 800 ₽ в год — вот сколько стоит одна ступень разрядности, и вот какой суммой вы рискуете, не проверив её

Теперь сравнение с облаком. Постоянные 89 700 ₽ в месяц у контура против переменных 2,82 ₽ за обращение в облаке — эта цена одного диалога из трёх реплик посчитана в разборе токенов и счёта за модель. Всё остальное — поддержка, ведение базы знаний, контроль качества — в обоих вариантах одинаково и из сравнения выпадает.

Облачный счёт за модель в месяцЭто примерно обращений в месяцЧто дешевле
до 40 000 ₽до 14 200облако, с двукратным запасом
80 000 ₽около 28 400облако, но разговор о контуре уже осмысленный
89 700 ₽около 31 800точка равенства
150 000 ₽около 53 200контур, разница 60 300 ₽ в месяц
сравнениеkvantovanie-i-lokalnyy-zapusk-modeli--03
Постоянные 89 700 ₽ у своего контура против растущего облачного счёта: равенство на 31 800 обращений

Двухосевой график. Ось X — обращений в месяц от 0 до 60 000, ось Y — рублей в месяц от 0 до 170 000. Горизонтальная сплошная линия на уровне 89 700 ₽ подписана «свой контур средней конфигурации, постоянные расходы». Наклонная прямая из начала координат подписана «облако, 2,82 ₽ за обращение». Точка пересечения выделена и подписана «31 800 обращений, 89 700 ₽ — равенство». Вертикальная штриховая линия на отметке 28 400 обращений подписана «80 000 ₽ — ниже этого разговор можно не начинать». Область слева от неё затонирована с подписью «здесь работает большинство компаний 20–300 человек». Чертёжный стиль, все подписи по-русски.

У контура горизонталь, у облака наклон — пересекаются они там, где почти никто не работает

Порог формулируется так: пока облачный счёт за модель ниже 80 000 ₽ в месяц, свой контур дороже при любых уговорах. Равенство наступает около 89 700 ₽, но и в этой точке у контура остаётся хвост, которого нет у облака: простой оплаченного железа, дежурство и ответственность за отказ узла. Разница в 10 000 ₽ такой хвост не покрывает. Тот же порог, посчитанный не в рублях, а в обращениях и с другими вводными по цене вызова, разобран в материале про объём, с которого выгоден свой сервер.

Где теряется качество и как проверить это на своих задачах

Здесь начинается честный минус локального варианта, и он двойной. Во-первых, доступные открытые модели на русском языке по состоянию на сентябрь 2026 отвечают заметно слабее, чем сделанные под русский GigaChat 3 и YandexGPT 5. Во-вторых, квантование добавляет к этому свою потерю. Складывать эти два эффекта на бумаге бессмысленно — их надо измерить вместе и на своих текстах.

Потеря собирается на предсказуемых типах задач. Ниже — те, на которых её видно первой; на всех остальных разница обычно теряется в шуме.

  • Точное воспроизведение символов: артикулы, номера договоров, суммы, даты. Модель начинает «примерно помнить» строку вместо того, чтобы её повторить. Для карточки заказа это дефект, а не стилистика.
  • Длинные цепочки: сверка условий из трёх документов, расчёт с несколькими взаимными условиями, разбор противоречий. Чем больше шагов, тем выше шанс, что один из них поедет.
  • Редкие слова: фамилии, названия номенклатуры, отраслевые сокращения. Всё, что встречалось в обучении редко, при огрублении весов страдает первым.
  • Строгий формат вывода: ответ в виде заполненных полей держится хуже, и чем больше полей, тем заметнее. Если карточка лида на шестнадцать полей — проверять надо именно её.
  • Длинный контекст: чем больше документа кладётся в запрос, тем сильнее расходятся варианты. На коротких вопросах разницы может не быть вообще.
  1. 1
    Соберите 60 своих задач, а не абстрактных вопросов

    Двадцать типовых, двадцать с цифрами и артикулами, двадцать самых сложных из тех, что реально приходят. Берутся из журнала обращений, а не сочиняются. Это тот же принцип, по которому собирается набор для замера качества поиска.

  2. 2
    Прогоните один набор через три варианта

    Облачная модель, локальная в 8 битах, локальная в 4 битах. Узел под замер берётся в аренду на сутки примерно за 4 000 ₽ — покупать железо ради проверки не нужно. Ответы складываются в таблицу в три колонки.

  3. 3
    Оценивает предметный специалист и вслепую

    Колонки перемешиваются, пометок «где чей ответ» нет. Восемь часов специалиста по 900 ₽/час — 7 200 ₽. Оценивает не тот, кто разворачивал модель: у него уже есть мнение, и оно попадёт в результат.

  4. 4
    Смотрите корзины, а не среднюю

    Общая доля верных ответов почти наверняка окажется близкой у всех трёх вариантов. Решение принимается по корзине с цифрами и артикулами — там квантование проседает первым, и там же цена ошибки выше всего.

Вся процедура — 29 200 ₽: 7 200 ₽ предметного специалиста, 18 000 ₽ инженера за шесть часов по 3 000 ₽/час и 4 000 ₽ аренды узла на сутки. Это 3 % от годовой экономии в 940 800 ₽, ради которой квантование и затевается. Отказаться от такого замера и взять чужой бенчмарк — это ровно та же ошибка, что принять систему по демонстрации подрядчика: цифра честная, но получена не на ваших текстах.

Когда локальная модель не нужна

Свой контур берут по требованию, а не по ощущению «так спокойнее». Ниже — ситуации, в которых решение почти всегда оказывается ошибочным, и его стоит отложить.

  • Облачный счёт за модель ниже 80 000 ₽ в месяц, и нет требования к периметру. Контур обойдётся дороже минимум вдвое, а к цене добавится администратор, которого сейчас в штате нет.
  • Требование не сформулировано письменно. Если на вопрос «какое требование заставляет держать контур» ответа нет, кроме общей тревоги, — сначала разберитесь, что именно нельзя выпускать наружу, потом считайте железо.
  • Пилот и первые месяцы. Пока не устоялись база знаний и сценарии, локальный контур замедляет проверку гипотез: каждая правка упирается в администратора и окно обслуживания. Пилот делается в облаке даже теми, кто твёрдо решил уйти на своё.
  • Чувствительна только часть потока. Тогда дешевле гибрид: локальный узел на чувствительные обращения плюс облако на остальные. Разбор гибридной схемы и её цены есть в материале про то, когда контур обязателен.
  • Нет ответа на вопрос, кто обслуживает узел. Спокойный режим — около 10 часов администратора и 4 часа инженера в месяц. Без выделенных часов контур деградирует молча, и это дороже любого облачного счёта.

Зеркальный признак — когда контур брать нужно: есть письменное требование к периметру или специальные категории персональных данных, поток даёт облачный счёт выше 80 000 ₽ в месяц, и в компании есть человек, который будет узел обслуживать. Если верно всё три, следующий шаг — не покупка железа, а суточная аренда узла и замер из раздела выше на своих шестидесяти задачах.