Связать языковую модель с данными компании можно четырьмя способами, и они образуют лестницу по цене. Первый: положить нужные правила прямо в текст запроса — стоит часов работы инженера. Второй: настроить поиск по вашим документам, чтобы система сама подставляла в запрос подходящие фрагменты — 150 000–200 000 ₽. Третий: дообучить модель на размеченном наборе примеров — от 400 000 ₽ вместе со сбором корпуса. Четвёртый: развернуть собственную модель на своём железе — от 1 100 000 ₽ капитальных расходов плюс постоянный месячный счёт.

Практический вывод из этой статьи можно прочитать сразу: восемь задач из десяти закрываются первыми двумя уровнями, и почти всегда именно там нужно остановиться. Третий уровень решает задачу формы, а не фактов, и его продают под видом «обучим ИИ на ваших данных» гораздо чаще, чем он нужен. Четвёртый уровень — это не про качество и не про экономию, а про требование к размещению данных или про очень большой объём.

Дальше — таблица со всеми четырьмя подходами по цене, срокам, требованиям к данным и стоимости изменения; разбор каждого уровня отдельно; правило перехода на следующий уровень с конкретной метрикой; счёт за месяц эксплуатации на потоке 6 000 обращений во всех четырёх вариантах и стоимость первого года целиком; что меняет 152-ФЗ и почему зарубежные модели в 2026 году записываются в риски, а не в архитектуру; пять признаков, что вам продают лишний уровень.

Четыре подхода на одной лестнице

Все четыре способа отвечают на один и тот же вопрос: откуда модель возьмёт факты, которых нет в её общем знании о мире — ваши цены, ваши регламенты, ваши условия договоров. Отличаются они тем, в какой момент эти факты попадают к модели. В первом и втором случае — прямо в запросе, каждый раз заново. В третьем — заранее, внутрь весов модели. В четвёртом вопрос о фактах вообще не меняется: меняется место, где модель физически считает.

1. Правила в запросе2. Поиск по документам (RAG)3. Дообучение4. Своя модель на своём сервере
Что происходитСвод правил кладётся в каждый запрос целикомСистема ищет в базе 3–7 подходящих фрагментов и подставляет ихМодель меняет внутренние веса на ваших примерахОткрытая модель разворачивается в вашем контуре, факты приходят уровнями 1–2
Внедрение3–5 дней инженера, около 40 000 ₽150 000–200 000 ₽, 3–8 недельот 400 000 ₽ вместе с корпусом, 6–12 недельжелезо 1 100 000–1 600 000 ₽ плюс развёртывание
Требования к даннымСвод правил до 15–20 страниц в одной редакцииДокументы в читаемом виде, версии разведеныРазмеченный корпус от 1 000 примеров «вопрос — эталонный ответ»То же, что на уровне 2
Цена изменения правила0 ₽, правка текста — минуты0 ₽, правка документа и переиндексация — минутыновая итерация обучения, от 80 000 ₽ и дникак на уровне 2
Ссылка на источник в ответезатруднена: модель видит весь свод сразуесть в каждом ответе, это условие приёмкинет в принципекак на уровне 2
Юридическая сторонаданные уходят провайдеру в каждом запросето же плюс хранилище фрагментов у провайдера или у васваш корпус остаётся у провайдера в составе моделитрансграничной передачи нет, данные не покидают периметр
схема процессаkak-podklyuchit-model-k-dannym-kompanii--01
Лестница из четырёх ступеней с ценой внедрения и месячного счёта на каждой

Схема-лестница из четырёх ступеней, поднимающихся слева направо, каждая подписана сверху и снизу. Ступень 1 «Правила в запросе» — сверху «40 000 ₽ внедрение», снизу «28 040 ₽/мес». Ступень 2 «Поиск по документам» — «175 000 ₽» и «45 640 ₽/мес». Ступень 3 «Дообучение» — «575 000 ₽» и «103 940 ₽/мес». Ступень 4 «Своя модель» — «175 000 ₽ + железо 1 100 000–1 600 000 ₽» и «120 100 ₽/мес». Под ступенями 1 и 2 общая скобка с подписью «здесь закрывается 8 задач из 10». Справа мелкая сноска «поток 6 000 обращений в месяц».

Каждая ступень дороже предыдущей в разы, а прирост качества — в единицах процентов

Обратите внимание на две строки таблицы, которые в коммерческих предложениях почти никогда не обсуждают. Первая — цена изменения правила. На уровнях 1, 2 и 4 она нулевая: вы правите текст, и новое правило действует через минуты. На уровне 3 каждое изменение — это новая итерация обучения, и она стоит денег каждый раз. Вторая — ссылка на источник. Дообученная модель не может показать, откуда взяла факт, потому что факт растворён в весах. Для внутреннего помощника по регламентам это отсекающее ограничение: сотрудник не может опереться на ответ в разговоре с клиентом, а руководитель не может разобрать спор.

Уровни не заменяют друг друга, а складываются

Уровень 4 не отменяет уровень 2: своя модель на своём сервере всё равно должна откуда-то брать ваши регламенты, и берёт она их тем же поиском по документам. Уровень 3 в рабочих проектах тоже почти всегда идёт поверх уровня 2, а не вместо него. Поэтому в сметах третьего и четвёртого уровня строка «поиск по документам» обязана присутствовать — если её там нет, вам продают только половину системы.

Уровень 1. Правила в запросе: часы работы и потолок в 15 страниц

Самый недооценённый способ. Вы берёте свод правил — условия возврата, скрипт квалификации заявки, порядок расчёта скидки — и кладёте его в текст каждого запроса к модели, вместе с вопросом и требованием отвечать только по этому своду. Никакой базы, никакого хранилища, никакого поиска. Работы — три-пять дней инженера, включая проверку на контрольных вопросах: около 40 000 ₽ по рыночным ставкам.

У способа два жёстких ограничения, и оба измеримы. Первое — объём. В запрос физически помещается ограниченное количество текста, и чем он длиннее, тем хуже модель находит в нём нужное место: это отдельный механизм, который мы разбираем в материале про контекстное окно модели. Практическая граница, за которой качество начинает заметно падать, — примерно 15–20 страниц А4, то есть около 18 000–25 000 токенов. Второе ограничение — деньги: этот свод оплачивается на каждом обращении заново.

Что это значитТокен

Единица, которой модель измеряет текст: примерно 2–3 символа русского языка, страница А4 — порядка 1 000–1 500 токенов. Тарифицируются отдельно входные токены (всё, что вы отправили) и выходные (то, что модель написала). Ориентир на сентябрь 2026: 0,20 ₽ за 1 000 входных и 0,60 ₽ за 1 000 выходных.

Посчитаем. Свод правил на 15 страниц — это около 18 000 входных токенов. Ответ в 400 выходных. Одно обращение: 18 000 × 0,20 ₽ / 1 000 = 3,60 ₽ плюс 400 × 0,60 ₽ / 1 000 = 0,24 ₽, итого 3,84 ₽. Для сравнения, обращение с поиском по документам, где в запрос попадают только пять найденных фрагментов, стоит 1,04 ₽ — почти вчетверо дешевле. Зато у первого уровня нет ни хранилища, ни индексации, ни ведения базы, ни поддержки подрядчиком: это 39 400 ₽ в месяц, которых просто нет в смете.

Отсюда точка равенства, которую полезно знать до разговора с подрядчиком. Первый уровень стоит 3,84 ₽ × N плюс 5 000 ₽ мелких правок; второй — 1,04 ₽ × N плюс 39 400 ₽ постоянных расходов. Приравниваем: 2,80 ₽ × N = 34 400 ₽, значит N ≈ 12 300 обращений в месяц. До этого потока правила в запросе дешевле поиска по документам, после — дороже.

графикkak-podklyuchit-model-k-dannym-kompanii--02
Пересечение двух линий расходов на 12 300 обращений в месяц: промпт против поиска по документам

Двухосевой график. Ось X — обращений в месяц от 0 до 25 000, ось Y — рубли в месяц от 0 до 100 000. Крутая линия из точки 5 000 ₽ с наклоном 3,84 ₽ за обращение подписана «Правила в запросе». Пологая линия из точки 39 400 ₽ с наклоном 1,04 ₽ подписана «Поиск по документам». Точка пересечения выделена и подписана «12 300 обращений в месяц». Слева от точки область затонирована и подписана «дешевле уровень 1», справа — «дешевле уровень 2». Внизу сноска «при цене 0,20 ₽ за 1 000 входных и 0,60 ₽ за 1 000 выходных токенов».

До 12 300 обращений в месяц правила в запросе дешевле — если они помещаются в 15 страниц

Из этой арифметики следует неочевидное: значительная часть небольших компаний, которым продают полноценную систему с базой знаний, могла бы обойтись первым уровнем. Пятнадцать страниц регламента, 3 000 обращений в месяц, один отдел — это 16 520 ₽ в месяц и неделя работы вместо 175 000 ₽ и шести недель проекта. Ограничитель здесь честный и один: как только правил становится больше 15–20 страниц или как только нужна ссылка на конкретный пункт действующей редакции, первый уровень заканчивается.

Первый уровень не даёт проверяемого источника

Модель видит весь свод целиком и физически не может достоверно сказать, каким именно пунктом руководствовалась — она напишет правдоподобную ссылку, и проверить её будет нечем. Если ответы системы используются в спорах с клиентами, при разборе жалоб или при проверках, первый уровень не подходит вне зависимости от объёма правил, и это не настраивается промптом.

Уровень 2. Поиск по документам: 175 000 ₽ и ответ со ссылкой

Второй уровень — то, что в предложениях называют RAG, «поиском по базе знаний» и, к сожалению, «обучением ИИ на ваших документах». Механизм: база заранее нарезается на фрагменты, перед каждым ответом система находит 3–7 подходящих и подставляет их в запрос вместе с требованием отвечать строго по ним и указывать источник. Модель ничему не учится; она пересказывает найденное. Подробный разбор механизма по шагам, распределения причин ошибок и методики приёмки — в опорной статье раздела «RAG простыми словами»; здесь нас интересует только место этого уровня в лестнице и его цена.

Рыночный ориентир на сентябрь 2026 — 150 000–200 000 ₽ и 3–8 недель, в середине вилки типовой проект собирается за 175 000 ₽ и шесть недель. Разброс объясняется тремя вещами: объёмом и состоянием документов, числом каналов, где система должна отвечать, и наличием разграничения прав. Почти треть суммы уходит не на разработку, а на приведение документов в порядок — и это единственная часть проекта, которая остаётся вашей при любом исходе.

Что второй уровень даёт по сравнению с первым и за что, собственно, платятся эти деньги. Во-первых, снимается ограничение по объёму: база на 380 документов работает так же, как база на 30, потому что в запрос попадают только найденные фрагменты. Во-вторых, появляется ссылка на конкретный пункт с датой редакции — то, чего первый уровень дать не может. В-третьих, обновление правила по-прежнему бесплатное: вы правите документ, система переиндексирует, новое правило действует через минуты. Именно это свойство делает второй уровень рабочим потолком для большинства компаний.

Чего второй уровень не даёт. Он не научит модель говорить в вашем стиле — для этого нужен третий уровень или тщательно собранные примеры в инструкции. Он не даст доступа к живым данным учётной системы: «где мой заказ» — это запрос в 1С, а не поиск по документам, и коннектор к учётной системе стоит отдельных 60 000–120 000 ₽. И он не решает проблему противоречий в самой базе: если два регламента действуют одновременно, система будет уверенно цитировать любой из них.

Уровень 3. Дообучение: меняет форму ответа, а не факты

Дообучение — это изменение самой модели на ваших примерах. Ей показывают набор пар «вход — эталонный выход», и она подстраивает внутренние веса так, чтобы отвечать похоже. Технология настоящая и рабочая, но задачу, ради которой её чаще всего покупают, она не решает: передавать через неё факты нельзя.

сравнениеkak-podklyuchit-model-k-dannym-kompanii--03
Что дообучение делает хорошо и что не делает: стиль и формат против фактов и актуальности

Две колонки. Левая «Дообучение решает» с четырьмя строками: «Стиль и тон ответов», «Жёсткий формат выдачи», «Отраслевая терминология и сокращения», «Узкая повторяющаяся задача с одинаковой структурой». Правая «Дообучение не решает» с четырьмя строками: «Актуальность фактов — они застывают на дате обучения», «Ссылку на источник — её нет в принципе», «Быстрое изменение правила — от 80 000 ₽ за итерацию», «Доступ к живым данным учётной системы». Под колонками общая полоса: «Корпус от 1 000 пар «вопрос — эталонный ответ», собирается людьми, 6–12 недель».

Дообучение отвечает за форму. Факты в него класть нельзя — их нечем проверить и дорого менять

Причина в устройстве. Дообученная модель знает ваши факты на дату обучения и не умеет объяснить, откуда их взяла. Когда регламент меняется — а он меняется, — старое знание остаётся внутри и продолжает вылезать в ответах, причём вперемешку с новым. Обновить его можно только новой итерацией обучения: от 80 000 ₽ и несколько дней каждый раз. Сравните с уровнем 2, где то же изменение стоит правки одного абзаца в документе.

Отдельная статья расходов, о которой в предложениях обычно молчат, — корпус. Дообучению нужен размеченный набор от 1 000 пар «вопрос — эталонный ответ», и собирают его люди, которые знают предмет: методист, юрист, старший менеджер. Это 60–120 часов работы ваших сотрудников плюс работа подрядчика по проверке и чистке набора. Полный проект третьего уровня вместе с корпусом и обучением — от 400 000 ₽, и это в дополнение к 175 000 ₽ второго уровня, потому что факты всё равно придётся подавать поиском.

Есть и третья строка, специфичная именно для этого уровня: дообученная модель не может обслуживаться в общем пуле провайдера. Под неё выделяется отдельное развёртывание, и тарифицируется оно помесячно, а не по токенам — ориентир 40 000–90 000 ₽ в месяц. То есть третий уровень добавляет постоянный платёж, которого нет ни на первом, ни на втором.

Когда дообучение оправдано по-настоящему. Первое: узкая повторяющаяся задача с жёстким форматом выхода — например, разбор однотипных заявок в структуру полей, где важна не эрудиция, а точность формы. Второе: специфическая отраслевая терминология, которую модель систематически перевирает, и это подтверждено замером, а не ощущением. Третье: требование к длине и стилю, которое не удаётся получить инструкцией даже после нескольких итераций. Во всех трёх случаях дообучение идёт поверх поиска по документам, а не вместо него.

Уровень 4. Своя модель: покупают требование, а не экономию

Четвёртый уровень — это открытая модель (Qwen 3, Llama 4, DeepSeek, Mistral), развёрнутая через Ollama на вашем сервере в России, с векторным хранилищем pgvector в вашей же PostgreSQL. Формально это не способ передать модели факты: факты по-прежнему приходят поиском по документам. Меняется только строка «где физически считает модель», и сравнивать варианты нужно именно по ней.

карта связейkak-podklyuchit-model-k-dannym-kompanii--04
Где лежат данные в четырёх подходах: граница периметра компании смещается только на четвёртом

Карта из четырёх горизонтальных дорожек, по одной на подход. В каждой слева узел «Ваши документы», справа узел «Модель», между ними стрелка. Пунктирная рамка «периметр компании» на дорожках 1–3 охватывает только левую часть, стрелка пересекает её с подписью «текст запроса уходит провайдеру»; на дорожке 1 подпись у стрелки «весь свод правил, каждый раз», на дорожке 2 — «5 найденных фрагментов», на дорожке 3 — «фрагменты плюс корпус хранится у провайдера в составе модели». На дорожке 4 рамка охватывает обе части целиком, стрелка внутри, подпись «трансграничной передачи нет». Справа у каждой дорожки колонка «Месяц»: 28 040 ₽, 45 640 ₽, 103 940 ₽, 120 100 ₽.

Первые три уровня отправляют текст провайдеру. Периметр закрывается только на четвёртом

Стоимость владения средней конфигурацией — одна карта на 48 ГБ видеопамяти, модели класса 27–32 млрд параметров, 8–12 одновременных запросов — складывается из амортизации железа, размещения, администратора и обновлений и составляет 89 700 ₽ в месяц независимо от объёма. Бюджет самого железа — 1 100 000–1 600 000 ₽. Конфигурации и полный расчёт владения мы разбираем в материале про локальную модель под 152-ФЗ; здесь важен только вывод для сравнения уровней.

Вывод такой. Облачное обращение с поиском по документам стоит 1,04 ₽. Свой контур стоит 89 700 ₽ в месяц при любом объёме. Порог равенства: 89 700 ₽ ÷ 1,04 ₽ ≈ 86 000 обращений в месяц, то есть около 2 900 в день. Для компании на 50–300 человек это очень много — столько даёт разве что клиентский поток контакт-центра или массовая обработка документов. На внутреннем ассистенте реалистичный объём — 3 000–15 000 обращений в месяц, и в этом диапазоне облако дешевле в пять-восемь раз.

Собственный сервер под модель почти никогда не покупают ради экономии. Его покупают под требование — и если требования нет, это надо сказать собственнику прямо, а не спрятать в смете.

Правило перехода: следующий уровень берут по метрике

Главная защита от переплаты формулируется одной фразой: каждый следующий уровень берётся только после того, как предыдущий измеримо не справился. Не «нам кажется, что качество низкое», а конкретное число на контрольном наборе вопросов. Набор собирается один раз до начала работ — 100 реальных вопросов сотрудников или клиентов с эталонными ответами — и потом служит воротами при каждом переходе.

схема процессаkak-podklyuchit-model-k-dannym-kompanii--05
Три ворот перехода между уровнями с конкретной метрикой на каждых

Горизонтальная схема: четыре блока-уровня («Правила в запросе», «Поиск по документам», «Дообучение», «Своя модель») соединены тремя воротами. Ворота 1 подписаны «свод перевалил за 15–20 страниц ИЛИ нужна ссылка на пункт». Ворота 2 — «фрагмент попадает в топ-5 в 85+ случаях из 100, но принято меньше 70 ответов из 100». Ворота 3 — «требование к размещению данных ИЛИ более 86 000 обращений в месяц». Под каждыми воротами мелкая подпись «замер на контрольных 100 вопросах». Ворота 3 отмечены сноской «решается юристом и объёмом, а не качеством ответов».

Ворота проходят по числу на контрольных 100 вопросах, а не по ощущению от демонстрации
  1. 1
    С первого уровня на второй

    Переход обоснован, когда верно хотя бы одно из двух. Свод правил перевалил за 15–20 страниц — тогда качество падает механически, и это видно по контрольным вопросам: доля верных ответов проседает при том, что нужный текст в своде есть. Либо появилось требование показывать источник: ссылку на пункт действующей редакции первый уровень дать не может ни при каком объёме.

  2. 2
    Со второго уровня на третий

    Переход обоснован ровно в одном случае: поиск работает, а ответы всё равно не принимают. Метрика двойная. Нужный фрагмент попадает в топ-5 найденного в 85 и более случаях из 100 — значит, факты система находит. И при этом доля принятых ответов ниже 70 из 100 — значит, проблема в форме: стиль, длина, структура, терминология. Если первое число ниже 85, переходить на дообучение нельзя: вы будете дорого учить модель поверх сломанного поиска.

  3. 3
    С любого уровня на четвёртый

    Это вообще не решение о качестве. Оно принимается по двум основаниям, и оба внешние. Первое: требование к размещению данных — специальные категории персональных данных, условие заказчика в договоре, госконтракт, позиция службы безопасности. Второе: объём перевалил за 86 000 обращений в месяц. Если ни того, ни другого нет, свой сервер обойдётся дороже облака в несколько раз.

Практическая ценность этих ворот в том, что они превращают спор о подходе в проверку числа. Подрядчик, который предлагает начать сразу с третьего уровня, должен показать, что второй измеримо не справился — а показать он этого не может, потому что второй уровень ещё не собран. Тот же вопрос работает и в обратную сторону: если у вас уже стоит система второго уровня и вы недовольны ответами, откройте журнал и посмотрите, попадает ли нужный фрагмент в найденное. В восьми случаях из десяти проблема окажется в поиске, а не в модели, и дообучение её не решит.

Счёт за месяц: 6 000 обращений во всех четырёх вариантах

Вводные модельного примера: производственно-торговая компания, 140 человек, внутренний ассистент отвечает сотрудникам на вопросы по регламентам, условиям договоров и характеристикам продукции. Поток — 6 000 обращений в месяц. Свод правил на 15 страниц для первого уровня, база из 380 документов для остальных. Цены на сентябрь 2026: 0,20 ₽ за 1 000 входных токенов, 0,60 ₽ за 1 000 выходных.

Месяц эксплуатации, поток 6 000 обращений
Уровень 1: модель 6 000 × 3,84 ₽ = 23 040 ₽ плюс мелкие правки 5 000 ₽28 040 ₽/мес
Уровень 2: модель 6 000 × 1,04 ₽ = 6 240 ₽ + инфраструктура 9 000 ₽ + ведение базы 5 400 ₽ + поддержка 25 000 ₽45 640 ₽/мес
Уровень 3: то же, что уровень 2, плюс выделенное развёртывание 45 000 ₽ и переобучение 80 000 ₽ раз в полгода103 940 ₽/мес
Уровень 4: свой контур 89 700 ₽ + ведение базы 5 400 ₽ + поддержка 25 000 ₽, вызовы модели бесплатны120 100 ₽/мес
Итогоразрыв между первым и четвёртым уровнем — 92 060 ₽ в месяц на одном и том же потоке

Разберём две строки, которые вызывают больше всего вопросов. В третьем уровне 103 940 ₽ складываются так: выделенное развёртывание дообученной модели 45 000 ₽, вызовы модели 6 240 ₽, амортизация переобучения 80 000 ₽ ÷ 6 месяцев = 13 300 ₽, инфраструктура поиска 9 000 ₽, ведение базы 5 400 ₽, поддержка 25 000 ₽. Если ваши регламенты меняются не раз в полгода, а ежеквартально, строка переобучения вырастает вдвое — до 26 700 ₽, и месяц уходит за 117 000 ₽.

В четвёртом уровне вызовы модели не стоят ничего сверху — вы уже заплатили за железо. Но 89 700 ₽ платятся и при 6 000 обращений, и при 600: это фиксированная стоимость владения, в которую входят амортизация сервера за 36 месяцев, размещение и электричество, системный администратор и обновление моделей с регресс-тестом. Строка «поддержка подрядчиком 25 000 ₽» из сметы не исчезает: сам агент, база и интеграции требуют сопровождения одинаково в облаке и в своём контуре.

Первый год целиком: от 376 тысяч до 1,8 миллиона

Месячный счёт — только половина картины: уровни сильно различаются и по разовым вложениям. Сложим внедрение и двенадцать месяцев эксплуатации на том же потоке 6 000 обращений. Железо четвёртого уровня в разовую часть не выносим — оно уже сидит в месячном счёте через амортизацию за 36 месяцев.

УровеньВнедрениеМесяц12 месяцевПервый год всего
1. Правила в запросе40 000 ₽28 040 ₽336 480 ₽376 480 ₽
2. Поиск по документам175 000 ₽45 640 ₽547 680 ₽722 680 ₽
3. Дообучение поверх поиска575 000 ₽103 940 ₽1 247 280 ₽1 822 280 ₽
4. Своя модель поверх поиска175 000 ₽120 100 ₽1 441 200 ₽1 616 200 ₽
графикkak-podklyuchit-model-k-dannym-kompanii--06
Стоимость первого года по четырём уровням: 376, 723, 1822 и 1616 тысяч рублей

Горизонтальная столбчатая диаграмма из четырёх составных полос, ось X в рублях от 0 до 2 000 000. Каждая полоса разделена на две части: тёмная «внедрение» и светлая «12 месяцев эксплуатации». Уровень 1 — 40 000 + 336 480 = 376 480 ₽. Уровень 2 — 175 000 + 547 680 = 722 680 ₽. Уровень 3 — 575 000 + 1 247 280 = 1 822 280 ₽. Уровень 4 — 175 000 + 1 441 200 = 1 616 200 ₽. Полосы 1 и 2 обведены общей скобкой с подписью «закрывает 8 задач из 10». Внизу сноска «поток 6 000 обращений в месяц, сентябрь 2026».

Разрыв между вторым и третьим уровнем — два с половиной раза при сопоставимом качестве ответов

Главное, что видно в этой таблице, — не абсолютные суммы, а форма разрыва. Между первым и вторым уровнем разница почти вдвое, и она обычно оправдана: второй уровень снимает ограничение по объёму и даёт проверяемый источник. Между вторым и третьим — ещё в два с половиной раза, и вот здесь прирост качества на типовых задачах измеряется единицами процентов. Четвёртый уровень стоит примерно как третий, но покупается по совершенно другой причине — под требование, а не под качество.

Ещё одно наблюдение, полезное при чтении чужой сметы. Постоянные расходы на втором, третьем и четвёртом уровнях почти не зависят от потока: 39 400 ₽, 97 700 ₽ и 120 100 ₽ соответственно платятся и при 6 000 обращений, и при 1 000. Это значит, что на малых объёмах спорить о цене токенов бессмысленно — вы боретесь за проценты счёта. Полную структуру расходов на ИИ-агента, включая четыре статьи, которых почти никогда нет в коммерческих предложениях, мы разбираем отдельно.

Где проходит граница периметра: 152-ФЗ и зарубежные модели

На первых трёх уровнях текст запроса уходит провайдеру модели. Это ключевой факт для 152-ФЗ, и он не зависит от того, насколько уважаемый провайдер: в момент отправки данные покидают ваш периметр. Если в запросе есть имя, телефон, адрес, диагноз или сумма договора конкретного контрагента — это обработка персональных данных сторонним лицом со всеми вытекающими обязанностями: правовое основание, поручение обработки, локализация базы в России.

схема процессаkak-podklyuchit-model-k-dannym-kompanii--07
Развилка: обезличивание на входе или собственный контур — два способа закрыть требование

Схема-развилка. Слева блок «Обращение с персональными данными». От него стрелка в ромб «Данные можно обезличить на входе?». Ветка «да» ведёт в блок «Уровни 1–3 в российском облаке: имена и телефоны заменяются метками до отправки, обратная подстановка после ответа» с подписью «дополнительно 40 000–90 000 ₽ разово». Ветка «нет» ведёт в блок «Уровень 4: свой контур, 89 700 ₽/мес» с подписью «трансграничной передачи нет». Отдельная нижняя ветка «Заказчик — госорганизация» ведёт в блок «Проверить продукт в реестре отечественного ПО» с пометкой «российское облако ≠ реестр».

Обезличивание на входе закрывает большинство случаев дешевле, чем собственный сервер

Практический порядок действий такой. Сначала посмотрите, что реально уходит в модель. В большинстве внутренних сценариев — вопросы по регламентам, разбор условий, подготовка черновиков — персональных данных в запросе нет вовсе, и вопрос снимается. Если они есть, второй шаг — обезличивание на входе: имена и телефоны заменяются метками до отправки и подставляются обратно после ответа. Это отдельная работа на 40 000–90 000 ₽, и она почти всегда дешевле собственного сервера. И только если обезличить нельзя — например, сам текст обращения и есть предмет анализа, — остаётся четвёртый уровень. Как мы работаем с доступами, журналами и персональными данными на проектах, описано в разделе про безопасность и защиту данных.

Отдельная оговорка про зарубежные модели, потому что их продолжают закладывать в проекты. Прямая оплата OpenAI и Anthropic из России невозможна: страна не входит в список поддерживаемых для их API, и доступ идёт через рублёвых посредников и агрегаторы. Для системы, на которую опирается ежедневная работа компании, это не инструмент, а точка отказа: посредник может исчезнуть, тариф — измениться в одностороннем порядке, а вопрос о том, где физически обрабатываются данные и кто отвечает по 152-ФЗ, остаётся открытым.

Зарубежная модель — строка в реестре рисков, а не основа архитектуры

Если подрядчик проектирует систему вокруг конкретной зарубежной модели, задайте два вопроса. Первый: через какое юридическое лицо идёт оплата и что произойдёт с системой, если этот канал закроется в течение месяца. Второй: сколько стоит переключение на российскую модель — если ответ измеряется неделями, значит, слоя абстракции над моделью в архитектуре нет, и его нужно требовать до подписания. Рабочая постановка на сентябрь 2026: основная модель российская (GigaChat 3, YandexGPT 5) или открытая на своём сервере, зарубежная — максимум запасной вариант для редких запросов на обезличенных данных.

Пять признаков, что вам продают лишний уровень

Ни один из признаков сам по себе не приговор, но три сразу — повод затормозить и попросить обоснование по метрике. Все пять проверяются по тексту коммерческого предложения, без технической экспертизы.

  1. 1«Обучим модель на ваших данных» — и больше ни слова о том, что именно происходит. В подавляющем большинстве предложений за этой фразой стоит второй уровень, поиск по документам. Это нормально и правильно, но требует другого разговора о цене и о приёмке. Спросите прямо: модель дообучается на наших данных или документы подставляются в запрос при каждом ответе.
  2. 2В смете есть дообучение, но нет строки про размеченный корпус и часы ваших сотрудников. Корпус от 1 000 пар «вопрос — эталонный ответ» кто-то должен собрать, и это 60–120 часов работы человека, который знает предмет. Если этой строки нет, либо дообучения на самом деле не будет, либо корпус соберут наспех и качество окажется хуже второго уровня.
  3. 3Собственный сервер предлагается без расчёта порога и без вопроса о том, какие данные реально уходят в модель. Правильный разговор начинается с маршрута данных, а не с конфигурации видеокарт. Если про обезличивание на входе не спросили ни разу, скорее всего, продают железо.
  4. 4Нет строки «поиск по документам» в смете третьего или четвёртого уровня. Факты в обоих случаях приходят одинаково — поиском. Смета, где этой работы нет, описывает половину системы: вторая половина всплывёт как доработка на третий месяц.
  5. 5Нет контрольного набора вопросов и порога приёмки в числах. Без него переход между уровнями невозможно обосновать ни в одну сторону, а приёмка сводится к демонстрации. Набор из 100 вопросов с эталонными ответами собирается вашей стороной за два-три дня и защищает бюджет лучше любых гарантий в договоре — как это устроено у нас, описано в разделе о порядке работы.

Когда не нужен ни один из четырёх уровней

Языковая модель стала стандартным ответом на любой вопрос про автоматизацию, и это делает её частой переплатой. Ниже — ситуации, в которых мы отговариваем от всех четырёх уровней сразу, потому что задача решается проще, дешевле и надёжнее.

  • Ответ лежит в одном поле учётной системы. «Где мой заказ», «какой остаток на складе», «когда оплата» — это запрос в 1С или в CRM, а не работа с текстами. Нужен коннектор за 60 000–120 000 ₽, и никакой уровень лестницы его не заменит.
  • Вопросов много, но они одинаковые. Двадцать типовых вопросов закрываются кнопочным меню за 30 000–120 000 ₽: ответ воспроизводим, проверять нечего, счёта за вызовы модели нет вовсе.
  • Правило формулируется в три строки и не меняется. Это строка в памятке, а не повод для проекта. Первый уровень имеет смысл примерно от пяти-семи страниц правил, до этого дешевле памятка.
  • Меньше 300–400 обращений в месяц и все из одного отдела. Постоянные расходы даже второго уровня — 39 400 ₽ в месяц независимо от нагрузки — съедят всю экономию. На первом уровне порог ниже, но и там нужен хотя бы стабильный поток.
  • Документы противоречат друг другу, и никто не знает, какая версия действует. Пока это так, система любого уровня будет уверенно цитировать отменённый приказ. Сначала ревизия документов — порядок подготовки данных перед внедрением мы разбирали отдельно, — потом автоматизация.
  • Процесс не описан и держится на конкретном человеке. Модель не восстановит правило, которого нет в письменном виде: она сочинит правдоподобное. Это самая дорогая из перечисленных ошибок, потому что обнаруживается уже в эксплуатации.

Зеркальный признак применимости так же прост. Лестница уместна, когда одновременно верны три вещи: ответы лежат в текстах, а не в полях базы данных; вопросы формулируются свободно и по-разному; поток измеряется тысячами обращений в месяц. Начинать при этом почти всегда стоит с первого уровня — он собирается за неделю и даёт честный ответ на вопрос, будут ли люди этим пользоваться, до того как вы потратите 175 000 ₽ на второй.