Связать языковую модель с данными компании можно четырьмя способами, и они образуют лестницу по цене. Первый: положить нужные правила прямо в текст запроса — стоит часов работы инженера. Второй: настроить поиск по вашим документам, чтобы система сама подставляла в запрос подходящие фрагменты — 150 000–200 000 ₽. Третий: дообучить модель на размеченном наборе примеров — от 400 000 ₽ вместе со сбором корпуса. Четвёртый: развернуть собственную модель на своём железе — от 1 100 000 ₽ капитальных расходов плюс постоянный месячный счёт.
Практический вывод из этой статьи можно прочитать сразу: восемь задач из десяти закрываются первыми двумя уровнями, и почти всегда именно там нужно остановиться. Третий уровень решает задачу формы, а не фактов, и его продают под видом «обучим ИИ на ваших данных» гораздо чаще, чем он нужен. Четвёртый уровень — это не про качество и не про экономию, а про требование к размещению данных или про очень большой объём.
Дальше — таблица со всеми четырьмя подходами по цене, срокам, требованиям к данным и стоимости изменения; разбор каждого уровня отдельно; правило перехода на следующий уровень с конкретной метрикой; счёт за месяц эксплуатации на потоке 6 000 обращений во всех четырёх вариантах и стоимость первого года целиком; что меняет 152-ФЗ и почему зарубежные модели в 2026 году записываются в риски, а не в архитектуру; пять признаков, что вам продают лишний уровень.
Четыре подхода на одной лестнице
Все четыре способа отвечают на один и тот же вопрос: откуда модель возьмёт факты, которых нет в её общем знании о мире — ваши цены, ваши регламенты, ваши условия договоров. Отличаются они тем, в какой момент эти факты попадают к модели. В первом и втором случае — прямо в запросе, каждый раз заново. В третьем — заранее, внутрь весов модели. В четвёртом вопрос о фактах вообще не меняется: меняется место, где модель физически считает.
| 1. Правила в запросе | 2. Поиск по документам (RAG) | 3. Дообучение | 4. Своя модель на своём сервере | |
|---|---|---|---|---|
| Что происходит | Свод правил кладётся в каждый запрос целиком | Система ищет в базе 3–7 подходящих фрагментов и подставляет их | Модель меняет внутренние веса на ваших примерах | Открытая модель разворачивается в вашем контуре, факты приходят уровнями 1–2 |
| Внедрение | 3–5 дней инженера, около 40 000 ₽ | 150 000–200 000 ₽, 3–8 недель | от 400 000 ₽ вместе с корпусом, 6–12 недель | железо 1 100 000–1 600 000 ₽ плюс развёртывание |
| Требования к данным | Свод правил до 15–20 страниц в одной редакции | Документы в читаемом виде, версии разведены | Размеченный корпус от 1 000 примеров «вопрос — эталонный ответ» | То же, что на уровне 2 |
| Цена изменения правила | 0 ₽, правка текста — минуты | 0 ₽, правка документа и переиндексация — минуты | новая итерация обучения, от 80 000 ₽ и дни | как на уровне 2 |
| Ссылка на источник в ответе | затруднена: модель видит весь свод сразу | есть в каждом ответе, это условие приёмки | нет в принципе | как на уровне 2 |
| Юридическая сторона | данные уходят провайдеру в каждом запросе | то же плюс хранилище фрагментов у провайдера или у вас | ваш корпус остаётся у провайдера в составе модели | трансграничной передачи нет, данные не покидают периметр |
Схема-лестница из четырёх ступеней, поднимающихся слева направо, каждая подписана сверху и снизу. Ступень 1 «Правила в запросе» — сверху «40 000 ₽ внедрение», снизу «28 040 ₽/мес». Ступень 2 «Поиск по документам» — «175 000 ₽» и «45 640 ₽/мес». Ступень 3 «Дообучение» — «575 000 ₽» и «103 940 ₽/мес». Ступень 4 «Своя модель» — «175 000 ₽ + железо 1 100 000–1 600 000 ₽» и «120 100 ₽/мес». Под ступенями 1 и 2 общая скобка с подписью «здесь закрывается 8 задач из 10». Справа мелкая сноска «поток 6 000 обращений в месяц».
Обратите внимание на две строки таблицы, которые в коммерческих предложениях почти никогда не обсуждают. Первая — цена изменения правила. На уровнях 1, 2 и 4 она нулевая: вы правите текст, и новое правило действует через минуты. На уровне 3 каждое изменение — это новая итерация обучения, и она стоит денег каждый раз. Вторая — ссылка на источник. Дообученная модель не может показать, откуда взяла факт, потому что факт растворён в весах. Для внутреннего помощника по регламентам это отсекающее ограничение: сотрудник не может опереться на ответ в разговоре с клиентом, а руководитель не может разобрать спор.
Уровень 4 не отменяет уровень 2: своя модель на своём сервере всё равно должна откуда-то брать ваши регламенты, и берёт она их тем же поиском по документам. Уровень 3 в рабочих проектах тоже почти всегда идёт поверх уровня 2, а не вместо него. Поэтому в сметах третьего и четвёртого уровня строка «поиск по документам» обязана присутствовать — если её там нет, вам продают только половину системы.
Уровень 1. Правила в запросе: часы работы и потолок в 15 страниц
Самый недооценённый способ. Вы берёте свод правил — условия возврата, скрипт квалификации заявки, порядок расчёта скидки — и кладёте его в текст каждого запроса к модели, вместе с вопросом и требованием отвечать только по этому своду. Никакой базы, никакого хранилища, никакого поиска. Работы — три-пять дней инженера, включая проверку на контрольных вопросах: около 40 000 ₽ по рыночным ставкам.
У способа два жёстких ограничения, и оба измеримы. Первое — объём. В запрос физически помещается ограниченное количество текста, и чем он длиннее, тем хуже модель находит в нём нужное место: это отдельный механизм, который мы разбираем в материале про контекстное окно модели. Практическая граница, за которой качество начинает заметно падать, — примерно 15–20 страниц А4, то есть около 18 000–25 000 токенов. Второе ограничение — деньги: этот свод оплачивается на каждом обращении заново.
Единица, которой модель измеряет текст: примерно 2–3 символа русского языка, страница А4 — порядка 1 000–1 500 токенов. Тарифицируются отдельно входные токены (всё, что вы отправили) и выходные (то, что модель написала). Ориентир на сентябрь 2026: 0,20 ₽ за 1 000 входных и 0,60 ₽ за 1 000 выходных.
Посчитаем. Свод правил на 15 страниц — это около 18 000 входных токенов. Ответ в 400 выходных. Одно обращение: 18 000 × 0,20 ₽ / 1 000 = 3,60 ₽ плюс 400 × 0,60 ₽ / 1 000 = 0,24 ₽, итого 3,84 ₽. Для сравнения, обращение с поиском по документам, где в запрос попадают только пять найденных фрагментов, стоит 1,04 ₽ — почти вчетверо дешевле. Зато у первого уровня нет ни хранилища, ни индексации, ни ведения базы, ни поддержки подрядчиком: это 39 400 ₽ в месяц, которых просто нет в смете.
Отсюда точка равенства, которую полезно знать до разговора с подрядчиком. Первый уровень стоит 3,84 ₽ × N плюс 5 000 ₽ мелких правок; второй — 1,04 ₽ × N плюс 39 400 ₽ постоянных расходов. Приравниваем: 2,80 ₽ × N = 34 400 ₽, значит N ≈ 12 300 обращений в месяц. До этого потока правила в запросе дешевле поиска по документам, после — дороже.
Двухосевой график. Ось X — обращений в месяц от 0 до 25 000, ось Y — рубли в месяц от 0 до 100 000. Крутая линия из точки 5 000 ₽ с наклоном 3,84 ₽ за обращение подписана «Правила в запросе». Пологая линия из точки 39 400 ₽ с наклоном 1,04 ₽ подписана «Поиск по документам». Точка пересечения выделена и подписана «12 300 обращений в месяц». Слева от точки область затонирована и подписана «дешевле уровень 1», справа — «дешевле уровень 2». Внизу сноска «при цене 0,20 ₽ за 1 000 входных и 0,60 ₽ за 1 000 выходных токенов».
Из этой арифметики следует неочевидное: значительная часть небольших компаний, которым продают полноценную систему с базой знаний, могла бы обойтись первым уровнем. Пятнадцать страниц регламента, 3 000 обращений в месяц, один отдел — это 16 520 ₽ в месяц и неделя работы вместо 175 000 ₽ и шести недель проекта. Ограничитель здесь честный и один: как только правил становится больше 15–20 страниц или как только нужна ссылка на конкретный пункт действующей редакции, первый уровень заканчивается.
Модель видит весь свод целиком и физически не может достоверно сказать, каким именно пунктом руководствовалась — она напишет правдоподобную ссылку, и проверить её будет нечем. Если ответы системы используются в спорах с клиентами, при разборе жалоб или при проверках, первый уровень не подходит вне зависимости от объёма правил, и это не настраивается промптом.
Уровень 2. Поиск по документам: 175 000 ₽ и ответ со ссылкой
Второй уровень — то, что в предложениях называют RAG, «поиском по базе знаний» и, к сожалению, «обучением ИИ на ваших документах». Механизм: база заранее нарезается на фрагменты, перед каждым ответом система находит 3–7 подходящих и подставляет их в запрос вместе с требованием отвечать строго по ним и указывать источник. Модель ничему не учится; она пересказывает найденное. Подробный разбор механизма по шагам, распределения причин ошибок и методики приёмки — в опорной статье раздела «RAG простыми словами»; здесь нас интересует только место этого уровня в лестнице и его цена.
Рыночный ориентир на сентябрь 2026 — 150 000–200 000 ₽ и 3–8 недель, в середине вилки типовой проект собирается за 175 000 ₽ и шесть недель. Разброс объясняется тремя вещами: объёмом и состоянием документов, числом каналов, где система должна отвечать, и наличием разграничения прав. Почти треть суммы уходит не на разработку, а на приведение документов в порядок — и это единственная часть проекта, которая остаётся вашей при любом исходе.
Что второй уровень даёт по сравнению с первым и за что, собственно, платятся эти деньги. Во-первых, снимается ограничение по объёму: база на 380 документов работает так же, как база на 30, потому что в запрос попадают только найденные фрагменты. Во-вторых, появляется ссылка на конкретный пункт с датой редакции — то, чего первый уровень дать не может. В-третьих, обновление правила по-прежнему бесплатное: вы правите документ, система переиндексирует, новое правило действует через минуты. Именно это свойство делает второй уровень рабочим потолком для большинства компаний.
Чего второй уровень не даёт. Он не научит модель говорить в вашем стиле — для этого нужен третий уровень или тщательно собранные примеры в инструкции. Он не даст доступа к живым данным учётной системы: «где мой заказ» — это запрос в 1С, а не поиск по документам, и коннектор к учётной системе стоит отдельных 60 000–120 000 ₽. И он не решает проблему противоречий в самой базе: если два регламента действуют одновременно, система будет уверенно цитировать любой из них.
Уровень 3. Дообучение: меняет форму ответа, а не факты
Дообучение — это изменение самой модели на ваших примерах. Ей показывают набор пар «вход — эталонный выход», и она подстраивает внутренние веса так, чтобы отвечать похоже. Технология настоящая и рабочая, но задачу, ради которой её чаще всего покупают, она не решает: передавать через неё факты нельзя.
Две колонки. Левая «Дообучение решает» с четырьмя строками: «Стиль и тон ответов», «Жёсткий формат выдачи», «Отраслевая терминология и сокращения», «Узкая повторяющаяся задача с одинаковой структурой». Правая «Дообучение не решает» с четырьмя строками: «Актуальность фактов — они застывают на дате обучения», «Ссылку на источник — её нет в принципе», «Быстрое изменение правила — от 80 000 ₽ за итерацию», «Доступ к живым данным учётной системы». Под колонками общая полоса: «Корпус от 1 000 пар «вопрос — эталонный ответ», собирается людьми, 6–12 недель».
Причина в устройстве. Дообученная модель знает ваши факты на дату обучения и не умеет объяснить, откуда их взяла. Когда регламент меняется — а он меняется, — старое знание остаётся внутри и продолжает вылезать в ответах, причём вперемешку с новым. Обновить его можно только новой итерацией обучения: от 80 000 ₽ и несколько дней каждый раз. Сравните с уровнем 2, где то же изменение стоит правки одного абзаца в документе.
Отдельная статья расходов, о которой в предложениях обычно молчат, — корпус. Дообучению нужен размеченный набор от 1 000 пар «вопрос — эталонный ответ», и собирают его люди, которые знают предмет: методист, юрист, старший менеджер. Это 60–120 часов работы ваших сотрудников плюс работа подрядчика по проверке и чистке набора. Полный проект третьего уровня вместе с корпусом и обучением — от 400 000 ₽, и это в дополнение к 175 000 ₽ второго уровня, потому что факты всё равно придётся подавать поиском.
Есть и третья строка, специфичная именно для этого уровня: дообученная модель не может обслуживаться в общем пуле провайдера. Под неё выделяется отдельное развёртывание, и тарифицируется оно помесячно, а не по токенам — ориентир 40 000–90 000 ₽ в месяц. То есть третий уровень добавляет постоянный платёж, которого нет ни на первом, ни на втором.
Когда дообучение оправдано по-настоящему. Первое: узкая повторяющаяся задача с жёстким форматом выхода — например, разбор однотипных заявок в структуру полей, где важна не эрудиция, а точность формы. Второе: специфическая отраслевая терминология, которую модель систематически перевирает, и это подтверждено замером, а не ощущением. Третье: требование к длине и стилю, которое не удаётся получить инструкцией даже после нескольких итераций. Во всех трёх случаях дообучение идёт поверх поиска по документам, а не вместо него.
Уровень 4. Своя модель: покупают требование, а не экономию
Четвёртый уровень — это открытая модель (Qwen 3, Llama 4, DeepSeek, Mistral), развёрнутая через Ollama на вашем сервере в России, с векторным хранилищем pgvector в вашей же PostgreSQL. Формально это не способ передать модели факты: факты по-прежнему приходят поиском по документам. Меняется только строка «где физически считает модель», и сравнивать варианты нужно именно по ней.
Карта из четырёх горизонтальных дорожек, по одной на подход. В каждой слева узел «Ваши документы», справа узел «Модель», между ними стрелка. Пунктирная рамка «периметр компании» на дорожках 1–3 охватывает только левую часть, стрелка пересекает её с подписью «текст запроса уходит провайдеру»; на дорожке 1 подпись у стрелки «весь свод правил, каждый раз», на дорожке 2 — «5 найденных фрагментов», на дорожке 3 — «фрагменты плюс корпус хранится у провайдера в составе модели». На дорожке 4 рамка охватывает обе части целиком, стрелка внутри, подпись «трансграничной передачи нет». Справа у каждой дорожки колонка «Месяц»: 28 040 ₽, 45 640 ₽, 103 940 ₽, 120 100 ₽.
Стоимость владения средней конфигурацией — одна карта на 48 ГБ видеопамяти, модели класса 27–32 млрд параметров, 8–12 одновременных запросов — складывается из амортизации железа, размещения, администратора и обновлений и составляет 89 700 ₽ в месяц независимо от объёма. Бюджет самого железа — 1 100 000–1 600 000 ₽. Конфигурации и полный расчёт владения мы разбираем в материале про локальную модель под 152-ФЗ; здесь важен только вывод для сравнения уровней.
Вывод такой. Облачное обращение с поиском по документам стоит 1,04 ₽. Свой контур стоит 89 700 ₽ в месяц при любом объёме. Порог равенства: 89 700 ₽ ÷ 1,04 ₽ ≈ 86 000 обращений в месяц, то есть около 2 900 в день. Для компании на 50–300 человек это очень много — столько даёт разве что клиентский поток контакт-центра или массовая обработка документов. На внутреннем ассистенте реалистичный объём — 3 000–15 000 обращений в месяц, и в этом диапазоне облако дешевле в пять-восемь раз.
Собственный сервер под модель почти никогда не покупают ради экономии. Его покупают под требование — и если требования нет, это надо сказать собственнику прямо, а не спрятать в смете.
Правило перехода: следующий уровень берут по метрике
Главная защита от переплаты формулируется одной фразой: каждый следующий уровень берётся только после того, как предыдущий измеримо не справился. Не «нам кажется, что качество низкое», а конкретное число на контрольном наборе вопросов. Набор собирается один раз до начала работ — 100 реальных вопросов сотрудников или клиентов с эталонными ответами — и потом служит воротами при каждом переходе.
Горизонтальная схема: четыре блока-уровня («Правила в запросе», «Поиск по документам», «Дообучение», «Своя модель») соединены тремя воротами. Ворота 1 подписаны «свод перевалил за 15–20 страниц ИЛИ нужна ссылка на пункт». Ворота 2 — «фрагмент попадает в топ-5 в 85+ случаях из 100, но принято меньше 70 ответов из 100». Ворота 3 — «требование к размещению данных ИЛИ более 86 000 обращений в месяц». Под каждыми воротами мелкая подпись «замер на контрольных 100 вопросах». Ворота 3 отмечены сноской «решается юристом и объёмом, а не качеством ответов».
- 1С первого уровня на второй
Переход обоснован, когда верно хотя бы одно из двух. Свод правил перевалил за 15–20 страниц — тогда качество падает механически, и это видно по контрольным вопросам: доля верных ответов проседает при том, что нужный текст в своде есть. Либо появилось требование показывать источник: ссылку на пункт действующей редакции первый уровень дать не может ни при каком объёме.
- 2Со второго уровня на третий
Переход обоснован ровно в одном случае: поиск работает, а ответы всё равно не принимают. Метрика двойная. Нужный фрагмент попадает в топ-5 найденного в 85 и более случаях из 100 — значит, факты система находит. И при этом доля принятых ответов ниже 70 из 100 — значит, проблема в форме: стиль, длина, структура, терминология. Если первое число ниже 85, переходить на дообучение нельзя: вы будете дорого учить модель поверх сломанного поиска.
- 3С любого уровня на четвёртый
Это вообще не решение о качестве. Оно принимается по двум основаниям, и оба внешние. Первое: требование к размещению данных — специальные категории персональных данных, условие заказчика в договоре, госконтракт, позиция службы безопасности. Второе: объём перевалил за 86 000 обращений в месяц. Если ни того, ни другого нет, свой сервер обойдётся дороже облака в несколько раз.
Практическая ценность этих ворот в том, что они превращают спор о подходе в проверку числа. Подрядчик, который предлагает начать сразу с третьего уровня, должен показать, что второй измеримо не справился — а показать он этого не может, потому что второй уровень ещё не собран. Тот же вопрос работает и в обратную сторону: если у вас уже стоит система второго уровня и вы недовольны ответами, откройте журнал и посмотрите, попадает ли нужный фрагмент в найденное. В восьми случаях из десяти проблема окажется в поиске, а не в модели, и дообучение её не решит.
Счёт за месяц: 6 000 обращений во всех четырёх вариантах
Вводные модельного примера: производственно-торговая компания, 140 человек, внутренний ассистент отвечает сотрудникам на вопросы по регламентам, условиям договоров и характеристикам продукции. Поток — 6 000 обращений в месяц. Свод правил на 15 страниц для первого уровня, база из 380 документов для остальных. Цены на сентябрь 2026: 0,20 ₽ за 1 000 входных токенов, 0,60 ₽ за 1 000 выходных.
Разберём две строки, которые вызывают больше всего вопросов. В третьем уровне 103 940 ₽ складываются так: выделенное развёртывание дообученной модели 45 000 ₽, вызовы модели 6 240 ₽, амортизация переобучения 80 000 ₽ ÷ 6 месяцев = 13 300 ₽, инфраструктура поиска 9 000 ₽, ведение базы 5 400 ₽, поддержка 25 000 ₽. Если ваши регламенты меняются не раз в полгода, а ежеквартально, строка переобучения вырастает вдвое — до 26 700 ₽, и месяц уходит за 117 000 ₽.
В четвёртом уровне вызовы модели не стоят ничего сверху — вы уже заплатили за железо. Но 89 700 ₽ платятся и при 6 000 обращений, и при 600: это фиксированная стоимость владения, в которую входят амортизация сервера за 36 месяцев, размещение и электричество, системный администратор и обновление моделей с регресс-тестом. Строка «поддержка подрядчиком 25 000 ₽» из сметы не исчезает: сам агент, база и интеграции требуют сопровождения одинаково в облаке и в своём контуре.
Первый год целиком: от 376 тысяч до 1,8 миллиона
Месячный счёт — только половина картины: уровни сильно различаются и по разовым вложениям. Сложим внедрение и двенадцать месяцев эксплуатации на том же потоке 6 000 обращений. Железо четвёртого уровня в разовую часть не выносим — оно уже сидит в месячном счёте через амортизацию за 36 месяцев.
| Уровень | Внедрение | Месяц | 12 месяцев | Первый год всего |
|---|---|---|---|---|
| 1. Правила в запросе | 40 000 ₽ | 28 040 ₽ | 336 480 ₽ | 376 480 ₽ |
| 2. Поиск по документам | 175 000 ₽ | 45 640 ₽ | 547 680 ₽ | 722 680 ₽ |
| 3. Дообучение поверх поиска | 575 000 ₽ | 103 940 ₽ | 1 247 280 ₽ | 1 822 280 ₽ |
| 4. Своя модель поверх поиска | 175 000 ₽ | 120 100 ₽ | 1 441 200 ₽ | 1 616 200 ₽ |
Горизонтальная столбчатая диаграмма из четырёх составных полос, ось X в рублях от 0 до 2 000 000. Каждая полоса разделена на две части: тёмная «внедрение» и светлая «12 месяцев эксплуатации». Уровень 1 — 40 000 + 336 480 = 376 480 ₽. Уровень 2 — 175 000 + 547 680 = 722 680 ₽. Уровень 3 — 575 000 + 1 247 280 = 1 822 280 ₽. Уровень 4 — 175 000 + 1 441 200 = 1 616 200 ₽. Полосы 1 и 2 обведены общей скобкой с подписью «закрывает 8 задач из 10». Внизу сноска «поток 6 000 обращений в месяц, сентябрь 2026».
Главное, что видно в этой таблице, — не абсолютные суммы, а форма разрыва. Между первым и вторым уровнем разница почти вдвое, и она обычно оправдана: второй уровень снимает ограничение по объёму и даёт проверяемый источник. Между вторым и третьим — ещё в два с половиной раза, и вот здесь прирост качества на типовых задачах измеряется единицами процентов. Четвёртый уровень стоит примерно как третий, но покупается по совершенно другой причине — под требование, а не под качество.
Ещё одно наблюдение, полезное при чтении чужой сметы. Постоянные расходы на втором, третьем и четвёртом уровнях почти не зависят от потока: 39 400 ₽, 97 700 ₽ и 120 100 ₽ соответственно платятся и при 6 000 обращений, и при 1 000. Это значит, что на малых объёмах спорить о цене токенов бессмысленно — вы боретесь за проценты счёта. Полную структуру расходов на ИИ-агента, включая четыре статьи, которых почти никогда нет в коммерческих предложениях, мы разбираем отдельно.
Где проходит граница периметра: 152-ФЗ и зарубежные модели
На первых трёх уровнях текст запроса уходит провайдеру модели. Это ключевой факт для 152-ФЗ, и он не зависит от того, насколько уважаемый провайдер: в момент отправки данные покидают ваш периметр. Если в запросе есть имя, телефон, адрес, диагноз или сумма договора конкретного контрагента — это обработка персональных данных сторонним лицом со всеми вытекающими обязанностями: правовое основание, поручение обработки, локализация базы в России.
Схема-развилка. Слева блок «Обращение с персональными данными». От него стрелка в ромб «Данные можно обезличить на входе?». Ветка «да» ведёт в блок «Уровни 1–3 в российском облаке: имена и телефоны заменяются метками до отправки, обратная подстановка после ответа» с подписью «дополнительно 40 000–90 000 ₽ разово». Ветка «нет» ведёт в блок «Уровень 4: свой контур, 89 700 ₽/мес» с подписью «трансграничной передачи нет». Отдельная нижняя ветка «Заказчик — госорганизация» ведёт в блок «Проверить продукт в реестре отечественного ПО» с пометкой «российское облако ≠ реестр».
Практический порядок действий такой. Сначала посмотрите, что реально уходит в модель. В большинстве внутренних сценариев — вопросы по регламентам, разбор условий, подготовка черновиков — персональных данных в запросе нет вовсе, и вопрос снимается. Если они есть, второй шаг — обезличивание на входе: имена и телефоны заменяются метками до отправки и подставляются обратно после ответа. Это отдельная работа на 40 000–90 000 ₽, и она почти всегда дешевле собственного сервера. И только если обезличить нельзя — например, сам текст обращения и есть предмет анализа, — остаётся четвёртый уровень. Как мы работаем с доступами, журналами и персональными данными на проектах, описано в разделе про безопасность и защиту данных.
Отдельная оговорка про зарубежные модели, потому что их продолжают закладывать в проекты. Прямая оплата OpenAI и Anthropic из России невозможна: страна не входит в список поддерживаемых для их API, и доступ идёт через рублёвых посредников и агрегаторы. Для системы, на которую опирается ежедневная работа компании, это не инструмент, а точка отказа: посредник может исчезнуть, тариф — измениться в одностороннем порядке, а вопрос о том, где физически обрабатываются данные и кто отвечает по 152-ФЗ, остаётся открытым.
Если подрядчик проектирует систему вокруг конкретной зарубежной модели, задайте два вопроса. Первый: через какое юридическое лицо идёт оплата и что произойдёт с системой, если этот канал закроется в течение месяца. Второй: сколько стоит переключение на российскую модель — если ответ измеряется неделями, значит, слоя абстракции над моделью в архитектуре нет, и его нужно требовать до подписания. Рабочая постановка на сентябрь 2026: основная модель российская (GigaChat 3, YandexGPT 5) или открытая на своём сервере, зарубежная — максимум запасной вариант для редких запросов на обезличенных данных.
Пять признаков, что вам продают лишний уровень
Ни один из признаков сам по себе не приговор, но три сразу — повод затормозить и попросить обоснование по метрике. Все пять проверяются по тексту коммерческого предложения, без технической экспертизы.
- 1«Обучим модель на ваших данных» — и больше ни слова о том, что именно происходит. В подавляющем большинстве предложений за этой фразой стоит второй уровень, поиск по документам. Это нормально и правильно, но требует другого разговора о цене и о приёмке. Спросите прямо: модель дообучается на наших данных или документы подставляются в запрос при каждом ответе.
- 2В смете есть дообучение, но нет строки про размеченный корпус и часы ваших сотрудников. Корпус от 1 000 пар «вопрос — эталонный ответ» кто-то должен собрать, и это 60–120 часов работы человека, который знает предмет. Если этой строки нет, либо дообучения на самом деле не будет, либо корпус соберут наспех и качество окажется хуже второго уровня.
- 3Собственный сервер предлагается без расчёта порога и без вопроса о том, какие данные реально уходят в модель. Правильный разговор начинается с маршрута данных, а не с конфигурации видеокарт. Если про обезличивание на входе не спросили ни разу, скорее всего, продают железо.
- 4Нет строки «поиск по документам» в смете третьего или четвёртого уровня. Факты в обоих случаях приходят одинаково — поиском. Смета, где этой работы нет, описывает половину системы: вторая половина всплывёт как доработка на третий месяц.
- 5Нет контрольного набора вопросов и порога приёмки в числах. Без него переход между уровнями невозможно обосновать ни в одну сторону, а приёмка сводится к демонстрации. Набор из 100 вопросов с эталонными ответами собирается вашей стороной за два-три дня и защищает бюджет лучше любых гарантий в договоре — как это устроено у нас, описано в разделе о порядке работы.
Когда не нужен ни один из четырёх уровней
Языковая модель стала стандартным ответом на любой вопрос про автоматизацию, и это делает её частой переплатой. Ниже — ситуации, в которых мы отговариваем от всех четырёх уровней сразу, потому что задача решается проще, дешевле и надёжнее.
- Ответ лежит в одном поле учётной системы. «Где мой заказ», «какой остаток на складе», «когда оплата» — это запрос в 1С или в CRM, а не работа с текстами. Нужен коннектор за 60 000–120 000 ₽, и никакой уровень лестницы его не заменит.
- Вопросов много, но они одинаковые. Двадцать типовых вопросов закрываются кнопочным меню за 30 000–120 000 ₽: ответ воспроизводим, проверять нечего, счёта за вызовы модели нет вовсе.
- Правило формулируется в три строки и не меняется. Это строка в памятке, а не повод для проекта. Первый уровень имеет смысл примерно от пяти-семи страниц правил, до этого дешевле памятка.
- Меньше 300–400 обращений в месяц и все из одного отдела. Постоянные расходы даже второго уровня — 39 400 ₽ в месяц независимо от нагрузки — съедят всю экономию. На первом уровне порог ниже, но и там нужен хотя бы стабильный поток.
- Документы противоречат друг другу, и никто не знает, какая версия действует. Пока это так, система любого уровня будет уверенно цитировать отменённый приказ. Сначала ревизия документов — порядок подготовки данных перед внедрением мы разбирали отдельно, — потом автоматизация.
- Процесс не описан и держится на конкретном человеке. Модель не восстановит правило, которого нет в письменном виде: она сочинит правдоподобное. Это самая дорогая из перечисленных ошибок, потому что обнаруживается уже в эксплуатации.
Зеркальный признак применимости так же прост. Лестница уместна, когда одновременно верны три вещи: ответы лежат в текстах, а не в полях базы данных; вопросы формулируются свободно и по-разному; поток измеряется тысячами обращений в месяц. Начинать при этом почти всегда стоит с первого уровня — он собирается за неделю и даёт честный ответ на вопрос, будут ли люди этим пользоваться, до того как вы потратите 175 000 ₽ на второй.
