Проверять надо не текст, а шесть типов утверждений в нём: числа, даты, названия и модели, ссылки на нормативные требования, обещания и гарантии, цитаты. Всё остальное — связки, переходы, описательные фразы — модель делает надёжно, и сплошная вычитка этих частей и есть та работа, из-за которой выигрыш во времени исчезает.
Разница в цифрах такая. Сплошная вдумчивая вычитка текста на 3 000 знаков занимает у редактора около 25 минут — примерно столько же, сколько написать этот текст самому. Проверка по процедуре — 12 минут: десять-четырнадцать отмеченных точек по 45 секунд плюс три минуты на чтение связок. Именно эти тринадцать минут разницы и составляют весь экономический смысл генерации на длинных материалах.
Ниже — сам список шести типов с примерами ошибок и способом проверки, правила автоматической разметки точек, приём, который убирает две трети проверок вообще, норматив времени с расчётом и порядок действий, если ошибка нашлась уже после публикации.
Шесть типов утверждений, которые проверяются всегда
Список закрытый. Он не растёт от материала к материалу и не зависит от отрасли — меняется только источник, по которому сверяется каждый тип.
| Тип утверждения | Как выглядит ошибка | Чем проверяется | Время |
|---|---|---|---|
| Числа: размеры, вес, состав, мощность, сроки | Правдоподобное значение вместо фактического: «алюминиевый корпус» у стального | Справочник характеристик, карточка поставщика, ТУ | 30–60 сек |
| Даты: сроки действия, периоды, календарные привязки | Смещение на год или подстановка «текущего» года из обучения | Первоисточник документа или приказа | 30 сек |
| Названия и модели: продукты, версии, конфигурации | Устаревшее имя сервиса или несуществующая версия конфигурации | Сайт вендора, реестр, свой прайс | 60 сек |
| Ссылки на нормы: законы, требования площадок, ГОСТы | Правильная суть при неверном номере статьи или дате вступления | Официальный текст нормы, справка площадки | 90–120 сек |
| Обещания и гарантии: сроки, условия возврата, ответственность | Формулировка шире, чем компания реально готова выполнить | Оферта, регламент поддержки, договор | 60 сек |
| Цитаты и приписанные высказывания | Складная фраза, которой источник не произносил | Первоисточник целиком, а не цитата в чужом пересказе | 120 сек |
Особенно коварны две последние строки. Ошибка в характеристике товара всплывает возвратом — неприятно, но измеримо. Ошибка в обещании порождает обязательство: опубликованное условие возврата или срок гарантии компания выполняет независимо от того, кто набрал этот текст. А неверно приписанная цитата — единственный тип ошибки, который читатель воспринимает не как небрежность, а как подлог.
Нарисованный абстрактный экран редактора: колонка текста, строки показаны условными серыми линиями. Двенадцать фрагментов выделены рамками с номерами и значками шести типов: число, дата, название, норма, обещание, цитата. Справа узкая колонка-панель со списком тех же двенадцати пунктов, у каждого — источник проверки и пустой чекбокс. Внизу счётчик «12 точек · 45 секунд каждая · 9 минут». Чертёжный стиль, подписи по-русски, без брендов.
Почему модель уверенно ошибается именно здесь
Языковая модель подбирает продолжение текста по тому, насколько оно вероятно в подобных текстах, а не по тому, верно ли оно для вашего товара. Там, где нужного факта в исходных данных нет, самым вероятным продолжением оказывается типичное значение: обычный материал для этой категории, обычный срок гарантии, обычная толщина. Оно и подставляется — в том же уверенном тоне, что и верные части текста.
Отсюда практический вывод, который важнее любых настроек: признаков сомнения в тексте не будет. Модель не пишет «вероятно, корпус алюминиевый». Она пишет ровно так же, как пишет правду, и поэтому вычитка «на глаз» не работает — глазу не за что зацепиться. Работает только формальная разметка мест, где утверждение относится к одному из шести типов.
Второе следствие — ошибки не случайны, а систематичны. Модель ошибается в одну и ту же сторону: в сторону типичного для категории. Если у вас нестандартный товар, доля ошибок в его карточках будет выше, чем в карточках обычного, и это надо учитывать при выборе, какие товарные группы отдавать генерации первыми. Общая механика распределения ролей между шаблоном и моделью разобрана в опорной статье кластера.
Как пометить точки проверки до того, как текст увидит человек
Разметка делается один раз в шаблоне и дальше работает на каждом материале. Задача — не найти ошибки автоматически, это невозможно, а показать редактору места, где ошибка вообще может быть, чтобы он не читал остальное.
- 1Выделить всё числовое
Любая последовательность цифр в сгенерированном тексте помечается автоматически: размеры, вес, проценты, сроки, суммы. Правило грубое и даёт лишние срабатывания на артикулах — это дешевле, чем пропустить одно число. На карточке товара так набирается 4–7 точек.
- 2Выделить имена собственные и версии
Слова с заглавной буквы вне начала предложения, буквенно-цифровые сочетания вида «УТ 11.5», названия материалов и стандартов. Ещё 2–4 точки. Здесь же ловятся упоминания сервисов, которых больше нет на российском рынке или которые сменили название.
- 3Выделить модальные конструкции обещаний
Списком слов: «гарантируем», «в течение», «не менее», «подходит для», «обеспечивает», «безопасен». Это самая короткая по числу срабатываний группа — 1–2 точки — и самая дорогая по последствиям.
- 4Показать источник рядом с каждой точкой
Точка проверки без источника превращает процедуру обратно в вычитку: редактор начинает искать, где сверить. Рядом с числом должна стоять ссылка на строку справочника, рядом с нормой — на официальный текст. Именно это сокращает проверку одной точки до 45 секунд.
- 5Оставить след проверки
Чекбокс у каждой точки и отметка «проверено» в карточке материала. Нужно не для контроля людей, а для разбора: когда ошибка всё-таки уходит в публикацию, видно, была ли точка помечена и была ли она проверена. Без этого следующий разбор превращается в спор.
Схема из пяти блоков со стрелками слева направо: «Справочник характеристик» и «Шаблон» сходятся в «Сборка материала», далее «Автоматическая разметка точек: числа, имена, обещания», далее «Редактор: 12 точек по 45 секунд», далее «Публикация». От блока разметки вниз отходит ветка «пустое поле справочника — сборка останавливается». Под схемой подпись: «без разметки — 25 минут, с разметкой — 12 минут на 3 000 знаков». Чертёжный стиль, подписи по-русски.
Главный приём: числа не генерируются, а подставляются
Проверка — это лечение симптома. Радикальное решение убирает две трети точек вообще: числа, характеристики, состав и комплектация не пишутся моделью, а подставляются из справочника, а шаблон не собирает материал, если поле пустое. Пустое поле становится остановкой выпуска, а не местом, куда модель допишет правдоподобное значение.
Не начинать с генерации. Заполнение справочника — самостоятельная работа: примерно 6 минут на позицию для торговой компании с внешними поставщиками, то есть 200 часов на каталог в 2 000 позиций. Это дорого, но это единственные расходы, которые остаются вашими навсегда: справочник переживает и смену модели, и смену подрядчика. Полный расчёт — в статье про стоимость автоматизации контента.
Промежуточный вариант для тех, у кого справочник есть частично: подстановка включается для заполненных полей, а для незаполненных модель получает запрет упоминать характеристику вообще. Текст выходит беднее — и это правильный размен: отсутствующая характеристика стоит ноль, а выдуманная стоит возврат. Цена такого возврата в модельном интернет-магазине со средним чеком 4 800 ₽ и маржой 30 % — 2 840 ₽: 1 440 ₽ потерянной маржи плюс 1 400 ₽ обратной логистики.
Норматив времени: 12 минут против 25 на 3 000 знаков
Норматив нужен не для контроля редактора, а для того, чтобы посчитать, окупается ли сама разметка. Считаем на партии в 200 материалов по 3 000 знаков при полной стоимости часа редактора 900 ₽.
Двенадцать минут — не универсальная норма. На карточке товара в 900 знаков точек проверки 4–7, и проверка занимает 4–5 минут. На экспертной статье в 12 000 знаков их бывает 40–60, и никакая процедура не сведёт проверку меньше чем к 40 минутам. Замерьте своё число на десяти материалах: это полтора часа работы, которые дают основание для всех дальнейших расчётов. Как ставить такие замеры, разобрано в статье про то, как измерить эффект автоматизации.
Ошибка нашлась после публикации
Это не аварийная ситуация, а штатная: процедура снижает частоту ошибок, но не доводит её до нуля. Важно другое — цена одной и той же ошибки различается в сотни раз в зависимости от того, на какой стадии её нашли.
| Где нашли ошибку | Что нужно сделать | Стоимость |
|---|---|---|
| В шаблоне, до генерации партии | Правка одной строки шаблона, 2 минуты | 30 ₽ |
| В тексте, до публикации | Правка по помеченной точке, 45 секунд | 11 ₽ |
| В одном опубликованном материале | Правка, проверка соседних материалов, ответ обратившимся: 40 минут | 600 ₽ |
| В партии на 1 000 карточек | Переделка 50 часов плюс возвраты за полтора месяца | 181 320 ₽ |
Порядок действий после публикации короткий, и его смысл — не в исправлении одного текста, а в том, чтобы не повторить тот же тип ошибки в следующей партии.
- 1Определите охват прежде, чем править. Первый вопрос — не «как исправить», а «сколько ещё материалов собраны тем же шаблоном». Ошибка почти никогда не единична: она в шаблоне или в строке справочника.
- 2Правьте источник, потом тексты. Если сначала выправить тексты, следующая сборка вернёт ошибку обратно, и её найдут уже клиенты.
- 3Отметьте тип, а не случай. В журнале разбора пишется не «в карточке 4471 был неверный материал», а «числовая характеристика попала в текст мимо справочника». Тип показывает, какое правило разметки не сработало.
- 4Проверьте, была ли точка помечена. Если да и её пропустили — вопрос к нагрузке редактора. Если нет — правило разметки надо расширять, и это работа инженера, а не разговор с человеком.
- 5Раз в квартал пересматривайте список типов. Он закрытый, но источники проверки меняются: обновилась площадка, сменился поставщик, изменилась норма. Полчаса работы, которые держат процедуру живой.
Столбчатая диаграмма с логарифмической осью Y в рублях, четыре столбца: «В шаблоне» — 30 ₽, «В тексте до публикации» — 11 ₽, «В одном опубликованном материале» — 600 ₽, «В партии на 1 000 карточек» — 181 320 ₽. Между третьим и четвёртым столбцом вертикальная пунктирная линия с подписью «публикация партии». Ось Y подписана «логарифмическая шкала». Чертёжный стиль, подписи по-русски.
Когда процедура не спасает и текст должен писать человек
У процедуры есть граница, и её важно знать заранее. Проверка ловит неверные утверждения. Она не ловит утверждений, которых в тексте нет, а должны быть, — и именно этим машинный черновик вредит там, где его читает специалист.
Сгенерированный экспертный текст обычно фактически безупречен и профессионально пуст: в нём нет оговорок, исключений и деталей, по которым читатель узнаёт практика. Редактор проверит двенадцать точек, все сойдутся, а специалист закроет страницу на третьем абзаце. Пять таких случаев разобраны отдельно в статье про то, когда генерация вредит бренду; там же — три вопроса, по которым решение принимается до запуска.
Есть и обратная граница — когда процедура избыточна. Если материалов меньше сотни в год, разметка не окупится: порог, посчитанный выше, — 93 материала. Если все факты в тексте подставляются из справочника и модель отвечает только за связки, типов проверки остаётся четыре из шести, а время падает до 4–6 минут, и отдельная процедура превращается в обычную вычитку. И если текст в принципе не содержит проверяемых утверждений — поздравление, анонс события без цифр, — проверять там нечего, и требовать процедуру означает просто добавить шаг.
Главное, что стоит унести из этой статьи: проверка фактов — не признак недоверия к технологии, а часть её эксплуатации, такая же обязательная, как приёмка на любом другом участке. Отвечает за опубликованный текст компания, а не инструмент, которым он был набран, и никакая формулировка в договоре с подрядчиком этого не меняет. Как встроить проверку в общий маршрут согласования, разобрано в статье про согласование контента в компании.
