Проверять надо не текст, а шесть типов утверждений в нём: числа, даты, названия и модели, ссылки на нормативные требования, обещания и гарантии, цитаты. Всё остальное — связки, переходы, описательные фразы — модель делает надёжно, и сплошная вычитка этих частей и есть та работа, из-за которой выигрыш во времени исчезает.

Разница в цифрах такая. Сплошная вдумчивая вычитка текста на 3 000 знаков занимает у редактора около 25 минут — примерно столько же, сколько написать этот текст самому. Проверка по процедуре — 12 минут: десять-четырнадцать отмеченных точек по 45 секунд плюс три минуты на чтение связок. Именно эти тринадцать минут разницы и составляют весь экономический смысл генерации на длинных материалах.

Ниже — сам список шести типов с примерами ошибок и способом проверки, правила автоматической разметки точек, приём, который убирает две трети проверок вообще, норматив времени с расчётом и порядок действий, если ошибка нашлась уже после публикации.

Шесть типов утверждений, которые проверяются всегда

Список закрытый. Он не растёт от материала к материалу и не зависит от отрасли — меняется только источник, по которому сверяется каждый тип.

Тип утвержденияКак выглядит ошибкаЧем проверяетсяВремя
Числа: размеры, вес, состав, мощность, срокиПравдоподобное значение вместо фактического: «алюминиевый корпус» у стальногоСправочник характеристик, карточка поставщика, ТУ30–60 сек
Даты: сроки действия, периоды, календарные привязкиСмещение на год или подстановка «текущего» года из обученияПервоисточник документа или приказа30 сек
Названия и модели: продукты, версии, конфигурацииУстаревшее имя сервиса или несуществующая версия конфигурацииСайт вендора, реестр, свой прайс60 сек
Ссылки на нормы: законы, требования площадок, ГОСТыПравильная суть при неверном номере статьи или дате вступленияОфициальный текст нормы, справка площадки90–120 сек
Обещания и гарантии: сроки, условия возврата, ответственностьФормулировка шире, чем компания реально готова выполнитьОферта, регламент поддержки, договор60 сек
Цитаты и приписанные высказыванияСкладная фраза, которой источник не произносилПервоисточник целиком, а не цитата в чужом пересказе120 сек

Особенно коварны две последние строки. Ошибка в характеристике товара всплывает возвратом — неприятно, но измеримо. Ошибка в обещании порождает обязательство: опубликованное условие возврата или срок гарантии компания выполняет независимо от того, кто набрал этот текст. А неверно приписанная цитата — единственный тип ошибки, который читатель воспринимает не как небрежность, а как подлог.

разбор экранаproverka-faktov-v-sgenerirovannom-tekste--01
Абстрактная страница текста с двенадцатью отмеченными точками проверки по шести типам

Нарисованный абстрактный экран редактора: колонка текста, строки показаны условными серыми линиями. Двенадцать фрагментов выделены рамками с номерами и значками шести типов: число, дата, название, норма, обещание, цитата. Справа узкая колонка-панель со списком тех же двенадцати пунктов, у каждого — источник проверки и пустой чекбокс. Внизу счётчик «12 точек · 45 секунд каждая · 9 минут». Чертёжный стиль, подписи по-русски, без брендов.

Редактор видит не сплошной текст, а список из двенадцати мест и источник к каждому

Почему модель уверенно ошибается именно здесь

Что это значитПравдоподобие вместо истинности

Языковая модель подбирает продолжение текста по тому, насколько оно вероятно в подобных текстах, а не по тому, верно ли оно для вашего товара. Там, где нужного факта в исходных данных нет, самым вероятным продолжением оказывается типичное значение: обычный материал для этой категории, обычный срок гарантии, обычная толщина. Оно и подставляется — в том же уверенном тоне, что и верные части текста.

Отсюда практический вывод, который важнее любых настроек: признаков сомнения в тексте не будет. Модель не пишет «вероятно, корпус алюминиевый». Она пишет ровно так же, как пишет правду, и поэтому вычитка «на глаз» не работает — глазу не за что зацепиться. Работает только формальная разметка мест, где утверждение относится к одному из шести типов.

Второе следствие — ошибки не случайны, а систематичны. Модель ошибается в одну и ту же сторону: в сторону типичного для категории. Если у вас нестандартный товар, доля ошибок в его карточках будет выше, чем в карточках обычного, и это надо учитывать при выборе, какие товарные группы отдавать генерации первыми. Общая механика распределения ролей между шаблоном и моделью разобрана в опорной статье кластера.

Как пометить точки проверки до того, как текст увидит человек

Разметка делается один раз в шаблоне и дальше работает на каждом материале. Задача — не найти ошибки автоматически, это невозможно, а показать редактору места, где ошибка вообще может быть, чтобы он не читал остальное.

  1. 1
    Выделить всё числовое

    Любая последовательность цифр в сгенерированном тексте помечается автоматически: размеры, вес, проценты, сроки, суммы. Правило грубое и даёт лишние срабатывания на артикулах — это дешевле, чем пропустить одно число. На карточке товара так набирается 4–7 точек.

  2. 2
    Выделить имена собственные и версии

    Слова с заглавной буквы вне начала предложения, буквенно-цифровые сочетания вида «УТ 11.5», названия материалов и стандартов. Ещё 2–4 точки. Здесь же ловятся упоминания сервисов, которых больше нет на российском рынке или которые сменили название.

  3. 3
    Выделить модальные конструкции обещаний

    Списком слов: «гарантируем», «в течение», «не менее», «подходит для», «обеспечивает», «безопасен». Это самая короткая по числу срабатываний группа — 1–2 точки — и самая дорогая по последствиям.

  4. 4
    Показать источник рядом с каждой точкой

    Точка проверки без источника превращает процедуру обратно в вычитку: редактор начинает искать, где сверить. Рядом с числом должна стоять ссылка на строку справочника, рядом с нормой — на официальный текст. Именно это сокращает проверку одной точки до 45 секунд.

  5. 5
    Оставить след проверки

    Чекбокс у каждой точки и отметка «проверено» в карточке материала. Нужно не для контроля людей, а для разбора: когда ошибка всё-таки уходит в публикацию, видно, была ли точка помечена и была ли она проверена. Без этого следующий разбор превращается в спор.

схема процессаproverka-faktov-v-sgenerirovannom-tekste--02
Схема пути материала: генерация, автоматическая разметка точек, проверка редактором, публикация

Схема из пяти блоков со стрелками слева направо: «Справочник характеристик» и «Шаблон» сходятся в «Сборка материала», далее «Автоматическая разметка точек: числа, имена, обещания», далее «Редактор: 12 точек по 45 секунд», далее «Публикация». От блока разметки вниз отходит ветка «пустое поле справочника — сборка останавливается». Под схемой подпись: «без разметки — 25 минут, с разметкой — 12 минут на 3 000 знаков». Чертёжный стиль, подписи по-русски.

Между генерацией и редактором стоит один автоматический шаг — он и экономит тринадцать минут

Главный приём: числа не генерируются, а подставляются

Проверка — это лечение симптома. Радикальное решение убирает две трети точек вообще: числа, характеристики, состав и комплектация не пишутся моделью, а подставляются из справочника, а шаблон не собирает материал, если поле пустое. Пустое поле становится остановкой выпуска, а не местом, куда модель допишет правдоподобное значение.

Что делать, когда справочника нет

Не начинать с генерации. Заполнение справочника — самостоятельная работа: примерно 6 минут на позицию для торговой компании с внешними поставщиками, то есть 200 часов на каталог в 2 000 позиций. Это дорого, но это единственные расходы, которые остаются вашими навсегда: справочник переживает и смену модели, и смену подрядчика. Полный расчёт — в статье про стоимость автоматизации контента.

Промежуточный вариант для тех, у кого справочник есть частично: подстановка включается для заполненных полей, а для незаполненных модель получает запрет упоминать характеристику вообще. Текст выходит беднее — и это правильный размен: отсутствующая характеристика стоит ноль, а выдуманная стоит возврат. Цена такого возврата в модельном интернет-магазине со средним чеком 4 800 ₽ и маржой 30 % — 2 840 ₽: 1 440 ₽ потерянной маржи плюс 1 400 ₽ обратной логистики.

Норматив времени: 12 минут против 25 на 3 000 знаков

Норматив нужен не для контроля редактора, а для того, чтобы посчитать, окупается ли сама разметка. Считаем на партии в 200 материалов по 3 000 знаков при полной стоимости часа редактора 900 ₽.

Партия 200 материалов по 3 000 знаков
Сплошная вычитка: 200 × 25 минут = 5 000 минут83 часа
Стоимость сплошной вычитки: 83 ч × 900 ₽74 700 ₽
Проверка по процедуре: 200 × 12 минут = 2 400 минут40 часов
Стоимость проверки по процедуре: 40 ч × 900 ₽36 000 ₽
Экономия на партии: 13 минут × 200 = 2 600 минут43 часа, 38 700 ₽
Разметка точек в шаблоне: инженер 6 ч × 3 000 ₽18 000 ₽ разово
ИтогоЭкономия 194 ₽ на материале. Разовые 18 000 ₽ возвращаются на 93-м материале — то есть меньше чем на половине первой же партии. Дальше разметка работает бесплатно, пока не меняется структура шаблона.

Двенадцать минут — не универсальная норма. На карточке товара в 900 знаков точек проверки 4–7, и проверка занимает 4–5 минут. На экспертной статье в 12 000 знаков их бывает 40–60, и никакая процедура не сведёт проверку меньше чем к 40 минутам. Замерьте своё число на десяти материалах: это полтора часа работы, которые дают основание для всех дальнейших расчётов. Как ставить такие замеры, разобрано в статье про то, как измерить эффект автоматизации.

Ошибка нашлась после публикации

Это не аварийная ситуация, а штатная: процедура снижает частоту ошибок, но не доводит её до нуля. Важно другое — цена одной и той же ошибки различается в сотни раз в зависимости от того, на какой стадии её нашли.

Где нашли ошибкуЧто нужно сделатьСтоимость
В шаблоне, до генерации партииПравка одной строки шаблона, 2 минуты30 ₽
В тексте, до публикацииПравка по помеченной точке, 45 секунд11 ₽
В одном опубликованном материалеПравка, проверка соседних материалов, ответ обратившимся: 40 минут600 ₽
В партии на 1 000 карточекПеределка 50 часов плюс возвраты за полтора месяца181 320 ₽

Порядок действий после публикации короткий, и его смысл — не в исправлении одного текста, а в том, чтобы не повторить тот же тип ошибки в следующей партии.

  1. 1Определите охват прежде, чем править. Первый вопрос — не «как исправить», а «сколько ещё материалов собраны тем же шаблоном». Ошибка почти никогда не единична: она в шаблоне или в строке справочника.
  2. 2Правьте источник, потом тексты. Если сначала выправить тексты, следующая сборка вернёт ошибку обратно, и её найдут уже клиенты.
  3. 3Отметьте тип, а не случай. В журнале разбора пишется не «в карточке 4471 был неверный материал», а «числовая характеристика попала в текст мимо справочника». Тип показывает, какое правило разметки не сработало.
  4. 4Проверьте, была ли точка помечена. Если да и её пропустили — вопрос к нагрузке редактора. Если нет — правило разметки надо расширять, и это работа инженера, а не разговор с человеком.
  5. 5Раз в квартал пересматривайте список типов. Он закрытый, но источники проверки меняются: обновилась площадка, сменился поставщик, изменилась норма. Полчаса работы, которые держат процедуру живой.
графикproverka-faktov-v-sgenerirovannom-tekste--03
Стоимость одной ошибки на четырёх стадиях: 30, 11, 600 и 181 320 рублей

Столбчатая диаграмма с логарифмической осью Y в рублях, четыре столбца: «В шаблоне» — 30 ₽, «В тексте до публикации» — 11 ₽, «В одном опубликованном материале» — 600 ₽, «В партии на 1 000 карточек» — 181 320 ₽. Между третьим и четвёртым столбцом вертикальная пунктирная линия с подписью «публикация партии». Ось Y подписана «логарифмическая шкала». Чертёжный стиль, подписи по-русски.

Цена ошибки растёт не постепенно, а скачком в момент публикации партии

Когда процедура не спасает и текст должен писать человек

У процедуры есть граница, и её важно знать заранее. Проверка ловит неверные утверждения. Она не ловит утверждений, которых в тексте нет, а должны быть, — и именно этим машинный черновик вредит там, где его читает специалист.

Чего проверка фактов не видит

Сгенерированный экспертный текст обычно фактически безупречен и профессионально пуст: в нём нет оговорок, исключений и деталей, по которым читатель узнаёт практика. Редактор проверит двенадцать точек, все сойдутся, а специалист закроет страницу на третьем абзаце. Пять таких случаев разобраны отдельно в статье про то, когда генерация вредит бренду; там же — три вопроса, по которым решение принимается до запуска.

Есть и обратная граница — когда процедура избыточна. Если материалов меньше сотни в год, разметка не окупится: порог, посчитанный выше, — 93 материала. Если все факты в тексте подставляются из справочника и модель отвечает только за связки, типов проверки остаётся четыре из шести, а время падает до 4–6 минут, и отдельная процедура превращается в обычную вычитку. И если текст в принципе не содержит проверяемых утверждений — поздравление, анонс события без цифр, — проверять там нечего, и требовать процедуру означает просто добавить шаг.

Главное, что стоит унести из этой статьи: проверка фактов — не признак недоверия к технологии, а часть её эксплуатации, такая же обязательная, как приёмка на любом другом участке. Отвечает за опубликованный текст компания, а не инструмент, которым он был набран, и никакая формулировка в договоре с подрядчиком этого не меняет. Как встроить проверку в общий маршрут согласования, разобрано в статье про согласование контента в компании.