Найти похожее дело за минуту можно, если в архиве есть три вещи: карточка дела с типом спора и результатом, распознанный текст всех документов и правило, по которому дело вообще попадает в архив. Технология поиска здесь третья по важности — первыми идут карточка и правило. Фирмы, которые начинают с покупки поисковой системы и пропускают эти два шага, получают быстрый поиск по свалке.
Задача выглядит буднично: специалист берёт новое дело и хочет понять, вела ли фирма похожее. Это не «найди договор поставки» — такой запрос закрывается реестром договоров, и мы разбирали его в материале про поиск по архиву договоров. Здесь другой вопрос: был ли у нас спор такого типа и чем он закончился. Ответ лежит не в одном документе, а в связке «дело — позиция — исход».
Ниже — три уровня поиска с ценой каждого, карточка дела как предусловие, отдельный разговор про сканы и права доступа, модельная смета на архив в 620 дел и 4 000 документов и список ситуаций, где всё это не нужно.
Что на самом деле ищут в архиве дел
Разница между поиском по договорам и поиском по делам — в единице хранения. В реестре договоров единица — документ: «где у нас пункт про ответственность за просрочку». В архиве дел единица — дело целиком: «вели ли мы спор с застройщиком по качеству работ на сумму около пяти миллионов и чем он закончился». Полнотекстовый индекс на такой запрос отвечает плохо — слова «застройщик» и «качество работ» встречаются в сотнях документов, а сумма спора и исход в тексте обычно не написаны вообще. Их надо хранить отдельно, в карточке дела.
- «Было ли похожее». Самый частый и самый ценный запрос: специалист хочет не документ, а прецедент внутри фирмы. Закрывается атрибутами карточки, а не текстом.
- «Что мы тогда написали». Нужен конкретный документ внутри дела — жалоба, отзыв, расчёт. Закрывается полнотекстовым поиском.
- «Какая у фирмы позиция по этому вопросу». Это уже не архив, а корпоративная база знаний: архив хранит то, что было, база знаний — то, как фирма считает правильным.
Три уровня поиска и цена каждого
Уровни складываются: второй строится поверх первого, третий — поверх второго. Продавать их как альтернативу друг другу некорректно, и это первый признак, по которому стоит проверять коммерческое предложение.
| Уровень | Что находит | Чего не находит | Цена и срок |
|---|---|---|---|
| 1. Атрибутивный поиск по карточке дела | Дела по типу спора, отрасли, сумме, инстанции, результату, году, ответственному | Ничего внутри документов: формулировку, расчёт, довод | 90 000–160 000 ₽, 2–3 недели |
| 2. Полнотекстовый индекс с распознаванием сканов | Точные формулировки и словосочетания внутри всех документов дела | Смысловые запросы: синонимы, переформулировки, «похожая ситуация» | 150 000–250 000 ₽ с распознаванием, 3–5 недель |
| 3. Векторный слой поиска по смыслу | Похожие по сути дела и фрагменты, даже если слова другие | Гарантированную полноту: часть релевантного в ответ не попадает | 250 000–450 000 ₽ поверх готового индекса, 4–6 недель |
Уровни 2 и 3 вместе дают ту же вилку 400 000–700 000 ₽, что и для поиска по договорам, но здесь векторный слой берут далеко не всегда: большую часть смысловых запросов закрывает первый уровень, потому что тип спора, отрасль и сумма уже разложены по полям. Векторный поиск нужен там, где типология не укладывается в конечный список значений, — в консалтинге и проектном инжиниринге, где двух одинаковых проектов не бывает.
Сравнение в три вертикальные колонки, поставленные ступенями снизу вверх. Нижняя ступень: «Атрибутивный поиск по карточке — 90 000–160 000 ₽, 2–3 недели», находит «тип спора, отрасль, сумма, инстанция, результат». Средняя: «Полнотекстовый индекс с распознаванием — 150 000–250 000 ₽, 3–5 недель», находит «точные формулировки внутри документов». Верхняя: «Векторный слой по смыслу — 250 000–450 000 ₽, 4–6 недель», находит «похожее по сути, другими словами». Сбоку сквозная подпись: «в сумме уровни 2 и 3 — те же 400 000–700 000 ₽». Под нижней ступенью широкое основание с подписью «карточка дела — без неё не работает ни один уровень».
Карточка дела: предусловие, о котором молчат
Структурированное описание дела отдельно от его документов: тип спора или задачи, отрасль клиента, сумма требований, инстанция, команда дела, дата открытия и закрытия, результат и одна-две строки «что оказалось решающим». Это шесть-девять полей со списками значений, а не свободный текст. Именно карточка превращает архив из хранилища файлов в базу опыта фирмы.
Карточка даёт атрибутивный поиск — тот самый первый уровень — и то, чего нет ни в одном документе: исход. Ни в жалобе, ни в отзыве не написано, чем всё кончилось, а именно это определяет, стоит ли брать старое дело за образец.
Для новых дел карточка заводится при открытии и стоит две минуты работы помощника. Для старых её надо заполнить задним числом, и это ручной труд: тип спора и сумму система вытащит из документов с точностью около 70 %, а результат и «что оказалось решающим» — нет, потому что этого в документах не написано.
Сто часов — это две недели выделенной работы одного человека, и планировать их надо отдельной строкой с ответственным, иначе разметка растянется на полгода. Размечать стоит не по хронологии, а по практикам: сначала та, где чаще всего спрашивают «было ли похожее». Оставшиеся 120 дел — закрытая практика, устаревшее регулирование, ушедшие клиенты — не размечаются вовсе: они остаются в полнотекстовом индексе, но не разбавляют выдачу «покажи похожие».
Сканы без текстового слоя и права доступа
В архиве фирмы, которому шесть лет, примерно треть документов — сканы и фотографии без текстового слоя: определения судов, входящая корреспонденция, подписанные экземпляры. В модельном примере это 1 400 документов из 4 000. Для полнотекстового поиска их надо распознать. Российские системы обработки документов — Content AI, Smart Engines, 1С:Распознавание первичных документов — с этим справляются, но качество зависит от исходника гораздо сильнее, чем обещает любая презентация.
| Тип исходника | Доля в архиве | Ошибок распознавания | Что с этим делать |
|---|---|---|---|
| Электронный документ с текстовым слоем | 65 % | 0 % | Индексируется как есть |
| Чистый скан 300 dpi | 20 % | 1–3 % символов | Индексируется, выборочный контроль |
| Копия копии, печати поверх текста, факс | 10 % | 8–15 % символов | Помечается флагом «низкое качество» |
| Рукописные пометки и резолюции | 5 % | распознаётся ненадёжно | Не индексируется, остаётся картинкой |
Выборочный контроль — обязательная часть работы: 5 % распознанных документов, то есть 70 штук из 1 400, проверяет человек по 4 минуты каждый. Эти пять часов показывают, где именно система ошибается. Документы с флагом «низкое качество» выдаются с явной пометкой — специалист видит, что тексту доверять нельзя, и открывает оригинал.
Опасность здесь не в том, что специалист откроет чужое дело: обычно ему хватит и одной строки результата. Список «у фирмы есть три похожих спора с этим контрагентом» сам по себе является информацией, которую нельзя показывать тому, кто не входит в команду дела, и уж точно нельзя показывать по клиенту-конкуренту. Поэтому фильтр по команде дела применяется до ранжирования, а не прячет строки после. Разница видна в интерфейсе: во втором случае пользователь видит «найдено 12, доступно 3» — и уже знает, что девять есть.
- Матрица доступа строится по делам, а не по папкам: у дела есть команда, у практики — партнёр, у клиента — ограничение по конфликту интересов.
- Счётчики и подсказки фильтруются вместе с результатами: автодополнение запроса не должно подсказывать имя контрагента из недоступного дела.
- Журнал запросов хранится не меньше года: кто, что искал, что открывал. Он же понадобится, если клиент попросит подтвердить, что его материалы никто посторонний не смотрел. Роль с доступом ко всему архиву нужна одному-двум людям и логируется жёстче остальных.
- Если поверх архива ставится языковая модель, вопрос «где она физически считает» становится обязательным — мы разбирали границы допустимого в материале про конфиденциальность клиентских данных и ИИ.
Горизонтальная схема из шести блоков со стрелками слева направо: «Запрос специалиста» → «Фильтр: команда дела, практика, конфликт интересов» → «Атрибутивный поиск по карточкам» и параллельно «Полнотекстовый индекс (4 000 документов, из них 1 400 распознано)» → «Ранжирование» → «Результат: карточка дела + цитата + пометка о качестве скана». Снизу отдельная ветка от блока фильтра вниз к прямоугольнику «Журнал запросов, хранение от года». Красной штриховкой перечёркнута пунктирная стрелка в обход фильтра с подписью «фильтрация после ранжирования — так нельзя».
Модельный расчёт: 15 специалистов и архив 4 000 документов
Модельная фирма: 15 практикующих специалистов, архив 620 дел за шесть лет, 4 000 документов, из них 1 400 без текстового слоя. Строится первый и второй уровни — атрибутивный поиск по карточкам и полнотекстовый индекс. Векторный слой не берётся: типология практики укладывается в списки значений.
| Статья сметы | Стоимость | Срок |
|---|---|---|
| Инвентаризация архива, правило именования и попадания дела в архив | 40 000 ₽ | 1 неделя |
| Карточка дела и заполнение задним числом на 500 делах | 90 000 ₽ | 2–3 недели |
| Распознавание 1 400 сканов и выборочный контроль 70 документов | 60 000 ₽ | 1–2 недели |
| Полнотекстовый индекс и поиск в интерфейсе | 110 000 ₽ | 2 недели |
| Права доступа по клиентам и практикам, журнал запросов | 55 000 ₽ | 1 неделя |
| Итого разово (работы идут с перекрытием) | 355 000 ₽ | 4–6 недель |
| Поддержка: обновление индекса, доступы, разбор жалоб на выдачу | 15 000 ₽/мес | — |
Теперь эффект. Считать его надо в часах, которые фирма сейчас не может выставить клиенту, — это и есть настоящая цена плохого архива. В модельной фирме каждый специалист обращается к архиву около 26 раз в месяц, то есть 390 обращений на фирму. Среднее время одного поиска — 22 минуты: посмотреть в папках, не найти, спросить у того, кто вёл, дождаться ответа.
Одну треть в этом расчёте надо объяснить, потому что именно её обычно и завышают. Из 91 освободившегося часа часть уходит не в счета, а в раньше законченный рабочий день и в задачи, которые никому не выставляются: внутренние согласования, подготовка к встрече, обучение. Планировать конверсию выше трети можно только там, где у фирмы есть очередь работы, которую некому взять, — иначе освободившиеся часы просто исчезают. Как считать такую окупаемость честно, мы разбирали в отдельном материале про окупаемость автоматизации.
Второй эффект — повторное использование наработок — мы в окупаемость не кладём намеренно. Он реален: найденное похожее дело экономит 3–4 часа подготовки, и таких находок в модельной фирме набирается 25–35 в месяц. Но измерить его без спорных допущений нельзя — неизвестно, сколько из этих часов специалист всё равно потратил бы, просто иначе. Если подрядчик считает окупаемость через повторное использование, попросите показать, как он отделил его от обычной экономии времени.
Когда хватит папок и правила именования
Проект на 355 000 ₽ окупается не у всех, и проверить это можно до первого разговора с подрядчиком. Есть четыре ситуации, в которых мы сами советуем поставить дисциплину вместо системы.
- Архив меньше 300 дел, один тип практики, три-четыре специалиста. Все всё помнят, а поиск занимает минуты, потому что дел мало. Здесь работает единая структура папок и правило именования — «год / клиент / номер дела / тип документа», — плюс полчаса на приведение архива к нему.
- Дела не повторяются. Если каждый проект уникален по составу работ и старый почти никогда не годится в образец, ценность архива падает до хранения обязательств. Тогда нужен реестр договоров и сроков, а не поиск по смыслу.
- Архив не в порядке физически. Если половина документов лежит на личных дисках специалистов и в почте, поиск построить не на чем: индекс покажет только то, что успели собрать. Сначала сбор в одно место, и это отдельная работа — мы описывали её в материале про подготовку данных перед внедрением.
- Нет владельца карточки. Если никто в фирме не отвечает за то, что у закрытого дела заполнен результат, карточки перестанут заполняться на третий месяц, и через год поиск снова будет искать по свалке — только за 355 000 ₽.
И последнее про очередь работ. Поиск по архиву не входит в девять базовых узлов работы фирмы — он надстраивается над карточкой дела. В разборе автоматизации юридической фирмы он выходит на первое место только у фирмы на 40–50 человек, где два специалиста из соседних практик пишут одно и то же и не знают об этом. На пятнадцати он окупается, но встаёт в очередь после учёта часов, контроля сроков и сборки документов — кроме случая, когда практика повторяющаяся и каждое новое дело похоже на десяток старых.
Архив хранит не документы, а ответ на вопрос «чем это тогда кончилось». Ответа нет ни в одном файле — его надо записать отдельно.
