Поиск по архиву документов
Смысловой поиск по всем хранилищам компании с учётом прав доступа. Сотрудник задаёт вопрос обычным языком — и получает ответ с цитатой и ссылкой на первоисточник, а не двести файлов с похожими названиями.

Иллюстрация показывает рабочий контур направления; конкретные шаги и интеграции разобраны ниже.
Как это выглядит без автоматизации
Архив компании старше пяти лет — это сотни тысяч файлов: СЭД, сетевые диски, SharePoint, почта, папки уволившихся сотрудников. Формально всё сохранено. Фактически найти можно только то, о чём помнишь, как оно называется и где лежит, — а помнят это два-три старожила.
Поиск держится на памяти людей, а не на системе
«Это у Сергея на диске», «спроси у снабжения, они переписывались» — типовой маршрут поиска. Когда носитель памяти в отпуске или уволился, документы фактически перестают существовать: они лежат на диске, но недостижимы.
Штатный поиск ищет слова в названиях, а не смысл
Файл «Договор_поставки_финал_v3» не найдётся по вопросу «какая неустойка у поставщика насосов». Сканы без текстового слоя — нередко треть архива — не ищутся вообще: для поиска это картинки.
Не нашли — сделали заново
После получаса безуспешного поиска специалисту проще пересоздать документ: расчёт, регламент, типовое КП. В архиве множатся версии-двойники, а компания оплачивает одну и ту же работу второй раз — по 3–5 часов на документ.
Медленный ответ стоит денег снаружи
Запрос аудитора, требование налоговой, претензия заказчика, вопрос тендерного комитета — везде срок. Когда подборка документов занимает два-три дня раскопок, компания платит просрочками, штрафами и проигранными спорами.
Во что это обходится: 30 специалистов × 2 поиска в день × 15 минут × 700 ₽/час ≈ 220 000 ₽ рабочего времени в месяц уходит на поиски — не считая документов, которые так и не нашли и сделали заново.
Возможности системы
Мы строим поверх ваших хранилищ смысловой поиск на связке индексации, OCR и языковой модели. Документы остаются там, где лежат, — СЭД, диски, SharePoint. Система понимает вопрос как живой коллега, ищет только среди документов, доступных этому сотруднику, и отвечает с цитатой и ссылкой на первоисточник.
Понимает вопрос обычным языком
«Какой гарантийный срок на кровлю по объекту на Лесной», «наш типовой ответ на претензию по срокам» — не нужно вспоминать имя файла, папку и год. Поиск работает по смыслу: синонимы, аббревиатуры и опечатки ему не мешают.
Отвечает цитатой, а не списком из двухсот файлов
Ответ строится только на найденных фрагментах: рядом цитата, название документа, страница и ссылка на оригинал в исходной системе. Если ответа в архиве нет, система прямо говорит «не найдено» — выдумывать ей запрещено архитектурой.
Читает сканы
PDF без текстового слоя, сканы актов, факсы десятилетней давности проходят OCR при индексации и ищутся наравне с обычными файлами. Долю уверенно распознаваемых сканов оцениваем на вашей выборке до старта проекта.
Наследует права доступа
Сотрудник находит только то, что ему разрешено в исходных системах: кадровые документы не всплывают у менеджеров, чужие проекты — у подрядчиков. Вход через корпоративный SSO, каждый запрос фиксируется в журнале.
Ищет по всем хранилищам сразу
СЭД, сетевые папки, SharePoint, облачные диски и wiki подключаются коннекторами в единый индекс. Одно окно поиска вместо шести систем с разными логинами и шестью разными «не найдено».
Обновляется без ручной работы
Коннекторы отслеживают новые и изменённые файлы: документ появляется в поиске через минуты после сохранения. Удалённое и закрытое правами исчезает из выдачи автоматически.
Путь одного события через систему
Каждый шаг оставляет след в журнале: любое решение системы можно открыть и проверить — что пришло, что проверено, что сделано.
Коннекторы собирают архив
Подключаемся на чтение к СЭД, сетевым папкам, SharePoint и облачным дискам. Забираем файлы вместе с атрибутами и правами доступа: кто владелец, каким группам разрешено чтение.
Извлечение текста и распознавание
Из PDF, DOCX, XLSX и презентаций извлекается текст, сканы проходят OCR. Каждому документу присваиваются метаданные: тип, дата, контрагент, проект — по ним потом можно сужать поиск.
Смысловая индексация
Текст режется на фрагменты, каждый получает векторное представление — математический отпечаток смысла. Такой индекс находит близкое по значению, даже если слова в вопросе и в документе разные.
Вопрос — строго в рамках прав
Сотрудник входит через SSO и спрашивает как коллегу. Поиск отбирает релевантные фрагменты только среди документов, доступных именно этому пользователю, — фильтр прав срабатывает до генерации ответа.
Ответ с доказательством
Языковая модель формулирует ответ по найденным фрагментам и обязана указать источники: цитата, документ, страница, ссылка. Любой ответ проверяется в один клик по оригиналу.
Индекс живёт вместе с архивом
Новые и изменённые файлы попадают в индекс автоматически по событиям хранилища или расписанию. Журнал запросов показывает, что ищут сотрудники и на какие вопросы архив не отвечает.
Что происходит по неделям
Каждый этап заканчивается результатом, который вы видите и принимаете. Оплата привязана к приёмке, а не к обещаниям.
Инвентаризация архива
Составляем карту хранилищ: где что лежит, объёмы, форматы, доля сканов, кто чем пользуется. Выгружаем структуру прав из Active Directory и СЭД. Выбираем пилотный корпус — обычно 10–20 тысяч документов одного подразделения.
Пилотный индекс и поиск
Подключаем первый источник, прогоняем OCR на сканах, строим векторный индекс, поднимаем интерфейс поиска. Проверяем контрольные вопросы и измеряем долю точных ответов с корректной ссылкой.
Права доступа и SSO
Переносим модель прав исходных систем в поиск: группы AD, роли СЭД, доступы к папкам. Подключаем вход через корпоративный SSO. Прогоняем негативные тесты: сотрудник не должен увидеть чужой документ ни в ответе, ни в цитате, ни в подсказке.
Полный архив и остальные источники
Масштабируем индексацию на весь согласованный объём, подключаем остальные хранилища. Настраиваем инкрементальное обновление: новые и изменённые документы попадают в индекс без ручных действий.
Запуск и обучение
Встраиваем поиск туда, где работают люди: веб-интерфейс, кнопка в интранете, бот в корпоративном мессенджере. Обучаем сотрудников, настраиваем дашборд: частые вопросы, доля ответов без источника, активность по отделам.
Сопровождение и развитие
Еженедельно разбираем вопросы, оставшиеся без ответа: пополняем отраслевые термины и синонимы, чиним источники, подключаем новые хранилища. Следим за расходом токенов и скоростью индексации.
Модельный расчёт: из чего складывается эффект
Не «до 90% экономии», а конкретная модель с вводными, которые можно оспорить и пересчитать под себя.
| Показатель | Сейчас | После внедрения |
|---|---|---|
| Типовой поиск документа | 15 минут, «потерянный» — часы | 1–2 минуты: вопрос — ответ с источником |
| Время специалистов на поиск | ≈ 315 часов в месяц | ≈ 40 часов в месяц |
| Поиски, закончившиеся ничем | примерно каждый пятый | менее 5%, каждый случай виден в журнале |
| Документы, сделанные заново | 6–8 в месяц по 3–5 часов | единичные случаи |
| Новичок ориентируется в архиве | 2–3 недели вопросов коллегам | с первого дня — источники подсказывает поиск |
Полная цена владения — три составляющие
Никаких скрытых платежей: внешние сервисы вы оплачиваете напрямую по своим договорам, мы не делаем наценку на чужие тарифы.
Внедрение
- типовой проект: 400 000 ₽
- срок: 4–10 недель
- диагностика, разработка, интеграции, пилот
- документация и обучение команды
Поддержка
- мониторинг и реагирование по SLA
- исправление дефектов бесплатно
- обновление сценариев и интеграций
- ежемесячный отчёт о работе системы
Эксплуатация
- LLM-токены на ответы: 1–3 ₽ за вопрос; при 2 000 вопросов в месяц — 2 000–6 000 ₽
- OCR сканов при первичной индексации: разово, десятые доли рубля за страницу в облачном OCR
- Сервер и векторная база под индекс: 5 000–20 000 ₽/мес
- On-premise LLM, если данные нельзя в облако: аренда GPU-сервера 30 000–150 000 ₽/мес
- число источников: каждый коннектор — СЭД, диск, SharePoint, wiki — отдельная работа
- сложность модели прав: одна доменная группа или матрица по проектам и ролям
- объём и качество сканов: доля документов без текстового слоя
- контур размещения: облачная языковая модель или полностью on-premise
- интерфейсы: веб-поиск, интранет, бот в мессенджере, кнопка внутри СЭД
Участие заказчика
На диагностике достаточно обезличенных примеров. Боевые доступы — только после договора и NDA, через защищённые каналы.
С чем соединяем
Работаем с тем, что у вас уже есть. Если вашей системы нет в списке — скорее всего, подключимся через API: уточним на диагностике.
Как это решение работает в разных бизнесах
Генподрядчик, 200 000 файлов по 40 объектам: проектная и исполнительная документация, акты скрытых работ, переписка с заказчиками. Сбор комплекта исполнительной перед сдачей занимал у инженера 2–3 дня; со смысловым поиском подборка по объекту и виду работ собирается за час, а на претензию заказчика юрист отвечает цитатой из журнала работ в тот же день.
Завод с 25-летним архивом чертежей, ТУ, техпроцессов и протоколов испытаний в пяти хранилищах. Выяснение «делали ли мы такой узел раньше» занимало у конструктора полдня, и нередко узел проектировали заново — 40–60 часов работы. Теперь прошлые решения находятся за минуты по описанию, а не по шифру изделия.
Юридическая фирма, 80 000 документов по делам за десять лет. Позицию по похожему спору младший юрист раскапывал день; смысловой поиск поднимает аналогичные дела, аргументы и судебные акты за пять минут. При внутренней ставке 3 000 ₽/час экономия на одном деле — десятки тысяч рублей.
УК на 120 домов: протоколы собраний, паспорта домов, акты, предписания надзора. Ответ на запрос жилинспекции требовал двух-трёх дней раскопок по папкам и рисковал просрочкой со штрафом; теперь специалист находит протокол и акт по адресу за минуты и укладывается в срок.
Аутсорс-бухгалтерия: 90 клиентов, 300 000 файлов первички и договоров. Сбор документов по требованию ИФНС занимал день на клиента; поиск по контрагенту, периоду и типу документа собирает комплект за 20 минут — в сезон требований это высвобождает недели работы.
Что обычно спрашивают
Треть нашего архива — сканы без текстового слоя. Они будут искаться?
Сотрудник сможет найти документы, которые ему видеть нельзя?
Языковая модель может придумать ответ, которого нет в документах?
Наши документы уйдут в чужое облако?
Чем это лучше поиска, который уже есть в СЭД и Windows?
Архив пополняется каждый день. Индекс не устареет?
Когда это решение не окупится
- архив меньше ~10 000 файлов — хватит наведения порядка в папках и штатного поиска, внедрение не окупится
- документы в основном рукописные или фото низкого качества — OCR даст слабый результат; честно покажем это на тестовой выборке до договора
- бумажный архив без электронных копий — сначала оцифровка (сканеры и подрядчик по сканированию), мы делаем только программную часть
- в исходных системах права розданы хаотично, «всем всё» — поиск честно унаследует этот хаос и обнажит его; сначала аудит доступов, потом внедрение
- нужен поиск по чертежам как по геометрии или по 3D-моделям — мы ищем по тексту и атрибутам, не по графике
Если на диагностике расчёт не сойдётся — мы предложим более простой вариант или честно скажем, что автоматизация вам пока не нужна. Это дешевле для всех, чем проект ради проекта.
Классификация документов
Система читает каждый входящий файл и за секунды определяет, что это — счёт, акт, договор, претензия, заявление, — находит контрагента и отправляет документ по нужному маршруту. Сомнительное уходит оператору на экран верификации, а не в общую кучу.
Документы и знанияИзвлечение данных из договоров
Система читает договоры и допсоглашения, извлекает стороны, суммы, сроки, обязательства, условия пролонгации и штрафы — и сама ведёт реестр с контрольными датами. Каждое значение в карточке — со ссылкой на пункт документа, каждый срок — с напоминанием ответственному.
Поддержка клиентовКорпоративная база знаний
ИИ-поиск по регламентам, инструкциям и документам компании: сотрудник задаёт вопрос в привычном чате и получает ответ с точной цитатой и ссылкой на источник. Права доступа — по ролям: каждый видит только своё.
