Документы и знания

Поиск по архиву документов

Смысловой поиск по всем хранилищам компании с учётом прав доступа. Сотрудник задаёт вопрос обычным языком — и получает ответ с цитатой и ссылкой на первоисточник, а не двести файлов с похожими названиями.

поиск за 1–2 минуты вместо 15–20каждый ответ — с цитатой и ссылкойокупаемость 4–8 месяцев
Схема работы решения «Поиск по архиву документов»
Документы и знания · событие → проверка → действие
Поиск по архиву документов

Иллюстрация показывает рабочий контур направления; конкретные шаги и интеграции разобраны ниже.

Проблема

Как это выглядит без автоматизации

Архив компании старше пяти лет — это сотни тысяч файлов: СЭД, сетевые диски, SharePoint, почта, папки уволившихся сотрудников. Формально всё сохранено. Фактически найти можно только то, о чём помнишь, как оно называется и где лежит, — а помнят это два-три старожила.

Поиск держится на памяти людей, а не на системе

«Это у Сергея на диске», «спроси у снабжения, они переписывались» — типовой маршрут поиска. Когда носитель памяти в отпуске или уволился, документы фактически перестают существовать: они лежат на диске, но недостижимы.

Штатный поиск ищет слова в названиях, а не смысл

Файл «Договор_поставки_финал_v3» не найдётся по вопросу «какая неустойка у поставщика насосов». Сканы без текстового слоя — нередко треть архива — не ищутся вообще: для поиска это картинки.

Не нашли — сделали заново

После получаса безуспешного поиска специалисту проще пересоздать документ: расчёт, регламент, типовое КП. В архиве множатся версии-двойники, а компания оплачивает одну и ту же работу второй раз — по 3–5 часов на документ.

Медленный ответ стоит денег снаружи

Запрос аудитора, требование налоговой, претензия заказчика, вопрос тендерного комитета — везде срок. Когда подборка документов занимает два-три дня раскопок, компания платит просрочками, штрафами и проигранными спорами.

Во что это обходится: 30 специалистов × 2 поиска в день × 15 минут × 700 ₽/час ≈ 220 000 ₽ рабочего времени в месяц уходит на поиски — не считая документов, которые так и не нашли и сделали заново.

Что мы строим

Возможности системы

Мы строим поверх ваших хранилищ смысловой поиск на связке индексации, OCR и языковой модели. Документы остаются там, где лежат, — СЭД, диски, SharePoint. Система понимает вопрос как живой коллега, ищет только среди документов, доступных этому сотруднику, и отвечает с цитатой и ссылкой на первоисточник.

Понимает вопрос обычным языком

«Какой гарантийный срок на кровлю по объекту на Лесной», «наш типовой ответ на претензию по срокам» — не нужно вспоминать имя файла, папку и год. Поиск работает по смыслу: синонимы, аббревиатуры и опечатки ему не мешают.

Отвечает цитатой, а не списком из двухсот файлов

Ответ строится только на найденных фрагментах: рядом цитата, название документа, страница и ссылка на оригинал в исходной системе. Если ответа в архиве нет, система прямо говорит «не найдено» — выдумывать ей запрещено архитектурой.

Читает сканы

PDF без текстового слоя, сканы актов, факсы десятилетней давности проходят OCR при индексации и ищутся наравне с обычными файлами. Долю уверенно распознаваемых сканов оцениваем на вашей выборке до старта проекта.

Наследует права доступа

Сотрудник находит только то, что ему разрешено в исходных системах: кадровые документы не всплывают у менеджеров, чужие проекты — у подрядчиков. Вход через корпоративный SSO, каждый запрос фиксируется в журнале.

Ищет по всем хранилищам сразу

СЭД, сетевые папки, SharePoint, облачные диски и wiki подключаются коннекторами в единый индекс. Одно окно поиска вместо шести систем с разными логинами и шестью разными «не найдено».

Обновляется без ручной работы

Коннекторы отслеживают новые и изменённые файлы: документ появляется в поиске через минуты после сохранения. Удалённое и закрытое правами исчезает из выдачи автоматически.

— Вопрос: какой гарантийный срок на кровельные работы в договоре с подрядчиком по объекту «Лесная, 7»? — Ответ: 60 месяцев с даты подписания акта КС-11. Источник: договор подряда № 214-СМР от 12.03.2024, п. 9.2, стр. 14 — открыть в СЭД. — Связанные документы: допсоглашение № 2 о переносе сроков, гарантийное письмо подрядчика от февраля 2025.
Как это работает

Путь одного события через систему

Каждый шаг оставляет след в журнале: любое решение системы можно открыть и проверить — что пришло, что проверено, что сделано.

01

Коннекторы собирают архив

Подключаемся на чтение к СЭД, сетевым папкам, SharePoint и облачным дискам. Забираем файлы вместе с атрибутами и правами доступа: кто владелец, каким группам разрешено чтение.

02

Извлечение текста и распознавание

Из PDF, DOCX, XLSX и презентаций извлекается текст, сканы проходят OCR. Каждому документу присваиваются метаданные: тип, дата, контрагент, проект — по ним потом можно сужать поиск.

03

Смысловая индексация

Текст режется на фрагменты, каждый получает векторное представление — математический отпечаток смысла. Такой индекс находит близкое по значению, даже если слова в вопросе и в документе разные.

04

Вопрос — строго в рамках прав

Сотрудник входит через SSO и спрашивает как коллегу. Поиск отбирает релевантные фрагменты только среди документов, доступных именно этому пользователю, — фильтр прав срабатывает до генерации ответа.

05

Ответ с доказательством

Языковая модель формулирует ответ по найденным фрагментам и обязана указать источники: цитата, документ, страница, ссылка. Любой ответ проверяется в один клик по оригиналу.

06

Индекс живёт вместе с архивом

Новые и изменённые файлы попадают в индекс автоматически по событиям хранилища или расписанию. Журнал запросов показывает, что ищут сотрудники и на какие вопросы архив не отвечает.

Пошаговое внедрение

Что происходит по неделям

Каждый этап заканчивается результатом, который вы видите и принимаете. Оплата привязана к приёмке, а не к обещаниям.

1-я неделя

Инвентаризация архива

Составляем карту хранилищ: где что лежит, объёмы, форматы, доля сканов, кто чем пользуется. Выгружаем структуру прав из Active Directory и СЭД. Выбираем пилотный корпус — обычно 10–20 тысяч документов одного подразделения.

Карта архива с объёмами и правами, согласованный пилотный корпус и список из 30–50 реальных вопросов сотрудников для приёмки.
2–3-я недели

Пилотный индекс и поиск

Подключаем первый источник, прогоняем OCR на сканах, строим векторный индекс, поднимаем интерфейс поиска. Проверяем контрольные вопросы и измеряем долю точных ответов с корректной ссылкой.

Работающий поиск по пилотному корпусу: команда задаёт свои вопросы и видит ответы с цитатами. Отчёт по точности на контрольном списке.
4–5-я недели

Права доступа и SSO

Переносим модель прав исходных систем в поиск: группы AD, роли СЭД, доступы к папкам. Подключаем вход через корпоративный SSO. Прогоняем негативные тесты: сотрудник не должен увидеть чужой документ ни в ответе, ни в цитате, ни в подсказке.

Протокол проверки прав по ролям, принятый вашими ИТ и безопасностью. Вход по корпоративным учётным записям.
6–7-я недели

Полный архив и остальные источники

Масштабируем индексацию на весь согласованный объём, подключаем остальные хранилища. Настраиваем инкрементальное обновление: новые и изменённые документы попадают в индекс без ручных действий.

Весь архив в поиске, автообновление работает. Замер на полном объёме: типовой вопрос — ответ за секунды.
8-я неделя

Запуск и обучение

Встраиваем поиск туда, где работают люди: веб-интерфейс, кнопка в интранете, бот в корпоративном мессенджере. Обучаем сотрудников, настраиваем дашборд: частые вопросы, доля ответов без источника, активность по отделам.

Поиск в промышленной эксплуатации, у руководителя — статистика использования и качества ответов.
далее, в рамках поддержки

Сопровождение и развитие

Еженедельно разбираем вопросы, оставшиеся без ответа: пополняем отраслевые термины и синонимы, чиним источники, подключаем новые хранилища. Следим за расходом токенов и скоростью индексации.

Доля вопросов, закрытых с первого запроса, растёт от месяца к месяцу. Архив перестаёт зависеть от памяти старожилов.
Экономика

Модельный расчёт: из чего складывается эффект

Не «до 90% экономии», а конкретная модель с вводными, которые можно оспорить и пересчитать под себя.

Профиль примерапроектно-строительная компания, 60 человек в офисе
Архив150 000 файлов за 12 лет: СЭД, сетевой диск, SharePoint
Активно ищут документы30 специалистов: инженеры, сметчики, юристы, снабжение
Интенсивность2 поиска в день на специалиста, типовой поиск 15 минут
Ставка специалиста700 ₽/час (ФОТ с налогами)
ПоказательСейчасПосле внедрения
Типовой поиск документа15 минут, «потерянный» — часы1–2 минуты: вопрос — ответ с источником
Время специалистов на поиск≈ 315 часов в месяц≈ 40 часов в месяц
Поиски, закончившиеся ничемпримерно каждый пятыйменее 5%, каждый случай виден в журнале
Документы, сделанные заново6–8 в месяц по 3–5 часовединичные случаи
Новичок ориентируется в архиве2–3 недели вопросов коллегамс первого дня — источники подсказывает поиск
Денежный эффект+115 000 ₽/мес
Расходы на систему35 000 ₽/мес
Окупаемость внедрения5 месяцев
Модельный расчёт. Высвобождено ≈ 275 часов поиска в месяц (≈ 190 000 ₽ по ставке); в модель консервативно берём половину — 95 000 ₽, потому что не каждая сэкономленная минута превращается в полезную работу. Ещё ≈ 20 000 ₽ — 6–8 документов в месяц, которые перестали пересоздавать. Расходы: поддержка 25 000 ₽ плюс LLM-токены и сервер ≈ 10 000 ₽. Перед договором пересчитываем модель на ваших фактических цифрах — и если она не сходится, честно говорим об этом.
Стоимость

Полная цена владения — три составляющие

Никаких скрытых платежей: внешние сервисы вы оплачиваете напрямую по своим договорам, мы не делаем наценку на чужие тарифы.

разово · по этапам 20/30/30/20

Внедрение

180 000 – 600 000 ₽
  • типовой проект: 400 000 ₽
  • срок: 4–10 недель
  • диагностика, разработка, интеграции, пилот
  • документация и обучение команды
по факту · напрямую поставщикам

Эксплуатация

по потреблению
  • LLM-токены на ответы: 1–3 ₽ за вопрос; при 2 000 вопросов в месяц — 2 000–6 000 ₽
  • OCR сканов при первичной индексации: разово, десятые доли рубля за страницу в облачном OCR
  • Сервер и векторная база под индекс: 5 000–20 000 ₽/мес
  • On-premise LLM, если данные нельзя в облако: аренда GPU-сервера 30 000–150 000 ₽/мес
От чего зависит итоговая цена
  • число источников: каждый коннектор — СЭД, диск, SharePoint, wiki — отдельная работа
  • сложность модели прав: одна доменная группа или матрица по проектам и ролям
  • объём и качество сканов: доля документов без текстового слоя
  • контур размещения: облачная языковая модель или полностью on-premise
  • интерфейсы: веб-поиск, интранет, бот в мессенджере, кнопка внутри СЭД
Что потребуется от вас

Участие заказчика

На диагностике достаточно обезличенных примеров. Боевые доступы — только после договора и NDA, через защищённые каналы.

01доступ на чтение к хранилищам: сервисная учётная запись для СЭД, сетевых папок, SharePoint
02выгрузка структуры прав: группы Active Directory или роли СЭД — кто к каким разделам допущен
0330–50 реальных вопросов от сотрудников: по ним будем принимать качество поиска
04ответственный от ИТ: 2–3 часа в неделю на доступы, SSO и сервер в период внедрения
05решение по контуру: облачная модель или on-premise — влияет на бюджет и сроки
06выборка типовых сканов (50–100 страниц) для оценки качества распознавания до старта
Интеграции

С чем соединяем

Работаем с тем, что у вас уже есть. Если вашей системы нет в списке — скорее всего, подключимся через API: уточним на диагностике.

Directum RX1С:ДокументооборотELMA365DocsvisionMicrosoft SharePointБитрикс24.ДискЯндекс 360 (Диск)Nextcloud / ownCloudConfluenceсетевые папки (SMB/NFS)Active Directory / Keycloak (SSO)
Отраслевые сценарии

Как это решение работает в разных бизнесах

Строительство и девелопмент

Генподрядчик, 200 000 файлов по 40 объектам: проектная и исполнительная документация, акты скрытых работ, переписка с заказчиками. Сбор комплекта исполнительной перед сдачей занимал у инженера 2–3 дня; со смысловым поиском подборка по объекту и виду работ собирается за час, а на претензию заказчика юрист отвечает цитатой из журнала работ в тот же день.

Производство

Завод с 25-летним архивом чертежей, ТУ, техпроцессов и протоколов испытаний в пяти хранилищах. Выяснение «делали ли мы такой узел раньше» занимало у конструктора полдня, и нередко узел проектировали заново — 40–60 часов работы. Теперь прошлые решения находятся за минуты по описанию, а не по шифру изделия.

Юридические компании

Юридическая фирма, 80 000 документов по делам за десять лет. Позицию по похожему спору младший юрист раскапывал день; смысловой поиск поднимает аналогичные дела, аргументы и судебные акты за пять минут. При внутренней ставке 3 000 ₽/час экономия на одном деле — десятки тысяч рублей.

Управляющие компании и ЖКХ

УК на 120 домов: протоколы собраний, паспорта домов, акты, предписания надзора. Ответ на запрос жилинспекции требовал двух-трёх дней раскопок по папкам и рисковал просрочкой со штрафом; теперь специалист находит протокол и акт по адресу за минуты и укладывается в срок.

Бухгалтерские компании

Аутсорс-бухгалтерия: 90 клиентов, 300 000 файлов первички и договоров. Сбор документов по требованию ИФНС занимал день на клиента; поиск по контрагенту, периоду и типу документа собирает комплект за 20 минут — в сезон требований это высвобождает недели работы.

Вопросы владельцев

Что обычно спрашивают

Треть нашего архива — сканы без текстового слоя. Они будут искаться?
Да: при индексации сканы проходят OCR и дальше ищутся наравне с обычными файлами. Качество зависит от исходников — печатный текст распознаётся уверенно, рукописный и слепые факсы ограниченно. До старта прогоняем вашу выборку в 50–100 страниц и показываем честный процент распознавания.
Сотрудник сможет найти документы, которые ему видеть нельзя?
Нет. Права наследуются из исходных систем, и фильтр по доступам применяется до генерации ответа: недоступный документ не попадает ни в ответ, ни в цитаты, ни в похожие. Приёмка включает негативные тесты по ролям, а каждый запрос пишется в журнал — безопасность может проверить любой инцидент.
Языковая модель может придумать ответ, которого нет в документах?
Архитектура это ограничивает: модель отвечает только по найденным фрагментам и обязана приложить цитату со ссылкой. Если релевантных фрагментов нет, система отвечает «в архиве не найдено». Для скептиков остаётся режим классической выдачи — список документов без генерации.
Наши документы уйдут в чужое облако?
Зависит от выбранного контура. Базовый вариант — российские облачные модели (YandexGPT, GigaChat), при этом индекс и документы остаются на вашем сервере, в модель уходят только найденные фрагменты. Для конфиденциальных архивов ставим локальную модель на вашем железе: наружу не уходит ничего, к бюджету добавляется аренда GPU-сервера.
Чем это лучше поиска, который уже есть в СЭД и Windows?
Штатный поиск ищет точные слова в названиях и атрибутах: он не найдёт «неустойку» по слову «пеня», не заглянет в скан и вернёт двести файлов вместо ответа. Смысловой поиск понимает формулировку, читает содержимое всех форматов и отвечает цитатой. Разница видна на первом же вашем вопросе во время пилота.
Архив пополняется каждый день. Индекс не устареет?
Коннекторы отслеживают изменения: новые и отредактированные файлы попадают в индекс за минуты — по событиям хранилища или расписанию. Удалённые документы и отозванные доступы исчезают из выдачи при ближайшей синхронизации, обычно в тот же час.
говорим честно

Когда это решение не окупится

  • архив меньше ~10 000 файлов — хватит наведения порядка в папках и штатного поиска, внедрение не окупится
  • документы в основном рукописные или фото низкого качества — OCR даст слабый результат; честно покажем это на тестовой выборке до договора
  • бумажный архив без электронных копий — сначала оцифровка (сканеры и подрядчик по сканированию), мы делаем только программную часть
  • в исходных системах права розданы хаотично, «всем всё» — поиск честно унаследует этот хаос и обнажит его; сначала аудит доступов, потом внедрение
  • нужен поиск по чертежам как по геометрии или по 3D-моделям — мы ищем по тексту и атрибутам, не по графике

Если на диагностике расчёт не сойдётся — мы предложим более простой вариант или честно скажем, что автоматизация вам пока не нужна. Это дешевле для всех, чем проект ради проекта.

часто внедряют вместе
Документы и знания

Классификация документов

Система читает каждый входящий файл и за секунды определяет, что это — счёт, акт, договор, претензия, заявление, — находит контрагента и отправляет документ по нужному маршруту. Сомнительное уходит оператору на экран верификации, а не в общую кучу.

от 150 000 ₽4–8 недель
Документы и знания

Извлечение данных из договоров

Система читает договоры и допсоглашения, извлекает стороны, суммы, сроки, обязательства, условия пролонгации и штрафы — и сама ведёт реестр с контрольными датами. Каждое значение в карточке — со ссылкой на пункт документа, каждый срок — с напоминанием ответственному.

от 150 000 ₽4–8 недель
Поддержка клиентов

Корпоративная база знаний

ИИ-поиск по регламентам, инструкциям и документам компании: сотрудник задаёт вопрос в привычном чате и получает ответ с точной цитатой и ссылкой на источник. Права доступа — по ролям: каждый видит только своё.

от 250 000 ₽5–10 недель
Первый шаг — диагностика

Посчитать «Поиск по архиву документов» на ваших цифрах?

Пришлите объёмы и пару примеров — вернёмся с картой процесса, честным расчётом экономики и точной сметой. Если не сойдётся — так и скажем.

Голосовое описание задачи превращается в карту процесса и план внедрения
Можно голосом: запишите сообщение прямо в форме — расшифруем и разберём сами
NDA по запросу до передачи любых данных
Смета и план этапов — до договора, оплата только по принятым этапам
Ответ живого инженера, а не менеджера по продажам