Блог

AI Document Processing: production-пайплайн от файла до данных в ERP

Архитектура IDP для счетов, договоров и сканов: ingestion, OCR, классификация, извлечение полей, валидация, confidence, human review и экспорт в CRM/ERP.

2026-07-25

IDP — это workflow, а не одна модель

Intelligent Document Processing превращает неструктурированный файл в проверенные данные и бизнес-действие. Пайплайн включает приём документа, проверку типа и безопасности, OCR, классификацию, извлечение полей, правила валидации, human review и запись в CRM, ERP или систему документооборота.

LLM помогает с разными макетами и описательными полями, но не заменяет OCR и бухгалтерские правила. ИНН, сумма, валюта и согласованность позиций должны проходить детерминированные проверки. Система обязана уметь остановить документ, а не генерировать отсутствующее значение.

Ingestion и подготовка документа

Источниками служат upload, e-mail, сканер, API или папка обмена. Каждый файл получает document_id, checksum, tenant, источник и timestamp. Антивирусная проверка, лимит размера, определение MIME и дедупликация выполняются до основного процесса.

Preprocessing повышает качество: поворот страниц, deskew, удаление шума, разделение пакета и обнаружение пустых страниц. Оригинал остаётся неизменным в storage, а производные артефакты версионируются. Результат можно воспроизвести после смены модели или правил.

OCR, klasyfikacja i ekstrakcja

OCR возвращает текст вместе с координатами на странице и confidence. Классификатор определяет тип, а extractor применяет его схему: у счёта есть поставщик, даты, суммы и позиции; у договора — стороны, срок, обязательства и условия. Один универсальный prompt для всех документов трудно тестировать, и он обычно снижает качество.

Результат извлечения должен содержать значение, confidence, страницу и область источника. Рецензенту нужно видеть происхождение поля. Для таблиц сохраняют связь строк и контрольные суммы, а не рассматривают каждое число как независимый фрагмент текста.

Walidacja i human-in-the-loop

Валидация объединяет синтаксические и бизнес-правила: формат ИНН, сумма нетто + НДС = брутто, разрешённая валюта, поставщик в справочнике, заказ в ERP и отсутствие дубликата счёта. Confidence модели — лишь один сигнал; уверенно прочитанное значение может быть невозможно по бизнес-логике.

В очередь human review попадают документы с низким confidence, конфликтом правил или высоким финансовым риском. Интерфейс показывает изображение, выделенный источник и предлагаемое значение. Исправления сохраняются как evaluation data, но не должны автоматически обучать модель без контроля качества.

Eksport, audyt i metryki

После подтверждения adapter записывает данные в целевую систему с idempotency key. Статусы received, processing, review, approved, exported и failed позволяют продолжить pipeline после сбоя. Audit log связывает документ, версии моделей, правила, правки пользователя и идентификатор записи ERP.

Измеряйте field accuracy по типам полей, document straight-through-processing rate, долю review, время обработки, стоимость документа и ошибки экспорта. Одна точность OCR не описывает ценность: бизнесу нужна корректная запись в ERP и возможность быстро объяснить каждое значение.

Частые вопросы

Может ли LLM заменить OCR?
Не в каждом pipeline. Мультимодальные модели помогают со сложными макетами, но production IDP всё равно нужны координаты, confidence, валидация и воспроизводимое чтение.
Когда документ должен попасть к человеку?
При низкой уверенности, конфликте правил, неизвестном типе или высоком финансовом риске. Порог следует различать по полям и процессам.
Как предотвратить двойное проведение документа?
Использовать checksum, бизнес-ключи, проверку дубликатов в ERP и idempotency key при экспорте.

Имя и контакт — этого достаточно для первого шага. Описание задачи необязательно.