Обработка документов

Обработка документов (англ. document processing) — область научных исследований и совокупность производственных процессов, направленных на перевод аналогового документа в цифровую форму. Обработка документов включает не только фотографирование или сканирование документа для получения цифрового изображения, но и обеспечение его цифровой интерпретируемости. Это предполагает извлечение структуры документа или выполнения разметки макета, а затем содержимого, представленное в виде текста или изображений. В процессе могут быть задействованы традиционные алгоритмы компьютерного зрения, свёрточные нейронные сети или ручной труд. Среди решаемых задач — семантическая сегментация, обнаружение объектов, оптическое распознавание символов (OCR), распознавание рукописного текста (HTR) и, шире, транскрипция — как автоматическая, так и ручная[1]. Термин также может включать этап оцифровки документа с помощью сканера и стадию интерпретации, например, с использованием технологий обработки естественного языка (NLP) или классификации изображений. Обработка документов широко применяется в различных отраслях промышленности и науки для оптимизации административных процессов, обработки корреспонденции, а также оцифровки аналоговых архивов и исторических документов.

Предпосылки

Обработка документов изначально, и до некоторой степени до сих пор, представляет собой разновидность конвейерной работы, связанной с обработкой различных документов, таких как письма и посылки, с целью сортировки, извлечения или массового извлечения данных. Эта работа может выполняться штатными силами или посредством аутсорсинга бизнес-процессов[2][3]. Обработка документов может предполагать и внешний ручной труд, например с помощью платформ наподобие Mechanical Turk.

Примером ручной обработки документов может служить работа по рассмотрению «миллионов заявок на визы и гражданство» в 2007 году[4], при которой около тысячи подрядных работников занимались «управлением почтовым отделением и вводом данных».

Хотя обработка документов предусматривала ручной ввод данных задолго до появления компьютерной мыши или компьютерного сканера, статья 1990 года в газете «The New York Times», посвящённая концепции «безбумажного офиса», отмечала, что «обработка документов начинается со сканирования»[5]. В этом контексте бывший вице-президент Xerox Пол Страссманн выразил критическую точку зрения, заявив, что компьютеры не снижают, а увеличивают объёмы бумажных документов в офисе[5]. Отмечалось, что инженерные и технические документы по эксплуатации самолёта могут весить «больше, чем сам самолёт».

Автоматическая обработка документов

С развитием текущего уровня данной области обработка документов перешла на уровень представления «компонентов документов как сущностей базы данных»[6].

Технология автоматической обработки документов, иногда также называемая интеллектуальной обработкой документов (IDP), возникла как специфическая форма интеллектуальной автоматизации процессов (IPA), объединяя искусственный интеллект, такие как машинное обучение (ML), обработка естественного языка (NLP) и интеллектуальное распознавание символов (ICE) для извлечения данных из различных типов документов[7][8]. Современные системы автоматической обработки документов (Intelligent Document Processing) позволяют обрабатывать неструктурированные данные с меньшим количеством исключений и на более высоких скоростях[9].

Применение

Автоматическая обработка документов применяется ко множеству документов независимо от их структуры. В частности, в бизнесе и финансах такие технологии используют для работы с бумажными счетами-фактурами, бланками, заказами на закупку, контрактами и купюрами[10]. Финансовые организации используют интеллектуальные системы для обработки больших объёмов форм, таких как регуляторная документация или заявки на кредиты. Интеллектуальная обработка документов заменяет ручной ввод данных, извлекая и классифицируя информацию с помощью ИИ[11].

Технологии также находят применение в логистике и управлении персоналом. В сфере управления цепочками поставок они позволяют ускорить сбор данных из транспортных накладных и таможенных деклараций[12]. В области управления персоналом (HR) автоматизируется обработка резюме, заявлений и других кадровых документов[13].

В медицине методы обработки документов применяют для отслеживания пациентов и оптимизации управленческих процедур, в частности за счёт оцифровки медицинских или лабораторных заключений. Кроме того, обработка документов позволяет унифицировать медицинские базы данных[14]. Алгоритмы также применяются, чтобы помогать врачам при постановке диагноза, например, при анализе магнитно-резонансных изображений[15][16], или микроскопических изображений[17].

Обработка документов широко используется и в гуманитарных, и в цифровых гуманитарных науках, для извлечения исторических данных из архивов и культурных коллекций. Для работы с различными источниками, включая текстовые документы (например, газетные архивы)[18], изображения[19], или карты[20][21], были разработаны специфические подходы.

Технологии

Если с 1980-х годов решения для обработки документов базировались на традиционных алгоритмах компьютерного зрения[22][23], в 2010-х годах им на смену пришли алгоритмы на основе нейронных сетей[24]. Тем не менее, классические алгоритмы компьютерного зрения по-прежнему применяются, иногда в сочетании с нейронными сетями, в отдельных областях.

Ключевыми технологиями в обработке документов выступают оптическое распознавание символов (OCR) и распознавание рукописного текста (HTR), позволяющие осуществлять автоматическую транскрипцию текста. Текстовые сегменты обнаруживаются с помощью алгоритмов инстанс- или обнаружения объектов, которые могут также определять структуру документа. Для последней задачи нередко применяют также алгоритмы семантической сегментации.

Эти технологии часто составляют базовый уровень обработки документов, однако и до, и после них могут применяться альтернативные алгоритмы. Среди них — технологии оцифровки документов, включая как классическое, так и трёхмерное сканирование[25]. Оцифровка 3D-документов может базироваться на производных фотограмметрии. Для оцифровки особо крупных документов или в целях повышения эргономики иногда разрабатываются специализированные 2D-сканеры[19]. Важную роль играет и цифровое кодирование документов в подходящем формате файла. Кроме того, обработка гетерогенных баз данных опирается на технологии классификации изображений.

В финальных этапах применяются разные алгоритмы для дорисовки/очистки изображений или для финальной обработки данных. Для текстовых документов при интерпретации может использоваться обработка естественного языка (NLP).

С начала 2020-х годов развитие технологий интеллектуальной обработки документов (IDP) было связано с несколькими ключевыми тенденциями. IDP-решения стали неотъемлемой частью концепции гиперавтоматизации, интегрируясь с роботизированной автоматизацией процессов (RPA) для создания сквозных интеллектуальных рабочих процессов[26][27]. Произошёл массовый переход на облачные платформы, которые обеспечивают большую масштабируемость и доступ к передовым технологиям ИИ и стали доминирующими к 2024 году.

Главным технологическим сдвигом стала интеграция генеративного ИИ и больших языковых моделей (LLM)[28]. Это позволило перейти от простого извлечения данных к глубокому семантическому пониманию неструктурированного контента, его анализу и обобщению[29], причём часто без необходимости предварительного обучения моделей на конкретных типах документов[30]. Наряду с этим, получили развитие мультимодальные системы, способные обрабатывать различные типы данных, включая текст, голос и изображения[31]. Одновременно фокус сместился на повышение надёжности ИИ и борьбу с «галлюцинациями» генеративных моделей[32].

Современное развитие и рынок

2021—2022 годы: Рост на фоне цифровой трансформации

В 2021 году рынок интеллектуальной обработки документов (IDP) показал значительный рост, ускоренный глобальным переходом на удалённую работу и цифровой трансформацией бизнеса. Объём мирового рынка оценивался в 1,1—1,2 млрд долларов США[33][34]. Рост был обусловлен последствиями пандемии COVID-19, которая подчеркнула необходимость в непрерывности бизнес-процессов и повышении эффективности за счёт автоматизации[35]. Ключевыми тенденциями стали интеграция IDP в стратегии гиперавтоматизации совместно с RPA[36], рост популярности облачных решений и фокус на обработке неструктурированных данных, составляющих до 80 % корпоративной информации[37].

В 2022 году тенденции получили дальнейшее развитие: IDP-решения стали неотъемлемой частью сквозных интеллектуальных рабочих процессов, а в технологиях произошёл качественный скачок в обработке неструктурированных документов, таких как договоры и электронные письма. Рынок продолжил уверенный рост, достигнув, по разным оценкам, от 1,1 до 1,5 млрд долларов[38]. Основными драйверами роста оставались потребность в сокращении операционных расходов и повышении производительности.

Для российского рынка 2022 год стал переломным из-за ухода крупных международных вендоров, включая Kofax, Adobe и ABBYY[39]. Это событие стимулировало импортозамещение: освободившиеся ниши начали занимать отечественные разработчики. В апреле 2022 года команда менеджмента бывшего российского офиса ABBYY создала независимую компанию Content AI, которая унаследовала технологии и стала одним из лидеров на российском рынке[39].

2023—2025 годы: Интеграция генеративного ИИ

В 2023 году мировой рынок интеллектуальной обработки документов достиг 1,7 млрд долларов[40]. Главным технологическим трендом этого периода стала интеграция генеративного ИИ и больших языковых моделей (LLM). Это позволило перейти от простого извлечения данных к глубокому семантическому пониманию неструктурированного контента, его анализу и обобщению. На российском рынке этот период характеризовался активным импортозамещением после ухода западных вендоров.

В 2024 году продолжился рост рынка, а облачные IDP-решения стали доминирующими, предоставляя доступ к передовым технологиям ИИ. Генеративный ИИ позволил не только извлекать информацию, но и анализировать, обобщать и создавать новые документы на основе имеющихся[41]. Получили развитие мультимодальные системы, способные обрабатывать различные типы данных, включая текст, голос и изображения. Исследование, проведённое в 2024 году, показало, что 80 % российских организаций за последние пять лет внедряли технологии автоматизации работы с документами.

К 2025 году IDP-решения стали массово внедряться: по данным исследования AIIM, 78 % предприятий уже использовали искусственный интеллект в своих системах[42]. Ключевыми направлениями развития стали повышение надёжности ИИ и борьба с «галлюцинациями», а также применение LLM для обработки сложных документов без предварительного обучения. Технологии начали активно применяться не только для внутренних процессов (бэк-офис), но и в задачах, ориентированных на клиента (фронт-офис)[42]. Среди практических примеров внедрения — ускорение обработки ипотечных договоров в банке ДОМ.РФ, обработка сотен тысяч документов в месяц в НПФ «Будущее»[43] и повышение доли извлечения металлов из руды в «Норникеле» на 2,5 %[44].

Примечания

  1. Len Asprey. Integrative Document & Content Management: Strategies for Exploiting Enterprise Knowledge : [англ.] / Len Asprey, Michael Middleton. — Idea Group Inc (IGI), 2003. — ISBN 9781591400554.
  2. Vinod V. Sople. Business Process Outsourcing: A Supply Chain of Expertises : [англ.]. — PHI Learning Pvt. Ltd., 25 мая 2009. — ISBN 978-8120338159.
  3. Mark Kobayashi-Hillary. Outsourcing to India: The Offshore Advantage : [англ.]. — Springer Science & Business Media, 5 декабря 2005. — ISBN 9783540247944.
  4. Julia Preston. Immigration Contractor Trims Wages (англ.) (2 декабря 2007). Архивировано 24 января 2025 года.
  5. 1 2 Lawrence M. Fisher. Paper, Once Written Off, Keeps a Place in the Office (англ.) (7 июля 1990). Архивировано 21 января 2023 года.
  6. Al Young; Dayle Woolstein; Jay Johnson (февраль 1996). “Unknown Title”. Object Magazine [англ.]: 51. Проверьте дату в |date= (справка на английском)
  7. Intelligent Document processing (англ.). Department of Computer Science – University of Bari (7 апреля 2005). Дата обращения: 8 сентября 2018. Архивировано 30 июня 2022 года.
  8. Флориана Эспозито, Стефано Ферилли, Тереза М. А. Базиле, Никола Ди Мауро. "Intelligent Document Processing" in Proceedings. Eighth International Conference on Document Analysis and Recognition, Seoul, South Korea, 2005 pp. 1100-1104. doi: 10.1109/ICDAR.2005.144 : [англ.]. — 1 апреля 2005. — doi:10.1109/ICDAR.2005.144.
  9. Intelligent Document Processing (IDP) (англ.). keymarkinc.com. Дата обращения: 12 июля 2024. Архивировано 13 июня 2025 года.
  10. John E. Jones; William J. Jones & Frank M. Csultis, "Financial document processing system", US active US7873576B2, published 18 января 2011, issued 18 января 2011
  11. Bridgwater, Adrian Appian Adds Google Cloud Intelligence To Low-Code Automation Mix (англ.). Forbes. Дата обращения: 21 апреля 2021. Архивировано 24 января 2025 года.
  12. Intelligent Document Processing (IDP) Market Size, Share, Growth (англ.). Fortune Business Insights. Дата обращения: 3 ноября 2025. Архивировано 8 августа 2025 года.
  13. 80% организаций активно внедряют новые технологии автоматизации обработки документов для трансформации бизнес-процессов. TAdviser. Дата обращения: 3 ноября 2025. Архивировано 6 ноября 2024 года.
  14. Adamo, Francesco; Attivissimo, Filippo; Di Nisio, Attilio; Spadavecchia, Maurizio (февраль 2015). “An automatic document processing system for medical data extraction”. Measurement [англ.]. 61: 88—99. Bibcode:2015Meas...61...88A. DOI:10.1016/j.measurement.2014.10.032. Дата обращения 2021-01-31. Проверьте дату в |date= (справка на английском)
  15. Changwan, Kim; Seong-Il, Lee; Won Joon, Cho (сентябрь 2020). “Volumetric assessment of extrusion in medial meniscus posterior root tears through semi-automatic segmentation on 3-tesla magnetic resonance images”. Orthopaedics & Traumatology: Surgery & Research [англ.]. 101 (5): 963—968. DOI:10.1016/j.rcot.2020.06.003. S2CID 225215597. Дата обращения 2021-01-31. Проверьте дату в |date= (справка на английском)
  16. Despotović, Ivana; Bart, Goossens; Wilfried, Philips (1 марта 2015). “MRI Segmentation of the Human Brain: Challenges, Methods, and Applications”. Computational Intelligence Techniques in Medicine [англ.]. 2015: 963—968. DOI:10.1155/2015/450341. PMC 4402572. PMID 25945121.
  17. Putzua, Lorenzo; Caocci, Giovanni; Di Rubertoa, Cecilia (ноябрь 2014). “Leucocyte classification for leukaemia detection using image processing techniques”. Artificial Intelligence in Medicine [англ.]. 63 (3): 179—191. DOI:10.1016/j.artmed.2014.09.002. HDL:11584/94592. PMID 25241903. Проверьте дату в |date= (справка на английском)
  18. Ehrmann, Maud; Romanello, Matteo; Clematide, Simon; Ströbel, Phillip; Barman, Raphaël (2020). “Language Resources for Historical Newspapers: the Impresso Collection”. Proceedings of the 12th Language Resources and Evaluation Conference [англ.]. Марсель, Франция. pp. 958—968.
  19. 1 2 Seguin, Benoit; Costiner, Lisandra; di Lenardo, Isabella; Kaplan, Frédéric (1 апреля 2018). “New Techniques for the Digitization of Art Historical Photographic Archives - the Case of the Cini Foundation in Venice”. Archiving 2018 Final Program and Proceedings [англ.]. Society for Imaging Science and Technology. pp. 1—5. DOI:10.2352/issn.2168-3204.2018.1.0.2.
  20. Ares Oliveira, Sofia; di Lenardo, Isabella; Tourenc, Bastien; Kaplan, Frédéric (11 июля 2019). A deep learning approach to Cadastral Computing. Digital Humanities Conference [англ.]. Утрехт, Нидерланды.
  21. Petitpierre, Rémi (июль 2020). Neural networks for semantic segmentation of historical city maps: Cross-cultural performance and the impact of figurative diversity (MSc) [англ.]. arXiv:2101.12478. DOI:10.13140/RG.2.2.10973.64484. Проверьте дату в |date= (справка на английском)
  22. Fujisawa, H.; Nakano, Y.; Kurino, K. (июль 1992). “Segmentation methods for character recognition: from segmentation to document structure analysis”. Proceedings of the IEEE [англ.]. 80 (7): 1079—1092. DOI:10.1109/5.156471. Проверьте дату в |date= (справка на английском)
  23. Tang, Yuan Y.; Lee, Seong-Whan; Suen, Ching Y. (1996). “Automatic document processing: a survey”. Pattern Recognition [англ.]. 29 (12): 1931—1952. Bibcode:1996PatRe..29.1931T. DOI:10.1016/S0031-3203(96)00044-1. Дата обращения 2021-02-03.
  24. Ares Oliveira, Sofia; Seguin, Benoit; Kaplan, Frederic (5–8 августа 2018). dhSegment: A Generic Deep-Learning Approach for Document Segmentation. 2018 16th International Conference on Frontiers in Handwriting Recognition (ICFHR) [англ.]. Ниагара-Фолс, США: IEEE. arXiv:1804.10371. DOI:10.1109/ICFHR-2018.2018.00011.
  25. Revolutionary Scanning Technology for Art (англ.). Artmyn. Дата обращения: 3 февраля 2021.
  26. Intelligent Document Processing in 2022: Driving Towards the Unknown (англ.). Documentmedia.com. Дата обращения: 3 ноября 2025. Архивировано 22 декабря 2021 года.
  27. Intelligent Document Processing (IDP) Market Size (англ.). Global Market Insights. Дата обращения: 3 ноября 2025. Архивировано 21 апреля 2025 года.
  28. Интеллектуальная обработка документов. Обзор TAdviser. TAdviser. Дата обращения: 3 ноября 2025. Архивировано 30 июня 2025 года.
  29. Технологии обработки документов в 2023 году. Бегемот АИ. Дата обращения: 3 ноября 2025.
  30. Как ИИ помогает автоматизировать рутинные операции с документами. CNews (24 октября 2025). Дата обращения: 3 ноября 2025.
  31. Top AI Trends for 2024 (англ.). Allsee. Дата обращения: 3 ноября 2025. Архивировано 8 сентября 2025 года.
  32. AI-тренды в 2025 году: что ждет бизнес. ELMA365. Дата обращения: 3 ноября 2025. Архивировано 21 июня 2025 года.
  33. Intelligent Document Processing (IDP) Market (англ.). Allied Market Research. Дата обращения: 3 ноября 2025.
  34. Intelligent Document Processing (IDP) Market Size (англ.). SkyQuest Technology. Дата обращения: 3 ноября 2025. Архивировано 18 мая 2025 года.
  35. Intelligent Document Processing (IDP) – Technology Vendor Landscape with Products PEAK Matrix® Assessment 2021 (англ.). Everest Group (2021). Дата обращения: 3 ноября 2025. Архивировано 16 июля 2025 года.
  36. Predictions 2021: Automation Becomes A Business Imperative (англ.). Forrester. Дата обращения: 3 ноября 2025. Архивировано 20 мая 2025 года.
  37. Intelligent Document Processing Statistics (англ.). Nividous. Дата обращения: 3 ноября 2025. Архивировано 10 июля 2025 года.
  38. Document Processing Statistics (англ.). PDF Reader Pro. Дата обращения: 3 ноября 2025. Архивировано 8 августа 2025 года.
  39. 1 2 В рекордные сроки: российские средства интеллектуальной обработки документов на 100% готовы к импортозамещению. TAdviser. Дата обращения: 3 ноября 2025. Архивировано 10 октября 2023 года.
  40. Intelligent Document Processing Market. Kings Research. Дата обращения: 3 ноября 2025.
  41. Распознавание документов в 2024: революция в обработке информации. Polymerium. Дата обращения: 3 ноября 2025.
  42. 1 2 Market Momentum Index: IDP Survey 2025 (англ.). AIIM. Дата обращения: 3 ноября 2025.
  43. TAdviser: СЭД и ECM Day 2025. TAdviser. Дата обращения: 3 ноября 2025. Архивировано 20 октября 2025 года.
  44. Искусственный интеллект завоевывает бизнес. ЦИПР. Дата обращения: 3 ноября 2025. Архивировано 31 августа 2025 года.