Обработка форм

Pause

Обрабо́тка форм (англ. forms processing) — процесс, при котором информация, внесённая в поля данных бумажных форм, фиксируется и преобразуется в электронный вид. Эта операция может выполняться вручную или автоматически; общий принцип состоит в том, что данные, введённые пользователем на бумажном носителе, «захватываются» из соответствующих полей и вводятся в базу данных или другой электронный формат[1]. Обработка форм занимает промежуточное положение между вводом документов и автоматизацией документооборота: предметом служит не движение документов по организации, а извлечение значений полей с бумажного носителя[2].

Значение процесса определяется масштабом бумажного документооборота: анкеты, ведомости, платёжные поручения и бланки строгой отчётности ежедневно поступают в организации тысячами, и ручной перенос их содержимого в информационные системы остаётся дорогим и ошибкоёмким[3]. Типовой конвейер обработки включает сканирование, предобработку изображения, сопоставление с шаблоном формы, распознавание полей, контроль достоверности, верификацию неуверенных результатов оператором и экспорт в информационную систему[4]. Обработку форм следует отличать от приёма данных анкетами на сайтах: в вебе сведения уже электронны, тогда как здесь речь идёт о преобразовании записи с бумаги.

Общие сведения
Обработка форм
Область использования документооборот, архивное дело, бухгалтерский учёт, переписи и обследования
Автор понятия практика машинного чтения бланков, сложившаяся в системах обработки переписей, платежей и отчётности XX века
Ключевые слова ввод данных, оптическое распознавание, поля формы, верификация, база данных
Базовые понятия оптическое распознавание символов, распознавание рукописного текста, шаблон формы, контроль достоверности

История

Первые машины чтения

Идея автоматического чтения нанесённых символов старше вычислительной техники: первые патенты на машины чтения знаков были выданы в конце 1920-х — начале 1930-х годов, а систематические исследования распознавания образов развернулись с появлением электронных вычислительных машин[5]. Ранние решения были ориентированы именно на бланки: считыватели оптических меток регистрировали отметки в заданных позициях листа, и эта технология десятилетиями применялась при обработке тестов, листов переписей и бюллетеней[6].

undefined

Для машинного чтения были стандартизированы печатные шрифты, устойчивые к дефектам печати; бланки печатались с разметкой полей, а заполнение допускалось только в строго отведённых местах[5]. Меточные бланки и перфокарты объединяли бумажный носитель с машинной проверкой: оператор ставил отметку, машина считывала её и переносила в учёт. Для печатного заполнения применялись специальные машиночитаемые шрифты: символы особой формы считывались надёжно даже при дефектах печати, что позволило массово вводить чеки, квитанции и платёжные документы. Уже тогда сложился двухуровневый контроль: машина уверенно читала стандартизованные позиции, а всё остальное уходило человеку[6].

Свёрточные сети и открытые движки

Перелом наступил в 1990-е годы, когда обучаемые многослойные нейронные сети сравнялись с ручными признаками. Свёрточная сеть Леуна и соавторов, обученная на десятках тысяч образцов, была применена к чтению банковских чеков — типовой задаче обработки заполненных от руки форм[7]. Параллельно зрелые движки переходили в открытый код: распознаватель Tesseract, разработанный в Hewlett-Packard и переданный сообществу в 2005 году, стал основой множества недорогих решений потокового ввода[8][9].

Отраслевые системы и отечественная практика

В 2000-е годы сформировался рынок специализированных систем ввода форм: продукт содержал конструктор описаний бланков, модуль распознавания печатного и рукопечатного заполнения, станции верификации и экспорт в учётные системы[10]. В российскую практику потоковый ввод пришёл и через системы электронного документооборота: комплекс LanDocs интегрировался с распознаванием FineReader, а система «Евфрат» включала потоковый ввод на движке Cuneiform[11]. Вузовские исследования 2010-х годов закрепили смешанную модель: часть документов существует только электронно, но бумажные ведомости и бланки по-прежнему требуют машинного ввода[2]. Схожая картина описана для систем электронного документооборота в целом: ввод бумажных документов остаётся обязательным звеном, интегрируемым с архивным хранением и полнотекстовым поиском[11].

Виды форм

Фиксированная разметка

Классический случай — бланк с заранее известной геометрией: позиции полей, рамки и метки напечатаны типографски, а заполнение производится в отведённых зонах. Сопоставление с шаблоном сводится к подтверждению ориентации и масштаба листа, после чего значения извлекаются из фиксированных прямоугольников[4]. Такая организация допускает полный автоматический контроль: формат даты, число разрядов, словари значений и контрольные соотношения проверяются без участия человека[10]. Дисциплина заполнения повышается и организационными мерами: бланки печатаются с увеличенными полями для письма, инструкции снабжаются примерами, а критичные позиции дублируются контрольными суммами[1]. Чем жёстче ограничено письмо, тем выше доля автоматически принятых документов и тем дешевле обработка потока[4].

undefined

Полуструктурированные документы

Счета-фактуры, акты и накладные, поступающие от разных контрагентов, не совпадают по разметке, но содержат одинаковые по смыслу реквизиты. Для их обработки вместо жёстких шаблонов применяются правила и обучаемые модели, ищущие поля по подписям и контексту; современные платформы заявляют распознавание первичных документов «без привязки к шаблону»[12][13].

Метки и машинночитаемые зоны

Особый класс образуют отметки (галочки, зачёркивания) и штриховые коды. Метки считываются средствами оптического распознавания меток и дают практически безошибочный ввод при аккуратной печати[6]. Слабое место меток — дисциплина заполнения: двойные отметки, неотмеченные позиции и небрежные пометки за пределами зоны приводят к ошибкам ввода, поэтому бланки с метками снабжаются инструкциями и контрольными позициями[6]. Дополняет отметки штриховой код: он служит ключом, связывающим лист с записью в учётной системе, и защищает от повторного ввода[3].

Конвейер обработки

Сканирование и предобработка

Бумажные формы поступают в конвейер потоковым сканированием на сканерах либо фотографированием, в том числе мобильным. Предобработка выравнивает перекосы, устраняет просвет и «мусор», нормализует контраст и разрешение — качество этих операций напрямую влияет на точность распознавания, что подтверждено сравнениями систем на документах разного качества[14]. Типовой состав OCR-конвейера описан как последовательность блоков: сегментация областей текста, предобработка изображения, выделение признаков, распознавание символов и постобработка результатов[15].

undefined

Сопоставление с шаблоном и сегментация

Далее система определяет тип бланка и привязывает изображение к описанию формы: находит опорные метки, оси, рамки таблиц. Для форм фиксированной разметки это обеспечивает точную вырезку полей; для таблиц разработаны специальные методы согласования строк и столбцов[4]. Сегментация выделяет знакоместа и строки, отделяя печатную основу бланка от заполнения[15]. Надёжность привязки зависит от опорных элементов: меток совмещения, печатной сетки, фоновой защиты бланка — по ним система отличает сдвинутый лист от другой формы и не смешивает поля с фоном[4]. Если бланк не опознан, документ направляется в отдельный поток: либо ручная привязка шаблона, либо безшаблонное извлечение текста с последующей разметкой полей[1].

Распознавание полей

Значения полей распознаются в зависимости от типа заполнения: печатный текст — движками оптического распознавания, рукопечатные и рукописные значения — средствами распознавания рукописного ввода. Свёрточные сети стали стандартом распознавания отдельных символов и цифр[16][7], а для рукописных строк применяются рекуррентные и гибридные архитектуры[15]. Отдельные модели находят на листах подписи, печати и рукописные пометки, отделяя их от печатного содержания[17]. Дообучение на документах конкретной организации — ведомостях, бланках, справках — снижает ошибку на характерном для неё почерке и типографике[3]. Для оценки рукопечатного ввода применяются и узкие задачи: свёрточные модели распознают отдельные знакоместа цифр с точностью, достаточной для биометрических приложений[16].

Контроль и верификация

Каждому распознанному значению сопоставляется оценка уверенности. Значения с высокой уверенностью проходят автоматические проверки: по словарям имён, форматам дат, числу разрядов, перекрёстным соотношениям полей и контрольным суммам[10]. Сомнительные фрагменты направляются оператору, который проверяет отдельные символы, а не весь документ; такая организация сохраняет точность при резком сокращении ручного труда[10]. Станция верификации показывает оператору изображение поля и распознанное значение, подсвечивая неуверенные символы; решение оператора фиксируется и может использоваться для дообучения модели[10][3]. Так возникает разделение труда: машина обрабатывает поток, человек — сложные случаи и окончательный контроль качества данных. В чувствительных применениях применяется выборочный двойной контроль: сопоставление автоматического ввода с ручным повторным набором показало сопоставимое качество данных в клинических исследованиях[18].

Экспорт данных

Прошедшие контроль значения выгружаются в базу данных, систему электронного документооборота или учётную систему в согласованном формате; вместе с данными сохраняется изображение документа и журнал распознавания[10]. Экспорт выполняется порциями с контролем допустимости значений, а регистрация записей происходит после проверки оператором заданного объёма[10]. Вместе со значениями сохраняются служебные сведения: номер пакета, версия шаблона, оценки уверенности полей и отметки об исправлениях оператора; такой журнал позволяет воспроизвести историю каждой записи и локализовать источник ошибки при расхождениях[1]. Для учебных заведений и ведомств важна и прослеживаемость бланка: по машинночитаемому ключу система отличает повторное сканирование от нового документа и не допускает двойного ввода[3]. В учебных внедрениях зафиксирован полный цикл: сканирование ведомости, распознавание рукописного заполнения, сохранение в базу с одновременным дообучением модели и проверка подлинности электронного аналога[3]. Согласованность выгрузки обеспечивается сверкой числа записей с числом обработанных листов, контрольными суммами пакетов и журналированием отклонённых документов: ни один бланк не исчезает из конвейера бесследно, а повторная обработка листа не порождает дубликатов[10]. Такой порядок делает поток ввода проверяемым на уровне всей организации, а не отдельного оператора[1].

undefined

Ручной и автоматический ввод

При ручном вводе оператор переносит значения с листа с клавиатуры; для повышения достоверности применяют двойной набор с сравнением. Такой способ универсален, но медленнее и дороже, а сам оператор устаёт и ошибается. Автоматический ввод устраняет рутину: сравнительное клиническое исследование не выявило преимущества двойного ручного набора перед машинной обработкой меток и рукопечатных полей по качеству данных[18]. На практике доминирует гибридная схема: машина обрабатывает уверенные случаи, человек — исключения. Доля операторских вмешательств зависит от дисциплины заполнения: аккуратные машинописные бланки проходят почти без участия человека, формы с небрежной рукописью требуют верификации большинства полей[10]. Экономика процесса складывается из стоимости сканирования, лицензий на распознавание, станций верификации и повторных вводов. Поэтому переход на автоматический ввод выгоден прежде всего при стабильном однотипном потоке документов, а штучная обработка редких бланков остаётся уделом ручного набора[1]. Автоматизированный ввод уменьшает и человеческий фактор набора: усталость, перестановки разрядов, пропуск строк — типовые ошибки ручного переноса, выявляемые контрольными соотношениями уже после ввода[10].

Современные подходы

Свёрточные и рекуррентные сети

Современные распознаватели строятся на методах машинного обучения: свёрточных сетях, обучаемых на больших коллекциях образцов; для рукописного заполнения применяются комбинации свёрточных и рекуррентных слоёв, а дообучение на документах конкретной организации снижает ошибку на её специфике[3][16]. Нейросетевые методы вытеснили ручные признаки и в сегментации: области текста, подписи и печати находятся детекторами и сегментаторами общего назначения[17]. Качество распознавания зависит уже не столько от алгоритма, сколько от условий съёмки и разрешения. Сравнения систем на документах разного качества показывают расхождения в точности именно на сложных входных данных, поэтому предобработке уделяется столько же внимания, сколько самой модели[14]. Многоступенчатая организация конвейера — от сегментации до постобработки словарями — остаётся общей рамкой как для классических, так и для нейросетевых систем[15].

Понимание документов

Задача поднялась с уровня символов до уровня смысла: мультимодальные модели, предобученные одновременно на тексте и изображении страницы, извлекают структуру документа и связи полей — подход, развиваемый семейством LayoutLM[19]. Для оценки понимания форм предложены открытые наборы данных размеченных сканов — например, FUNSD с аннотированными бланками[20]. Ключевое отличие от классического распознавания в том, что модель соотносит три сигнала: текст, разметку страницы и положение полей; за счёт этого становится возможным понять, что данное число — номер счёта, а подпись в рамке — итоговая сумма[19]. Обобщённая классификация полей по ролям сближает обработку форм с распознаванием таблиц: и там, и там требуется согласовать геометрию листа с логической структурой документа[4]. В отечественных системах документооборота интеллектуальные микросервисы с обучаемыми классификаторами определяют тип входящего документа, извлекают реквизиты и маршрутизируют его по процессам[21]. Промышленные платформы описывают конвейер от определения типа и комплектности пакета до проверки подписей и печатей[12]. Серверная обработка ведётся без дорогостоящих ускорителей, а мобильные распознаватели работают автономно, без подключения к сети[13]. Открытые движки и библиотеки свели порог входа к уровню отдельного разработчика: базовое распознавание текста доступно без лицензий, а специализированные модели дообучаются на документах организации[8][9].

undefined

Применение

Обработка форм охватывает массовый ввод в отраслях и процессах, где исходные данные возникают на бумаге. В образовании это ведомости и бланки аттестации: внедрение машинного ввода с нейросетевым распознаванием рукописного заполнения сокращает ручные операции и время обработки[3]. В здравоохранении и исследованиях меточные и рукопечатные анкеты вводятся автоматизированно, а качество данных сравнивается с эталоном двойного набора[18]. Медицинские опросники, карты наблюдений и бланки клинических исследований обрабатываются тем же конвейером, причём достоверность ввода здесь проверяется особенно строго, поскольку от записей зависит оценка эффективности лечения[18]. В финансах и бухгалтерии распознаются платёжные документы — от платёжных поручений до первичных документов учёта, в том числе с фотографий и без подключения к интернету[13][10]. Переписи и обследования исторически опирались на меточные бланки и оптическое считывание[6]. Массовые налоговые декларации и расчётные бланки обрабатываются конвейерно с проверкой контрольных соотношений полей[3]. Наконец, организации переводят смешанный бумажно-электронный документооборот на потоковый ввод с распознаванием как базовый способ попадания бумажных документов в информационные системы[11][2]. В образовании потоковый ввод встроен в жизненный цикл электронных ведомостей: распознанное значение записывается вместе с изображением документа и проверкой подлинности, что позволяет службе аудита отклонять неподтверждённые записи[3].

undefined

Ограничения

Точность автоматической обработки ограничена качеством носителя и заполнения: низкое разрешение сканов, перекосы и небрежная рукопись заметно снижают распознаваемость, поэтому системы различаются именно на сложных входных данных[14]. Ошибки распознавания требуют человеческой верификации, а в критичных приложениях — контрольных процедур; полностью безлюдные контуры остаются редкостью[10][18]. Стоимость ошибки неодинакова для разных полей: неверная сумма платёжного документа дороже неверной даты, поэтому пороги уверенности настраиваются по критичности поля, а не по документу в целом[10]. Нешаблонные документы и произвольная рукопись вне отведённых зон по-прежнему сложны: методы выделения пометок и подписей только формируются[17], а модели понимания документов оцениваются на ограниченных открытых наборах[20]. Технология ограничена и самим носителем: потёртости, сгибы и дефекты печати искажают символы задолго до распознавания, и никакая модель не восстановит стёртое заполнение[5]. Наконец, автоматизация переносит усилия с набора на организацию процесса: бланки всё равно должны быть стандартизованы, маршруты верификации настроены, а персонал обучен работе с исключениями[1]. Дополнительные риски связаны с персональными данными: потоковое сканирование создаёт большие массивы изображений, требующие защищённого хранения и разграничения доступа[3][21].

Примечания

  1. ↑ 1 2 3 4 5 6 7 Doermann D., Tombre K. Handbook of Document Image Processing and Recognition (англ.). — London: Springer, 2014. — 1055 p. — ISBN 978-0-85729-859-1.
  2. ↑ 1 2 3 Клишин А. П., Волкова Н. Р., Еремина Н. Л., Мытник А. А., Клыжко Е. Н. Подходы к автоматизации документооборота в вузе // Вестник Новосибирского государственного университета. Серия: Информационные технологии. — 2017. — Т. 15, № 1.
  3. ↑ 1 2 3 4 5 6 7 8 9 10 11 Петров Д. Н., Луцко А. Н. Автоматизация электронно-печатного делопроизводства с идентификацией и верификацией документов // Прикаспийский журнал: управление и высокие технологии. — 2021. — № 2 (54).
  4. ↑ 1 2 3 4 5 6 Coüasnon B., Lemaitre A. Recognition of Tables and Forms (англ.) // Handbook of Document Image Processing and Recognition. — 2014. — P. 647—677. — doi:10.1007/978-0-85729-859-1_20.
  5. ↑ 1 2 3 Mori S., Suen C. Y., Yamamoto K. Historical review of OCR research and development (англ.) // Proceedings of the IEEE. — 1992. — Vol. 80, no. 7. — P. 1029—1058. — doi:10.1109/5.156468.
  6. ↑ 1 2 3 4 5 Wynn R. Optical mark recognition (англ.) // Data Processing. — 1984. — Vol. 26. — P. 26—27. — doi:10.1016/0011-684x(84)90434-9.
  7. ↑ 1 2 LeCun Y., Bottou L., Bengio Y., Haffner P. Gradient-based learning applied to document recognition (англ.) // Proceedings of the IEEE. — 1998. — Vol. 86, no. 11. — P. 2278—2324. — doi:10.1109/5.726791.
  8. ↑ 1 2 Smith R. An Overview of the Tesseract OCR Engine (англ.) // Ninth International Conference on Document Analysis and Recognition (ICDAR 2007). — 2007. — P. 629—633. — doi:10.1109/ICDAR.2007.4376991.
  9. ↑ 1 2 Tesseract documentation (англ.). tesseract-ocr.github.io. Tesseract OCR community. Дата обращения: 5 октября 2026.
  10. ↑ 1 2 3 4 5 6 7 8 9 10 11 12 13 Системы автоматического распознавания форм. compress.ru. КомпьютерПресс. Дата обращения: 5 октября 2026.
  11. ↑ 1 2 3 Гордиенко В. В., Самойлов Д. Ю., Самойлова Ю. А. Разработка онлайн-автоматизированной системы для электронного документооборота // Auditorium. — 2024. — № 1 (41).
  12. ↑ 1 2 Конвейер по распознаванию и обработке данных: интеллектуальные OCR-технологии на практике. slsoft.ru. SL Soft. Дата обращения: 5 октября 2026.
  13. ↑ 1 2 3 Распознавание первичных документов и ввод документов в 1С. smartengines.ru. Smart Engines. Дата обращения: 5 октября 2026.
  14. ↑ 1 2 3 Нестеров А. С. Анализ рынка современных информационных систем оптического распознавания символов (OCR) // Вопросы науки и образования. — 2020. — № 23 (107).
  15. ↑ 1 2 3 4 Бурлуцкий В. В., Балуев В. А. Реализация агента анализа изображений в рамках интеллектуальной мультиагентной системы поиска противоправных материалов в сети Интернет // Вестник Югорского государственного университета. — 2020. — № 4 (59).
  16. ↑ 1 2 3 Катасёв А. С., Катасёва Д. В. Нейросетевая модель распознавания рукописных символов для построения систем биометрической аутентификации // Вестник Казанского государственного энергетического университета. — 2016. — № 2 (30).
  17. ↑ 1 2 3 Китенко А. М. Метод поиска и разметки артефактов на изображениях с использованием алгоритмов детекции и сегментации // Системы анализа и обработки данных. — 2021. — № 4 (84).
  18. ↑ 1 2 3 4 5 Paulsen A., Harboe K., Dalen I. Data entry quality of double data entry vs automated form processing technologies: A cohort study validation of optical mark recognition and intelligent character recognition in a clinical setting (англ.) // Health Science Reports. — 2020. — Vol. 3. — doi:10.1002/hsr2.210.
  19. ↑ 1 2 Huang Y., Lv T., Cui L., Lu Y., Wei F. LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking (англ.) // arXiv. — 2022.
  20. ↑ 1 2 Jaume G., Ekenel H. K., Thiran J.-P. FUNSD: A Dataset for Form Understanding in Noisy Scanned Documents (англ.) // arXiv. — 2019.
  21. ↑ 1 2 Аверьянова А. Н., Атанов В. В., Кеся М. С., Можнов Е. С. Использование интеллектуальных микросервисов в современных системах электронного документооборота // Форум молодых учёных. — 2023. — № 5 (81).

Литература

Дополнительно по теме

Pause