Ответ на вопрос
Обработка форм
Обрабо́тка форм (англ. forms processing) — процесс, при котором информация, внесённая в поля данных бумажных форм, фиксируется и преобразуется в электронный вид. Эта операция может выполняться вручную или автоматически; общий принцип состоит в том, что данные, введённые пользователем на бумажном носителе, «захватываются» из соответствующих полей и вводятся в базу данных или другой электронный формат[1]. Обработка форм занимает промежуточное положение между вводом документов и автоматизацией документооборота: предметом служит не движение документов по организации, а извлечение значений полей с бумажного носителя[2].
Значение процесса определяется масштабом бумажного документооборота: анкеты, ведомости, платёжные поручения и бланки строгой отчётности ежедневно поступают в организации тысячами, и ручной перенос их содержимого в информационные системы остаётся дорогим и ошибкоёмким[3]. Типовой конвейер обработки включает сканирование, предобработку изображения, сопоставление с шаблоном формы, распознавание полей, контроль достоверности, верификацию неуверенных результатов оператором и экспорт в информационную систему[4]. Обработку форм следует отличать от приёма данных анкетами на сайтах: в вебе сведения уже электронны, тогда как здесь речь идёт о преобразовании записи с бумаги.
Общие сведения
| Обработка форм | |
|---|---|
| Область использования | документооборот, архивное дело, бухгалтерский учёт, переписи и обследования |
| Автор понятия | практика машинного чтения бланков, сложившаяся в системах обработки переписей, платежей и отчётности XX века |
| Ключевые слова | ввод данных, оптическое распознавание, поля формы, верификация, база данных |
| Базовые понятия | оптическое распознавание символов, распознавание рукописного текста, шаблон формы, контроль достоверности |
История
Первые машины чтения
Идея автоматического чтения нанесённых символов старше вычислительной техники: первые патенты на машины чтения знаков были выданы в конце 1920-х — начале 1930-х годов, а систематические исследования распознавания образов развернулись с появлением электронных вычислительных машин[5]. Ранние решения были ориентированы именно на бланки: считыватели оптических меток регистрировали отметки в заданных позициях листа, и эта технология десятилетиями применялась при обработке тестов, листов переписей и бюллетеней[6].
Для машинного чтения были стандартизированы печатные шрифты, устойчивые к дефектам печати; бланки печатались с разметкой полей, а заполнение допускалось только в строго отведённых местах[5]. Меточные бланки и перфокарты объединяли бумажный носитель с машинной проверкой: оператор ставил отметку, машина считывала её и переносила в учёт. Для печатного заполнения применялись специальные машиночитаемые шрифты: символы особой формы считывались надёжно даже при дефектах печати, что позволило массово вводить чеки, квитанции и платёжные документы. Уже тогда сложился двухуровневый контроль: машина уверенно читала стандартизованные позиции, а всё остальное уходило человеку[6].
Свёрточные сети и открытые движки
Перелом наступил в 1990-е годы, когда обучаемые многослойные нейронные сети сравнялись с ручными признаками. Свёрточная сеть Леуна и соавторов, обученная на десятках тысяч образцов, была применена к чтению банковских чеков — типовой задаче обработки заполненных от руки форм[7]. Параллельно зрелые движки переходили в открытый код: распознаватель Tesseract, разработанный в Hewlett-Packard и переданный сообществу в 2005 году, стал основой множества недорогих решений потокового ввода[8][9].
Отраслевые системы и отечественная практика
В 2000-е годы сформировался рынок специализированных систем ввода форм: продукт содержал конструктор описаний бланков, модуль распознавания печатного и рукопечатного заполнения, станции верификации и экспорт в учётные системы[10]. В российскую практику потоковый ввод пришёл и через системы электронного документооборота: комплекс LanDocs интегрировался с распознаванием FineReader, а система «Евфрат» включала потоковый ввод на движке Cuneiform[11]. Вузовские исследования 2010-х годов закрепили смешанную модель: часть документов существует только электронно, но бумажные ведомости и бланки по-прежнему требуют машинного ввода[2]. Схожая картина описана для систем электронного документооборота в целом: ввод бумажных документов остаётся обязательным звеном, интегрируемым с архивным хранением и полнотекстовым поиском[11].
Виды форм
Фиксированная разметка
Классический случай — бланк с заранее известной геометрией: позиции полей, рамки и метки напечатаны типографски, а заполнение производится в отведённых зонах. Сопоставление с шаблоном сводится к подтверждению ориентации и масштаба листа, после чего значения извлекаются из фиксированных прямоугольников[4]. Такая организация допускает полный автоматический контроль: формат даты, число разрядов, словари значений и контрольные соотношения проверяются без участия человека[10]. Дисциплина заполнения повышается и организационными мерами: бланки печатаются с увеличенными полями для письма, инструкции снабжаются примерами, а критичные позиции дублируются контрольными суммами[1]. Чем жёстче ограничено письмо, тем выше доля автоматически принятых документов и тем дешевле обработка потока[4].
Полуструктурированные документы
Счета-фактуры, акты и накладные, поступающие от разных контрагентов, не совпадают по разметке, но содержат одинаковые по смыслу реквизиты. Для их обработки вместо жёстких шаблонов применяются правила и обучаемые модели, ищущие поля по подписям и контексту; современные платформы заявляют распознавание первичных документов «без привязки к шаблону»[12][13].
Метки и машинночитаемые зоны
Особый класс образуют отметки (галочки, зачёркивания) и штриховые коды. Метки считываются средствами оптического распознавания меток и дают практически безошибочный ввод при аккуратной печати[6]. Слабое место меток — дисциплина заполнения: двойные отметки, неотмеченные позиции и небрежные пометки за пределами зоны приводят к ошибкам ввода, поэтому бланки с метками снабжаются инструкциями и контрольными позициями[6]. Дополняет отметки штриховой код: он служит ключом, связывающим лист с записью в учётной системе, и защищает от повторного ввода[3].
Конвейер обработки
Сканирование и предобработка
Бумажные формы поступают в конвейер потоковым сканированием на сканерах либо фотографированием, в том числе мобильным. Предобработка выравнивает перекосы, устраняет просвет и «мусор», нормализует контраст и разрешение — качество этих операций напрямую влияет на точность распознавания, что подтверждено сравнениями систем на документах разного качества[14]. Типовой состав OCR-конвейера описан как последовательность блоков: сегментация областей текста, предобработка изображения, выделение признаков, распознавание символов и постобработка результатов[15].
Сопоставление с шаблоном и сегментация
Далее система определяет тип бланка и привязывает изображение к описанию формы: находит опорные метки, оси, рамки таблиц. Для форм фиксированной разметки это обеспечивает точную вырезку полей; для таблиц разработаны специальные методы согласования строк и столбцов[4]. Сегментация выделяет знакоместа и строки, отделяя печатную основу бланка от заполнения[15]. Надёжность привязки зависит от опорных элементов: меток совмещения, печатной сетки, фоновой защиты бланка — по ним система отличает сдвинутый лист от другой формы и не смешивает поля с фоном[4]. Если бланк не опознан, документ направляется в отдельный поток: либо ручная привязка шаблона, либо безшаблонное извлечение текста с последующей разметкой полей[1].
Распознавание полей
Значения полей распознаются в зависимости от типа заполнения: печатный текст — движками оптического распознавания, рукопечатные и рукописные значения — средствами распознавания рукописного ввода. Свёрточные сети стали стандартом распознавания отдельных символов и цифр[16][7], а для рукописных строк применяются рекуррентные и гибридные архитектуры[15]. Отдельные модели находят на листах подписи, печати и рукописные пометки, отделяя их от печатного содержания[17]. Дообучение на документах конкретной организации — ведомостях, бланках, справках — снижает ошибку на характерном для неё почерке и типографике[3]. Для оценки рукопечатного ввода применяются и узкие задачи: свёрточные модели распознают отдельные знакоместа цифр с точностью, достаточной для биометрических приложений[16].
Контроль и верификация
Каждому распознанному значению сопоставляется оценка уверенности. Значения с высокой уверенностью проходят автоматические проверки: по словарям имён, форматам дат, числу разрядов, перекрёстным соотношениям полей и контрольным суммам[10]. Сомнительные фрагменты направляются оператору, который проверяет отдельные символы, а не весь документ; такая организация сохраняет точность при резком сокращении ручного труда[10]. Станция верификации показывает оператору изображение поля и распознанное значение, подсвечивая неуверенные символы; решение оператора фиксируется и может использоваться для дообучения модели[10][3]. Так возникает разделение труда: машина обрабатывает поток, человек — сложные случаи и окончательный контроль качества данных. В чувствительных применениях применяется выборочный двойной контроль: сопоставление автоматического ввода с ручным повторным набором показало сопоставимое качество данных в клинических исследованиях[18].
Экспорт данных
Прошедшие контроль значения выгружаются в базу данных, систему электронного документооборота или учётную систему в согласованном формате; вместе с данными сохраняется изображение документа и журнал распознавания[10]. Экспорт выполняется порциями с контролем допустимости значений, а регистрация записей происходит после проверки оператором заданного объёма[10]. Вместе со значениями сохраняются служебные сведения: номер пакета, версия шаблона, оценки уверенности полей и отметки об исправлениях оператора; такой журнал позволяет воспроизвести историю каждой записи и локализовать источник ошибки при расхождениях[1]. Для учебных заведений и ведомств важна и прослеживаемость бланка: по машинночитаемому ключу система отличает повторное сканирование от нового документа и не допускает двойного ввода[3]. В учебных внедрениях зафиксирован полный цикл: сканирование ведомости, распознавание рукописного заполнения, сохранение в базу с одновременным дообучением модели и проверка подлинности электронного аналога[3]. Согласованность выгрузки обеспечивается сверкой числа записей с числом обработанных листов, контрольными суммами пакетов и журналированием отклонённых документов: ни один бланк не исчезает из конвейера бесследно, а повторная обработка листа не порождает дубликатов[10]. Такой порядок делает поток ввода проверяемым на уровне всей организации, а не отдельного оператора[1].
Ручной и автоматический ввод
При ручном вводе оператор переносит значения с листа с клавиатуры; для повышения достоверности применяют двойной набор с сравнением. Такой способ универсален, но медленнее и дороже, а сам оператор устаёт и ошибается. Автоматический ввод устраняет рутину: сравнительное клиническое исследование не выявило преимущества двойного ручного набора перед машинной обработкой меток и рукопечатных полей по качеству данных[18]. На практике доминирует гибридная схема: машина обрабатывает уверенные случаи, человек — исключения. Доля операторских вмешательств зависит от дисциплины заполнения: аккуратные машинописные бланки проходят почти без участия человека, формы с небрежной рукописью требуют верификации большинства полей[10]. Экономика процесса складывается из стоимости сканирования, лицензий на распознавание, станций верификации и повторных вводов. Поэтому переход на автоматический ввод выгоден прежде всего при стабильном однотипном потоке документов, а штучная обработка редких бланков остаётся уделом ручного набора[1]. Автоматизированный ввод уменьшает и человеческий фактор набора: усталость, перестановки разрядов, пропуск строк — типовые ошибки ручного переноса, выявляемые контрольными соотношениями уже после ввода[10].
Современные подходы
Свёрточные и рекуррентные сети
Современные распознаватели строятся на методах машинного обучения: свёрточных сетях, обучаемых на больших коллекциях образцов; для рукописного заполнения применяются комбинации свёрточных и рекуррентных слоёв, а дообучение на документах конкретной организации снижает ошибку на её специфике[3][16]. Нейросетевые методы вытеснили ручные признаки и в сегментации: области текста, подписи и печати находятся детекторами и сегментаторами общего назначения[17]. Качество распознавания зависит уже не столько от алгоритма, сколько от условий съёмки и разрешения. Сравнения систем на документах разного качества показывают расхождения в точности именно на сложных входных данных, поэтому предобработке уделяется столько же внимания, сколько самой модели[14]. Многоступенчатая организация конвейера — от сегментации до постобработки словарями — остаётся общей рамкой как для классических, так и для нейросетевых систем[15].
Понимание документов
Задача поднялась с уровня символов до уровня смысла: мультимодальные модели, предобученные одновременно на тексте и изображении страницы, извлекают структуру документа и связи полей — подход, развиваемый семейством LayoutLM[19]. Для оценки понимания форм предложены открытые наборы данных размеченных сканов — например, FUNSD с аннотированными бланками[20]. Ключевое отличие от классического распознавания в том, что модель соотносит три сигнала: текст, разметку страницы и положение полей; за счёт этого становится возможным понять, что данное число — номер счёта, а подпись в рамке — итоговая сумма[19]. Обобщённая классификация полей по ролям сближает обработку форм с распознаванием таблиц: и там, и там требуется согласовать геометрию листа с логической структурой документа[4]. В отечественных системах документооборота интеллектуальные микросервисы с обучаемыми классификаторами определяют тип входящего документа, извлекают реквизиты и маршрутизируют его по процессам[21]. Промышленные платформы описывают конвейер от определения типа и комплектности пакета до проверки подписей и печатей[12]. Серверная обработка ведётся без дорогостоящих ускорителей, а мобильные распознаватели работают автономно, без подключения к сети[13]. Открытые движки и библиотеки свели порог входа к уровню отдельного разработчика: базовое распознавание текста доступно без лицензий, а специализированные модели дообучаются на документах организации[8][9].
Применение
Обработка форм охватывает массовый ввод в отраслях и процессах, где исходные данные возникают на бумаге. В образовании это ведомости и бланки аттестации: внедрение машинного ввода с нейросетевым распознаванием рукописного заполнения сокращает ручные операции и время обработки[3]. В здравоохранении и исследованиях меточные и рукопечатные анкеты вводятся автоматизированно, а качество данных сравнивается с эталоном двойного набора[18]. Медицинские опросники, карты наблюдений и бланки клинических исследований обрабатываются тем же конвейером, причём достоверность ввода здесь проверяется особенно строго, поскольку от записей зависит оценка эффективности лечения[18]. В финансах и бухгалтерии распознаются платёжные документы — от платёжных поручений до первичных документов учёта, в том числе с фотографий и без подключения к интернету[13][10]. Переписи и обследования исторически опирались на меточные бланки и оптическое считывание[6]. Массовые налоговые декларации и расчётные бланки обрабатываются конвейерно с проверкой контрольных соотношений полей[3]. Наконец, организации переводят смешанный бумажно-электронный документооборот на потоковый ввод с распознаванием как базовый способ попадания бумажных документов в информационные системы[11][2]. В образовании потоковый ввод встроен в жизненный цикл электронных ведомостей: распознанное значение записывается вместе с изображением документа и проверкой подлинности, что позволяет службе аудита отклонять неподтверждённые записи[3].
Ограничения
Точность автоматической обработки ограничена качеством носителя и заполнения: низкое разрешение сканов, перекосы и небрежная рукопись заметно снижают распознаваемость, поэтому системы различаются именно на сложных входных данных[14]. Ошибки распознавания требуют человеческой верификации, а в критичных приложениях — контрольных процедур; полностью безлюдные контуры остаются редкостью[10][18]. Стоимость ошибки неодинакова для разных полей: неверная сумма платёжного документа дороже неверной даты, поэтому пороги уверенности настраиваются по критичности поля, а не по документу в целом[10]. Нешаблонные документы и произвольная рукопись вне отведённых зон по-прежнему сложны: методы выделения пометок и подписей только формируются[17], а модели понимания документов оцениваются на ограниченных открытых наборах[20]. Технология ограничена и самим носителем: потёртости, сгибы и дефекты печати искажают символы задолго до распознавания, и никакая модель не восстановит стёртое заполнение[5]. Наконец, автоматизация переносит усилия с набора на организацию процесса: бланки всё равно должны быть стандартизованы, маршруты верификации настроены, а персонал обучен работе с исключениями[1]. Дополнительные риски связаны с персональными данными: потоковое сканирование создаёт большие массивы изображений, требующие защищённого хранения и разграничения доступа[3][21].
Примечания
- ↑ 1 2 3 4 5 6 7 Doermann D., Tombre K. Handbook of Document Image Processing and Recognition (англ.). — London: Springer, 2014. — 1055 p. — ISBN 978-0-85729-859-1.
- ↑ 1 2 3 Клишин А. П., Волкова Н. Р., Еремина Н. Л., Мытник А. А., Клыжко Е. Н. Подходы к автоматизации документооборота в вузе // Вестник Новосибирского государственного университета. Серия: Информационные технологии. — 2017. — Т. 15, № 1.
- ↑ 1 2 3 4 5 6 7 8 9 10 11 Петров Д. Н., Луцко А. Н. Автоматизация электронно-печатного делопроизводства с идентификацией и верификацией документов // Прикаспийский журнал: управление и высокие технологии. — 2021. — № 2 (54).
- ↑ 1 2 3 4 5 6 Coüasnon B., Lemaitre A. Recognition of Tables and Forms (англ.) // Handbook of Document Image Processing and Recognition. — 2014. — P. 647—677. — doi:10.1007/978-0-85729-859-1_20.
- ↑ 1 2 3 Mori S., Suen C. Y., Yamamoto K. Historical review of OCR research and development (англ.) // Proceedings of the IEEE. — 1992. — Vol. 80, no. 7. — P. 1029—1058. — doi:10.1109/5.156468.
- ↑ 1 2 3 4 5 Wynn R. Optical mark recognition (англ.) // Data Processing. — 1984. — Vol. 26. — P. 26—27. — doi:10.1016/0011-684x(84)90434-9.
- ↑ 1 2 LeCun Y., Bottou L., Bengio Y., Haffner P. Gradient-based learning applied to document recognition (англ.) // Proceedings of the IEEE. — 1998. — Vol. 86, no. 11. — P. 2278—2324. — doi:10.1109/5.726791.
- ↑ 1 2 Smith R. An Overview of the Tesseract OCR Engine (англ.) // Ninth International Conference on Document Analysis and Recognition (ICDAR 2007). — 2007. — P. 629—633. — doi:10.1109/ICDAR.2007.4376991.
- ↑ 1 2 Tesseract documentation (англ.). tesseract-ocr.github.io. Tesseract OCR community. Дата обращения: 5 октября 2026.
- ↑ 1 2 3 4 5 6 7 8 9 10 11 12 13 Системы автоматического распознавания форм. compress.ru. КомпьютерПресс. Дата обращения: 5 октября 2026.
- ↑ 1 2 3 Гордиенко В. В., Самойлов Д. Ю., Самойлова Ю. А. Разработка онлайн-автоматизированной системы для электронного документооборота // Auditorium. — 2024. — № 1 (41).
- ↑ 1 2 Конвейер по распознаванию и обработке данных: интеллектуальные OCR-технологии на практике. slsoft.ru. SL Soft. Дата обращения: 5 октября 2026.
- ↑ 1 2 3 Распознавание первичных документов и ввод документов в 1С. smartengines.ru. Smart Engines. Дата обращения: 5 октября 2026.
- ↑ 1 2 3 Нестеров А. С. Анализ рынка современных информационных систем оптического распознавания символов (OCR) // Вопросы науки и образования. — 2020. — № 23 (107).
- ↑ 1 2 3 4 Бурлуцкий В. В., Балуев В. А. Реализация агента анализа изображений в рамках интеллектуальной мультиагентной системы поиска противоправных материалов в сети Интернет // Вестник Югорского государственного университета. — 2020. — № 4 (59).
- ↑ 1 2 3 Катасёв А. С., Катасёва Д. В. Нейросетевая модель распознавания рукописных символов для построения систем биометрической аутентификации // Вестник Казанского государственного энергетического университета. — 2016. — № 2 (30).
- ↑ 1 2 3 Китенко А. М. Метод поиска и разметки артефактов на изображениях с использованием алгоритмов детекции и сегментации // Системы анализа и обработки данных. — 2021. — № 4 (84).
- ↑ 1 2 3 4 5 Paulsen A., Harboe K., Dalen I. Data entry quality of double data entry vs automated form processing technologies: A cohort study validation of optical mark recognition and intelligent character recognition in a clinical setting (англ.) // Health Science Reports. — 2020. — Vol. 3. — doi:10.1002/hsr2.210.
- ↑ 1 2 Huang Y., Lv T., Cui L., Lu Y., Wei F. LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking (англ.) // arXiv. — 2022.
- ↑ 1 2 Jaume G., Ekenel H. K., Thiran J.-P. FUNSD: A Dataset for Form Understanding in Noisy Scanned Documents (англ.) // arXiv. — 2019.
- ↑ 1 2 Аверьянова А. Н., Атанов В. В., Кеся М. С., Можнов Е. С. Использование интеллектуальных микросервисов в современных системах электронного документооборота // Форум молодых учёных. — 2023. — № 5 (81).
Литература
- Аверьянова А. Н., Атанов В. В., Кеся М. С., Можнов Е. С. Использование интеллектуальных микросервисов в современных системах электронного документооборота // Форум молодых учёных. — 2023. — № 5 (81).
- Клишин А. П., Волкова Н. Р., Еремина Н. Л., Мытник А. А., Клыжко Е. Н. Подходы к автоматизации документооборота в вузе // Вестник Новосибирского государственного университета. Серия: Информационные технологии. — 2017. — Т. 15, № 1.
- Нестеров А. С. Анализ рынка современных информационных систем оптического распознавания символов (OCR) // Вопросы науки и образования. — 2020. — № 23 (107).
- Петров Д. Н., Луцко А. Н. Автоматизация электронно-печатного делопроизводства с идентификацией и верификацией документов // Прикаспийский журнал: управление и высокие технологии. — 2021. — № 2 (54).
- Doermann D., Tombre K. Handbook of Document Image Processing and Recognition (англ.). — London: Springer, 2014. — 1055 p. — ISBN 978-0-85729-859-1.
- Huang Y., Lv T., Cui L., Lu Y., Wei F. LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking (англ.) // arXiv. — 2022.
- Jaume G., Ekenel H. K., Thiran J.-P. FUNSD: A Dataset for Form Understanding in Noisy Scanned Documents (англ.) // arXiv. — 2019.
- LeCun Y., Bottou L., Bengio Y., Haffner P. Gradient-based learning applied to document recognition (англ.) // Proceedings of the IEEE. — 1998. — Vol. 86, no. 11. — P. 2278—2324. — doi:10.1109/5.726791.
- Mori S., Suen C. Y., Yamamoto K. Historical review of OCR research and development (англ.) // Proceedings of the IEEE. — 1992. — Vol. 80, no. 7. — P. 1029—1058. — doi:10.1109/5.156468.
- Smith R. An Overview of the Tesseract OCR Engine (англ.) // Ninth International Conference on Document Analysis and Recognition (ICDAR 2007). — 2007. — P. 629—633. — doi:10.1109/ICDAR.2007.4376991.