Dataset Annotation

Dataset Annotation (рус. аннотация датасета, также разметка данных) — процесс добавления меток, атрибутов или других метаданных к необработанным цифровым данным (изображениям, видео, тексту, аудио), необходимый для обучения алгоритмов контролируемого машинного обучения. Грамотно аннотированный набор данных повышает точность моделей, а ошибки в разметке могут привести к снижению качества прогнозов.

Общие сведения

Определение

  • Аннотация датасета — это:
  1. добавление человекочитаемых или машинно-читаемых меток к сырому контенту (изображения, звук, текст, видео) с целью создания «истины на земле» (ground truth) для моделей ИИ[1];
  2. ключевой этап подготовки данных, который может занимать до 80 % времени проекта по разработке ИИ-систем[1];
  3. обязательное условие для задач классификации, детекции объектов, сегментации, NLP, Распознавание речи и др.[2]

Основные цели аннотации:

  1. сделать данные интерпретируемыми для алгоритмов;
  2. минимизировать смещение и повысить точность обучаемых моделей;
  3. обеспечить возможность объективной проверки и валидации результатов[3].
  • Ground truth (базовая истина / эталонные данные) — максимально точные, проверенные и размеченные данные, которые используются в качестве образца для обучения и оценки моделей машинного обучения.
  • Bounding boxes (ограничивающие рамки) — метод разметки данных, при котором объекты на изображении или видео обводятся прямоугольниками, чтобы указать их местоположение, размер и класс.
  • CSV (Comma-Separated Values) — текстовый формат файла, используемый для хранения структурированной информации о размеченных данных (текстах, изображениях, аудио).
  • COCO (Common Objects in Context) — один из самых популярных и стандартизированных форматов разметки изображений в компьютерном зрении, разработанный Microsoft.
  • YOLO (You Only Look Once) — формат текстовых аннотаций, используемый для обучения моделей компьютерного зрения (обнаружение объектов, сегментация, поиск ключевых точек).
  • Cross-review (перекрестная проверка) — метод контроля качества размеченных данных, при котором размеченный одним аннотатором (или моделью) материал проверяется другим аннотатором.

Структурные элементы процесса аннотации датасетов

Процесс построен из последовательных структурных элементов (workflow), каждый из которых влияет на итоговое качество:

  1. Сбор данных — получение необработанного контента в соответствии с требованиями проекта[4].
  2. Предварительная обработка — очистка, нормализация и унификация форматов[1].
  3. Выбор инструмента и аннотатора — определение программной платформы (например, CVAT, Label Studio) и исполнителей (люди или полуавтоматические ИИ-модели)[5].
  4. Аннотация/разметка — добавление меток. Тип разметки зависит от задачи:
    • классификация изображений,
    • ограничивающие рамки (bounding boxes),
    • полигоны и маски для сегментации,
    • ключевые точки,
    • текстовые теги и др.
  1. Контроль качества и верификация — проверка точности разметки, исправление ошибок и устранение субъективности[4].
  2. Экспорт и интеграция — выгрузка размеченных данных в требуемом формате (CSV, COCO, YOLO, JSON) и их загрузка в конвейер машинного обучения[4].
undefined

Этапы процесса аннотации датасетов

Процесс аннотации датасетов в прикладных проектах включает семь ключевых этапов, каждый из которых обеспечивает последовательную подготовку и качество данных для машинного обучения[6].

1. Определение целей

На этом этапе формулируются задачи проекта, определяются метрики качества и выбираются типы данных, которые будут аннотироваться. Чёткая постановка целей позволяет задать критерии успешности разметки и выбрать подходящие методы аннотации[7].

2. Сбор исходных данных

На этом этапе осуществляется агрегирование исходного контента из внутренних и внешних источников. Важно обеспечить достаточное разнообразие и репрезентативность данных для последующего обучения моделей[4].

3. Предобработка

Включает очистку данных от шумов и артефактов, дедупликацию, балансировку классов, а также нормализацию и унификацию форматов. Этот этап необходим для повышения качества и однородности входных данных[7].

4. Разметка

Процесс аннотирования данных может быть ручным, полуавтоматическим или автоматическим, в зависимости от выбранного инструмента (например, CVAT, Label Studio). Тип разметки определяется задачей: классификация, ограничивающие рамки, полигоны, маски, ключевые точки, текстовые теги и др.[6]

5. Контроль качества

Включает двойную проверку разметки, вычисление межаннотационного согласия, аудит ошибок и исправление неточностей. На этом этапе устраняется субъективность и обеспечивается согласованность аннотаций[8].

6. Разделение на выборки

Данные делятся на обучающую, валидационную и тестовую подвыборки (обычно 70 / 15 / 15 %). Это необходимо для объективной оценки качества моделей и предотвращения переобучения[7].

7. Экспорт и деплой

На заключительном этапе разметка сохраняется в требуемом формате (CSV, COCO, YOLO, JSON), интегрируется в пайплайн обучения и осуществляется мониторинг качества после запуска модели[4].

Преимущества и недостатки

Преимущества

  • Повышение точности и надёжности моделей — аннотированные данные служат ground truth и улучшают результат предсказаний[9].
  • Контроль качества данных и снижение смещения[10].
  • Экономия ресурсов на последующих стадиях разработки за счёт уменьшения повторной работы и отладки моделей[11].
  • Ускорение инноваций в областях автономного вождения, медицины, NLP и др.[10]

Недостатки

  • Высокие временные и финансовые затраты, особенно при ручной разметке большого объёма данных.
  • Человеческие ошибки и субъективность, приводящие к несогласованной разметке.
  • Необходимость специализированных знаний в предметной области (медицина, финансы)[12].
  • Сложность масштабирования процесса и обеспечения конфиденциальности чувствительных данных[13].
  • Ограниченная точность полностью автоматических инструментов, требующая последующей ручной валидации.

Критические замечания

  • Систематические ошибки (Bias) и субъективность разметчика. Разметка часто зависит от интерпретации конкретного человека, что вносит предвзятость. Если не аннотировать критические классы (например, этническую принадлежность), это приводит к систематическим ошибкам модели.
  • Низкое качество разметки ("Garbage In — Garbage Out"). Ошибки в разметке (неправильно очерченные границы, пропущенные объекты, неверные теги) напрямую ведут к тому, что система путает данные и работает некорректно.
  • Недостаточная стандартизация инструкций. Если инструкции для разметчиков неоднозначны, это приводит к высокой вариативности результатов (низкий межэкспертный консенсус).
  • Трудности с окклюзией (перекрытием объектов). В компьютерном зрении разметка объектов, частично скрытых другими, часто выполняется неточно, что снижает устойчивость моделей.
  • Высокая стоимость и время. Ручная аннотация больших объемов данных — это длительный и дорогостоящий процесс, создающий узкое место в разработке ИИ.
  • Использование ИИ при аннотации. Попытки использовать ИИ для автоматизации без контроля качества могут привести к масштабированию ошибок.

Сферы применения

Аннотация данных востребована во множестве отраслей[4]:

  • Автономный транспорт — детекция пешеходов, дорожных знаков, дорожной разметки.
  • Медицинская визуализация — идентификация опухолей и патологий на КТ, МРТ, рентген-снимках.
  • Розничная торговля — анализ поведения клиентов и предотвращение краж по видео с камер наблюдения[14].
  • Промышленность — визуальный контроль качества продукции и обнаружение дефектов.
  • NLP-сервисы — чат-боты, классификация тональностей, извлечение именованных сущностей.
  • Биометрические системы — распознавание лиц, жестов и поз.
  • Голосовые помощники — обучение моделей распознавания речи на аннотированных аудиоданных.

Инструменты для аннотации датасетов

Инструменты делятся на open-source и коммерческие решения, поддерживающие разные форматы данных[15].

Открытые решения

  • CVAT (Intel) — аннотация изображений и видео, поддержка bounding boxes, полигонов, трекинга[15].
  • Label Studio — универсальная платформа для изображений, текста, аудио и видео[6].
  • LabelMe — веб-интерфейс MIT для полигональной разметки изображений.
  • LabelImg — лёгкий десктопный инструмент для YOLO и Pascal VOC.
  • VGG Image Annotator (VIA), Universal Data Tool, Doccano (текст), ELAN (аудио).

Коммерческие платформы

  • Labelbox, SuperAnnotate — облачные решения для изображений, видео и текста[16].
  • V7 Darwin, Encord Annotate, Supervisely — поддержка 3D-данных, автоматическая аннотация.
  • Scale AI, Appen, Dataloop — сервисы с расширенными функциями контроля качества и аналитики.
  • Prodigy — интерактивная разметка изображений, текста и аудио с активным обучением[17].

Примечания

  1. 1 2 3 Аннотация данных или разметка данных - что это такое? — Статьи от Training Data компании №1 по сбору и разметке данных в России. trainingdata.ru. Дата обращения: 20 июня 2025.
  2. Annotation Definition — Computer Vision Glossary. voxel51.com. Дата обращения: 20 июня 2025.
  3. Annotation Definition — Encord. encord.com. Дата обращения: 20 июня 2025.
  4. 1 2 3 4 5 6 Что такое аннотация данных: базовое и расширенное руководство на 2025 год. shaip.com. Дата обращения: 20 июня 2025.
  5. Что такое разметка данных и для чего она нужна? beorg.ru. Дата обращения: 20 июня 2025.
  6. 1 2 3 Стратегии сбора и аннотации данных для компьютерного зрения. ultralytics.com. Дата обращения: 20 июня 2025.
  7. 1 2 3 Пошаговое руководство по подготовке датасета для машинного обучения - Data Light. data-light.ru. Дата обращения: 20 июня 2025.
  8. Разметка данных в машинном обучении: процесс, разновидности и рекомендации / Хабр. habr.com. Дата обращения: 20 июня 2025.
  9. What is Data Annotation? Why does it matter? — AI Workspace. ai-workspace.com. Дата обращения: 20 июня 2025.
  10. 1 2 Data Annotation & Tools in Computer Vision — ImageVision.ai. imagevision.ai. Дата обращения: 20 июня 2025.
  11. Data Annotation Benefits and Advantages in 2023 — Sama. sama.com. Дата обращения: 20 июня 2025.
  12. What is data annotation? Types, challenges, and getting started. sigma.ai. Дата обращения: 20 июня 2025.
  13. Challenges in Unstructured Data Annotation - Deasy Labs: Efficient Metadata Solutions for Scalable AI Workflows. deasylabs.com. Дата обращения: 20 июня 2025.
  14. CVAT: Самый полный гайд по разметке - Data Light. data-light.ru. Дата обращения: 20 июня 2025.
  15. 1 2 15 инструментов и платформ для разметки данных в 2025 году - Data Light. data-light.ru. Дата обращения: 20 июня 2025.
  16. 12 лучших инструментов аннотирования изображений на 2023 год / Хабр. habr.com. Дата обращения: 20 июня 2025.
  17. 9 лучших инструментов аннотирования изображений для Computer Vision / Хабр. habr.com. Дата обращения: 20 июня 2025.
© Правообладателем данного материала является АНО «Интернет-энциклопедия «РУВИКИ».
Использование данного материала на других сайтах возможно только с согласия АНО «Интернет-энциклопедия «РУВИКИ».