Поза (компьютерное зрение)

Pose (англ. pose, также пространственная поза) — в области вычислительной техники и компьютерного зрения — сочетание позиции и ориентации объекта, обычно в трёхмерном пространстве[1]. Позы обычно хранятся во внутреннем представлении в виде матриц преобразования[2][3]. Термин «поза» во многом синонимичен термину «трансформация», однако трансформация может включать в себя также масштабирование, тогда как поза, как правило, нет[4][5]. Пространственная поза с шестью степеней свободы (6DoF) описывает состояние объекта через три параметра смещения (позиция по осям X, Y и Z) и три параметра вращения (крен, тангаж и рыскание)[6].

В компьютерном зрении поза объекта часто определяется по изображениям с помощью процесса, называемого оценкой позы. Эти сведения, например, позволяют роботу манипулировать объектом или избегать столкновения с ним, учитывая его положение и ориентацию в окружающей среде. Другие применения включают скелетную распознавание действий.

В экосистеме пространственных вычислений (Spatial Computing) поза является одним из ключевых элементов физического состояния пользователя. Её отслеживание с помощью датчиков и носимых устройств обеспечивает систему контекстными данными для понимания действий человека и предоставления ему помощи в реальном времени[7].

Оценка позы

Задача определения позы объекта на изображении (или серии изображений, стереопаре) называется оценкой позы. Решение задачи оценки позы зависит от конфигурации сенсоров (камер) и используемой методологии. Можно выделить три основных класса методов:

Классические методы

  • Аналитические или геометрические методы — предполагается, что камера откалибрована и известна связь между трехмерными точками сцены и их двумерными изображениями. Если также известна геометрия объекта, проекция его изображения на плоскость камеры однозначно определяется позой. После идентификации контрольных точек на объекте (чаще всего это углы или характерные точки) возможно вычислить преобразование позы из системы уравнений, связывающих 3D-координаты точек и их 2D-проекции. Алгоритмы, определяющие взаимную позу двух облаков точек, называются алгоритмами регистрации множеств точек, если соответствия между точками заранее неизвестны.
  • Методы на основе генетических алгоритмов — если вычисление позы допускает работу не в режиме реального времени, можно использовать генетические алгоритмы. Такой подход устойчив, особенно при неидеально откалибрированных изображениях. В этой постановке поза кодируется через генетическое представление, а ошибка между проекцией контрольных точек объекта и их изображениями выступает в роли функции приспособленности.

Нейросетевые подходы

Методы, основанные на обучении, используют системы искусственного обучения, которые запоминают отображение между двумерными признаками изображения и преобразованием, определяющим позу. Необходимо предоставить системе достаточно большой набор изображений объекта в различных позах на этапе обучения. После завершения обучения система должна уметь оценивать позу объекта по входному изображению. Современная классификация нейросетевых методов оценки позы выделяет три основных подхода к обработке данных:[8][9]

  • Нисходящий подход (Top-down): двухэтапный процесс, при котором сначала выполняется детекция всех людей на изображении (выделение ограничивающих рамок), а затем для каждого фрагмента оцениваются ключевые точки. Подход обеспечивает высокую точность (например, модели HRNet, ViTPose), но вычислительные затраты растут пропорционально числу людей в кадре[8].[10]
  • Восходящий подход (Bottom-up): модель за один проход находит все ключевые точки на изображении, после чего группирует их в скелеты конкретных людей. Подход (например, OpenPose, HigherHRNet) хорошо масштабируется для плотных сцен, а время работы почти не зависит от количества людей[8].[10]
  • Одноэтапный подход (One-stage): объединяет детекцию и оценку позы в один проход, одновременно предсказывая положение человека и его ключевые точки (например, YOLOv8-Pose, YOLO11-Pose). Это обеспечивает высокую скорость и подходит для задач реального времени[8].[9]

Для достижения баланса между точностью и вычислительной эффективностью применяются гибридные решения, объединяющие методы на основе тепловых карт (heatmap-based) и прямой регрессии координат (regression-based). Например, метод SimCC рассматривает локализацию ключевых точек как одномерную классификацию координат, что позволяет достигать точности уровня тепловых карт при сниженной сложности. Также используются методы дистилляции знаний (например, фреймворк DistilPose), где высокоточные модели на основе тепловых карт обучают более быстрые регрессионные модели[11].[12] В качестве базовых архитектур активно применяются Vision Transformers (ViT). Передовым решением является семейство моделей ViTPose. Архитектура ViTPose++ расширяет базовую модель за счёт декомпозиции знаний через механизм Mixture of Experts (MoE). Модель поддерживает мультизадачное обучение для совместной оценки поз людей, животных и всего тела, достигая передовых результатов на датасете MS COCO[13].[14]

Оптимизация для периферийных устройств

Для адаптации моделей оценки позы к работе на периферийных устройствах (edge-устройствах) применяются методы сжатия нейронных сетей, такие как дистилляция знаний и прунинг[15]. Например, в модели SLIC-POSE используется комбинация структурного прунинга и дистилляции знаний, что позволяет снизить вычислительную сложность на 63,2 % (с 15,2 до 5,6 GFLOPs) при сохранении высокой точности[16]. Помимо этого, разрабатываются специализированные легковесные архитектуры, обеспечивающие высокую скорость работы. В семействе моделей YOLO26-Pose применяется метод Residual Log-Likelihood Estimation (RLE) для точной локализации ключевых точек, а отказ от алгоритма подавления немаксимумов (NMS) обеспечивает предсказуемую задержку вывода[17][18]. В модели CDO-POSE базовая архитектура оптимизирована за счёт применения модуля C3k2CAA, что снижает количество параметров на 32,3 % и позволяет достичь скорости обработки 39,79 кадра в секунду (при разрешении 480p) на устройствах класса NVIDIA Jetson Orin Nano.

Фундаментальные и генеративные модели

Для оценки пространственной позы без предварительного обучения (Zero-shot) применяются подходы на базе визуально-языковых (Vision-Language Models, VLM) и других фундаментальных моделей:

  • ConceptPose — использует VLM для локализации сгенерированных текстовых концептов на изображениях; карты значимости проецируются в 3D-пространство, а итоговая поза оценивается алгоритмами RANSAC и ICP[19].
  • ProM-Pose — использует язык как семантический якорь для управления генеративной 3D-моделью, создающей геометрический приор.
  • FreePose — извлекает визуальные признаки с помощью предварительно обученных фундаментальных моделей (например, SAM2), которые проецируются на 3D-точки и объединяются с геометрическими признаками для вычисления позы[20].

Кроме того, в экспериментальном режиме для уточнения позы в реальном времени применяются деноизирующие диффузионные модели, оптимизированные для работы на периферийных устройствах с минимальными вычислительными затратами[21].[22]

Примечания

  1. Hoff, William A.; Nguyen, Khoi; Lyon, Torsten (29 октября 1996). Casasent, David P., ed. “Основанные на компьютерном зрении методы регистрации для дополненной реальности”. Intelligent Robots and Computer Vision XV: Algorithms, Techniques, Active Vision, and Materials Handling [англ.]. SPIE. 2904: 538—548. Bibcode:1996SPIE.2904..538H. DOI:10.1117/12.256311. S2CID 6587175. Дата обращения 2026-08-27.
  2. Pose (позиция и ориентация) (англ.). DigitalRune Documentation. Дата обращения: 27 августа 2026.
  3. Матричные преобразования в geometry_msgs/Pose — ответы ROS: форум с открытым исходным кодом (англ.). ROS Answers (27 мая 2021). Дата обращения: 27 августа 2026.
  4. Drake: пространственная поза и трансформация (англ.). Drake. Дата обращения: 27 августа 2026.
  5. Документация разработчика Apple: Transform (англ.). Apple Developer Documentation. Дата обращения: 27 августа 2026.
  6. 6D object pose estimation in computer vision. Nature Index. Дата обращения: 27 августа 2026.
  7. On the road to spatial computing. Nokia. Дата обращения: 27 августа 2026.
  8. 1 2 3 4 Top-down vs Bottom-up Pose Estimation. MSightFlow. Дата обращения: 27 августа 2026.
  9. 1 2 The Ultimate Guide to Pose Estimation Tools. Ultralytics. Дата обращения: 27 августа 2026.
  10. 1 2 What is Pose Estimation & Keypoint Detection Explained. Datature. Дата обращения: 27 августа 2026.
  11. What is Pose Estimation & Keypoint Detection Explained. Datature. Дата обращения: 27 августа 2026.
  12. DistilPose: Knowledge Distillation for Pose Estimation. CVPR. Дата обращения: 27 августа 2026.
  13. ViTPose++: Vision Transformer for Pose Estimation with Knowledge Factorization. IEEE Transactions on Pattern Analysis and Machine Intelligence. Дата обращения: 27 августа 2026.
  14. ViTPose GitHub Repository. GitHub. Дата обращения: 27 августа 2026.
  15. Дистилляция знаний. Ultralytics. Дата обращения: 27 августа 2026.
  16. Structural Pruning and Knowledge Distillation for Efficient Pose Estimation. Springer. Дата обращения: 27 августа 2026.
  17. YOLO26 Pose Estimation Tutorial. LearnOpenCV. Дата обращения: 27 августа 2026.
  18. YOLO26: A New Generation of Real-Time Object Detection. arXiv. Дата обращения: 27 августа 2026.
  19. ConceptPose: Training-Free Zero-Shot Object Pose Estimation Using Concept Vectors. arXiv (9 декабря 2025). Дата обращения: 27 августа 2026.
  20. FreePose: Zero-Shot 6D Object Pose Estimation Using Pretrained Foundation Models. pure.bit.edu.cn. Beijing Institute of Technology. Дата обращения: 27 августа 2026.
  21. Real-Time Denoising Diffusion Models for Edge Pose Refinement. ACM Digital Library. Дата обращения: 27 августа 2026.
  22. Low-Latency Diffusion Filtering for Pose Estimation on Embedded Systems. IEEE Xplore. Дата обращения: 27 августа 2026.

Категории