Визуальный тест Тьюринга
Визуальный тест Тьюринга (англ. Visual Turing Test) — это устройство, работающее при участии оператора, которое порождает случайную последовательность бинарных вопросов по заданному тестовому изображению[1]. Механизм генерации запросов строит цепочку вопросов, ответы на которые непредсказуемы с учётом предшествующих вопросов. Тест посвящён исключительно визуальному восприятию и не требует обработки естественного языка. Оператор даёт правильные ответы на вопросы или отклоняет вопросы как неоднозначные. Генератор запросов формулирует вопросы так, чтобы они соответствовали «естественной сюжетной линии», аналогично тому, как человек интерпретирует изображение.
История
Исследования в области компьютерного зрения ведутся с 1960-х годов, когда Сеймур Пейперт впервые попытался решить эту задачу в рамках Летнего проекта по зрению. Этот эксперимент оказался неудачным, поскольку компьютерное зрение гораздо сложнее, чем предполагалось, и сравнимо по сложности с визуальной системой человека: примерно 50 % мозга занято обработкой зрительной информации, что указывает на исключительную сложность проблемы.
Позднее предпринимались попытки использовать модели, вдохновлённые работой мозга. Перцептроны Фрэнка Розенблатта, представляющие собой разновидность нейронных сетей, стали одним из первых подходов такого рода. Однако простые нейронные сети оказались ограниченными и были практически забыты в последующих исследованиях.
С развитием аппаратного обеспечения исследование сместилось в область обработки изображений, включавшую операции на уровне пикселов: поиск границ, удаление шума, применение фильтров и др. Несмотря на успехи, задача осмысленного понимания изображения так и не была решена. В этот же период были показаны возможности многослойных перцептронов, а в 1990-х появились свёрточные нейронные сети, продемонстрировавшие отличные результаты для распознавания цифр, но слабо масштабируемые на сложные задачи.
В конце 1990-х и начале 2000-х началась эпоха современного компьютерного зрения. Развитие ключевых признаков и алгоритмов представления, вместе с машинным обучением, позволило определять, локализовать и сегментировать объекты на изображениях.
Появление стандартных датасетов и оценки качества позволило объективно сравнивать разные алгоритмы, например, через соревнования Pascal VOC и ImageNet. Появление единой системы оценки и открытых челленджей дало ясные ориентиры для исследований, способствуя эффективному развитию специализированных методов, например, для обнаружения и классификации объектов.
Визуальный тест Тьюринга направлен на переосмысление целей компьютерного зрения — приблизить создание систем, воспринимающих изображения более «по-человечески».
Современные методы оценки
Для оценки качества алгоритмов компьютерного зрения созданы многочисленные размеченные датасеты, которые позволяют сравнивать продуктивность методов для разных задач (например, обнаружение или распознавание объектов) на выбранных доменах изображений (например, уличные сцены).
Один из самых известных датасетов — ImageNet, используемый для тестирования классификации объектов на изображении. Это один из крупнейших размеченных корпусов: свыше миллиона изображений. Для задачи локализации и детекции объектов применяется датасет Pascal. Существуют и другие датасеты: H3D[2] для детектирования поз людей, Core — для оценки признаков объектов (цвет, ориентация, действие) и др.
Стандартизация тестовых данных и процедур сравнения позволила выработать эффективные алгоритмы для частных задач. Следующий логичный этап — создание более комплексной задачи, охватывающей множество подзадач: такие тесты приблизят машины к реальному пониманию изображений, поскольку трактовка сцены подразумевает одновременное распознавание, локализацию и сегментацию объектов.
Технические особенности
В отличие от классического теста Тьюринга, у Визуального теста Тьюринга используется генератор запросов, который взаимодействует с системой компьютерного зрения при посредничестве человека-координатора.
Система генерирует случайную последовательность бинарных вопросов по тестовому изображению так, что ответ на любой вопрос k остаётся непредсказуемым с учётом правильных ответов на k−1 предыдущих вопросов.
Человек-оператор выполняет две ключевые функции: исключает неоднозначные вопросы и даёт правильные ответы на однозначные. Возможен бесконечный набор бинарных вопросов к сцене, из которых многие окажутся неоднозначны — такие вопросы отсеиваются и заменяются на другие, также с условием непредсказуемости их ответа.
Ключевая задача теста — оценить «понимание изображения» системой. Для человека восприятие иллюстрируется построением сюжетной линии: люди не мыслят в терминах «автомобиль на x-пикселях слева и y-пикселях сверху», а скорее воспринимают, что «машина припаркована на улице, человек выходит из неё и направляется к зданию». Самые важные элементы сюжетной линии — объекты; основная роль генератора вопросов — конкретизация объектов изображения.
Генератор запросов
Ядро Визуального теста Тьюринга составляет система генерации запросов, включающая две части: словарь и типы вопросов.
Словарь
Словарь — множество понятий, описывающих элементы изображения. В сочетании с определённой грамматикой он позволяет порождать вопросы; грамматика организует пространство бинарных вопросов.
Словарь состоит из трёх компонентов:
- Типы объектов ;
- Атрибуты объектов, зависящие от типа ;
- Отношения между объектами, зависящие от типов .
В задачах анализа уличных сцен типы объектов включают людей, автомобили и здания. Атрибуты могут быть такими, как: женщина, ребёнок, в шляпе, несёт предмет или движется, припаркован, виден один-два колеса. Между парой объектов могут быть неупорядоченные и упорядоченные отношения.
Вся лексика применяется не только ко всему изображению, но и к прямоугольным областям w ∈ W, отвечающим за локализацию объектов. Возможное множество областей очень велико, что усложняет вычисления, поэтому тест ограничен стандартными масштабами: 1/16, 1/4, 1/2 и более изображения.
Типы вопросов
Пространство вопросов состоит из четырёх типов:
- Вопросы о существовании: находят новые объекты, ещё не выделенные в изображении.
Qexist = 'Есть ли в области w экземпляр объекта типа t с атрибутами A, который ещё не был выделен?
- Вопросы об уникальности: позволяют однозначно идентифицировать объект для его выделения.
Quniq = 'Есть ли уникальный экземпляр объекта типа t с атрибутами A, частично видимый в области w, который ещё не был выделен?
Вместе с вопросами о существовании — составляют инстанцирующие вопросы: они порождают новые объекты, а затем позволяют переходить к более сложным вопросам и строить сюжет. После вопроса о существовании обычно следует вопрос об уникальности; положительный ответ приводит к появлению нового объекта.
- Вопросы об атрибутах: позволяют узнать дополнительные свойства уже выделенного объекта. Можно спрашивать о наличии одного, сочетания («и») или альтернативы («или») двух признаков.
Qatt(ot) = {'У объекта ot есть признак a?','У объекта ot есть a1 или a2?','У объекта ot есть a1 и a2?'}
- Вопросы об отношениях: исследуют связь между двумя объектами.
Qrel(ot,ot') = 'Обладает ли объект ot отношением r к объекту ot'?
Подробности реализации
Как отмечалось выше, ядро теста — генератор, который составляет последовательность бинарных вопросов, отвечающих требованию «непредсказуемости» относительно предыдущей истории. Это рекурсивный процесс: после каждой очередной пары «вопрос—ответ» генератор либо завершает работу (если больше нет подходящих вопросов), либо случайным образом выбирает новый, соответствующий ограничению непредсказуемости.
Упорядоченность пространства вопросов подразумевает: вопросы о признаках и отношениях следуют только после инстанцирующих вопросов. То есть только после выделения объекта возможны уточняющие запросы о его свойствах и связях с другими уже выделенными объектами. Соответственно, по каждой истории можно зафиксировать набор допустимых (кандидатных) вопросов .
Задача — из кандидатов выбрать случайный непредсказуемый вопрос, согласованный с порядком. Для этого вычисляют непредсказуемость каждого возможного запроса.
Пусть — бинарная случайная величина, где , если история «валидна» для изображения , и — в противном случае. Пусть — кандидат на следующий вопрос, — его ответ.
Условная вероятность получить ответ Xq на вопрос q при условии истории H вычисляется как:
Мера непредсказуемости определяется как:
Чем ближе к 0, тем вопрос непредсказуемее. Выбирают те, для которых , а следующий вопрос случайно выбирается из этого множества.
Структура вопросов
Как и описано выше, имеется явная последовательность: сначала атрибуты появляются после выделения объектов, затем за ними следуют отношения, если экземпляров несколько.
Генератор строит цепочку: сначала выделяет объект через вопросы существования и уникальности, потом уточняет его свойства и отношения с другими.
Поиск с упреждением
Наиболее интересные вопросы лежат среди уточняющих, но их возможно задавать только после появления новых объектов. Поэтому генератор стремится выделить как можно больше объектов за счёт соответствующих вопросов.
Если необходимо случайно выбрать следующий инстанцирующий вопрос, предпочитают «сложные», если таковые есть среди непредсказуемых. Если нет — выбирают вопрос о существовании, который с высокой вероятностью приведёт к появлению уникального вопроса в дальнейшем, используя look-ahead, или поиск с упреждением.
Сюжетная линия
Важная составляющая машинного «понимания» изображения — построение сюжетной линии, то есть выявление логики сцены, как это делает человек. Генератор достигает этого за счёт внутренней целостности последовательности: выделив объект, он последовательно уточняет его свойства, положение и связи, шаг за шагом подстраиваясь под сюжет сцены.
Локализация объекта, уточнение его положения, зафиксированного при инстанцировании — важный этап: на следующих шагах вопросы ограничиваются областями в пределах исходной.
Предпочтение простоты
Генератор вопросов стремится выбирать простые вопросы с минимальным числом атрибутов по сравнению со сложными. Это задаёт упорядочивание по сложности: при прочих равных выбираются вопросы с наименьшей спецификой.
Оценка предсказуемости
Для выбора следующего вопроса Визуальный тест Тьюринга оценивает предсказуемость каждого кандидата. Для этого используется размеченная обучающая выборка, где каждое изображение снабжено ограничивающими рамками объектов, их признаками, а пары объектов — отмеченными отношениями.
Для разных типов вопросов оценки отличаются:
- Инстанцирующие вопросы: Условную вероятность оценивают по формуле:
При этом учитывают только вопросы с не менее чем 80 изображениями в знаменателе, поскольку каждый дополнительный вопрос истории резко сужает валидный корпус. Для борьбы с этим историю «прочёсывают» в два этапа:- На первом этапе убирают все вопросы о признаках и отношениях — считается, что само наличие объектов менее зависит от их свойств. Также убирают вопросы существования, относящиеся к непересекающимся областям: вероятность появления объекта в одной области не связана с наличием других объектов в других областях. Наконец, убирают вопросы уникальности с отрицательным ответом, если они не относятся к проверяемой области. Итоговая история после этого — .
- Второй этап — покадровое прочёсывание: если уникальный вопрос из первого этапа относится к области, не совпадающей с текущей, то ожидаемый ответ для обучающего изображения — , а если реальный ответ был , то изображение выкидывают из оценки вероятности. Это позволяет получить финальную историю и окончательную формулу:
- Вопросы о признаках: Для них вероятность оценивается по количеству помеченных объектов, а не изображений, так как один объект может встречаться на многих сценах.
Например, для вопроса «У объекта ot есть признак a?», где — экземпляр типа , . Пусть — уже известные свойства объекта, — множество всех размеченных объектов обучающей выборки, — тип, — признаки. Тогда вероятность:
Большое число уже известных признаков может привести к проблеме разреженности, поэтому атрибуты разбивают на группы слабо зависящих друг от друга свойств (например, для человеков — независимость пола и активности), что уменьшает размер множества и облегчает оценку вероятности. - Вопросы об отношениях: Аналогично вопросам о признаках, но оценки строятся по парам объектов (и, соответственно, по слабо зависящим отношениям).
Датасеты
Для экспериментов группы Дональда Джемана и соавт[1]. был использован датасет «Urban street scenes»[1] — изображения улиц разных городов мира, поэтому типы объектов были ограничены людьми и транспортом.
Другой датасет, представленный Институтом информатики Общества Макса Планка, называется DAQUAR[3][4] и содержит реальные изображения помещений. Для этого корпуса предложена своя версия визуального теста Тьюринга, где основной упор делается на квази-человеческую общую осмысленность системы[3].
Заключение
Визуальный тест Тьюринга — работа, опубликованная 9 марта 2015 года в журнале Proceedings of the National Academy of Sciences исследователями из Брауновского университета и Университета Джонса Хопкинса. Метод оценивает, насколько системы компьютерного зрения действительно понимают сцены по сравнению с человеком. В настоящее время вопросы теста составлены и задаются машинно, поскольку устная интерактивная проверка вручную даёт человеку субъективное преимущество и требует ответа в реальном времени.
Крупные компании, такие как Google и Facebook, инвестируют значительные ресурсы в исследования в этой области и создают системы, стремящиеся максимально приблизиться к человеческому восприятию. В 2015 году, например, Facebook анонсировала платформу M, которая анализирует изображение и формирует его описание для слабовидящих[5]. Подобные системы, вероятно, будут успешно проходить Визуальный тест Тьюринга.