Хуан, Томас
То́мас Ши-Та́о Хуа́н (26 июня 1936, Шанхай, Китайская Республика[1] — 25 апреля 2020, Форт-Уэйн, Индиана, США) — американский учёный в области информатики и инженер-электрик китайского происхождения. Был исследователем и почётным профессором Иллинойсского университета в Урбане-Шампейне (UIUC). Хуан был одним из ведущих специалистов в области компьютерного зрения, распознавания образов и человеко-компьютерного взаимодействия.
Биография
Хуан родился 26 июня 1936 года в Шанхае, Китайская Республика[4]. В 1949 году его семья переехала на Тайвань во время Великого отступления. Хуан изучал электронику в Национальном университете Тайваня и получил степень бакалавра в 1956 году[5].
Хуан отправился в США для обучения в Массачусетском технологическом институте (MIT). В MIT он сначала работал с Питером Элиасом, который интересовался теорией информации и кодированием изображений, а затем с Уильямом Ф. Шрайбером. В то время сканирующее оборудование не было коммерчески доступным, поэтому было необходимо создать сканер для оцифровки и воспроизведения изображений. Компьютерные программы были написаны на языке ассемблера с использованием прототипа компьютера TX-0 Лаборатории Линкольна. Описания оцифрованных изображений хранились на бумажной ленте с перфорированными отверстиями[5]. Хуан работал под руководством Шрайбера над своей магистерской диссертацией Picture statistics and linearly interpolative coding (1960)[6] и докторской диссертацией Pictorial noise (1963)[7]. Его магистерская работа была посвящена алгоритмам кодирования изображений с использованием адаптивных методов интерполяции с чувствительностью к краям. Его докторская диссертация включала работу над субъективными эффектами графического шума в спектре[5].
Карьера
Хуан принял должность на факультете электротехники в MIT и оставался там с 1963 по 1973 год[5]. В 1973 году он принял должность профессора электротехники и директора Лаборатории обработки информации и сигналов в Университете Пердью, где оставался до 1980 года[5].
В 1980 году Хуан принял кафедру электротехники в Иллинойсском университете в Урбане-Шампейне (UIUC)[5]. 15 апреля 1996 года Хуан стал первым выдающимся профессором электротехники и вычислительной техники имени Уильяма Л. Эверитта в UIUC. Он был связан с Координированной научной лабораторией (CSL) и занимал должность руководителя группы формирования и обработки изображений Института передовых наук и технологий Бекмана, а также сопредседателя исследовательского направления Института Бекмана по интеллектуальному взаимодействию человека и компьютера. В 2012 году он был назначен заведующим кафедрой Сванлунда, что является высшим званием в UIUC[8]. Хуан ушёл с преподавательской работы в декабре 2014 года, но продолжал активно заниматься исследованиями[9].
Хуан был одним из редакторов-основателей журнала International Journal of Computer Vision, Graphics and Image Processing и серии Springer Series in Information Sciences издательства Springer-Verlag. Он помогал в организации первого Международного симпозиума по кодированию изображений (1969), первого Международного семинара по кодированию видео с очень низким битрейтом (1993) и первой Международной конференции по автоматическому распознаванию лиц и жестов (1995), которые стали регулярными мероприятиями.
Исследования
Исследования Хуана были сосредоточены на разработке общих концепций, методологий, теорий и алгоритмов, которые имеют широкое применение в мультимодальной и мультимедийной обработке сигналов[5]. Ещё в MIT он разработал первую алгебраическую процедуру для проверки условий стабильности двумерных фильтров, основанную на двойном билинейном преобразовании и методе Анселла. Он также публиковал работы по цифровой голографии. В Пердью он работал над нелинейными фильтрами, в частности медианными фильтрами, которые стали стандартным методом удаления шума на изображениях.
Некоторые из его ранних работ были посвящены сжатию изображений, а позже распространились на области улучшения, восстановления и анализа. Он разработал подходы к сжатию бинарных документов, которые использовали двумерную отсканированную информацию, анализируя изменения от одной строки сканирования к другой и обнаруживая точки перехода, в которых последующая строка отличается. Статистические прогнозы и экспериментальные результаты производительности модели хорошо согласовывались[5]. В 1969 году Хуан и Грант Андерсон были одной из первых команд, предложивших метод блочного трансформационного кодирования, основываясь на работе Дж. Дж. Й. Хуана и Питера М. Шультхайсса[10].
В 1984 году Цай и Хуан первыми представили многокадровый метод в частотной области, который связывал дискретное преобразование Фурье наблюдаемых спутниковых изображений низкого разрешения на этапе получения с непрерывным преобразованием Фурье изображения высокого разрешения, используя обратное преобразование Фурье для получения окончательного изображения с повышенным разрешением[11][12]. Хуан также работал над вейвлет-методами кодирования и фрактальным кодированием. Вейвлет-кодирование особенно важно для поиска изображений по содержанию в мультимедийных базах данных, содержащих изображения, видео, аудио и текст. Оно позволяет выполнять поиск по меньшим закодированным изображениям, а не по полноразмерным извлечённым изображениям[5]. Другие важные области исследований включают использование обратной связи по релевантности для адаптации систем баз данных к намерениям пользователя (при просмотре или поиске), а также создание оглавлений и семантических индексов для видео с использованием мультимедийной информации (последовательность изображений, аудио и скрытые субтитры, если они доступны).
В области 3D-моделирования Хуан работал над идентификацией трёхмерного движения и структуры твёрдых объектов по нескольким изображениям, на которых можно идентифицировать соответствующие признаки. Эта работа была важна для сжатия телевизионных изображений, для разработки стандартов изображений и для исследований в области человеческого и компьютерного зрения[5]. Хуан также работал над 3D-моделированием, анализом и синтезом изображений человеческого лица, рук и тела. Первоначальной мотивацией этого исследования была поддержка низкобитрейтного 3D-модельного кодирования видео для видеотелефонов и телеконференций. Идея заключалась в том, что если 3D-модель пользователя может быть передана и реконструирована на принимающей стороне, то будет достаточно извлечь и отправить информацию о движении для управления 3D-моделью и регенерации видеопоследовательности. Инструменты, разработанные для этого типа сценариев, применимы и ко многим другим проблемам, включая конференции в виртуальном пространстве с аватарами и электронные игры.
Хуан считал обработку изображений и речи фундаментально схожими[5] и работал с распознаванием речи и обработкой звука так же, как и с изображениями. Хуан, Марк Хасегава-Джонсон и их студенты создали базу данных речи, записанной в автомобилях, которая может использоваться в качестве бенчмарка для тестирования алгоритмов аудиовизуального распознавания речи[13]. Они также разработали методы обнаружения аудиоэлементов, которые могут привлечь внимание человека, и используют их, чтобы позволить людям более эффективно просматривать большие объёмы аудиозаписей для поиска важной информации[14].
Хуан проделал важную работу в области мультимодального человеко-компьютерного взаимодействия и дизайна интерфейсов. Он был одним из первых исследователей, объединивших аудио- и видеометоды для идентификации аффективных состояний человека[15]. Более поздние работы Хуана и других исследователей направлены на разработку серии алгоритмов для оптимального извлечения информации из мультимодальности[16], проверяя большие объёмы данных из нескольких источников и оптимизируя типы и объёмы данных, которые сжимаются и передаются. Такие исследования оппортунистического зондирования имеют применение как в военных, так и в гражданских целях[16][17].
Хуан также надеялся разработать более естественные и эффективные способы взаимодействия человека с компьютером или виртуальной средой с помощью речи и жестов[5]. Исследовательские проекты включают визуальное отслеживание рук и распознавание жестов; использование визуального чтения по губам для повышения точности распознавания аудиоречи; и интеграцию распознавания речи и визуального анализа жестов при управлении дисплеями в виртуальных средах.
Он также работал над аудиовизуальным распознаванием пола, возрастной группы и эмоций. Его работа в области определения пола и эмоций привлекла внимание СМИ, когда его программное обеспечение было использовано для изучения Моны Лизы, придя к выводу, что портрет принадлежит женщине (а не, как предполагали некоторые, основан на самом да Винчи) и что её загадочная улыбка скорее счастливая, чем грустная[18].
В 2015 году Хуан работал с Энн Виллемсен-Данлап в междисциплинарном проекте по разработке 3D-аватара, сгенерированного компьютером, способного демонстрировать соответствующие эмоции, для использования в онлайн-передаче медицинской информации пациентам[19].
Он также исследовал использование высокопроизводительных вычислений и больших данных для разработки лучших методов глубокого обучения[9]. Одной из изучаемых задач является распознавание лиц. В другом проекте его команда работает с астрономом Робертом Бруннером над обучением нейронной сети прямого распространения для идентификации изображений галактик.
Публикации
К 2010 году Хуан опубликовал более 21 книги и был автором более 600 статей[20].
- Qi, G. J., Aggarwal, C., Tian, Q., Ji, H., Huang, T. S. (2012), "Exploring Context and Content Links in Social Media: A Latent Space Method", IEEE Transactions on Pattern Analysis and Machine Intelligence, pp. 850–862.
- Jaimes, A., Gatica-Perez, D., Sebe, N., Huang, T.S. (2007), "Human-centered Computing: Toward a Human Revolution", IEEE Computer, 40(5), pp. 30–34.
- Cohen, I., Cozman, F., Sebe, N., Cirelo, M., Huang, T.S. (2004), "Semi-supervised Learning of Classifiers: Theory, Algorithms and Their Applications to Human-Computer Interaction", IEEE Transactions on Pattern Analysis and Machine Intelligence, 26(12), pp. 1553–1567.
- Pan, H., Levinson, S.E., Huang, T.S., and Liang, Z.P. (2004), “A Fused HMM Model with Application to Bimodal Speech Processing,” IEEE Transactions On Signal Processing, 52/3, pp. 573– 581.
- Zhou, X.S. and Huang, T.S. (2003), "Relevance Feedback in Image Retrieval: A Comprehensive Review," ACM Multimedia Systems Journal, pp. 536–544.
- Bruckstein, A.M., Holt, R.J., Huang, T.S., and Netravali, A.N. (2000), "New Devices for 3D Pose Estimation: Mantis Eyes, Agam Paintings, Sundials, and Other Space Fiducials," International Journal of Computer Vision, pp. 131–139.
- Image Retrieval: Current Techniques, Promising Directions, and Open Issues // Journal of Visual Communication and Image Representation. — 1999. — Т. 10. — С. 39–62. — doi:10.1006/jvci.1999.0413. – Эта статья получила награду «Самая цитируемая статья десятилетия» от Journal of Visual Communication and Image Representation, 2010[20].
- Lew, M.S., Wong, K., and Huang, T.S. (1994), "Learning and Feature Selection in Stereo Matching," IEEE Transactions on Pattern Analysis and Machine Intelligence, pp. 869–881.
- Arun, K., Huang, T.S., and Blostein, S.D. (1987), "Least-Squares Fitting of Two 3-D Point Sets, IEEE Transactions on Pattern Analysis and Machine Intelligence, pp. 698–700.
- R. Y. Tsai and T.S. Huang, (1984) "Uniqueness and estimation of three-dimensional motion parameters of rigid objects with curved surfaces" IEEE Transactions on Pattern Analysis and Machine Intelligence, pp. 13–27.
Личная жизнь
Награды и звания
За свою карьеру Хуан получил множество наград и званий, в том числе[23]:
Членство
- Член Академии Синика, 2008[24]
- Иностранный член Китайской академии наук, 2002
- Иностранный член Китайской инженерной академии, 2001
- Член Национальной инженерной академии США, 2001[25][26]
- Член Японского общества содействия науке, 1986
- Член SPIE
- Член Международной ассоциации распознавания образов (IAPR)
- Член Оптического общества Америки, 1986
- Пожизненный член IEEE, 1979, за вклад в теорию и применение обработки изображений и цифровой фильтрации
Награды
- Премия Азриэля Розенфельда, 2011
- HP Innovation Research Award, 2009[27]
- Picture Coding Symposium: Pioneering Research in Picture Coding Award, 2006
- IS&T and SPIE Imaging Scientist of the Year Award, 2006
- Okawa Prize for Information and Telecommunications Technology, 2005[28]
- Tau Beta Pi Daniel C. Drucker Eminent Faculty Award, 2005.
- Pan Wen-Yuan Outstanding Research Award, Pan Wen-Yuan Foundation, 2002
- Премия Кин-Сун Фу, Международная ассоциация распознавания образов (IAPR), 2002[29]
- Information Science Award, Association of Intelligent Machinery, 2002
- Медаль Джека Килби, 2001 (совместно с Аруном Н. Нетравали)[30][31]
- IEEE Achievement Award for Contributions to Motion Analysis, 2000
- IEEE Third Millennium Medal, 2000
- Society Award, IEEE Signal Processing Society, 1991
- IEEE ASSP Society Technical Achievement Award, 1988
- A. V. Humboldt U.S. Senior Scientist Award, 1976–77
- Стипендия Гуггенхайма, 1971–72
Именные награды
Хуан руководил более чем 100 аспирантами. В 2012 году в ответ на призывы бывших студентов Джеймса Дж. Куча и Чан Вэнь Чена был создан Фонд Томаса и Маргарет Хуан для исследований аспирантов, чтобы отметить вклад Хуана и его жены как наставников и преподавателей, а также его вклад как исследователя. Фонд будет предоставлять стипендии для поддержки студентов в области интеллектуального взаимодействия человека и компьютера в Институте Бекмана[32][33].