Повседневное мышление

Повседне́вное мышле́ние — ветвь искусственного интеллекта, целью которой является создание систем с «человеческим здравым смыслом».

Это способность, присущая человеку, делать предположения о типах и сущности обычных ситуаций, с которыми люди сталкиваются каждый день. Такие предположения включают в себя суждения о природе физических объектов, таксономические свойства и намерения людей. Система, обладающая повседневным мышлением, может делать выводы, аналогичные человеческой народной психологии (врождённой способности людей рассуждать о поведении и мотивах других людей) и наивной физике (естественному человеческому пониманию физического мира)[1].

Определения и характеристики

Некоторые определения и характеристики повседневного мышления, предложенные разными авторами:

  • Повседневные знания включают базовые факты о событиях (в том числе действиях) и их последствиях, факты о знаниях и способах их получения, факты о верованиях и желаниях. Также сюда относятся базовые сведения о материальных объектах и их свойствах[2];
  • Повседневные знания отличаются от энциклопедических тем, что относятся к общим сведениям, а не к деталям конкретных объектов[3];
  • Повседневные знания — это «знания о реальном мире, на основании которых могут быть автоматически собраны и интерпретированы другие сведения»[4];
  • Повседневная картина мира включает в себя «время, пространство, физические взаимодействия, людей и так далее»[1];
  • Повседневное мышление — это «все знания о мире, которые мы принимаем как должное, но редко проговариваем вслух»[5];
  • Повседневное мышление — это «универсальные фоновые знания, не относящиеся к какой-либо конкретной предметной области… то, что вы должны знать»[6].

Профессор Нью-Йоркского университета Эрнест Дэвис характеризует повседневные знания как «то, что знает о мире обычный семилетний ребёнок»: о физических объектах, веществах, растениях, животных, человеческом обществе. Обычно сюда не входят академические, специализированные или конвенциональные знания; но иногда они могут включаться. Например, умение играть в карты — это специализированные знания, а понимание, что люди играют в карты ради удовольствия, — повседневные знания[7].

Проблема повседневного мышления

undefined

По сравнению с человеком, современные системы ИИ лишены ряда особенностей повседневного мышления; прежде всего механизма рассуждения о «наивной физике» — пространстве, времени, физических взаимодействиях. Это позволяет даже детям делать выводы вроде «если скатить ручку со стола, она упадёт на пол». Также у человека есть развитая народная психология, помогающая интерпретировать фразы вроде: «Городские советники отказали демонстрантам в разрешении, потому что они пропагандировали насилие». (Для неспециализированного ИИ сложно определить, кто именно пропагандировал насилие — советники или демонстранты)[1][8][9]. Отсутствие «общих знаний» приводит к тому, что ИИ совершает иные ошибки, чем люди — зачастую труднообъяснимые. Например, нынешние беспилотные автомобили не могут рассуждать о расположении и мотивах пешеходов так, как это делают люди, и вынуждены полагаться на иные, неинтуитивные методы избежания столкновений[10][11][12].

К пересекающимся с повседневным мышлением темам относятся: количество и измерения, время и пространство, физика, мышление, общество, планы и цели, действия и изменения[13].

Проблема повседневного знания

Проблема повседневного знания — это исследовательская задача в области искусственного интеллекта, направленная на создание баз данных с общеизвестными знаниями, понятными программам ИИ, работающим с естественным языком[14]. Из-за огромного охвата области задача считается одним из наиболее сложных вызовов исследований ИИ[15]. Чтобы машины могли решать задачи наравне с людьми, им необходимо обладать уровнем интеллекта, близким к человеческому. К таким задачам относятся распознавание объектов, машинный перевод и извлечение знаний из текста. Для успешного выполнения этих задач системе требуется понимание тех же понятий, которыми обладает человек, наделённый повседневным знанием.

Повседневное мышление в интеллектуальных задачах

В 1961 году Бар-Хиллель первым обсудил потребность в практических знаниях для обработки естественного языка в контексте машинного перевода[16]. Одни двусмысленности разрешаются простыми правилами, другие требуют широких знаний о мире и полноценного повседневного мышления. Например, при машинном переводе возникает множество неоднозначностей, которые могли бы быть устранены лишь при глубоком понимании контекста. Системы онлайн-перевода часто справляются с ними при помощи поиска аналогий: так, в предложениях «The electrician is working» и «The telephone is working» английское слово «working» машинно переводится по смыслу — «работает» как «трудиться» для электрика и как «исправен» для телефона, поскольку контекст текста показывает, что соответствующие слова часто встречаются в соответствующем контексте. Однако такой статистический подход, эффективный в простых случаях, часто проваливается в сложных. Современные программы решают простые языковые задачи, манипулируя короткими фразами и отдельными словами, но не стремятся к более глубокому пониманию и ориентированы на краткосрочные результаты.

Компьютерное зрение

Похожие проблемы встречаются в области компьютерного зрения[1][17]. Например, на фотографии ванной комнаты даже частично видимые мелкие предметы (салфетки, бутыльки) можно распознать по окружающим объектам (унитаз, раковина, ванна) и функциональному назначению помещения. В изоляции такие предметы были бы неузнаваемы.

Аналогичные трудности возникают при анализе видеоматериалов. Для синхронного распознавания и построения смысловых связей требуется не только классификация действий, но также понимание намерений персонажей и предположения, основанные на их поведении. Современные методы способны лишь выделять простые действия и отслеживать персонажей, но не предугадывать развитие событий и не выстраивать причинно-следственные цепочки.

Манипулирование роботами

Повседневное мышление необходимо и для автономных роботов, работающих в неконтролируемой среде. Например, если робот-официант на приёме видит, что бокал, который он держит, разбит, он не должен наливать туда напиток, а подобрать другой. Задачи, кажущиеся человеку тривиальными, требуют крупных усилий для программной реализации[1]

Достижения в автоматизации повседневного мышления

Значительный прогресс достигнут в автоматизации отдельных областей повседневного мышления: таксономического вывода, выводах о действиях и изменениях, о времени. Для каждой из сфер существуют отдельные теории, позволяющие делать широкий круг попутных выводов[18].

Таксономическое рассуждение

Таксономия — это иерархия объектов, категорий и их взаимоотношений. Три основные связи:

  • Индивидуальный объект является экземпляром категории. Например, объект Твити — экземпляр категории дрозд;
  • Одна категория является подмножеством другой (например, дрозд — подмножество птиц);
  • Две категории несовместимы (например, дрозд и пингвин).

Транзитивность — важный вывод таксономии: если Твити — это дрозд, а дрозд — это птица, то Твити — птица. Наследование свойств: если Твити — дрозд, а дрозд — птица, и птица имеет свойство летать, то и Твити, и дрозд — «умеют летать».

Использование абстрактных категорий осложняет выделение иерархий. Простые таксономии часто реализуются в ИИ; например, система WordNet строится на таксономии английских слов и их значений, а системы web mining для повседневных знаний чаще всего ориентируются на таксономические связи[1].

Действия и изменения

Теория действий, событий и изменений — ещё одно развитое направление повседневных рассуждений[19]. Доказанность и алгоритмизация возможны при выполнении условий:

  • События атомарны (происходит только одно событие за раз), система учитывает состояние мира только до и после события;
  • Каждое изменение вызывается событиями;
  • События детерминированы: состояние после наступления события определяется исходным состоянием и спецификой события;
  • Есть только один актор, все события — его действия;
  • Начальное состояние мира известно или вычислимо.

Временные рассуждения

Временные рассуждения — это способность делать выводы о времени, длительности и временных интервалах. Например, если известно, что Моцарт родился позже Гайдна, но умер раньше, можно заключить, что Моцарт умер моложе Гайдна. Такие выводы сводятся к решению систем линейных неравенств[20].

Интеграция временных рассуждений с пониманием естественного языка гораздо сложнее из-за контекстной вариативности языковых выражений[21]. Даже простые задачи, например таймстемпинг процедур, реализуются с ошибкой.

Качественное рассуждение

Качественное рассуждение[22] — ещё одна область, успешно формализуемая на основе повседневного мышления. Она предполагает оценку направления изменения в системе связанных величин: если цена акций растёт — их будут продавать меньше; если в некой экосистеме становится меньше волков — падает уровень гибели ягнят. Теорию качественного рассуждения впервые изложил Йохан де Клеер, анализируя движение объекта по американским горкам.

Качественное рассуждение применяется в физике, биологии, инженерии, экологии, текстовых анализах и других дисциплинах, а также лежит в основе практических приложений и программ аналогического поиска.

Проблемы автоматизации повседневного мышления

По состоянию на 2014 год коммерческие системы, включающие элементы повседневного мышления, используют в основном статистику, а не полноценное рассуждение. Современные программы оперируют отдельными словами и не моделируют глубокого понимания. Эрнест Дэвис и Гэри Маркус выделяют пять основных препятствий на пути к созданию полноценного «повседневного разумателя»[1]:

  • Во-первых, ряд областей, задействованных в повседневном мышлении, частично не формализован. Передача знаний о коммуникации, взаимодействиях и процессах далека от завершения;
  • Во-вторых, простые ситуации зачастую содержат логическую сложность сверх человеческих интуитивных способностей; известны только некоторые их аспекты;
  • В-третьих, привлекается рассуждение, опирающееся не только на достоверность, но и на вероятность, основанную на ненадёжных данных — это требует моделей вероятностной логики и немонотонного вывода;
  • В-четвёртых, в ряде областей единичные шаблонные случаи встречаются очень часто, а реально встречающихся возможных вариантов — огромное количество, но большинство крайне редки;
  • В-пятых, при формулировании вывода у системы возникает проблема выбора уровня абстракции.

В 2018 году программы демонстрировали крайне низкие результаты на бенчмарках по повседневному мышлению, таких как Winograd Schema Challenge[23]. Решение задачи достижения человеческого уровня компетентности в «повседневных знаниях» считается AI-complete (то есть эквивалентным созданию универсального ИИ)[24][25]. Некоторые исследователи считают, что данных под контролем обучения недостаточно для создания универсального ИИ с повседневным мышлением, и переходят к менее супервизированным методам[26].

Подходы и техники

Изучение повседневного мышления делится на подходы, основанные на знаниях (knowledge-based), и на методы машинного обучения, работающие с большими массивами данных, причём их интеграция остаётся ограниченной. Также выделяют краудсорсинговые методики, предполагающие сбор знаний по коллективному вкладу непрофессионалов. Знание-ориентированные методы базируются либо на формализованной математической логике, либо на неформальном эмпирическом анализе.

В рамках подходов на основе знаний, эксперты структурируют требования к выводам, необходимым для решения конкретной задачи. Выделяют строго математические методы (формализованные на бумаге в рамках ограниченных областей); неформальные (построенные на интуиции и общеповеденческих фактах); и масштабные проекты. Ключевые техники пополнения повседневных знаний из интернета — это web mining и краудсорсинг.

Модель COMET (2019), сочетающая архитектуру GPT и уже существующие базы повседневных знаний, например ConceptNet, сообщает о достижении уровня генерации заключений, близкого к человеческим оценкам. Тем не менее, как и другие современные разработки, модель сильно зависит от языковых паттернов, не обладая глубокой трактовкой повседневных понятий. Альтернативные подходы включают обучение по описаниям визуальных сцен либо по тексту, моделирующему ситуацию повседневной физики[6][27].

Примечания

  1. 1 2 3 4 5 6 7 Дэвис, Эрнест; Маркус, Гэри (2015). “Commonsense Reasoning and Commonsense Knowledge in Artificial Intelligence”. Communications of the ACM [англ.]. 58 (9): 92—103. DOI:10.1145/2701413.
  2. McCarthy, John. «Artificial intelligence, logic and formalizing common sense.» Philosophical logic and artificial intelligence. Springer, Dordrecht, 1989. 161—190.
  3. Тэндон, Никет; Вардэ, Апарна С.; де Мело, Жерар (22 февраля 2018). “Commonsense Knowledge in Machine Intelligence”. ACM SIGMOD Record [англ.]. 46 (4): 49—52. DOI:10.1145/3186549.3186562.
  4. Matuszek, Cynthia, et al. «Searching for common sense: Populating cyc from the web.» UMBC Computer Science and Electrical Engineering Department Collection (2005).
  5. “How to Teach Artificial Intelligence Some Common Sense”. Wired [англ.]. 13 ноября 2018. Дата обращения 11 февраля 2021.
  6. 1 2 Common Sense Comes to Computers (англ.), Quanta Magazine (30 апреля 2020). Архивировано 30 апреля 2020 года. Дата обращения: 3 мая 2020.
  7. Дэвис, Эрнест (25 августа 2017). “Logical Formalizations of Commonsense Reasoning: A Survey”. Journal of Artificial Intelligence Research [англ.]. 59: 651—723. DOI:10.1613/jair.5339.
  8. Cultivating Common Sense, Discover Magazine (2017). Архивировано 25 марта 2018. Дата обращения: 24 марта 2018.
  9. Виноград, Терри (Январь 1972). “Understanding natural language”. Cognitive Psychology [англ.]. 3 (1): 1—191. DOI:10.1016/0010-0285(72)90002-3.
  10. Don't worry: Autonomous cars aren't coming tomorrow (or next year), Autoweek (2016). Архивировано 25 марта 2018. Дата обращения: 24 марта 2018.
  11. Boston may be famous for bad drivers, but it's the testing ground for a smarter self-driving car, MIT Technology Review (2017). Архивировано 22 августа 2020. Дата обращения: 27 марта 2018.
  12. Пракен, Генри (31 августа 2017). “On the problem of making autonomous vehicles conform to traffic law”. Artificial Intelligence and Law [англ.]. 25 (3): 341—363. DOI:10.1007/s10506-017-9210-0.
  13. Thomason, Richmond (27 августа 2003). “Logic and Artificial Intelligence” [англ.]. Metaphysics Research Lab, Stanford University. Дата обращения 2024-06-22.
  14. Artificial intelligence Programs. Elsevier. Дата обращения: 22 июня 2024. Архивировано 5 ноября 2011 года.
  15. Artificial intelligence applications. Udacity. Дата обращения: 22 июня 2024. Архивировано 2 мая 2015 года.
  16. Bar Hillel Artificial Intelligence Research Machine Translation (англ.). The Guardian. Дата обращения: 22 июня 2024.
  17. Antol, Stanislaw, и др. «VQA: Visual question answering.» Proceedings of the IEEE International Conference on Computer Vision, 2015.
  18. Taxonomy. Encyclopedia.com. Дата обращения: 22 июня 2024. Архивировано 22 сентября 2015 года.
  19. Action and change in Commonsense reasoning (англ.). Stanford.edu. Дата обращения: 22 июня 2024. Архивировано 24 декабря 2024 года.
  20. Temporal reasoning (англ.). Stanford.edu. Дата обращения: 22 июня 2024. Архивировано 22 июня 2004 года.
  21. Liu, Hugo, и Сингх, Пуш. «Commonsense reasoning in and over natural language». International Conference on Knowledge-Based and Intelligent Information and Engineering Systems, Springer, Berlin, Heidelberg, 2004.
  22. Qualitative reasoning (англ.). TechCrunch (9 августа 2014). Дата обращения: 22 июня 2024. Архивировано 8 сентября 2025 года.
  23. The Winograd Schema Challenge (англ.). cs.nyu.edu. Дата обращения: 9 января 2018. Архивировано 4 августа 2016 года.
  24. Ямпольский, Роман В. «AI-Complete, AI-Hard, or AI-Easy-Classification of Problems in AI.» MAICS. 2012.
  25. Andrich, C, Novosel, L, Hrnkas, B. (2009). Common Sense Knowledge. Information Search and Retrieval, 2009.
  26. Computers Already Learn From Us. But Can They Teach Themselves? (англ.), The New York Times (8 апреля 2020). Архивировано 19 сентября 2025 года. Дата обращения: 3 мая 2020.
  27. Bosselut, Antoine, и др. «Comet: Commonsense transformers for automatic knowledge graph construction.» arXiv preprint arXiv:1906.05317 (2019).

Литература

Категории