Коннекционизм

Коннекциони́зм (англ. connectionism) — подход в когнитивных науках и исследовании человеческих психических процессов, основанный на использовании математических моделей, известных как коннекционистские сети или искусственные нейронные сети[1].

undefined

В развитии коннекционизма выделяют несколько «волн». Первая волна началась в 1943 году с работ Уоррена МакКаллока и Уолтера Питтса, которые стремились математически описать нейронные цепи[2], и Фрэнка Розенблатта, который в 1958 году опубликовал статью «Перцептрон: вероятностная модель хранения и организации информации в мозге» в Psychological Review, работая в Корнельской аэрокосмической лаборатории[3].

Завершилась первая волна в 1969 году после выхода книги Марвина Минского и Сеймура Пейперта, критикующей ограничения исходного перцептрона, что привело к снижению финансирования исследований в этой области в США[4]. Термин «коннекционистская модель» был вновь введён Джеромом Фельдманом и Даной Баллардом в статье 1982 года в журнале Cognitive Science.

Вторая волна началась в конце 1980-х годов, после выхода в 1987 году книги о параллельной распределённой обработке (Parallel Distributed Processing) Джеймса МакКлелланда, Дэвида Румельхарта и соавторов, где были представлены усовершенствования простой идеи перцептрона: введение промежуточных «скрытых» слоёв и использование сигмоидальной функции активации вместо прежней пороговой функции. Их работа базировалась на исследованиях Джона Хопфилда, изучавшего математические характеристики сигмоидальных функций активации[3]. В конце 1980-х и начале 1990-х годов в психологии и философии обсуждалась возможность парадигмального сдвига в сторону коннекционизма[5]. Преимуществами такого подхода стали универсальность, структурная близость к биологическим нейронным сетям, низкая требовательность к врождённым структурам, способность к грациозной деградации[6]. К недостаткам относили сложность понимания внутренней работы ИНС или объяснения композициональности психических представлений, а также трудности объяснения феноменов на более высоком уровне[7].

Современная, «третья» волна связана с развитием глубинного обучения, что позволило создавать большие языковые модели[3]. Успех глубоких нейронных сетей за последнее десятилетие значительно повысил популярность этого подхода, однако сложность и масштаб таких сетей привели к новым проблемам интерпретируемости[8].

Основной принцип

Центральная идея коннекционизма состоит в том, что психические явления могут быть описаны через взаимосвязанные сети простых и, как правило, однородных элементов. Форма связей и сами элементы могут различаться в зависимости от модели. Так, элементы сети могут моделировать нейроны, а связи — синапсы, как в мозге человека. Этот принцип рассматривается как альтернатива подходу традиционного ИИ (GOFAI) и классическим теориям разума, основанным на символьных вычислениях, однако вопрос о совместимости этих подходов остаётся предметом обсуждений[8].

Функция активации

Внутренние состояния сети меняются во времени благодаря передаче сигналов от нейронов одного слоя к следующему (в прямой сети) или к предыдущему (в рекуррентных сетях). Открытие нелинейных функций активации позволило реализовать вторую волну коннекционизма.

Память и обучение

Нейронные сети основаны на двух принципах:

  1. Любое ментальное состояние можно представить как n-мерный вектор числовых значений активации по элементам сети.
  2. Память и обучение возникают за счёт модификации «весов» связей между элементами сети, как правило, в виде матрицы . Веса корректируются по определённому правилу обучения или алгоритму, например, по принципу Гебба.

Различия между моделями обусловлены:

  • Интерпретацией элементов: элементы могут пониматься как отдельные нейроны или их группы;
  • Определением активации: активация может задаваться по-разному, например, в машине Больцмана — это, скорее, вероятность генерации сигнала, определяется через логистическую функцию по сумме входов;
  • Алгоритмом обучения: различные сети модифицируют связи разными способами. Любые математически задаваемые изменения весов называются «алгоритмом обучения».

Биологическая правдоподобность

Работы в области коннекционизма, как правило, не требуют строгого соответствия биологическим процессам[9]. Одной из областей, где модели считаются биологически мало реалистичными, является обратное распространение ошибки, необходимое для обучения[10], однако такие процессы могут объяснять часть биологических проявлений активности мозга при исследовании вызванных потенциалов — например, компонентов N400 и P600 в нейрофизике[11]. Многие рекуррентные сети также используют теорию динамических систем. Исследователи, например, Пол Смоленский, считают, что коннекционистские модели станут полностью непрерывными, многомерными нелинейными динамическими системами.

Исторические предпосылки

Истоки коннекционистских принципов можно проследить в работах ранней психологии, таких как труды Уильяма Джеймса[12]. В конце XIX века были популярны психологические теории, основывающиеся на знании о мозге человека. Уже в 1869 году невролог Джон Хаглингс-Джексон рассматривал распределённые системы с несколькими уровнями. Вслед за ним Герберт Спенсер («Principles of Psychology», 3-е изд., 1872) и Зигмунд Фрейд («Проект научной психологии», 1895) также развивали коннекционистские или близкие к ним теории. Эти теории часто имели спекулятивный характер. В начале XX века Эдвард Торндайк уже рассматривал обучение человека как процесс, реализуемый коннекционистской сетью[13].

Сети Хопфилда имели предшественников в модели Изинга, разработанной Вильгельмом Ленцем (1920) и Эрнстом Изингом (1925), хотя их модель не принимала во внимание время. Компьютерное моделирование по методу Монте-Карло для задачи Изинга стало возможным только с появлением ЭВМ в 1950-х годах[14].

Первая волна

Первая волна началась в 1943 году с работ Уоррена МакКаллока и Уолтера Питтса, которые математически моделировали нейронные цепи. МакКаллок и Питтс показали, что нейронные системы могут реализовать логику первого порядка: их классическая статья «Логическое исчисление идей, скрытых в деятельности нервной системы» (1943) считается ключевой для этого направления. Они испытали влияние работ Николая Рашевского 1930-х годов и идей из Principia Mathematica[2].

Доналд Хебб предложил принцип обучения — Хеббовское обучение, а Карл Лешли отстаивал идею распределённых представлений, поскольку не смог найти локализованных энграмм в ходе многочисленных экспериментов по повреждению мозга. Фридрих Хайек независимо пришёл к подобной модели сначала в неопубликованной рукописи 1920 года[15][16], а затем — в книге 1952 года[17].

Машины-перцептроны были предложены и реализованы Фрэнком Розенблаттом, который в 1958 году опубликовал статью «Перцептрон: вероятностная модель хранения и организации информации в мозге», ссылаясь на Хебба, Хайека, Аттли и Эшби.

Другой вариант коннекционистской модели — реляционная сеть, разработанная лингвистом Сидни Лэмбом в 1960-х.

Группа исследователей под руководством Видро экспериментально искала методы обучения двухслойных сетей ADALINE (MADALINE), но их успех был ограничен[18].

Метод обучения многослойных перцептронов произвольной глубины был опубликован Алексеем Ивахненко и Валентином Лапой в 1965 году — так называемый метод группового учёта аргументов (МГУА). Этот способ предполагает поэтапное обучение слоями с регрессионным анализом и отсевом лишних узлов на промежуточных слоях на основе валидационных выборок[19].

В 1967 году Сюнъити Амари опубликовал работу об обучении многослойных перцептронов методом стохастического градиентного спуска[20]. Эксперименты Амари и его ученика Сайто с 5-слойным МЛП с двумя изменяемыми слоями подтвердили формирование внутренних представлений для классификации нелинейно неразделимых образцов[21].

В 1972 году Сюнъити Амари предложил один из первых примеров самоорганизующейся нейросети[22].

Зима нейросетей

В конце 1960-х в сообществе искусственного интеллекта возникли сомнения о реальной пользе нейронных сетей. Примерно с конца 1960-х по 1970-е наблюдался спад исследований и публикаций в этой области, так называемая «зима нейросетей», когда ИИ переключился на символьные методы. Публикация книги Perceptrons (1969) считается катализатором этого явления.

Вторая волна

Вторая волна началась в начале 1980-х. Ключевыми публикациями считаются статьи Джона Хопфилда (1982)[23], популяризовавшие сети Хопфилда, статья 1986 года об обратном распространении ошибки[24], а также двухтомник Parallel Distributed Processing (PDP, 1987) Дж. МакКлелланда, Д. Румельхарта и другие, в которых описаны такие усовершенствования, как скрытые слои и сигмоидальная функция активации.

Вклад Хопфилда заключался в применении методов статистической механики для обоснования математики нейросетей[3].

Важной вехой стала теорема о универсальной аппроксимации функций искусственными нейронными сетями[25].

В этот период появились известные демонстрационные проекты: NETtalk (1987) учился произносить написанный английский и приобрёл популярность в СМИ[26], TD-Gammon (1992) достиг уровня сильнейших игроков в нарды[27].

Дебаты: коннекционизм против компьютерализм

С ростом популярности коннекционизма в конце 1980-х года многие исследователи (включая Джерри Фодора, Стивена Пинкера и других) выступили против, считая, что коннекционизм угрожает результатам классического компьютерализма, согласно которому познание осуществляется посредством формальных операций над символами (аналогично машине Тьюринга). Критики рассматривали коннекционизм как возврат к ассоцианизму и отказу от идеи языка мышления, в то время как сторонникам эти черты, напротив, казались привлекательными.

Дискуссия приобрела антагонистический характер, хотя многие авторы указывали на совместимость подходов. Ключевые отличия:

  • Компьютералисты строят символьные модели, схожие с мозгом структурно, тогда как коннекционисты стремятся моделировать низкоуровневую структуру самих нейронных связей;
  • Компьютералисты анализируют символьные структуры и синтаксические правила, а коннекционисты делают упор на обучение на стимул-ответ и хранение знаний в весах соединений;
  • Считается, что ментальная деятельность у первых отражает манипуляцию эксплицитными символами, вторые придерживаются представления о комплексной динамике соединений;
  • Часто компьютералисты настаивают на доменно-специфических подсистемах, коннекционисты же ограничиваются универсальными механизмами обучения.

Тем не менее, возможно, что нейронные сети — это физиологическая основа символьных систем, и на практике нейросети могут моделировать манипуляцию символами так, как это предусмотрено моделями компьютерализма[28]. Были предложены архитектуры, сочетающие оба подхода, например Смоленского — ICS, и CLARION Рона Суна. Однако спор остаётся открытым по вопросу: лежит ли манипуляция символами в основе мышления вообще, или является лишь высокоуровневым описанием.

Основная трудность в дискуссии заключалась в том, могли ли нейронные сети воспроизвести синтаксическую структуру рассуждений. Это было продемонстрировано для моделей с быстрой переменной связки, выходящей за рамки стандартных коннекционистских моделей[28].

Символьные модели легче интерпретировать, а коннекционистские более «тёмные» («чёрный ящик»), зачастую описываются лишь через параметры структуры и обучения. В этом смысле, коннекционистские модели воплощают теорию когнитивных процессов, но не всегда дают объяснение конкретного (смоделированного) феномена. Некоторые авторы считают, что это вызвано эмерджентными свойствами сетей, которые можно описывать в символьном виде[29].

В 2000-х интерес к динамическим системам в философии сознания добавил к спорам новый ракурс[30][31]; некоторые авторы считают, что граница между коннекционизмом и компьютерализмом теперь может быть описана как разрыв между компьютерализмом и динамическими системами.

В 2014 году Алекс Грейвс и сотрудники из DeepMind опубликовали работы, в которых представили структуру глубокой нейросети «Нейронная машина Тьюринга» (англ. Neural Turing Machine)[32], способной читать и записывать символы в память. Реляционные сети, опубликованные DeepMind, осуществляют объектные представления и манипуляции, что показывает возможность интеграции символических и нейросетевых подходов.

Символизм против коннекционизма

Субсимволическая парадигма Смоленского[33][34] сталкивается с проблемой Фодора-Пайлишина[35], выдвинутой классической символьной теорией. Чтобы быть полноценной альтернативой, субсимволическая теория должна объяснить систематичность и композиционность в языке и мышлении, не прибегая к классической структуре ментальных представлений. В противном случае, она либо не способна объяснить систематичность, либо превращается в архитектурную реализацию классического символизма (и уже не является собственно альтернативой)[36]. Классический символизм характеризуется (1) комбинаторным синтаксисом и семантикой, (2) структура-зависимыми операциями — всё это воплощено в «языке мысли» Фодора (LOT)[37].

В современных нейросетевых подходах данный вызов частично преодолён — например, в архитектуре Смоленского ICS[38], а также в работах Вернинга и Мэя по осцилляторным сетям[39]. Обзор приводят также Bechtel & Abrahamsen[40], Marcus[41] и Maurer[42].

Недавно Хэн Чжан и соавторы показали, что формализмы представления знаний с равной выразительной мощностью рекурсивно изоморфны[43]. Это значит, что между символьным и коннекционистским способами представления знаний нет принципиальной разницы для задач общего искусственного интеллекта, а изучение одного подхода может обогащать другой.

Примечания

  1. Internet Encyclopedia of Philosophy (англ.). iep.utm.edu. Дата обращения: 19 августа 2023.
  2. 1 2 McCulloch, Warren S.; Pitts, Walter (1 декабря 1943). “A logical calculus of the ideas immanent in nervous activity”. The Bulletin of Mathematical Biophysics [англ.]. 5 (4): 115—133. DOI:10.1007/BF02478259. ISSN 1522-9602.
  3. 1 2 3 4 Berkeley, Istvan S. N. (2019). “The Curious Case of Connectionism”. Open Philosophy [англ.]. 2019 (2): 190—205. DOI:10.1515/opphil-2019-0018. S2CID 201061823.
  4. Boden, Margaret. Mind as Machine: A History of Cognitive Science : [англ.]. — Оксфорд : Oxford U.P, 2006. — P. 914. — ISBN 978-0-262-63268-3.
  5. Schneider, Walter (1987). “Connectionism: Is it a Paradigm Shift for Psychology?”. Behavior Research Methods, Instruments, & Computers. 19: 73—83. DOI:10.1515/opphil-2019-0018. S2CID 201061823.
  6. Marcus, Gary F. The Algebraic Mind: Integrating Connectionism and Cognitive Science (Learning, Development, and Conceptual Change). — Кембридж (Массачусетс) : MIT Press, 2001. — P. 27–28. — ISBN 978-0-262-63268-3.
  7. Smolensky, Paul (1999). “Grammar-based Connectionist Approaches to Language”. Cognitive Science [англ.]. 23 (4): 589—613. DOI:10.1207/s15516709cog2304_9.
  8. 1 2 Garson, James. The Stanford Encyclopedia of Philosophy : [англ.]. — Metaphysics Research Lab, Stanford University, 27 ноября 2018.
  9. Encephalos Journal (англ.). www.encephalos.gr. Дата обращения: 20 февраля 2018.
  10. Crick, Francis (январь 1989). “The recent excitement about neural networks”. Nature [англ.]. 337 (6203): 129—132. Bibcode:1989Natur.337..129C. DOI:10.1038/337129a0. ISSN 1476-4687. PMID 2911347. Проверьте дату в |date= (справка на английском)
  11. Fitz, Hartmut; Chang, Franklin (1 июня 2019). “Language ERPs reflect learning through prediction error propagation”. Cognitive Psychology. 111: 15—52. DOI:10.1016/j.cogpsych.2019.03.002. HDL:21.11116/0000-0003-474F-6. ISSN 0010-0285. PMID 30921626. S2CID 85501792.
  12. Anderson, James A. Chapter 1: (1890) William James Psychology (Brief Course) // Neurocomputing: Foundations of Research : [англ.] / James A. Anderson, Edward Rosenfeld. — A Bradford Book, 1989. — P. 1. — ISBN 978-0-262-51048-6.
  13. Эдвард Торндайк (1931) Human Learning, с. 122
  14. Brush, Stephen G. (1967). “History of the Lenz-Ising Model”. Reviews of Modern Physics. 39 (4): 883—893. Bibcode:1967RvMP...39..883B. DOI:10.1103/RevModPhys.39.883.
  15. Hayek, Friedrich A. [1920] 1991. Beiträge zur Theorie der Entwicklung des Bewusstseins. Manuscript, translated by Grete Heinz.
  16. Caldwell, Bruce (2004). “Some Reflections on F.A. Hayek's The Sensory Order”. Journal of Bioeconomics [англ.]. 6 (3): 239—254. DOI:10.1007/s10818-004-5505-9. ISSN 1387-6996. S2CID 144437624.
  17. Hayek, F. A. The Sensory Order: An Inquiry into the Foundations of Theoretical Psychology : [англ.]. — 1. — The University of Chicago Press, 15 сентября 2012.
  18. Olazaran Rodriguez, Jose Miguel. A historical sociology of neural network research. PhD Dissertation. University of Edinburgh, 1991, с. 124—129.
  19. Ivakhnenko, A. G. Cybernetics and forecasting techniques / A. G. Ivakhnenko, Valentin Grigorʹevich Lapa. — American Elsevier Pub. Co., 1967.
  20. Robbins, H.; Monro, S. (1951). “A Stochastic Approximation Method”. The Annals of Mathematical Statistics. 22 (3): 400. DOI:10.1214/aoms/1177729586.
  21. Schmidhuber, Jürgen (2022), Annotated History of Modern AI and Deep Learning, arΧiv:2212.11279 [cs.NE]. 
  22. Amari, S.-I. (ноябрь 1972). “Learning Patterns and Pattern Sequences by Self-Organizing Nets of Threshold Elements”. IEEE Transactions on Computers. C-21 (11): 1197—1206. DOI:10.1109/T-C.1972.223477. ISSN 0018-9340. Проверьте дату в |date= (справка на английском)
  23. Hopfield, J J (апрель 1982). “Neural networks and physical systems with emergent collective computational abilities”. Proceedings of the National Academy of Sciences [англ.]. 79 (8): 2554—2558. Bibcode:1982PNAS...79.2554H. DOI:10.1073/pnas.79.8.2554. ISSN 0027-8424. PMC 346238. PMID 6953413. Проверьте дату в |date= (справка на английском)
  24. Rumelhart, David E.; Hinton, Geoffrey E.; Williams, Ronald J. (октябрь 1986). “Learning representations by back-propagating errors”. Nature [англ.]. 323 (6088): 533—536. Bibcode:1986Natur.323..533R. DOI:10.1038/323533a0. ISSN 1476-4687. Проверьте дату в |date= (справка на английском)
  25. Cybenko, G. (1 декабря 1989). “Approximation by superpositions of a sigmoidal function”. Mathematics of Control, Signals and Systems [англ.]. 2 (4): 303—314. Bibcode:1989MCSS....2..303C. DOI:10.1007/BF02551274. ISSN 1435-568X.
  26. Sejnowski, Terrence J. The deep learning revolution : [англ.]. — Кембридж (Массачусетс) : The MIT Press, 2018. — ISBN 978-0-262-03803-4.
  27. Sammut, Claude & Webb, Geoffrey I., eds. (2010), TD-Gammon, Encyclopedia of Machine Learning, Boston, MA: Springer US, pp. 955–956, ISBN 978-0-387-30164-8, doi:10.1007/978-0-387-30164-8_813, <https://doi.org/10.1007/978-0-387-30164-8_813>. Проверено 25 декабря 2023.. 
  28. 1 2 Chang, Franklin (2002). “Symbolically speaking: a connectionist model of sentence production”. Cognitive Science [англ.]. 26 (5): 609—651. DOI:10.1207/s15516709cog2605_3. ISSN 1551-6709.
  29. Ellis, Nick C. (1998). “Emergentism, Connectionism and Language Learning” (PDF). Language Learning. 48 (4): 631—664. DOI:10.1111/0023-8333.00063.
  30. Van Gelder, Tim (1998). “The dynamical hypothesis in cognitive science”. Behavioral and Brain Sciences [англ.]. 21 (5): 615—628, обсуждение 629–665. DOI:10.1017/S0140525X98001733. PMID 10097022. Дата обращения 2022-05-28.
  31. Beer, Randall D. (март 2000). “Dynamical approaches to cognitive science”. Trends in Cognitive Sciences. 4 (3): 91—99. DOI:10.1016/s1364-6613(99)01440-0. ISSN 1364-6613. PMID 10689343. S2CID 16515284. Проверьте дату в |date= (справка на английском)
  32. Graves, Alex (2014), Neural Turing Machines, arΧiv:1410.5401 [cs.NE]. 
  33. Смоленский П. On the proper treatment of connectionism. Behavioral and Brain Sciences. 1988. № 11. С. 1—74.
  34. Смоленский П. The constituent structure of connectionist mental states: a reply to Fodor and Pylyshyn. В: Horgan T., Tienson J. (ред.) Spindel Conference 1987: Connectionism and the Philosophy of Mind. Southern Journal of Philosophy, спецвыпуск, 1988. Т. 26. С. 137—161.
  35. Fodor J.A., Pylyshyn Z.W. Connectionism and cognitive architecture: a critical analysis. Cognition. 1988. Т. 28. С. 12-13, 33-50.
  36. Fodor J.A., McLaughlin B. Connectionism and the problem of systematicity: Why Smolensky’s solution doesn’t work. Cognition. 1990. Т. 35. С. 183—184.
  37. Fodor J.A. The language of thought. Harvester Press, 1976.
    Fodor J.A. LOT 2: The language of thought revisited. Clarendon Press, 2008.
  38. Smolenky P. Reply: Constituent structure and explanation in an integrated connectionist / symbolic cognitive architecture. В: MacDonald C., MacDonald G. (ред.) Connectionism: Debates on psychological explanation. Blackwell Publishers, 1995. Т. 2. С. 224, 236—239 и др.
  39. Werning M. Neuronal synchronization, covariation, and compositional representation. В: Werning M., Machery E., Schurz G. (ред.) The compositionality of meaning and content. Vol. II, 2005.
    Werning M. Non-symbolic compositional representation and its neuronal foundation: towards an emulative semantics. В: Werning M., Hinzen W., Machery E. (ред.) The Oxford Handbook of Compositionality. 2012.
    Maye A., Werning M. Neuronal synchronization: from dynamics feature binding to compositional representations. Chaos and Complexity Letters. Т. 2. С. 315—325.
  40. Bechtel W., Abrahamsen A. Connectionism and the Mind. Blackwell Publishers, 2002.
  41. Marcus G.F. The algebraic mind. The MIT Press, 2001.
  42. Maurer H. Cognitive science: Integrative synchronization mechanisms in cognitive neuroarchitectures of the modern connectionism. CRC Press, 2021. https://doi.org/10.1201/9781351043526
  43. Zhang, Heng; Jiang, Guifei; Quan, Donghui (11 апреля 2025). “A Theory of Formalisms for Representing Knowledge”. Proceedings of the AAAI Conference on Artificial Intelligence [англ.]. 39 (14): 15257—15264. arXiv:2412.11855. DOI:10.1609/aaai.v39i14.33674. ISSN 2374-3468.

Литература

  • Feldman, Jerome; Ballard, Dana. Connectionist models and their properties (1982). Cognitive Science. V6, Issue 3, pp. 205—254.
  • Rumelhart, D.E.; McClelland, J.L.; PDP Research Group. Parallel Distributed Processing: Explorations in the Microstructure of Cognition. Volume 1: Foundations. Cambridge, Massachusetts: MIT Press, 1986. ISBN 978-0-262-68053-0.
  • McClelland, J.L.; Rumelhart, D.E.; PDP Research Group. Parallel Distributed Processing: Explorations in the Microstructure of Cognition. Volume 2: Psychological and Biological Models. Cambridge, Massachusetts: MIT Press, 1986. ISBN 978-0-262-63110-5.
  • Pinker, S.; Mehler, J. Connections and Symbols. Cambridge, MA: MIT Press, 1988. ISBN 978-0-262-66064-8.
  • Elman, J.L.; Bates, E.A.; Johnson, M.H.; Karmiloff-Smith, A.; Parisi, D.; Plunkett, K. Rethinking Innateness: A connectionist perspective on development. Cambridge, MA: MIT Press, 1996. ISBN 978-0-262-55030-7.
  • Marcus, Gary F. The Algebraic Mind: Integrating Connectionism and Cognitive Science. Cambridge, Massachusetts: MIT Press, 2001. ISBN 978-0-262-63268-3.
  • Medler, D. A. A Brief History of Connectionism. Neural Computing Surveys, 1 (1998), 61-101. [1]
  • Maurer, Harald. Cognitive Science: Integrative Synchronization Mechanisms in Cognitive Neuroarchitectures of the Modern Connectionism. Boca Raton/FL: CRC Press, 2021. https://doi.org/10.1201/9781351043526. ISBN 978-1-351-04352-6.