Gensim
Gensim — это открытая библиотека для обучения без учителя, предназначенная для тематического моделирования, индексации документов, поиска по сходству и других задач обработки естественного языка, основанная на современных статистических методах машинного обучения.
Gensim реализована на Питоне и Cython для повышения производительности. Библиотека спроектирована для работы с большими коллекциями текстов посредством потоковой обработки данных и инкрементальных онлайн-алгоритмов, что отличает её от большинства других пакетов машинного обучения, ориентированных только на обработку в оперативной памяти.
Для актуальных версий библиотеки требуется Python версии 3.9 или выше[2], так как поддержка Python 2.7 была прекращена с выходом версии 4.0.0[3].
Общие сведения
| Gensim | |
|---|---|
| Тип | Информационный поиск |
| Автор | Радим Ржегурек |
| Разработчик | RARE Technologies Ltd. |
| Написана на | Python, Cython |
| Операционные системы | Linux, Windows, macOS |
| Первый выпуск | 2009 |
| Последняя версия |
|
| Репозиторий | github.com/RaRe-Technolo… |
| Лицензия | LGPL |
| Сайт | radimrehurek.com/gensim/ |
Возможности
Gensim включает потоковые и параллелизированные реализации алгоритмов fastText[4], word2vec и doc2vec[5], а также латентно-семантический анализ (LSA, LSI, SVD), неотрицательная матричная факторизация (NMF), латентное размещение Дирихле (LDA), tf-idf и случайные проекции.
В библиотеке также реализованы дополнительные модели, среди которых Ensemble LDA (eLDA) для извлечения стабильных тем с помощью ансамбля моделей без необходимости заранее задавать их количество[6], вложения Пуанкаре (Poincaré embeddings) для иерархических представлений данных[7], а также Author-Topic Model и Dynamic Topic Model (DTM)[8][9].
Ряд оригинальных онлайн-алгоритмов Gensim также был представлен в диссертации Радима Ржегурека «Scalability of Semantic Analysis in Natural Language Processing» (2011)[10].
Развитие методов семантического поиска также отражено в совместной статье Ржегурека 2017 года «Semantic vector encoding and similarity search using fulltext search engines»[11].
Использование
Библиотека Gensim по состоянию на 2018 год применяется и цитируется более чем в 1400 коммерческих и академических проектах[12], охватывающих широкий спектр областей — от медицины и анализа страховых претензий до патентного поиска[13]. Программное обеспечение освещалось в новостных публикациях, подкастах и интервью[14].[15][16]
В 2017—2018 годах Радим Ржегурек также представлял проект на профильных конференциях, включая выступления с ключевыми докладами на ECIR 2018 и PyData Warsaw 2017, а также участие в Machine Learning Prague 2018[17].[18][19]
Свободная и коммерческая поддержка
Открытый исходный код Gensim разрабатывается и размещается на GitHub[20], а поддержка сообщества осуществляется через Google Groups[21] и Gitter[22].
Gensim также коммерчески поддерживается компанией rare-technologies.com, которая ранее предлагала программу менторства для студентов и исследовательские стажировки по проекту Gensim через свой Инкубатор, однако эта программа была прекращена и больше не является активной[23]. |url=https://rare-technologies.com/incubator/ |title=Открытый инкубатор Gensim |website=rare-technologies.com |lang=en |access-date=29 июня 2024 |archive-url=https://web.archive.org/web/20250209112135/https://rare-technologies.com/incubator/%7Carchive-date=2025-02-09}}</ref>.
Примечания
- ↑ Release 4.3.2 — 2023.
- ↑ Gensim Python Package Guide. Generalist Programmer (16 ноября 2025). Дата обращения: 28 мая 2026.
- ↑ Gensim repository. GitHub. Дата обращения: 28 мая 2026.
- ↑ Масштабируемое обучение *2vec (англ.). GitHub. RARE Technologies Ltd.. Дата обращения: 28 мая 2026. Архивировано 19 марта 2025 года.
- ↑ Глубокое обучение с word2vec и Gensim (англ.). radimrehurek.com. Radim Řehůřek (17 сентября 2013). Дата обращения: 28 мая 2026. Архивировано 1 октября 2013 года.
- ↑ Ensemble LDA. radimrehurek.com/gensim. Дата обращения: 28 мая 2026.
- ↑ Poincare Embedding with Gensim (27 ноября 2018). Дата обращения: 28 мая 2026.
- ↑ Author Topic Models in Gensim. datawarrior.wordpress.com (26 января 2017). Дата обращения: 28 мая 2026.
- ↑ LdaSeqModel Tutorial. markroxor.github.io. Дата обращения: 28 мая 2026.
- ↑ Řehůřek, Radim Scalability of Semantic Analysis in Natural Language Processing (англ.) (2011). — «my open-source gensim software package that accompanies this thesis». Дата обращения: 28 мая 2026. Архивировано 17 июля 2025 года.
- ↑ Radim Řehůřek Publications. Google Scholar. Дата обращения: 28 мая 2026.
- ↑ Научные цитирования Gensim (англ.). Google Scholar. Дата обращения: 28 мая 2026.
- ↑ Коммерческие пользователи Gensim (англ.). GitHub. Дата обращения: 28 мая 2026. Архивировано 27 января 2017 года.
- ↑ Podcast.__init__ выпуск #71: Gensim и Радим Ржегурек (англ.). Podcast.__init__ (31 июля 2016). Дата обращения: 28 мая 2026. Архивировано 2 февраля 2017 года.
- ↑ Интервью с Радимом Ржегуреком, создателем Gensim (англ.). williamjohnbert.com (3 апреля 2012). Дата обращения: 28 мая 2026. Архивировано 27 июня 2012 года.
- ↑ Интервью DecisionStats: Радим Ржегурек о Gensim и Python (англ.). decisionstats.com (8 декабря 2015). Дата обращения: 28 мая 2026. Архивировано 27 декабря 2024 года.
- ↑ Keynote Speakers (англ.). ECIR 2018 (29 марта 2018). Дата обращения: 28 мая 2026.
- ↑ Winning together: Bridging the gap between academia and industry (Python edition) (англ.). GitHub. Дата обращения: 28 мая 2026.
- ↑ Machine Learning Prague 2018 Program (англ.). ML Prague. Дата обращения: 28 мая 2026.
- ↑ Исходный код Gensim на GitHub (англ.). GitHub. Дата обращения: 28 мая 2026. Архивировано 27 января 2017 года.
- ↑ Список рассылки Gensim на Google Groups (англ.). Google Groups. Дата обращения: 28 мая 2026.
- ↑ Чат Gensim на Gitter (англ.). Gitter. Дата обращения: 28 мая 2026. Архивировано 2 февраля 2017 года.
- ↑ Where to Apply in Early 2026: Startup Accelerators and Incubators List. The Top Voices. Дата обращения: 28 мая 2026.