KNIME

KNIME (сокращение от Konstanz Information Miner) — программная платформа для анализа, интеграции и визуализации данных, а также создания отчётов. Система поддерживает модульный принцип построения аналитических процессов («строительные блоки»), позволяя наглядно собирать пайплайны для машинного обучения, обработки и визуализации данных, интеграции различных источников с помощью JDBC и минимальным (или вовсе без) программированием. Платформа распространяется свободно как открытое программное обеспечение под лицензией GNU GPL.

KNIME используется с 2006 года в фармацевтических исследованиях[1], а также в таких областях, как управление взаимоотношениями с клиентами (CRM), анализ бизнес-данных, бизнес-аналитика, текстовая аналитика и финансовый анализ[2]. В последнее время предпринимаются попытки применения KNIME как инструмента для роботизированной автоматизации бизнес-процессов (RPA)[3].

Штаб-квартира KNIME находится в Цюрихе; офисы также расположены в Констанце, Берлине и Остине (США).

Общие сведения
KNIME
Тип анализ данных, управляемая аналитика, корпоративная отчётность, бизнес-аналитика, интеллектуальный анализ данных, глубокое обучение, обработка данных, текстовая аналитика, работа с большими данными
Разработчик KNIME
Написана на Java
Операционные системы Linux, macOS, Windows
Языки интерфейса английский
Первый выпуск 2006
Аппаратная платформа Java Virtual Machine
Последняя версия 5.4 (6 декабря 2024)
Репозиторий github.com/knime/knime-c…
Лицензия GNU General Public License
Сайт knime.com

История

Разработка KNIME началась в январе 2004 года командой программистов Университета Констанца как открытой платформы. Первоначальную команду, которой руководил Михаэль Бертхольд, составили специалисты, ранее работавшие в программных компаниях фармацевтической отрасли Силиконовой долины. Целью было создать модульную, масштабируемую и открытую платформу для обработки данных, допуская простую интеграцию различных модулей для загрузки, обработки, трансформации, анализа и визуализации данных — без привязки к одной прикладной области. Платформа изначально предназначалась для совместных исследований и интеграции других аналитических проектов[4].

В 2006 году вышла первая версия KNIME. Несколько фармацевтических компаний начали использовать KNIME, и ряд поставщиков ПО для наук о жизни интегрировали свои инструменты с платформой[5][6][7][8][9]. Позже в том же году, после статьи в немецком журнале c’t, новым пользователям из разных сфер стало известно о платформе[10][11][12]. К 2012 году KNIME использовали более 15 тысяч активных пользователей (не считая скачиваний) из сфер наук о жизни, а также банков, издательств, автопрома, телекома, консалтинга и других отраслей, а также многочисленных исследовательских групп по всему миру. Позднейшие обновления KNIME Server и KNIME Big Data Extensions обеспечили поддержку Apache Spark 2.3, Parquet и HDFS-хранилищ.

На протяжении шести лет подряд KNIME занимает лидирующие позиции среди платформ для анализа данных и машинное обучение по версии Gartner (Magic Quadrant).

Принципы и возможности

К основным принципам разработки и функциям KNIME относятся[13]:

  • Визуальная и интерактивная среда: приоритет отдаётся удобному и интуитивному интерфейсу для анализа данных, с визуальным построением потоков обработки по принципу «drag-and-drop». Пользователи могут создавать как простые, так и сложные автоматизированные конвейеры обработки данных, использовать подключение к базам данных, библиотеки машинного обучения, средства для организации логики исполнения (циклы, ветвления), абстракции и интерактивные виджеты, автоматизацию и обработку ошибок.
  • Модульность: единицы вычислений и контейнеры данных независимы друг от друга, что позволяет легко распределять вычисления и дополнять платформу новыми алгоритмами. Типы данных инкапсулированы и могут расширяться/комбинироваться при необходимости с помощью собственных представлений и компараторов.
  • Расширяемость: благодаря механизмам плагинов, добавление новых обработчиков и представлений упрощено и не требует сложной установки или удаления.
  • Сочетание no-code и программирования: платформа поддерживает визуальное моделирование (no-code) и интеграцию программных скриптов, в том числе на Python, R, JavaScript. Такой подход называют low-code.
  • Автоматизация и масштабируемость: внедрение параметризации с помощью переменных, инкапсуляция сегментов пайплайнов, планирование и автоматизация исполнения (поддерживается на KNIME Business Hub и Community Hub for Teams) позволяют сокращать ручной труд и ошибки. KNIME подходит для работы с большими наборами данных (миллионы записей), параллельного исполнения процессов и повторного использования частей рабочих процессов.
  • Полная функциональность без ограничений: как полностью открытое ПО, KNIME Analytics Platform не накладывает ограничений по функциональности или времени использования.

Устройство

KNIME позволяет визуально собирать потоки данных (пайплайны), запускать отдельные или все этапы анализа и интерактивно просматривать результаты и модели, используя виджеты. Написана на Java и основана на Eclipse. Благодаря расширяемой архитектуре, функции дополняются через плагины. Базовый дистрибутив содержит сотни модулей для интеграции данных (ввод-вывод файлов, работа с любыми СУБД через JDBC или нативные коннекторы: SQLite, MS-Access, SQL Server, MySQL, Oracle, PostgreSQL, Vertica, H2), трансформации (фильтрация, преобразование, разбиение, объединение, слияние), а также реализует широко используемые методы статистики, интеллектуального анализа данных, машинного обучения и текстовой аналитики. Результаты визуализируются с помощью дополнения Report Designer; рабочие процессы могут служить примерами для настройки шаблонов отчётов, экспортируемых в форматы doc, ppt, xls, pdf и др. Прочие возможности:

  • ядро KNIME обеспечивает обработку больших объёмов данных, ограничиваемых только дисковым пространством (а не доступной оперативной памятью): возможно анализировать до 300 млн адресов клиентов, 20 млн изображений клеток, 10 млн молекул;
  • поддержка расширений для текстовой, визуальной аналитики, анализа временных рядов и сетевого анализа;
  • интеграция с другими open source-проектами: Weka, H2O.ai, Keras, Spark, R, LIBSVM, plotly, JFreeChart, ImageJ, CDK[14].

KNIME реализована на Java, поддерживает обёртки для вызова внешнего кода (в том числе Python, R, Ruby и других языков).

Лицензия

В 2024 году KNIME (версия 5.3) распространяется под лицензией GPLv3, как и предыдущие выпуски[15]. Начиная с версии 2.1, разрешается использовать определённый API для разработки проприетарных расширений к узлам приложения[16], благодаря чему есть возможность интеграции с коммерческим ПО.

Курсы

KNIME позволяет проводить анализ данных без программирования. Доступен ряд бесплатных онлайн-курсов[17].

Примечания

  1. Tiwari, Abhishek; Sekhar, Arvind K.T. (октябрь 2007). “Workflow based framework for life science informatics”. Computational Biology and Chemistry [англ.]. 31 (5—6): 305—319. DOI:10.1016/j.compbiolchem.2007.08.009. PMID 17931570. Проверьте дату в |date= (справка на английском)
  2. Chasco, Coro; Taques, Fernando H.; Taques, Flávio H. (январь 2025). “Integrating big data with KNIME as an alternative without programming code: an application to the PATSTAT patent database”. Journal of Geographical Systems [англ.]. 27 (1): 31—61. Bibcode:2025JGS....27...31T. DOI:10.1007/s10109-024-00445-0. Проверьте дату в |date= (справка на английском)
  3. KNIME Analytics Platform Bot (англ.). Дата обращения: 12 апреля 2021. Архивировано 3 июня 2021 года.
  4. Open for Innovation (англ.). KNIME.com. Дата обращения: 24 февраля 2020. Архивировано 10 марта 2020 года.
  5. Tripos. Tripos, Inc.. Архивировано 17 июля 2011 года.
  6. KNIME Extensions: Modular, highly configurable framework for easy workflow automation and data analysis (англ.). Schrödinger, Inc.. Дата обращения: 22 мая 2025. Архивировано 25 сентября 2009 года.
  7. ChemAxon. Архивировано 17 июля 2011 года.
  8. NovaMechanics Ltd. Дата обращения: 14 ноября 2017. Архивировано 18 апреля 2023 года.
  9. Treweren Consultants. Дата обращения: 7 декабря 2010. Архивировано 24 апреля 2017 года.
  10. «Datenbank-Mosaik. Data Mining oder die Kunst, sich aus Millionen Datensätzen ein Bild zu machen», c’t 20/2006, с. 164 и далее, Heise Verlag.
  11. Форум на сайте KNIME. Дата обращения: 7 декабря 2010. Архивировано 26 апреля 2017 года.
  12. Pervasive. Дата обращения: 7 декабря 2010. Архивировано 29 августа 2010 года.
  13. Berthold, Michael R.; Cebron, Nicolas; Dill, Fabian T.; Gabriel, Thomas R.; Kötter, Tobias; Meinl, Thorsten; Ohl, Peter; Thiel, Kilian; Wiswedel, Bernd (16 ноября 2009). “KNIME-the Konstanz information miner: version 2.0 and beyond”. ACM SIGKDD Explorations Newsletter [англ.]. 11 (1): 26—31. DOI:10.1145/1656274.1656280.
  14. Beisken, S.; Meinl, T.; Wiswedel, B.; De Figueiredo, L. F.; Berthold, M.; Steinbeck, C. (2013). “KNIME-CDK: Workflow-driven Cheminformatics”. BMC Bioinformatics [англ.]. 14: 257. DOI:10.1186/1471-2105-14-257. PMC 3765822. PMID 24103053.
  15. KNIME 5.3 License Terms and Conditions (англ.) (3 августа 2024). Дата обращения: 3 августа 2024. Архивировано 3 августа 2024 года.
  16. KNIME 2.1.0 released. Архивировано 17 апреля 2010 года.
  17. KNIME Learning Center (англ.). KNIME. Дата обращения: 4 декабря 2024. Архивировано 23 ноября 2024 года.

Ссылки

  • https://www.knime.org — официальный сайт
  • https://github.com/knime/KNIME — исходный код на GitHub
  • http://hub.knime.com/ — KNIME Hub, официальный портал для поиска компонентов, рабочих процессов и совместной работы
  • https://nodepit.com/ — Nodepit, коллекция узлов для KNIME с поддержкой версионирования и установки