KNIME
KNIME (сокращение от Konstanz Information Miner) — программная платформа для анализа, интеграции и визуализации данных, а также создания отчётов. Система поддерживает модульный принцип построения аналитических процессов («строительные блоки»), позволяя наглядно собирать пайплайны для машинного обучения, обработки и визуализации данных, интеграции различных источников с помощью JDBC и минимальным (или вовсе без) программированием. Платформа распространяется свободно как открытое программное обеспечение под лицензией GNU GPL.
KNIME используется с 2006 года в фармацевтических исследованиях[1], а также в таких областях, как управление взаимоотношениями с клиентами (CRM), анализ бизнес-данных, бизнес-аналитика, текстовая аналитика и финансовый анализ[2]. В последнее время предпринимаются попытки применения KNIME как инструмента для роботизированной автоматизации бизнес-процессов (RPA)[3].
Штаб-квартира KNIME находится в Цюрихе; офисы также расположены в Констанце, Берлине и Остине (США).
Общие сведения
| KNIME | |
|---|---|
| Тип | анализ данных, управляемая аналитика, корпоративная отчётность, бизнес-аналитика, интеллектуальный анализ данных, глубокое обучение, обработка данных, текстовая аналитика, работа с большими данными |
| Разработчик | KNIME |
| Написана на | Java |
| Операционные системы | Linux, macOS, Windows |
| Языки интерфейса | английский |
| Первый выпуск | 2006 |
| Аппаратная платформа | Java Virtual Machine |
| Последняя версия | 5.4 (6 декабря 2024) |
| Репозиторий | github.com/knime/knime-c… |
| Лицензия | GNU General Public License |
| Сайт | knime.com |
История
Разработка KNIME началась в январе 2004 года командой программистов Университета Констанца как открытой платформы. Первоначальную команду, которой руководил Михаэль Бертхольд, составили специалисты, ранее работавшие в программных компаниях фармацевтической отрасли Силиконовой долины. Целью было создать модульную, масштабируемую и открытую платформу для обработки данных, допуская простую интеграцию различных модулей для загрузки, обработки, трансформации, анализа и визуализации данных — без привязки к одной прикладной области. Платформа изначально предназначалась для совместных исследований и интеграции других аналитических проектов[4].
В 2006 году вышла первая версия KNIME. Несколько фармацевтических компаний начали использовать KNIME, и ряд поставщиков ПО для наук о жизни интегрировали свои инструменты с платформой[5][6][7][8][9]. Позже в том же году, после статьи в немецком журнале c’t, новым пользователям из разных сфер стало известно о платформе[10][11][12]. К 2012 году KNIME использовали более 15 тысяч активных пользователей (не считая скачиваний) из сфер наук о жизни, а также банков, издательств, автопрома, телекома, консалтинга и других отраслей, а также многочисленных исследовательских групп по всему миру. Позднейшие обновления KNIME Server и KNIME Big Data Extensions обеспечили поддержку Apache Spark 2.3, Parquet и HDFS-хранилищ.
На протяжении шести лет подряд KNIME занимает лидирующие позиции среди платформ для анализа данных и машинное обучение по версии Gartner (Magic Quadrant).
Принципы и возможности
К основным принципам разработки и функциям KNIME относятся[13]:
- Визуальная и интерактивная среда: приоритет отдаётся удобному и интуитивному интерфейсу для анализа данных, с визуальным построением потоков обработки по принципу «drag-and-drop». Пользователи могут создавать как простые, так и сложные автоматизированные конвейеры обработки данных, использовать подключение к базам данных, библиотеки машинного обучения, средства для организации логики исполнения (циклы, ветвления), абстракции и интерактивные виджеты, автоматизацию и обработку ошибок.
- Модульность: единицы вычислений и контейнеры данных независимы друг от друга, что позволяет легко распределять вычисления и дополнять платформу новыми алгоритмами. Типы данных инкапсулированы и могут расширяться/комбинироваться при необходимости с помощью собственных представлений и компараторов.
- Расширяемость: благодаря механизмам плагинов, добавление новых обработчиков и представлений упрощено и не требует сложной установки или удаления.
- Сочетание no-code и программирования: платформа поддерживает визуальное моделирование (no-code) и интеграцию программных скриптов, в том числе на Python, R, JavaScript. Такой подход называют low-code.
- Автоматизация и масштабируемость: внедрение параметризации с помощью переменных, инкапсуляция сегментов пайплайнов, планирование и автоматизация исполнения (поддерживается на KNIME Business Hub и Community Hub for Teams) позволяют сокращать ручной труд и ошибки. KNIME подходит для работы с большими наборами данных (миллионы записей), параллельного исполнения процессов и повторного использования частей рабочих процессов.
- Полная функциональность без ограничений: как полностью открытое ПО, KNIME Analytics Platform не накладывает ограничений по функциональности или времени использования.
Устройство
KNIME позволяет визуально собирать потоки данных (пайплайны), запускать отдельные или все этапы анализа и интерактивно просматривать результаты и модели, используя виджеты. Написана на Java и основана на Eclipse. Благодаря расширяемой архитектуре, функции дополняются через плагины. Базовый дистрибутив содержит сотни модулей для интеграции данных (ввод-вывод файлов, работа с любыми СУБД через JDBC или нативные коннекторы: SQLite, MS-Access, SQL Server, MySQL, Oracle, PostgreSQL, Vertica, H2), трансформации (фильтрация, преобразование, разбиение, объединение, слияние), а также реализует широко используемые методы статистики, интеллектуального анализа данных, машинного обучения и текстовой аналитики. Результаты визуализируются с помощью дополнения Report Designer; рабочие процессы могут служить примерами для настройки шаблонов отчётов, экспортируемых в форматы doc, ppt, xls, pdf и др. Прочие возможности:
- ядро KNIME обеспечивает обработку больших объёмов данных, ограничиваемых только дисковым пространством (а не доступной оперативной памятью): возможно анализировать до 300 млн адресов клиентов, 20 млн изображений клеток, 10 млн молекул;
- поддержка расширений для текстовой, визуальной аналитики, анализа временных рядов и сетевого анализа;
- интеграция с другими open source-проектами: Weka, H2O.ai, Keras, Spark, R, LIBSVM, plotly, JFreeChart, ImageJ, CDK[14].
KNIME реализована на Java, поддерживает обёртки для вызова внешнего кода (в том числе Python, R, Ruby и других языков).
Лицензия
Курсы
KNIME позволяет проводить анализ данных без программирования. Доступен ряд бесплатных онлайн-курсов[17].
Примечания
- ↑ Tiwari, Abhishek; Sekhar, Arvind K.T. (октябрь 2007). “Workflow based framework for life science informatics”. Computational Biology and Chemistry [англ.]. 31 (5—6): 305—319. DOI:10.1016/j.compbiolchem.2007.08.009. PMID 17931570. Проверьте дату в
|date=(справка на английском) - ↑ Chasco, Coro; Taques, Fernando H.; Taques, Flávio H. (январь 2025). “Integrating big data with KNIME as an alternative without programming code: an application to the PATSTAT patent database”. Journal of Geographical Systems [англ.]. 27 (1): 31—61. Bibcode:2025JGS....27...31T. DOI:10.1007/s10109-024-00445-0. Проверьте дату в
|date=(справка на английском) - ↑ KNIME Analytics Platform Bot (англ.). Дата обращения: 12 апреля 2021. Архивировано 3 июня 2021 года.
- ↑ Open for Innovation (англ.). KNIME.com. Дата обращения: 24 февраля 2020. Архивировано 10 марта 2020 года.
- ↑ Tripos. Tripos, Inc.. Архивировано 17 июля 2011 года.
- ↑ KNIME Extensions: Modular, highly configurable framework for easy workflow automation and data analysis (англ.). Schrödinger, Inc.. Дата обращения: 22 мая 2025. Архивировано 25 сентября 2009 года.
- ↑ ChemAxon. Архивировано 17 июля 2011 года.
- ↑ NovaMechanics Ltd. Дата обращения: 14 ноября 2017. Архивировано 18 апреля 2023 года.
- ↑ Treweren Consultants. Дата обращения: 7 декабря 2010. Архивировано 24 апреля 2017 года.
- ↑ «Datenbank-Mosaik. Data Mining oder die Kunst, sich aus Millionen Datensätzen ein Bild zu machen», c’t 20/2006, с. 164 и далее, Heise Verlag.
- ↑ Форум на сайте KNIME. Дата обращения: 7 декабря 2010. Архивировано 26 апреля 2017 года.
- ↑ Pervasive. Дата обращения: 7 декабря 2010. Архивировано 29 августа 2010 года.
- ↑ Berthold, Michael R.; Cebron, Nicolas; Dill, Fabian T.; Gabriel, Thomas R.; Kötter, Tobias; Meinl, Thorsten; Ohl, Peter; Thiel, Kilian; Wiswedel, Bernd (16 ноября 2009). “KNIME-the Konstanz information miner: version 2.0 and beyond”. ACM SIGKDD Explorations Newsletter [англ.]. 11 (1): 26—31. DOI:10.1145/1656274.1656280.
- ↑ Beisken, S.; Meinl, T.; Wiswedel, B.; De Figueiredo, L. F.; Berthold, M.; Steinbeck, C. (2013). “KNIME-CDK: Workflow-driven Cheminformatics”. BMC Bioinformatics [англ.]. 14: 257. DOI:10.1186/1471-2105-14-257. PMC 3765822. PMID 24103053.
- ↑ KNIME 5.3 License Terms and Conditions (англ.) (3 августа 2024). Дата обращения: 3 августа 2024. Архивировано 3 августа 2024 года.
- ↑ KNIME 2.1.0 released. Архивировано 17 апреля 2010 года.
- ↑ KNIME Learning Center (англ.). KNIME. Дата обращения: 4 декабря 2024. Архивировано 23 ноября 2024 года.
Ссылки
- https://www.knime.org — официальный сайт
- https://github.com/knime/KNIME — исходный код на GitHub
- http://hub.knime.com/ — KNIME Hub, официальный портал для поиска компонентов, рабочих процессов и совместной работы
- https://nodepit.com/ — Nodepit, коллекция узлов для KNIME с поддержкой версионирования и установки