Kandinsky

Kandinsky — проект, сервис и приложение компании «Сбер», получившее название в честь художника Василия Кандинского, с помощью которого пользователи могут генерировать по текстовому описанию не только изображения, но и физически достоверные видеоролики с помощью нейросетей[1][2].

Общие сведения

История

В ноябре 2021 года были выложены в открытый доступ код и параметры модели ruDALL-E XL, содержащей 1,3 млрд параметров, а также создан сервис генерации изображений. В июне 2022 года была представлена улучшенная модель — ruDALL-E XXL с 12 млрд параметров, которую дообучили на 179 млн изображений с текстовыми описаниями. В итоге была получена первая версия сервиса Kandinsky[3].

23 ноября 2022 года на конференции «Путешествие в мир искусственного интеллекта» Сбер представил новую версию нейросети — Kandinsky 2.0. От предыдущей она отличается своей мультиязычностью и диффузным подходом. Вторая версия обучалась на 1 млрд пар «текст-изображение»[4].

В начале апреля 2023 года вышла Kandinsky 2.1. Она была обучена ещё на дополнительных 170 млн пар изображений с текстом. Нейросеть была также усовершенствована за счёт новой обученной модели автоэнкодера. Помимо закодированных текстовых описаний, модель использует специальное представление изображения моделью CLIP[5]. На начало июля 2023 года пользователи создали с помощью нейросети более 70 млн изображений. Наиболее популярными запросами были «Россия», «любовь», «аниме», «кот» и «космос»[6].

12 июля 2023 года Сбер выпустил версию нейросети Kandinsky 2.2. Сообщается, что теперь сервис умеет создавать фотореалистичные изображения в улучшенном качестве и изменять соотношение сторон при генерации. Нейросеть дополучили на датасете, содержащем 1,5 млрд пар «текст — изображение»[7]. В течение суток после выхода Kandinsky 2.2 пользователи сгенерировали 1 млн изображений, лидерами по популярности стали темы «коты», «море» и «аниме»[8].

12 октября 2023 года в Kandinsky 2.2 появилась возможность генерировать четырёхсекундные ролики по текстовому описанию[9].

22 ноября 2023 года Сбер представил новую версию нейросети — 3.0 в рамках конференции «AI Journey». Одной из главных особенностей модели является более лучшее знание русской культуры[10].

22 апреля 2024 года пользователям стала доступна усовершенствованная версия сервиса — 3.1. В ней улучшилось качество генерируемых картинок засчёт дообучения на датасете эстетичных изображений[11]. В апреля 2024 года Kandinsky вошла в рейтинг лучших нейросетей от американского портала TechBullion, где заняла пятое место[12].

4 августа 2026 года «Сбер» выпустил семейство открытых image-to-video нейросетей Kandinsky WM 1.0 на базе Kandinsky 5.0 Video Lite (2 млрд параметров). Модели предназначены для генерации физически достоверных 5-секундных видео и обучения систем Physical AI, включая беспилотники, робототехнику и симуляцию сложных физических процессов[1][13].

Описание

Согласно заявлениям разработчиков, сервис поддерживает более 100 языков, включая русский.

Сервис поддерживает четыре основных режима работы:

  • генерация изображения по текстовому описанию
  • микширование двух изображений
  • микширование изображения и текстового описания дополнения
  • стилистическая переработка изображения

Актуальные версии — Kandinsky 3.1 и семейство нейросетей Kandinsky WM 1.0[14]. Модель Kandinsky WM 1.0 имеет открытый исходный код (лицензия MIT) и доступна на платформах GitHub, GitVerse и HuggingFace[14][15]. Архитектура включает диффузионный трансформер (2 млрд параметров) и три специализированные модели (K5-AV, K5-RO и K5-PH) для генерации 5-секундных видео, применяемых в робототехнике и симуляторах[16][14][17].

Создатели

Примечания

  1. 1 2 Kandinsky WM 1.0: открытая image-to-video модель для Physical AI. Хабр. Сбер. Дата обращения: 4 августа 2026.
  2. kandinsky-wm. GitHub. Дата обращения: 4 августа 2026.
  3. «Сбер» представил Kandinsky — ИИ-модель для генерации изображений по текстовому описанию на русском языке. 3dnews.ru (14 июня 2022). Дата обращения: 11 июля 2023. Архивировано 11 июля 2023 года.
  4. Сбер показал нейросеть Kandinsky 2.0 для генерации изображений по текстам. РБК (23 ноября 2022). Дата обращения: 11 июля 2023. Архивировано 11 июля 2023 года.
  5. Сбер представил нейросеть Kandinsky 2.1. Lenta.ru (4 апреля 2023). Дата обращения: 11 июля 2023. Архивировано 11 июля 2023 года.
  6. Сбер подсчитал число созданных нейросетью Kandinsky 2.1 изображений. Lenta.ru (4 июля 2023). Дата обращения: 12 июля 2023. Архивировано 12 июля 2023 года.
  7. Сбер представил новую версию своей нейросети Kandinsky. Газета.ru (12 июля 2023). Дата обращения: 13 июля 2023. Архивировано 13 июля 2023 года.
  8. За сутки пользователи Kandinsky 2.2 от Сбера создали миллион изображений. Lenta.ru. — новость. Дата обращения: 14 июля 2023. Архивировано 14 июля 2023 года.
  9. Нейросеть Kandinsky 2.2 научилась создавать анимационные видеоролики. Российская газета (12 октября 2023). Дата обращения: 14 октября 2023. Архивировано 13 октября 2023 года.
  10. Сбер представил новую версию нейросети Kandinsky 3.0. ТАСС (22 ноября 2023). Дата обращения: 30 апреля 2024.
  11. Изобразительная нейросеть Kandinsky 3.1 стала доступна для всех пользователей. 3dnews.ru (22 апреля 2024). Дата обращения: 30 апреля 2024.
  12. Две российские нейросети попали в топ-10 лучших в мире, AiF. Дата обращения: 17 апреля 2024.
  13. Сбер выпустил семейство моделей Kandinsky WM 1.0. Газета.ru (4 августа 2026). Дата обращения: 4 августа 2026.
  14. 1 2 3 Kandinsky WM 1.0: семейство открытых image-to-video нейросетей для Physical AI. Хабр. Сбербанк (4 августа 2026). Дата обращения: 4 августа 2026.
  15. kandinskylab/kandinsky-wm. GitHub. kandinskylab. Дата обращения: 4 августа 2026.
  16. Kandinsky-WM-1.0-I2V-5s-AV. Hugging Face. kandinskylab. Дата обращения: 4 августа 2026.
  17. Нейросеть Kandinsky обучит роботов. CNews (4 августа 2026). Дата обращения: 4 августа 2026.

Дополнительно по теме