Генеративный искусственный интеллект
Генеративный искусственный интеллект — это тип системы искусственного интеллекта (ИИ), способной генерировать текст, изображения или другие медиаданные в ответ на подсказки. Генеративный ИИ использует генеративные модели, такие как большие языковые модели, для статистической выборки новых данных на основе набора обучающих данных, который использовался для их создания[1].
Известные системы генеративного ИИ включают ChatGPT — чат-бот, созданный OpenAI с использованием больших языковых моделей GPT-3 и GPT-4 и Bard — чат-бот, созданный Google с использованием модели LaMDA[2]. Другие генеративные модели ИИ включают художественные системы искусственного интеллекта, такие как Stable Diffusion и DALL-E.
Генеративный ИИ может применяться в самых разных отраслях, включая разработку программного обеспечения, маркетинг и моду[3]. Инвестиции в генеративный ИИ резко выросли в начале 2020-х годов, когда крупные компании, такие как Microsoft, Google и Baidu, а также многочисленные более мелкие фирмы разрабатывали модели генеративного ИИ[4][5].
Модальности
Генеративная система искусственного интеллекта строится путём применения обучения без учителя или самообучения ИИ на наборе данных. Возможности генеративной системы ИИ зависят от модальности или типа используемого набора данных.
- Текст: генеративные системы ИИ, обученные на словах или словесных токенах, включают GPT-3, LaMDA, LLaMA, BLOOM, GPT-4 и другие (см. Список больших языковых моделей). Они способны к обработке естественного языка, машинному переводу и генерации естественного языка и могут использоваться в качестве базовых моделей для других задач[6]. Наборы данных включают BookCorpus, Wikipedia и другие (см. Список корпусов текстов).
- Код: в дополнение к тексту на естественном языке большие языковые модели можно обучать на текстах написанных на каком-нибудь языке программирования, что позволяет им генерировать исходный код для новых компьютерных программ[7]. Примеры включают OpenAI Codex.
- Изображения: системы генеративного ИИ, обученные на наборах изображений с текстовыми подписями, включают такие, как Imagen, DALL-E, Midjourney, Stable Diffusion и другие (см. Художественные системы искусственного интеллекта, генеративное искусство. Они обычно используются для преобразования текста в изображение и передачи нейронного стиля[8]. Наборы данных включают LAION-5B и другие (см. Наборы данных в компьютерном зрении).
- Молекулы: системы генеративного ИИ можно обучать последовательностям аминокислот или молекулярным представлениям, таким как SMILES, изображающим ДНК или белки. Эти системы, такие как AlphaFold, используются для прогнозирования структуры белков и открытия лекарств[9]. Наборы данных включают в себя различные наборы биологических данных.
- Мультимодальность: генеративную систему ИИ можно построить из нескольких генеративных моделей или одной модели, обученной на нескольких типах данных. Например, одна версия OpenAI GPT-4 принимает ввод как текста, так и изображения.
Изобретения в области генеративного ИИ
Патенты в сфере генеративного ИИ охватывают широкий спектр секторов, включая бизнес-решения, промышленность, транспорт, безопасность и телекоммуникации. Доминирующим направлением патентования является обработка видео и изображений (почти 18 тыс. патентов), второе место занимает работа с текстом (около 13,5 тыс.). Также наблюдается активное внедрение индустриальных решений, в частности в науках о жизни и транспорте[10].
14 июля 2026 года Всемирная организация интеллектуальной собственности (ВОИС) опубликовала доклад «WIPO Technology SPARK», согласно которому за 2024—2025 годы было опубликовано свыше 56 000 новых патентных семейств в сфере генеративного искусственного интеллекта[11]. Странами-лидерами по количеству патентов являются Китай, США и Южная Корея[10]. Среди ведущих компаний выделяются Tencent, Ping An Insurance, Baidu, IBM и другие[10].