Нейронный процессор
Нейро́нный проце́ссор (англ. Neural Processing Unit, NPU или ИИ-ускоритель, англ. AI accelerator) — специализированный класс микропроцессоров и сопроцессоров (часто реализуемых как специализированные интегральные схемы), используемых для аппаратного ускорения алгоритмов нейронных сетей, компьютерного зрения, распознавания речи, машинного обучения и других методов искусственного интеллекта[1].
К 2026 году нейронные процессоры стали обязательным стандартным компонентом потребительских систем на кристалле (SoC) от ведущих производителей, таких как Intel, AMD, Qualcomm и Apple. В частности, стандарт Microsoft Copilot+ PC требует от NPU производительность не менее 40 TOPS[2][3].
Описание
Нейронные процессоры относятся к вычислительной технике и применяются для аппаратного ускорения эмуляции работы нейронных сетей и цифровой обработки сигналов в режиме реального времени. Обычно нейропроцессор включает регистры, магазинные блоки памяти, коммутатор и вычислительное устройство, в составе которого — матрица умножения, дешифраторы, триггеры и мультиплексоры[4].
На современном этапе произошёл массовый переход к гибридным вычислительным архитектурам (CPU, GPU и NPU)[2][5]. Производительность нейронных процессоров измеряется в TOPS (Tera Operations Per Second) — метрике, обозначающей количество триллионов операций в секунду[6]. Типичные диапазоны производительности NPU для современных мобильных платформ составляют от 38 до 85 TOPS, тогда как десктопные платформы обеспечивают от 60 до 126 и более TOPS[7][8].
К классу нейронных процессоров относят различные по устройству и назначению типы чипов, например:
- Нейроморфные процессоры — построенные по кластерной асинхронной архитектуре, разработанной в Корнеллском университете (существенно отличающейся от фон-Неймановской и Гарвардской архитектур, применявшихся последние 70 лет в IT-отрасли). Логика нейроморфных процессоров изначально специализирована под создание и развитие различных видов искусственных нейронных сетей. Используются обычные транзисторы для построения вычислительных ядер, каждое из которых содержит планировщик, собственную память SRAM и маршрутизатор, а ядро эмулирует работу сотен нейронов, что позволяет одной микросхеме с тысячами ядер имитировать поведение сотен тысяч нейронов и гораздо большего числа синапсов. Типично применяются для алгоритмов глубокого машинного обучения[9].
- Тензорные процессоры — обычно реализуются как сопроцессоры под управлением центрального процессора, обрабатывают тензоры (многомерные массивы чисел, удобные для вычислений в машинном обучении)[10]. Для повышения производительности операции выполняются над числами сниженной точности (8 или 16 бит), ускоряя такие задачи, как матричное умножение и свёртка, используемые для эмуляции свёрточных нейронных сетей[11].
- Процессоры машинного зрения — схожи с тензорными, но специализированы для ускорения алгоритмов машинного зрения, включая методы свёрточных нейронных сетей (CNN) и SIFT. Акцент делается на распараллеливание потоков данных между многочисленными ядрами, в том числе с использованием блокнотной памяти, а также на обработку с пониженной точностью, характерную для обработки изображений[12].
Области применения
- Беспилотное транспортное средство: автомобиль, корабль, поезд, трамвай, летательный аппарат — это направление развивает компания Nvidia с серией Drive PX[13][14]. А навигационная система на базе чипов Movidius Myriad 2 успешно управляет автономными беспилотниками[15].
- Диагностика в здравоохранении.
- Машинный перевод.
- Обработка естественного языка.
- Поисковая система — NPU повышают энергоэффективность центров обработки данных и позволяют использовать более сложные запросы.
- Промышленный робот — NPU расширяют спектр автоматизируемых задач, повышая адаптивность к изменяющимся условиям.
- Распознавание по голосу — например, в смартфонах применяются технологии Qualcomm Hexagon и Sensing Hub[16][17].
- Сельскохозяйственный робот — например, автоматизированная борьба с сорняками без применения химикатов.
- Локальный запуск генеративного ИИ и больших языковых моделей (например, Llama и Stable Diffusion) — обеспечивает конфиденциальность данных и возможность автономной работы[18][19].
- Интеграция в системные функции операционных систем — локальное выполнение ИИ-задач, таких как Windows Studio Effects и Live Captions, а также ускорение встроенных функций через Apple Intelligence[20][21].
Поддержка в операционных системах
В операционной системе Windows 11 (начиная с версий 24H2 и 25H2) реализован системный мониторинг нейронного процессора[22].
Программные интерфейсы и фреймворки
Основным стандартом, обеспечивающим кросс-платформенную совместимость между нейронными процессорами разных производителей, является ONNX Runtime. Единого универсального API, работающего с NPU напрямую без использования вендорских прослоек, пока не существует, однако поддержка формата ONNX всеми ведущими разработчиками (Intel, AMD, Qualcomm, Apple) значительно упростила перенос моделей. Для экосистемы Windows также активно используется Windows ML, обеспечивающий нативную интеграцию нейронных процессоров от Intel, AMD и Qualcomm в операционную систему[23].
Примеры
Специализированные ИИ-ускорители и тензорные процессоры
- Тензорные процессоры:
- Тензорный процессор Google — ускоритель для TensorFlow компании Google, применяется для свёрточных нейронных сетей. Актуальными поколениями являются v5, v6 (Trillium) и v7 (Ironwood)[24][25].
- Huawei Ascend 310 / Ascend 910 — первые чипы линейки Ascend, оптимизированные под задачи искусственного интеллекта. Актуальные модели включают Ascend 950DT (для обучения) и 950PR (для инференса)[26][27].
- Intel Nervana NNP — первый коммерческий тензорный процессор для глубокого обучения[28][29]. Актуальным ИИ-ускорителем компании является Intel Gaudi 3[30][31].
- Qualcomm Cloud AI 100 — ИИ-ускоритель для облачных платформ, поддерживающий PyTorch, Glow, TensorFlow, Keras и ONNX[32].
- LinQ HPS — универсальный ИИ-ускоритель для дата-центров от компании «ХайТэк». Имеет собственную архитектуру, пиковую производительность 960 TOPS, внесён в реестр Минпромторга РФ[33][34].
- Нейроморфные процессоры:
- IBM TrueNorth — построен по принципу взаимодействия нейронов. Частота импульсов кодирует интенсивность сигнала. На 2016 год не существует однозначного мнения в ИИ-сообществе о перспективности этого подхода, однако отмечается высокая энергоэффективность для задач машинного зрения[35].
- AltAI — российский нейроморфный вычислитель компании «Мотив Нейроморфные Технологии». Первое поколение предназначено для задач искусственного интеллекта. Второе — позволяет исполнять импульсные нейронные сети и решать задачи общего назначения[36].
- Cerebras Wafer Scale Engine — суперпроцессор компании Cerebras. Актуальным поколением является WSE-3 Turbo (5 нм), содержащий 900 000 ИИ-оптимизированных ядер и 44 ГБ распределённой SRAM[37][38].
- KnuPath — процессор компании KnuEdge для систем распознавания речи и машинного обучения; использует соединение LambdaFabric и масштабируется до 512 тысяч процессоров[39].
Процессоры машинного зрения и автопилота
- Процессоры машинного зрения:
- Intel Movidius Myriad 2 — многоядерный ИИ-ускоритель на архитектуре VLIW с дополнительными модулями для обработки видео[12].
- Mobileye EyeQ — специализированный процессор для ускорения алгоритмов машинного зрения в беспилотных автомобилях. Актуальные поколения включают EyeQ Ultra (176 TOPS, уровень автономности L4) и чипы семейства EyeQ6 (EyeQ6L и EyeQ6H)[40][41].
Нейроморфные процессоры
- IBM TrueNorth — построен по принципу взаимодействия нейронов. Частота импульсов кодирует интенсивность сигнала. На 2016 год не существует однозначного мнения в ИИ-сообществе о перспективности этого подхода, однако отмечается высокая энергоэффективность для задач машинного зрения[42].
- AltAI — российский нейроморфный вычислитель компании «Мотив Нейроморфные Технологии». Первое поколение предназначено для задач искусственного интеллекта. Второе — позволяет исполнять импульсные нейронные сети и решать задачи общего назначения[43].
- Intel Loihi 2 — нейроморфный процессор Intel второго поколения (128 ядер, 1 млн нейронов, высокая энергоэффективность)[44][45]. Первое поколение объединяло обучение, тренинг и принятие решений в одном чипе, работало автономно и на MNIST превосходило типовые спайковые нейросети более чем в миллион раз[46].
- SpiNNaker-2 — массово-параллельная вычислительная платформа со 152 ARM-ядрами на чип, оптимизированная для моделирования крупных и разреженных нейронных сетей (развитие архитектуры SpiNNaker)[47][48]."
Продукты на основе графических процессоров
- Nvidia Tesla — серия GPGPU-ускорителей Nvidia[49]:
- Nvidia Volta — GPU архитектуры Volta (2017), напр. GV100, содержат до 640 тензорных ядер[1].
- Nvidia Turing — GPU архитектуры Turing (2018), напр. TU104, до 576 тензорных ядер[50].
- Nvidia DGX-1 — специализированный сервер из двух ЦП и 8 GPU Nvidia Volta GV100 (5120 тензорных ядер), связанных через быструю NVLink[51]. Архитектура памяти системы оптимизирована для глубокого обучения[52][53].
- Nvidia Hopper — GPU архитектуры Hopper (2022), например H100, оснащены тензорными ядрами 4-го поколения с нативной поддержкой формата FP8[54].[55].
- Nvidia Blackwell — GPU архитектуры Blackwell (2024), например B200, используют тензорные ядра 5-го поколения с аппаратной поддержкой формата FP4[54].[55].
- Nvidia Rubin — следующее поколение ускорителей (например, R100) с поддержкой формата FP4[54].[55].
- AMD Instinct (ранее Radeon Instinct) — специализированные GPGPU от AMD для глубокого обучения на базе архитектуры CDNA, включая актуальные серии MI300X и MI400[56][57][58].
ИИ-ускорители как встроенные сопроцессоры (аппаратные ИИ-блоки)
- Cambricon-1A — NPU в ARM-чипах Huawei Kirin 970, разработан компанией Cambricon Technologies[59].
- CEVA NeuPro — семейство лицензируемых ИИ-процессоров для глубокообучающих задач компании CEVA.
- Apple Neural Engine — ИИ-ускоритель внутри SoC от Apple A11 до A18 Pro и от M1 до M5 (с производительностью до 38 TOPS), а также в процессорах M5 Ultra и M6[60][61][62].
- E-Series GPU — актуальная серия со встроенными ИИ-ядрами (Neural Cores) от компании Imagination Technologies, пришедшая на смену выделенным NNA (упразднены в 2023 году) и обеспечивающая производительность до 200 TOPS[63].
- LinQ HX — ускоритель для встраиваемых систем компании «ХайТэк». Обеспечивает производительность до 30 TOPS при энергопотреблении до 40 Вт, позволяя обрабатывать до пяти нейросетей одновременно в реальном времени[64][65].
- Intel NPU 5 — нейронный сопроцессор в чипах Panther Lake (Core Ultra 300) с производительностью 50 TOPS[60].[66]
- AMD XDNA 2 — архитектура нейронных ускорителей в процессорах Ryzen AI 300 и 400, обеспечивающая производительность до 60 TOPS[60].[67]
- MediaTek APU — встроенные ИИ-ускорители в процессорах Dimensity 9400 (NPU 890) и Dimensity 9500 (NPU 990, производительность 100 TOPS)[68].[69]
Научные исследования и прототипы
- Индийский технологический институт в Мадрасе разрабатывает ускоритель на импульсных нейронах для новых систем RISC-V, нацеленных на обработку больших данных в серверах.
- Eyeriss — разработка для свёрточных нейронных сетей с применением блокнотной памяти и сетевой архитектуры в пределах кристалла.
- Fujitsu DLU — многоблочный сопроцессор для глубокого машинного обучения, использует вычисления с низкой точностью[70].
- Kalray — компания разработала MPPA и сообщила о повышении эффективности СВНС по сравнению с GPU.
- Zeroth NPU — разработка компании Qualcomm для добавления функций распознавания речи и изображений в мобильные устройства.
- TPU H — тензорный процессор, разрабатываемый компанией «ХайТэк». В октябре 2020 опубликованы результаты[71] тестирования архитектуры TPU H консорциумом MLPerf (создан в 2018 году Baidu, Google, Гарвардский университет, Стэнфордский университет и Калифорнийский университет в Беркли)[72].
- В рамках архитектуры RISC-V разрабатываются матричные расширения (Integrated Matrix Extensions — IME и Vector Matrix Extensions — VME), спецификации которых находятся на стадии заморозки, а также ведётся работа по их унификации через общий путь LLVM-MLIR для компиляторов и ИИ-фреймворков[73].
- Коммерческие реализации ИИ-ускорителей на базе RISC-V от компании Tenstorrent находятся на этапе массового производства: поставляются серийные системы, а масштабы развёртывания ядер оцениваются в миллионы единиц[73].
Примечания
Ссылки
- Популярность машинного обучения влияет на эволюцию архитектуры процессоров. Servernews. (31 августа 2017). Дата обращения: 17 ноября 2017.