58-битная большая языковая модель

58-би́тная больша́я языкова́я моде́ль (англ. 1.58-bit large language model, также тернарная большая языковая модель) — разновидность больших языковых моделей, разработанная для повышения вычислительной эффективности. Эта модель использует веса, ограниченные всего тремя значениями: −1, 0 и +1. Такое ограничение значительно сокращает объём памяти, необходимый для модели, и ускоряет вычисления, поскольку дорогостоящие операции умножения заменяются менее затратными сложениями. В отличие от традиционных моделей, использующих 16-битные числа с плавающей запятой (например, FP16 или BF16) для хранения весов, тернарная модель снижает ресурсоёмкость.

Исследования показали, что для моделей с числом параметров до нескольких миллиардов производительность 1,58-битных моделей на различных задачах сопоставима с моделями полной точности[1][2]. Такой подход позволяет запускать мощные ИИ на менее специализированном и энергоэффективном оборудовании[3].

Название «1,58-битная» отражает тот факт, что система с тремя состояниями содержит бита информации по теории информации. Такие модели иногда также называют 1-битными большими языковыми моделями (англ. 1-bit LLMs) в научных публикациях, хотя этот термин также может относиться и к истинно бинарным моделям (с весами только −1 и +1)[1][4].

К августу 2026 года массового внедрения 1,58-битных языковых моделей в индустрию не произошло, технология преимущественно остаётся на стадии исследований и создания ранних прототипов[5].

Модели

В 2024 году исследователи из Microsoft под руководством Ма объявили, что их 1,58-битная модель BitNet b1.58 по качеству сопоставима с 16-битной Llama 2 и знаменует собой начало эры 1-битных больших языковых моделей[6].

В 2025 году исследователи Microsoft выпустили модель с открытыми весами и открытым исходным кодом инференса BitNet b1.58 2B4T, показавшую уровень производительности, сопоставимый с высокоточной моделью при 2 миллиардах параметров и 4 триллионах обучающих токенов[7]. Среди ключевых архитектурных особенностей модели — использование токенизатора LLaMA 3, позиционного кодирования RoPE и функции активации Squared ReLU[7].

16 апреля 2026 года компания PrismML представила семейство 1,58-битных моделей Ternary-Bonsai с 8, 4 и 1,7 млрд параметров[8][9].

Архитектура и обучение

При создании BitNet авторы не применяли постквантизацию весов после обучения, а использовали новый слой преобразования BitLinear, который заменил традиционный слой nn.Linear в архитектуре трансформера[10]. В этих слоях веса квантуются до тернарных значений {-1, 0, +1} с помощью функции абсолютного среднего (absmean), а активации — до 8-битных целых чисел с использованием стратегии абсолютного максимума (absmax)[11].

Для обучения недифференцируемых дискретных весов применяется метод Straight-Through Estimator (STE). Особенностью функции потерь при таком обучении является S-образная форма кривой, что требует двухэтапного расписания: на первом этапе используется повышенная скорость обучения, а во второй половине она снижается с отключением затухания весов (weight decay)[12].

Постквантизация

Производительность BitNet обусловлена её обучением непосредственно в 1,58-битном пространстве, а не переводом высокоточной модели в низкоразрядную после обучения. Тем не менее, само обучение является ресурсоёмким процессом, поэтому желательно иметь возможность переводить уже существующие модели в 1,58 бита. В 2024 году портал HuggingFace сообщил о способе постепенного применения 1,58-битной квантизации при дообучении уже существующей модели[13].

Производительность и эффективность

Модель BitNet b1.58 (3,9 млрд параметров) превосходит LLaMA 3B по скорости инференса в 2,4 раза и потребляет в 3,32 раза меньше памяти GPU[14]. Для модели BitNet b1.58 2B расчётное энергопотребление снижено на 89,1 % по сравнению с LLaMA 3.2 1B[15].

В бенчмарках модель BitNet b1.58 2B показывает результаты, сопоставимые с моделями аналогичного размера. В тесте MMLU она набирает 53,17 %, опережая MiniCPM 2B (51,82 %), SmolLM2 1.7B (49,24 %), LLaMA 3.2 1B (45,58 %) и Gemma-3 1B (39,91 %), но уступая Qwen 2.5 1.5B (60,25 %)[16][17]. В тесте GSM8K результат BitNet b1.58 2B составляет 58,38 %, что превышает показатели Qwen 2.5 1.5B (56,79 %), SmolLM2 1.7B (45,11 %), LLaMA 3.2 1B (38,21 %), Gemma-3 1B (31,16 %) и MiniCPM 2B (4,40 %)[16][17].

Применение

В 2026 году технология 1,58-битных языковых моделей (BitNet b1.58) нашла применение на мобильных и периферийных устройствах (Edge AI). Компания ENERZAi развернула модель BitNet b1.58 2B на нейронном процессоре Qualcomm QCS6490 Hexagon NPU с использованием пользовательских 1,58-битных ядер[18]. В рамках платформы QVAC Fabric от компании Tether было продемонстрировано LoRA-дообучение моделей BitNet непосредственно на мобильных графических процессорах смартфонов[19]. Для центральных процессоров, включая архитектуру ARM, был выпущен движок реального времени VibeASR.cpp, обеспечивающий многоязычное распознавание речи с использованием квантования BitNet[20]. Кроме того, фреймворк bitnet.cpp позволил запускать крупные модели на одном процессоре, обеспечивая снижение энергопотребления на ARM-устройствах на 55,4—70 %[21].

Масштабирование и критика

Закон масштабирования для 1-битных трансформеров подчиняется степенной зависимости, при этом разрыв в качестве по сравнению с полноточными моделями сокращается по мере роста числа параметров[22].[23]. Ряд исследователей[24] отмечают, что законы масштабирования[25] благоприятствуют низкоразрядным весам только в случае недоученных моделей; по мере увеличения количества обучающих токенов проявляются недостатки низкоразрядной квантизации.

Примечания

  1. 1 2 Ma, Shuming; Wang, Hongyu; Ma, Lingxiao; Wang, Lei; Wang, Wenhui; Huang, Shaohan; Dong, Li; Wang, Ruiping; Xue, Jilong; Wei, Furu (27 февраля 2024). “The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits”. arXiv. arXiv:2402.17764 [cs.CL]. Дата обращения 2025-04-22. Используется устаревший параметр |class= (справка); |access-date= требует |url= (справка)
  2. Hutson, Matthew. 1-bit LLMs Could Solve AI's Energy Demands (англ.) (30 мая 2024). Архивировано 12 октября 2025 года. Дата обращения: 27 августа 2026.
  3. Friha, Othmane; Amine Ferrag, Mohamed; Kantarci, Burak; Cakmak, Burak; Ozgun, Arda; Ghoualmi-Zine, Nassira (2024). “LLM-Based Edge Intelligence: A Comprehensive Survey on Architectures, Applications, Security and Trustworthiness”. IEEE Open Journal of the Communications Society [англ.]. 5: 5799—5856. DOI:10.1109/OJCOMS.2024.3456549. ISSN 2644-125X. Дата обращения 2025-04-22. |access-date= требует |url= (справка)
  4. Morales, Jowi Microsoft researchers build 1-bit AI LLM with 2B parameters (англ.). Tom's Hardware (17 апреля 2025). Дата обращения: 27 августа 2026. Архивировано 8 сентября 2025 года.
  5. Running BitNet on Qualcomm Hexagon with Custom 1.58 Kernels. Edge AI Vision (июнь 2026). Дата обращения: 27 августа 2026.
  6. Huyen, Chip. AI Engineering : [англ.]. — O'Reilly Media, Inc., 4 декабря 2024. — ISBN 978-1-0981-6627-4.
  7. 1 2 Ma, Shuming; Wang, Hongyu; Huang, Shaohan; Zhang, Xingxing; Hu, Ying; Song, Ting; Xia, Yan & Wei, Furu (2025), BitNet b1.58 2B4T Technical Report, arΧiv:2504.12285 [cs.CL]. 
  8. PrismML Introduces Ternary-Bonsai Model Family. PrismML (16 апреля 2026). Дата обращения: 27 августа 2026.
  9. PrismML Introduces Ternary-Bonsai Model Family. PR Newswire (16 апреля 2026). Дата обращения: 27 августа 2026.
  10. Wang, Hongyu; Ma, Shuming; Dong, Li; Huang, Shaohan; Wang, Huaijie; Ma, Lingxiao; Yang, Fan; Wang, Ruiping; et al. (2023), BitNet: Scaling 1-bit Transformers for Large Language Models, arΧiv:2310.11453 [cs.CL]. 
  11. BitNet b1.58: Scaling 1-bit Transformers for Large Language Models. arXiv. Microsoft Research. Дата обращения: 27 августа 2026.
  12. The Era of 1-bit LLMs: All Large Language Models are in Sight. Journal of Machine Learning Research (2024). Дата обращения: 27 августа 2026.
  13. Fine-tuning LLMs to 1.58bit: extreme quantization made easy (англ.). HuggingFace Blog (20 апреля 2025). Дата обращения: 27 августа 2026. Архивировано 16 июля 2025 года.
  14. BitNet b1.58: Training a 1.58-bit LLM. QueryLoop AI. Дата обращения: 27 августа 2026.
  15. Bitnet-B1.58. Hugging Face. Compumacy. Дата обращения: 27 августа 2026.
  16. 1 2 BitNet b1.58. Emergent Mind. Дата обращения: 27 августа 2026.
  17. 1 2 BitNet b1.58 2B 4-bit. Hugging Face. Microsoft. Дата обращения: 27 августа 2026.
  18. Running BitNet on Qualcomm Hexagon. Edge AI Vision. Дата обращения: 27 августа 2026.
  19. QVAC Fabric: LLM Fine-Tuning BitNet. Hugging Face Blog. Дата обращения: 27 августа 2026.
  20. Microsoft BitNet Repository. GitHub. Microsoft. Дата обращения: 27 августа 2026.
  21. Is bitnet.cpp the game changer for running LLMs on your laptop? GOpenAI Blog. Дата обращения: 27 августа 2026.
  22. BitNet: Scaling 1-bit Transformers (Technical Review). Zhongzhu Zhou's Blog (21 марта 2026). Дата обращения: 27 августа 2026.
  23. BitNet: Scaling 1-bit Transformers for Large Language Models. AlphaXiv. Дата обращения: 27 августа 2026.
  24. Ouyang, Xu; Ge, Tao; Hartvigsen, Thomas; Zhang, Zhisong; Mi, Haitao & Yu, Dong (2024), Low-Bit Quantization Favors Undertrained LLMS: Scaling Laws for Quantized LLMS with 100T Training Tokens, arΧiv:2411.17691 [cs.LG]. 
  25. Kumar, Tanishq; Ankner, Zachary; Spector, Benjamin F.; Bordelon, Blake; Muennighoff, Niklas; Paul, Mansheej; Pehlevan, Cengiz; Ré, Christopher; et al. (2024), Scaling Laws for Precision, arΧiv:2411.04330 [cs.LG]. 

Литература

  • Ma, Shuming; Wang, Hongyu; Ma, Lingxiao; Wang, Lei; Wang, Wenhui; Huang, Shaohan; Dong, Li; Wang, Ruiping; Xue, Jilong; Wei, Furu (27 февраля 2024). “The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits”. arXiv [англ.]. arXiv:2402.17764 [cs.CL]. Дата обращения 2025-04-22. Используется устаревший параметр |class= (справка); |access-date= требует |url= (справка)
  • Ma, Shuming; Wang, Hongyu; Huang, Shaohan; Zhang, Xingxing; Hu, Ying; Song, Ting; Xia, Yan & Wei, Furu (2025), BitNet b1.58 2B4T Technical Report, arΧiv:2504.12285 [cs.CL]. 
  • Friha, Othmane; Amine Ferrag, Mohamed; Kantarci, Burak; Cakmak, Burak; Ozgun, Arda; Ghoualmi-Zine, Nassira (2024). “LLM-Based Edge Intelligence: A Comprehensive Survey on Architectures, Applications, Security and Trustworthiness”. IEEE Open Journal of the Communications Society [англ.]. 5: 5799—5856. DOI:10.1109/OJCOMS.2024.3456549. ISSN 2644-125X. Дата обращения 2025-04-22. |access-date= требует |url= (справка)
  • Hutson, Matthew. 1-bit LLMs Could Solve AI's Energy Demands (англ.) (30 мая 2024). Дата обращения: 22 апреля 2025.
  • Huyen, Chip. AI Engineering : [англ.]. — O'Reilly Media, Inc., 4 декабря 2024. — ISBN 978-1-0981-6627-4.
  • Kumar, Tanishq; Ankner, Zachary; Spector, Benjamin F.; Bordelon, Blake; Muennighoff, Niklas; Paul, Mansheej; Pehlevan, Cengiz; Ré, Christopher; et al. (2024), Scaling Laws for Precision, arΧiv:2411.04330 [cs.LG]. 
  • Morales, Jowi Microsoft researchers build 1-bit AI LLM with 2B parameters (англ.). Tom's Hardware (17 апреля 2025). Дата обращения: 21 апреля 2025.
  • Ouyang, Xu; Ge, Tao; Hartvigsen, Thomas; Zhang, Zhisong; Mi, Haitao & Yu, Dong (2024), Low-Bit Quantization Favors Undertrained LLMS: Scaling Laws for Quantized LLMS with 100T Training Tokens, arΧiv:2411.17691 [cs.LG]. 
  • Wang, Hongyu; Ma, Shuming; Dong, Li; Huang, Shaohan; Wang, Huaijie; Ma, Lingxiao; Yang, Fan; Wang, Ruiping; et al. (2023), BitNet: Scaling 1-bit Transformers for Large Language Models, arΧiv:2310.11453 [cs.CL]. 

Категории