LMArena
Arena (ранее — LMArena и Chatbot Arena)[1] — общедоступная веб-платформа для оценки больших языковых моделей (LLM), основанная на анонимном парном сравнении с привлечением широкой аудитории. Пользователь задаёт вопрос двум модельным чат-ботам (их имена скрыты) и голосует за лучший ответ; только после этого раскрываются названия моделей. Также можно самостоятельно выбирать модели для тестирования[2].
Платформа управляется коммерческой компанией Arena Intelligence Inc[3]., которая в 2026 году достигла статуса «единорога»[4].
Общие сведения
| Arena | |
|---|---|
| URL | arena.ai |
| Тип сайта | Искусственный интеллект |
| Регистрация | необязательная |
| Язык (-и) | английский |
| Владелец | Arena Intelligence Inc. |
| Автор | Вэй-Лин Чианг, Анастасиос Н. Ангелопулос, Ион Стоика |
| Начало работы | 2023 |
| Текущий статус | активен |
| Страна | |
История и коммерциализация
Проект был запущен в начале 2023 года исследователями из Калифорнийского университета в Беркли под названием Chatbot Arena[1]. 17 апреля 2025 года была создана компания Arena Intelligence Inc. и внедрён бренд LMArena[3]. В мае 2025 года компания привлекла 100 млн долларов посевных инвестиций при оценке в 600 млн долларов[5].
В конце 2025 года был запущен коммерческий продукт AI Evaluations, годовая прогнозируемая выручка которого к концу года достигла 30 млн долларов[4]. В январе 2026 года компания привлекла 150 млн долларов в раунде финансирования Серии А, достигнув оценки в 1,7 млрд долларов и статуса «единорога»[4]. 28 января 2026 года платформа была переименована в Arena[6].
Методология оценки
Для расчёта рейтинга платформа перешла от классической системы Эло к статистической модели Брэдли-Терри (Bradley-Terry) для обеспечения большей стабильности оценок[7][8]. Для оценки моделей на сложных задачах была внедрена система Arena-Hard[9][10]. Также на платформе применяются базовые меры защиты от манипуляций голосованием[11][8].
Методология оценки больших языковых моделей на LMArena анализируется в академических публикациях: учёные выявили ряд ограничений площадки и предложили варианты совершенствования. Платформа активно участвует в экосистеме исследований ИИ, регулярно обновляя свои методики с учётом последних научных рекомендаций[12].
Поддерживаемые модальности
Помимо текстовых моделей, платформа поддерживает оценку других модальностей[13]. Ключевые направления включают:
Использование в индустрии
Рейтинг платформы стал де-факто отраслевым стандартом, на который ориентируются лидеры рынка при оценке конкурентоспособности своих новых моделей[16].
Платформа LMArena популярна в индустрии искусственного интеллекта: ведущие компании предоставляют сюда свои большие языковые модели, такие как OpenAI — GPT-4o и o1, Google DeepMind — Gemini[17], и Anthropic — Claude[18]; компании используют полученные рейтинги для продвижения моделей.
Сайт также применяется для предварительного тестирования новых моделей. Так, китайская компания DeepSeek испытывала свои экспериментальные решения на LMArena за несколько месяцев до появления модели R1 в западных медиа. Среди других примечательных примеров — тестирование прототипа GPT-5 от OpenAI под кодовым названием «summit» и модели Google DeepMind Gemini 2.5 Flash Image (генерация и редактирование изображений, кодовое имя «nano-banana»)[19][20].
Примечания
Ссылки
- arena.ai — официальный сайт LMArena