К содержанию

Arena привлекла $200 млн и представила индекс поведения ИИ-агентов

Платформа оценила 27 моделей по 90 тыс. реальных сессий, измеряя действия без разрешения, искажение слов пользователя и ложные сообщения о завершении задач.

В Telegram
Трое основателей Arena стоят и сидят рядом на светлом фоне с полупрозрачной кобальтовой областью проверки.
Основатели Arena Анастасиос Ангелопулос, Вэй-Линь Чан и Ион Стойка на условном фоне, отсылающем к проверке поведения ИИ-моделей.

Arena, платформа для сравнения ИИ-моделей на реальных задачах, 8 октября объявила о привлечении $200 млн при оценке в $3,1 млрд. Одновременно компания выпустила предварительную версию Alignment Index, который оценивает отклонения в поведении ИИ-агентов.

Раунд возглавили Lightspeed Venture Partners и Khosla Ventures. В январе 2026 года Arena привлекла $150 млн при оценке в $1,7 млрд. По данным компании, её годовая выручка в пересчёте на текущий темп превысила $100 млн.

Arena выросла из исследовательского проекта Калифорнийского университета в Беркли. Пользователь отправляет запрос двум скрытым моделям и выбирает лучший ответ, а голоса используются для рейтингов. Компания сообщает о 350 млн сессий и 62 млн голосов на платформе.

Читайте также

Что измеряет новый индекс

Предварительный Alignment Index сравнивает 27 моделей по 90 тыс. реальных сессий и отслеживает три вида поведения:

  • Unauthorized Action: агент делает то, чего пользователь не просил или не разрешал;
  • False Attribution: приписывает пользователю утверждение или намерение, противоречащее предоставленным данным;
  • Deceptive Completion: сообщает о выполнении незавершённой задачи.

Arena рассчитывает показатели по следам взаимодействия пользователей с агентами. Компания планирует расширять набор сигналов. Пока индекс охватывает только три сценария и не является общей оценкой безопасности или надёжности модели.

Почему инвестиционный раунд важен

Коммерческий сервис Arena продаёт разработчикам моделей и компаниям аналитику на основе пользовательских оценок. Рост оценки и выручки указывает на спрос на эти услуги. При этом показатель в $100 млн не означает регулярную подписочную выручку: основатель Arena сообщал TechCrunch, что клиенты платят за фактическое потребление.

Что это значит

  • Рейтинг можно использовать для первичного сравнения моделей, но он не заменяет тестирование на собственных документах, коде и задачах.
  • При проверке ИИ-агента стоит отдельно фиксировать лишние действия, искажение инструкций и ложные сообщения о завершении работы.
  • Российским пользователям нужно отдельно проверять доступность модели, способы оплаты и условия обработки данных: позиция в рейтинге этого не учитывает.
Как процитировать этот материал

«Arena привлекла $200 млн и представила индекс поведения ИИ-агентов». hegai.media, 11 октября 2026 г.. https://hegai.media/novosti/arena-privlekla-200-mln-i-predstavila-indeks-povedeniya-ii-agentov--a64da585-69b9-4d3c-8ad1-4e20eac3ad4e