🆕 Новые модели 1 мин чтения

ITBench-AA: frontier-модели набирают ниже 50% на бенчмарке enterprise IT-агентов

Что произошло

IBM Research и Artificial Analysis представили ITBench-AA — первый бенчмарк для оценки LLM-агентов в реальных enterprise IT-задачах. Лучшие модели (GPT-4o, Claude 3.5 Sonnet, Gemini 1.5 Pro) набрали менее 50% точности на задачах инцидент-менеджмента и настройки инфраструктуры.

Детали

  • ITBench-AA — первый бенчмарк для LLM-агентов в enterprise IT от IBM Research и Artificial Analysis
  • Три категории задач: Incident Investigation, Monitoring Configuration, Configuration Management
  • GPT-4o, Claude 3.5 Sonnet, Gemini 1.5 Pro — все ниже 50% точности
  • Модели лучше справляются с поиском информации, хуже — с multi-step reasoning
  • Задачи основаны на реальных enterprise-сценариях с верифицируемыми ответами

Что это значит

Бенчмарк даёт инженерам первый измеримый ориентир: если вы строите IT-агентов — рассчитывайте на ~40–50% автономности и проектируйте human-in-the-loop для оставшихся 50%.

Frontier LLM-агенты набирают <50% на enterprise IT-задачах (инциденты, мониторинг, конфигурации) — основной bottleneck не поиск информации, а multi-step reasoning и планирование последовательности действий через несколько систем.