ITBench-AA: frontier-модели набирают ниже 50% на бенчмарке enterprise IT-агентов
Что произошло
IBM Research и Artificial Analysis представили ITBench-AA — первый бенчмарк для оценки LLM-агентов в реальных enterprise IT-задачах. Лучшие модели (GPT-4o, Claude 3.5 Sonnet, Gemini 1.5 Pro) набрали менее 50% точности на задачах инцидент-менеджмента и настройки инфраструктуры.
Детали
- ITBench-AA — первый бенчмарк для LLM-агентов в enterprise IT от IBM Research и Artificial Analysis
- Три категории задач: Incident Investigation, Monitoring Configuration, Configuration Management
- GPT-4o, Claude 3.5 Sonnet, Gemini 1.5 Pro — все ниже 50% точности
- Модели лучше справляются с поиском информации, хуже — с multi-step reasoning
- Задачи основаны на реальных enterprise-сценариях с верифицируемыми ответами
Что это значит
Бенчмарк даёт инженерам первый измеримый ориентир: если вы строите IT-агентов — рассчитывайте на ~40–50% автономности и проектируйте human-in-the-loop для оставшихся 50%.
Frontier LLM-агенты набирают <50% на enterprise IT-задачах (инциденты, мониторинг, конфигурации) — основной bottleneck не поиск информации, а multi-step reasoning и планирование последовательности действий через несколько систем.