Claude Opus 4.8: SWE-Bench Pro 69.2%, Dynamic Workflows и «честный» агент
Что произошло
Anthropic выпустила Claude Opus 4.8. Главное: SWE-Bench Pro 69.2% (на 4.9 п.п. выше 4.7), OSWorld 83.4%, GDPval-AA 1890. Модель стала точнее в оценке собственного прогресса и дольше держит контекст в автономном режиме.
Детали
- SWE-Bench Pro (agentic coding): 69.2% vs 64.3% у 4.7 и 58.6% у GPT-5.5
- OSWorld (computer use): 83.4%
- GDPval-AA (knowledge work): 1890 vs 1753 у предыдущей версии
- Terminal coding: 74.6% (GPT-5.5 — 78.2%)
- Цена не изменилась
- Нововведение: Dynamic Workflows для координации субагентов
Что это значит
Рост на 4.9 п.п. по SWE-Bench Pro и механизм честной оценки прогресса делают Opus 4.8 сильнее для автономных агентных пайплайнов, где критична надёжность завершения задач.
Claude Opus 4.8: SWE-Bench Pro 69.2% (+4.9 п.п. к 4.7), Dynamic Workflows для субагентов и механизм «честной оценки прогресса» — модель теперь реже ложно сообщает о завершении задачи.