🆕 Новые модели 1 мин чтения

Claude Opus 4.8: SWE-Bench Pro 69.2%, Dynamic Workflows и «честный» агент

Что произошло

Anthropic выпустила Claude Opus 4.8. Главное: SWE-Bench Pro 69.2% (на 4.9 п.п. выше 4.7), OSWorld 83.4%, GDPval-AA 1890. Модель стала точнее в оценке собственного прогресса и дольше держит контекст в автономном режиме.

Детали

  • SWE-Bench Pro (agentic coding): 69.2% vs 64.3% у 4.7 и 58.6% у GPT-5.5
  • OSWorld (computer use): 83.4%
  • GDPval-AA (knowledge work): 1890 vs 1753 у предыдущей версии
  • Terminal coding: 74.6% (GPT-5.5 — 78.2%)
  • Цена не изменилась
  • Нововведение: Dynamic Workflows для координации субагентов

Что это значит

Рост на 4.9 п.п. по SWE-Bench Pro и механизм честной оценки прогресса делают Opus 4.8 сильнее для автономных агентных пайплайнов, где критична надёжность завершения задач.

Claude Opus 4.8: SWE-Bench Pro 69.2% (+4.9 п.п. к 4.7), Dynamic Workflows для субагентов и механизм «честной оценки прогресса» — модель теперь реже ложно сообщает о завершении задачи.