GPT-5.4: 83% на GDPval, tool search в API и open-source оценка CoT
Что произошло
OpenAI выпустила GPT-5.4 — модель превзошла GPT-5.2 на бенчмарке GDPval с 83% против 70.9% и получила новый API-инструмент tool search для эффективной работы с множеством инструментов.
Детали
- GDPval: 83.0% (GPT-5.4) vs 70.9% (GPT-5.2) — бенчмарк охватывает 44 профессии
- Новый API-инструмент: tool search для работы с большим количеством инструментов
- Выпущен open-source навык Playwright (Interactive) для демонстрации computer-use + coding
- Введена метрика CoT controllability — оценка устойчивости рассуждений к обфускации
- Контекстные окна GPT-5.4 Thinking не изменились относительно GPT-5.2
Что это значит
Для практиков: tool search снижает сложность при интеграции десятков инструментов в агентские пайплайны, а CoT controllability даёт метрику для аудита безопасности цепочек рассуждений.
GPT-5.4 достигает 83% совпадений с профессионалами на GDPval (44 профессии) — рост на 12 п.п. относительно GPT-5.2, при этом в API появился tool search для эффективной работы с множеством инструментов.