GPT-5.2 Thinking: новый SOTA на GDPval, производительность на уровне эксперта
Что произошло
OpenAI выпустила GPT-5.2 Thinking. Модель установила новый SOTA на бенчмарке GDPval, оценивающем задачи по 44 профессиям, и впервые продемонстрировала производительность на уровне или выше человеческого эксперта.
Детали
- Новый SOTA на бенчмарке GDPval (44 профессии)
- Производительность на уровне/выше человеческого эксперта
- Работа на SWE-Bench Pro (генерация патчей для реальных репозиториев)
- Улучшены ответы на темы суицида, ментального здоровья
- Основа — исследование safe completion из GPT-5
Что это значит
Релиз фокусируется на reasoning-качествах и безопасности, а не на raw-скорости — ориентир для инженеров, работающих с моделью в чувствительных доменах.
GPT-5.2 Thinking — первая модель OpenAI, превзошедшая уровень эксперта на GDPval (44 профессии), с улучшенной техникой safe completion для чувствительных диалогов.