🆕 Новые модели 2 мин чтения

GPT-4V: как формулировка вопроса и CoT влияют на точность ответов

Простым языком

LlamaIndex провели эксперименты с GPT-4V, чтобы понять, как лучше формулировать вопросы к мультимодальной модели. Они сравнили общие вопросы («опиши картинку») с конкретными («сколько людей и что они делают»), а также протестировали технику Chain-of-Thought, где модель объясняет свои рассуждения. Оказалось, что конкретные вопросы с CoT prompting дают на 40% лучшие результаты, чем базовый подход.

Что нового

  • Конкретные вопросы повышают точность GPT-4V на 20-30% по сравнению с общими формулировками
  • Chain-of-Thought prompting увеличивает точность на 15-25% за счет пошаговых рассуждений
  • Комбинация конкретных вопросов и CoT дает синергетический эффект до 40% улучшения
  • Для анализа изображений конкретные вопросы с CoT снижают галлюцинации на 35%
  • CoT увеличивает количество токенов, что важно учитывать при расчете стоимости

Вердикт

Применять конкретные вопросы с CoT prompting рекомендуется для задач анализа изображений и сложных запросов к GPT-4V. Для простых задач классификации CoT может быть избыточен. Ограничения: результаты получены только для GPT-4V и могут не переноситься на другие модели.

Конкретные вопросы с CoT prompting дают до 40% прироста точности GPT-4V в анализе изображений, снижая галлюцинации на 35% — формулируйте запросы с указанием конкретных деталей и требуйте пошаговых рассуждений.