GPT-4V: как формулировка вопроса и CoT влияют на точность ответов
Простым языком
LlamaIndex провели эксперименты с GPT-4V, чтобы понять, как лучше формулировать вопросы к мультимодальной модели. Они сравнили общие вопросы («опиши картинку») с конкретными («сколько людей и что они делают»), а также протестировали технику Chain-of-Thought, где модель объясняет свои рассуждения. Оказалось, что конкретные вопросы с CoT prompting дают на 40% лучшие результаты, чем базовый подход.
Что нового
- Конкретные вопросы повышают точность GPT-4V на 20-30% по сравнению с общими формулировками
- Chain-of-Thought prompting увеличивает точность на 15-25% за счет пошаговых рассуждений
- Комбинация конкретных вопросов и CoT дает синергетический эффект до 40% улучшения
- Для анализа изображений конкретные вопросы с CoT снижают галлюцинации на 35%
- CoT увеличивает количество токенов, что важно учитывать при расчете стоимости
Вердикт
Применять конкретные вопросы с CoT prompting рекомендуется для задач анализа изображений и сложных запросов к GPT-4V. Для простых задач классификации CoT может быть избыточен. Ограничения: результаты получены только для GPT-4V и могут не переноситься на другие модели.
Конкретные вопросы с CoT prompting дают до 40% прироста точности GPT-4V в анализе изображений, снижая галлюцинации на 35% — формулируйте запросы с указанием конкретных деталей и требуйте пошаговых рассуждений.