Понимание важности контекста в оценке ИИ
Пользователи языковых моделей часто задают вопросы, которые не имеют достаточной детализации, что усложняет понимание их потребностей. Например, вопрос «Какую книгу мне прочитать дальше?» зависит от индивидуальных предпочтений, в то время как «Как работают антибиотики?» требует других ответов в зависимости от уровня знаний пользователя. Существующие методы оценки часто игнорируют этот недостающий контекст, что приводит к несоответствующим выводам. Ответ, который хвалит кофе, может оказаться неуместным для человека с проблемами со здоровьем.
Актуальные исследования и методологии
Предыдущие исследования сосредоточились на генерации вопросов для уточнения, чтобы устранить неопределенности в таких задачах, как вопросы и ответы, диалоговые системы и извлечение информации. Эти методы нацелены на улучшение понимания намерений пользователей. Исследования по следованию инструкциям и персонализации подтверждают необходимость адаптации ответов в зависимости от атрибутов пользователя, включая уровень экспертизы, возраст и предпочтения в стиле общения. Вдобавок, изучались способы, как языковые модели адаптируются к различным контекстам и предлагались методы обучения для повышения этой адаптивности.
Контекстуализированные оценки: новый подход
Исследователи Университета Пенсильвании, Института ИИ Аллена и Университета Мэриленда предложили контекстуализированные оценки. Этот подход обогащает неопределенные запросы, добавляя синтетический контекст, представленный в виде пар вопрос-ответ, чтобы прояснить потребности пользователя во время оценивания языковых моделей. Их выводы показывают, что внедрение контекста может значительно изменить результаты оценки, иногда меняя ранжирование моделей и повышая согласованность оценщиков.
Влияние контекста на оценку моделей
В своем исследовании ученые разработали структуру для оценки производительности языковых моделей с учетом более четких, контекстуализированных запросов. Они выбрали неопределенные запросы из известных эталонных наборов данных и обогатили их парами вопросов и ответов, которые имитируют специфические для пользователя контексты. Оценка включала сбор ответов от различных языковых моделей и их сравнение в двух условиях: с оригинальным запросом и с добавленным контекстом. Эта методология эффективно измеряет, как контекст влияет на ранжирование моделей, согласие оценщиков и критерии оценки.
Ключевые находки
Включение контекста, такого как намерение пользователя или аудитория, значительно улучшает оценку моделей. Этот подход повышает согласие между оценщиками на 3–10% и в определенных сценариях может менять ранжирование моделей. Например, GPT-4 превосходил Gemini-1.5-Flash только при наличии контекстной информации. Без контекста оценки, как правило, сосредоточены на поверхностных характеристиках, таких как тональность или беглость, в то время как контекст смещает акцент на точность и полезность. Стандартные выводы моделей часто отражают западные, формальные и общие предвзятости, что делает их менее эффективными для разнообразных пользователей. Текущие эталоны, которые игнорируют контекст, рискуют привести к ненадежным результатам, подчеркивая необходимость оценок, соответствующих контекстно насыщенным подсказкам с соответствующими рубриками оценки, ориентированными на потребности пользователей.
Заключение
Многие запросы пользователей, направленные к языковым моделям, являются неопределенными, лишенными важного контекста, такого как намерение пользователя или уровень экспертизы. Эта неопределенность делает оценки субъективными и ненадежными. Предложенные контекстуализированные оценки, обогащающие запросы релевантными дополнительными вопросами и ответами, помогают сместить акцент с поверхностных характеристик на значимые критерии, такие как полезность. Этот метод также выявляет скрытые предвзятости в ответах модели, особенно те, которые основываются на предположениях WEIRD (Западные, Образованные, Индустриализированные, Богатые, Демократические). Хотя исследование использует ограниченный набор типов контекста и применяет некоторую автоматизированную оценку, оно настоятельно призывает к более контекстно-осознанным оценкам в будущих исследованиях.
Дополнительное чтение
Посмотрите статья, код, набор данных и блог для получения дополнительных сведений. Все кредиты за это исследование принадлежат исследователям этого проекта. Подпишитесь на нашу рассылку новостей ИИ, чтобы получать последние обновления.














