Key points are not available for this paper at this time.
モデル応答の相対品質比較として、人間と大規模言語モデル(LLM)の嗜好は、モデルのファインチューニングおよび評価基準における一般的な調整目標として機能します。しかし、これらの嗜好は広範な傾向を反映するだけであり、説明可能性や制御可能性が低く、安全リスクの可能性があるモデルを生じることになります。本研究では、人間および32種類の異なるLLMの嗜好を解剖し、リアルワールドのユーザー-モデル会話からの注釈を用いて、その定量的構成を理解します。人間はエラーに対する感受性が低く、自らの立場を支持する応答を好み、モデルが限界を認めると嫌悪感を示すことが明らかになりました。一方、GPT-4-Turboなどの高度なLLMは、正確性、明快さ、無害性を重視する傾向があります。さらに、同様のサイズのLLMは、学習方法に関係なく類似の嗜好を示し、調整のためのファインチューニングは、事前学習のみのLLMの嗜好を大きく変更しません。最後に、嗜好に基づく評価は意図的に操作できることを示します。学習なしおよび学習ベースの設定の両方で、審査員の嗜好に合わせてモデルを調整するとスコアが向上し、最も好まれない特性を注入するとスコアが低下します。この結果、MT-Bench(1-10スケール)で最大0.59、AlpacaEval 2.0(0-100スケール)で31.94の著しいスコアシフトが生じ、この戦略的適応の重要な影響が強調されます。インタラクティブデモ: https://huggingface.co/spaces/GAIR/Preference-Dissection-Visualization データセット: https://huggingface.co/datasets/GAIR/preference-dissection コード: https://github.com/GAIR-NLP/Preference-Dissection.
Li et al. (土曜日)はこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: