Key points are not available for this paper at this time.
大規模言語モデル (LLM) の "軍拡競争" は、その進展を忠実に検証するための新しい、挑戦的で多様なベンチマークを必要としています。私たちは、知識グラフ、ソーシャルネットワーク、分子構造などの多様なシナリオからの百万規模の実世界のグラフを使用して、グラフ計算問題に対するLLMを評価するために設計されたベンチマークツールGraphArenaを紹介します。GraphArenaは、4つの多項式時間タスク(例:最短距離)と6つのNP完全な課題(例:巡回セールスマン問題)を含む10の計算タスクのスイートを提供します。これには、LLMの出力を正しい、サブオプティマル(実行可能だが最適でない)、または幻覚的(適切にフォーマットされているが実行不可能)として分類する厳密な評価フレームワークが特徴です。GPT-4oやLLaMA3-70B-Instructを含む10の主要LLMの評価では、最高のパフォーマンスを発揮するモデルでも、より大きくより複雑なグラフ問題に苦しみ、幻覚の問題を示すことが明らかになりました。思考連鎖提示のような戦略を適用しても、これらの問題は未解決のままです。GraphArenaは、既存のLLMベンチマークに貴重な補完物を提供し、https://github.com/squareRoot3/GraphArena でオープンソースされています。
Tang et al. (Sat,) はこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: