Key points are not available for this paper at this time.
マルチモーダル大規模言語モデル(MLLMs)は最近重要な進展を遂げました。しかし、高解像度画像内の複雑な詳細を正確に認識し理解することには依然として課題があります。堅牢なMLLMsの開発に必要不可欠であるにもかかわらず、この分野は未調査のままです。この課題に対処するため、私たちの研究は、低計算オーバーヘッドでさまざまな解像度の画像を処理するために特別に設計された新しいアーキテクチャ、InfiMM-HDを紹介します。この革新により、MLLMsが高解像度の能力を持つように拡張できます。InfiMM-HDは、計算コストを削減するためにクロスアテンションモジュールと視覚ウィンドウを組み込んでいます。このアーキテクチャデザインを4段階のトレーニングパイプラインと統合することにより、私たちのモデルは効率的かつコスト効果的に視覚的知覚を向上させます。実証的研究はInfiMM-HDの堅牢性と効果を強調しており、関連分野での新しい探求の道を開いています。コードとモデルはhttps://huggingface.co/Infi-MM/infimm-hdで見つけることができます。
Liu et al. (Sun)はこの問題を研究しました。