Key points are not available for this paper at this time.
Die Interaktion zwischen Menschen und künstlicher Intelligenz (KI) ist ein entscheidender Faktor, der die Effektivität von multimodalen großen Sprachmodellen (MLLMs) widerspiegelt. Aktuelle MLLMs konzentrieren sich jedoch hauptsächlich auf das Verständnis auf Bildebene und beschränken die Interaktion auf textliche Anweisungen, was ihre Flexibilität in der Nutzung und die Tiefe der Reaktionen einschränkt. In diesem Papier stellen wir das Draw-and-Understand-Projekt vor: ein neues Modell, einen Multi-Domain-Datensatz und eine herausfordernde Benchmark für visuelles Prompting. Konkret schlagen wir SPHINX-V vor, ein neu trainiertes, end-to-end Multimodales Großes Sprachmodell (MLLM), das einen Bildkodierer, einen visuellen Hinweis-Kodierer und ein LLM für verschiedene visuelle Hinweise (Punkte, Begrenzungsrahmen und freie Formen) sowie Sprachverständnis verbindet. Um die Forschung zum visuellen Prompting für MLLMs voranzutreiben, führen wir MDVP-Data und MDVP-Bench ein. MDVP-Data umfasst einen Multi-Domain-Datensatz mit 1,6 Millionen einzigartigen bild-visuellen Hinweis-Text-Anweisungen, einschließlich natürlicher Bilder, Dokumentenbilder, OCR-Bilder, mobile Screenshots, Web-Screenshots und mehrteilige Bilder. Darüber hinaus präsentieren wir MDVP-Bench, eine umfassende und herausfordernde Benchmark zur Bewertung der Fähigkeit eines Modells, visuelle Hinweis-Anweisungen zu verstehen. Unsere Experimente demonstrieren die beeindruckenden multimodalen Interaktionsfähigkeiten von SPHINX-V durch visuelles Prompting und zeigen signifikante Verbesserungen bei der detaillierten Beschreibung auf Pixel-Ebene und den Fähigkeiten zur Beantwortung von Fragen.
Lin et al. (Fri,) untersuchten diese Frage.