Key points are not available for this paper at this time.
مؤخراً، تم اقتراح DETR وDeformable DETR للقضاء على الحاجة إلى العديد من المكونات المصممة يدوياً في كشف الكائنات، مع إظهار أداء جيد مثل الكواشف المعقدة التي تم تصميمها يدوياً سابقاً. ومع ذلك، لم يتم استكشاف أدائها في كشف الكائنات في الفيديو (VOD) بشكل جيد. في هذه الورقة، نقدم TransVOD، نموذج كشف كائنات الفيديو من النهاية إلى النهاية قائم على هيكل المحولات الزمانية المكانية. الهدف من هذه الورقة هو تبسيط عملية VOD، وإزالة الحاجة إلى العديد من المكونات المصممة يدوياً لتجميع الميزات، مثل، تدفق الضوء، والشبكات العصبية المتكررة، وشبكات العلاقات. بالإضافة إلى ذلك، استفدنا من تصميم استعلام الكائن في DETR، حيث لا تحتاج طريقتنا إلى طرق ما بعد المعالجة المعقدة مثل Seq-NMS أو إعادة تقييم Tubelet، مما يحافظ على بساطة ونظافة العملية. على وجه الخصوص، نقدم المحول الزمني لتجميع كل من استعلامات الكائنات المكانية وذاكرات الميزات لكل إطار. يتكون المحول الزمني الخاص بنا من ثلاثة مكونات: ترميز المحول الزمني القابل للتشكيل (TDTE) لترميز التفاصيل المكانية المتعددة الإطارات، وترميز الاستعلام الزمني (TQE) لدمج استعلامات الكائن، ومحول فك الترميز الزمني القابل للتشكيل (TDTD) للحصول على نتائج كشف الإطار الحالي. تعزز هذه التصاميم قاعدة الأساس القوية لـ Deformable DETR بزيادة كبيرة (3%-4% mAP) على مجموعة بيانات ImageNet VID. ينتج TransVOD نتائج أداء قابلة للمقارنة في معيار ImageNet VID. نأمل أن يوفر TransVOD الخاص بنا منظورًا جديدًا لكشف الكائنات في الفيديو.
درس H وآخرون (Sun) هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: