Backpropagation के लिए ग्लोबल स्टेट की आवश्यकता होती है: सभी लेयर्स के माध्यम से प्रोपेगेट होने वाला एक सिंगल लॉस, पूरे नेटवर्क में रिटेन किए गए एक्टिवेशन्स, और सभी पैरामीटर्स में ग्रेडिएंट सिंक्रोनाइज़ेशन। हम दिखाते हैं कि Product of Experts (PoE) फ्रेमवर्क लोकल लर्निंग के लिए एक सैद्धांतिक आधार प्रदान करता है जो चार आर्किटेक्चर परिवारों (MLPs, CNNs, ResNets, Transformers) और पैमानों (30M से 897M पैरामीटर्स) में प्रतिस्पर्धी गुणवत्ता बनाए रखते हुए इस ग्लोबल निर्भरता को समाप्त करता है। तीन परिणाम इस पेपर को संरचित करते हैं: 1. सिद्धांत और छोटे पैमाने पर वेलिडेशन: PoE लोकल लर्निंग MNIST पर backpropagation के बराबर या उससे बेहतर प्रदर्शन करता है (98.00% बनाम 97.80%), CIFAR-10 पर 1.25% के अंतर तक पहुँचता है, और WikiText-2 पर 12% का अंतर प्राप्त करता है। कंटीन्युअल लर्निंग पर, PoE ने EWC के प्रदर्शन का 2.1x हासिल किया। 2. सिस्टम लाभ: ग्लोबल स्टेट को समाप्त करने से दोषरहित लेयर प्रूनिंग, बबल-मुक्त पाइपलाइन पैरेललिज्म (99% तक पाइपलाइन बबल्स को समाप्त करना), इलास्टिक डेप्थ स्केलिंग और पैरेलल स्टेज ब्रांचिंग (स्टेज-लेवल Mixture of Experts) सक्षम होते हैं। 3. क्लस्टर्ड लोकल लर्निंग के माध्यम से प्रोडक्शन स्केलिंग: इंट्रा-स्टेज ग्रेडिएंट फ्लो और इंटर-स्टेज डिटैचमेंट के साथ लेयर्स को मल्टी-लेयर स्टेजेस में समूहीकृत करने से ClimbMix-400B के 5.2B टोकन्स पर प्रशिक्षित 897M-पैरामीटर GPT पर 1.33x ट्रेनिंग ओवरहेड के साथ 6.6% BPB गैप प्राप्त होता है। BPB गैप के बावजूद, PoE मॉडल बेहतर तथ्यात्मक रिकॉल (26 QA प्रॉम्ट्स पर 4 विन्स बनाम 3 लॉसेस) प्रदर्शित करता है और स्टेज प्रीफिक्स प्रूनिंग (25% कंप्यूट 62.5% प्रश्नों का सही उत्तर देता है) के माध्यम से एडेप्टिव कंप्यूट को सक्षम बनाता है।
Jaepil Jeong (Mon,) ने इस प्रश्न का अध्ययन किया।
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: