मल्टी-एलएलएम सहमति उस सहमति के स्तर को दर्शाती है जो तब प्राप्त होती है जब कई विभिन्न बड़े भाषा मॉडल स्वतंत्र रूप से एक ही दावे के बारे में तर्क करते हैं और एक-दूसरे के तर्कों का मूल्यांकन करते हैं। यह एकल-मॉडल सैंपलिंग या आत्म-संगति से भिन्न है, जो एक मॉडल को बार-बार सैंपल करता है और उस मॉडल के पूर्वाग्रहों को साझा करता है। यह सांख्यिकीय समेकन से भी भिन्न है, जो आउटपुट को एक औसत भविष्यवाणी में मिलाता है: मल्टी-एलएलएम सहमति व्यक्तिगत तर्कों को बनाए रखती है ताकि उन्हें औसत में समाहित करने के बजाय निरीक्षण किया जा सके। एजेंटों के मिश्रण पर शोध (arXiv:2406.04692) कई एलएलएम को परतबद्ध करने से गुणवत्ता में सुधार दिखाता है, जिसे मुख्य रूप से अल्पाका मूल्यांकन जैसे प्राथमिकता बेंचमार्क पर मापा गया है—प्रतिक्रिया की गुणवत्ता में सुधार का प्रमाण, किसी दिए गए दावे पर तथ्यात्मक सटीकता की गारंटी नहीं। Argumentree.AI सहमति को आत्मविश्वास संकेत के रूप में मानता है, सत्य ओरेकल नहीं; मॉडलों के बीच असहमति अक्सर सबसे क्रियाशील आउटपुट होती है।
मल्टी-एलएलएम सहमति कई वास्तव में विभिन्न मॉडलों के बीच सहमति है—न कि एक मॉडल को दो बार सैंपल किया गया, और न ही एक मिश्रित औसत। यह एक आत्मविश्वास संकेत है जिसे आप निरीक्षण कर सकते हैं, न कि एक सत्य ओरेकल।
मल्टी-एलएलएम सहमति कई विभिन्न मॉडलों के बीच सहमति को मापती है। यह आत्म-संगति (एक मॉडल, कई सैंपल) और सांख्यिकीय समेकन (मिश्रित औसत) से भिन्न है। यह व्यक्तिगत तर्कों को बनाए रखती है—और यह आत्मविश्वास संकेत है, सत्य का प्रमाण नहीं।
मल्टी-एलएलएम सहमति उस सहमति के स्तर को दर्शाती है जो तब प्राप्त होती है जब कई विभिन्न बड़े भाषा मॉडल स्वतंत्र रूप से एक ही प्रश्न के बारे में तर्क करते हैं और एक-दूसरे के तर्कों का मूल्यांकन करते हैं। महत्वपूर्ण शब्द है विभिन्न: मॉडल विभिन्न आर्किटेक्चर और प्रशिक्षण डेटा से आते हैं, इसलिए जब वे एकत्र होते हैं, तो वह सहमति एक प्रणाली के दृष्टिकोण से अधिक को दर्शाती है—और जब वे भिन्न होते हैं, तो विभाजन एक वास्तविक रूप से विवादित दावे को चिह्नित करता है।
एक सामान्य एकल-मॉडल तकनीक है आत्म-संगति: एक ही मॉडल को कई बार सैंपल करें और बहुमत का उत्तर लें। यह यादृच्छिक भिन्नता को कम करता है, लेकिन हर सैंपल उसी मॉडल के पूर्वाग्रहों और अंधे स्थानों को विरासत में लेता है। यदि मॉडल आत्मविश्वास से गलत है, तो इसे फिर से सैंपल करना केवल त्रुटि को दोहराता है। मल्टी-एलएलएम सहमति प्रकार में भिन्न है—यह स्वतंत्र मॉडलों पर निर्भर करती है, इसलिए एक में साझा अंधा स्थान सभी द्वारा साझा होने की संभावना नहीं है।
क्लासिकल समेकन मॉडल आउटपुट को एक एकल औसत भविष्यवाणी में मिलाता है—स्कोर के लिए उपयोगी, समझने के लिए बेकार। मल्टी-एलएलएम सहमति जानबूझकर इसके विपरीत करती है: यह व्यक्तिगत तर्कों को बनाए रखती है ताकि आप प्रत्येक मॉडल की तर्क को पढ़ सकें। कुछ भी एक काले बॉक्स नंबर में समाहित नहीं होता। यही असहमति को स्पष्ट बनाता है बजाय इसके कि वह औसत में गायब हो जाए।
| पद्धति | यह क्या मिलाता है | क्या तर्क दिखाई दे रहे हैं? |
|---|---|---|
| आत्म-संगति | एक मॉडल, कई सैंपल | केवल बहुमत का उत्तर |
| सांख्यिकीय समेकन | आउटपुट औसत में मिश्रित | नहीं—औसत में गायब |
| मल्टी-एलएलएम सहमति | कई विभिन्न मॉडलों के तर्क | हाँ—बनाए गए और निरीक्षण योग्य |
यहां सबसे अधिक उद्धृत शोध है एजेंटों का मिश्रण (arXiv:2406.04692), जो कई एलएलएम को परतबद्ध करता है ताकि बाद की परतें पहले की प्रतिक्रियाओं को परिष्कृत कर सकें। यह गुणवत्ता में सुधार की रिपोर्ट करता है—लेकिन यह महत्वपूर्ण है कि क्या मापा गया है, इस पर सटीक होना।
एजेंटों के मिश्रण के लाभ मुख्य रूप से प्राथमिकता बेंचमार्क जैसे अल्पाका मूल्यांकन पर दिखाए गए थे—यह मापने के लिए कि प्रतिक्रिया कितनी अच्छी मानी जाती है। यह नहीं किसी विशेष दावे पर तथ्यात्मक सटीकता की गारंटी है। मॉडलों को मिलाना गुणवत्ता में सुधार कर सकता है; यह सत्य को प्रमाणित नहीं करता।
टुकड़ों को एक साथ रखें और ईमानदार रूप से यह है: मल्टी-एलएलएम सहमति एक आत्मविश्वास संकेत है। उच्च सहमति का मतलब है कि कई स्वतंत्र प्रणालियाँ सहमत हैं, जो मानव सत्यापन के लिए प्राथमिकता को कम करती है—लेकिन इसे समाप्त नहीं करती। मॉडल एक प्रशिक्षण पूर्वाग्रह साझा कर सकते हैं और एक साथ गलत हो सकते हैं। सहमति को "संभवतः कम जोखिम" के रूप में मानें, और असहमतियों को अपने सबसे क्रियाशील आउटपुट के रूप में मानें: वे ठीक उसी स्थान की ओर इशारा करते हैं जहाँ सत्यापन सबसे महत्वपूर्ण है।
विभिन्न प्रणालियों के बीच सहमति—न कि एक मॉडल को फिर से सैंपल किया गया
प्रत्येक मॉडल की तर्क पढ़ें; कुछ भी एक काले बॉक्स में औसत नहीं किया गया
स्कोर आत्मविश्वास को कैलिब्रेट करते हैं—कभी भी सत्य के प्रमाण के रूप में प्रस्तुत नहीं किया जाता
विवादित बिंदुओं को मानव सत्यापन के लिए चिह्नित किया गया
मल्टी-एलएलएम सहमति उस सहमति के स्तर को दर्शाती है जो तब प्राप्त होती है जब कई विभिन्न बड़े भाषा मॉडल स्वतंत्र रूप से एक ही दावे के बारे में तर्क करते हैं और एक-दूसरे के तर्कों का मूल्यांकन करते हैं। एक मॉडल को कई बार सैंपल करने के विपरीत, यह वास्तव में विभिन्न प्रणालियों पर निर्भर करती है—इसलिए सहमति विभिन्न आर्किटेक्चर और प्रशिक्षण डेटा के बीच सहमति को दर्शाती है, और असहमति उन स्थानों को चिह्नित करती है जहाँ एक दावा विवादित है।
आत्म-संगति एक ही एकल मॉडल को कई बार सैंपल करती है और बहुमत का उत्तर लेती है। यह यादृच्छिक भिन्नता को कम करती है लेकिन एक मॉडल के पूर्वाग्रहों और अंधे स्थानों को साझा करती है। मल्टी-एलएलएम सहमति विभिन्न मॉडलों का उपयोग करती है, इसलिए सहमति अधिक अर्थपूर्ण होती है और असहमति एक अंधे स्थान को प्रकट कर सकती है जिसे एक मॉडल के बार-बार सैंपल करने से कभी नहीं उजागर किया जाएगा।
सांख्यिकीय समेकन मॉडल आउटपुट को एक एकल औसत भविष्यवाणी में मिलाता है, व्यक्तिगत तर्क को त्यागता है। मल्टी-एलएलएम सहमति प्रत्येक मॉडल के तर्कों को बनाए रखती है ताकि आप उन्हें पढ़ सकें। कुछ भी एक काले बॉक्स स्कोर में औसत नहीं किया जाता जिसे आप निरीक्षण नहीं कर सकते—व्यक्तिगत मामले स्पष्ट रहते हैं, जो असहमति को स्पष्ट बनाता है।
एजेंटों के मिश्रण जैसे शोध (arXiv:2406.04692) कई एलएलएम को परतबद्ध करने से गुणवत्ता में सुधार दिखाता है, जिसे मुख्य रूप से अल्पाका मूल्यांकन जैसे प्राथमिकता बेंचमार्क पर मापा गया है। यह उन बेंचमार्क पर प्रतिक्रिया की गुणवत्ता में सुधार का प्रमाण है—यह किसी दिए गए दावे पर तथ्यात्मक सटीकता की गारंटी नहीं है। सहमति को आत्मविश्वास संकेत के रूप में मानें, सत्य ओरेकल नहीं।
नहीं। सहमति एक आत्मविश्वास संकेत है, प्रमाण नहीं। कई मॉडल एक ही प्रशिक्षण पूर्वाग्रह साझा कर सकते हैं और कुछ गलत पर सहमत हो सकते हैं। उच्च सहमति मानव सत्यापन के लिए प्राथमिकता को कम करती है; यह कभी भी इसकी आवश्यकता को समाप्त नहीं करती। सबसे क्रियाशील आउटपुट अक्सर असहमति होती है, जो यह इंगित करती है कि सत्यापन कहाँ सबसे महत्वपूर्ण है।
न कि एक मॉडल को दो बार सैंपल किया गया। कई विभिन्न मॉडल, तर्क बनाए रखे गए, असहमति स्पष्ट।
मुफ्त शुरू करें