एक LLM एन्सेम्बल कई बड़े भाषा मॉडलों के आउटपुट को मिलाकर एक ऐसा परिणाम उत्पन्न करता है जो किसी एकल मॉडल से अधिक मजबूत होता है। यह अवधारणा क्लासिकल मशीन-लर्निंग एन्सेम्बलिंग से आती है, जहां विविध मॉडलों के बीच औसत या मतदान करने से भिन्नता कम होती है और व्यक्तिगत त्रुटियों को रद्द किया जाता है। जनरेटिव मॉडलों पर लागू होने पर, एन्सेम्बलिंग का अर्थ हो सकता है आउटपुट को मिलाना, मतदान करना, या प्रतिक्रियाओं के बीच मार्गनिर्देशन करना। सांख्यिकीय एन्सेम्बलिंग आउटपुट को एक समग्र में मिलाता है — मजबूती में सुधार करता है लेकिन व्यक्तिगत तर्कों और मॉडलों के बीच किसी भी असहमति को छोड़ देता है। Argumentree.AI एक अलग दृष्टिकोण अपनाता है: आउटपुट का औसत निकालने के बजाय, यह प्रत्येक मॉडल के व्यक्तिगत तर्कों को बनाए रखता है और हर उपलब्ध मॉडल को हर अन्य मॉडल के तर्कों को रेट करने देता है, असहमति को छिपाने के बजाय इसे स्पष्ट रखता है। किसी भी प्रकार की एन्सेम्बलिंग टोकन लागत और विलंबता जोड़ती है क्योंकि यह कई मॉडलों को चलाती है — यह एक वास्तविक मजबूती तकनीक है जिसमें वास्तविक लागत होती है, यह कोई मुफ्त अपग्रेड नहीं है, और इसे उन प्रश्नों के लिए सबसे अच्छा रखा जाता है जहां एक आत्मविश्वासी एकल-मॉडल त्रुटि को पकड़ना अतिरिक्त कंप्यूट के लायक है।
एक LLM एन्सेम्बल कई भाषा मॉडलों को मिलाता है ताकि उनके स्वतंत्र त्रुटियाँ रद्द हो जाएं। सांख्यिकीय एन्सेम्बलिंग आउटपुट को एक में मिलाता है — Argumentree.AI प्रत्येक मॉडल के तर्कों को स्पष्ट और पीयर-रेटेड बनाए रखता है।
एक LLM एन्सेम्बल कई मॉडलों को क्वेरी करता है और मजबूती के लिए उन्हें मिलाता है। क्लासिक एन्सेम्बलिंग आउटपुट को एक मिश्रित उत्तर में औसत या मतदान करता है। Argumentree.AI इसके बजाय प्रत्येक मॉडल के व्यक्तिगत तर्कों को बनाए रखता है और मॉडलों को एक-दूसरे को रेट करने देता है — इसलिए असहमति स्पष्ट रहती है। किसी भी तरह से, कई मॉडलों को चलाना एक से अधिक लागत है।
एन्सेम्बलिंग मशीन लर्निंग में सबसे पुराने विश्वसनीयता ट्रिक्स में से एक है: एकल मॉडल पर भरोसा करने के बजाय, आप कई को मिलाते हैं। क्योंकि विविध मॉडल विभिन्न गलतियाँ करते हैं, उनके पूर्वानुमानों को मिलाना भिन्नता को कम करता है और व्यक्तिगत त्रुटियों को रद्द करता है। रैंडम फॉरेस्ट और ग्रेडिएंट बूस्टिंग एन्सेम्बल हैं; तीन लोगों से पूछना और बहुमत का उत्तर लेना भी एन्सेम्बल है।
एक LLM एन्सेम्बल बड़े भाषा मॉडलों पर समान विचार लागू करता है। आप कई मॉडलों को क्वेरी करते हैं — आदर्श रूप से वे जो विभिन्न डेटा पर विभिन्न आर्किटेक्चर के साथ प्रशिक्षित होते हैं — और जो वे उत्पन्न करते हैं उसे मिलाते हैं। जब स्वतंत्र मॉडल एकमत होते हैं, तो वह सहमति एक महत्वपूर्ण आत्मविश्वास संकेत है। जब वे भिन्न होते हैं, तो आपने एक ऐसा प्रश्न पाया है जो वास्तव में अनिश्चित है, जिसे एकल मॉडल ने झूठे आत्मविश्वास के साथ छिपा दिया होगा।
आप मिलाते हैं, यह वह जगह है जहां दृष्टिकोण भिन्न होते हैं। क्लासिक मार्ग सांख्यिकीय है: आउटपुट का औसत निकालें, बहुमत का वोट लें, या "सर्वश्रेष्ठ" मॉडल पर मार्गनिर्देशन करें। यह सब कुछ एक समग्र परिणाम में मिलाता है।
सांख्यिकीय समुच्चय आउटपुट को मिलाता है - एक उत्तर में औसत या मतदान करता है, व्यक्तिगत तर्कों को त्यागता है
यह एकल लेबल या स्कोर के लिए आदर्श है, लेकिन यह छिपाता है कि किस मॉडल ने क्या और क्यों कहा
Argumentree.AI प्रत्येक मॉडल के व्यक्तिगत तर्कों को औसत करने के बजाय संरक्षित करता है
फिर हर उपलब्ध मॉडल हर दूसरे मॉडल के तर्कों का मूल्यांकन करता है (सहकर्मी मूल्यांकन)
विपरीतता स्पष्ट रहती है - आप प्रतिस्पर्धी दावों को देखते हैं और ठीक उसी स्थान पर जहां मॉडल विभाजित होते हैं
पूछें "क्या यह माइग्रेशन योजना उत्पादन में चलाने के लिए सुरक्षित है?" एक सांख्यिकीय एन्सेम्बल मॉडल को "72% सुरक्षित" स्कोर पर औसत कर सकता है — साफ-सुथरा, लेकिन आप नहीं जानते कि क्यों। एक संरक्षित-तर्क दृष्टिकोण आपको दिखाता है कि अधिकांश मॉडलों ने समान रोलबैक गैप को चिह्नित किया जबकि एक ने एक विशिष्ट लॉकिंग चिंता उठाई जिसे अन्य ने नजरअंदाज कर दिया। मिश्रित स्कोर ने उन दो तर्कों को छिपा दिया जो वास्तव में महत्वपूर्ण हैं।
आप उन्हें किसी भी तरह से मिलाते हैं, एक एन्सेम्बल कई मॉडलों को चलाता है, इसलिए यह एकल कॉल की तुलना में अधिक टोकन और विलंबता जोड़ता है। और यह कुछ से ज्ञान नहीं बनाता:
Argumentree.AI औसत निकालने के बिना एन्सेम्बल की मजबूती का लाभ बनाए रखता है।
कई मॉडल स्वतंत्र रूप से उत्तर देते हैं - विविधता ही बिंदु है
व्यक्तिगत पक्ष/विपक्ष के तर्कों को श्रेय दिया जाता है, औसत में नहीं मिलाया जाता
हर उपलब्ध मॉडल हर दूसरे मॉडल के तर्कों का मूल्यांकन करता है
आप सहमति को आत्मविश्वास के रूप में और भिन्नता को असली प्रश्न के रूप में देखते हैं
एक LLM समुच्चय कई भाषा मॉडलों के आउटपुट को मिलाकर एक ऐसा परिणाम उत्पन्न करता है जो किसी एकल मॉडल की तुलना में अधिक मजबूत होता है। यह विचार पारंपरिक मशीन लर्निंग समुच्चय से लिया गया है - जहां विविध मॉडलों के बीच औसत या मतदान करने से भिन्नता और व्यक्तिगत त्रुटियाँ कम होती हैं - इसे जनरेटिव मॉडलों पर लागू किया गया है, उनके उत्तरों को मिलाकर, मतदान करके, या उनके बीच मार्गनिर्देशन करके।
एकल मॉडल आपको एक दृष्टिकोण देता है जिसमें एक सेट के अंधे स्थान होते हैं। एक समुच्चय कई मॉडलों को पूछता है - अक्सर विभिन्न डेटा और विभिन्न आर्किटेक्चर पर प्रशिक्षित - ताकि उनकी स्वतंत्र त्रुटियाँ आंशिक रूप से रद्द हो जाएं। जब मॉडल एकजुट होते हैं, तो वह सहमति एक आत्मविश्वास संकेत होती है; जब वे भिन्न होते हैं, तो आपने एक वास्तव में अनिश्चित प्रश्न को सामने लाया है जिसे एक मॉडल ने छिपा दिया होता।
क्लासिक सांख्यिकीय समुच्चय ठीक यही करता है - यह औसत करता है, मतदान करता है, या अन्यथा आउटपुट को एक मिश्रित परिणाम में मिलाता है। यह मजबूती में सुधार करता है लेकिन व्यक्तिगत तर्कों को फेंक देता है: आपको एक चिकना उत्तर मिलता है और यह नहीं देख पाते कि किस मॉडल ने क्या और क्यों कहा। यह व्यापार-बंद एकल लेबल या स्कोर के लिए ठीक है, लेकिन जब असहमति स्वयं वह अंतर्दृष्टि होती है जिसकी आपको आवश्यकता होती है, तो यह सीमित होता है।
आउटपुट को एक मिश्रित उत्तर में औसत करने के बजाय, Argumentree.AI प्रत्येक मॉडल के व्यक्तिगत तर्कों को संरक्षित करता है और फिर हर उपलब्ध मॉडल को हर दूसरे मॉडल के तर्कों का मूल्यांकन करने देता है। विपरीतता स्पष्ट रहती है, इसलिए आप न केवल एक समग्र स्कोर देख सकते हैं बल्कि वास्तविक प्रतिस्पर्धी दावे और जहां मॉडल विभाजित होते हैं, उसे भी देख सकते हैं।
समुच्चय कई मॉडलों को चलाता है, इसलिए यह एकल कॉल की तुलना में अधिक टोकन और विलंबता की लागत करता है - यह जादू नहीं है और न ही मुफ्त है। यह उच्च दांव वाले प्रश्नों के लिए लाभकारी होता है जहां एकल मॉडल की आत्मविश्वास त्रुटि को पकड़ना, या यह जानना कि एक दावा कितना विवादित है, अतिरिक्त कंप्यूट से अधिक मूल्यवान होता है। निम्न-दांव, नियमित प्रश्नों के लिए एकल मॉडल आमतौर पर सही कॉल होता है।
असहमति को औसत में न मिलाएं। प्रत्येक मॉडल के तर्कों को देखें और वे एक-दूसरे को कैसे रेट करते हैं।
मुफ्त शुरू करें