मल्टि-LLM सहमति भनेको विभिन्न ठूलो भाषाई मोडेलहरूले स्वतन्त्र रूपमा एउटै दावीको बारेमा तर्क गर्दा र एक अर्काका तर्कहरूको मूल्याङ्कन गर्दा पुगिएको सहमति स्तर हो। यो एकल-मोडेल नमूनाकरण वा आत्म-संगतिबाट भिन्न छ, जसले एक मोडेललाई बारम्बार नमूना लिन्छ र त्यस मोडेलका पूर्वाग्रहहरू साझा गर्दछ। यो सांख्यिकीय समावेशबाट पनि भिन्न छ, जसले उत्पादनहरूलाई एक औसत भविष्यवाणीमा मिलाउँछ: मल्टि-LLM सहमति व्यक्तिगत तर्कहरूलाई जोगाउँछ ताकि तिनीहरूलाई औसतमा नपारेर जाँच गर्न सकिन्छ। Mixture-of-Agents (arXiv:2406.04692) मा गरिएको अनुसन्धानले धेरै LLMs को तह लगाउने क्रममा गुणस्तरको वृद्धि देखाउँछ, जुन मुख्य रूपमा AlpacaEval जस्ता प्राथमिकता मापदण्डहरूमा मापन गरिएको छ—यो कुनै पनि दावीमा तथ्यात्मक सटीकताको ग्यारेन्टी होइन, तर सुधारिएको प्रतिक्रिया गुणस्तरको प्रमाण हो। Argumentree.AI ले सहमतिलाई आत्मविश्वासको संकेतको रूपमा लिन्छ, सत्यको ओरेकल होइन; मोडेलहरू बीचको असहमतिहरू प्रायः सबैभन्दा कार्यान्वयन योग्य उत्पादन हुन्छन्।
मल्टि-LLM सहमति भनेको विभिन्न मोडेलहरू बीचको सहमति हो—एक मोडेललाई दुई पटक नमूना लिइएको होइन, र न त एक मिश्रित औसत। यो एक आत्मविश्वासको संकेत हो जुन तपाईं जाँच गर्न सक्नुहुन्छ, सत्यको ओरेकल होइन।
मल्टि-LLM सहमति विभिन्न मोडेलहरू बीचको सहमति मापन गर्दछ। यो आत्म-संगतिबाट (एक मोडेल, धेरै नमूनाहरू) र सांख्यिकीय समावेशबाट (मिश्रित औसत) भिन्न छ। यसले व्यक्तिगत तर्कहरूलाई जोगाउँछ—र यो आत्मविश्वासको संकेत हो, सत्यको प्रमाण होइन।
मल्टि-LLM सहमति भनेको विभिन्न ठूलो भाषाई मोडेलहरूले स्वतन्त्र रूपमा एउटै प्रश्नको बारेमा तर्क गर्दा र एक अर्काका तर्कहरूको मूल्याङ्कन गर्दा पुगिएको सहमति को डिग्री हो। महत्त्वपूर्ण शब्द भनेको भिन्न: मोडेलहरू भिन्न आर्किटेक्चर र तालिमको डेटा बाट आउँछन्, त्यसैले जब तिनीहरू एकत्रित हुन्छन्, त्यो सहमति एक प्रणालीको दृष्टिकोण भन्दा बढीलाई दर्शाउँछ—र जब तिनीहरू भिन्न हुन्छन्, विभाजनले वास्तवमा विवादित दावीलाई चिह्नित गर्दछ।
एक सामान्य एकल-मोडेल प्रविधि भनेको आत्म-संगति हो: एउटै मोडेललाई धेरै पटक नमूना लिई बहुमतको उत्तर लिन्छ। यसले र्यान्डम भिन्नतालाई घटाउँछ, तर प्रत्येक नमूनाले एउटै मोडेलका पूर्वाग्रह र अन्धा स्थानहरूलाई विरासतमा लिन्छ। यदि मोडेल विश्वस्त रूपमा गलत छ भने, यसलाई पुनः नमूना लिँदा केवल गल्ती दोहोरिन्छ। मल्टि-LLM सहमति प्रकारमा भिन्न छ—यसले स्वतन्त्र मोडेलहरू मा निर्भर गर्दछ, त्यसैले एकमा साझा अन्धा स्थान सबैले साझा गर्ने सम्भावना कम छ।
क्लासिकल समावेश मोडेल उत्पादनहरूलाई एकल औसत भविष्यवाणीमा मिलाउँछ—स्कोरको लागि उपयोगी, बुझ्नको लागि बेकार। मल्टि-LLM सहमति जानबूजेर यसको विपरीत गर्छ: यसले व्यक्तिगत तर्कहरूलाई जोगाउँछ ताकि तपाईं प्रत्येक मोडेलको तर्क पढ्न सक्नुहुन्छ। केही पनि एक ब्ल्याक-बक्स नम्बरमा समतल गरिएको छैन। यही कुरा असहमतिलाई स्पष्ट बनाउँछ र औसतमा हराउँदैन।
| पद्धति | यसले के संयोजन गर्छ | तर्क देखिन्छ? |
|---|---|---|
| आत्म-संगति | एक मोडेल, धेरै नमूनाहरू | केवल बहुमतको उत्तर |
| सांख्यिकीय समावेश | औसतमा मिश्रित उत्पादनहरू | छैन—औसतमा हराइन्छ |
| मल्टि-LLM सहमति | विभिन्न मोडेलहरूको तर्कहरू | हो—जोगाइएको र जाँच गर्न सकिने |
यहाँ सबैभन्दा धेरै उद्धृत गरिएको अनुसन्धान भनेको Mixture-of-Agents (arXiv:2406.04692) हो, जसले धेरै LLMs लाई तहमा राख्छ ताकि पछि आउने तहहरूले पहिलेका प्रतिक्रियाहरूलाई परिष्कृत गर्छ। यसले गुणस्तरको वृद्धि रिपोर्ट गर्दछ—तर के मापन गरिएको हो भन्ने कुरा स्पष्ट हुनु महत्त्वपूर्ण छ।
Mixture-of-Agents को लाभहरू मुख्य रूपमा प्राथमिकता मापदण्डहरू जस्तै AlpacaEval मा देखाइएको छ—जसले प्रतिक्रिया कति राम्रो छ भनेर मापन गर्दछ। त्यो ग्यारेन्टी होइन कुनै विशेष दावीमा तथ्यात्मक सटीकता। मोडेलहरूलाई संयोजन गर्दा गुणस्तर सुधार गर्न सक्छ; यसले सत्यको प्रमाणित गर्दैन।
टुक्राहरूलाई एकसाथ राख्नुहोस् र ईमानदार ढंगले यो हो: मल्टि-LLM सहमति भनेको आत्मविश्वासको संकेत हो। उच्च सहमति भनेको धेरै स्वतन्त्र प्रणालीहरू सहमत छन्, जसले मानव प्रमाणीकरणको प्राथमिकता घटाउँछ—तर यसले यसलाई हटाउँदैन। मोडेलहरूले तालिमको पूर्वाग्रह साझा गर्न सक्छन् र गलत हुन सक्छन्। सहमतिलाई "संभावित रूपमा कम जोखिम"को रूपमा लिई, र असहमतिहरू लाई तपाईंको सबैभन्दा कार्यान्वयन योग्य उत्पादनको रूपमा लिई: तिनीहरूले ठीक त्यहाँ चिह्नित गर्छन् जहाँ प्रमाणीकरण सबैभन्दा महत्त्वपूर्ण छ।
विभिन्न प्रणालीहरू बीचको सहमति—एक मोडेल पुनः नमूना गरिएको होइन
प्रत्येक मोडेलको तर्क पढ्नुहोस्; केही पनि एक ब्ल्याक बक्समा औसत गरिएको छैन
स्कोरहरूले आत्मविश्वासलाई समायोजन गर्छ—सत्यको प्रमाणको रूपमा कहिल्यै प्रस्तुत गरिएको छैन
विवादित बुँदाहरू मानव प्रमाणीकरणको लागि चिह्नित गरिन्छ
मल्टि-LLM सहमति भनेको विभिन्न ठूलो भाषाई मोडेलहरूले स्वतन्त्र रूपमा एउटै दावीको बारेमा तर्क गर्दा र एक अर्काका तर्कहरूको मूल्याङ्कन गर्दा पुगिएको सहमति स्तर हो। एउटै मोडेललाई धेरै पटक नमूना लिने सट्टा, यसले वास्तवमा भिन्न प्रणालीहरूमा निर्भर गर्दछ—त्यसैले सहमति भिन्न आर्किटेक्चर र तालिमको डेटा बीचको सहमति दर्शाउँछ, र असहमतिले चिह्नित गर्दछ जहाँ दावी विवादित छ।
आत्म-संगति एउटै एकल मोडेललाई धेरै पटक नमूना लिन्छ र बहुमतको उत्तर लिन्छ। यसले र्यान्डम भिन्नतालाई घटाउँछ तर एउटै मोडेलका पूर्वाग्रह र अन्धा स्थानहरूलाई साझा गर्छ। मल्टि-LLM सहमति भिन्न मोडेलहरू प्रयोग गर्दछ, त्यसैले सहमति बढी अर्थपूर्ण हुन्छ र असहमतिले एक अन्धा स्थानलाई प्रकट गर्न सक्छ जुन एक मोडेलको पुनरावृत्त नमूनाले कहिल्यै प्रकट गर्दैन।
सांख्यिकीय समावेशले मोडेल उत्पादनहरूलाई एकल औसत भविष्यवाणीमा मिलाउँछ, व्यक्तिगत तर्कलाई फ्याँकिदिन्छ। मल्टि-LLM सहमति प्रत्येक मोडेलका तर्कहरूलाई जोगाउँछ ताकि तपाईं तिनीहरूलाई पढ्न सक्नुहुन्छ। केही पनि एक ब्ल्याक-बक्स स्कोरमा औसत गरिएको छैन जुन तपाईं जाँच गर्न सक्नुहुन्न—व्यक्तिगत केसहरू देखिन्छन्, जुन असहमतिलाई स्पष्ट बनाउँछ।
Mixture-of-Agents (arXiv:2406.04692) जस्तो अनुसन्धानले धेरै LLMs को तह लगाउने क्रममा गुणस्तरको वृद्धि देखाउँछ, जुन मुख्य रूपमा AlpacaEval जस्ता प्राथमिकता मापदण्डहरूमा मापन गरिएको छ। त्यो ती मापदण्डहरूमा सुधारिएको प्रतिक्रिया गुणस्तरको प्रमाण हो—यो कुनै पनि विशेष दावीमा तथ्यात्मक सटीकताको ग्यारेन्टी होइन। सहमतिलाई आत्मविश्वासको संकेतको रूपमा लिई, सत्यको ओरेकल होइन।
होइन। सहमति आत्मविश्वासको संकेत हो, प्रमाण होइन। धेरै मोडेलहरूले एउटै तालिमको पूर्वाग्रह साझा गर्न सक्छन् र केही गलत कुरामा सहमत हुन सक्छन्। उच्च सहमति मानव प्रमाणीकरणको प्राथमिकता घटाउँछ; यसले कहिल्यै यसको आवश्यकता हटाउँदैन। सबैभन्दा कार्यान्वयन योग्य उत्पादन प्रायः असहमतिमा हुन्छ, जसले चिह्नित गर्छ कि प्रमाणीकरण कहाँ सबैभन्दा महत्त्वपूर्ण छ।
एक मोडेललाई दुई पटक नमूना लिइएको होइन। विभिन्न मोडेलहरू, तर्कहरू जोगाइएको, असहमतिहरू देखिन्छ।
निःशुल्क सुरु गर्नुहोस्