एआई पीयर रिभ्यू भनेको धेरै एआई मोडेलहरूले एकअर्काका तर्कहरूको समीक्षा र मूल्याङ्कन गर्ने अभ्यास हो, जस्तै शैक्षिक पीयर रिभ्यू एआई उत्पादनहरूमा लागू गरिन्छ। एकल मोडेलको उत्तरमा विश्वास गर्नको सट्टा, प्रत्येक मोडेलको दाबीलाई अन्य मोडेलहरूले मूल्याङ्कन गर्छन्, र क्रस-मोडेलको जाँचमा बाँच्ने तर्कहरूले विश्वास प्राप्त गर्छन्। यो तर्क एकल LLM लाई न्यायाधीशको रूपमा प्रयोग गर्दा थाहा भएका सीमाहरूमा आधारित छ: अनुसन्धानले स्थिति पूर्वाग्रह (पहिलो देखिएको उत्तरलाई प्राथमिकता दिने), verbosity पूर्वाग्रह (गुणस्तरको परवाह नगरी लामो उत्तरहरूलाई पुरस्कार दिने), र आत्म-सुधार पूर्वाग्रह (एक मोडेलले आफ्नै उत्पादनलाई प्राथमिकता दिने) लाई दस्तावेज गरेको छ। धेरै मोडेलहरूमा मूल्याङ्कन फैलाउने र गुमनाम बनाउनेले कुनै एक न्यायाधीशको विशेष पूर्वाग्रहलाई कम गर्छ। विभिन्न मोडेलहरूले भिन्न तरिकामा ह्यालुसिनेट गर्नको कारण, एक बनावटी वा असमर्थित दाबीलाई अन्य मोडेलहरूले प्रायः कमजोर मूल्याङ्कन गर्छन्, त्यसैले लगातार कम क्रस-मोडेल रेटिङहरूले मानव प्रमाणीकरणको आवश्यकता पर्ने दाबीहरूलाई झण्डा लगाउँछन्। Argumentree.AI ले यो कार्यान्वयन गर्दछ जसले प्रत्येक उपलब्ध मोडेललाई प्रत्येक अन्य मोडेलका तर्कहरूको गुमनाम रूपमा मूल्याङ्कन गर्न अनुमति दिन्छ, कुन दाबीहरू व्यापक रूपमा समर्थन गरिएका छन् र कुन कमजोर वा विवादित छन् भन्ने कुरा उजागर गर्दछ। यसले मानव निर्णयलाई प्रतिस्थापन गर्ने सट्टा यसलाई बढाउँछ।
एआई पीयर रिभ्यूमा धेरै मोडेलहरूले एकअर्काका तर्कहरूको मूल्याङ्कन गर्छन् - शैक्षिक पीयर रिभ्यू, एआई उत्पादनहरूमा लागू गरिन्छ। गुमनाम क्रस-मोडेल रेटिङले एकल एआई न्यायाधीशलाई हराउँछ, जसका रेटिङहरू पूर्वाग्रही भएको थाहा छ।
एआई पीयर रिभ्यू ले मोडेलहरूलाई एकअर्काका तर्कहरूको मूल्याङ्कन गर्न बनाउँछ, एक न्यायाधीशमा विश्वास नगरी। एकल LLM न्यायाधीशहरूले स्थिति, verbosity, र आत्म-सुधार पूर्वाग्रह देखाउँछन् - धेरै मोडेलहरूमा रेटिङहरू फैलाउने, गुमनाम रूपमा, ती पूर्वाग्रहहरूलाई कम गर्छ र कमजोर वा ह्यालुसिनेट गरिएका दाबीहरूलाई उजागर गर्छ।
शिक्षामा, कुनै दाबी स्वीकार गरिदैन किनभने यसको लेखक विश्वस्त छ - यसलाई तर्क र प्रमाणको मूल्याङ्कन गर्ने स्वतन्त्र साथीसँग जाँच गरिन्छ। एआई पीयर रिभ्यू ले त्यो सिद्धान्तलाई उधारो लिन्छ: एक मोडेलको उत्तरमा विश्वास गर्नको सट्टा, तपाईंसँग धेरै मोडेलहरू छन् जसले एकअर्काका तर्कहरूको समीक्षा र मूल्याङ्कन गर्छन्। क्रस-मोडेलको जाँचमा बाँच्ने दाबीहरूले विश्वास प्राप्त गर्छन्; अन्य मोडेलहरूले कमजोर रूपमा मूल्याङ्कन गर्ने दाबीहरूलाई झण्डा लगाइन्छ।
एक आकर्षक छोटो बाटो भनेको एकल बलियो मोडेललाई उत्पादनहरूको ग्रेड दिनु हो - "LLM-as-a-judge" ढाँचा। समस्या: LLM न्यायाधीशहरूमा गरिएको अनुसन्धानले एक न्यायाधीशलाई अविश्वसनीय बनाउने प्रणालीगत पूर्वाग्रहहरूलाई दस्तावेज गरेको छ।
यी पूर्वाग्रहहरूलाई सामना गर्नका लागि दुई डिजाइन विकल्पहरू छन्: धेरै मोडेलहरूमा रेटिङ फैलाउनुहोस्, र कसको तर्क मूल्याङ्कन भइरहेको छ गुमनाम बनाउनुहोस्। सँगै, तिनीहरूले सामग्रीलाई न्याय गर्छन्, लेखकत्वलाई होइन, र कुनै एक मोडेलको विशेषताहरूलाई औसतमा ल्याउँछन्।
प्रत्येक उपलब्ध मोडेलले स्वतन्त्र रूपमा पक्ष/विपक्षका तर्कहरू योगदान गर्दछ।
तर्कहरू गुमनाम बनाइन्छ ताकि कुनै मोडेलले थाहा नपाओस् कि कुन तर्क यसको आफ्नै हो।
रेटिङहरू मोडेलहरूमा फैलिन्छ, एक न्यायाधीशमा संकेंद्रित हुँदैन।
व्यापक समर्थन = विश्वास; लगातार कम रेटिङ = एक कमजोर वा ह्यालुसिनेट गरिएका दाबीलाई प्रमाणित गर्न।
एक मोडेलले "यो पुस्तकालय डिजाइनद्वारा मेमोरी-सेफ हो" भन्ने दाबी गर्दछ जसमा विश्वस्त उद्धरण छ। गुमनाम पीयर रिभ्यूमा, अन्य मोडेलहरूले त्यो तर्कलाई कम मूल्याङ्कन गर्छन् - धेरैले उद्धृत गरिएको ग्यारेन्टीले असुरक्षित अन्तरक्रियात्मक मार्गलाई समेट्दैन भन्ने कुरा नोट गर्छन्। कम क्रस-मोडेल रेटिङले दाबीलाई मानवले जाँच गर्नका लागि झण्डा लगाउँछ, एक विश्वस्त मोडेललाई चुनौतीविना अघि बढ्न दिनुको सट्टा।
प्रत्येक उपलब्ध मोडेलले प्रत्येक अन्य मोडेलका तर्कहरूको मूल्याङ्कन गर्छ - गुमनाम रूपमा - ताकि कमजोर दाबीहरू एक मोडेलको विश्वासको पछाडि लुकेका छैनन्।
तर्कहरू धेरै मोडेलहरूबाट आउँछन्, एकल स्रोतबाट होइन
प्रत्येक मोडेलले लेखकलाई थाहा नपाई प्रत्येक अन्य मोडेलका तर्कहरूको मूल्याङ्कन गर्छ
व्यापक रूपमा समर्थित तर्कहरू उठ्छन्; लगातार कम मूल्याङ्कन गरिएका तर्कहरू झण्डा लगाइन्छ
संभावित ह्यालुसिनेसनहरू क्रस-मोडेल असहमतिका रूपमा देखिन्छन् जसलाई प्रमाणित गर्न आवश्यक छ
एआई पीयर रिभ्यू भनेको धेरै एआई मोडेलहरूले एकअर्काका तर्कहरूको समीक्षा र मूल्याङ्कन गर्ने प्रक्रिया हो, जस्तै शैक्षिक पीयर रिभ्यू एआई उत्पादनहरूमा लागू गरिन्छ। एकल मोडेलको उत्तरमा विश्वास गर्नको सट्टा, प्रत्येक मोडेलको दाबीलाई अन्य मोडेलहरूले मूल्याङ्कन गर्छन्। क्रस-मोडेलको जाँचमा बाँच्ने तर्कहरूले विश्वास प्राप्त गर्छन्; अन्य मोडेलहरूले कमजोर रूपमा मूल्याङ्कन गर्ने दाबीहरूलाई कमजोर वा सम्भावित ह्यालुसिनेट गरिएका रूपमा झण्डा लगाइन्छ।
एकल LLM लाई न्यायाधीशको रूपमा प्रयोग गर्दा पूर्वाग्रही भएको थाहा छ। LLM-as-a-judge मा गरिएको अनुसन्धानले स्थिति पूर्वाग्रह (पहिलो देखिएको उत्तरलाई प्राथमिकता दिने), verbosity पूर्वाग्रह (गुणस्तरको परवाह नगरी लामो उत्तरहरूलाई पुरस्कार दिने), र आत्म-सुधार पूर्वाग्रह (एक मोडेलले आफ्नै उत्पादनलाई प्राथमिकता दिने) लाई दस्तावेज गरेको छ। धेरै मोडेलहरूमा मूल्याङ्कन फैलाउने र कसको तर्क मूल्याङ्कन भइरहेको छ गुमनाम बनाउनेले कुनै एक न्यायाधीशको विशेष पूर्वाग्रहलाई कम गर्छ।
यदि एक मोडेललाई थाहा छ कि कुन तर्क यसको आफ्नै हो भने, आत्म-सुधार पूर्वाग्रहले यसलाई आफूलाई उच्च मूल्याङ्कन गर्न बनाउँछ। मूल्याङ्कन गर्नु अघि तर्कहरूलाई गुमनाम बनाउँदा त्यो संकेत हटाउँछ, त्यसैले प्रत्येक मोडेलले लेखकको सट्टा सामग्रीलाई न्याय गर्छ। धेरै मोडेलहरूबाट रेटिङहरूलाई संयोजन गर्दा कुनै एक मोडेलको स्थिति वा verbosity विशेषताहरूलाई थप औसतमा ल्याउँछ, एकल न्यायाधीशभन्दा बढी सन्तुलित सिग्नल उत्पादन गर्दछ।
यसले तिनीहरूलाई उजागर गर्न मद्दत गर्छ। विभिन्न मोडेलहरूले भिन्न तरिकामा ह्यालुसिनेट गर्नको कारण, एक मोडेलबाट बनावटी वा असमर्थित दाबीलाई अन्यहरूले प्रायः कमजोर मूल्याङ्कन गर्छन्। लगातार कम क्रस-मोडेल रेटिङहरू एक रेड फ्ल्याग हो कि दाबीलाई मानव प्रमाणीकरणको आवश्यकता छ। यो असहमतिका लागि संकेत हो, ग्यारेन्टी होइन - यदि प्रत्येक मोडेलले एउटै गल्ती साझा गर्छ भने, पीयर रिभ्यूले यसलाई पक्रने छैन।
होइन। एआई पीयर रिभ्यू मानव निर्णयलाई प्राथमिकता र बढाउनको लागि डिजाइन गरिएको हो, यसलाई प्रतिस्थापन गर्न होइन। यसले तपाईलाई कुन दाबीहरू मोडेलहरूमा व्यापक रूपमा समर्थन गरिएका छन् र कुन विवादित वा कमजोर छन् भन्ने कुरा बताउँछ, ताकि मानवहरूले जहाँ महत्त्वपूर्ण छ त्यहाँ आफ्नो प्रमाणीकरणमा ध्यान केन्द्रित गर्न सकून्। अन्तिम निर्णय र उच्च-जोखिम प्रमाणीकरण मानवको जिम्मेवारीमा रहन्छ।
एक एआई न्यायाधीशमा विश्वास नगर्नुहोस्। हरेक मोडेलले हरेक अन्य मोडेलका तर्कहरूको मूल्याङ्कन कसरी गर्छ भन्ने कुरा हेर्नुहोस्।
निःशुल्क सुरु गर्नुहोस्