एआई पीयर रिव्यू क्या है?

एआई पीयर रिव्यू कई एआई मॉडल्स द्वारा एक-दूसरे के तर्कों की समीक्षा और रेटिंग करने का अभ्यास है, ठीक उसी तरह जैसे कि एआई आउटपुट पर लागू अकादमिक पीयर रिव्यू। एकल मॉडल के उत्तर पर भरोसा करने के बजाय, प्रत्येक मॉडल के दावों का मूल्यांकन अन्य मॉडलों द्वारा किया जाता है, और जो तर्क क्रॉस-मॉडल जांच में जीवित रहते हैं, उन्हें विश्वास मिलता है। इसका तर्क एकल LLM को जज के रूप में उपयोग करने की ज्ञात सीमाओं पर आधारित है: शोध दस्तावेज़ पोजीशन पूर्वाग्रह (जो उत्तर पहले प्रस्तुत होता है, उसे प्राथमिकता देना), वर्बोसिटी पूर्वाग्रह (गुणवत्ता की परवाह किए बिना लंबे उत्तरों को पुरस्कृत करना), और आत्म-संवर्धन पूर्वाग्रह (एक मॉडल अपने ही आउटपुट को प्राथमिकता देना) को दर्शाते हैं। कई मॉडलों के बीच मूल्यांकन फैलाने और यह एनोनिमाइज करने से कि किसका तर्क रेट किया जा रहा है, किसी एक जज के अद्वितीय पूर्वाग्रह को कम किया जाता है। चूंकि विभिन्न मॉडल अलग-अलग तरीके से हॉलुसिनेट करते हैं, एक निर्मित या असमर्थित दावा अक्सर अन्य मॉडलों द्वारा खराब रेट किया जाता है, इसलिए लगातार निम्न क्रॉस-मॉडल रेटिंग उन दावों को चिह्नित करती है जो मानव सत्यापन की आवश्यकता होती है। Argumentree.AI इसे इस तरह लागू करता है कि हर उपलब्ध मॉडल हर अन्य मॉडल के तर्कों को एनोनिमाइज्ड तरीके से रेट करता है, यह दर्शाते हुए कि कौन से दावे व्यापक रूप से समर्थित हैं और कौन से कमजोर या विवादित हैं। यह मानव निर्णय को बढ़ाता है, न कि उसे प्रतिस्थापित करता है।

सामूहिक एआई बुद्धिमत्ता पर वापस जाएंक्रॉस-मॉडल रेटिंग

क्या है
एआई पीयर रिव्यू?

एआई पीयर रिव्यू में कई मॉडल एक-दूसरे के तर्कों को रेट करते हैं - अकादमिक पीयर रिव्यू, एआई आउटपुट पर लागू। एनोनिमाइज्ड क्रॉस-मॉडल रेटिंग एकल एआई जज को मात देती है, जिसकी रेटिंग पूर्वाग्रही होती है।

TL;DR

एआई पीयर रिव्यू मॉडल्स को एक-दूसरे के तर्कों को रेट करने के लिए बनाता है, बजाय एक जज पर भरोसा करने के। एकल LLM जज पोजीशन, वर्बोसिटी, और आत्म-संवर्धन पूर्वाग्रह दिखाते हैं - कई मॉडलों के बीच रेटिंग फैलाने से, एनोनिमाइज्ड तरीके से, उन पूर्वाग्रहों को कम किया जाता है और कमजोर या हॉलुसिनेटेड दावे सामने आते हैं।

पीयर रिव्यू, एआई पर लागू

शिक्षा में, एक दावा स्वीकार नहीं किया जाता क्योंकि उसका लेखक आत्मविश्वासी है - इसे स्वतंत्र साथियों द्वारा जांचा जाता है जो तर्क और साक्ष्य का मूल्यांकन करते हैं। एआई पीयर रिव्यू उस सिद्धांत को उधार लेता है: एक मॉडल के उत्तर पर भरोसा करने के बजाय, आपके पास कई मॉडल होते हैं जो एक-दूसरे के तर्कों की समीक्षा और रेटिंग करते हैं। जो दावे क्रॉस-मॉडल जांच में टिकते हैं, उन्हें विश्वास मिलता है; जो दावे अन्य मॉडल खराब रेट करते हैं, उन्हें चिह्नित किया जाता है।

क्यों न केवल एक एआई को जज के रूप में उपयोग करें?

एक लुभावना शॉर्टकट है कि एकल मजबूत मॉडल को आउटपुट का ग्रेड देने दिया जाए - "LLM-एक-जज के रूप में" पैटर्न। समस्या: LLM जजों पर शोध ने ऐसे प्रणालीगत पूर्वाग्रहों का दस्तावेजीकरण किया है जो एक जज को अविश्वसनीय बनाते हैं।

दस्तावेजीकृत एकल-जज पूर्वाग्रह

  • पोजीशन पूर्वाग्रह - जो उत्तर पहले प्रस्तुत होता है, उसे प्राथमिकता देना
  • वर्बोसिटी पूर्वाग्रह - गुणवत्ता की परवाह किए बिना लंबे उत्तरों को पुरस्कृत करना
  • आत्म-संवर्धन पूर्वाग्रह - एक मॉडल अपने ही आउटपुट को प्राथमिकता देना
  • एकल जज की अद्वितीयताएँ हर रेटिंग पर लागू होती हैं

एनोनिमाइज्ड क्रॉस-मॉडल रेटिंग कैसे मदद करती है

दो डिज़ाइन विकल्प उन पूर्वाग्रहों का मुकाबला करते हैं: कई मॉडलों के बीच रेटिंग फैलाना, और जिसका तर्क रेट किया जा रहा है, उसे एनोनिमाइज करना। मिलकर वे सामग्री का मूल्यांकन करते हैं, न कि लेखन का, और किसी एक मॉडल की विशेषताओं को औसत करते हैं।

1

कई मॉडलों से तर्क एकत्र करें

हर उपलब्ध मॉडल स्वतंत्र रूप से पक्ष/विपक्ष के तर्कों का योगदान करता है।

2

लेखन को हटा दें

तर्कों को एनोनिमाइज किया जाता है ताकि कोई मॉडल न जाने कि कौन सा उसका अपना है।

3

हर मॉडल हर तर्क को रेट करता है

रेटिंग को मॉडलों के बीच फैलाया जाता है, न कि एक जज में केंद्रित किया जाता है।

4

क्रॉस-मॉडल सिग्नल को एकत्रित करें

व्यापक समर्थन = विश्वास; लगातार निम्न रेटिंग = एक कमजोर या हॉलुसिनेटेड दावा जिसे सत्यापित करना है।

उदाहरणात्मक उदाहरण - वास्तविक मॉडल आउटपुट नहीं

एक मॉडल asserts "यह पुस्तकालय डिज़ाइन द्वारा मेमोरी-सुरक्षित है" एक आत्मविश्वासी उद्धरण के साथ। एनोनिमाइज्ड पीयर रिव्यू के तहत, अन्य मॉडल उस तर्क को कम रेट करते हैं - कई नोट करते हैं कि उद्धृत गारंटी असुरक्षित इंटरऑप पथ को कवर नहीं करती। निम्न क्रॉस-मॉडल रेटिंग उस दावे को मानव द्वारा जांचने के लिए चिह्नित करती है, बजाय एक आत्मविश्वासी मॉडल को इसे बिना चुनौती के आगे बढ़ाने देने के।

Argumentree.AI में एआई पीयर रिव्यू

हर उपलब्ध मॉडल हर अन्य मॉडल के तर्कों को एनोनिमाइज्ड तरीके से रेट करता है - ताकि कमजोर दावे एक मॉडल के आत्मविश्वास के पीछे छिप न सकें।

कई स्वतंत्र मॉडल

तर्क कई मॉडलों से आते हैं, न कि एकल स्रोत से

एनोनिमाइज्ड क्रॉस-रेटिंग

हर मॉडल हर अन्य मॉडल के तर्कों को बिना लेखक को जाने रेट करता है

समर्थन एक सिग्नल बन जाता है

व्यापक रूप से समर्थित तर्क ऊपर उठते हैं; लगातार निम्न रेटेड वाले चिह्नित होते हैं

कमजोर दावे सामने आते हैं

संभावित हॉलुसिनेशन क्रॉस-मॉडल असहमति के रूप में सत्यापित होते हैं

अक्सर पूछे जाने वाले प्रश्न

एआई पीयर रिव्यू क्या है?

एआई पीयर रिव्यू तब होता है जब कई एआई मॉडल एक-दूसरे के तर्कों की समीक्षा और रेटिंग करते हैं, ठीक उसी तरह जैसे कि एआई आउटपुट पर लागू अकादमिक पीयर रिव्यू। एकल मॉडल के उत्तर पर भरोसा करने के बजाय, प्रत्येक मॉडल के दावों का मूल्यांकन अन्य मॉडलों द्वारा किया जाता है। जो तर्क क्रॉस-मॉडल जांच में टिकते हैं, उन्हें विश्वास मिलता है; जो दावे अन्य मॉडल खराब रेट करते हैं, उन्हें कमजोर या संभावित हॉलुसिनेटेड के रूप में चिह्नित किया जाता है।

एआई पीयर रिव्यू एकल एआई जज से बेहतर क्यों है?

एक LLM को जज के रूप में उपयोग करना पूर्वाग्रही होने के लिए जाना जाता है। LLM-एक-जज पर शोध ने पोजीशन पूर्वाग्रह (जो उत्तर पहले प्रस्तुत होता है, उसे प्राथमिकता देना), वर्बोसिटी पूर्वाग्रह (गुणवत्ता की परवाह किए बिना लंबे उत्तरों को पुरस्कृत करना), और आत्म-संवर्धन पूर्वाग्रह (एक मॉडल अपने ही आउटपुट को प्राथमिकता देना) का दस्तावेजीकरण किया है। कई मॉडलों के बीच मूल्यांकन फैलाने और यह एनोनिमाइज करने से कि किसका तर्क रेट किया जा रहा है, किसी एक जज के अद्वितीय पूर्वाग्रह को कम किया जाता है।

एनोनिमाइज्ड क्रॉस-मॉडल रेटिंग पूर्वाग्रह को कैसे कम करती है?

यदि एक मॉडल जानता है कि कौन सा तर्क उसका है, तो आत्म-संवर्धन पूर्वाग्रह उसे खुद को उच्च रेट करने के लिए प्रेरित कर सकता है। रेटिंग से पहले तर्कों को एनोनिमाइज करना उस संकेत को हटा देता है, इसलिए प्रत्येक मॉडल सामग्री का मूल्यांकन करता है न कि लेखक का। कई मॉडलों से रेटिंग को मिलाकर किसी एक मॉडल के पोजीशनल या वर्बोसिटी विशेषताओं को और औसत किया जाता है, जो एकल जज की तुलना में अधिक संतुलित सिग्नल उत्पन्न करता है।

क्या एआई पीयर रिव्यू हॉलुसिनेशन को पकड़ सकता है?

यह उन्हें सामने लाने में मदद करता है। चूंकि विभिन्न मॉडल अलग-अलग तरीके से हॉलुसिनेट करते हैं, एक मॉडल से निर्मित या असमर्थित दावा अक्सर अन्य द्वारा खराब रेट किया जाता है। लगातार निम्न क्रॉस-मॉडल रेटिंग एक लाल झंडा है कि एक दावे को मानव सत्यापन की आवश्यकता है। यह एक असहमति-खोज सिग्नल है, न कि एक गारंटी - यदि हर मॉडल एक ही त्रुटि साझा करता है, तो पीयर रिव्यू इसे नहीं पकड़ पाएगा।

क्या एआई पीयर रिव्यू मानव समीक्षा को प्रतिस्थापित करता है?

नहीं। एआई पीयर रिव्यू मानव निर्णय को प्राथमिकता देने और बढ़ाने के लिए डिज़ाइन किया गया है, न कि उसे प्रतिस्थापित करने के लिए। यह आपको बताता है कि कौन से दावे मॉडलों के बीच व्यापक रूप से समर्थित हैं और कौन से विवादित या कमजोर हैं, ताकि मानव सत्यापन को सबसे महत्वपूर्ण स्थानों पर केंद्रित किया जा सके। अंतिम निर्णय और उच्च-स्टेक सत्यापन मानव की जिम्मेदारी बनी रहती है।

मॉडल्स को एक-दूसरे की पीयर-रिव्यू करने दें

एक एआई जज पर भरोसा न करें। देखें कि हर मॉडल हर अन्य मॉडल के तर्कों को कैसे रेट करता है।

मुफ्त शुरू करें