AI पीअर पुनरावलोकन म्हणजे अनेक AI मॉडेल एकमेकांचे तर्क पुनरावलोकन आणि रेट करणे, जसे शैक्षणिक पीअर पुनरावलोकन AI उत्पादनांवर लागू होते. एकाच मॉडेलच्या उत्तरावर विश्वास ठेवण्याऐवजी, प्रत्येक मॉडेलच्या दाव्यांचे मूल्यांकन इतर मॉडेलद्वारे केले जाते, आणि क्रॉस-मॉडेल तपासणीत टिकणारे तर्क विश्वासार्हता मिळवतात. यामागील तत्त्व एकाच LLM ला न्यायाधीश म्हणून वापरण्याच्या ज्ञात मर्यादांवर आधारित आहे: संशोधन दस्तऐवज स्थिती पूर्वाग्रह (जो उत्तर प्रथम दिसतो त्याला प्राधान्य देणे), verbosity पूर्वाग्रह (गुणवत्तेची पर्वा न करता लांब उत्तरांना बक्षिस देणे), आणि आत्म-सुधारणा पूर्वाग्रह (एक मॉडेल त्याच्या स्वतःच्या उत्पादनांना प्राधान्य देणे). अनेक मॉडेलमध्ये मूल्यांकन पसरवणे आणि कोणाचा तर्क रेट केला जात आहे हे अनामिक करणे कोणत्याही एकाच न्यायाधीशाच्या अद्वितीय पूर्वाग्रहाला कमी करते. कारण विविध मॉडेल भिन्न प्रकारे हॅलुसिनेट करण्याची प्रवृत्ती असते, एक बनावट किंवा असमर्थित दावा इतर मॉडेलद्वारे सामान्यतः कमी रेट केला जातो, त्यामुळे सतत कमी क्रॉस-मॉडेल रेटिंग मानव सत्यापनाची गरज असलेल्या दाव्यांना झेंडा दाखवतात. Argumentree.AI हे प्रत्येक उपलब्ध मॉडेलला प्रत्येक इतर मॉडेलच्या तर्कांना अनामिकपणे रेट करण्यास लागू करून कार्यान्वित करते, जे व्यापकपणे समर्थित असलेल्या दाव्यांना आणि कोणते दुर्बल किंवा वादग्रस्त आहेत हे उघड करते. हे मानवाच्या निर्णयाला वाढवते, त्याला बदलत नाही.
AI पीअर पुनरावलोकनामध्ये अनेक मॉडेल एकमेकांच्या तर्कांना रेट करतात — शैक्षणिक पीअर पुनरावलोकन, AI उत्पादनांवर लागू केलेले. अनामिक क्रॉस-मॉडेल रेटिंग एकाच AI न्यायाधीशाला मागे टाकते, ज्याचे रेटिंग पूर्वाग्रही असल्याचे ज्ञात आहे.
AI पीअर पुनरावलोकन मॉडेलांना एकमेकांचे तर्क रेट करण्यास भाग पाडते, एकाच न्यायाधीशावर विश्वास ठेवण्याऐवजी. एकल LLM न्यायाधीश स्थिती, verbosity, आणि आत्म-सुधारणा पूर्वाग्रह दर्शवतात — अनेक मॉडेलमध्ये रेटिंग पसरवणे, अनामिकपणे, त्या पूर्वाग्रहांना कमी करते आणि दुर्बल किंवा हॅलुसिनेटेड दाव्यांना उघड करते.
शैक्षणिक क्षेत्रात, एक दावा स्वीकारला जात नाही कारण त्याचा लेखक आत्मविश्वासाने आहे — तो स्वतंत्र सहकाऱ्यांद्वारे तपासला जातो जे तर्क आणि पुरावे न्यायाधीश करतात. AI पीअर पुनरावलोकन हा तत्त्व उधार घेतो: एकाच मॉडेलच्या उत्तरावर विश्वास ठेवण्याऐवजी, तुम्ही अनेक मॉडेलांना एकमेकांचे तर्क पुनरावलोकन आणि रेट करण्यास भाग पाडता. क्रॉस-मॉडेल तपासणीत टिकणारे दावे विश्वासार्हता मिळवतात; इतर मॉडेल कमी रेट केलेले दावे झेंडा दाखवतात.
एक आकर्षक शॉर्टकट म्हणजे एकाच मजबूत मॉडेलला उत्पादनांचे ग्रेड देणे — "LLM-एक-जज" पॅटर्न. समस्या: LLM न्यायाधीशांवरील संशोधनाने एकाच न्यायाधीशाला अविश्वसनीय बनवणारे प्रणालीगत पूर्वाग्रह दस्तऐवज केले आहेत.
त्या पूर्वाग्रहांना विरोध करण्यासाठी दोन डिझाइन निवडी: अनेक मॉडेलमध्ये रेटिंग पसरवा, आणि कोणाचा तर्क रेट केला जात आहे हे अनामिक करा. एकत्रितपणे ते सामग्रीचे न्यायाधीश करतात, लेखकाचे नाही, आणि कोणत्याही एकाच मॉडेलच्या विचित्रतेचे सरासरीकरण करतात.
प्रत्येक उपलब्ध मॉडेल स्वतंत्रपणे प्रॉ/कॉन तर्क योगदान देते.
तर्क अनामिक केले जातात जेणेकरून कोणतेही मॉडेल कोणते त्याचे आहे हे जाणून घेऊ शकत नाही.
रेटिंग मॉडेलमध्ये पसरवले जातात, एकाच न्यायाधीशात संकेंद्रित केले जात नाहीत.
व्यापक समर्थन = विश्वास; सतत कमी रेटिंग = सत्यापित करण्यासाठी एक दुर्बल किंवा हॅलुसिनेटेड दावा.
एक मॉडेल "ही लायब्ररी डिझाइनद्वारे मेमरी-सुरक्षित आहे" असा आत्मविश्वासाने संदर्भ देतो. अनामिक पीअर पुनरावलोकनाच्या अंतर्गत, इतर मॉडेल त्या तर्काला कमी रेट करतात — अनेकांनी नोट केले की संदर्भित हमी असुरक्षित इंटरऑप पथावर लागू होत नाही. कमी क्रॉस-मॉडेल रेटिंग दाव्याला मानवाने तपासण्यासाठी झेंडा दाखवतो, एक आत्मविश्वासाने मॉडेल त्याला अनियंत्रितपणे पुढे नेण्याऐवजी.
प्रत्येक उपलब्ध मॉडेल प्रत्येक इतर मॉडेलच्या तर्कांना रेट करते — अनामिक — त्यामुळे दुर्बल दावे एकाच मॉडेलच्या आत्मविश्वासामागे लपू शकत नाहीत.
तर्क अनेक मॉडेलमधून येतात, एकाच स्रोतातून नाही
प्रत्येक मॉडेल प्रत्येक इतर मॉडेलच्या तर्कांना लेखक जाणून न घेता रेट करते
व्यापकपणे समर्थित तर्क वाढतात; सतत कमी रेट केलेले तर्क झेंडा दाखवतात
संभाव्य हॅलुसिनेशन्स क्रॉस-मॉडेल असहमततेसारख्या सत्यापनासाठी उघडकीस येतात
AI पीअर पुनरावलोकन म्हणजे अनेक AI मॉडेल एकमेकांचे तर्क पुनरावलोकन आणि रेट करतात, जसे शैक्षणिक पीअर पुनरावलोकन AI उत्पादनांवर लागू होते. एकाच मॉडेलच्या उत्तरावर विश्वास ठेवण्याऐवजी, प्रत्येक मॉडेलच्या दाव्यांचे मूल्यांकन इतर मॉडेलद्वारे केले जाते. क्रॉस-मॉडेल तपासणीत टिकणारे तर्क विश्वासार्हता मिळवतात; इतर मॉडेल कमी रेट केलेले दावे दुर्बल किंवा संभाव्य हॅलुसिनेटेड म्हणून झेंडा दाखवतात.
एक LLM न्यायाधीश म्हणून वापरणे पूर्वाग्रही असल्याचे ज्ञात आहे. LLM-एक-जजवरील संशोधनाने स्थिती पूर्वाग्रह (जो उत्तर प्रथम दिसतो त्याला प्राधान्य देणे), verbosity पूर्वाग्रह (गुणवत्तेची पर्वा न करता लांब उत्तरांना बक्षिस देणे), आणि आत्म-सुधारणा पूर्वाग्रह (एक मॉडेल त्याच्या स्वतःच्या उत्पादनांना प्राधान्य देणे) दस्तऐवज केले आहेत. अनेक मॉडेलमध्ये मूल्यांकन पसरवणे आणि कोणाचा तर्क रेट केला जात आहे हे अनामिक करणे कोणत्याही एकाच न्यायाधीशाच्या अद्वितीय पूर्वाग्रहाला कमी करते.
जर एक मॉडेल जाणून घेत असेल की कोणता तर्क त्याचा आहे, तर आत्म-सुधारणा पूर्वाग्रह त्याला स्वतःला उच्च रेट करण्यास भाग पाडू शकतो. रेटिंग करण्यापूर्वी तर्क अनामिक करणे त्या संकेताला काढून टाकते, त्यामुळे प्रत्येक मॉडेल सामग्रीचे न्यायाधीश करते, लेखकाचे नाही. अनेक मॉडेलमधून रेटिंग एकत्रितपणे कोणत्याही एकाच मॉडेलच्या स्थिती किंवा verbosity विचित्रतेचे सरासरीकरण करते, एकाच न्यायाधीशापेक्षा अधिक संतुलित सिग्नल तयार करते.
हे त्यांना उघडकीस आणण्यास मदत करते. कारण विविध मॉडेल भिन्न प्रकारे हॅलुसिनेट करण्याची प्रवृत्ती असते, एकाच मॉडेलमधून बनवलेला किंवा असमर्थित दावा इतरांद्वारे सामान्यतः कमी रेट केला जातो. सतत कमी क्रॉस-मॉडेल रेटिंग म्हणजे एक लाल झेंडा की दाव्याला मानव सत्यापनाची आवश्यकता आहे. हे असहमतता-शोधक सिग्नल आहे, हमी नाही — जर प्रत्येक मॉडेल एकाच त्रुटीला सामोरे जात असेल, तर पीअर पुनरावलोकन ते पकडणार नाही.
नाही. AI पीअर पुनरावलोकन मानवाच्या निर्णयाला प्राधान्य देण्यासाठी आणि वाढवण्यासाठी डिझाइन केले आहे, त्याला बदलण्यासाठी नाही. हे तुम्हाला सांगते की कोणते दावे मॉडेलमध्ये व्यापकपणे समर्थित आहेत आणि कोणते वादग्रस्त किंवा दुर्बल आहेत, त्यामुळे मानवांना त्यांच्या सत्यापनावर लक्ष केंद्रित करता येईल जिथे ते सर्वात महत्त्वाचे आहे. अंतिम निर्णय आणि उच्च-जोखमीचे सत्यापन मानवाची जबाबदारी राहते.
एकाच AI न्यायाधीशावर विश्वास ठेवू नका. प्रत्येक मॉडेल प्रत्येक इतर मॉडेलच्या तर्कांना कसे रेट करते ते पहा.
मोफत प्रारंभ करा