એઆઈ પિયર રિવ્યૂ એ અનેક એઆઈ મોડલને એકબીજાના દલીલને સમીક્ષા અને રેટ કરવા માટેની પ્રથા છે, જે શૈક્ષણિક પિયર રિવ્યૂને એઆઈ આઉટપુટ પર લાગુ કરે છે. એક જ મોડલના જવાબ પર વિશ્વાસ કરવા બદલે, દરેક મોડલના દાવો અન્ય મોડલ દ્વારા મૂલ્યાંકિત થાય છે, અને ક્રોસ-મોડલની સમીક્ષા દ્વારા ટકી રહેલા દલીલને વિશ્વાસ મળે છે. આનું કારણ એ છે કે એક જ એલએલએમને જજ તરીકે ઉપયોગ કરવાની જાણીતી મર્યાદાઓમાં આધારિત છે: સંશોધન દસ્તાવેજો સ્થિતિના પૂર્વગ્રહને નોંધાવે છે (જે કોઈપણ જવાબ પ્રથમ દેખાય છે તે પસંદ કરે છે), verbosity પૂર્વગ્રહ (ગુણવત્તા પર ધ્યાન ન આપતા લાંબા જવાબોને ઇનામ આપે છે), અને સ્વયં-વધારાના પૂર્વગ્રહ (એક મોડલ તેના પોતાના આઉટપુટને પસંદ કરે છે). અનેક મોડલમાં મૂલ્યાંકન ફેલાવવાથી અને કઈ દલીલને રેટ કરવામાં આવી રહી છે તે અનામિક બનાવવાથી કોઈ એક જજના વિશિષ્ટ પૂર્વગ્રહને ઓછી કરે છે. કારણ કે વિવિધ મોડલો અલગ રીતે હલ્યુસિનેટ કરવા માટે વલણ ધરાવે છે, એક બનાવટી અથવા અસહાય દાવો અન્ય મોડલ દ્વારા ઘણીવાર ખરાબ રીતે રેટ કરવામાં આવે છે, તેથી સતત નીચા ક્રોસ-મોડલ રેટિંગ એ દાવાઓને ચિહ્નિત કરે છે જે માનવ ચકાસણીની જરૂર છે. Argumentree.AI આને અમલમાં લાવે છે કે દરેક ઉપલબ્ધ મોડલ દરેક અન્ય મોડલના દલીલને અનામિક રીતે રેટ કરે છે, જે દર્શાવે છે કે કયા દાવો વ્યાપક રીતે સમર્થિત છે અને કયા નબળા અથવા વિવાદિત છે. તે માનવ નિર્ણયને વધારવા માટે બનાવવામાં આવ્યું છે, તેને બદલે તેને બદલે.
એઆઈ પિયર રિવ્યૂમાં અનેક મોડલ એકબીજાના દલીલને રેટ કરે છે - શૈક્ષણિક પિયર રિવ્યૂ, એઆઈ આઉટપુટ પર લાગુ. અનામિક ક્રોસ-મોડલ રેટિંગ એક જ એઆઈ જજને હરાવે છે, જેના રેટિંગને પૂર્વગ્રહિત માનવામાં આવે છે.
એઆઈ પિયર રિવ્યૂ મોડલને એકબીજાના દલીલને રેટ કરાવે છે, એક જ જજ પર વિશ્વાસ કરવા બદલે. એકલ એલએલએમ જજોએ સ્થિતિ, verbosity, અને સ્વયં-વધારાના પૂર્વગ્રહ દર્શાવે છે - અનેક મોડલમાં રેટિંગ ફેલાવવાથી, અનામિક રીતે, તે પૂર્વગ્રહોને ઓછી કરે છે અને નબળા અથવા હલ્યુસિનેટેડ દાવાઓને બહાર લાવે છે.
શૈક્ષણિક ક્ષેત્રમાં, એક દાવો સ્વીકારવામાં નથી આવતો કારણ કે તેનો લેખક આત્મવિશ્વાસી છે - તેને સ્વતંત્ર સમકક્ષો દ્વારા સમીક્ષા કરવામાં આવે છે જે તર્ક અને પુરાવાને જજ કરે છે. એઆઈ પિયર રિવ્યૂ આ સિદ્ધાંતને ઉધાર લે છે: એક જ મોડલના જવાબ પર વિશ્વાસ કરવા બદલે, તમે અનેક મોડલને એકબીજાના દલીલને સમીક્ષા અને રેટ કરવા માટે રાખો છો. ક્રોસ-મોડલની સમીક્ષા હેઠળ ટકી રહેલા દાવાઓને વિશ્વાસ મળે છે; અન્ય મોડલ જે નબળા રેટ કરે છે તે ચિહ્નિત થાય છે.
એક આકર્ષક શોર્ટકટ એ છે કે એક જ મજબૂત મોડલને આઉટપુટને ગ્રેડ કરવા દેવું - "એલએલએમ-એઝ-એ-જજ" પેટર્ન. સમસ્યા: એલએલએમ જજ પર સંશોધન એ સિસ્ટમેટિક પૂર્વગ્રહોને દસ્તાવેજ કરે છે જે એક જ જજને અવિશ્વસનીય બનાવે છે.
આ પૂર્વગ્રહોને કાઉન્ટર કરવા માટે બે ડિઝાઇન પસંદગીઓ: બહુ મોડલમાં રેટિંગ ફેલાવો, અને કઈ દલીલને રેટ કરવામાં આવી રહી છે તે અનામિક બનાવો. એકસાથે તેઓ સામગ્રીને જજ કરે છે, લેખકને નહીં, અને કોઈ એક મોડલના અજીબને સરેરાશ કરે છે.
દરેક ઉપલબ્ધ મોડલ સ્વતંત્ર રીતે પ્રો/કોન દલીલ આપે છે.
દલીલને અનામિક બનાવવામાં આવે છે જેથી કોઈ મોડલને ખબર ન પડે કે કઈ તેની પોતાની છે.
રેટિંગ મોડલમાં ફેલાય છે, એક જ જજમાં કેન્દ્રિત નથી.
વ્યાપક સમર્થન = વિશ્વાસ; સતત નીચા રેટિંગ = માન્યતા માટે નબળા અથવા હલ્યુસિનેટેડ દાવો.
એક મોડલ "આ લાઇબ્રેરી ડિઝાઇન દ્વારા મેમરી-સેફ છે" સાથે આત્મવિશ્વાસી ઉલ્લેખ કરે છે. અનામિક પિયર રિવ્યૂ હેઠળ, અન્ય મોડલ તે દલીલને નીચું રેટ કરે છે - ઘણા નોંધે છે કે ઉલ્લેખિત ગેરંટી અસુરક્ષિત ઇન્ટરોપ પાથને આવરી લેતી નથી. નીચા ક્રોસ-મોડલ રેટિંગ એ દાવાને માનવ ચકાસવા માટે ચિહ્નિત કરે છે, એક જ આત્મવિશ્વાસી મોડલને તેને અવરોધિત કર્યા વિના આગળ વધવા દેવા બદલે.
દરેક ઉપલબ્ધ મોડલ દરેક અન્ય મોડલના દલીલને રેટ કરે છે - અનામિક - જેથી નબળા દાવાઓ એક જ મોડલના આત્મવિશ્વાસ પાછળ છુપાઈ ન શકે.
દલીલ અનેક મોડલમાંથી આવે છે, એક જ સ્ત્રોતમાંથી નહીં
દરેક મોડલ દરેક અન્ય મોડલના દલીલને રેટ કરે છે લેખકને જાણ્યા વિના
વ્યાપક રીતે સમર્થિત દલીલ ઊંચી થાય છે; સતત નીચા રેટેડ દલીલને ચિહ્નિત કરવામાં આવે છે
સંભવિત હલ્યુસિનેશનને માન્યતા માટે ક્રોસ-મોડલ વિવાદ તરીકે દર્શાવવામાં આવે છે
એઆઈ પિયર રિવ્યૂ એ ત્યારે થાય છે જ્યારે અનેક એઆઈ મોડલ એકબીજાના દલીલને સમીક્ષા અને રેટ કરે છે, જે શૈક્ષણિક પિયર રિવ્યૂને એઆઈ આઉટપુટ પર લાગુ કરે છે. એક જ મોડલના જવાબ પર વિશ્વાસ કરવા બદલે, દરેક મોડલના દાવો અન્ય મોડલ દ્વારા મૂલ્યાંકિત થાય છે. ક્રોસ-મોડલની સમીક્ષા હેઠળ ટકી રહેલા દાવાઓને વિશ્વાસ મળે છે; અન્ય મોડલ જે નબળા રેટ કરે છે તે નબળા અથવા સંભવિત હલ્યુસિનેટેડ તરીકે ચિહ્નિત થાય છે.
એક જ એલએલએમને જજ તરીકે ઉપયોગ કરવો પૂર્વગ્રહિત માનવામાં આવે છે. એલએલએમ-એઝ-એ-જજ પર સંશોધન સ્થિતિના પૂર્વગ્રહને દસ્તાવેજ કરે છે (જે કોઈપણ જવાબ પ્રથમ દેખાય છે તે પસંદ કરે છે), verbosity પૂર્વગ્રહ (ગુણવત્તા પર ધ્યાન ન આપતા લાંબા જવાબોને ઇનામ આપે છે), અને સ્વયં-વધારાના પૂર્વગ્રહ (એક મોડલ તેના પોતાના આઉટપુટને પસંદ કરે છે). અનેક મોડલમાં મૂલ્યાંકન ફેલાવવાથી અને કઈ દલીલને રેટ કરવામાં આવી રહી છે તે અનામિક બનાવવાથી કોઈ એક જજના વિશિષ્ટ પૂર્વગ્રહને ઓછી કરે છે.
જો એક મોડલ જાણે છે કે કઈ દલીલ તેની છે, તો સ્વયં-વધારાના પૂર્વગ્રહ તેને પોતાને વધુ ઊંચું રેટ કરાવશે. રેટિંગ પહેલાં દલીલને અનામિક બનાવવાથી તે સંકેત દૂર થાય છે, તેથી દરેક મોડલ સામગ્રીને જજ કરે છે, લેખકને નહીં. અનેક મોડલમાંથી રેટિંગને સંયોજિત કરવાથી કોઈ એક મોડલના સ્થિતિ અથવા verbosityના અજીબને વધુ સરેરાશ કરવામાં આવે છે, જે એક જ જજ કરતાં વધુ સંતુલિત સંકેત ઉત્પન્ન કરે છે.
તે તેમને બહાર લાવવામાં મદદ કરે છે. કારણ કે વિવિધ મોડલો અલગ રીતે હલ્યુસિનેટ કરવા માટે વલણ ધરાવે છે, એક મોડલમાંથી બનાવટી અથવા અસહાય દાવો અન્ય મોડલ દ્વારા ઘણીવાર ખરાબ રીતે રેટ કરવામાં આવે છે. સતત નીચા ક્રોસ-મોડલ રેટિંગ એ ચિહ્ન છે કે દાવાને માનવ ચકાસણીની જરૂર છે. તે વિવાદ-પહચાન સંકેત છે, ખાતરી નથી - જો દરેક મોડલ સમાન ભૂલ શેર કરે છે, તો પિયર રિવ્યૂ તેને પકડશે નહીં.
નહીં. એઆઈ પિયર રિવ્યૂ માનવ નિર્ણયને પ્રાથમિકતા અને વધારવા માટે ડિઝાઇન કરવામાં આવ્યું છે, તેને બદલે તેને બદલે. તે તમને જણાવે છે કે કયા દાવો મોડલમાં વ્યાપક રીતે સમર્થિત છે અને કયા વિવાદિત અથવા નબળા છે, જેથી માનવોએ તેમની ચકાસણી ત્યાં કેન્દ્રિત કરી શકે જ્યાં તે સૌથી વધુ મહત્વપૂર્ણ છે. અંતિમ નિર્ણય અને ઉચ્ચ-દાંતોની ચકાસણી માનવ જવાબદારી રહે છે.
એક જ એઆઈ જજ પર વિશ્વાસ ન કરો. જુઓ કે કેવી રીતે દરેક મોડલ દરેક અન્ય મોડલના દલીલને રેટ કરે છે.
મફત શરૂ કરો