ஏன் AI பீர் மதிப்பீடு?

AI பீர் மதிப்பீடு என்பது பல AI மாதிரிகள் ஒருவருக்கொருவர் வாதங்களை மதிப்பீடு செய்து மதிப்பீடு செய்வதற்கான நடைமுறை ஆகும், இது AI வெளியீடுகளுக்கு பயன்படுத்தப்படும் கல்வி பீர் மதிப்பீட்டைப் போலவே உள்ளது. ஒரு மாதிரியின் பதிலுக்கு நம்பிக்கை வைக்காமல், ஒவ்வொரு மாதிரியின் வாதங்களும் மற்ற மாதிரிகள் மூலம் மதிப்பீடு செய்யப்படுகின்றன, மற்றும் மாறுபட்ட மாதிரிகள் மூலம் பரிசீலனைக்கு உட்பட்ட வாதங்கள் நம்பிக்கையை பெறுகின்றன. ஒரு தனி LLM-ஐ நீதிபதியாகப் பயன்படுத்துவதற்கான அறியப்பட்ட எல்லைகளில் இந்த காரணம் அடிப்படையாக்கப்பட்டுள்ளது: ஆராய்ச்சி ஆவணங்கள் இடதுசாரி பாகுபாடு (முதலில் தோன்றும் பதிலை ஆதரிக்கும்), நீளமான பதில்களுக்கு (தரத்தைப் பொருட்படுத்தாமல்) பரிசு வழங்கும் நீளத்தன்மை பாகுபாடு, மற்றும் தன்னிறைவு பாகுபாடு (ஒரு மாதிரி தனது சொந்த வெளியீடுகளை விரும்புவது). பல மாதிரிகள் மத்தியில் மதிப்பீட்டை பரப்புவதும், எந்த வாதம் மதிப்பீடு செய்யப்படுகிறதென்று மறைமுகமாகக் கூறுவதும், ஒரு நீதிபதியின் தனித்துவமான பாகுபாட்டை குறைக்கிறது. மாறுபட்ட மாதிரிகள் மாறுபட்ட முறையில் கற்பனை செய்ய tendency உள்ளதால், உருவாக்கப்பட்ட அல்லது ஆதரிக்கப்படாத வாதம் மற்ற மாதிரிகள் மூலம் அடிக்கடி மோசமாக மதிப்பீடு செய்யப்படுகிறது, எனவே தொடர்ந்து குறைந்த மாறுபட்ட மதிப்பீடுகள் மனித சரிபார்ப்புக்கு உரிய வாதங்களை அடையாளம் காண்கின்றன. Argumentree.AI இதை ஒவ்வொரு கிடைக்கும் மாதிரியும் மற்ற மாதிரிகளின் வாதங்களை மறைமுகமாக மதிப்பீடு செய்வதன் மூலம் செயல்படுத்துகிறது, எந்த வாதங்கள் பரந்த அளவில் ஆதரிக்கப்படுகின்றன மற்றும் எந்தவாறு பலவீனமான அல்லது எதிர்க்கப்பட்டவை என்பதை வெளிப்படுத்துகிறது. இது மனித தீர்மானத்தை மாற்றுவதற்குப் பதிலாக அதை மேம்படுத்துகிறது.

கூட்டு AI அறிவுக்கு திரும்பவும்குறுக்கு மாதிரி மதிப்பீடு

என்னது
AI பீர் மதிப்பீடு?

AI பீர் மதிப்பீடு பல மாதிரிகள் ஒருவருக்கொருவர் வாதங்களை மதிப்பீடு செய்கின்றன — AI வெளியீடுகளுக்கு பயன்படுத்தப்படும் கல்வி பீர் மதிப்பீடு. அநாமதேயமாக்கப்பட்ட குறுக்கு-மாதிரி மதிப்பீடு ஒற்றை AI நீதிபதியை வெல்கிறது, அதன் மதிப்பீடுகள் சார்பானவை என்று அறியப்படுகிறது.

TL;DR

AI பீர் மதிப்பீடு ஒரு நீதிபதியை நம்புவதற்கு பதிலாக மாதிரிகள் ஒருவருக்கொருவர் வாதங்களை மதிப்பீடு செய்யச் செய்கிறது. ஒற்றை LLM நீதிபதிகள் நிலை, நீளம், மற்றும் சுய-மேம்பாட்டு சார்பை காட்டுகின்றன — பல மாதிரிகளில் அநாமதேயமாக மதிப்பீடுகளை பரப்புவது அந்த சார்புகளை குறைக்கிறது மற்றும் பலவீனமான அல்லது கற்பனை செய்யப்பட்ட கூற்றுகளை வெளிப்படுத்துகிறது.

பீர் மதிப்பீடு, AI க்கு பயன்படுத்தப்பட்டது

கல்வியில், ஒரு வாதம் அதன் ஆசிரியர் நம்பிக்கையுடன் இருப்பதால் ஏற்கப்படுவதில்லை — அது காரணம் மற்றும் ஆதாரத்தை மதிப்பீடு செய்யும் சுயாதீன பீர்களால் ஆய்வு செய்யப்படுகிறது. AI பீர் மதிப்பீடு அந்தக் கொள்கையை கடைபிடிக்கிறது: ஒரே மாதிரியின் பதிலுக்கு நம்பிக்கை வைக்காமல், நீங்கள் பல மாதிரிகள் ஒருவருக்கொருவர் வாதங்களை மதிப்பீடு செய்யவும் மதிப்பீடு செய்யவும் செய்கிறீர்கள். குறுக்கு மாதிரி ஆய்வில் நிலைத்திருக்கும் வாதங்கள் நம்பிக்கையை பெறுகின்றன; மற்ற மாதிரிகள் மோசமாக மதிப்பீடு செய்யும் வாதங்கள் அடையாளம் காணப்படுகின்றன.

ஒரே AI ஐ நீதிபதியாகப் பயன்படுத்துவதில் ஏன் இல்லை?

ஒரு ஈர்க்கக்கூடிய சுருக்கம் என்பது ஒரு தனி வலிமையான மாதிரியை வெளியீடுகளை மதிப்பீடு செய்ய அனுமதிப்பதாகும் — "LLM-as-a-judge" முறை. சிக்கல்: LLM நீதிபதிகள் பற்றிய ஆராய்ச்சி ஒழுங்கமைக்கப்பட்ட பாகுபாடுகளை பதிவு செய்துள்ளது, இது ஒரு நீதிபதியை நம்பகமற்றதாக மாற்றுகிறது.

ஆவணமிடப்பட்ட ஒற்றை நீதிபதி பாகுபாடுகள்

  • இடம் பாகுபாடு — முதலில் வழங்கப்படும் எந்த பதிலையும் ஆதரிக்கும்
  • விரிவான பாகுபாடு — தரத்தைப் பொருட்படுத்தாமல் நீண்ட பதில்களுக்கு பரிசளிக்கும்
  • சுய மேம்பாட்டு பாகுபாடு — தனது சொந்த வெளியீடுகளை விரும்பும் மாதிரி
  • ஒரு தனி நீதிபதியின் தனித்துவங்கள் அது செய்யும் ஒவ்வொரு மதிப்பீட்டுக்கும் பொருந்தும்

அனானிமை செய்யப்பட்ட குறுக்கு மாதிரி மதிப்பீடு எப்படி உதவுகிறது

இரு வடிவமைப்பு தேர்வுகள் அந்த முன்னுரிமைகளை எதிர்கொள்கின்றன: பல மாதிரிகள் மத்தியில் மதிப்பீட்டை பரப்பவும், மற்றும் மதிப்பீடு செய்யப்படும் வாதத்தின் உரிமையாளரை அடையாளமற்றதாக மாற்றவும். இவை சேர்ந்து உள்ளடக்கத்தை மதிப்பீடு செய்கின்றன, எழுத்தாளரை அல்ல, மற்றும் ஒவ்வொரு மாதிரியின் தனித்துவங்களை சராசரியாக்குகின்றன.

1

பல மாதிரிகளிலிருந்து வாதங்களை சேகரிக்கவும்

ஒவ்வொரு கிடைக்கும் மாதிரியும் சுதந்திரமாக ஆதரவு/எதிர்ப்பு வாதங்களை வழங்குகிறது.

2

ஆசிரியரை நீக்கவும்

வாதங்கள் அனானிமை செய்யப்பட்டுள்ளன, எனவே எந்த மாதிரியும் எது தனது சொந்தம் என்பதைப் புரிந்துகொள்ளவில்லை.

3

ஒவ்வொரு மாதிரியும் ஒவ்வொரு வாதத்தையும் மதிப்பீடு செய்கிறது

மதிப்பீடுகள் மாதிரிகள் மத்தியில் பரவுகின்றன, ஒரே நீதிபதியில் மையமாக்கப்படவில்லை.

4

குறுக்கு மாதிரி சிக்னலை ஒருங்கிணைக்கவும்

பரந்த ஆதரவு = நம்பிக்கை; தொடர்ந்து குறைந்த மதிப்பீடுகள் = சரிபார்க்க வேண்டிய ஒரு பலவீனமான அல்லது கற்பனை செய்யப்பட்ட வாதம்.

உதாரணம் — உண்மையான மாதிரி வெளியீடு அல்ல

ஒரு மாதிரி "இந்த நூலகம் வடிவமைப்பால் நினைவக பாதுகாப்பாக உள்ளது" என்ற நம்பிக்கையுடன் மேற்கோள் அளிக்கிறது. அனானிமை செய்யப்பட்ட பீர் மதிப்பீட்டின் கீழ், மற்ற மாதிரிகள் அந்த வாதத்தை குறைவாக மதிப்பீடு செய்கின்றன — பலர் மேற்கோள் அளிக்கப்பட்ட உறுதிப்பத்திரம் பாதுகாப்பற்ற இடைமுக பாதையை உள்ளடக்கவில்லை என்பதை குறிப்பிட்டுள்ளனர். குறைந்த குறுக்கு மாதிரி மதிப்பீடு அந்த வாதத்தை மனிதர் சரிபார்க்க வேண்டியதாகக் காட்டுகிறது, ஒரே நம்பிக்கையுள்ள மாதிரி அதை எதிர்கொள்ளாமல் கொண்டு செல்லாமல்.

Argumentree.AI இல் AI பீர் மதிப்பீடு

ஒவ்வொரு கிடைக்கும் மாதிரியும் மற்ற மாதிரியின் வாதங்களை மதிப்பீடு செய்கிறது — அனானிமை செய்யப்பட்ட — எனவே பலவீனமான வாதங்கள் ஒரே மாதிரியின் நம்பிக்கையின் பின்னால் மறைய முடியாது.

பல சுயாதீன மாதிரிகள்

வாதங்கள் பல மாதிரிகளிலிருந்து வருகின்றன, ஒரே மூலத்திலிருந்து அல்ல

அனானிமை செய்யப்பட்ட குறுக்கு மதிப்பீடு

ஒவ்வொரு மாதிரியும் மற்ற மாதிரியின் வாதங்களை ஆசிரியரைப் புரிந்துகொள்ளாமல் மதிப்பீடு செய்கிறது

ஆதரவு சிக்னலாக மாறுகிறது

பரந்த ஆதரிக்கப்படும் வாதங்கள் உயர்கின்றன; தொடர்ந்து குறைவாக மதிப்பீடு செய்யப்பட்டவை அடையாளம் காணப்படுகின்றன

பலவீனமான வாதங்கள் வெளிப்படுகின்றன

சாத்தியமான கற்பனைகள் குறுக்கு மாதிரி மோதலாக வெளிப்படுகின்றன

அடிக்கடி கேட்கப்படும் கேள்விகள்

AI சக மதிப்பாய்வு என்றால் என்ன?

AI பீர் மதிப்பீடு என்பது பல AI மாதிரிகள் ஒருவருக்கொருவர் வாதங்களை மதிப்பீடு செய்து மதிப்பீடு செய்யும் போது, AI வெளியீடுகளுக்கு பயன்படுத்தப்படும் கல்வி பீர் மதிப்பீட்டைப் போலவே உள்ளது. ஒரு மாதிரியின் பதிலுக்கு நம்பிக்கை வைக்காமல், ஒவ்வொரு மாதிரியின் வாதங்களும் மற்ற மாதிரிகளால் மதிப்பீடு செய்யப்படுகின்றன. மாறுபட்ட மாதிரிகளின் சோதனையை தாங்கும் வாதங்கள் நம்பிக்கையை பெறுகின்றன; மற்ற மாதிரிகள் மோசமாக மதிப்பீடு செய்யும் வாதங்கள் பலவீனமாக அல்லது சாத்தியமாக உருவாக்கப்பட்டதாகக் குறிக்கப்படுகின்றன.

ஒரே AI நடுவரை விட AI சக மதிப்பாய்வு ஏன் சிறந்தது?

ஒரு LLM-ஐ நீதிபதியாகப் பயன்படுத்துவதுசார்பானதாக இருக்கிறது. LLM-ஐ நீதிபதியாகக் கொண்டு மேற்கொள்ளப்பட்ட ஆராய்ச்சியில் நிலை சார்பு (முதலில் தோன்றும் பதிலை ஆதரிக்கும்), verbosity சார்பு (தரத்தைப் பொருட்படுத்தாமல் நீண்ட பதில்களை பரிசளிக்கும்), மற்றும் சுய மேம்பாட்டு சார்பு (ஒரு மாதிரி தனது சொந்த வெளியீடுகளை விரும்புவது) ஆகியவை ஆவணமாக்கப்பட்டுள்ளது. பல மாதிரிகளில் மதிப்பீட்டை பரப்புவது மற்றும் எந்த வாதம் மதிப்பீடு செய்யப்படுகிறதென்று மறைமுகமாகக் கூறுவது எந்த ஒரு நீதிபதியின் தனிப்பட்ட சார்புத்தை குறைக்கிறது.

பெயர் மறைக்கப்பட்ட குறுக்கு-மாதிரி மதிப்பீடு எப்படி சார்பைக் குறைக்கிறது?

ஒரு மாதிரி எந்த வாதம் தனது சொந்தது என்பதைப் புரிந்தால், சுய மேம்பாட்டுசார்பு அது தனது மதிப்பீட்டை உயரமாகக் கொடுக்கச் செய்யலாம். மதிப்பீட்டுக்கு முன் வாதங்களை மறைமுகமாக்குவது அந்த சுட்டியை அகற்றுகிறது, எனவே ஒவ்வொரு மாதிரியும் ஆசிரியரைப் பொறுத்து உள்ளடக்கத்தை மதிப்பீடு செய்கிறது. பல மாதிரிகளின் மதிப்பீடுகளை இணைப்பது மேலும் ஒரு மாதிரியின் நிலை அல்லது verbosity சிக்கல்களை சராசரியாக்குகிறது, ஒரு தனி நீதிபதியைவிட அதிக சமநிலையுள்ள சிக்னலை உருவாக்குகிறது.

AI சக மதிப்பாய்வு மாயத்தோற்றங்களைக் கண்டறிய முடியுமா?

இது அவற்றை வெளிப்படுத்த உதவுகிறது. மாறுபட்ட மாதிரிகள் மாறுபட்ட முறையில் உருவாக்க tend, ஒரு மாதிரியில் இருந்து உருவாக்கப்பட்ட அல்லது ஆதரிக்கப்படாத வாதம் மற்றவற்றால் பெரும்பாலும் மோசமாக மதிப்பீடு செய்யப்படுகிறது. தொடர்ந்து குறைந்த மாறுபட்ட மதிப்பீடுகள் ஒரு வாதம் மனித சரிபார்ப்புக்கு தேவைப்படும் என்பதைப் பற்றிய சிவப்பு கொடியாக இருக்கிறது. இது ஒரு கருத்து மோதல் கண்டறிதல் சிக்னல், உறுதி அல்ல - ஒவ்வொரு மாதிரியும் ஒரே தவறை பகிர்ந்தால், பீர் மதிப்பீடு அதை பிடிக்காது.

AI சக மதிப்பாய்வு மனித மதிப்பாய்வை மாற்றுகிறதா?

இல்லை. AI பீர் மதிப்பீடு மனித தீர்மானத்தை முன்னுரிமை அளிக்கவும், மேம்படுத்தவும் வடிவமைக்கப்பட்டுள்ளது, அதை மாற்றுவதற்காக அல்ல. இது எந்த வாதங்கள் மாதிரிகளில் பரவலாக ஆதரிக்கப்படுகின்றன மற்றும் எந்தவாறு எதிர்க்கப்படுகின்றன அல்லது பலவீனமாக உள்ளன என்பதை உங்களுக்கு தெரிவிக்கிறது, எனவே மனிதர்கள் அவர்கள் முக்கியமாக சரிபார்க்க வேண்டிய இடத்தில் கவனம் செலுத்தலாம். இறுதி முடிவுகள் மற்றும் உயர் ஆபத்து சரிபார்ப்பு மனித பொறுப்பாகவே உள்ளது.

மாதிரிகள் ஒருவருக்கொருவர் பீர் மதிப்பீடு செய்ய அனுமதிக்கவும்

ஒரே AI நீதிபதிக்கு நம்பிக்கை வைக்காதீர்கள். ஒவ்வொரு மாதிரியும் மற்ற மாதிரியின் வாதங்களை எப்படி மதிப்பீடு செய்கின்றது என்பதைப் பாருங்கள்.

இப்போது இலவசமாக தொடங்கவும்