நீங்கள் பல AI மாதிரிகளை கேள்வி எழுப்பும் போது "87% ஒப்புதல்" என்ற எண்ணிக்கை உண்மையில் என்ன அர்த்தம் கொண்டது? இது எவ்வாறு கணக்கிடப்படுகிறது, மற்றும் இதனை நீங்கள் என்ன செய்ய வேண்டும்? இந்த வழிகாட்டி ஒப்புதல் மதிப்பீடு எவ்வாறு செயல்படுகிறது மற்றும் முடிவுகளை எவ்வாறு விளக்குவது என்பதை விளக்குகிறது.
ஒன்றிணை மதிப்பீடு என்ன?
ஒரு ஒப்பந்த மதிப்பீடு பல AI மாதிரிகள் ஒரே கேள்விக்கு பதிலளிக்கும் போது எவ்வளவு ஒப்புதல் உள்ளது என்பதை அளவிடுகிறது. இது நம்பகத்தன்மை மதிப்பீடுகளின் எளிய சராசரி அல்ல - இது மாதிரிகள் இடையே ஒப்புதலின் அளவீடு.
எப்படி ஒப்பந்தம் கணக்கிடப்படுகிறது
பல மாதிரிகளை கேளுங்கள்
GPT-4, Claude, Gemini, Grok, மற்றும் பிறவற்றுக்கு அனுப்பிய ஒரே கேள்வி.
முக்கிய கோரிக்கைகளை எடுக்கவும்
ஒவ்வொரு பதிலும் தனித்தனியான உண்மையான குற்றச்சாட்டுகளில் உடைக்கப்பட்டுள்ளது.
குறிப்புகளை மாறுபடுத்தவும்
ஒவ்வொரு மாதிரியும் மற்ற மாதிரிகளின் கோரிக்கைகளின் துல்லியத்தை மதிப்பீடு செய்கிறது.
ஒப்பந்தத்தை கணக்கிடுங்கள்
பல மாதிரிகள் ஒப்புக்கொள்கின்றன என்ற கோரிக்கைகளின் சதவீதம்
ஒப்புதலின் நிலைகளை விளக்குதல்
90%+ — வலுவான ஒப்புதல்
அதிகமான மாதிரிகள் பெரும்பாலான கோரிக்கைகளில் ஒப்புக்கொள்கின்றன. இது துல்லியத்தின் சான்று அல்ல, ஆனால் இது வெவ்வேறு பயிற்சி தரவுகள் மற்றும் கட்டமைப்புகளில் சுயாதீனமான உறுதிப்படுத்தலைக் குறிக்கிறது. ஒளி சரிபார்ப்பு பொதுவாக போதுமானது.
70-89% — மிதமான ஒப்புதல்
சில விவரங்களில் மாறுபாடுகளுடன் பொதுவான ஒப்புதல். மையமான கோரிக்கைகள் நம்பகமானதாக இருக்க வாய்ப்பு உள்ளது, ஆனால் விவரங்களை சரிபார்க்க வேண்டும். மாதிரிகள் மாறுபடும் இடங்களில் கவனம் செலுத்துங்கள்.
50-69% — குறைந்த ஒப்புதல்
முக்கியமான கருத்து வேறுபாடு உள்ளது. இது பெரும்பாலும் கேள்வி AI அறிவு உறுதியாக இல்லாத பகுதிகளை, தலைப்பு உண்மையில் விவாதத்திற்குரியது, அல்லது கேள்வி தெளிவற்றது என்பதை குறிக்கிறது. மனித ஆராய்ச்சி தேவை.
<50% — எந்த ஒப்பந்தமும் இல்லை
மாதிரிகள் செயலில் மோதுகின்றன. முதன்மை ஆதார உறுதிப்படுத்தல் இல்லாமல் இங்கு AI உருவாக்கிய தகவல்களை பயன்படுத்த வேண்டாம். இது மதிப்புமிக்க தரவாகும் - AI எங்கு உதவ முடியாது மற்றும் மனித நிபுணத்துவம் அவசியம் என்பதைக் கூறுகிறது.
ஏன் ஒப்பந்தம் நம்பிக்கையிலிருந்து அதிக முக்கியத்துவம் வாய்ந்தது
தனித்துவ AI மாதிரிகள் தவறான போது கூட அதிக நம்பிக்கையை காட்டுகின்றன. "நான் 95% நம்பிக்கையுடன் இருக்கிறேன்" என்று ஒரு மாதிரி கூறுவது, அந்த மாதிரியின் உள்ளக மாதிரி பொருத்தத்தைப் பற்றியது, உண்மையான உலகத்தில் உள்ள துல்லியத்தைப் பற்றியது அல்ல. ஒப்பந்தம் மாறுபட்டது.
ஒற்றை மாதிரி நம்பிக்கை
- •உள்ளக மாதிரி பொருத்தத்தின் அடிப்படையில்
- •சரியானதுடன் நன்கு தொடர்பு கொள்ளவில்லை
- •மயக்கங்களுக்கு உயரமாக இருக்கலாம்
- •ஒரு பயிற்சி தரவுத்தொகுப்பு, ஒரு பார்வை
பல மாதிரி ஒப்புதல்
- •சுயாதீன ஒப்பந்தத்தின் அடிப்படையில்
- •குறிப்பிட்ட முறைமையை மாறுபாட்டுக்கான சரிபார்ப்புக்கு அமைக்கப்பட்டது
- •மயக்கங்கள் பொதுவாக மீண்டும் உருவாகாது.
- •பல தரவுத்தொகுப்புகள், பல பார்வைகள்
என்னது ஒப்பந்தம் உங்களுக்கு சொல்லவில்லை
உயர்ந்த ஒப்புதல் உண்மையின் சான்று அல்ல. அனைத்து மாதிரிகளும் ஒரே கண்மூடித்தன்மை அல்லது பிழையை ஒத்துக்கொள்ளும் பயிற்சி தரவிலிருந்து பகிர்ந்து கொள்ளலாம். ஒப்புதல் உங்களுக்கு சரியான நம்பிக்கை எங்கு இருக்க முடியும் என்பதைச் சொல்கிறது, உறுதியாக அல்ல.
உயர் ஆபத்தான முடிவுகளுக்காக, ஒத்துழைப்பு மதிப்பீடுகள் நீங்கள் சரிபார்ப்பு முயற்சியை ஒதுக்க உதவுகின்றன: உயர் ஒத்துழைப்பு கோரிக்கைகளில் குறைவான நேரம், குறைந்த ஒத்துழைப்பு கோரிக்கைகளில் அதிக நேரம்.
ஒப்புதலுக்கான மதிப்பீடுகளைப் புரிந்துகொள்வது, நீங்கள் AI ஆராய்ச்சியை எவ்வாறு பயன்படுத்துகிறீர்கள் என்பதைக் மாற்றுகிறது. "இந்த பதிலுக்கு நான் நம்பிக்கை வைக்க முடியுமா?" என்ற கேள்வியை கேட்கும் பதிலாக, "இந்த குறிப்பிட்ட கோரிக்கைக்கு எவ்வளவு சரிபார்ப்பு தேவை?" என்ற கேள்வியை நீங்கள் கேட்கலாம். இது மிகவும் செயல்பாட்டிற்கேற்பட்ட கேள்வி.
அடிக்கடி கேட்கப்படும் கேள்விகள்
ஒன்றிணை மதிப்பெண் என்ன?
முறையீட்டு மாதிரிகளுக்கிடையிலான ஒப்பந்தத்தின் அளவீடு — பல AI மாதிரிகள் ஒருவருக்கொருவர் எவ்வளவு ஒப்புக்கொள்கின்றன — ஒரு தனி மாதிரியின் சுயமாகக் கூறிய நம்பிக்கை அல்ல.
நீங்கள் ஒப்புதலின் நிலைகளை எவ்வாறு விளக்குகிறீர்கள்?
பதவியின் பாண்டுகள்: 90%+ என்பது வலிமையானது, 70–89% மிதமானது, 50–69% குறைவானது (ஆய்வு செய்யவும்), மற்றும் 50% க்குக் கீழே இருப்பது தனியாக சரிபார்க்க வேண்டும் என்பதைக் குறிக்கிறது.
ஒரு ஒப்பந்த மதிப்பீடு உங்களுக்கு என்ன சொல்லவில்லை?
இது ஒப்புக்கொண்ட பதில் உண்மையானது என்பதை நிரூபிக்கவில்லை — பதிவில் சரியானதற்கான ஆதாரமாக அல்ல, சரிபார்ப்பு முயற்சியை ஒதுக்குவதற்காக மதிப்பெண்களை பயன்படுத்த வேண்டும் என்று கூறப்பட்டுள்ளது.