பல-எல்.எல்.எம் ஒப்பந்தம் பல்வேறு பெரிய மொழி மாதிரிகள் ஒரே குறிப்பு பற்றி சுயமாக யோசிக்கும்போது மற்றும் ஒருவருக்கொருவர் வாதங்களை மதிப்பீடு செய்யும் போது அடைந்த ஒப்புதலின் அளவாகும். இது ஒரே மாதிரியின் மாதிரிகளை மீண்டும் மீண்டும் எடுத்துக்கொள்வதோடு அல்லது சுய-ஒத்திசைவு, இது ஒரு மாதிரியை மீண்டும் மீண்டும் எடுத்துக்கொண்டு அந்த மாதிரியின் பாகுபாடுகளை பகிர்கிறது. இது புள்ளியியல் சேர்க்கையை மாறுபடுத்துகிறது, இது வெளியீடுகளை ஒரே சராசரி முன்னறிவிப்பில் கலந்து விடுகிறது: பல-எல்.எல்.எம் ஒப்பந்தம் தனிப்பட்ட வாதங்களை பாதுகாக்கிறது, எனவே அவற்றைப் பரிசோதிக்கலாம், சராசரியாக்கப்படுவதற்குப் பதிலாக. Mixture-of-Agents (arXiv:2406.04692) பற்றிய ஆராய்ச்சி பல எல்.எல்.எம்-களை அடுக்குவதன் மூலம் தரம் உயர்வுகளை காட்டுகிறது, பெரும்பாலும் AlpacaEval போன்ற விருப்ப அளவீடுகளில் அளவீடு செய்யப்படுகிறது—சரியான பதிலின் தரத்தை மேம்படுத்துவதற்கான ஆதாரம், எந்த குறிப்பிட்ட குறிப்பு மீது உண்மையான துல்லியத்தின் உத்தி அல்ல. Argumentree.AI ஒப்பந்தத்தை ஒரு நம்பிக்கை சிக்னல் எனக் கருதுகிறது, உண்மை ஓரக்கோணம் அல்ல; மாதிரிகளுக்கிடையிலான முரண்பாடுகள் பெரும்பாலும் மிகவும் செயல்பாட்டிற்குரிய வெளியீடாக இருக்கும்.
பல-எல்.எல்.எம் ஒப்பந்தம் என்பது பல உண்மையான மாறுபட்ட மாதிரிகள் மத்தியில் ஒப்புதல்—ஒரே மாதிரியை இரண்டு முறை எடுத்துக்கொள்வதோ அல்லது ஒரு சராசரி கலவையோ அல்ல. இது நீங்கள் பரிசோதிக்கக்கூடிய ஒரு நம்பிக்கை சிக்னல், உண்மை ஓரக்கோணம் அல்ல.
பல-எல்.எல்.எம் ஒப்பந்தம் பல்வேறு மாறுபட்ட மாதிரிகள் மத்தியில் ஒப்புதலை அளவீடு செய்கிறது. இது சுய-ஒத்திசைவு (ஒரே மாதிரி, பல மாதிரிகள்) மற்றும் புள்ளியியல் சேர்க்கையை (சராசரி கலவை) மாறுபடுத்துகிறது. இது தனிப்பட்ட வாதங்களை பாதுகாக்கிறது—இது நம்பிக்கை சிக்னல், உண்மையின் ஆதாரம் அல்ல.
பல-எல்.எல்.எம் ஒப்பந்தம் என்பது பல்வேறு பெரிய மொழி மாதிரிகள் ஒரே கேள்வி பற்றி சுயமாக யோசிக்கும்போது மற்றும் ஒருவருக்கொருவர் வாதங்களை மதிப்பீடு செய்யும் போது அடைந்த ஒப்புதலின் அளவாகும். முக்கியமான சொல் மாறுபட்ட: மாதிரிகள் மாறுபட்ட கட்டமைப்புகள் மற்றும் பயிற்சி தரவுகளிலிருந்து வருகின்றன, எனவே அவை ஒரே மாதிரியானது, அந்த ஒப்புதல் ஒரே அமைப்பின் பார்வையை காட்டுகிறது—மற்றும் அவை மாறுபட்டால், அந்த பிளவு உண்மையான மோதலான குறிப்பு ஒன்றை குறிக்கிறது.
ஒரு பொதுவான ஒரே மாதிரி தொழில்நுட்பம் சுய-ஒத்திசைவு: ஒரே மாதிரியை பல முறை எடுத்துக்கொண்டு பெரும்பான்மையினை எடுத்துக்கொள். இது சீரற்ற மாறுபாட்டை குறைக்கிறது, ஆனால் ஒவ்வொரு மாதிரியும் ஒரே மாதிரியின் பாகுபாடுகள் மற்றும் குருட்டுப் புள்ளிகளைப் பெறுகிறது. மாதிரி நம்பிக்கையுடன் தவறாக இருந்தால், அதை மீண்டும் எடுத்துக்கொள்வது தவறை மீண்டும் மீண்டும் செய்கிறது. பல-எல்.எல்.எம் ஒப்பந்தம் வகையில் மாறுபட்டது—இது சுயாதீன மாதிரிகளை அடிப்படையாகக் கொண்டது, எனவே ஒரே மாதிரியில் உள்ள பகிர்ந்த குருட்டுப் புள்ளி அனைவராலும் பகிரப்படுவதற்கான வாய்ப்பு குறைவாகவே உள்ளது.
பாரம்பரிய சேர்க்கை மாதிரி வெளியீடுகளை ஒரே சராசரி முன்னறிவிப்பில் கலந்து விடுகிறது—ஒரு மதிப்பீட்டிற்காக பயனுள்ளதாக, புரிந்துகொள்ளுவதற்காக பயனற்றது. பல-எல்.எல்.எம் ஒப்பந்தம் எதிர்மறையாக செய்கிறது: இது தனிப்பட்ட வாதங்களை பாதுகாக்கிறது எனவே நீங்கள் ஒவ்வொரு மாதிரியின் யோசனையைப் படிக்கலாம். எதுவும் கறுப்பு பெட்டியில் எண் ஆக மாறவில்லை. இது முரண்பாட்டை தெளிவாகக் காட்டுகிறது, சராசரியாக்கப்படுவதற்குப் பதிலாக.
| அணுகுமுறை | இது என்னை இணைக்கிறது | யோசனை தெளிவாக இருக்கிறதா? |
|---|---|---|
| சுய-ஒத்திசைவு | ஒரே மாதிரி, பல மாதிரிகள் | பெரும்பான்மையினை மட்டும் |
| புள்ளியியல் சேர்க்கை | சராசரியில் கலந்து விடப்பட்ட வெளியீடுகள் | இல்லை—சராசரியாக்கப்பட்டது |
| பல-எல்.எல்.எம் ஒப்பந்தம் | பல மாறுபட்ட மாதிரிகளின் வாதங்கள் | ஆம்—பாதுகாக்கப்பட்ட மற்றும் பரிசோதிக்கக்கூடிய |
இங்கு அதிகமாக மேற்கோள் காட்டப்படும் ஆராய்ச்சி Mixture-of-Agents (arXiv:2406.04692), இது பல எல்.எல்.எம்-களை அடுக்கி, பின்னணி அடுக்குகள் முந்தைய பதில்களை மேம்படுத்துகிறது. இது தரம் உயர்வுகளைப் புகாரளிக்கிறது—ஆனால் என்ன அளவீடு செய்யப்பட்டது என்பதில் துல்லியமாக இருக்க முக்கியமாகும்.
Mixture-of-Agents உயர்வுகள் பெரும்பாலும் விருப்ப அளவீடுகள் போன்றவற்றில் காட்டப்பட்டன—ஒரு பதில் எவ்வளவு நல்லது என்று மதிப்பீடு செய்யும் அளவீடுகள். இது இல்லை எந்த குறிப்பிட்ட குறிப்பு மீது உண்மையான துல்லியத்தின் உத்தி அல்ல. மாதிரிகளை இணைப்பது தரத்தை மேம்படுத்தலாம்; இது உண்மையை சான்றளிக்காது.
உள்ளடக்கங்களை ஒன்றாக சேர்க்கவும், உண்மையான வடிவமைப்பு இதுதான்: பல-எல்.எல்.எம் ஒப்பந்தம் ஒரு நம்பிக்கை சிக்னல். உயர்ந்த ஒப்புதல் பல சுயாதீன அமைப்புகள் ஒப்புக்கொள்கின்றன, இது மனித உறுதிப்படுத்தலுக்கான முன்னுரிமையை குறைக்கிறது—ஆனால் அதை நீக்காது. மாதிரிகள் ஒரே பயிற்சி பாகுபாட்டைப் பகிர்ந்து, தவறாக ஒப்புக்கொள்கின்றன. ஒப்புதலை "சாத்தியமாக குறைந்த ஆபத்து" எனக் கருதுங்கள், மற்றும் முரண்பாடுகள் உங்கள் மிகவும் செயல்பாட்டிற்குரிய வெளியீடாகக் கருதுங்கள்: அவை உறுதிப்படுத்தல் எங்கு மிகவும் முக்கியம் என்பதை குறிக்கின்றன.
மாறுபட்ட அமைப்புகள் மத்தியில் ஒப்புதல்—ஒரே மாதிரியை மீண்டும் எடுத்துக்கொள்வதில்லை
ஒவ்வொரு மாதிரியின் யோசனையைப் படிக்கவும்; எதுவும் கறுப்பு பெட்டியில் சராசரியாக்கப்படவில்லை
மதிப்பீடுகள் நம்பிக்கையை அளவீடு செய்கின்றன—உண்மையின் ஆதாரமாகக் காட்டப்படுவதில்லை
மோதலான புள்ளிகள் மனித உறுதிப்படுத்தலுக்காக குறிக்கப்படுகின்றன
பல-எல்.எல்.எம் ஒப்பந்தம் பல்வேறு பெரிய மொழி மாதிரிகள் ஒரே குறிப்பு பற்றி சுயமாக யோசிக்கும்போது மற்றும் ஒருவருக்கொருவர் வாதங்களை மதிப்பீடு செய்யும் போது அடைந்த ஒப்புதலின் அளவாகும். ஒரே மாதிரியை பல முறை எடுத்துக்கொள்வதற்கு மாறுபட்ட அமைப்புகளை அடிப்படையாகக் கொண்டது—எனவே ஒப்புதல் மாறுபட்ட கட்டமைப்புகள் மற்றும் பயிற்சி தரவுகளின் மத்தியில் ஒப்புதலைக் காட்டுகிறது, மற்றும் முரண்பாடு ஒரு குறிப்பு மோதலான இடங்களை குறிக்கிறது.
சுய-ஒத்திசைவு ஒரே ஒரே மாதிரியை பல முறை எடுத்துக்கொண்டு பெரும்பான்மையினை எடுத்துக்கொள்கிறது. இது சீரற்ற மாறுபாட்டை குறைக்கிறது, ஆனால் ஒரே மாதிரியின் பாகுபாடுகள் மற்றும் குருட்டுப் புள்ளிகளைப் பகிர்கிறது. பல-எல்.எல்.எம் ஒப்பந்தம் மாறுபட்ட மாதிரிகளைப் பயன்படுத்துகிறது, எனவே ஒப்புதல் மேலும் முக்கியமாக இருக்கிறது மற்றும் முரண்பாடு மீண்டும் எடுத்துக்கொள்ளும் ஒரே மாதிரியின் குருட்டுப் புள்ளியை வெளிப்படுத்தலாம்.
புள்ளியியல் சேர்க்கை மாதிரி வெளியீடுகளை ஒரே சராசரி முன்னறிவிப்பில் கலந்து விடுகிறது, தனிப்பட்ட யோசனையைத் துறக்கிறது. பல-எல்.எல்.எம் ஒப்பந்தம் ஒவ்வொரு மாதிரியின் வாதங்களை பாதுகாக்கிறது, எனவே நீங்கள் அவற்றைப் படிக்கலாம். எதுவும் நீங்கள் பரிசோதிக்க முடியாத கறுப்பு பெட்டியில் சராசரியாக்கப்படவில்லை—தனிப்பட்ட வழக்குகள் தெளிவாகவே உள்ளன, இது முரண்பாட்டை தெளிவாகக் காட்டுகிறது.
Mixture-of-Agents (arXiv:2406.04692) போன்ற ஆராய்ச்சி பல எல்.எல்.எம்-களை அடுக்குவதன் மூலம் தரம் உயர்வுகளை காட்டுகிறது, பெரும்பாலும் AlpacaEval போன்ற விருப்ப அளவீடுகளில் அளவீடு செய்யப்படுகிறது. இது அந்த அளவீடுகளில் பதிலின் தரத்தை மேம்படுத்துவதற்கான ஆதாரம்—இது எந்த குறிப்பிட்ட குறிப்பு மீது உண்மையான துல்லியத்தின் உத்தி அல்ல. ஒப்புதலை நம்பிக்கை சிக்னல் எனக் கருதுங்கள், உண்மை ஓரக்கோணம் அல்ல.
இல்லை. ஒப்புதல் ஒரு நம்பிக்கை சிக்னல், ஆதாரம் அல்ல. பல மாதிரிகள் ஒரே பயிற்சி பாகுபாட்டைப் பகிர்ந்து, தவறான ஒன்றில் ஒப்புக்கொள்கின்றன. உயர்ந்த ஒப்புதல் மனித உறுதிப்படுத்தலுக்கான முன்னுரிமையை குறைக்கிறது; இது அதை நீக்காது. மிகவும் செயல்பாட்டிற்குரிய வெளியீடு பெரும்பாலும் முரண்பாடு, இது உறுதிப்படுத்தல் எங்கு மிகவும் முக்கியம் என்பதை குறிக்கிறது.
ஒரே மாதிரியை இரண்டு முறை எடுத்துக்கொள்வதில்லை. பல மாறுபட்ட மாதிரிகள், வாதங்கள் பாதுகாக்கப்பட்டன, முரண்பாடு தெளிவாக உள்ளது.
இப்போது இலவசமாக தொடங்குங்கள்