മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് എന്താണ്?

മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് എന്നത് നിരവധി വ്യത്യസ്ത വലിയ ഭാഷാ മോഡലുകൾ സ്വതന്ത്രമായി ഒരേ അവകാശത്തെക്കുറിച്ച് ചിന്തിക്കുകയും പരസ്പരം അവരുടെ വാദങ്ങൾ വിലയിരുത്തുകയും ചെയ്യുമ്പോൾ എത്തുന്ന സമ്മതത്തിന്റെ തലമാണ്. ഇത് ഒറ്റ മോഡൽ സാമ്പിളിംഗ് അല്ലെങ്കിൽ സ്വയം-സമത്വത്തിൽ നിന്ന് വ്യത്യസ്തമാണ്, ഇത് ഒരു മോഡലിനെ ആവർത്തിച്ച് സാമ്പിള്‍ ചെയ്യുകയും ആ മോഡലിന്റെ മുൻഗണനകൾ പങ്കുവയ്ക്കുകയും ചെയ്യുന്നു. ഇത് കണക്കുകൂട്ടലിൽ നിന്ന് വ്യത്യസ്തമാണ്, ഇത് ഔട്ട്‌പുട്ടുകൾ ഒരു ശരാശരി പ്രവചനത്തിലേക്ക് ലയിപ്പിക്കുന്നു: മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് വ്യക്തിഗത വാദങ്ങൾ സംരക്ഷിക്കുന്നു, അതിനാൽ അവയെ ശരാശരിയിലേക്ക് മാറ്റുന്നതിന് പകരം പരിശോധിക്കാം. മിക്‌സ്-ഓഫ്-എജന്റ്സ് (arXiv:2406.04692) എന്ന ഗവേഷണം നിരവധി എൽഎൽഎം-കളുടെ പാളികൾക്കായി ഗുണമേന്മയിലെ വർദ്ധനവുകൾ കാണിക്കുന്നു, പ്രധാനമായും ആൽപാക്കാ എവാലിൽ പോലുള്ള മുൻഗണനാ ബഞ്ച്മാർക്കുകളിൽ അളക്കുന്നു—ഏതെങ്കിലും പ്രത്യേക അവകാശത്തിന് സത്യസന്ധമായ കൃത്യതയുടെ ഉറപ്പ് അല്ല, മറിച്ച് മെച്ചപ്പെട്ട പ്രതികരണ ഗുണമേന്മയുടെ തെളിവാണ്. Argumentree.AI കൺസെൻസസിനെ ഒരു ആത്മവിശ്വാസ സൂചനയായി കാണിക്കുന്നു, സത്യത്തിന്റെOracle അല്ല; മോഡലുകൾക്കിടയിലെ വ്യത്യാസങ്ങൾ പലപ്പോഴും ഏറ്റവും പ്രവർത്തനക്ഷമമായ ഔട്ട്‌പുട്ടാണ്.

കോളക്ടീവ് എഐ ബുദ്ധിയിലേക്ക് മടങ്ങുകമൾട്ടി-എഐ ഗവേഷണം

എന്താണ്
മൾട്ടി-എൽഎൽഎം കൺസെൻസസ്?

മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് എന്നത് നിരവധി യഥാർത്ഥ വ്യത്യസ്ത മോഡലുകൾക്കിടയിലെ സമ്മതമാണ്—ഒറ്റ മോഡൽ രണ്ടുതവണ സാമ്പിള്‍ ചെയ്യുന്നതും, ലയിച്ച ശരാശരിയും അല്ല. ഇത് നിങ്ങൾക്ക് പരിശോധിക്കാവുന്ന ഒരു ആത്മവിശ്വാസ സൂചനയാണ്, സത്യത്തിന്റെOracle അല്ല.

TL;DR

മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് എന്നത് നിരവധി വ്യത്യസ്ത മോഡലുകൾക്കിടയിലെ സമ്മതം അളക്കുന്നു. ഇത് സ്വയം-സമത്വത്തിൽ നിന്ന് (ഒരു മോഡൽ, നിരവധി സാമ്പിളുകൾ) കണക്കുകൂട്ടലിൽ നിന്ന് (ലയിച്ച ശരാശരി) വ്യത്യസ്തമാണ്. ഇത് വ്യക്തിഗത വാദങ്ങൾ സംരക്ഷിക്കുന്നു—ഇത് ആത്മവിശ്വാസ സൂചനയാണ്, സത്യത്തിന്റെ തെളിവല്ല.

മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് നിർവചിക്കുന്നത്

മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് എന്നത് നിരവധി വ്യത്യസ്ത വലിയ ഭാഷാ മോഡലുകൾ സ്വതന്ത്രമായി ഒരേ ചോദ്യത്തെക്കുറിച്ച് ചിന്തിക്കുകയും പരസ്പരം അവരുടെ വാദങ്ങൾ വിലയിരുത്തുകയും ചെയ്യുമ്പോൾ എത്തുന്ന സമ്മതത്തിന്റെ ഡിഗ്രിയാണ്. പ്രധാനമായ വാക്ക് വ്യത്യസ്ത ആണ്: മോഡലുകൾ വ്യത്യസ്ത ആർക്കിടെക്ചറുകളും പരിശീലന ഡാറ്റയും നിന്നാണ് വരുന്നത്, അതിനാൽ അവ സംയോജിപ്പിക്കുമ്പോൾ, ആ സമ്മതം ഒരു സിസ്റ്റത്തിന്റെ കാഴ്ചപ്പാടിൽ നിന്ന് കൂടുതൽ പ്രതിഫലിക്കുന്നു—മോഡലുകൾ വ്യത്യസ്തമായാൽ, വിഭജനം ഒരു യഥാർത്ഥമായി പ്രതിസന്ധിയുള്ള അവകാശത്തെ അടയാളപ്പെടുത്തുന്നു.

സ്വയം-സമത്വം പോലെ അല്ല

ഒരു സാധാരണ ഒറ്റ-മോഡൽ സാങ്കേതികവിദ്യ സ്വയം-സമത്വം ആണ്: ഒരേ മോഡലിനെ പല തവണ സാമ്പിള്‍ ചെയ്യുക, ഭൂരിപക്ഷം ഉത്തരം എടുക്കുക. ഇത് യാദൃച്ഛിക വ്യത്യാസം കുറയ്ക്കുന്നു, പക്ഷേ ഓരോ സാമ്പിളും ഒരേ മോഡലിന്റെ മുൻഗണനകളും അന്ധസ്ഥലങ്ങളും പകരുന്നു. മോഡൽ ആത്മവിശ്വാസത്തോടെ തെറ്റായാൽ, അതിനെ വീണ്ടും സാമ്പിള്‍ ചെയ്യുന്നത് തെറ്റിനെ ആവർത്തിക്കുന്നു. മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് തരം വ്യത്യസ്തമാണ്—ഇത് സ്വതന്ത്ര മോഡലുകൾ ഉപയോഗിക്കുന്നു, അതിനാൽ ഒരൊറ്റ മോഡലിലെ പങ്കുവെച്ച അന്ധസ്ഥലം എല്ലാവരുടെയും പങ്കുവെക്കാൻ സാധ്യതയില്ല.

കണക്കുകൂട്ടലിൽ നിന്ന് വ്യത്യസ്തമാണ്

ക്ലാസിക്കൽ കണക്കുകൂട്ടൽ മോഡൽ ഔട്ട്‌പുട്ടുകൾ ഒരു ഏകീകരിച്ച പ്രവചനത്തിലേക്ക് ലയിപ്പിക്കുന്നു—ഒരു സ്കോറിന് ഉപകാരപ്രദമാണ്, മനസ്സിലാക്കുന്നതിന് ഉപകാരപ്രദമല്ല. മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് ഉദ്ദേശ്യമായി എതിര്‍ക്കുന്നു: ഇത് വ്യക്തിഗത വാദങ്ങൾ സംരക്ഷിക്കുന്നു അതിനാൽ നിങ്ങൾക്ക് ഓരോ മോഡലിന്റെ ചിന്തനങ്ങൾ വായിക്കാം. ഒന്നും കറുത്ത ബോക്സ് നമ്പറിലേക്ക് സമന്വയിപ്പിക്കപ്പെടുന്നില്ല. ഇത് വ്യത്യാസത്തെ വായനാസഹായമാക്കുന്നു, ശരാശരിയിലേക്ക് അപ്രത്യക്ഷമാകുന്നതിന് പകരം.

അവകാശംഇത് എന്താണ് സംയോജിപ്പിക്കുന്നത്ചിന്തനം ദൃശ്യമാണ്?
സ്വയം-സമത്വംഒരു മോഡൽ, നിരവധി സാമ്പിളുകൾഭൂരിപക്ഷം ഉത്തരം മാത്രം
കണക്കുകൂട്ടൽഔട്ട്‌പുട്ടുകൾ ശരാശരിയിലേക്ക് ലയിപ്പിക്കുന്നുഇല്ല—ശരാശരിയിലേക്ക് മാറ്റിയിരിക്കുന്നു
മൾട്ടി-എൽഎൽഎം കൺസെൻസസ്അനവധി വ്യത്യസ്ത മോഡലുകളുടെ വാദങ്ങൾഅതെ—സംരക്ഷിതവും പരിശോധിക്കാവുന്നതും

ഗവേഷണം യഥാർത്ഥത്തിൽ എന്ത് കാണിക്കുന്നു

ഇവിടെ ഏറ്റവും അധികം ഉദ്ധരിക്കപ്പെടുന്ന ഗവേഷണം മിക്‌സ്-ഓഫ്-എജന്റ്സ് (arXiv:2406.04692) ആണ്, ഇത് നിരവധി എൽഎൽഎം-കളെ പാളികളായി ക്രമീകരിക്കുന്നു, അതിനാൽ പിന്നീട് പാളികൾ മുൻഗണനകളെ മെച്ചപ്പെടുത്തുന്നു. ഇത് ഗുണമേന്മയിലെ വർദ്ധനവുകൾ റിപ്പോർട്ട് ചെയ്യുന്നു—എന്നാൽ അളക്കപ്പെട്ടതിൽ കൃത്യമായിരിക്കണം.

അവകാശം ശ്രദ്ധയോടെ വായിക്കുക

മിക്‌സ്-ഓഫ്-എജന്റ്സ് ഗെയിൻസ് പ്രധാനമായും മുൻഗണനാ ബഞ്ച്മാർക്കുകൾ പോലുള്ള ആൽപാക്കാ എവാലിൽ കാണിക്കപ്പെട്ടു—ഒരു പ്രതികരണം എത്ര നല്ലതെന്ന് വിലയിരുത്തുന്ന അളവുകൾ. അത് അല്ല ഏതെങ്കിലും പ്രത്യേക അവകാശത്തിന് സത്യസന്ധമായ കൃത്യതയുടെ ഉറപ്പ്. മോഡലുകൾ സംയോജിപ്പിക്കുന്നത് ഗുണമേന്മ മെച്ചപ്പെടുത്താൻ കഴിയും; ഇത് സത്യത്തെ സർട്ടിഫൈ ചെയ്യുന്നില്ല.

ഒരു ആത്മവിശ്വാസ സൂചന, സത്യത്തിന്റെOracle അല്ല

തുറകളെ ഒന്നിച്ച് വച്ചാൽ, സത്യമായ ഫ്രെയിമിംഗ് ഇതാണ്: മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് ഒരു ആത്മവിശ്വാസ സൂചന ആണ്. ഉയർന്ന കൺസെൻസസ് നിരവധി സ്വതന്ത്ര സിസ്റ്റങ്ങൾ സമ്മതിക്കുന്നു, ഇത് മനുഷ്യ പരിശോധനയ്ക്ക് മുൻഗണന കുറയ്ക്കുന്നു—എന്നാൽ അത് ഇല്ലാതാക്കുന്നില്ല. മോഡലുകൾ ഒരു പരിശീലന മുൻഗണന പങ്കുവയ്ക്കുകയും തെറ്റായ കാര്യങ്ങളിൽ സമ്മതിക്കുകയും ചെയ്യാം. കൺസെൻസസിനെ "ശരാശരിയിൽ കുറവായ അപകടം" എന്ന നിലയിൽ കാണിക്കുക, വ്യത്യാസങ്ങൾ നിങ്ങളുടെ ഏറ്റവും പ്രവർത്തനക്ഷമമായ ഔട്ട്‌പുട്ട് എന്ന നിലയിൽ കാണിക്കുക: അവ സ്ഥിരീകരണം എവിടെ ഏറ്റവും പ്രധാനമാണെന്ന് സൂചിപ്പിക്കുന്നു.

Argumentree.AI ഉപയോഗിച്ച് മൾട്ടി-എൽഎൽഎം കൺസെൻസസ്

അനവധി വ്യത്യസ്ത മോഡലുകൾ

വ്യത്യസ്ത സിസ്റ്റങ്ങൾക്കിടയിലെ സമ്മതം—ഒറ്റ മോഡൽ വീണ്ടും സാമ്പിള്‍ ചെയ്യുന്നത് അല്ല

വാദങ്ങൾ സംരക്ഷിതമാണ്

ഓരോ മോഡലിന്റെ ചിന്തനം വായിക്കുക; ഒന്നും കറുത്ത ബോക്സിലേക്ക് ശരാശരിയിലേക്കു മാറ്റിയിട്ടില്ല

സൂചനയായി കൺസെൻസസ്

സ്കോറുകൾ ആത്മവിശ്വാസം കാൽബ്രേറ്റ് ചെയ്യുന്നു—സത്യത്തിന്റെ തെളിവായി ഒരിക്കലും അവതരിപ്പിക്കില്ല

വ്യത്യാസം ഉയർത്തിയിരിക്കുന്നു

വ്യത്യാസമുള്ള പോയിന്റുകൾ മനുഷ്യ പരിശോധനയ്ക്ക് അടയാളപ്പെടുത്തുന്നു

അവശ്യമായ ചോദ്യങ്ങൾ

മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് എന്താണ്?

മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് എന്നത് നിരവധി വ്യത്യസ്ത വലിയ ഭാഷാ മോഡലുകൾ സ്വതന്ത്രമായി ഒരേ അവകാശത്തെക്കുറിച്ച് ചിന്തിക്കുകയും പരസ്പരം അവരുടെ വാദങ്ങൾ വിലയിരുത്തുകയും ചെയ്യുമ്പോൾ എത്തുന്ന സമ്മതത്തിന്റെ തലമാണ്. ഒരൊറ്റ മോഡലിനെ പല തവണ സാമ്പിള്‍ ചെയ്യുന്നതിന് വ്യത്യസ്തമായ സിസ്റ്റങ്ങൾ ഉപയോഗിക്കുന്നു—അതുകൊണ്ട് കൺസെൻസസ് വ്യത്യസ്ത ആർക്കിടെക്ചറികളും പരിശീലന ഡാറ്റയും തമ്മിലുള്ള സമ്മതം പ്രതിഫലിക്കുന്നു, വ്യത്യാസം ഒരു അവകാശം എവിടെ പ്രതിസന്ധിയുള്ളതെന്ന് അടയാളപ്പെടുത്തുന്നു.

മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് സ്വയം-സമത്വത്തിൽ നിന്ന് എങ്ങനെ വ്യത്യസ്തമാണ്?

സ്വയം-സമത്വം ഒരേ ഒറ്റ മോഡലിനെ പല തവണ സാമ്പിള്‍ ചെയ്യുകയും ഭൂരിപക്ഷം ഉത്തരം എടുക്കുകയും ചെയ്യുന്നു. ഇത് യാദൃച്ഛിക വ്യത്യാസം കുറയ്ക്കുന്നു, പക്ഷേ ഒരു മോഡലിന്റെ മുൻഗണനകളും അന്ധസ്ഥലങ്ങളും പങ്കുവയ്ക്കുന്നു. മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് വ്യത്യസ്ത മോഡലുകൾ ഉപയോഗിക്കുന്നു, അതിനാൽ സമ്മതം കൂടുതൽ അർത്ഥവത്തായിരിക്കും, വ്യത്യാസം ആവർത്തിച്ച സാമ്പിളിംഗ് ഒരൊറ്റ മോഡലിന്റെ അന്ധസ്ഥലത്തെ വെളിപ്പെടുത്താൻ കഴിയുന്നില്ല.

കണക്കുകൂട്ടലിൽ നിന്ന് എങ്ങനെ വ്യത്യസ്തമാണ്?

കണക്കുകൂട്ടൽ മോഡൽ ഔട്ട്‌പുട്ടുകൾ ഒരു ഏകീകരിച്ച പ്രവചനത്തിലേക്ക് ലയിപ്പിക്കുന്നു, വ്യക്തിഗത ചിന്തനം ഒഴിവാക്കുന്നു. മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് ഓരോ മോഡലിന്റെ വാദങ്ങൾ സംരക്ഷിക്കുന്നു, അതിനാൽ നിങ്ങൾക്ക് അവയെ വായിക്കാം. ഒന്നും കറുത്ത ബോക്സ് സ്കോറിലേക്ക് ശരാശരിയിലേക്കു മാറ്റിയിട്ടില്ല—വ്യക്തിഗത കേസുകൾ ദൃശ്യമായിരിക്കുന്നു, ഇത് വ്യത്യാസത്തെ വായനാസഹായമാക്കുന്നു.

മോഡലുകൾ സംയോജിപ്പിക്കുന്നത് കൃത്യത മെച്ചപ്പെടുത്തുമെന്ന് ഗവേഷണം തെളിയിക്കുന്നുണ്ടോ?

മിക്‌സ്-ഓഫ്-എജന്റ്സ് (arXiv:2406.04692) പോലുള്ള ഗവേഷണം നിരവധി എൽഎൽഎം-കളുടെ പാളികളിൽ ഗുണമേന്മയിലെ വർദ്ധനവുകൾ കാണിക്കുന്നു, പ്രധാനമായും ആൽപാക്കാ എവാലിൽ പോലുള്ള മുൻഗണനാ ബഞ്ച്മാർക്കുകളിൽ അളക്കുന്നു. അത് ആ ബഞ്ച്മാർക്കുകളിൽ മെച്ചപ്പെട്ട പ്രതികരണ ഗുണമേന്മയുടെ തെളിവാണ്—ഏതെങ്കിലും പ്രത്യേക അവകാശത്തിന് സത്യസന്ധമായ കൃത്യതയുടെ ഉറപ്പ് അല്ല. കൺസെൻസസിനെ ഒരു ആത്മവിശ്വാസ സൂചനയായി കാണിക്കുക, സത്യത്തിന്റെOracle അല്ല.

ഉയർന്ന കൺസെൻസസ് ഒരു ഉത്തരം സത്യമാണ് എന്നതിന്റെ സൂചനയാണോ?

ഇല്ല. കൺസെൻസസ് ഒരു ആത്മവിശ്വാസ സൂചനയാണ്, തെളിവല്ല. നിരവധി മോഡലുകൾ ഒരേ പരിശീലന മുൻഗണന പങ്കുവയ്ക്കുകയും തെറ്റായ കാര്യങ്ങളിൽ സമ്മതിക്കുകയും ചെയ്യാം. ഉയർന്ന കൺസെൻസസ് മനുഷ്യ പരിശോധനയ്ക്ക് മുൻഗണന കുറയ്ക്കുന്നു; ഇത് അതിന്റെ ആവശ്യം ഇല്ലാതാക്കുന്നില്ല. ഏറ്റവും പ്രവർത്തനക്ഷമമായ ഔട്ട്‌പുട്ട് പലപ്പോഴും വ്യത്യാസമാണ്, ഇത് സ്ഥിരീകരണം എവിടെ ഏറ്റവും പ്രധാനമാണെന്ന് സൂചിപ്പിക്കുന്നു.

യാഥാർത്ഥ്യ മോഡലുകൾക്കിടയിൽ കൺസെൻസസ് അളക്കുക

ഒറ്റ മോഡൽ രണ്ടുതവണ സാമ്പിള്‍ ചെയ്യുന്നത് അല്ല. നിരവധി വ്യത്യസ്ത മോഡലുകൾ, വാദങ്ങൾ സംരക്ഷിതമാണ്, വ്യത്യാസം ദൃശ്യമാണ്.

മൂല്യവത്തായ ആരംഭിക്കുക