മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് എന്നത് നിരവധി വ്യത്യസ്ത വലിയ ഭാഷാ മോഡലുകൾ സ്വതന്ത്രമായി ഒരേ അവകാശത്തെക്കുറിച്ച് ചിന്തിക്കുകയും പരസ്പരം അവരുടെ വാദങ്ങൾ വിലയിരുത്തുകയും ചെയ്യുമ്പോൾ എത്തുന്ന സമ്മതത്തിന്റെ തലമാണ്. ഇത് ഒറ്റ മോഡൽ സാമ്പിളിംഗ് അല്ലെങ്കിൽ സ്വയം-സമത്വത്തിൽ നിന്ന് വ്യത്യസ്തമാണ്, ഇത് ഒരു മോഡലിനെ ആവർത്തിച്ച് സാമ്പിള് ചെയ്യുകയും ആ മോഡലിന്റെ മുൻഗണനകൾ പങ്കുവയ്ക്കുകയും ചെയ്യുന്നു. ഇത് കണക്കുകൂട്ടലിൽ നിന്ന് വ്യത്യസ്തമാണ്, ഇത് ഔട്ട്പുട്ടുകൾ ഒരു ശരാശരി പ്രവചനത്തിലേക്ക് ലയിപ്പിക്കുന്നു: മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് വ്യക്തിഗത വാദങ്ങൾ സംരക്ഷിക്കുന്നു, അതിനാൽ അവയെ ശരാശരിയിലേക്ക് മാറ്റുന്നതിന് പകരം പരിശോധിക്കാം. മിക്സ്-ഓഫ്-എജന്റ്സ് (arXiv:2406.04692) എന്ന ഗവേഷണം നിരവധി എൽഎൽഎം-കളുടെ പാളികൾക്കായി ഗുണമേന്മയിലെ വർദ്ധനവുകൾ കാണിക്കുന്നു, പ്രധാനമായും ആൽപാക്കാ എവാലിൽ പോലുള്ള മുൻഗണനാ ബഞ്ച്മാർക്കുകളിൽ അളക്കുന്നു—ഏതെങ്കിലും പ്രത്യേക അവകാശത്തിന് സത്യസന്ധമായ കൃത്യതയുടെ ഉറപ്പ് അല്ല, മറിച്ച് മെച്ചപ്പെട്ട പ്രതികരണ ഗുണമേന്മയുടെ തെളിവാണ്. Argumentree.AI കൺസെൻസസിനെ ഒരു ആത്മവിശ്വാസ സൂചനയായി കാണിക്കുന്നു, സത്യത്തിന്റെOracle അല്ല; മോഡലുകൾക്കിടയിലെ വ്യത്യാസങ്ങൾ പലപ്പോഴും ഏറ്റവും പ്രവർത്തനക്ഷമമായ ഔട്ട്പുട്ടാണ്.
മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് എന്നത് നിരവധി യഥാർത്ഥ വ്യത്യസ്ത മോഡലുകൾക്കിടയിലെ സമ്മതമാണ്—ഒറ്റ മോഡൽ രണ്ടുതവണ സാമ്പിള് ചെയ്യുന്നതും, ലയിച്ച ശരാശരിയും അല്ല. ഇത് നിങ്ങൾക്ക് പരിശോധിക്കാവുന്ന ഒരു ആത്മവിശ്വാസ സൂചനയാണ്, സത്യത്തിന്റെOracle അല്ല.
മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് എന്നത് നിരവധി വ്യത്യസ്ത മോഡലുകൾക്കിടയിലെ സമ്മതം അളക്കുന്നു. ഇത് സ്വയം-സമത്വത്തിൽ നിന്ന് (ഒരു മോഡൽ, നിരവധി സാമ്പിളുകൾ) കണക്കുകൂട്ടലിൽ നിന്ന് (ലയിച്ച ശരാശരി) വ്യത്യസ്തമാണ്. ഇത് വ്യക്തിഗത വാദങ്ങൾ സംരക്ഷിക്കുന്നു—ഇത് ആത്മവിശ്വാസ സൂചനയാണ്, സത്യത്തിന്റെ തെളിവല്ല.
മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് എന്നത് നിരവധി വ്യത്യസ്ത വലിയ ഭാഷാ മോഡലുകൾ സ്വതന്ത്രമായി ഒരേ ചോദ്യത്തെക്കുറിച്ച് ചിന്തിക്കുകയും പരസ്പരം അവരുടെ വാദങ്ങൾ വിലയിരുത്തുകയും ചെയ്യുമ്പോൾ എത്തുന്ന സമ്മതത്തിന്റെ ഡിഗ്രിയാണ്. പ്രധാനമായ വാക്ക് വ്യത്യസ്ത ആണ്: മോഡലുകൾ വ്യത്യസ്ത ആർക്കിടെക്ചറുകളും പരിശീലന ഡാറ്റയും നിന്നാണ് വരുന്നത്, അതിനാൽ അവ സംയോജിപ്പിക്കുമ്പോൾ, ആ സമ്മതം ഒരു സിസ്റ്റത്തിന്റെ കാഴ്ചപ്പാടിൽ നിന്ന് കൂടുതൽ പ്രതിഫലിക്കുന്നു—മോഡലുകൾ വ്യത്യസ്തമായാൽ, വിഭജനം ഒരു യഥാർത്ഥമായി പ്രതിസന്ധിയുള്ള അവകാശത്തെ അടയാളപ്പെടുത്തുന്നു.
ഒരു സാധാരണ ഒറ്റ-മോഡൽ സാങ്കേതികവിദ്യ സ്വയം-സമത്വം ആണ്: ഒരേ മോഡലിനെ പല തവണ സാമ്പിള് ചെയ്യുക, ഭൂരിപക്ഷം ഉത്തരം എടുക്കുക. ഇത് യാദൃച്ഛിക വ്യത്യാസം കുറയ്ക്കുന്നു, പക്ഷേ ഓരോ സാമ്പിളും ഒരേ മോഡലിന്റെ മുൻഗണനകളും അന്ധസ്ഥലങ്ങളും പകരുന്നു. മോഡൽ ആത്മവിശ്വാസത്തോടെ തെറ്റായാൽ, അതിനെ വീണ്ടും സാമ്പിള് ചെയ്യുന്നത് തെറ്റിനെ ആവർത്തിക്കുന്നു. മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് തരം വ്യത്യസ്തമാണ്—ഇത് സ്വതന്ത്ര മോഡലുകൾ ഉപയോഗിക്കുന്നു, അതിനാൽ ഒരൊറ്റ മോഡലിലെ പങ്കുവെച്ച അന്ധസ്ഥലം എല്ലാവരുടെയും പങ്കുവെക്കാൻ സാധ്യതയില്ല.
ക്ലാസിക്കൽ കണക്കുകൂട്ടൽ മോഡൽ ഔട്ട്പുട്ടുകൾ ഒരു ഏകീകരിച്ച പ്രവചനത്തിലേക്ക് ലയിപ്പിക്കുന്നു—ഒരു സ്കോറിന് ഉപകാരപ്രദമാണ്, മനസ്സിലാക്കുന്നതിന് ഉപകാരപ്രദമല്ല. മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് ഉദ്ദേശ്യമായി എതിര്ക്കുന്നു: ഇത് വ്യക്തിഗത വാദങ്ങൾ സംരക്ഷിക്കുന്നു അതിനാൽ നിങ്ങൾക്ക് ഓരോ മോഡലിന്റെ ചിന്തനങ്ങൾ വായിക്കാം. ഒന്നും കറുത്ത ബോക്സ് നമ്പറിലേക്ക് സമന്വയിപ്പിക്കപ്പെടുന്നില്ല. ഇത് വ്യത്യാസത്തെ വായനാസഹായമാക്കുന്നു, ശരാശരിയിലേക്ക് അപ്രത്യക്ഷമാകുന്നതിന് പകരം.
| അവകാശം | ഇത് എന്താണ് സംയോജിപ്പിക്കുന്നത് | ചിന്തനം ദൃശ്യമാണ്? |
|---|---|---|
| സ്വയം-സമത്വം | ഒരു മോഡൽ, നിരവധി സാമ്പിളുകൾ | ഭൂരിപക്ഷം ഉത്തരം മാത്രം |
| കണക്കുകൂട്ടൽ | ഔട്ട്പുട്ടുകൾ ശരാശരിയിലേക്ക് ലയിപ്പിക്കുന്നു | ഇല്ല—ശരാശരിയിലേക്ക് മാറ്റിയിരിക്കുന്നു |
| മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് | അനവധി വ്യത്യസ്ത മോഡലുകളുടെ വാദങ്ങൾ | അതെ—സംരക്ഷിതവും പരിശോധിക്കാവുന്നതും |
ഇവിടെ ഏറ്റവും അധികം ഉദ്ധരിക്കപ്പെടുന്ന ഗവേഷണം മിക്സ്-ഓഫ്-എജന്റ്സ് (arXiv:2406.04692) ആണ്, ഇത് നിരവധി എൽഎൽഎം-കളെ പാളികളായി ക്രമീകരിക്കുന്നു, അതിനാൽ പിന്നീട് പാളികൾ മുൻഗണനകളെ മെച്ചപ്പെടുത്തുന്നു. ഇത് ഗുണമേന്മയിലെ വർദ്ധനവുകൾ റിപ്പോർട്ട് ചെയ്യുന്നു—എന്നാൽ അളക്കപ്പെട്ടതിൽ കൃത്യമായിരിക്കണം.
മിക്സ്-ഓഫ്-എജന്റ്സ് ഗെയിൻസ് പ്രധാനമായും മുൻഗണനാ ബഞ്ച്മാർക്കുകൾ പോലുള്ള ആൽപാക്കാ എവാലിൽ കാണിക്കപ്പെട്ടു—ഒരു പ്രതികരണം എത്ര നല്ലതെന്ന് വിലയിരുത്തുന്ന അളവുകൾ. അത് അല്ല ഏതെങ്കിലും പ്രത്യേക അവകാശത്തിന് സത്യസന്ധമായ കൃത്യതയുടെ ഉറപ്പ്. മോഡലുകൾ സംയോജിപ്പിക്കുന്നത് ഗുണമേന്മ മെച്ചപ്പെടുത്താൻ കഴിയും; ഇത് സത്യത്തെ സർട്ടിഫൈ ചെയ്യുന്നില്ല.
തുറകളെ ഒന്നിച്ച് വച്ചാൽ, സത്യമായ ഫ്രെയിമിംഗ് ഇതാണ്: മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് ഒരു ആത്മവിശ്വാസ സൂചന ആണ്. ഉയർന്ന കൺസെൻസസ് നിരവധി സ്വതന്ത്ര സിസ്റ്റങ്ങൾ സമ്മതിക്കുന്നു, ഇത് മനുഷ്യ പരിശോധനയ്ക്ക് മുൻഗണന കുറയ്ക്കുന്നു—എന്നാൽ അത് ഇല്ലാതാക്കുന്നില്ല. മോഡലുകൾ ഒരു പരിശീലന മുൻഗണന പങ്കുവയ്ക്കുകയും തെറ്റായ കാര്യങ്ങളിൽ സമ്മതിക്കുകയും ചെയ്യാം. കൺസെൻസസിനെ "ശരാശരിയിൽ കുറവായ അപകടം" എന്ന നിലയിൽ കാണിക്കുക, വ്യത്യാസങ്ങൾ നിങ്ങളുടെ ഏറ്റവും പ്രവർത്തനക്ഷമമായ ഔട്ട്പുട്ട് എന്ന നിലയിൽ കാണിക്കുക: അവ സ്ഥിരീകരണം എവിടെ ഏറ്റവും പ്രധാനമാണെന്ന് സൂചിപ്പിക്കുന്നു.
വ്യത്യസ്ത സിസ്റ്റങ്ങൾക്കിടയിലെ സമ്മതം—ഒറ്റ മോഡൽ വീണ്ടും സാമ്പിള് ചെയ്യുന്നത് അല്ല
ഓരോ മോഡലിന്റെ ചിന്തനം വായിക്കുക; ഒന്നും കറുത്ത ബോക്സിലേക്ക് ശരാശരിയിലേക്കു മാറ്റിയിട്ടില്ല
സ്കോറുകൾ ആത്മവിശ്വാസം കാൽബ്രേറ്റ് ചെയ്യുന്നു—സത്യത്തിന്റെ തെളിവായി ഒരിക്കലും അവതരിപ്പിക്കില്ല
വ്യത്യാസമുള്ള പോയിന്റുകൾ മനുഷ്യ പരിശോധനയ്ക്ക് അടയാളപ്പെടുത്തുന്നു
മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് എന്നത് നിരവധി വ്യത്യസ്ത വലിയ ഭാഷാ മോഡലുകൾ സ്വതന്ത്രമായി ഒരേ അവകാശത്തെക്കുറിച്ച് ചിന്തിക്കുകയും പരസ്പരം അവരുടെ വാദങ്ങൾ വിലയിരുത്തുകയും ചെയ്യുമ്പോൾ എത്തുന്ന സമ്മതത്തിന്റെ തലമാണ്. ഒരൊറ്റ മോഡലിനെ പല തവണ സാമ്പിള് ചെയ്യുന്നതിന് വ്യത്യസ്തമായ സിസ്റ്റങ്ങൾ ഉപയോഗിക്കുന്നു—അതുകൊണ്ട് കൺസെൻസസ് വ്യത്യസ്ത ആർക്കിടെക്ചറികളും പരിശീലന ഡാറ്റയും തമ്മിലുള്ള സമ്മതം പ്രതിഫലിക്കുന്നു, വ്യത്യാസം ഒരു അവകാശം എവിടെ പ്രതിസന്ധിയുള്ളതെന്ന് അടയാളപ്പെടുത്തുന്നു.
സ്വയം-സമത്വം ഒരേ ഒറ്റ മോഡലിനെ പല തവണ സാമ്പിള് ചെയ്യുകയും ഭൂരിപക്ഷം ഉത്തരം എടുക്കുകയും ചെയ്യുന്നു. ഇത് യാദൃച്ഛിക വ്യത്യാസം കുറയ്ക്കുന്നു, പക്ഷേ ഒരു മോഡലിന്റെ മുൻഗണനകളും അന്ധസ്ഥലങ്ങളും പങ്കുവയ്ക്കുന്നു. മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് വ്യത്യസ്ത മോഡലുകൾ ഉപയോഗിക്കുന്നു, അതിനാൽ സമ്മതം കൂടുതൽ അർത്ഥവത്തായിരിക്കും, വ്യത്യാസം ആവർത്തിച്ച സാമ്പിളിംഗ് ഒരൊറ്റ മോഡലിന്റെ അന്ധസ്ഥലത്തെ വെളിപ്പെടുത്താൻ കഴിയുന്നില്ല.
കണക്കുകൂട്ടൽ മോഡൽ ഔട്ട്പുട്ടുകൾ ഒരു ഏകീകരിച്ച പ്രവചനത്തിലേക്ക് ലയിപ്പിക്കുന്നു, വ്യക്തിഗത ചിന്തനം ഒഴിവാക്കുന്നു. മൾട്ടി-എൽഎൽഎം കൺസെൻസസ് ഓരോ മോഡലിന്റെ വാദങ്ങൾ സംരക്ഷിക്കുന്നു, അതിനാൽ നിങ്ങൾക്ക് അവയെ വായിക്കാം. ഒന്നും കറുത്ത ബോക്സ് സ്കോറിലേക്ക് ശരാശരിയിലേക്കു മാറ്റിയിട്ടില്ല—വ്യക്തിഗത കേസുകൾ ദൃശ്യമായിരിക്കുന്നു, ഇത് വ്യത്യാസത്തെ വായനാസഹായമാക്കുന്നു.
മിക്സ്-ഓഫ്-എജന്റ്സ് (arXiv:2406.04692) പോലുള്ള ഗവേഷണം നിരവധി എൽഎൽഎം-കളുടെ പാളികളിൽ ഗുണമേന്മയിലെ വർദ്ധനവുകൾ കാണിക്കുന്നു, പ്രധാനമായും ആൽപാക്കാ എവാലിൽ പോലുള്ള മുൻഗണനാ ബഞ്ച്മാർക്കുകളിൽ അളക്കുന്നു. അത് ആ ബഞ്ച്മാർക്കുകളിൽ മെച്ചപ്പെട്ട പ്രതികരണ ഗുണമേന്മയുടെ തെളിവാണ്—ഏതെങ്കിലും പ്രത്യേക അവകാശത്തിന് സത്യസന്ധമായ കൃത്യതയുടെ ഉറപ്പ് അല്ല. കൺസെൻസസിനെ ഒരു ആത്മവിശ്വാസ സൂചനയായി കാണിക്കുക, സത്യത്തിന്റെOracle അല്ല.
ഇല്ല. കൺസെൻസസ് ഒരു ആത്മവിശ്വാസ സൂചനയാണ്, തെളിവല്ല. നിരവധി മോഡലുകൾ ഒരേ പരിശീലന മുൻഗണന പങ്കുവയ്ക്കുകയും തെറ്റായ കാര്യങ്ങളിൽ സമ്മതിക്കുകയും ചെയ്യാം. ഉയർന്ന കൺസെൻസസ് മനുഷ്യ പരിശോധനയ്ക്ക് മുൻഗണന കുറയ്ക്കുന്നു; ഇത് അതിന്റെ ആവശ്യം ഇല്ലാതാക്കുന്നില്ല. ഏറ്റവും പ്രവർത്തനക്ഷമമായ ഔട്ട്പുട്ട് പലപ്പോഴും വ്യത്യാസമാണ്, ഇത് സ്ഥിരീകരണം എവിടെ ഏറ്റവും പ്രധാനമാണെന്ന് സൂചിപ്പിക്കുന്നു.
ഒറ്റ മോഡൽ രണ്ടുതവണ സാമ്പിള് ചെയ്യുന്നത് അല്ല. നിരവധി വ്യത്യസ്ത മോഡലുകൾ, വാദങ്ങൾ സംരക്ഷിതമാണ്, വ്യത്യാസം ദൃശ്യമാണ്.
മൂല്യവത്തായ ആരംഭിക്കുക