ഒരു LLM കൗൺസിൽ സ്വതന്ത്രമായി ഒരു ചോദ്യം ഉത്തരം നൽകുന്ന വലിയ ഭാഷാ മോഡലുകളുടെ ഒരു ഗ്രൂപ്പാണ്, പിന്നീട് പരസ്പരം അവരുടെ പ്രതികരണങ്ങൾ റേറ്റുചെയ്യുന്നു, ഒത്തുചേരാൻ. ഈ മാതൃക ആൻഡ്രെജ് കാർപത്തി എന്നവന്റെ ഓപ്പൺ-സോഴ്സ് 'llm-council' റെപ്പോസിറ്ററിയിലൂടെ പ്രശസ്തമായതാണ്, നിരവധി മോഡലുകൾ ഉത്തരം നൽകുകയും, പിന്നീട് പരസ്പരം റാങ്ക് ചെയ്യുകയും ചെയ്യുന്നു, ഒരു അന്തിമ സംയോജനം മുമ്പ്. Argumentree.AI ഈ കൗൺസിൽ മാതൃകയെ ഘടനാപരമായ വാദ വൃക്ഷങ്ങൾക്കും അനോണിമൈസ്ഡ് പരസ്പര റേറ്റിംഗിനും വിപുലീകരിക്കുന്നു—അനോണിമൈസ്ഡ് കാരണം LLM-നെ ജഡ്ജ് ആയി ഉപയോഗിക്കുന്നതിനെക്കുറിച്ചുള്ള ഗവേഷണം മോഡലുകൾ അവരുടെ സ്വന്തം ഔട്ട്പുട്ടുകൾക്ക് അനുകൂലമായി റേറ്റുചെയ്യുന്നതിന് സ്വയം-ഉന്നതിയുടെ ബയസ് രേഖപ്പെടുത്തുന്നു. ഒരു ഹോസ്റ്റഡ് LLM കൗൺസിൽ നിങ്ങൾക്ക് നിങ്ങളുടെ സ്വന്തം API കീകൾ നൽകാതെ നിരവധി മോഡലുകൾക്ക് ചോദ്യം ചെയ്യാൻ അനുവദിക്കുന്നു. സത്യസന്ധമായ വ്യാപാരം ചെലവും വൈകിയതും ആണ്: ഒരു കൗൺസിൽ നിരവധി മോഡൽ കോളുകൾ നടത്തുന്നു, അതിനാൽ ഇത് ഒരു ഏകീകൃത ചോദ്യം ചെയ്യലേക്കാൾ മന്ദഗതിയിലും കൂടുതൽ ചെലവിലുമാണ്, ക്രോസ്-മോഡൽ സ്ഥിരീകരണം, ദൃശ്യമായ വ്യത്യാസം എന്നിവയ്ക്കായി.
ഒരു LLM കൗൺസിൽ നിരവധി ഭാഷാ മോഡലുകൾ സ്വതന്ത്രമായി ഉത്തരം നൽകുന്നു, പരസ്പരം റേറ്റുചെയ്യുന്നു, ഒത്തുചേരുന്നു. ഇത് "ഒരു ആത്മവിശ്വാസമുള്ള ഉത്തരം" ഒരു ചർച്ചയാക്കി മാറ്റുന്നു, നിങ്ങൾ പരിശോധിക്കാവുന്ന.
ഒരു LLM കൗൺസിൽ സ്വതന്ത്രമായി ഉത്തരം നൽകുന്ന നിരവധി മോഡലുകൾ ആണ്, പിന്നീട് പരസ്പരം റേറ്റുചെയ്യുന്നു, ഒത്തുചേരാൻ. ഈ മാതൃക കാർപത്തിയുടെ ഓപ്പൺ-സോഴ്സ് llm-council-ൽ നിന്നാണ്. Argumentree.AI ഇത് ഹോസ്റ്റ് ചെയ്യുന്നു—API കീകൾ ആവശ്യമില്ല—സ്വയം-ഉന്നതിയെ കുറയ്ക്കാൻ അനോണിമസ് ആയി റേറ്റുചെയ്യുന്നു.
ഒരു കൗൺസിൽ മാതൃക പറയാൻ എളുപ്പമാണ്: നിരവധി LLM-കൾ ഒരേ ചോദ്യം സ്വതന്ത്രമായി ഉത്തരം നൽകുന്നു, പിന്നീട് പരസ്പരം അവരുടെ ഉത്തരം വിലയിരുത്തുന്നു, ഒത്തുചേരൽ പരസ്പര റേറ്റിംഗുകളിൽ നിന്ന് വരുന്നു. ഒരു ഏകീകൃത മോഡലിന് അവസാന വാക്ക് ലഭിക്കുന്നില്ല. മോഡലുകൾ ഉത്തരം നൽകുന്നതിന് മുമ്പ് പരസ്പരം മറുപടികൾ കാണുന്നില്ല, അതിനാൽ അവരുടെ സ്വതന്ത്രമായ ചിന്തനം നിലനിൽക്കുന്നു—അവരുടെ വ്യത്യാസങ്ങൾ മറച്ചുവയ്ക്കുന്നതിന് പകരം ദൃശ്യമായവയായി മാറുന്നു.
പ്രതിയൊരു മോഡലും മറ്റുള്ളവരെ കാണാതെ തന്നെ ചോദ്യം ഉത്തരം നൽകുന്നു
പ്രതിയൊരു മോഡലും മറ്റുള്ള മോഡലുകളുടെ ഉത്തരം വിലയിരുത്തുന്നു
റേറ്റിംഗുകൾ സമാഹരിച്ച് കൗൺസിൽ എവിടെ ഒത്തുചേരുന്നു, എവിടെ വ്യത്യാസമുണ്ടെന്ന് വെളിപ്പെടുത്തുന്നു
ആൻഡ്രെജ് കാർപത്തി ഒരു ഓപ്പൺ-സോഴ്സ് "llm-council" റെപ്പോസിറ്ററി പ്രസിദ്ധീകരിച്ചു, ഈ പ്രവാഹം കൃത്യമായി പ്രദർശിപ്പിക്കുന്നു—നിലവിലുള്ള മോഡലുകൾ ഉത്തരം നൽകുന്നു, പരസ്പരം റാങ്ക് ചെയ്യുന്നു, ഒരു അന്തിമ പ്രതികരണം സംയോജിപ്പിക്കുന്നു. മോഡലുകൾ പരസ്പരം വിലയിരുത്താൻ കഴിയും എന്നതിന്റെ ഒരു പൊതു തെളിവാണ് ഇത്. Argumentree.AI ഈ ആശയത്തിൽ നിർമ്മിക്കുന്നു.
Argumentree.AI കൗൺസിൽ മാതൃകയെ രണ്ട് വഴികളിൽ കൂടുതൽ മുന്നോട്ട് കൊണ്ടുപോകുന്നു. ആദ്യം, മുഴുവൻ ഉത്തരം താരതമ്യം ചെയ്യുന്നതിന് പകരം, ഓരോ മോഡലിന്റെയും ചിന്തനം ഒരു വാദ വൃക്ഷം ആയി ഘടനപ്പെടുത്തുന്നു—അതുകൊണ്ട് വ്യക്തിഗത അവകാശങ്ങൾ റേറ്റുചെയ്യാനും പരിശോധിക്കാനും കഴിയും, അവസാന പാരഗ്രാഫ് മാത്രമല്ല. രണ്ടാം, അനോണിമൈസ്ഡ് പരസ്പര റേറ്റിംഗ് ഉപയോഗിക്കുന്നു: ഒരു മോഡൽ വാദങ്ങൾ റേറ്റുചെയ്യുമ്പോൾ, അത് ഏത് മോഡൽ അവയെ രചിച്ചുവെന്ന് അറിയുന്നില്ല.
ഒരു LLM-നെ ജഡ്ജ് ആയി ഉപയോഗിക്കുന്നതിനെക്കുറിച്ചുള്ള ഗവേഷണം സ്വയം-ഉന്നതിയുടെ ബയസ് രേഖപ്പെടുത്തുന്നു—മോഡലുകൾ അവരുടെ സ്വന്തം ഔട്ട്പുട്ടുകൾക്ക് കൂടുതൽ അനുകൂലമായി റേറ്റുചെയ്യാൻ താല്പര്യപ്പെടുന്നു. റേറ്റിംഗിന് മുമ്പ് രചയിതാവിനെ മറച്ചുവയ്ക്കുന്നത് ഈ ഷോർട്ട്കട്ട് നീക്കുന്നു, അതിനാൽ ഒരു മോഡൽ സ്വയം തന്നെ സമ്മാനിക്കാനാവില്ല. അനോണിമൈസ്ഡ് ക്രോസ്-റേറ്റിംഗിന് പിന്നിലെ ഡിസൈൻ തത്വം ഇതാണ്.
ഒരു കൗൺസിൽ നിങ്ങൾ തന്നെ നടത്തുന്നത് സാധാരണയായി ഓരോ മോഡൽ പ്രദാതാവുമായും സൈൻ അപ്പ് ചെയ്യുകയും വ്യത്യസ്ത API കീകൾ കണക്ട് ചെയ്യുകയും ചെയ്യുന്നു. Argumentree.AI ഒരു ഹോസ്റ്റഡ് LLM കൗൺസിൽ നൽകുന്നു: നിങ്ങൾ ഒരു തവണ ചോദിക്കുന്നു, എല്ലാ ലഭ്യമായ മോഡലുകളും പങ്കാളിയാകുന്നു—നിങ്ങൾക്ക് കൈകാര്യം ചെയ്യേണ്ട കീകൾ ഇല്ല, ഓരോ പ്രദാതാവിനും സജ്ജീകരണം ഇല്ല. നിങ്ങൾക്ക് കൗൺസിലിന്റെ ഒത്തുചേരലും അതിന്റെ വ്യത്യാസങ്ങളും ഒരു സ്ഥലത്ത് ലഭിക്കുന്നു.
ഒരു കൗൺസിൽ സൗജന്യമായിട്ടില്ല. നിർവചനം പ്രകാരം ഇത് നിലവിലുള്ള മോഡൽ കോളുകൾ നടത്തുന്നു, അതിനാൽ ഇത് കൂടുതൽ കംപ്യൂട്ട് ഉപയോഗിക്കുന്നു, ഒരു ഏകീകൃത ചോദ്യം ചെയ്യലേക്കാൾ മന്ദഗതിയിലും കൂടുതൽ ചെലവിലുമാണ്. അത് ഉദ്ദേശിച്ച വ്യാപാരമാണ്: നിങ്ങൾ കൂടുതൽ ചെലവഴിക്കുന്നു, ക്രോസ്-മോഡൽ സ്ഥിരീകരണം, മോഡലുകൾ എവിടെ വ്യത്യാസപ്പെടുന്നു എന്നതിന്റെ ദൃശ്യമായ മാപ്പ് നേടുന്നു. ഉയർന്ന അപകടസാധ്യതയുള്ള ഗവേഷണത്തിന് അത് നല്ല ഇടപാടാണ്; trivials-നുള്ള ഒരു മോഡൽ മതിയാകും.
ഒരു ഏകീകൃത ചോദ്യം കൊണ്ട് നിരവധി മോഡലുകളുടെ കൗൺസിൽ ചേർക്കുക
പ്രതിയൊരു മോഡലിന്റെയും ചിന്തനം പോയിന്റ് ബൈ പോയിന്റ് പരിശോധിക്കുക, ഒരു ബ്ലോബ് ആയി അല്ല
ക്രോസ്-റേറ്റിംഗ് സ്വയം-ഉന്നതിയുടെ ബയസ് കുറയ്ക്കാൻ രചയിതാവിനെ മറയ്ക്കുന്നു
പ്രതിയൊരു പ്രദാതാവിനും API കീകൾ ഇല്ല—ഒത്തുചേരലും വ്യത്യാസവും ബോക്സിൽ നിന്ന്
ഒരു LLM കൗൺസിൽ സ്വതന്ത്രമായി ഒരു ചോദ്യം ഉത്തരം നൽകുന്ന വലിയ ഭാഷാ മോഡലുകളുടെ ഒരു ഗ്രൂപ്പാണ്, പിന്നീട് പരസ്പരം അവരുടെ പ്രതികരണങ്ങൾ റേറ്റുചെയ്യുന്നു, ഒത്തുചേരുന്ന കാഴ്ചപ്പാട് ഉത്പാദിപ്പിക്കുന്നു. ഒരു ഏകീകൃത മോഡലിൽ ആശ്രയിക്കുന്നതിന് പകരം, കൗൺസിൽ മോഡലുകൾക്കിടയിലെ ഒത്തുചേരലും വ്യത്യാസവും വ്യക്തമായതാക്കുന്നു—അതിനാൽ നിങ്ങൾക്ക് മോഡലുകൾ എവിടെ ഒത്തുചേരുന്നു, എവിടെ ഒത്തുചേരുന്നില്ല എന്ന് കാണാം.
ആൻഡ്രെജ് കാർപത്തി ഒരു ഓപ്പൺ-സോഴ്സ് 'llm-council' റെപ്പോസിറ്ററി പുറത്തിറക്കി, ഈ മാതൃകയെ പ്രദർശിപ്പിക്കുന്നു: നിരവധി മോഡലുകൾ ഒരു ചോദ്യം ഉത്തരം നൽകുന്നു, പിന്നീട് അന്തിമ സംയോജനത്തിന് മുമ്പ് പരസ്പരം അവരുടെ ഉത്തരം റാങ്ക് ചെയ്യുന്നു. ഇത് മോഡലുകൾക്കിടയിലെ കൂട്ടായ്മയുടെ ചിന്തനത്തിന്റെ ആശയ-പ്രൂഫ് ആണ്. Argumentree.AI ഘടനാപരമായ വാദ വൃക്ഷങ്ങൾ, അനോണിമൈസ്ഡ് പരസ്പര റേറ്റിംഗ് എന്നിവയുമായി ആശയത്തെ വിപുലീകരിക്കുന്നു.
ഒരു LLM-നെ ജഡ്ജ് ആയി ഉപയോഗിക്കുന്നതിനെക്കുറിച്ചുള്ള ഗവേഷണം സ്വയം-ഉന്നതിയുടെ ബയസ് രേഖപ്പെടുത്തിയിട്ടുണ്ട്—മോഡലുകൾ അവരുടെ സ്വന്തം ഔട്ട്പുട്ടുകൾക്ക് അനുകൂലമായി റേറ്റുചെയ്യാൻ താല്പര്യപ്പെടുന്നു. റേറ്റിംഗിന് മുമ്പ് ഏത് മോഡൽ ഏത് വാദം രചിച്ചുവെന്ന് അനോണിമൈസ് ചെയ്യുന്നത് ആ ബയസ് കുറയ്ക്കുന്നു, അതിനാൽ ഒരു മോഡൽ സ്വയം തന്നെ സമ്മാനിക്കാനാവില്ല. Argumentree.AI-യുടെ അനോണിമൈസ്ഡ് ക്രോസ്-റേറ്റിംഗിന് പിന്നിലെ ഡിസൈൻ തത്വം ഇതാണ്.
ഒരു ഹോസ്റ്റഡ് LLM കൗൺസിലിൽ അല്ല. ഓപ്പൺ-സോഴ്സ് നടപ്പാക്കലുകൾ സാധാരണയായി ഓരോ പ്രദാതാവിനും API കീകൾ നൽകാൻ ആവശ്യമാണ്. Argumentree.AI ഒരു ഹോസ്റ്റഡ് മൾട്ടി-LLM കൗൺസിൽ നൽകുന്നു, അതിനാൽ നിങ്ങൾക്ക് നിരവധി മോഡലുകൾക്ക് ചോദ്യം ചെയ്യാനും അവരുടെ ഒത്തുചേരൽ കാണാനും individual API കീകൾ കണക്ട് ചെയ്യേണ്ടതില്ല.
സത്യസന്ധമായി, ഒരു കൗൺസിൽ നടത്തുന്നത് ഒരു ഏകീകൃത ചോദ്യം ചെയ്യലേക്കാൾ കൂടുതൽ ചെലവേറിയതാണ്—ഇത് നിരവധി മോഡൽ കോളുകൾ നടത്തുന്നു, അതിനാൽ ഇത് കൂടുതൽ കംപ്യൂട്ട് ഉപയോഗിക്കുന്നു, ഒരു ഏകീകൃത ചോദ്യം ചെയ്യലേക്കാൾ മന്ദഗതിയിലും കൂടുതൽ ചെലവിലുമാണ്. ആ വ്യാപാരം നിങ്ങൾക്ക് ക്രോസ്-മോഡൽ സ്ഥിരീകരണം, വ്യത്യാസത്തിന്റെ ദൃശ്യമായ മാപ്പ് വാങ്ങുന്നു. ഉയർന്ന അപകടസാധ്യതയുള്ള ചോദ്യങ്ങൾക്ക് അധിക ചെലവും വൈകിയതും സാധാരണയായി വിലമതിക്കപ്പെടുന്നു; trivials-നുള്ള ഒരു മോഡൽ മതിയാകും.
നിലവിലുള്ള നിരവധി മോഡലുകൾ, ഒരു ചോദ്യം, നിങ്ങൾ പരിശോധിക്കാവുന്ന ഒത്തുചേരൽ—API കീകൾ ആവശ്യമില്ല.
സൗജന്യമായി ആരംഭിക്കുക