Ang Mixture-of-Agents (MoA) ay isang layered multi-LLM architecture na ipinakilala sa papel na "Ang Mixture-of-Agents ay Nagpapahusay sa Kakayahan ng Malalaking Modelong Wika" (arXiv:2406.04692). Sa MoA, maraming modelo ang kumikilos bilang mga nagmumungkahi sa isang layer; ang kanilang mga tugon ay pinagsasama-sama at ipinapasa sa mga aggregator models sa susunod na layer, na nagsasama-sama ng isang pinahusay na sagot. Ang karagdagang mga layer ay inuulit ang pagpapahusay. Ipinapakita ng papel ang mga pagtaas sa mga preference-style benchmarks tulad ng AlpacaEval 2.0, MT-Bench, at FLASK — mga sukat ng kalidad ng tugon ayon sa isang evaluator, hindi isang garantiya ng katotohanan. Ang MoA ay nagmumultiply din ng gastos sa token at nagdadagdag ng latency dahil ito ay nagpapatakbo ng maraming tawag sa modelo sa mga layer, at ang aggregation ay maaaring magpakinis sa tunay na hindi pagkakaunawaan. Ang Argumentree.AI ay may kaugnayan ngunit naiiba: sa halip na pagsamahin sa isang synthesized na sagot, pinapanatili nito ang mga indibidwal na argumento ng bawat modelo at pinapahalagahan ang bawat available na modelo na i-rate ang mga argumento ng bawat isa, na nagpapakita ng consensus at dissent sa halip na itago ang mga ito.
Ang Mixture-of-Agents (MoA) ay itinuturing ang maraming LLM bilang mga nagtutulungan na ahente — ang mga nagmumungkahi ay bumubuo ng mga kandidato na tugon, ang mga aggregator ay nagsasama-sama ng mga ito sa isang pinahusay na sagot. Ito ay isang tunay na teknika na may tunay na trade-offs, hindi isang magic accuracy switch.
Mixture-of-Agents ay naglalagay ng maraming LLMs: ang mga modelo ng nagmumungkahi ay nag-draft ng mga sagot, ang mga modelo ng aggregator ay pinagsasama ang mga ito. Ipinapakita ng papel na arXiv:2406.04692 ang mga pagtaas sa mga preference benchmarks (AlpacaEval, MT-Bench) — kalidad ng tugon, hindi napatunayan na katotohanan — at nagkakahalaga ito ng mas maraming token at latency kaysa sa isang modelo.
Ang Mixture-of-Agents ay ipinakilala sa papel na 2024 "Ang Mixture-of-Agents ay Nagpapahusay sa Kakayahan ng Malalaking Modelong Wika" (arXiv:2406.04692). Ang pangunahing obserbasyon ay pagtutulungan: ang mga LLM ay may posibilidad na makabuo ng mas mahusay na mga tugon kapag maaari nilang makita at bumuo sa mga output ng iba pang mga modelo — kahit na ang mga modelo na indibidwal na mas mahina. Ang MoA ay ginagawang arkitektura ang obserbasyong iyon.
Ang MoA ay nakaayos sa mga layer. Ang bawat layer ay naglalaman ng ilang LLM "ahente". Ang mga modelo ng isang layer ay bawat isa ay bumubuo ng isang tugon, ang mga tugon na iyon ay pinagsasama-sama at ibinibigay sa susunod na layer, na ang mga modelo ay kumikilos bilang mga aggregator na nagpapahusay at nagsasama-sama. Ang pag-stack ng mga layer ay inuulit ang pagpapahusay.
Maraming modelo ang bawat isa ay sumasagot sa prompt nang nakapag-iisa sa layer 1.
Lahat ng output ng layer-1 ay kinokolekta bilang materyal na sanggunian para sa susunod na layer.
Binabasa ng mga modelo ng Layer-2 ang mga kandidato at gumagawa ng pinino, pinagsamang tugon.
Ang karagdagang mga layer ay patuloy na nagpapino; isang panghuling aggregator ang naglalabas ng sagot.
Tanungin ang "Dapat bang ibalik ng aming API ang 200 o 202 para sa isang async job na tinanggap?" Ang tatlong modelo ng nagmumungkahi ay bawat isa ay nag-draft ng isang sagot na binabanggit ang mga REST conventions. Ang isang aggregator ay nagbabasa ng lahat ng tatlo, napapansin na dalawa ang pabor sa 202 Accepted na may status URL at isa ang pabor sa 200, at nagsasama-sama ng isang rekomendasyon na isinasama ang pinakamalakas na pangangatwiran mula sa bawat isa. Ang pinagsamang sagot ay maganda ang pagkakasulat — ngunit kung ang lahat ng tatlo ay may parehong maling pagkaunawa, ang aggregator ay tiyak na uulitin ito.
Ipinapahayag ng papel ang malalakas na resulta sa mga preference-style benchmarks — AlpacaEval 2.0, MT-Bench, at FLASK — kung saan ang isang hukom (madalas na isang LLM o tao) ay nag-uuri kung aling tugon ang mas kapaki-pakinabang o mas mataas ang kalidad. Ito ay isang mahalagang pagkakaiba para sa mga developer:
Tatlong multi-model na pattern. Bilang isang developer, pumili ayon sa kung ano ang kailangan mong ipalabas: isang pinakintab na sagot, o nakikitang cross-model na pangangatwiran.
| Pattern | Ano ang pinapabuti nito | Ano ang makukuha mo |
|---|---|---|
| Mixture-of-Agents | Isang pinino na pinaghalong sagot | Pinagsasama ng mga aggregator ang mga output ng nagmungkahi; ang mga indibidwal na pananaw ay nawawala sa synthesis |
| LLM council | Transparent na kontribusyon bawat modelo | Ang sagot ng bawat modelo ay nananatiling nakikita; madalas na sinusuri ng mga modelo ang isa't isa |
| Multi-LLM consensus | Signal ng kasunduan + hindi pagkakasundo | Sinasalamin kung saan nagkakasundo ang mga modelo (kumpiyansa) at nagkakaiba (ang pinagtatalunang tanong) |
Batas ng hinlalaki: abutin ang MoA kapag nais mo ang pinakamainam na sagot at kayang bayaran ang gastos sa token/latency; abutin ang isang council o consensus scoring kapag ang mismong hindi pagkakaunawaan ang produkto.
Ang Argumentree.AI ay nagbabahagi ng premise ng MoA — ang maraming modelo ay mas mahusay kaysa sa isa — ngunit pinapanatili ang mga indibidwal na output na nakikita sa halip na pagsamahin ang mga ito.
Bawat modelo ay sumasagot nang nakapag-iisa — walang nagmungkahi/aggregator na nagiging isang boses
Ang mga indibidwal na argumento pro/con ay nananatiling nakatukoy sa modelong gumawa nito
Bawat magagamit na modelo ay nag-rate ng argumento ng bawat isa pang modelo
Nakikita mo ang kasunduan bilang kumpiyansa at ang hindi pagkakasundo bilang tunay na tanong
Ang Mixture-of-Agents (MoA) ay isang layered architecture kung saan maraming malalaking modelo ng wika ang kumikilos bilang mga nagmungkahi sa isang layer, at ang kanilang mga output ay ipinapasa sa mga aggregator models sa susunod na layer na nagsasama-sama ng isang pinino na tugon. Ipinakilala sa papel na 'Mixture-of-Agents Enhances Large Language Model Capabilities' (arXiv:2406.04692), itinuturing nito ang maraming LLM bilang mga nagtutulungan na ahente sa halip na umasa sa isang solong modelo.
Ang orihinal na papel ng MoA ay nag-uulat ng mga pagtaas sa mga benchmark na estilo ng preference tulad ng AlpacaEval 2.0, MT-Bench at FLASK, kung saan ang isang hukom ay nag-rate ng kalidad ng tugon. Ang mga ito ay mga sukatan ng preference at pagiging kapaki-pakinabang, hindi isang garantiya ng katotohanang tumpak. Maaaring makabuo ang MoA ng mas pinino, mas mahusay na nakabalangkas na sagot habang paulit-ulit na inuulit ang isang ibinahaging pagkakamali sa katotohanan, kaya hindi ito dapat ituring na isang garantiya ng katotohanan.
Ang MoA ay nagpapatakbo ng maraming modelo sa maraming layer, kaya pinapalala nito ang gastos sa token at nagdaragdag ng latency kumpara sa isang tawag sa modelo. Ang mga aggregator layer ay maaari ring magpatag ng tunay na hindi pagkakaunawaan sa pagitan ng mga nagmungkahi, itinatago ang mga pananaw ng minorya na talagang karapat-dapat makita. Ito ay isang tunay na teknolohiya na may tunay na trade-off sa gastos/latency, hindi isang libreng pag-upgrade.
Ang MoA ay isang synthesis architecture: ang mga modelo ng nagmungkahi ay nagbibigay ng mga aggregator na pinagsasama ang lahat sa isang pinino na sagot. Ang isang LLM council ay nagpapanatili ng nakikitang kontribusyon ng bawat modelo at madalas na pinapahalagahan o nirereyt ang isa't isa, kaya makikita mo kung saan sila nagkakaiba. Ang MoA ay nag-optimize para sa isang malakas na pinaghalong output; ang isang council ay nag-optimize para sa transparency ng mga indibidwal na pananaw.
Hindi eksakto. Ang Argumentree.AI ay nagbabahagi ng premise ng MoA na ang maraming modelo ay mas mahusay kaysa sa isa, ngunit sa halip na mag-aggregate sa isang solong synthesized na sagot, pinapanatili nito ang mga indibidwal na argumento ng bawat modelo at pinapahalagahan ng bawat magagamit na modelo ang mga argumento ng bawat isa pang modelo. Ang layunin ay i-surface ang konsenso at hindi pagkakasundo nang malinaw, sa halip na itago ang mga indibidwal na output sa likod ng isang pinagsamang tugon.
Ang MoA ay pinagsasama ang mga modelo sa isang sagot. Ang Argumentree.AI ay pinapanatili ang mga argumento ng bawat modelo na nakikita at peer-rated.
Magsimula ng Libre