Apa Itu Mixture-of-Agents?

Mixture-of-Agents (MoA) adalah arsitektur multi-LLM berlapis yang diperkenalkan dalam makalah "Mixture-of-Agents Enhances Large Language Model Capabilities" (arXiv:2406.04692). Dalam MoA, beberapa model bertindak sebagai pengusul dalam satu lapisan; respons mereka digabungkan dan diteruskan ke model agregator di lapisan berikutnya, yang menyintesis jawaban yang lebih halus. Lapisan tambahan mengulangi penyempurnaan. Makalah tersebut menunjukkan peningkatan pada tolok ukur gaya preferensi seperti AlpacaEval 2.0, MT-Bench, dan FLASK — ukuran kualitas respons yang dinilai oleh evaluator, bukan jaminan akurasi faktual. MoA juga menggandakan biaya token dan menambah latensi karena menjalankan banyak panggilan model di seluruh lapisan, dan agregasi dapat meratakan ketidaksepakatan yang nyata. Argumentree.AI terkait tetapi berbeda: alih-alih mengagregasi menjadi satu jawaban yang disintesis, ia mempertahankan argumen individu dari setiap model dan meminta setiap model yang tersedia untuk menilai argumen model lainnya, menampilkan konsensus dan perbedaan pendapat alih-alih menyembunyikannya.

Kembali ke Kecerdasan AI KolektifArsitektur Multi-LLM

Apa Itu
Mixture-of-Agents?

Mixture-of-Agents (MoA) memperlakukan beberapa LLM sebagai agen kolaboratif — pengusul menghasilkan respons kandidat, agregator menyintesisnya menjadi satu jawaban yang lebih halus. Ini adalah teknik nyata dengan trade-off nyata, bukan saklar akurasi ajaib.

TL;DR

Mixture-of-Agents melapisi beberapa LLM: model pengusul menyusun jawaban, model agregator menggabungkannya. Makalah arXiv:2406.04692 menunjukkan peningkatan pada tolok ukur preferensi (AlpacaEval, MT-Bench) — kualitas respons, bukan akurasi faktual yang terbukti — dan biayanya lebih banyak token dan latensi dibandingkan satu model.

Dari Mana MoA Berasal

Mixture-of-Agents diperkenalkan dalam makalah 2024 "Mixture-of-Agents Enhances Large Language Model Capabilities" (arXiv:2406.04692). Observasi inti adalah kolaboratif: LLM cenderung menghasilkan respons yang lebih baik ketika mereka dapat melihat dan membangun dari keluaran model lain — bahkan model yang secara individu lebih lemah. MoA mengubah observasi itu menjadi arsitektur.

Arsitektur Berlapis

MoA diorganisir dalam lapisan. Setiap lapisan berisi beberapa "agen" LLM. Model-model dalam satu lapisan masing-masing menghasilkan respons, respons tersebut digabungkan dan diserahkan ke lapisan berikutnya, di mana model-modelnya bertindak sebagai agregator yang menyempurnakan dan menyintesis. Menumpuk lapisan mengulangi penyempurnaan.

1

Pengusul menghasilkan kandidat

Beberapa model masing-masing menjawab permintaan secara independen di lapisan 1.

2

Respon digabungkan

Semua keluaran lapisan-1 dikumpulkan sebagai bahan referensi untuk lapisan berikutnya.

3

Agregator mensintesis

Model lapisan-2 membaca kandidat dan menghasilkan respon yang lebih halus dan terintegrasi.

4

Opsional, ulangi per lapisan

Lapisan tambahan terus memperhalus; agregator akhir mengeluarkan jawaban.

Contoh ilustratif — bukan keluaran model yang sebenarnya

Tanya "Haruskah API kami mengembalikan 200 atau 202 untuk pekerjaan asinkron yang diterima?" Tiga model pengusul masing-masing menyusun jawaban yang mengutip konvensi REST. Seorang agregator membaca ketiga jawaban, memperhatikan dua mendukung 202 Accepted dengan URL status dan satu mendukung 200, dan menyintesis rekomendasi tunggal yang menggabungkan alasan terkuat dari masing-masing. Jawaban yang digabungkan terbaca dengan baik — tetapi jika ketiga model memiliki kesalahpahaman yang sama, agregator akan dengan percaya diri mengulangnya.

Apa yang Sebenarnya Ditunjukkan oleh Tolok Ukur

Makalah tersebut melaporkan hasil yang kuat pada tolok ukur gaya preferensi — AlpacaEval 2.0, MT-Bench, dan FLASK — di mana seorang juri (seringkali LLM atau manusia) menilai respons mana yang lebih membantu atau berkualitas lebih tinggi. Itu adalah perbedaan penting bagi pengembang:

Baca klaim dengan jujur

  • • Peningkatan preferensi/rasio kemenangan mengukur kualitas yang dirasakan, bukan kebenaran yang terverifikasi
  • • Jawaban yang lebih lancar dan terorganisir dengan baik masih bisa salah secara faktual
  • • Jika pengusul memiliki titik buta yang sama, agregasi memperkuat daripada memperbaikinya
  • • Setiap lapisan menambah panggilan model: lebih banyak token, biaya lebih tinggi, lebih banyak latensi
  • • Agregasi dapat meratakan ketidaksepakatan yang nyata menjadi kepercayaan yang salah

MoA vs Dewan LLM vs Konsensus Multi-LLM

Tiga pola multi-model. Sebagai pengembang, pilih berdasarkan apa yang perlu Anda kirim: satu jawaban yang dipoles, atau penalaran lintas model yang terlihat.

PolaApa yang dioptimalkanApa yang Anda dapatkan
Campuran-AgenSatu jawaban campuran yang halusAgregator menggabungkan keluaran pengusul; pandangan individu menghilang ke dalam sintesis
Dewan LLMKontribusi per-model yang transparanJawaban setiap model tetap terlihat; model sering mengevaluasi satu sama lain
Konsensus Multi-LLMSinyal kesepakatan + ketidaksepakatanMengukur di mana model setuju (kepercayaan) dan berbeda (pertanyaan yang diperdebatkan)

Aturan praktis: pilih MoA ketika Anda menginginkan jawaban terbaik tunggal dan dapat membayar biaya token/latensi; pilih dewan atau penilaian konsensus ketika ketidaksepakatan itu sendiri adalah produknya.

Di Mana Argumentree.AI Cocok

Argumentree.AI berbagi premis MoA — beberapa model mengalahkan satu — tetapi mempertahankan keluaran individu terlihat alih-alih menggabungkannya.

Kueri Semua Model Tersedia

Setiap model menjawab secara independen — tidak ada pengusul/agregator yang menyatu menjadi satu suara

Pertahankan Setiap Argumen

Argumen pro/con individu tetap dapat diatribusikan kepada model yang membuatnya

Penilaian Teman Lintas-Model

Setiap model yang tersedia menilai argumen setiap model lainnya

Permukaan Konsensus dan Ketidaksepakatan

Anda melihat kesepakatan sebagai kepercayaan dan ketidaksepakatan sebagai pertanyaan yang nyata

Pertanyaan yang Sering Diajukan

Apa itu Campuran-Agen (MoA)?

Campuran-Agen (MoA) adalah arsitektur berlapis di mana beberapa model bahasa besar bertindak sebagai pengusul di satu lapisan, dan keluaran mereka diteruskan ke model agregator di lapisan berikutnya yang mensintesis respon yang lebih halus. Diperkenalkan dalam makalah 'Campuran-Agen Meningkatkan Kemampuan Model Bahasa Besar' (arXiv:2406.04692), ini memperlakukan beberapa LLM sebagai agen kolaboratif daripada mengandalkan satu model.

Apakah Campuran-Agen membuat jawaban lebih akurat?

Makalah MoA yang asli melaporkan peningkatan pada tolok ukur gaya preferensi seperti AlpacaEval 2.0, MT-Bench dan FLASK, di mana seorang juri menilai kualitas respon. Itu adalah ukuran preferensi dan kegunaan, bukan jaminan akurasi faktual. MoA dapat menghasilkan jawaban yang lebih halus dan terstruktur lebih baik sambil tetap mengulangi kesalahan faktual yang sama, jadi tidak boleh diperlakukan sebagai jaminan kebenaran.

Apa saja kekurangan dari Campuran-Agen?

MoA menjalankan banyak model di berbagai lapisan, sehingga menggandakan biaya token dan menambah latensi dibandingkan dengan panggilan model tunggal. Lapisan agregator juga dapat meratakan ketidaksepakatan yang nyata antara pengusul, menyembunyikan pandangan minoritas yang sebenarnya layak untuk dilihat. Ini adalah teknik nyata dengan trade-off biaya/latensi yang nyata, bukan peningkatan gratis.

Bagaimana MoA berbeda dari dewan LLM?

MoA adalah arsitektur sintesis: model pengusul memberi umpan kepada agregator yang menggabungkan semuanya menjadi satu jawaban yang halus. Dewan LLM menjaga kontribusi setiap model tetap terlihat dan sering kali memiliki model yang mengevaluasi atau menilai satu sama lain, sehingga Anda dapat melihat di mana mereka tidak setuju. MoA mengoptimalkan untuk satu keluaran campuran yang kuat; dewan mengoptimalkan untuk transparansi perspektif individu.

Apakah Argumentree.AI adalah sistem Campuran-Agen?

Tidak persis. Argumentree.AI berbagi premis MoA bahwa beberapa model lebih baik daripada satu, tetapi alih-alih mengagregasi menjadi satu jawaban yang disintesis, ia mempertahankan argumen individu setiap model dan membuat setiap model yang tersedia menilai argumen setiap model lainnya. Tujuannya adalah untuk menampilkan konsensus dan ketidaksepakatan secara transparan, daripada menyembunyikan keluaran individu di balik satu respon yang digabungkan.

Lihat beberapa model beralasan — tanpa menggabungkannya

MoA menggabungkan model menjadi satu jawaban. Argumentree.AI mempertahankan argumen setiap model terlihat dan dinilai oleh rekan.

Mulai Gratis