Mixture-of-Agents (MoA) to warstwowa architektura multi-LLM wprowadzona w artykule "Mixture-of-Agents Enhances Large Language Model Capabilities" (arXiv:2406.04692). W MoA kilka modeli działa jako proponujący w jednej warstwie; ich odpowiedzi są łączone i przekazywane do modeli agregujących w następnej warstwie, które syntetyzują dopracowaną odpowiedź. Dodatkowe warstwy powtarzają proces udoskonalania. Artykuł pokazuje zyski w benchmarkach preferencyjnych, takich jak AlpacaEval 2.0, MT-Bench i FLASK — miary jakości odpowiedzi oceniane przez ewaluatora, a nie gwarancja dokładności faktów. MoA również zwiększa koszt tokenów i dodaje opóźnienia, ponieważ wykonuje wiele wywołań modeli w różnych warstwach, a agregacja może wygładzać prawdziwe nieporozumienia. Argumentree.AI jest związane, ale różne: zamiast agregować w jedną syntetyzowaną odpowiedź, zachowuje indywidualne argumenty każdego modelu i każdemu dostępnemu modelowi zleca ocenę argumentów innych modeli, ujawniając konsensus i sprzeczności zamiast je ukrywać.
Mixture-of-Agents (MoA) traktuje wiele LLM jako współpracujące agenty — proponujący generują kandydatów odpowiedzi, agregatorzy syntetyzują je w jedną dopracowaną odpowiedź. To prawdziwa technika z prawdziwymi kompromisami, a nie magiczny przełącznik dokładności.
Mixture-of-Agents łączy wiele LLM: modele proponujące tworzą odpowiedzi, modele agregujące je łączą. Artykuł arXiv:2406.04692 pokazuje zyski w benchmarkach preferencyjnych (AlpacaEval, MT-Bench) — jakość odpowiedzi, a nie udowodniona dokładność faktów — i kosztuje więcej tokenów i opóźnień niż jeden model.
Mixture-of-Agents został wprowadzony w artykule z 2024 roku "Mixture-of-Agents Enhances Large Language Model Capabilities" (arXiv:2406.04692). Kluczowa obserwacja to współpraca: LLM-y mają tendencję do generowania lepszych odpowiedzi, gdy mogą widzieć i budować na wynikach innych modeli — nawet modeli, które są indywidualnie słabsze. MoA przekształca tę obserwację w architekturę.
MoA jest zorganizowane w warstwy. Każda warstwa zawiera kilka "agentów" LLM. Modele w warstwie generują odpowiedzi, te odpowiedzi są łączone i przekazywane do następnej warstwy, której modele działają jako agregatory, które udoskonalają i syntetyzują. Stacking warstw powtarza proces udoskonalania.
Kilka modeli odpowiada na zapytanie niezależnie w warstwie 1.
Wszystkie wyjścia z warstwy 1 są zbierane jako materiał referencyjny dla następnej warstwy.
Modele warstwy 2 czytają kandydatów i produkują dopracowaną, połączoną odpowiedź.
Dodatkowe warstwy wciąż dopracowują; ostateczny agregator wydaje odpowiedź.
Zapytaj "Czy nasze API powinno zwracać 200 czy 202 dla zaakceptowanego zadania asynchronicznego?" Trzy modele proponujące każda tworzy odpowiedź, powołując się na konwencje REST. Agregator czyta wszystkie trzy, zauważa, że dwa preferują 202 Accepted z adresem URL statusu, a jeden preferuje 200, i syntetyzuje jedną rekomendację, która uwzględnia najsilniejsze argumenty z każdego. Połączona odpowiedź brzmi dobrze — ale jeśli wszystkie trzy miałyby to samo błędne przekonanie, agregator pewnie by je powtórzył.
Artykuł raportuje silne wyniki w benchmarkach preferencyjnych — AlpacaEval 2.0, MT-Bench i FLASK — gdzie sędzia (często LLM lub człowiek) ocenia, która odpowiedź jest bardziej pomocna lub wyższej jakości. To ważne rozróżnienie dla deweloperów:
Trzy wzorce multi-modelowe. Jako deweloper, wybierz to, co musisz dostarczyć: jedną dopracowaną odpowiedź, czy widoczne rozumowanie między modelami.
| Wzorzec | Co optymalizuje | Co otrzymujesz |
|---|---|---|
| Mieszanka-Agentów | Jedna dopracowana, połączona odpowiedź | Agregatory łączą wyjścia proponentów; indywidualne poglądy znikają w syntezie |
| Rada LLM | Przejrzysty wkład każdego modelu | Odpowiedź każdego modelu pozostaje widoczna; modele często oceniają się nawzajem |
| Konsensus Multi-LLM | Sygnalizacja zgody + niezgody | Ilościowo określa, gdzie modele się zgadzają (pewność) i różnią (kwestia sporna) |
Zasada ogólna: sięgnij po MoA, gdy chcesz uzyskać najlepszą odpowiedź i możesz ponieść koszt tokenów/opóźnień; sięgnij po radę lub ocenę konsensusu, gdy sama niezgoda jest produktem.
Argumentree.AI dzieli założenie MoA — wiele modeli przewyższa jeden — ale zachowuje widoczne indywidualne wyjścia zamiast je łączyć.
Każdy model odpowiada niezależnie — brak zbiegu proponenta/agregatora w jeden głos
Indywidualne argumenty za/przeciw pozostają przypisane do modelu, który je stworzył
Każdy dostępny model ocenia argumenty każdego innego modelu
Widoczna zgoda jako pewność i niezgoda jako prawdziwe pytanie
Mieszanka-Agentów (MoA) to architektura warstwowa, w której kilka dużych modeli językowych działa jako proponenci w jednej warstwie, a ich wyjścia są przekazywane do modeli agregujących w następnej warstwie, które syntetyzują dopracowaną odpowiedź. Wprowadzona w artykule 'Mieszanka-Agentów zwiększa możliwości dużych modeli językowych' (arXiv:2406.04692), traktuje wiele LLM jako współpracujących agentów, a nie polega na jednym modelu.
Oryginalny artykuł MoA raportuje zyski w benchmarkach typu preferencyjnego, takich jak AlpacaEval 2.0, MT-Bench i FLASK, gdzie sędzia ocenia jakość odpowiedzi. To są miary preferencji i użyteczności, a nie gwarancja dokładności faktograficznej. MoA może produkować bardziej dopracowaną, lepiej zorganizowaną odpowiedź, jednocześnie powtarzając wspólny błąd faktograficzny, więc nie należy go traktować jako gwarancji prawdy.
MoA uruchamia wiele modeli w wielu warstwach, co mnoży koszty tokenów i dodaje latencję w porównaniu do pojedynczego wywołania modelu. Warstwy agregujące mogą również wygładzać prawdziwe nieporozumienia między proponentami, ukrywając mniejszościowe poglądy, które naprawdę warto było zobaczyć. To rzeczywista technika z rzeczywistym kosztem/latencją, a nie darmowa aktualizacja.
MoA to architektura syntezująca: modele proponujące zasilają agregatory, które łączą wszystko w jedną dopracowaną odpowiedź. Rada LLM utrzymuje widoczny wkład każdego modelu i często ma modele oceniające lub oceniające się nawzajem, więc można zobaczyć, gdzie się nie zgadzają. MoA optymalizuje dla jednego silnego, połączonego wyniku; rada optymalizuje dla przejrzystości indywidualnych perspektyw.
Nie do końca. Argumentree.AI dzieli założenie MoA, że wiele modeli jest lepsze niż jedno, ale zamiast agregować w jedną syntetyzowaną odpowiedź, zachowuje indywidualne argumenty każdego modelu i każdemu dostępnemu modelowi pozwala oceniać argumenty każdego innego modelu. Celem jest ujawnienie konsensusu i sprzeciwu w sposób przejrzysty, a nie ukrywanie indywidualnych wyjść za jedną połączoną odpowiedzią.
MoA łączy modele w jedną odpowiedź. Argumentree.AI zachowuje widoczne argumenty każdego modelu i oceny rówieśników.
Rozpocznij za darmo