Mixture-of-Agents (MoA) là một kiến trúc đa lớp nhiều LLM được giới thiệu trong bài báo "Mixture-of-Agents Enhances Large Language Model Capabilities" (arXiv:2406.04692). Trong MoA, một số mô hình hoạt động như những người đề xuất trong một lớp; các phản hồi của chúng được nối lại và chuyển cho các mô hình tổng hợp trong lớp tiếp theo, mà tổng hợp một câu trả lời tinh chỉnh. Các lớp bổ sung lặp lại quá trình tinh chỉnh. Bài báo cho thấy những cải tiến trên các tiêu chuẩn kiểu sở thích như AlpacaEval 2.0, MT-Bench và FLASK — các thước đo chất lượng phản hồi được đánh giá bởi một người đánh giá, không phải là đảm bảo về độ chính xác thực tế. MoA cũng làm tăng chi phí token và thêm độ trễ vì nó thực hiện nhiều cuộc gọi mô hình qua các lớp, và việc tổng hợp có thể làm mờ đi sự bất đồng thực sự. Argumentree.AI có liên quan nhưng khác biệt: thay vì tổng hợp thành một câu trả lời tổng hợp, nó bảo tồn các lập luận riêng lẻ của mỗi mô hình và yêu cầu mỗi mô hình có sẵn đánh giá các lập luận của các mô hình khác, làm nổi bật sự đồng thuận và bất đồng thay vì che giấu chúng.
Mixture-of-Agents (MoA) coi nhiều LLM như những tác nhân hợp tác — các người đề xuất tạo ra các phản hồi ứng viên, các tổng hợp viên tổng hợp chúng thành một câu trả lời tinh chỉnh. Đó là một kỹ thuật thực sự với những giao dịch thực sự, không phải là một công tắc độ chính xác ma thuật.
Mixture-of-Agents xếp chồng nhiều LLM: các mô hình đề xuất soạn thảo câu trả lời, các mô hình tổng hợp hợp nhất chúng. Bài báo arXiv:2406.04692 cho thấy những cải tiến trên các tiêu chuẩn sở thích (AlpacaEval, MT-Bench) — chất lượng phản hồi, không phải độ chính xác thực tế đã được chứng minh — và nó tốn nhiều token và độ trễ hơn so với một mô hình.
Mixture-of-Agents được giới thiệu trong bài báo năm 2024 "Mixture-of-Agents Enhances Large Language Model Capabilities" (arXiv:2406.04692). Quan sát cốt lõi là sự hợp tác: các LLM có xu hướng tạo ra các phản hồi tốt hơn khi chúng có thể thấy và xây dựng trên các đầu ra của các mô hình khác — ngay cả những mô hình yếu hơn về mặt cá nhân. MoA biến quan sát đó thành một kiến trúc.
MoA được tổ chức thành các lớp. Mỗi lớp chứa một số "tác nhân" LLM. Các mô hình trong một lớp mỗi cái tạo ra một phản hồi, các phản hồi đó được nối lại và chuyển cho lớp tiếp theo, mà các mô hình của nó hoạt động như các tổng hợp viên tinh chỉnh và tổng hợp. Xếp chồng các lớp lặp lại quá trình tinh chỉnh.
Nhiều mô hình mỗi mô hình trả lời độc lập trong lớp 1.
Tất cả các đầu ra lớp 1 được tập hợp làm tài liệu tham khảo cho lớp tiếp theo.
Các mô hình lớp 2 đọc các ứng viên và tạo ra một phản hồi tinh chỉnh, hợp nhất.
Các lớp bổ sung tiếp tục tinh chỉnh; một tổng hợp cuối cùng phát ra câu trả lời.
Hỏi "API của chúng ta nên trả về 200 hay 202 cho một công việc bất đồng bộ được chấp nhận?" Ba mô hình đề xuất mỗi cái soạn thảo một câu trả lời trích dẫn các quy tắc REST. Một tổng hợp viên đọc cả ba, nhận thấy hai cái ủng hộ 202 Accepted với một URL trạng thái và một cái ủng hộ 200, và tổng hợp một khuyến nghị duy nhất mà kết hợp lý do mạnh mẽ nhất từ mỗi cái. Câu trả lời kết hợp đọc rất tốt — nhưng nếu cả ba đều chia sẻ cùng một hiểu lầm, tổng hợp viên sẽ tự tin lặp lại nó.
Bài báo báo cáo kết quả mạnh mẽ trên các tiêu chuẩn kiểu sở thích — AlpacaEval 2.0, MT-Bench và FLASK — nơi một người đánh giá (thường là một LLM hoặc con người) chấm điểm phản hồi nào hữu ích hơn hoặc chất lượng cao hơn. Đó là một sự phân biệt quan trọng cho các nhà phát triển:
Ba mẫu đa mô hình. Là một nhà phát triển, hãy chọn theo những gì bạn cần giao hàng: một câu trả lời tinh chỉnh, hoặc lý do xuyên mô hình rõ ràng.
| Mẫu | Điều gì được tối ưu hóa | Bạn nhận được gì |
|---|---|---|
| Hỗn hợp-Các Đại lý | Một câu trả lời tinh chỉnh, pha trộn | Các tổng hợp hợp nhất đầu ra của người đề xuất; các quan điểm cá nhân biến mất vào sự tổng hợp |
| Hội đồng LLM | Đóng góp theo mô hình minh bạch | Câu trả lời của mỗi mô hình vẫn được nhìn thấy; các mô hình thường đánh giá lẫn nhau |
| Đồng thuận Multi-LLM | Tín hiệu đồng thuận + bất đồng | Định lượng nơi các mô hình đồng ý (sự tự tin) và khác biệt (câu hỏi gây tranh cãi) |
Nguyên tắc chung: hãy chọn MoA khi bạn muốn câu trả lời tốt nhất duy nhất và có thể trả chi phí token/độ trễ; hãy chọn một hội đồng hoặc điểm số đồng thuận khi chính sự bất đồng là sản phẩm.
Argumentree.AI chia sẻ giả thuyết của MoA — nhiều mô hình vượt trội hơn một — nhưng giữ cho các đầu ra cá nhân được nhìn thấy thay vì hợp nhất chúng.
Mỗi mô hình trả lời độc lập — không có sự sụp đổ của người đề xuất/tổng hợp thành một giọng nói
Các lập luận pro/con cá nhân vẫn được gán cho mô hình đã tạo ra chúng
Mỗi mô hình có sẵn đánh giá lập luận của mọi mô hình khác
Bạn thấy sự đồng thuận như sự tự tin và sự bất đồng như câu hỏi thực sự
Hỗn hợp-Các Đại lý (MoA) là một kiến trúc theo lớp trong đó nhiều mô hình ngôn ngữ lớn hoạt động như những người đề xuất trong một lớp, và các đầu ra của chúng được chuyển đến các mô hình tổng hợp trong lớp tiếp theo để tổng hợp một phản hồi tinh chỉnh. Được giới thiệu trong bài báo 'Hỗn hợp-Các Đại lý Tăng cường Năng lực Mô hình Ngôn ngữ Lớn' (arXiv:2406.04692), nó coi nhiều LLM như những đại lý hợp tác thay vì dựa vào một mô hình duy nhất.
Bài báo MoA gốc báo cáo những lợi ích trên các tiêu chuẩn kiểu sở thích như AlpacaEval 2.0, MT-Bench và FLASK, nơi một trọng tài đánh giá chất lượng phản hồi. Đó là các biện pháp sở thích và hữu ích, không phải là đảm bảo về độ chính xác thực tế. MoA có thể tạo ra một câu trả lời tinh tế hơn, được cấu trúc tốt hơn trong khi vẫn lặp lại một lỗi thực tế chung, vì vậy nó không nên được coi là một đảm bảo về sự thật.
MoA chạy nhiều mô hình qua nhiều lớp, vì vậy nó nhân chi phí token và thêm độ trễ so với một cuộc gọi mô hình duy nhất. Các lớp tổng hợp cũng có thể làm mượt sự bất đồng chân thật giữa các người đề xuất, che giấu các quan điểm thiểu số mà thực sự đáng xem. Đây là một kỹ thuật thực sự với một sự đánh đổi chi phí/độ trễ thực sự, không phải là một nâng cấp miễn phí.
MoA là một kiến trúc tổng hợp: các mô hình đề xuất cung cấp cho các tổng hợp hợp nhất mọi thứ thành một câu trả lời tinh chỉnh. Một hội đồng LLM giữ cho đóng góp của mỗi mô hình được nhìn thấy và thường có các mô hình đánh giá hoặc xếp hạng lẫn nhau, vì vậy bạn có thể thấy nơi họ bất đồng. MoA tối ưu hóa cho một đầu ra pha trộn mạnh mẽ; một hội đồng tối ưu hóa cho tính minh bạch của các quan điểm cá nhân.
Không hoàn toàn. Argumentree.AI chia sẻ giả thuyết của MoA rằng nhiều mô hình tốt hơn một mô hình, nhưng thay vì tổng hợp thành một câu trả lời tổng hợp duy nhất, nó bảo tồn các lập luận cá nhân của mỗi mô hình và có mọi mô hình có sẵn đánh giá lập luận của mọi mô hình khác. Mục tiêu là làm nổi bật sự đồng thuận và bất đồng một cách minh bạch, thay vì che giấu các đầu ra cá nhân phía sau một phản hồi hợp nhất.
MoA kết hợp các mô hình thành một câu trả lời. Argumentree.AI giữ cho các lập luận của mỗi mô hình được nhìn thấy và được đánh giá bởi đồng nghiệp.
Bắt đầu miễn phí