Mixture-of-Agents là gì?

Mixture-of-Agents (MoA) là một kiến trúc đa lớp nhiều LLM được giới thiệu trong bài báo "Mixture-of-Agents Enhances Large Language Model Capabilities" (arXiv:2406.04692). Trong MoA, một số mô hình hoạt động như những người đề xuất trong một lớp; các phản hồi của chúng được nối lại và chuyển cho các mô hình tổng hợp trong lớp tiếp theo, mà tổng hợp một câu trả lời tinh chỉnh. Các lớp bổ sung lặp lại quá trình tinh chỉnh. Bài báo cho thấy những cải tiến trên các tiêu chuẩn kiểu sở thích như AlpacaEval 2.0, MT-Bench và FLASK — các thước đo chất lượng phản hồi được đánh giá bởi một người đánh giá, không phải là đảm bảo về độ chính xác thực tế. MoA cũng làm tăng chi phí token và thêm độ trễ vì nó thực hiện nhiều cuộc gọi mô hình qua các lớp, và việc tổng hợp có thể làm mờ đi sự bất đồng thực sự. Argumentree.AI có liên quan nhưng khác biệt: thay vì tổng hợp thành một câu trả lời tổng hợp, nó bảo tồn các lập luận riêng lẻ của mỗi mô hình và yêu cầu mỗi mô hình có sẵn đánh giá các lập luận của các mô hình khác, làm nổi bật sự đồng thuận và bất đồng thay vì che giấu chúng.

Quay lại Trí tuệ AI Tập thểKiến trúc Multi-LLM

Mixture-of-Agents là gì
?

Mixture-of-Agents (MoA) coi nhiều LLM như những tác nhân hợp tác — các người đề xuất tạo ra các phản hồi ứng viên, các tổng hợp viên tổng hợp chúng thành một câu trả lời tinh chỉnh. Đó là một kỹ thuật thực sự với những giao dịch thực sự, không phải là một công tắc độ chính xác ma thuật.

TL;DR

Mixture-of-Agents xếp chồng nhiều LLM: các mô hình đề xuất soạn thảo câu trả lời, các mô hình tổng hợp hợp nhất chúng. Bài báo arXiv:2406.04692 cho thấy những cải tiến trên các tiêu chuẩn sở thích (AlpacaEval, MT-Bench) — chất lượng phản hồi, không phải độ chính xác thực tế đã được chứng minh — và nó tốn nhiều token và độ trễ hơn so với một mô hình.

MoA đến từ đâu

Mixture-of-Agents được giới thiệu trong bài báo năm 2024 "Mixture-of-Agents Enhances Large Language Model Capabilities" (arXiv:2406.04692). Quan sát cốt lõi là sự hợp tác: các LLM có xu hướng tạo ra các phản hồi tốt hơn khi chúng có thể thấy và xây dựng trên các đầu ra của các mô hình khác — ngay cả những mô hình yếu hơn về mặt cá nhân. MoA biến quan sát đó thành một kiến trúc.

Kiến trúc Đa lớp

MoA được tổ chức thành các lớp. Mỗi lớp chứa một số "tác nhân" LLM. Các mô hình trong một lớp mỗi cái tạo ra một phản hồi, các phản hồi đó được nối lại và chuyển cho lớp tiếp theo, mà các mô hình của nó hoạt động như các tổng hợp viên tinh chỉnh và tổng hợp. Xếp chồng các lớp lặp lại quá trình tinh chỉnh.

1

Người đề xuất tạo ra các ứng viên

Nhiều mô hình mỗi mô hình trả lời độc lập trong lớp 1.

2

Các phản hồi được nối lại

Tất cả các đầu ra lớp 1 được tập hợp làm tài liệu tham khảo cho lớp tiếp theo.

3

Các tổng hợp tổng hợp

Các mô hình lớp 2 đọc các ứng viên và tạo ra một phản hồi tinh chỉnh, hợp nhất.

4

Tùy chọn, lặp lại theo lớp

Các lớp bổ sung tiếp tục tinh chỉnh; một tổng hợp cuối cùng phát ra câu trả lời.

Ví dụ minh họa — không phải đầu ra mô hình thực tế

Hỏi "API của chúng ta nên trả về 200 hay 202 cho một công việc bất đồng bộ được chấp nhận?" Ba mô hình đề xuất mỗi cái soạn thảo một câu trả lời trích dẫn các quy tắc REST. Một tổng hợp viên đọc cả ba, nhận thấy hai cái ủng hộ 202 Accepted với một URL trạng thái và một cái ủng hộ 200, và tổng hợp một khuyến nghị duy nhất mà kết hợp lý do mạnh mẽ nhất từ mỗi cái. Câu trả lời kết hợp đọc rất tốt — nhưng nếu cả ba đều chia sẻ cùng một hiểu lầm, tổng hợp viên sẽ tự tin lặp lại nó.

Những gì các tiêu chuẩn thực sự cho thấy

Bài báo báo cáo kết quả mạnh mẽ trên các tiêu chuẩn kiểu sở thích — AlpacaEval 2.0, MT-Bench và FLASK — nơi một người đánh giá (thường là một LLM hoặc con người) chấm điểm phản hồi nào hữu ích hơn hoặc chất lượng cao hơn. Đó là một sự phân biệt quan trọng cho các nhà phát triển:

Đọc tuyên bố một cách trung thực

  • • Lợi ích/tỷ lệ thắng đo lường chất lượng cảm nhận, không phải sự thật đã được xác minh
  • • Một câu trả lời trôi chảy hơn, được tổ chức tốt hơn vẫn có thể sai sự thật
  • • Nếu các người đề xuất chia sẻ một điểm mù, việc tổng hợp củng cố chứ không phải sửa chữa nó
  • • Mỗi lớp thêm các cuộc gọi mô hình: nhiều token hơn, chi phí cao hơn, độ trễ nhiều hơn
  • • Tổng hợp có thể làm phẳng sự bất đồng chân thật thành sự tự tin sai lệch

MoA so với Hội đồng LLM so với Đồng thuận Multi-LLM

Ba mẫu đa mô hình. Là một nhà phát triển, hãy chọn theo những gì bạn cần giao hàng: một câu trả lời tinh chỉnh, hoặc lý do xuyên mô hình rõ ràng.

MẫuĐiều gì được tối ưu hóaBạn nhận được gì
Hỗn hợp-Các Đại lýMột câu trả lời tinh chỉnh, pha trộnCác tổng hợp hợp nhất đầu ra của người đề xuất; các quan điểm cá nhân biến mất vào sự tổng hợp
Hội đồng LLMĐóng góp theo mô hình minh bạchCâu trả lời của mỗi mô hình vẫn được nhìn thấy; các mô hình thường đánh giá lẫn nhau
Đồng thuận Multi-LLMTín hiệu đồng thuận + bất đồngĐịnh lượng nơi các mô hình đồng ý (sự tự tin) và khác biệt (câu hỏi gây tranh cãi)

Nguyên tắc chung: hãy chọn MoA khi bạn muốn câu trả lời tốt nhất duy nhất và có thể trả chi phí token/độ trễ; hãy chọn một hội đồng hoặc điểm số đồng thuận khi chính sự bất đồng là sản phẩm.

Argumentree.AI phù hợp ở đâu

Argumentree.AI chia sẻ giả thuyết của MoA — nhiều mô hình vượt trội hơn một — nhưng giữ cho các đầu ra cá nhân được nhìn thấy thay vì hợp nhất chúng.

Truy vấn Tất cả Các Mô Hình Có Sẵn

Mỗi mô hình trả lời độc lập — không có sự sụp đổ của người đề xuất/tổng hợp thành một giọng nói

Bảo tồn Mọi Lập luận

Các lập luận pro/con cá nhân vẫn được gán cho mô hình đã tạo ra chúng

Đánh giá Đồng nghiệp Chéo Mô Hình

Mỗi mô hình có sẵn đánh giá lập luận của mọi mô hình khác

Bề mặt Đồng thuận và Bất đồng

Bạn thấy sự đồng thuận như sự tự tin và sự bất đồng như câu hỏi thực sự

Câu hỏi thường gặp

Hỗn hợp-Các Đại lý (MoA) là gì?

Hỗn hợp-Các Đại lý (MoA) là một kiến trúc theo lớp trong đó nhiều mô hình ngôn ngữ lớn hoạt động như những người đề xuất trong một lớp, và các đầu ra của chúng được chuyển đến các mô hình tổng hợp trong lớp tiếp theo để tổng hợp một phản hồi tinh chỉnh. Được giới thiệu trong bài báo 'Hỗn hợp-Các Đại lý Tăng cường Năng lực Mô hình Ngôn ngữ Lớn' (arXiv:2406.04692), nó coi nhiều LLM như những đại lý hợp tác thay vì dựa vào một mô hình duy nhất.

Hỗn hợp-Các Đại lý có làm cho các câu trả lời chính xác hơn không?

Bài báo MoA gốc báo cáo những lợi ích trên các tiêu chuẩn kiểu sở thích như AlpacaEval 2.0, MT-Bench và FLASK, nơi một trọng tài đánh giá chất lượng phản hồi. Đó là các biện pháp sở thích và hữu ích, không phải là đảm bảo về độ chính xác thực tế. MoA có thể tạo ra một câu trả lời tinh tế hơn, được cấu trúc tốt hơn trong khi vẫn lặp lại một lỗi thực tế chung, vì vậy nó không nên được coi là một đảm bảo về sự thật.

Những nhược điểm của Hỗn hợp-Các Đại lý là gì?

MoA chạy nhiều mô hình qua nhiều lớp, vì vậy nó nhân chi phí token và thêm độ trễ so với một cuộc gọi mô hình duy nhất. Các lớp tổng hợp cũng có thể làm mượt sự bất đồng chân thật giữa các người đề xuất, che giấu các quan điểm thiểu số mà thực sự đáng xem. Đây là một kỹ thuật thực sự với một sự đánh đổi chi phí/độ trễ thực sự, không phải là một nâng cấp miễn phí.

MoA khác gì so với một hội đồng LLM?

MoA là một kiến trúc tổng hợp: các mô hình đề xuất cung cấp cho các tổng hợp hợp nhất mọi thứ thành một câu trả lời tinh chỉnh. Một hội đồng LLM giữ cho đóng góp của mỗi mô hình được nhìn thấy và thường có các mô hình đánh giá hoặc xếp hạng lẫn nhau, vì vậy bạn có thể thấy nơi họ bất đồng. MoA tối ưu hóa cho một đầu ra pha trộn mạnh mẽ; một hội đồng tối ưu hóa cho tính minh bạch của các quan điểm cá nhân.

Argumentree.AI có phải là một hệ thống Hỗn hợp-Các Đại lý không?

Không hoàn toàn. Argumentree.AI chia sẻ giả thuyết của MoA rằng nhiều mô hình tốt hơn một mô hình, nhưng thay vì tổng hợp thành một câu trả lời tổng hợp duy nhất, nó bảo tồn các lập luận cá nhân của mỗi mô hình và có mọi mô hình có sẵn đánh giá lập luận của mọi mô hình khác. Mục tiêu là làm nổi bật sự đồng thuận và bất đồng một cách minh bạch, thay vì che giấu các đầu ra cá nhân phía sau một phản hồi hợp nhất.

Xem nhiều mô hình lý luận — mà không hợp nhất chúng

MoA kết hợp các mô hình thành một câu trả lời. Argumentree.AI giữ cho các lập luận của mỗi mô hình được nhìn thấy và được đánh giá bởi đồng nghiệp.

Bắt đầu miễn phí