Đồng thuận Multi-LLM là mức độ đồng thuận đạt được khi nhiều mô hình ngôn ngữ lớn khác nhau lý luận độc lập về cùng một tuyên bố và đánh giá lập luận của nhau. Nó khác với việc lấy mẫu một mô hình đơn hoặc tính nhất quán tự thân, mà lấy mẫu lặp đi lặp lại một mô hình và chia sẻ những thiên kiến của mô hình đó. Nó cũng khác với sự kết hợp thống kê, mà trộn các đầu ra thành một dự đoán trung bình: đồng thuận Multi-LLM bảo tồn các lập luận cá nhân để chúng có thể được kiểm tra thay vì bị trung bình hóa thành một hộp đen. Nghiên cứu về Mixture-of-Agents (arXiv:2406.04692) cho thấy sự cải thiện chất lượng từ việc xếp chồng nhiều LLM, được đo lường chủ yếu trên các tiêu chuẩn sở thích như AlpacaEval—bằng chứng về chất lượng phản hồi được cải thiện, không phải là đảm bảo về độ chính xác thực tế trên bất kỳ tuyên bố nào. Argumentree.AI coi đồng thuận là một tín hiệu tự tin, không phải là một oracle sự thật; những bất đồng giữa các mô hình thường là đầu ra có thể hành động nhất.
Đồng thuận Multi-LLM là sự đồng thuận giữa nhiều mô hình thực sự khác nhau—không phải một mô hình được lấy mẫu hai lần, và không phải một trung bình trộn lẫn. Đây là một tín hiệu tự tin mà bạn có thể kiểm tra, không phải một oracle sự thật.
Đồng thuận Multi-LLM đo lường sự đồng thuận giữa nhiều mô hình khác nhau. Nó khác với tính nhất quán tự thân (một mô hình, nhiều mẫu) và sự kết hợp thống kê (trung bình trộn lẫn). Nó bảo tồn các lập luận cá nhân—và đó là một tín hiệu tự tin, không phải là bằng chứng về sự thật.
Đồng thuận Multi-LLM là mức độ đồng thuận đạt được khi nhiều mô hình ngôn ngữ lớn khác nhau lý luận độc lập về cùng một câu hỏi và đánh giá lập luận của nhau. Từ quan trọng là khác nhau: các mô hình đến từ các kiến trúc và dữ liệu huấn luyện khác nhau, vì vậy khi chúng hội tụ, sự đồng thuận đó phản ánh nhiều hơn một quan điểm của hệ thống—và khi chúng phân kỳ, sự chia rẽ đánh dấu một tuyên bố thực sự tranh chấp.
Một kỹ thuật phổ biến của mô hình đơn là tính nhất quán tự thân: lấy mẫu cùng một mô hình nhiều lần và lấy câu trả lời đa số. Điều đó giảm thiểu biến động ngẫu nhiên, nhưng mỗi mẫu đều thừa hưởng những thiên kiến và điểm mù của cùng một mô hình. Nếu mô hình đó sai một cách tự tin, việc lấy mẫu lại chỉ lặp lại lỗi. Đồng thuận Multi-LLM khác về bản chất—nó dựa vào các mô hình độc lập, vì vậy một điểm mù chung trong một mô hình khó có thể được chia sẻ bởi tất cả.
Sự kết hợp cổ điển trộn lẫn các đầu ra của mô hình thành một dự đoán trung bình duy nhất—hữu ích cho một điểm số, vô dụng cho việc hiểu. Đồng thuận Multi-LLM cố ý làm điều ngược lại: nó bảo tồn các lập luận cá nhân để bạn có thể đọc lý luận của từng mô hình. Không có gì bị làm phẳng thành một con số hộp đen. Đó là điều làm cho sự bất đồng trở nên rõ ràng thay vì biến mất vào một trung bình.
| Cách tiếp cận | Những gì nó kết hợp | Lý luận có thể nhìn thấy? |
|---|---|---|
| Tính nhất quán tự thân | Một mô hình, nhiều mẫu | Chỉ câu trả lời đa số |
| Sự kết hợp thống kê | Các đầu ra trộn lẫn thành một trung bình | Không—bị trung bình hóa |
| Đồng thuận Multi-LLM | Lập luận của nhiều mô hình khác nhau | Có—được bảo tồn và có thể kiểm tra |
Nghiên cứu thường được trích dẫn ở đây là Mixture-of-Agents (arXiv:2406.04692), mà xếp chồng nhiều LLM để các lớp sau tinh chỉnh các phản hồi trước đó. Nó báo cáo sự cải thiện chất lượng—nhưng điều quan trọng là phải chính xác về những gì đã được đo lường.
Các lợi ích của Mixture-of-Agents chủ yếu được thể hiện trên các tiêu chuẩn sở thích như AlpacaEval—các thước đo về mức độ tốt của một phản hồi được đánh giá. Điều đó không phải là đảm bảo về độ chính xác thực tế trên bất kỳ tuyên bố cụ thể nào. Việc kết hợp các mô hình có thể cải thiện chất lượng; nó không chứng nhận sự thật.
Ghép các mảnh lại với nhau và cách diễn đạt trung thực là như thế này: đồng thuận Multi-LLM là một tín hiệu tự tin. Sự đồng thuận cao có nghĩa là nhiều hệ thống độc lập đồng ý, điều này làm giảm—nhưng không loại bỏ—ưu tiên cho việc xác minh của con người. Các mô hình có thể chia sẻ một thiên kiến huấn luyện và sai cùng nhau. Xem đồng thuận như "có thể có rủi ro thấp hơn," và coi những bất đồng là đầu ra có thể hành động nhất của bạn: chúng chỉ ra chính xác nơi mà việc xác minh là quan trọng nhất.
Sự đồng thuận giữa các hệ thống khác nhau—không phải một mô hình được lấy mẫu lại
Đọc lý luận của từng mô hình; không có gì bị trung bình hóa thành một hộp đen
Điểm số điều chỉnh sự tự tin—không bao giờ được trình bày như bằng chứng về sự thật
Các điểm tranh chấp được đánh dấu để xác minh của con người
Đồng thuận multi-LLM là mức độ đồng thuận đạt được khi nhiều mô hình ngôn ngữ lớn khác nhau lý luận độc lập về cùng một tuyên bố và đánh giá lập luận của nhau. Khác với việc lấy mẫu một mô hình nhiều lần, nó dựa vào các hệ thống thực sự khác nhau—vì vậy sự đồng thuận phản ánh sự đồng ý giữa các kiến trúc và dữ liệu huấn luyện khác nhau, và sự bất đồng đánh dấu nơi mà một tuyên bố bị tranh chấp.
Tính nhất quán tự thân lấy mẫu cùng một mô hình đơn nhiều lần và lấy câu trả lời đa số. Nó giảm thiểu biến động ngẫu nhiên nhưng chia sẻ thiên kiến và điểm mù của một mô hình. Đồng thuận multi-LLM sử dụng các mô hình khác nhau, vì vậy sự đồng thuận có ý nghĩa hơn và sự bất đồng có thể tiết lộ một điểm mù mà việc lấy mẫu lặp đi lặp lại một mô hình sẽ không bao giờ phơi bày.
Sự kết hợp thống kê trộn lẫn các đầu ra của mô hình thành một dự đoán trung bình duy nhất, loại bỏ lý luận cá nhân. Đồng thuận multi-LLM bảo tồn các lập luận của từng mô hình để bạn có thể đọc chúng. Không có gì bị trung bình hóa thành một điểm số hộp đen mà bạn không thể kiểm tra—các trường hợp cá nhân vẫn được nhìn thấy, điều này làm cho sự bất đồng trở nên rõ ràng.
Nghiên cứu như Mixture-of-Agents (arXiv:2406.04692) cho thấy sự cải thiện chất lượng từ việc xếp chồng nhiều LLM, được đo lường chủ yếu trên các tiêu chuẩn sở thích như AlpacaEval. Đó là bằng chứng về chất lượng phản hồi được cải thiện trên các tiêu chuẩn đó—nó không phải là đảm bảo về độ chính xác thực tế trên bất kỳ tuyên bố nào. Xem đồng thuận như một tín hiệu tự tin, không phải là một oracle sự thật.
Không. Sự đồng thuận là một tín hiệu tự tin, không phải là bằng chứng. Nhiều mô hình có thể chia sẻ cùng một thiên kiến huấn luyện và đồng ý về một điều sai. Sự đồng thuận cao làm giảm ưu tiên cho việc xác minh của con người; nó không bao giờ loại bỏ nhu cầu đó. Đầu ra có thể hành động nhất thường là sự bất đồng, chỉ ra nơi mà việc xác minh là quan trọng nhất.
Không phải một mô hình được lấy mẫu hai lần. Nhiều mô hình khác nhau, lập luận được bảo tồn, sự bất đồng rõ ràng.
Bắt đầu miễn phí