Đồng thuận Multi-LLM là gì?

Đồng thuận Multi-LLM là mức độ đồng thuận đạt được khi nhiều mô hình ngôn ngữ lớn khác nhau lý luận độc lập về cùng một tuyên bố và đánh giá lập luận của nhau. Nó khác với việc lấy mẫu một mô hình đơn hoặc tính nhất quán tự thân, mà lấy mẫu lặp đi lặp lại một mô hình và chia sẻ những thiên kiến của mô hình đó. Nó cũng khác với sự kết hợp thống kê, mà trộn các đầu ra thành một dự đoán trung bình: đồng thuận Multi-LLM bảo tồn các lập luận cá nhân để chúng có thể được kiểm tra thay vì bị trung bình hóa thành một hộp đen. Nghiên cứu về Mixture-of-Agents (arXiv:2406.04692) cho thấy sự cải thiện chất lượng từ việc xếp chồng nhiều LLM, được đo lường chủ yếu trên các tiêu chuẩn sở thích như AlpacaEval—bằng chứng về chất lượng phản hồi được cải thiện, không phải là đảm bảo về độ chính xác thực tế trên bất kỳ tuyên bố nào. Argumentree.AI coi đồng thuận là một tín hiệu tự tin, không phải là một oracle sự thật; những bất đồng giữa các mô hình thường là đầu ra có thể hành động nhất.

Quay lại Trí tuệ AI Tập thểNghiên cứu Multi-AI

Đồng thuận là gì
Multi-LLM?

Đồng thuận Multi-LLM là sự đồng thuận giữa nhiều mô hình thực sự khác nhau—không phải một mô hình được lấy mẫu hai lần, và không phải một trung bình trộn lẫn. Đây là một tín hiệu tự tin mà bạn có thể kiểm tra, không phải một oracle sự thật.

Tóm tắt

Đồng thuận Multi-LLM đo lường sự đồng thuận giữa nhiều mô hình khác nhau. Nó khác với tính nhất quán tự thân (một mô hình, nhiều mẫu) và sự kết hợp thống kê (trung bình trộn lẫn). Nó bảo tồn các lập luận cá nhân—và đó là một tín hiệu tự tin, không phải là bằng chứng về sự thật.

Định nghĩa Đồng thuận Multi-LLM

Đồng thuận Multi-LLM là mức độ đồng thuận đạt được khi nhiều mô hình ngôn ngữ lớn khác nhau lý luận độc lập về cùng một câu hỏi và đánh giá lập luận của nhau. Từ quan trọng là khác nhau: các mô hình đến từ các kiến trúc và dữ liệu huấn luyện khác nhau, vì vậy khi chúng hội tụ, sự đồng thuận đó phản ánh nhiều hơn một quan điểm của hệ thống—và khi chúng phân kỳ, sự chia rẽ đánh dấu một tuyên bố thực sự tranh chấp.

Không giống như Tính nhất quán tự thân

Một kỹ thuật phổ biến của mô hình đơn là tính nhất quán tự thân: lấy mẫu cùng một mô hình nhiều lần và lấy câu trả lời đa số. Điều đó giảm thiểu biến động ngẫu nhiên, nhưng mỗi mẫu đều thừa hưởng những thiên kiến và điểm mù của cùng một mô hình. Nếu mô hình đó sai một cách tự tin, việc lấy mẫu lại chỉ lặp lại lỗi. Đồng thuận Multi-LLM khác về bản chất—nó dựa vào các mô hình độc lập, vì vậy một điểm mù chung trong một mô hình khó có thể được chia sẻ bởi tất cả.

Không giống như Sự kết hợp thống kê

Sự kết hợp cổ điển trộn lẫn các đầu ra của mô hình thành một dự đoán trung bình duy nhất—hữu ích cho một điểm số, vô dụng cho việc hiểu. Đồng thuận Multi-LLM cố ý làm điều ngược lại: nó bảo tồn các lập luận cá nhân để bạn có thể đọc lý luận của từng mô hình. Không có gì bị làm phẳng thành một con số hộp đen. Đó là điều làm cho sự bất đồng trở nên rõ ràng thay vì biến mất vào một trung bình.

Cách tiếp cậnNhững gì nó kết hợpLý luận có thể nhìn thấy?
Tính nhất quán tự thânMột mô hình, nhiều mẫuChỉ câu trả lời đa số
Sự kết hợp thống kêCác đầu ra trộn lẫn thành một trung bìnhKhông—bị trung bình hóa
Đồng thuận Multi-LLMLập luận của nhiều mô hình khác nhauCó—được bảo tồn và có thể kiểm tra

Nghiên cứu thực sự cho thấy điều gì

Nghiên cứu thường được trích dẫn ở đây là Mixture-of-Agents (arXiv:2406.04692), mà xếp chồng nhiều LLM để các lớp sau tinh chỉnh các phản hồi trước đó. Nó báo cáo sự cải thiện chất lượng—nhưng điều quan trọng là phải chính xác về những gì đã được đo lường.

Đọc kỹ tuyên bố

Các lợi ích của Mixture-of-Agents chủ yếu được thể hiện trên các tiêu chuẩn sở thích như AlpacaEval—các thước đo về mức độ tốt của một phản hồi được đánh giá. Điều đó không phải là đảm bảo về độ chính xác thực tế trên bất kỳ tuyên bố cụ thể nào. Việc kết hợp các mô hình có thể cải thiện chất lượng; nó không chứng nhận sự thật.

Một Tín hiệu Tự tin, Không phải một Oracle Sự thật

Ghép các mảnh lại với nhau và cách diễn đạt trung thực là như thế này: đồng thuận Multi-LLM là một tín hiệu tự tin. Sự đồng thuận cao có nghĩa là nhiều hệ thống độc lập đồng ý, điều này làm giảm—nhưng không loại bỏ—ưu tiên cho việc xác minh của con người. Các mô hình có thể chia sẻ một thiên kiến huấn luyện và sai cùng nhau. Xem đồng thuận như "có thể có rủi ro thấp hơn," và coi những bất đồng là đầu ra có thể hành động nhất của bạn: chúng chỉ ra chính xác nơi mà việc xác minh là quan trọng nhất.

Đồng thuận Multi-LLM với Argumentree.AI

Nhiều Mô hình Khác nhau

Sự đồng thuận giữa các hệ thống khác nhau—không phải một mô hình được lấy mẫu lại

Lập luận được Bảo tồn

Đọc lý luận của từng mô hình; không có gì bị trung bình hóa thành một hộp đen

Đồng thuận như Tín hiệu

Điểm số điều chỉnh sự tự tin—không bao giờ được trình bày như bằng chứng về sự thật

Bất đồng được Nêu rõ

Các điểm tranh chấp được đánh dấu để xác minh của con người

Câu hỏi thường gặp

Đồng thuận multi-LLM là gì?

Đồng thuận multi-LLM là mức độ đồng thuận đạt được khi nhiều mô hình ngôn ngữ lớn khác nhau lý luận độc lập về cùng một tuyên bố và đánh giá lập luận của nhau. Khác với việc lấy mẫu một mô hình nhiều lần, nó dựa vào các hệ thống thực sự khác nhau—vì vậy sự đồng thuận phản ánh sự đồng ý giữa các kiến trúc và dữ liệu huấn luyện khác nhau, và sự bất đồng đánh dấu nơi mà một tuyên bố bị tranh chấp.

Đồng thuận multi-LLM khác gì so với tính nhất quán tự thân?

Tính nhất quán tự thân lấy mẫu cùng một mô hình đơn nhiều lần và lấy câu trả lời đa số. Nó giảm thiểu biến động ngẫu nhiên nhưng chia sẻ thiên kiến và điểm mù của một mô hình. Đồng thuận multi-LLM sử dụng các mô hình khác nhau, vì vậy sự đồng thuận có ý nghĩa hơn và sự bất đồng có thể tiết lộ một điểm mù mà việc lấy mẫu lặp đi lặp lại một mô hình sẽ không bao giờ phơi bày.

Nó khác gì so với sự kết hợp thống kê?

Sự kết hợp thống kê trộn lẫn các đầu ra của mô hình thành một dự đoán trung bình duy nhất, loại bỏ lý luận cá nhân. Đồng thuận multi-LLM bảo tồn các lập luận của từng mô hình để bạn có thể đọc chúng. Không có gì bị trung bình hóa thành một điểm số hộp đen mà bạn không thể kiểm tra—các trường hợp cá nhân vẫn được nhìn thấy, điều này làm cho sự bất đồng trở nên rõ ràng.

Nghiên cứu có chứng minh rằng việc kết hợp các mô hình cải thiện độ chính xác không?

Nghiên cứu như Mixture-of-Agents (arXiv:2406.04692) cho thấy sự cải thiện chất lượng từ việc xếp chồng nhiều LLM, được đo lường chủ yếu trên các tiêu chuẩn sở thích như AlpacaEval. Đó là bằng chứng về chất lượng phản hồi được cải thiện trên các tiêu chuẩn đó—nó không phải là đảm bảo về độ chính xác thực tế trên bất kỳ tuyên bố nào. Xem đồng thuận như một tín hiệu tự tin, không phải là một oracle sự thật.

Sự đồng thuận cao có nghĩa là một câu trả lời là đúng không?

Không. Sự đồng thuận là một tín hiệu tự tin, không phải là bằng chứng. Nhiều mô hình có thể chia sẻ cùng một thiên kiến huấn luyện và đồng ý về một điều sai. Sự đồng thuận cao làm giảm ưu tiên cho việc xác minh của con người; nó không bao giờ loại bỏ nhu cầu đó. Đầu ra có thể hành động nhất thường là sự bất đồng, chỉ ra nơi mà việc xác minh là quan trọng nhất.

Đo lường sự đồng thuận giữa các mô hình thực

Không phải một mô hình được lấy mẫu hai lần. Nhiều mô hình khác nhau, lập luận được bảo tồn, sự bất đồng rõ ràng.

Bắt đầu miễn phí