Một ensemble LLM kết hợp các đầu ra của nhiều mô hình ngôn ngữ lớn để tạo ra một kết quả mạnh mẽ hơn bất kỳ mô hình đơn lẻ nào. Khái niệm này xuất phát từ việc kết hợp máy học cổ điển, nơi mà việc trung bình hoặc bỏ phiếu giữa các mô hình đa dạng làm giảm phương sai và hủy bỏ các lỗi cá nhân. Khi áp dụng cho các mô hình sinh, việc kết hợp có thể có nghĩa là trộn, bỏ phiếu hoặc định tuyến giữa các phản hồi. Kết hợp thống kê gộp các đầu ra thành một tổng hợp — cải thiện độ mạnh mẽ nhưng loại bỏ lý do cá nhân và bất đồng giữa các mô hình. Argumentree.AI có cách tiếp cận khác: thay vì trung bình các đầu ra, nó bảo tồn các lập luận cá nhân của từng mô hình và yêu cầu mỗi mô hình có sẵn đánh giá các lập luận của các mô hình khác, giữ cho sự bất đồng được nhìn thấy thay vì làm mờ đi. Việc kết hợp bất kỳ loại nào cũng làm tăng chi phí token và độ trễ vì nó chạy nhiều mô hình — đây là một kỹ thuật độ mạnh mẽ thực sự với một chi phí thực sự, không phải là một nâng cấp miễn phí, và tốt nhất nên dành cho những câu hỏi mà việc phát hiện lỗi tự tin của một mô hình đơn lẻ đáng giá hơn việc tính toán thêm.
Một ensemble LLM kết hợp nhiều mô hình ngôn ngữ để các lỗi độc lập của chúng hủy bỏ lẫn nhau. Kết hợp thống kê trộn các đầu ra thành một — Argumentree.AI giữ cho các lập luận của từng mô hình được nhìn thấy và được đánh giá bởi đồng nghiệp.
Một ensemble LLM truy vấn nhiều mô hình và kết hợp chúng để có độ mạnh mẽ. Kết hợp cổ điển trung bình hoặc bỏ phiếu các đầu ra thành một câu trả lời trộn lẫn. Argumentree.AI thay vào đó bảo tồn các lập luận cá nhân của từng mô hình và yêu cầu các mô hình đánh giá lẫn nhau — vì vậy sự bất đồng vẫn được nhìn thấy. Dù bằng cách nào, việc chạy nhiều mô hình tốn kém hơn một mô hình.
Kết hợp là một trong những mẹo độ tin cậy lâu đời nhất trong máy học: thay vì tin tưởng vào một mô hình duy nhất, bạn kết hợp nhiều mô hình. Bởi vì các mô hình đa dạng tạo ra những sai lầm khác nhau, việc trộn các dự đoán của chúng làm giảm phương sai và hủy bỏ các lỗi cá nhân. Rừng ngẫu nhiên và tăng cường gradient là các ensemble; cũng như việc hỏi ba người và lấy câu trả lời đa số.
Một ensemble LLM áp dụng cùng một ý tưởng cho các mô hình ngôn ngữ lớn. Bạn truy vấn nhiều mô hình — lý tưởng là những mô hình được đào tạo trên dữ liệu khác nhau với các kiến trúc khác nhau — và kết hợp những gì chúng sản xuất. Khi các mô hình độc lập hội tụ, sự đồng thuận đó là một tín hiệu tự tin có ý nghĩa. Khi chúng phân kỳ, bạn đã tìm thấy một câu hỏi thực sự không chắc chắn, mà một mô hình đơn lẻ sẽ che giấu bằng sự tự tin giả.
Cách bạn kết hợp các mô hình là nơi các phương pháp khác nhau. Con đường cổ điển là thống kê: trung bình các đầu ra, lấy phiếu đa số, hoặc định tuyến đến một mô hình "tốt nhất". Điều đó gộp mọi thứ thành một kết quả tổng hợp.
Sự kết hợp thống kê pha trộn các đầu ra — trung bình hoặc bỏ phiếu thành một câu trả lời, loại bỏ lý do cá nhân
Nó lý tưởng cho một nhãn hoặc điểm số duy nhất, nhưng nó che giấu mô hình nào đã nói gì và tại sao
Argumentree.AI bảo tồn các lập luận cá nhân của mỗi mô hình thay vì trung bình chúng
Mỗi mô hình có sẵn sau đó đánh giá lập luận của từng mô hình khác (đánh giá đồng nghiệp)
Sự bất đồng vẫn được nhìn thấy — bạn thấy các tuyên bố cạnh tranh và chính xác nơi mà các mô hình phân tách
Hỏi "Kế hoạch di chuyển này có an toàn để chạy trong sản xuất không?" Một ensemble thống kê có thể trung bình các mô hình thành một điểm số "72% an toàn" — gọn gàng, nhưng bạn không biết tại sao. Một cách tiếp cận bảo tồn lập luận cho thấy rằng hầu hết các mô hình đã đánh dấu cùng một khoảng trống quay lại trong khi một mô hình đã nêu một mối quan tâm khóa khác biệt mà các mô hình khác đã bỏ lỡ. Điểm số trộn lẫn đã che giấu hai lập luận thực sự quan trọng.
Dù bạn kết hợp chúng theo cách nào, một ensemble chạy nhiều mô hình, vì vậy nó tốn nhiều token hơn và thêm độ trễ so với một cuộc gọi đơn lẻ. Và nó không tạo ra kiến thức từ hư không:
Argumentree.AI giữ lại lợi ích độ mạnh mẽ của một ensemble mà không làm mờ đi lý do.
Nhiều mô hình trả lời độc lập — sự đa dạng là điểm mấu chốt
Các lập luận pro/con cá nhân vẫn có thể quy cho, không bị gộp thành một giá trị trung bình
Mỗi mô hình có sẵn đánh giá lập luận của từng mô hình khác
Bạn thấy sự đồng thuận như là sự tự tin và sự phân kỳ như là câu hỏi thực sự
Một tập hợp LLM kết hợp các đầu ra của nhiều mô hình ngôn ngữ để tạo ra một kết quả mạnh mẽ hơn bất kỳ mô hình đơn lẻ nào. Ý tưởng này được vay mượn từ việc kết hợp học máy cổ điển — nơi mà việc trung bình hoặc bỏ phiếu giữa các mô hình đa dạng giảm thiểu phương sai và lỗi cá nhân — áp dụng cho các mô hình sinh bằng cách pha trộn, bỏ phiếu hoặc định tuyến giữa các phản hồi của chúng.
Một mô hình đơn cung cấp cho bạn một góc nhìn với một tập hợp các điểm mù. Một tập hợp truy vấn nhiều mô hình — thường được đào tạo trên dữ liệu khác nhau với các kiến trúc khác nhau — vì vậy các lỗi độc lập của chúng phần nào bù trừ cho nhau. Khi các mô hình hội tụ, sự đồng thuận đó là một tín hiệu tự tin; khi chúng phân kỳ, bạn đã làm nổi bật một câu hỏi thực sự không chắc chắn mà một mô hình sẽ che giấu.
Sự kết hợp thống kê cổ điển thực hiện chính xác điều đó — nó trung bình, bỏ phiếu hoặc gộp các đầu ra thành một kết quả pha trộn. Điều đó cải thiện tính mạnh mẽ nhưng loại bỏ lý do cá nhân: bạn nhận được một câu trả lời mượt mà và mất dấu mô hình nào đã nói gì và tại sao. Sự đánh đổi đó là hợp lý cho một nhãn hoặc điểm số đơn lẻ, nhưng hạn chế khi chính sự bất đồng là cái nhìn mà bạn cần.
Thay vì trung bình các đầu ra thành một câu trả lời pha trộn, Argumentree.AI bảo tồn các lập luận cá nhân của mỗi mô hình và sau đó có mỗi mô hình có sẵn đánh giá lập luận của từng mô hình khác. Sự bất đồng vẫn được nhìn thấy thay vì bị làm mượt đi, vì vậy bạn có thể thấy không chỉ một điểm số tổng hợp mà còn các tuyên bố cạnh tranh thực sự và nơi mà các mô hình phân tách.
Tập hợp chạy nhiều mô hình, vì vậy nó tốn nhiều token hơn và thêm độ trễ so với một cuộc gọi đơn — nó không phải là phép thuật và không miễn phí. Nó có lợi cho các câu hỏi có rủi ro cao hơn, nơi mà việc phát hiện lỗi tự tin của một mô hình, hoặc biết một tuyên bố có tranh cãi đến mức nào, có giá trị hơn so với việc tính toán thêm. Đối với các truy vấn thông thường có rủi ro thấp, một mô hình đơn thường là lựa chọn đúng.
Đừng làm mờ đi sự bất đồng. Xem các lập luận của từng mô hình và cách chúng đánh giá lẫn nhau.
Bắt đầu miễn phí