Multi-LLM consensus คือระดับของความเห็นพ้องกันที่เกิดขึ้นเมื่อโมเดลภาษาขนาดใหญ่ที่แตกต่างกันหลายตัวมีเหตุผลเกี่ยวกับข้อเรียกร้องเดียวกันและประเมินข้อโต้แย้งของกันและกัน มันแตกต่างจากการสุ่มตัวอย่างโมเดลเดียวหรือความสอดคล้องในตัวเอง ซึ่งจะสุ่มตัวอย่างโมเดลเดียวซ้ำแล้วซ้ำอีกและแบ่งปันอคติของโมเดลนั้น มันยังแตกต่างจากการรวมสถิติ ซึ่งผสมผสานผลลัพธ์เป็นการคาดการณ์เฉลี่ย: multi-LLM consensus รักษาข้อโต้แย้งแต่ละข้อไว้เพื่อให้สามารถตรวจสอบได้แทนที่จะเฉลี่ยเป็นกล่องดำ การวิจัยเกี่ยวกับ Mixture-of-Agents (arXiv:2406.04692) แสดงให้เห็นถึงการเพิ่มคุณภาพจากการชั้นหลาย LLM ซึ่งวัดได้จากเกณฑ์ความชอบเช่น AlpacaEval—หลักฐานของการปรับปรุงคุณภาพการตอบสนอง ไม่ใช่การรับประกันความถูกต้องตามข้อเท็จจริงในข้อเรียกร้องใด ๆ Argumentree.AI ถือว่าความเห็นพ้องกันเป็นสัญญาณความมั่นใจ ไม่ใช่คำทำนายความจริง; ความไม่เห็นพ้องกันระหว่างโมเดลมักจะเป็นผลลัพธ์ที่สามารถดำเนินการได้มากที่สุด
Multi-LLM consensus คือความเห็นพ้องกันระหว่างโมเดลที่แตกต่างกันอย่างแท้จริง—ไม่ใช่โมเดลเดียวที่สุ่มซ้ำสองครั้ง และไม่ใช่ค่าเฉลี่ยที่ผสมกัน มันเป็นสัญญาณความมั่นใจที่คุณสามารถตรวจสอบได้ ไม่ใช่คำทำนายความจริง
Multi-LLM consensus วัดระดับความเห็นพ้องกันระหว่างโมเดลที่แตกต่างกันหลายตัว มันแตกต่างจากความสอดคล้องในตัวเอง (โมเดลเดียว, หลายตัวอย่าง) และการรวมสถิติ (ค่าเฉลี่ยที่ผสมกัน) มันรักษาข้อโต้แย้งแต่ละข้อไว้—และมันคือ สัญญาณความมั่นใจ ไม่ใช่หลักฐานของความจริง
Multi-LLM consensus คือระดับของความเห็นพ้องกันที่เกิดขึ้นเมื่อโมเดลภาษาขนาดใหญ่ที่แตกต่างกันหลายตัวมีเหตุผลเกี่ยวกับคำถามเดียวกันและประเมินข้อโต้แย้งของกันและกัน คำที่สำคัญคือ แตกต่าง: โมเดลมาจากสถาปัตยกรรมและข้อมูลการฝึกอบรมที่แตกต่างกัน ดังนั้นเมื่อพวกเขามาบรรจบกัน ความเห็นพ้องกันนั้นสะท้อนถึงมุมมองของระบบมากกว่าหนึ่งระบบ—และเมื่อพวกเขาแตกต่างกัน การแยกนั้นทำเครื่องหมายข้อเรียกร้องที่มีการโต้แย้งอย่างแท้จริง
เทคนิคทั่วไปของโมเดลเดียวคือ ความสอดคล้องในตัวเอง: ทำการสุ่มตัวอย่างโมเดลเดียวกันหลายครั้งและนำคำตอบที่มากที่สุดมาใช้ นั่นลดความแปรปรวนแบบสุ่ม แต่ทุกตัวอย่างจะสืบทอดอคติและจุดบอดของโมเดลเดียวกัน หากโมเดลนั้นผิดอย่างมั่นใจ การสุ่มตัวอย่างมันอีกครั้งก็แค่ทำให้เกิดข้อผิดพลาดซ้ำ Multi-LLM consensus แตกต่างในลักษณะ—มันอิงจาก โมเดลที่เป็นอิสระ ดังนั้นจุดบอดที่แชร์ในหนึ่งจึงไม่น่าจะถูกแชร์โดยทั้งหมด
การรวมสถิติ คลาสสิก ผสมผสานผลลัพธ์ของโมเดลเป็นการคาดการณ์เฉลี่ยเดียว—มีประโยชน์สำหรับคะแนน แต่ไม่มีประโยชน์สำหรับการเข้าใจ Multi-LLM consensus ตั้งใจทำในทางตรงกันข้าม: มัน รักษาข้อโต้แย้งแต่ละข้อ ไว้เพื่อให้คุณสามารถอ่านเหตุผลของแต่ละโมเดลได้ ไม่มีอะไรถูกทำให้แบนเป็นหมายเลขกล่องดำ นั่นคือสิ่งที่ทำให้ความไม่เห็นพ้องกันสามารถอ่านได้แทนที่จะหายไปในค่าเฉลี่ย
| วิธีการ | สิ่งที่มันรวมกัน | เหตุผลที่มองเห็นได้? |
|---|---|---|
| ความสอดคล้องในตัวเอง | โมเดลเดียว, หลายตัวอย่าง | คำตอบที่มากที่สุดเท่านั้น |
| การรวมสถิติ | ผลลัพธ์ที่ผสมเป็นค่าเฉลี่ย | ไม่—ถูกเฉลี่ยออกไป |
| Multi-LLM consensus | ข้อโต้แย้งจากโมเดลที่แตกต่างกันหลายตัว | ใช่—รักษาไว้และตรวจสอบได้ |
การวิจัยที่ถูกอ้างถึงบ่อยที่สุดที่นี่คือ Mixture-of-Agents (arXiv:2406.04692) ซึ่งชั้นหลาย LLM ทำให้ชั้นหลังปรับปรุงการตอบสนองก่อนหน้า มันรายงานการเพิ่มคุณภาพ—แต่สิ่งสำคัญคือต้องแม่นยำเกี่ยวกับสิ่งที่ถูกวัด
การเพิ่มขึ้นของ Mixture-of-Agents แสดงให้เห็นส่วนใหญ่ใน เกณฑ์ความชอบ เช่น AlpacaEval —การวัดว่าการตอบสนองนั้นดีเพียงใด นั่นคือ ไม่ การรับประกันความถูกต้องตามข้อเท็จจริงในข้อเรียกร้องเฉพาะใด ๆ การรวมโมเดลสามารถปรับปรุงคุณภาพ; มันไม่ได้รับรองความจริง
รวมชิ้นส่วนเข้าด้วยกันและการจัดกรอบที่ซื่อสัตย์คือ: multi-LLM consensus คือ สัญญาณความมั่นใจ ความเห็นพ้องกันสูงหมายความว่าหลายระบบอิสระเห็นพ้องกัน ซึ่งลด—แต่ไม่กำจัด—ความสำคัญสำหรับการตรวจสอบของมนุษย์ โมเดลสามารถแชร์อคติในการฝึกอบรมและผิดพลาดร่วมกัน ถือว่าความเห็นพ้องกันเป็น "ความเสี่ยงที่ต่ำกว่า" และถือว่าความ ไม่เห็นพ้องกัน เป็นผลลัพธ์ที่สามารถดำเนินการได้มากที่สุด: มันชี้ไปที่จุดที่การตรวจสอบมีความสำคัญที่สุด
ความเห็นพ้องกันระหว่างระบบที่แตกต่างกัน—ไม่ใช่โมเดลเดียวที่สุ่มตัวอย่างใหม่
อ่านเหตุผลของแต่ละโมเดล; ไม่มีอะไรถูกเฉลี่ยเป็นกล่องดำ
คะแนนปรับความมั่นใจ—ไม่เคยนำเสนอเป็นหลักฐานของความจริง
จุดที่มีการโต้แย้งจะถูกทำเครื่องหมายสำหรับการตรวจสอบของมนุษย์
Multi-LLM consensus คือระดับของความเห็นพ้องกันที่เกิดขึ้นเมื่อโมเดลภาษาขนาดใหญ่ที่แตกต่างกันหลายตัวมีเหตุผลเกี่ยวกับข้อเรียกร้องเดียวกันและประเมินข้อโต้แย้งของกันและกัน แตกต่างจากการสุ่มตัวอย่างโมเดลเดียวหลายครั้ง มันอิงจากระบบที่แตกต่างกันอย่างแท้จริง—ดังนั้นความเห็นพ้องกันจึงสะท้อนถึงความเห็นพ้องกันระหว่างสถาปัตยกรรมและข้อมูลการฝึกอบรมที่แตกต่างกัน และความไม่เห็นพ้องกันทำเครื่องหมายจุดที่ข้อเรียกร้องมีการโต้แย้ง
ความสอดคล้องในตัวเองสุ่มตัวอย่างโมเดลเดียวกันหลายครั้งและนำคำตอบที่มากที่สุดมาใช้ มันลดความแปรปรวนแบบสุ่มแต่แชร์อคติและจุดบอดของโมเดลเดียวกัน Multi-LLM consensus ใช้โมเดลที่แตกต่างกัน ดังนั้นความเห็นพ้องกันจึงมีความหมายมากขึ้นและความไม่เห็นพ้องกันสามารถเปิดเผยจุดบอดที่การสุ่มตัวอย่างซ้ำของโมเดลเดียวจะไม่เปิดเผย
การรวมสถิติผสมผสานผลลัพธ์ของโมเดลเป็นการคาดการณ์เฉลี่ยเดียว โดยทิ้งเหตุผลแต่ละข้อ Multi-LLM consensus รักษาข้อโต้แย้งของแต่ละโมเดลไว้เพื่อให้คุณสามารถอ่านได้ ไม่มีอะไรถูกเฉลี่ยเป็นคะแนนกล่องดำที่คุณไม่สามารถตรวจสอบได้—กรณีแต่ละกรณียังคงมองเห็นได้ ซึ่งเป็นสิ่งที่ทำให้ความไม่เห็นพ้องกันสามารถอ่านได้
การวิจัยเช่น Mixture-of-Agents (arXiv:2406.04692) แสดงให้เห็นถึงการเพิ่มคุณภาพจากการชั้นหลาย LLM ซึ่งวัดได้จากเกณฑ์ความชอบเช่น AlpacaEval นั่นคือหลักฐานของการปรับปรุงคุณภาพการตอบสนองในเกณฑ์เหล่านั้น—มันไม่ใช่การรับประกันความถูกต้องตามข้อเท็จจริงในข้อเรียกร้องใด ๆ ถือว่าความเห็นพ้องกันเป็นสัญญาณความมั่นใจ ไม่ใช่คำทำนายความจริง
ไม่ ความเห็นพ้องกันเป็นสัญญาณความมั่นใจ ไม่ใช่หลักฐาน โมเดลหลายตัวสามารถแชร์อคติในการฝึกอบรมเดียวกันและเห็นพ้องกันในสิ่งที่ผิด ความเห็นพ้องกันสูงลดความสำคัญสำหรับการตรวจสอบของมนุษย์; มันไม่เคยลบความจำเป็นสำหรับมัน ผลลัพธ์ที่สามารถดำเนินการได้มากที่สุดมักจะเป็นความไม่เห็นพ้องกัน ซึ่งชี้ไปที่จุดที่การตรวจสอบมีความสำคัญที่สุด
ไม่ใช่โมเดลเดียวที่สุ่มซ้ำสองครั้ง โมเดลที่แตกต่างกันหลายตัว รักษาข้อโต้แย้งไว้ ความไม่เห็นพ้องกันมองเห็นได้
เริ่มต้นฟรี