توافق Multi-LLM هو مستوى الاتفاق الذي يتم الوصول إليه عندما تقوم عدة نماذج لغوية كبيرة مختلفة بالتفكير بشكل مستقل حول نفس الادعاء وتقييم حجج بعضها البعض. إنه متميز عن أخذ عينات من نموذج واحد أو الاتساق الذاتي، الذي يأخذ عينات من نموذج واحد مرارًا وتكرارًا ويشارك تحيزات ذلك النموذج. كما أنه يختلف عن التجميع الإحصائي، الذي يمزج المخرجات في توقع متوسط واحد: يحافظ توافق Multi-LLM على الحجج الفردية حتى يمكن فحصها بدلاً من أن تُدمج في صندوق أسود. تظهر الأبحاث حول Mixture-of-Agents (arXiv:2406.04692) مكاسب الجودة من طبقات متعددة من LLMs، تقاس بشكل كبير على معايير التفضيل مثل AlpacaEval - دليل على تحسين جودة الاستجابة، وليس ضمانًا للدقة الواقعية في أي ادعاء معين. تعتبر Argumentree.AI التوافق إشارة ثقة، وليس عرافة للحقائق؛ غالبًا ما تكون الاختلافات بين النماذج هي المخرجات الأكثر قابلية للتنفيذ.
توافق Multi-LLM هو الاتفاق عبر عدة نماذج مختلفة حقًا - ليس نموذجًا واحدًا تم أخذ عينات منه مرتين، وليس متوسطًا ممزوجًا. إنها إشارة ثقة يمكنك فحصها، وليست عرافة للحقائق.
توافق Multi-LLM يقيس الاتفاق عبر عدة نماذج مختلفة. إنه متميز عن الاتساق الذاتي (نموذج واحد، العديد من العينات) والتجميع الإحصائي (متوسط ممزوج). إنه يحافظ على الحجج الفردية - وهو إشارة ثقة، وليس دليلاً على الحقيقة.
توافق Multi-LLM هو درجة الاتفاق التي يتم الوصول إليها عندما تقوم عدة نماذج لغوية كبيرة مختلفة بالتفكير بشكل مستقل حول نفس السؤال وتقييم حجج بعضها البعض. الكلمة المهمة هي مختلفة: تأتي النماذج من هياكل وبيانات تدريب متميزة، لذا عندما تتقارب، يعكس ذلك الاتفاق أكثر من وجهة نظر نظام واحد - وعندما تتباعد، تشير الانقسامات إلى ادعاء متنازع عليه حقًا.
تقنية شائعة للنموذج الواحد هي الاتساق الذاتي: أخذ عينات من نفس النموذج عدة مرات وأخذ الإجابة الأكثر شيوعًا. يقلل ذلك من التباين العشوائي، لكن كل عينة ترث تحيزات ونقاط عمياء نفس النموذج. إذا كان النموذج خاطئًا بثقة، فإن أخذ عينات منه مرة أخرى يكرر الخطأ فقط. توافق Multi-LLM مختلف من حيث النوع - إنه يعتمد على نماذج مستقلة، لذا من غير المحتمل أن يتم مشاركة نقطة عمياء مشتركة في واحدة من جميعها.
يمزج التجميع الكلاسيكي مخرجات النماذج في توقع متوسط واحد - مفيد لدرجة، عديم الفائدة للفهم. يتعمد توافق Multi-LLM القيام بالعكس: إنه يحافظ على الحجج الفردية حتى تتمكن من قراءة تفكير كل نموذج. لا يتم تسطيح أي شيء إلى رقم صندوق أسود. هذا ما يجعل الاختلاف واضحًا بدلاً من أن يختفي في المتوسط.
| النهج | ما يجمعه | هل التفكير مرئي؟ |
|---|---|---|
| الاتساق الذاتي | نموذج واحد، العديد من العينات | الإجابة الأكثر شيوعًا فقط |
| التجميع الإحصائي | مخرجات ممزوجة في متوسط | لا - تم متوسطتها |
| توافق Multi-LLM | حجج عدة نماذج مختلفة | نعم - محفوظة وقابلة للفحص |
الأبحاث الأكثر استشهادًا هنا هي Mixture-of-Agents (arXiv:2406.04692)، التي تضع طبقات متعددة من LLMs بحيث تقوم الطبقات اللاحقة بتحسين الاستجابات السابقة. إنها تشير إلى مكاسب الجودة - لكن من المهم أن نكون دقيقين بشأن ما تم قياسه.
تم إظهار مكاسب Mixture-of-Agents بشكل كبير على معايير التفضيل مثل AlpacaEval - مقاييس لمدى جودة الحكم على الاستجابة. هذا ليس ضمانًا للدقة الواقعية في أي ادعاء محدد. يمكن أن يحسن دمج النماذج الجودة؛ لكنه لا يضمن الحقيقة.
اجمع الأجزاء معًا والإطار الصادق هو هذا: توافق Multi-LLM هو إشارة ثقة. يعني التوافق العالي أن عدة أنظمة مستقلة تتفق، مما يقلل - لكن لا يلغي - الأولوية للتحقق البشري. يمكن أن تشترك النماذج في تحيز تدريبي وتكون خاطئة معًا. اعتبر التوافق "من المحتمل أن يكون أقل خطرًا"، واعتبر الاختلافات كأكثر مخرجاتك القابلة للتنفيذ: فهي تشير إلى المكان الذي تكون فيه التحقق أكثر أهمية.
توافق عبر أنظمة متميزة - ليس نموذجًا واحدًا تم إعادة أخذ عيناته
اقرأ تفكير كل نموذج؛ لا شيء يتم متوسطته في صندوق أسود
تقوم الدرجات بمعايرة الثقة - لا يتم تقديمها أبدًا كدليل على الحقيقة
النقاط المتنازع عليها يتم الإشارة إليها للتحقق البشري
توافق Multi-LLM هو مستوى الاتفاق الذي يتم الوصول إليه عندما تقوم عدة نماذج لغوية كبيرة مختلفة بالتفكير بشكل مستقل حول نفس الادعاء وتقييم حجج بعضها البعض. على عكس أخذ عينات من نموذج واحد عدة مرات، فإنه يعتمد على أنظمة مختلفة حقًا - لذا فإن التوافق يعكس الاتفاق عبر هياكل وبيانات تدريب متميزة، ويشير الاختلاف إلى حيث يتم التنازع على الادعاء.
الاتساق الذاتي يأخذ عينات من نفس النموذج الواحد عدة مرات ويأخذ الإجابة الأكثر شيوعًا. يقلل ذلك من التباين العشوائي ولكنه يشارك تحيزات ونقاط عمياء نموذج واحد. يستخدم توافق Multi-LLM نماذج مختلفة، لذا فإن الاتفاق يكون أكثر معنى ويمكن أن يكشف الاختلاف عن نقطة عمياء لن يكشف عنها أخذ عينات متكرر من نموذج واحد.
يمزج التجميع الإحصائي مخرجات النماذج في توقع متوسط واحد، متجاهلاً التفكير الفردي. يحافظ توافق Multi-LLM على حجج كل نموذج حتى تتمكن من قراءتها. لا يتم متوسطتها إلى درجة صندوق أسود لا يمكنك فحصها - تبقى الحالات الفردية مرئية، وهو ما يجعل الاختلاف واضحًا.
تظهر الأبحاث مثل Mixture-of-Agents (arXiv:2406.04692) مكاسب الجودة من طبقات متعددة من LLMs، تقاس بشكل كبير على معايير التفضيل مثل AlpacaEval. هذا دليل على تحسين جودة الاستجابة على تلك المعايير - وليس ضمانًا للدقة الواقعية في أي ادعاء معين. اعتبر التوافق إشارة ثقة، وليس عرافة للحقائق.
لا. التوافق هو إشارة ثقة، وليس دليلاً. يمكن أن تشترك عدة نماذج في نفس التحيز التدريبي وتتفق على شيء خاطئ. يقلل التوافق العالي من الأولوية للتحقق البشري؛ لكنه لا يزيل الحاجة إليه. غالبًا ما تكون المخرجات الأكثر قابلية للتنفيذ هي الاختلاف، الذي يشير إلى المكان الذي تكون فيه التحقق أكثر أهمية.
ليس نموذجًا واحدًا تم أخذ عينات منه مرتين. عدة نماذج مختلفة، الحجج محفوظة، الاختلاف مرئي.
ابدأ مجانًا