مزيج الوكلاء (MoA) هو بنية متعددة الطبقات من نماذج لغوية كبيرة تم تقديمها في الورقة "مزيج الوكلاء يعزز قدرات نماذج اللغة الكبيرة" (arXiv:2406.04692). في MoA، تعمل عدة نماذج كموصين في طبقة واحدة؛ يتم دمج ردودهم وتمريرها إلى نماذج المجمعين في الطبقة التالية، التي تقوم بتوليف إجابة مصقولة. تتكرر الطبقات الإضافية لتكرار التنقيح. توضح الورقة المكاسب في معايير نمط التفضيل مثل AlpacaEval 2.0 وMT-Bench وFLASK - مقاييس جودة الردود كما يحكم عليها مقيم، وليس ضمانًا للدقة الواقعية. كما أن MoA يزيد من تكلفة الرموز ويضيف زمنًا لأن العديد من استدعاءات النماذج تتم عبر الطبقات، ويمكن أن يؤدي التجميع إلى تسوية الخلافات الحقيقية. Argumentree.AI مرتبط ولكنه متميز: بدلاً من التجميع في إجابة مصقولة واحدة، يحتفظ بحجج كل نموذج فردي ويجعل كل نموذج متاح يقيم حجج كل نموذج آخر، مما يظهر التوافق والاختلاف بدلاً من إخفائهما.
مزيج الوكلاء (MoA) يعامل عدة نماذج لغوية كبيرة كعملاء متعاونين - يقوم الموصون بإنشاء ردود مرشحة، ويقوم المجمعون بتوليفها في إجابة مصقولة واحدة. إنها تقنية حقيقية مع تبادلات حقيقية، وليست مفتاح سحري للدقة.
مزيج الوكلاء يدمج عدة نماذج لغوية كبيرة: نماذج الموصين تضع مسودات للإجابات، ونماذج المجمعين تدمجها. تظهر الورقة arXiv:2406.04692 مكاسب في معايير التفضيل (AlpacaEval، MT-Bench) - جودة الردود، وليس دقة واقعية مثبتة - وتكلف المزيد من الرموز والزمن مقارنة بنموذج واحد.
تم تقديم مزيج الوكلاء في الورقة لعام 2024 "مزيج الوكلاء يعزز قدرات نماذج اللغة الكبيرة" (arXiv:2406.04692). الملاحظة الأساسية هي التعاون: تميل النماذج اللغوية الكبيرة إلى إنتاج ردود أفضل عندما يمكنها رؤية وبناء على مخرجات نماذج أخرى - حتى النماذج التي تكون أضعف بشكل فردي. يحول MoA هذه الملاحظة إلى بنية.
يتم تنظيم MoA في طبقات. تحتوي كل طبقة على عدة "عملاء" من النماذج اللغوية الكبيرة. كل نموذج في الطبقة يولد ردًا، وتجمع تلك الردود وتُسلم إلى الطبقة التالية، حيث تعمل نماذجها كمجمعين يقومون بتنقيح وتوليف. تكرار الطبقات يعيد التنقيح.
تجيب عدة نماذج على الطلب بشكل مستقل في الطبقة 1.
تُجمع جميع مخرجات الطبقة 1 كمواد مرجعية للطبقة التالية.
تقرأ نماذج الطبقة 2 المرشحين وتنتج ردًا مصقولًا ومجمعًا.
تستمر الطبقات الإضافية في التنقيح؛ يقوم مجمع نهائي بإصدار الإجابة.
اسأل "هل يجب أن تعيد واجهة برمجة التطبيقات لدينا 200 أو 202 لوظيفة غير متزامنة مقبولة؟" تقوم ثلاثة نماذج موصين كل منها بصياغة إجابة تستشهد بممارسات REST. يقرأ مجمع جميع الثلاثة، ويلاحظ أن اثنين يفضلان 202 مقبولة مع عنوان URL للحالة وواحد يفضل 200، ويقوم بتوليف توصية واحدة تأخذ في الاعتبار أقوى الحجج من كل منها. الإجابة المدمجة تبدو جيدة - ولكن إذا كان الثلاثة يشتركون في نفس المفهوم الخاطئ، فإن المجمع سيعيده بثقة.
تبلغ الورقة عن نتائج قوية في معايير نمط التفضيل - AlpacaEval 2.0 وMT-Bench وFLASK - حيث يقوم قاضٍ (غالبًا ما يكون نموذجًا لغويًا كبيرًا أو إنسانًا) بتقييم أي رد هو الأكثر فائدة أو أعلى جودة. هذه تمييز مهم للمطورين:
ثلاثة أنماط متعددة النماذج. كمطور، اختر بناءً على ما تحتاجه للشحن: إجابة مصقولة واحدة، أو تفكير مرئي عبر النماذج.
| النمط | ما يتم تحسينه | ما تحصل عليه |
|---|---|---|
| خليط الوكلاء | إجابة مصقولة واحدة مختلطة | تجمع المجمعات مخرجات المقترحين؛ تختفي الآراء الفردية في التركيب |
| مجلس LLM | مساهمة شفافة لكل نموذج | تظل إجابة كل نموذج مرئية؛ غالبًا ما تقيم النماذج بعضها البعض |
| توافق متعدد LLM | إشارة الاتفاق + disagreement | تحدد الأماكن التي تتفق فيها النماذج (الثقة) وتختلف (السؤال المتنازع عليه) |
قاعدة عامة: استخدم MoA عندما تريد أفضل إجابة واحدة ويمكنك تحمل تكلفة الرموز/الزمن؛ استخدم مجلسًا أو تقييم توافق عندما يكون الاختلاف نفسه هو المنتج.
تشترك Argumentree.AI في فرضية MoA - النماذج المتعددة تتفوق على نموذج واحد - لكنها تحتفظ بالمخرجات الفردية مرئية بدلاً من دمجها.
تجيب كل نموذج بشكل مستقل - لا ينهار المقترح/المجمع في صوت واحد
تظل الحجج الفردية المؤيدة/المعارضة مرتبطة بالنموذج الذي أنشأها
يقيم كل نموذج متاح حجج كل نموذج آخر
ترى الاتفاق كالثقة والاختلاف كسؤال حقيقي
خليط الوكلاء (MoA) هو هيكل طبقي حيث تعمل عدة نماذج لغوية كبيرة كمقترحين في طبقة واحدة، وتُمرر مخرجاتها إلى نماذج المجمعين في الطبقة التالية التي تدمج ردًا مصقولًا. تم تقديمه في الورقة 'خليط الوكلاء يعزز قدرات نماذج اللغة الكبيرة' (arXiv:2406.04692)، حيث يعامل عدة LLMs كعملاء متعاونين بدلاً من الاعتماد على نموذج واحد.
تقرير الورقة الأصلية لـ MoA عن مكاسب في معايير نمط التفضيل مثل AlpacaEval 2.0 وMT-Bench وFLASK، حيث يقوم القاضي بتقييم جودة الرد. هذه مقاييس تفضيل وفائدة، وليست ضمانًا للدقة الواقعية. يمكن أن ينتج MoA إجابة أكثر تلميعًا وتنظيمًا أفضل بينما لا يزال يكرر خطأً واقعيًا مشتركًا، لذا يجب عدم اعتباره ضمانًا للحقيقة.
يعمل MoA على تشغيل العديد من النماذج عبر طبقات متعددة، لذا فإنه يضاعف تكلفة الرموز ويضيف الكمون مقارنةً بمكالمة نموذج واحدة. يمكن أن تعمل طبقات المجمع أيضًا على تسوية الخلاف الحقيقي بين المقترحين، مما يخفي الآراء الأقلية التي كانت تستحق المشاهدة. إنها تقنية حقيقية مع تكلفة/تجارة الكمون حقيقية، وليست ترقية مجانية.
MoA هو هيكل تركيب: تغذي نماذج المقترحين المجمعات التي تدمج كل شيء في إجابة مصقولة واحدة. يحتفظ مجلس LLM بمساهمة كل نموذج مرئية وغالبًا ما يجعل النماذج تقيم أو تصنف بعضها البعض، لذا يمكنك رؤية أين يختلفون. يقوم MoA بتحسين مخرجات مختلطة قوية واحدة؛ بينما يقوم المجلس بتحسين شفافية وجهات النظر الفردية.
ليس تمامًا. تشارك Argumentree.AI فرضية MoA بأن النماذج المتعددة تتفوق على واحدة، ولكن بدلاً من التجميع في إجابة مصنوعة واحدة، فإنها تحافظ على حجج كل نموذج الفردية وتجعل كل نموذج متاح يقيم حجج كل نموذج آخر. الهدف هو إظهار التوافق والاختلاف بشفافية، بدلاً من إخفاء المخرجات الفردية خلف رد واحد مدمج.
يمزج MoA النماذج في إجابة واحدة. تحتفظ Argumentree.AI بحجج كل نموذج مرئية ومصنفة من قبل الأقران.
ابدأ مجانًا