ما هو مزيج الوكلاء؟

مزيج الوكلاء (MoA) هو بنية متعددة الطبقات من نماذج لغوية كبيرة تم تقديمها في الورقة "مزيج الوكلاء يعزز قدرات نماذج اللغة الكبيرة" (arXiv:2406.04692). في MoA، تعمل عدة نماذج كموصين في طبقة واحدة؛ يتم دمج ردودهم وتمريرها إلى نماذج المجمعين في الطبقة التالية، التي تقوم بتوليف إجابة مصقولة. تتكرر الطبقات الإضافية لتكرار التنقيح. توضح الورقة المكاسب في معايير نمط التفضيل مثل AlpacaEval 2.0 وMT-Bench وFLASK - مقاييس جودة الردود كما يحكم عليها مقيم، وليس ضمانًا للدقة الواقعية. كما أن MoA يزيد من تكلفة الرموز ويضيف زمنًا لأن العديد من استدعاءات النماذج تتم عبر الطبقات، ويمكن أن يؤدي التجميع إلى تسوية الخلافات الحقيقية. Argumentree.AI مرتبط ولكنه متميز: بدلاً من التجميع في إجابة مصقولة واحدة، يحتفظ بحجج كل نموذج فردي ويجعل كل نموذج متاح يقيم حجج كل نموذج آخر، مما يظهر التوافق والاختلاف بدلاً من إخفائهما.

العودة إلى الذكاء الاصطناعي الجماعيبنية متعددة النماذج اللغوية

ما هو
مزيج الوكلاء؟

مزيج الوكلاء (MoA) يعامل عدة نماذج لغوية كبيرة كعملاء متعاونين - يقوم الموصون بإنشاء ردود مرشحة، ويقوم المجمعون بتوليفها في إجابة مصقولة واحدة. إنها تقنية حقيقية مع تبادلات حقيقية، وليست مفتاح سحري للدقة.

TL;DR

مزيج الوكلاء يدمج عدة نماذج لغوية كبيرة: نماذج الموصين تضع مسودات للإجابات، ونماذج المجمعين تدمجها. تظهر الورقة arXiv:2406.04692 مكاسب في معايير التفضيل (AlpacaEval، MT-Bench) - جودة الردود، وليس دقة واقعية مثبتة - وتكلف المزيد من الرموز والزمن مقارنة بنموذج واحد.

من أين يأتي MoA

تم تقديم مزيج الوكلاء في الورقة لعام 2024 "مزيج الوكلاء يعزز قدرات نماذج اللغة الكبيرة" (arXiv:2406.04692). الملاحظة الأساسية هي التعاون: تميل النماذج اللغوية الكبيرة إلى إنتاج ردود أفضل عندما يمكنها رؤية وبناء على مخرجات نماذج أخرى - حتى النماذج التي تكون أضعف بشكل فردي. يحول MoA هذه الملاحظة إلى بنية.

البنية الطبقية

يتم تنظيم MoA في طبقات. تحتوي كل طبقة على عدة "عملاء" من النماذج اللغوية الكبيرة. كل نموذج في الطبقة يولد ردًا، وتجمع تلك الردود وتُسلم إلى الطبقة التالية، حيث تعمل نماذجها كمجمعين يقومون بتنقيح وتوليف. تكرار الطبقات يعيد التنقيح.

1

يقوم المقترحون بإنشاء مرشحين

تجيب عدة نماذج على الطلب بشكل مستقل في الطبقة 1.

2

تُجمع الردود

تُجمع جميع مخرجات الطبقة 1 كمواد مرجعية للطبقة التالية.

3

تقوم المجمعات بالتركيب

تقرأ نماذج الطبقة 2 المرشحين وتنتج ردًا مصقولًا ومجمعًا.

4

اختياريًا، كرر حسب الطبقة

تستمر الطبقات الإضافية في التنقيح؛ يقوم مجمع نهائي بإصدار الإجابة.

مثال توضيحي - ليس مخرجات نموذج فعلية

اسأل "هل يجب أن تعيد واجهة برمجة التطبيقات لدينا 200 أو 202 لوظيفة غير متزامنة مقبولة؟" تقوم ثلاثة نماذج موصين كل منها بصياغة إجابة تستشهد بممارسات REST. يقرأ مجمع جميع الثلاثة، ويلاحظ أن اثنين يفضلان 202 مقبولة مع عنوان URL للحالة وواحد يفضل 200، ويقوم بتوليف توصية واحدة تأخذ في الاعتبار أقوى الحجج من كل منها. الإجابة المدمجة تبدو جيدة - ولكن إذا كان الثلاثة يشتركون في نفس المفهوم الخاطئ، فإن المجمع سيعيده بثقة.

ما تظهره المعايير فعليًا

تبلغ الورقة عن نتائج قوية في معايير نمط التفضيل - AlpacaEval 2.0 وMT-Bench وFLASK - حيث يقوم قاضٍ (غالبًا ما يكون نموذجًا لغويًا كبيرًا أو إنسانًا) بتقييم أي رد هو الأكثر فائدة أو أعلى جودة. هذه تمييز مهم للمطورين:

اقرأ الادعاء بصدق

  • • تقيس مكاسب التفضيل/معدل الفوز الجودة المدركة، وليس الحقيقة الموثقة
  • • يمكن أن يكون الرد الأكثر طلاقة وتنظيمًا أفضل خاطئًا من الناحية الواقعية
  • • إذا كان لدى المقترحين نقطة عمياء مشتركة، فإن التجميع يعززها بدلاً من إصلاحها
  • • تضيف كل طبقة مكالمات نموذجية: المزيد من الرموز، تكلفة أعلى، مزيد من الكمون
  • • يمكن أن يؤدي التجميع إلى تسطيح الخلاف الحقيقي إلى ثقة زائفة

MoA مقابل مجلس النماذج اللغوية الكبيرة مقابل توافق متعدد النماذج اللغوية

ثلاثة أنماط متعددة النماذج. كمطور، اختر بناءً على ما تحتاجه للشحن: إجابة مصقولة واحدة، أو تفكير مرئي عبر النماذج.

النمطما يتم تحسينهما تحصل عليه
خليط الوكلاءإجابة مصقولة واحدة مختلطةتجمع المجمعات مخرجات المقترحين؛ تختفي الآراء الفردية في التركيب
مجلس LLMمساهمة شفافة لكل نموذجتظل إجابة كل نموذج مرئية؛ غالبًا ما تقيم النماذج بعضها البعض
توافق متعدد LLMإشارة الاتفاق + disagreementتحدد الأماكن التي تتفق فيها النماذج (الثقة) وتختلف (السؤال المتنازع عليه)

قاعدة عامة: استخدم MoA عندما تريد أفضل إجابة واحدة ويمكنك تحمل تكلفة الرموز/الزمن؛ استخدم مجلسًا أو تقييم توافق عندما يكون الاختلاف نفسه هو المنتج.

أين تتناسب Argumentree.AI

تشترك Argumentree.AI في فرضية MoA - النماذج المتعددة تتفوق على نموذج واحد - لكنها تحتفظ بالمخرجات الفردية مرئية بدلاً من دمجها.

استعلام عن جميع النماذج المتاحة

تجيب كل نموذج بشكل مستقل - لا ينهار المقترح/المجمع في صوت واحد

الحفاظ على كل حجة

تظل الحجج الفردية المؤيدة/المعارضة مرتبطة بالنموذج الذي أنشأها

تقييم الأقران عبر النماذج

يقيم كل نموذج متاح حجج كل نموذج آخر

إظهار التوافق والاختلاف

ترى الاتفاق كالثقة والاختلاف كسؤال حقيقي

أسئلة متكررة

ما هو خليط الوكلاء (MoA)؟

خليط الوكلاء (MoA) هو هيكل طبقي حيث تعمل عدة نماذج لغوية كبيرة كمقترحين في طبقة واحدة، وتُمرر مخرجاتها إلى نماذج المجمعين في الطبقة التالية التي تدمج ردًا مصقولًا. تم تقديمه في الورقة 'خليط الوكلاء يعزز قدرات نماذج اللغة الكبيرة' (arXiv:2406.04692)، حيث يعامل عدة LLMs كعملاء متعاونين بدلاً من الاعتماد على نموذج واحد.

هل يجعل خليط الوكلاء الإجابات أكثر دقة؟

تقرير الورقة الأصلية لـ MoA عن مكاسب في معايير نمط التفضيل مثل AlpacaEval 2.0 وMT-Bench وFLASK، حيث يقوم القاضي بتقييم جودة الرد. هذه مقاييس تفضيل وفائدة، وليست ضمانًا للدقة الواقعية. يمكن أن ينتج MoA إجابة أكثر تلميعًا وتنظيمًا أفضل بينما لا يزال يكرر خطأً واقعيًا مشتركًا، لذا يجب عدم اعتباره ضمانًا للحقيقة.

ما هي عيوب خليط الوكلاء؟

يعمل MoA على تشغيل العديد من النماذج عبر طبقات متعددة، لذا فإنه يضاعف تكلفة الرموز ويضيف الكمون مقارنةً بمكالمة نموذج واحدة. يمكن أن تعمل طبقات المجمع أيضًا على تسوية الخلاف الحقيقي بين المقترحين، مما يخفي الآراء الأقلية التي كانت تستحق المشاهدة. إنها تقنية حقيقية مع تكلفة/تجارة الكمون حقيقية، وليست ترقية مجانية.

كيف يختلف MoA عن مجلس LLM؟

MoA هو هيكل تركيب: تغذي نماذج المقترحين المجمعات التي تدمج كل شيء في إجابة مصقولة واحدة. يحتفظ مجلس LLM بمساهمة كل نموذج مرئية وغالبًا ما يجعل النماذج تقيم أو تصنف بعضها البعض، لذا يمكنك رؤية أين يختلفون. يقوم MoA بتحسين مخرجات مختلطة قوية واحدة؛ بينما يقوم المجلس بتحسين شفافية وجهات النظر الفردية.

هل Argumentree.AI نظام خليط الوكلاء؟

ليس تمامًا. تشارك Argumentree.AI فرضية MoA بأن النماذج المتعددة تتفوق على واحدة، ولكن بدلاً من التجميع في إجابة مصنوعة واحدة، فإنها تحافظ على حجج كل نموذج الفردية وتجعل كل نموذج متاح يقيم حجج كل نموذج آخر. الهدف هو إظهار التوافق والاختلاف بشفافية، بدلاً من إخفاء المخرجات الفردية خلف رد واحد مدمج.

شاهد نماذج متعددة تفكر - دون دمجها

يمزج MoA النماذج في إجابة واحدة. تحتفظ Argumentree.AI بحجج كل نموذج مرئية ومصنفة من قبل الأقران.

ابدأ مجانًا