ليست جميع الحجج متساوية. بعضها مدعوم بأدلة ومنطقي، بينما يعتمد البعض الآخر على البلاغة أو المغالطات المنطقية. تقوم أنظمة تقييم الحجج بتقييم جودة التفكير - وعندما تقوم الذكاء الاصطناعي بالتقييم، توفر الأساليب متعددة النماذج تقييمات أكثر موثوقية.
ما الذي يتم تقييمه؟
تقييمات الحجج تقيم أبعادًا متعددة من جودة التفكير:
أبعاد التقييم
- •الصلاحية المنطقية: هل تتبع النتيجة من المقدمات؟
- •جودة الأدلة: هل الادعاءات مدعومة بأدلة موثوقة؟
- •الأهمية: هل ترتبط المقدمات فعلاً بالاستنتاج؟
- •الشمولية: هل تم تناول الاعتبارات المهمة؟
- •الحيادية: هل الاستدلال خالٍ من التحيز الواضح؟
- •الوضوح: هل تم التعبير عن الحجة بوضوح؟
تقييم نموذج واحد مقابل تقييم نماذج متعددة
تقييم الحجج بواسطة نموذج ذكاء اصطناعي واحد له قيود. قد يكون لدى النموذج تحيزات تجاه أنماط معينة من التفكير، أو يفوت السياق الثقافي، أو يقيم باستمرار أنماط الحجج بشكل مبالغ فيه أو ناقص.
تقييم نموذج واحد
- •وجهة نظر نموذج واحد
- •تحيزات التدريب غير المراقبة
- •متسق ولكنه قد يكون منحرفًا
- •لا توجد طريقة لاكتشاف أخطاء التقييم
تقييم متعدد النماذج
- •متعدد وجهات النظر المتوسطة
- •تميل التحيزات إلى الإلغاء المتبادل
- •الخلاف يكشف عن عدم اليقين
- •تساعد التحقق المتقاطع في اكتشاف الأخطاء
كيف تعمل تقييمات النماذج المتعددة
تشمل العملية ثلاث مراحل:
التقييم المستقل
يقوم كل نموذج ذكاء اصطناعي (GPT-4، كلود، جمني، إلخ) بتقييم الحجة بشكل مستقل عبر جميع الأبعاد. لا يرون تقييمات بعضهم البعض.
تجميع
تُجمع التقييمات باستخدام المتوسط المرجح، مع تعديلات على ميول النماذج المعروفة (بعض النماذج تقيم بشكل أكثر قسوة من غيرها).
تحليل التباين
التباين العالي (النماذج تختلف بشدة) يشير إلى الحاجة لمراجعة بشرية. التباين المنخفض يشير إلى أن التقييم موثوق.
مثال: تقييم حجة سياسية
اعتبر حجة حول سياسة تسعير الكربون:
"تعتبر ضرائب الكربون فعالة لأنها تخلق حوافز اقتصادية لتقليل الانبعاثات. لقد خفضت ضريبة الكربون في كولومبيا البريطانية الانبعاثات بنسبة 5-15% بينما نمت الاقتصاد. لذلك، يجب على السلطات الأخرى تنفيذ سياسات مماثلة."
تقييمات متعددة النماذج
- •الصلاحية المنطقية — 4.2/5: توافق عالٍ — الهيكل سليم
- •جودة الأدلة — 3.8/5: اتفاق معتدل — مثال BC موثق جيدًا
- •الكمال — 2.9/5: تباين عالٍ — النماذج تختلف حول ما إذا كانت الحجج المضادة قد تم تناولها
حالات الاستخدام
- تحقق من البحث: قم بتقييم قوة الحجج في الأوراق قبل الاستشهاد بها.
- التقييم الذاتي: تحقق من حججك الخاصة قبل النشر أو العرض.
- تحليل المناظرة: قارن جودة الحجج من جوانب مختلفة لقضية ما.
- التعليم: علم التفكير النقدي من خلال إظهار كيفية تقييم الحجج.
- دعم القرار: تقييم المقترحات أو التوصيات المتنافسة.
تقييم الحجة لا يخبرك بما يجب أن تصدق - بل يخبرك بمدى قوة بناء المنطق. الحجة ذات التقييم الجيد لموقف تختلف معه تستحق مزيدًا من الاعتبار مقارنةً بحجة ذات تقييم ضعيف لموقف تحبه.
الأسئلة المتكررة
ما الذي يقيمه نظام تصنيف الحجج؟
جودة التفكير — يقيّم المنشور الصلاحية المنطقية، وجودة الأدلة، والملاءمة، والشمولية بدلاً من مجرد ما إذا كانت الحجة تبدو مقنعة.
لماذا تقييم الحجج باستخدام نماذج متعددة بدلاً من نموذج واحد؟
تُجمع التقييمات عبر النماذج وتميل التحيزات في النماذج الفردية إلى الإلغاء؛ تشير الفروق الكبيرة بين النماذج إلى ضرورة المراجعة البشرية.
ماذا يعني ارتفاع الاختلاف في التقييمات؟
إنه يرفع العلم للحاجة إلى مراجعة بشرية - التباين الواسع بين النماذج يشير إلى أن التقييم غير مؤكد ولا ينبغي أخذه على محمل الجد.