ملٹی-ایل ایل ایم متفقہ اس معاہدے کی سطح ہے جو کئی مختلف بڑے زبان ماڈلز جب ایک ہی دعوے کے بارے میں آزادانہ طور پر سوچتے ہیں اور ایک دوسرے کے دلائل کی درجہ بندی کرتے ہیں تو حاصل ہوتی ہے۔ یہ واحد ماڈل کے نمونے لینے یا خود مطابقت سے مختلف ہے، جو ایک ماڈل کو بار بار نمونہ لیتا ہے اور اس ماڈل کی تعصبات کو شیئر کرتا ہے۔ یہ شماریاتی انسمبلنگ سے بھی مختلف ہے، جو آؤٹ پٹس کو ایک اوسط پیش گوئی میں ملا دیتا ہے: ملٹی-ایل ایل ایم متفقہ انفرادی دلائل کو محفوظ رکھتا ہے تاکہ انہیں جانچا جا سکے نہ کہ ایک سیاہ خانہ میں اوسط کیا جا سکے۔ ایجنٹس کے مرکب پر تحقیق (arXiv:2406.04692) کئی ایل ایل ایمز کی تہوں سے معیار میں بہتری دکھاتی ہے، جو بڑی حد تک ترجیحی بینچ مارک جیسے AlpacaEval پر ماپی جاتی ہے—جو جواب کی معیار میں بہتری کا ثبوت ہے، کسی بھی مخصوص دعوے پر حقائق کی درستگی کی ضمانت نہیں۔ Argumentree.AI متفقہ کو اعتماد کے اشارے کے طور پر لیتا ہے، سچائی کے اوریکل کے طور پر نہیں؛ ماڈلز کے درمیان اختلافات اکثر سب سے زیادہ قابل عمل آؤٹ پٹ ہوتے ہیں۔
ملٹی-ایل ایل ایم متفقہ کئی حقیقی مختلف ماڈلز کے درمیان معاہدہ ہے—نہ کہ ایک ماڈل کو دو بار نمونہ لیا گیا، اور نہ ہی ایک ملا ہوا اوسط۔ یہ ایک اعتماد کا اشارہ ہے جسے آپ جانچ سکتے ہیں، سچائی کا اوریکل نہیں۔
ملٹی-ایل ایل ایم متفقہ کئی مختلف ماڈلز کے درمیان معاہدے کی پیمائش کرتا ہے۔ یہ خود مطابقت (ایک ماڈل، کئی نمونے) اور شماریاتی انسمبلنگ (ملا ہوا اوسط) سے مختلف ہے۔ یہ انفرادی دلائل کو محفوظ رکھتا ہے—اور یہ ایک اعتماد کا اشارہ ہے، سچائی کا ثبوت نہیں۔
ملٹی-ایل ایل ایم متفقہ اس معاہدے کی ڈگری ہے جو کئی مختلف بڑے زبان ماڈلز جب ایک ہی سوال کے بارے میں آزادانہ طور پر سوچتے ہیں اور ایک دوسرے کے دلائل کا اندازہ لگاتے ہیں تو حاصل ہوتی ہے۔ جو لفظ اہم ہے وہ ہے مختلف: ماڈلز مختلف آرکیٹیکچرز اور تربیتی ڈیٹا سے آتے ہیں، لہذا جب وہ متفق ہوتے ہیں، تو یہ معاہدہ ایک نظام کے نقطہ نظر سے زیادہ کی عکاسی کرتا ہے—اور جب وہ مختلف ہوتے ہیں، تو تقسیم ایک حقیقی طور پر متنازعہ دعوے کی نشاندہی کرتی ہے۔
ایک عام واحد ماڈل کی تکنیک خود مطابقت ہے: ایک ہی ماڈل کو کئی بار نمونہ لیں اور اکثریتی جواب لیں۔ یہ بے ترتیب تغیر کو کم کرتا ہے، لیکن ہر نمونہ ایک ہی ماڈل کی تعصبات اور اندھی جگہوں کو وراثت میں لیتا ہے۔ اگر ماڈل یقین سے غلط ہے، تو اسے دوبارہ نمونہ لینا صرف غلطی کو دہرائے گا۔ ملٹی-ایل ایل ایم متفقہ نوع میں مختلف ہے—یہ آزاد ماڈلز پر انحصار کرتا ہے، لہذا ایک میں مشترکہ اندھی جگہ کا ہونا تمام میں مشترک ہونے کا امکان نہیں ہے۔
کلاسیکی انسمبلنگ ماڈل کے آؤٹ پٹس کو ایک واحد اوسط پیش گوئی میں ملا دیتا ہے—جو اسکور کے لیے مفید ہے، سمجھنے کے لیے بے کار۔ ملٹی-ایل ایل ایم متفقہ جان بوجھ کر اس کے برعکس کرتا ہے: یہ انفرادی دلائل کو محفوظ رکھتا ہے تاکہ آپ ہر ماڈل کی سوچ کو پڑھ سکیں۔ کچھ بھی سیاہ خانہ نمبر میں نہیں ملایا جاتا۔ یہی چیز اختلاف کو قابل فہم بناتی ہے بجائے اس کے کہ اوسط میں غائب ہو جائے۔
| طریقہ | یہ کیا ملا دیتا ہے | سوچنے کی قابلیت؟ |
|---|---|---|
| خود مطابقت | ایک ماڈل، کئی نمونے | صرف اکثریتی جواب |
| شماریاتی انسمبلنگ | آؤٹ پٹس کو اوسط میں ملا دیا گیا | نہیں—اوسط میں غائب |
| ملٹی-ایل ایل ایم متفقہ | کئی مختلف ماڈلز کے دلائل | جی ہاں—محفوظ اور جانچنے کے قابل |
یہاں سب سے زیادہ حوالہ دی جانے والی تحقیق ایجنٹس کا مرکب (arXiv:2406.04692) ہے، جو کئی ایل ایل ایمز کی تہوں کو اس طرح ترتیب دیتی ہے کہ بعد کی تہیں پہلے کے جوابات کو بہتر بناتی ہیں۔ یہ معیار میں بہتری کی رپورٹ کرتی ہے—لیکن یہ اہم ہے کہ یہ واضح ہو کہ کیا ماپا گیا تھا۔
ایجنٹس کے مرکب کی بہتری بڑی حد تک ترجیحات کے بینچ مارک جیسے AlpacaEval پر دکھائی گئی —جو یہ ماپتے ہیں کہ جواب کیسا ہے۔ یہ نہیں کسی مخصوص دعوے پر حقائق کی درستگی کی ضمانت ہے۔ ماڈلز کو ملا کر معیار کو بہتر بنایا جا سکتا ہے؛ یہ سچائی کی تصدیق نہیں کرتا۔
اجزاء کو اکٹھا کریں اور ایماندارانہ فریم یہ ہے: ملٹی-ایل ایل ایم متفقہ ایک اعتماد کا اشارہ ہے۔ اعلیٰ متفقہ کا مطلب ہے کہ کئی آزاد نظام متفق ہیں، جو انسانی تصدیق کی ترجیح کو کم کرتا ہے—لیکن اسے ختم نہیں کرتا۔ ماڈلز ایک تربیتی تعصب کو شیئر کر سکتے ہیں اور کسی غلط چیز پر متفق ہو سکتے ہیں۔ متفقہ کو "شاید کم خطرہ" کے طور پر سمجھیں، اور اختلافات کو اپنے سب سے زیادہ قابل عمل آؤٹ پٹ کے طور پر سمجھیں: یہ بالکل اس جگہ کی نشاندہی کرتے ہیں جہاں تصدیق سب سے زیادہ اہم ہے۔
مختلف نظاموں کے درمیان متفقہ—نہ کہ ایک ماڈل کو دوبارہ نمونہ لیا گیا
ہر ماڈل کی سوچ کو پڑھیں؛ کچھ بھی سیاہ خانہ میں اوسط نہیں کیا گیا
اسکور اعتماد کو درست کرتے ہیں—کبھی بھی سچائی کے ثبوت کے طور پر پیش نہیں کیا جاتا
متنازعہ نکات انسانی تصدیق کے لیے نشان زد ہیں
ملٹی-ایل ایل ایم متفقہ اس معاہدے کی سطح ہے جو کئی مختلف بڑے زبان ماڈلز جب ایک ہی دعوے کے بارے میں آزادانہ طور پر سوچتے ہیں اور ایک دوسرے کے دلائل کا اندازہ لگاتے ہیں تو حاصل ہوتی ہے۔ ایک ماڈل کو کئی بار نمونہ لینے کے برعکس، یہ حقیقی طور پر مختلف نظاموں پر انحصار کرتا ہے—لہذا متفقہ مختلف آرکیٹیکچرز اور تربیتی ڈیٹا کے درمیان معاہدے کی عکاسی کرتا ہے، اور اختلافات اس جگہ کی نشاندہی کرتے ہیں جہاں دعویٰ متنازعہ ہے۔
خود مطابقت ایک ہی واحد ماڈل کو کئی بار نمونہ لیتی ہے اور اکثریتی جواب لیتی ہے۔ یہ بے ترتیب تغیر کو کم کرتی ہے لیکن ایک ماڈل کی تعصبات اور اندھی جگہوں کو شیئر کرتی ہے۔ ملٹی-ایل ایل ایم متفقہ مختلف ماڈلز کا استعمال کرتا ہے، لہذا معاہدہ زیادہ معنی خیز ہے اور اختلاف ایک اندھی جگہ کو ظاہر کر سکتا ہے جسے ایک ماڈل کے بار بار نمونہ لینے سے کبھی نہیں دکھایا جائے گا۔
شماریاتی انسمبلنگ ماڈل کے آؤٹ پٹس کو ایک واحد اوسط پیش گوئی میں ملا دیتی ہے، انفرادی سوچ کو چھوڑ کر۔ ملٹی-ایل ایل ایم متفقہ ہر ماڈل کے دلائل کو محفوظ رکھتا ہے تاکہ آپ انہیں پڑھ سکیں۔ کچھ بھی سیاہ خانہ اسکور میں اوسط نہیں کیا جاتا جسے آپ جانچ نہیں سکتے—انفرادی کیسز نظر آتے ہیں، جو اختلاف کو قابل فہم بناتا ہے۔
ایجنٹس کے مرکب جیسی تحقیق (arXiv:2406.04692) کئی ایل ایل ایمز کی تہوں سے معیار میں بہتری دکھاتی ہے، جو بڑی حد تک ترجیحی بینچ مارک جیسے AlpacaEval پر ماپی جاتی ہے۔ یہ ان بینچ مارک پر جواب کی معیار میں بہتری کا ثبوت ہے—یہ کسی بھی مخصوص دعوے پر حقائق کی درستگی کی ضمانت نہیں ہے۔ متفقہ کو اعتماد کے اشارے کے طور پر سمجھیں، سچائی کے اوریکل کے طور پر نہیں۔
نہیں۔ متفقہ ایک اعتماد کا اشارہ ہے، سچائی کا ثبوت نہیں۔ کئی ماڈلز ایک ہی تربیتی تعصب کو شیئر کر سکتے ہیں اور کسی غلط چیز پر متفق ہو سکتے ہیں۔ اعلیٰ متفقہ انسانی تصدیق کی ترجیح کو کم کرتا ہے؛ یہ کبھی بھی اس کی ضرورت کو ختم نہیں کرتا۔ سب سے زیادہ قابل عمل آؤٹ پٹ اکثر اختلاف ہوتا ہے، جو اس جگہ کی نشاندہی کرتا ہے جہاں تصدیق سب سے زیادہ اہم ہے۔
نہ کہ ایک ماڈل کو دو بار نمونہ لیا گیا۔ کئی مختلف ماڈلز، دلائل محفوظ، اختلاف نظر آتا ہے۔
مفت شروع کریں