সবাই AI-হ্যালুসিনেশন মামলা থেকে ভুল পাঠ শিখেছে। শিরোনাম ছিল "AI ভুয়া মামলা আবিষ্কার করে।" প্রকৃত বিপদটি সূক্ষ্ম এবং ধরতে কঠিন: AI সম্পূর্ণ বাস্তব মামলার মধ্যে ভুয়া উদ্ধৃতি আবিষ্কার করা।
সবাই জানে ব্যর্থতা: তৈরি করা মামলা
মাতা বনাম অ্যাভিয়াঙ্কা (২০২৩) মামলায়, আইনজীবীরা একটি ফেডারেল ব্রিফ দাখিল করেন যেখানে কয়েকটি বিচারিক সিদ্ধান্তের উল্লেখ করা হয়েছিল যা আসলে বিদ্যমান ছিল না। উদ্ধৃতিগুলি ChatGPT দ্বারা তৈরি করা হয়েছিল, যা বিশ্বাসযোগ্য দেখানোর জন্য মামলা নাম, রিপোর্টার নম্বর এবং উদ্ধৃতি তৈরি করেছিল। যখন প্রতিপক্ষের আইনজীবী এবং আদালত মামলাগুলি খুঁজে পেতে ব্যর্থ হন, তখন আইনজীবীদের শাস্তি দেওয়া হয়। এটি আইনগত অনুশীলনে জেনারেটিভ এআই-এর একটি আদর্শ সতর্কতামূলক কাহিনী হয়ে ওঠে — এবং এটি পেশাকে একটি উদ্ধৃতি-পরীক্ষা চালানোর শিক্ষা দেয়।
একটি মিথ্যা মামলা ধরা পড়া, সৌভাগ্যবশত, সহজ। আপনি এটি খুঁজে দেখেন; এটি নেই; আপনি এটি মুছে ফেলেন। একটি একক অনুসন্ধান মিথ্যাটি প্রকাশ করে।
যা বেশিরভাগ মানুষ মিস করে: বাস্তব উদ্ধৃতিতে ভুয়া উদ্ধৃতি
এখন একটি আরও কূটতাত্ত্বিক ভ্যারিয়েন্ট বিবেচনা করুন। বিষয়টি বাস্তব। প্রতিবেদকের উদ্ধৃতি সঠিক। আদালত, বছর, পক্ষগুলো — সবই প্রকৃত। কিন্তু যে বাক্যটি AI সেই মতামতের সাথে যুক্ত করে, উদ্ধৃত ধারণাটি যা উদ্ধৃত চিহ্নে দেয়, তা কখনোই সেই আদালত দ্বারা লেখা হয়নি। টুলটি একটি বাস্তব নথির উপর তার উত্তর ভিত্তি করে এবং তারপর এমন ভাষা তৈরি করেছে যা এটি সেখানে পাওয়া বলে দাবি করে।
এটি কেন একটি ভুয়া মামলার চেয়ে খারাপ?
- •উদ্ধৃতিটি বাস্তব, তাই এটি একটি রুটিন সাইট-চেক পাস করে
- •একজন পর্যালোচক নিশ্চিত করেন যে মামলা বিদ্যমান এবং এগিয়ে যান — উদ্ধৃতিটি যাচাই করা হয়নি
- •নির্মিত ভাষাটি প্রায়ই শোনায় যেন কিছু আদালত বলবে
- •এটি একটি ফাইল করা সংক্ষিপ্ত বিবরণ, একটি মতামত, বা একটি ক্লায়েন্ট মেমোতে সম্পূর্ণরূপে টিকে থাকতে পারে।
এটি "গ্রাউন্ডেড" বা রিট্রিভাল-অগমেন্টেড (RAG) আইন-এআই টুলগুলোর ফাঁদ। বাস্তব উৎস নথির উপর একটি মডেলকে গ্রাউন্ড করা সম্পূর্ণভাবে উদ্ভাবিত মামলার সম্ভাবনা কমায় — কিন্তু এটি গ্যারান্টি করে না যে মডেলটি যা উদ্ধার করেছে তা সঠিকভাবে উদ্ধৃত করে। এটি এখনও একটি সিদ্ধান্তকে এমন শব্দে প্যারাফ্রেজ করতে পারে যা আদালত কখনও ব্যবহার করেনি, অথবা একটি উদ্ধৃতিকে একটি প্রস্তাবে সংযুক্ত করতে পারে যা এটি সমর্থন করে না।
এই উদ্ধৃতি-ভিত্তিক উদ্ধৃতি প্যাটার্নটি বাণিজ্যিক, ভিত্তিক গবেষণা সহকারীদের সাথে বাস্তবে প্রকাশিত হয়েছে বলে জানা গেছে। থমসন রয়টার্সের ওয়েস্টল অঙ্গীকারের একটি উদাহরণে — যা যুক্তরাষ্ট্র বনাম ফ্যারিস নামে পরিচিত একটি বিষয়ের সাথে আলোচনা করা হয়েছে — এই টুলটি এমন উদ্ধৃতি তৈরি করেছে যা উদ্ধৃত কর্তৃপক্ষের ভাষার সাথে মেলেনি, যদিও ভিত্তিগত উদ্ধৃতিটি সত্য ছিল। আমরা এটি শুধুমাত্র একটি প্রতিবেদিত উদাহরণ হিসেবে উপস্থাপন করছি: আমরা স্বাধীনভাবে সঠিক মামলা নাম, উদ্ধৃতি, আদালত, বছর, বা সিদ্ধান্ত নিশ্চিত করিনি, এবং পাঠকদের উচিত সেগুলি যাচাই করা আগে তাদের উপর নির্ভর করা। তবে, প্যাটার্নটি ভালভাবে নথিভুক্ত — এবং এটি প্যাটার্ন, কোনও একক কাহিনী নয়, যা আপনাকে AI আউটপুট পর্যালোচনা করার পদ্ধতি পরিবর্তন করা উচিত।
গ্রাউন্ডিং একটি গ্যারান্টি নয় — প্রমাণ
এটি একটি প্রান্তিক উদ্বেগ নয়। একটি ২০২৪ সালের গবেষণা স্ট্যানফোর্ড রেগল্যাব এবং ইনস্টিটিউট ফর হিউম্যান-সেন্টারড এআই (এইচএআই) দ্বারা পরিচালিত হয়েছিল যা শীর্ষস্থানীয় উদ্দেশ্য-নির্মিত আইন-এআই গবেষণা সরঞ্জামগুলি মূল্যায়ন করেছে — যেগুলি স্পষ্টভাবে ভিত্তিক এবং ভ্রমণ-হ্রাসকৃত হিসাবে বাজারজাত করা হয়েছে — এবং দেখা গেছে যে তারা এখনও একটি গুরুত্বপূর্ণ অংশের প্রশ্নে ভ্রমণ করছে।
এই সংখ্যাগুলি সম্পর্কে
স্ট্যানফোর্ড রেগল্যাব / এইএআই (২০২৪) কাজটি প্রধান আইন-এআই গবেষণা টুলগুলির জন্য হ্যালুসিনেশন হার প্রায় ১৭–৩৩% পরিসরে রিপোর্ট করেছে, টুল এবং কাজের উপর নির্ভর করে। আমরা একটি একক শিরোনাম সংখ্যা না দিয়ে পরিসর উল্লেখ করছি কারণ ফলাফল টুল এবং প্রশ্নের ধরনের উপর ভিত্তি করে পরিবর্তিত হয়েছে — সঠিক প্রতি-টুল শতাংশ এবং পদ্ধতির জন্য, মূল পত্রটি পরামর্শ করুন।
গবেষণার মূল কথা হলো "এই সরঞ্জামগুলি খারাপ।" এটি হলো গ্রাউন্ডিং হ্যালুসিনেশন কমায় কিন্তু এটি নির্মূল করে না, এবং অবশিষ্টাংশে ঠিক সেই বিপজ্জনক প্রকার অন্তর্ভুক্ত রয়েছে: আত্মবিশ্বাসী, ভাল-ফরম্যাট করা, উদ্ধৃতি-পরীক্ষা-পাস করা উদ্ধৃতিগুলি যা ভুল।
একটি চলমান, জনসাধারণের রেকর্ড হিসাবে বাস্তব আদালতের মামলাগুলোর জন্য যা AI-হ্যালুসিনেটেড উদ্ধৃতিগুলির সাথে জড়িত, গবেষক ডেমিয়েন চার্লোটিন একটি ব্যাপকভাবে উদ্ধৃত ডেটাবেস রক্ষণাবেক্ষণ করেন যা এই ঘটনাগুলিকে আদালতে পৌঁছানোর সাথে সাথে ট্র্যাক করে। এই ত্রুটিগুলি কতবার — এবং প্রক্রিয়ার কতদূর পর্যন্ত — চলে যায় তা দেখার জন্য এটি একটি চমৎকার সম্পদ। আমরা এটি নির্দেশ করি বরং এটি পুনরাবৃত্তি করি।
কেন একক-মডেল স্ব-যাচনা ব্যর্থ হয়
প্রাকৃতিক সমাধান হল একই টুলকে নিজেকে পরীক্ষা করতে বলা: "আপনি কি নিশ্চিত যে এই উদ্ধৃতিটি সঠিক?" এটি সাধারণত সাহায্য করে না, এবং প্রায়ই পরিস্থিতি আরও খারাপ করে।
- যে মডেলটি উদ্ধৃতিটি তৈরি করেছে তার কাছে মতামতের কোনো সত্যিকার স্মৃতি নেই — এটিকে "যাচাই" করতে বললে এটি কেবল একই প্যাটার্ন-ম্যাচিং পুনরায় চালায় যা ত্রুটিটি উৎপন্ন করেছিল।
- "এটি শব্দশুদ্ধভাবে নিশ্চিত করুন" এর মতো প্রম্পটগুলি প্রায়ই একটি আত্মবিশ্বাসী হ্যাঁ ফেরত দেয় — কখনও কখনও একটি নতুন কল্পিত সমর্থনকারী বিবরণ সহ।
- একটি মডেলের আত্মবিশ্বাসের স্কোর উদ্ধৃতি সঠিকতার সাথে সম্পর্কিত নয়, তাই এটি ঝুঁকিপূর্ণগুলিকে স্বয়ংক্রিয়ভাবে চিহ্নিত করতে পারে না।
কেন ক্রস-মডেল অমিল এটি ধরতে পারে
একটি একক স্থির মডেলের একটি পুনরুদ্ধার এবং একটি উদ্ধৃতির পদ্ধতি রয়েছে। একাধিক স্বাধীন মডেল প্রতিটি তাদের নিজস্বভাবে পুনরুদ্ধার এবং উদ্ধৃতি দেয়। যখন আপনি একাধিক মডেলের কাছে একই প্রশ্ন করেন এবং তাদের মধ্যে একটি উদ্ধৃতি তৈরি করে যা অন্যরা পুনরুত্পাদন করতে পারে না — অথবা যা অন্যরা স্পষ্টভাবে অস্বীকৃত বলে মূল্যায়ন করে — সেই অমিল হল সতর্ক সংকেত।
স্বাধীনতার নীতি, উদ্ধৃতিতে প্রয়োগ করা হয়েছে
যদি একটি মডেল একটি বাস্তব মামলায় "আদালত X বলেছে" তৈরি করে, তবে অন্যান্য মডেলগুলি — তাদের নিজস্ব একই মতামতের পুনরুদ্ধারের ভিত্তিতে — সাধারণত সেই সঠিক তৈরি করা ভাষাটি পুনরুত্পাদন করবে না। একটি উদ্ধৃতি যা শুধুমাত্র একটি মডেল তৈরি করতে পারে, এবং অন্যরা যা খারাপভাবে রেট করে, তা একটি নিম্ন-সম্মত দাবি হিসেবে উঠে আসে। আপনি একটি অদৃশ্য ত্রুটিকে একটি দৃশ্যমান পতাকায় পরিণত করেছেন। এটি একটি উদ্ধৃতির সংকেত দেয় যা প্রাথমিক উৎসের বিরুদ্ধে পরীক্ষা করা উচিত — এটি একটি উচ্চ-আস্থা স্ক্রীন, সঠিকতার প্রমাণ নয়।
এআই-সহায়ক আইনগত গবেষণার জন্য একটি যাচাইকরণ চেকলিস্ট
আপনি কনসেনসাস টুল ব্যবহার করেন কিনা, কখনোই অপ্রমাণিত AI আউটপুট জমা দেবেন না। সর্বনিম্ন:
- মামলা বিদ্যমান কিনা নিশ্চিত করুন — কিন্তু এখানেই থামবেন না; একটি বাস্তব উদ্ধৃতি হল যেখানে বিপজ্জনক ত্রুটিগুলি লুকিয়ে থাকে
- প্রাথমিক উৎসটি টেনে আনুন এবং উদ্ধৃত ভাষাটি প্রেক্ষাপটে পড়ুন — প্রতিটি উদ্ধৃতি শব্দশঃ যাচাই করুন মতামতের বিরুদ্ধে, AI-এর সারাংশের বিরুদ্ধে নয়
- যাচাই করুন যে উদ্ধৃতিটি প্রস্তাবনাকে সমর্থন করে — একটি বাস্তব উদ্ধৃতি এমন একটি দাবির সাথে সংযুক্ত করা যেতে পারে যা এটি আসলে সমর্থন করে না
- স্বতন্ত্র মডেলের সাথে ক্রস-চেক করুন — একটি উদ্ধৃতি যা শুধুমাত্র একটি মডেল উৎপন্ন করে তা তদন্তের জন্য একটি সংকেত, ফাইল করার জন্য একটি সত্য নয়
- কখনো "গ্রাউন্ডেড" কে "ভেরিফাইড" হিসেবে বিবেচনা করবেন না — RAG উদ্ভাবনের সম্ভাবনা কমিয়ে দেয়; এটি আপনার যাচাই করার দায়িত্ব মুছে ফেলে না
স্বতন্ত্র মডেলগুলির মধ্যে সম্মতি আপনার আত্মবিশ্বাস বাড়ায় যে একটি উদ্ধৃতি বাস্তব। এটি প্রমাণ করে না। প্রাথমিক উৎস এখনও কর্তৃত্ব — AI কেবল আপনাকে এটি দ্রুত খুঁজে পেতে সাহায্য করতে এবং মডেলগুলি কোথায় অমিল হয় তা জানাতে সেখানে রয়েছে।
প্রায়শই জিজ্ঞাসিত প্রশ্নসমূহ
বৈধ-এআই ব্যর্থতা কী যা বেশিরভাগ মানুষ মিস করে?
এটি সেই ভুয়া মামলাটি নয় যা সবাই জানে, বরং একটি তৈরি করা উদ্ধৃতি যা একটি বাস্তব উদ্ধৃতির মধ্যে লুকিয়ে আছে — উদ্ধৃতিটি বিদ্যমান এবং একটি উদ্ধৃতি-পরীক্ষা পাস করে, কিন্তু উদ্ধৃত শব্দগুলি কখনও মতামতে ছিল না।
একক-মডেল স্ব-পরীক্ষণ কেন একটি ভুয়া উদ্ধৃতি ধরতে পারে না?
কারণ উদ্ধৃতিটি বাস্তব, স্ব-যাচাইকরণ নিশ্চিত করে যে মামলা বিদ্যমান এবং সেখানেই থেমে যায়; মডেলের কাছে আসলে মতামতটি কী বলেছিল তার কোনো স্বাধীন রেকর্ড নেই।
ক্রস-মডেল তুলনা কেন তৈরি করা উদ্ধৃতিগুলি ধরতে পারে?
স্বতন্ত্র মডেলগুলি বিভিন্ন পুনরুদ্ধারের ভিত্তিতে একই উদ্ধৃতি খুব কমই উদ্ভাবন করে, তাই তাদের অমিল একটি একক মডেল যা নিশ্চিত করবে তার মিথ্যা প্রকাশ করে।