എല്ലാവരും AI-ഹലൂസിനേഷൻ നിയമവാദങ്ങളിൽ നിന്ന് തെറ്റായ പാഠം പഠിച്ചു. തലക്കെട്ട് "AI വ്യാജ കേസുകൾ കണ്ടുപിടിക്കുന്നു" എന്നായിരുന്നു. യഥാർത്ഥ അപകടം കൂടുതൽ സൂക്ഷ്മവും പിടികൂടാൻ ബുദ്ധിമുട്ടും ആണ്: AI യഥാർത്ഥമായ കേസുകളിൽ വ്യാജ ഉദ്ധരണികൾ കണ്ടുപിടിക്കുന്നത്.
എല്ലാവർക്കും അറിയാവുന്ന പരാജയം: നിർമ്മിത കേസുകൾ
മാതാ v. അവിയൻക്ക (2023) എന്ന കേസിൽ, അഭിഭാഷകർ നിരവധി ന്യായമൂല്യനിർണയങ്ങൾ ഉണ്ട് എന്ന് പറഞ്ഞ് ഒരു ഫെഡറൽ ബ്രീഫ് സമർപ്പിച്ചു. ഈ ഉദ്ധരണികൾ ChatGPT ഉപയോഗിച്ച് സൃഷ്ടിക്കപ്പെട്ടതായിരുന്നു, ഇത് യാഥാർത്ഥ്യത്തിൽ ഇല്ലാത്ത കേസുകളുടെ പേരുകൾ, റിപ്പോർട്ടർ നമ്പറുകൾ, ഉദ്ധരണികൾ എന്നിവ സൃഷ്ടിച്ചു. എതിര്പ്പുകാരനും കോടതിയും കേസുകൾ കണ്ടെത്താൻ കഴിയാത്തപ്പോൾ, അഭിഭാഷകർ ശിക്ഷിക്കപ്പെട്ടു. ഇത് നിയമ പ്രായോഗികതയിൽ സൃഷ്ടിപരമായ AI-യുടെ canonical മുന്നറിയിപ്പായ കഥയായി മാറി — ഇത് പ്രൊഫഷനെ ഒരു cite-check നടത്താൻ പഠിപ്പിച്ചു.
ഒരു നിർമ്മിത കേസ് പിടികൂടുന്നത്, ഭാഗ്യവശാൽ, എളുപ്പമാണ്. നിങ്ങൾ അത് പരിശോധിക്കുന്നു; അത് അവിടെ ഇല്ല; നിങ്ങൾ അത് ഇല്ലാതാക്കുന്നു. ഒരു ഏകദേശം പരിശോധിക്കൽ കള്ളം വെളിപ്പെടുത്തുന്നു.
അധികാരത്തിലുള്ള ഉദ്ധരണികളിൽ കൃത്രിമമായ ഉദ്ധരണികൾ: പലർക്കും കാണാനില്ലാത്ത പരാജയം
ഇപ്പോൾ കൂടുതൽ ദുഷ്ടമായ ഒരു വകഭേദത്തെ പരിഗണിക്കൂ. കേസ് യാഥാർത്ഥികമാണ്. റിപ്പോർട്ടർ ഉദ്ധരണി ശുദ്ധമാണ്. കോടതി, വർഷം, പാർട്ടികൾ — എല്ലാം യഥാർത്ഥമാണ്. എന്നാൽ AI ആ അഭിപ്രായത്തിന് നൽകുന്ന വാക്യം, അത് ഉദ്ധരിക്കുന്ന വിധം, ആ കോടതിയിൽ എഴുതപ്പെട്ടിട്ടില്ല. ഈ ഉപകരണം യാഥാർത്ഥികമായ ഒരു രേഖയിൽ അതിന്റെ ഉത്തരം അടിസ്ഥാനമാക്കി, അവിടെ കണ്ടെത്തിയതായി അവകാശപ്പെടുന്ന ഭാഷ നിർമ്മിച്ചു.
ഇത് ഒരു വ്യാജ കേസിനേക്കാൾ എങ്ങനെ മോശമാണ്?
- •ഉദ്ധരണി യാഥാർത്ഥ്യമാണെന്ന്, അതിനാൽ ഇത് ഒരു സാധാരണ ഉദ്ധരണി പരിശോധനയിൽ കടന്നുപോകുന്നു
- •ഒരു അവലോകനകാരൻ കേസ് നിലവിലുണ്ടെന്ന് സ്ഥിരീകരിക്കുന്നു, പിന്നെ മുന്നോട്ട് പോകുന്നു — ഉദ്ധരണി സ്ഥിരീകരിക്കപ്പെടുന്നില്ല
- •നിർമ്മിതമായ ഭാഷ സാധാരണയായി ശ്രവണം ചെയ്യുന്നത് കോടതിയിൽ പറയുന്നതുപോലെയാണ്
- •ഇത് ഒരു ഫീൽഡ് ബ്രിഫ്, ഒരു അഭിപ്രായം, അല്ലെങ്കിൽ ഒരു ക്ലയന്റ് മെമോയിൽ മുഴുവൻ നിലനിൽക്കാൻ കഴിയും.
ഇത് "ഗ്രൗണ്ടഡ്" അല്ലെങ്കിൽ റിട്രീവൽ-ഓഗ്മെന്റഡ് (RAG) നിയമ-എഐ ഉപകരണങ്ങളുടെ കുടുക്കാണ്. യാഥാർത്ഥ്യ സ്രോതസ്സ് രേഖകളിൽ ഒരു മോഡൽ ഗ്രൗണ്ട് ചെയ്യുന്നത് മുഴുവൻ കണ്ടുപിടിച്ച കേസുകളുടെ സാധ്യത കുറയ്ക്കുന്നു — എന്നാൽ ഇത് ശരിയല്ല മോഡൽ അത് റിട്രീവ് ചെയ്തതിനെക്കുറിച്ച് കൃത്യമായി ഉദ്ധരിക്കുമെന്ന് ഉറപ്പുനൽകുന്നില്ല. ഇത് കോടതി ഒരിക്കലും ഉപയോഗിച്ച വാക്കുകളിൽ ഒരു ഹോൾഡിംഗ് പാരാഫ്രേസ് ചെയ്യാൻ കഴിയും, അല്ലെങ്കിൽ ഒരു പാസേജിൽ നിന്നുള്ള ഉദ്ധരണി ഒരു പ്രസ്ഥാവനയിലേക്ക് ചേർക്കാൻ കഴിയും, അത് പിന്തുണയ്ക്കുന്നില്ല.
ഈ ഉദ്ധരണികൾ-വാസ്തവ-ഉദ്ധരണികൾ മാതൃക വ്യാപാര, അടിസ്ഥാനപരമായ ഗവേഷണ സഹായികളുമായി പ്രായോഗികമായി ഉയർന്നതായി റിപ്പോർട്ട് ചെയ്യപ്പെടുന്നു. U.S. v. Farris എന്ന വിഷയവുമായി ബന്ധപ്പെട്ട് ചർച്ച ചെയ്ത ഒരു റിപ്പോർട്ടുചെയ്ത ഉദാഹരണത്തിൽ, തോമ്സൺ റോയിറ്റേഴ്സിന്റെ വെസ്റ്റ്ലോ കോകൗൺസൽ ഉപയോഗിച്ചാണ്, ഈ ഉപകരണം ഉദ്ധരിച്ച അധികാരത്തിന്റെ ഭാഷയുമായി പൊരുത്തപ്പെടാത്ത ഉദ്ധരണികൾ ഉത്പാദിപ്പിച്ചതായി പറയുന്നു, അടിസ്ഥാന ഉദ്ധരണി യഥാർത്ഥമായിരുന്നിട്ടും. ഇത് റിപ്പോർട്ടുചെയ്ത ഉദാഹരണമായി മാത്രമാണ് ഞങ്ങൾ അവതരിപ്പിക്കുന്നത്: കൃത്യമായ കേസ് നാമം, ഉദ്ധരണി, കോടതി, വർഷം, അല്ലെങ്കിൽ ഹോൾഡിംഗ് സ്വതന്ത്രമായി സ്ഥിരീകരിച്ചിട്ടില്ല, വായകർ അവയെ ആശ്രയിക്കുന്നതിന് മുമ്പ് ആ വിവരങ്ങൾ സ്ഥിരീകരിക്കണം. എന്നിരുന്നാലും, മാതൃക നന്നായി രേഖപ്പെടുത്തിയിട്ടുണ്ട് — ഇത് ഒരു ഏകാന്ത അനുഭവം അല്ല, മറിച്ച് നിങ്ങൾ എങ്ങനെ AI ഔട്ട്പുട്ട് അവലോകനം ചെയ്യണമെന്ന് മാറ്റേണ്ടത് ഈ മാതൃകയാണ്.
ഗ്രൗണ്ടിംഗ് ഒരു ഉറപ്പ് അല്ല — തെളിവുകൾ
ഇത് ഒരു പരിതല പ്രശ്നം അല്ല. സ്റ്റാൻഫോർഡ് റെഗ്ലാബും മനുഷ്യകേന്ദ്രിത എഐ (HAI) ഇൻസ്റ്റിറ്റ്യൂട്ടും നടത്തിയ 2024-ലെ ഒരു പഠനം നയിക്കുന്ന ലക്ഷ്യത്തിനായി നിർമ്മിച്ച നിയമ-എഐ ഗവേഷണ ഉപകരണങ്ങളെ വിലയിരുത്തി — വ്യക്തമായി അടിസ്ഥാനമാക്കിയുള്ളതും ഹാലൂസിനേഷൻ കുറയ്ക്കുന്നതുമായ — അവയിൽ ഇപ്പോഴും ഒരു പ്രാധാന്യമുള്ള ക്വറിയുടെ ഭാഗത്ത് ഹാലൂസിനേറ്റ് ചെയ്യുന്നതായി കണ്ടെത്തി.
ഈ അക്കങ്ങൾക്കുറിച്ച്
സ്റ്റാൻഫോർഡ് റെഗ്ലാബ് / എച്ച്ഏഐ (2024) പ്രവർത്തനം മുൻനിര നിയമ-എഐ ഗവേഷണ ഉപകരണങ്ങൾക്കായുള്ള ഹലൂസിനേഷൻ നിരക്കുകൾ ഏകദേശം 17–33% പരിധിയിൽ റിപ്പോർട്ട് ചെയ്തു, ഉപകരണം കൂടാതെ പ്രവർത്തനത്തിനനുസരിച്ച്. ഉപകരണം കൂടാതെ ചോദ്യം തരം അനുസരിച്ച് ഫലങ്ങൾ വ്യത്യാസപ്പെട്ടതിനാൽ, ഒരു ഏകദേശം തലക്കെട്ട് നമ്പർ നൽകുന്നതിന് പകരം പരിധി ഞങ്ങൾ ഉദ്ധരിക്കുന്നു — കൃത്യമായ ഉപകരണം അനുസരിച്ചുള്ള ശതമാനങ്ങൾക്കും രീതി ശാസ്ത്രത്തിനും പ്രാഥമിക പേപ്പർ പരിശോധിക്കുക.
എടുക്കേണ്ടത് "ഈ ഉപകരണങ്ങൾ മോശമാണ്" എന്നതല്ല. ഗ്രൗണ്ടിംഗ് ഹലൂസിനേഷൻ കുറയ്ക്കുന്നു, എന്നാൽ അത് ഇല്ലാതാക്കുന്നില്ല, കൂടാതെ അവശിഷ്ടത്തിൽ കൃത്യമായ അപകടകരമായ തരങ്ങൾ ഉൾപ്പെടുന്നു: ആത്മവിശ്വാസമുള്ള, നന്നായി ഫോർമാറ്റ് ചെയ്ത, ഉദ്ധരണി പരിശോധിക്കുന്നതിൽ പാസ്സായ, എന്നാൽ തെറ്റായ ഉദ്ധരണികൾ.
AI-ഹലൂസിനേറ്റഡ് ഉദ്ധരണികളെ ഉൾക്കൊള്ളുന്ന യഥാർത്ഥ കോടതിക്കേസുകളുടെ ഓടുന്ന, പൊതു രേഖയ്ക്കായി, ഗവേഷകൻ ഡാമിയൻ ചാർലോട്ടിൻ വ്യാപകമായി ഉദ്ധരിക്കപ്പെടുന്ന ഡാറ്റാബേസ് ഈ സംഭവങ്ങൾ കോടതികളിൽ എത്തുമ്പോൾ ട്രാക്ക് ചെയ്യുന്നു. ഈ പിശകുകൾ എത്ര തവണ — എങ്ങനെ പ്രക്രിയയിൽ ആഴത്തിൽ — സഞ്ചരിക്കുന്നു എന്ന് കാണുന്നതിനുള്ള മികച്ച ഉറവിടമാണ് ഇത്. ഇത് പുനരാവിഷ്കരിക്കുന്നതിന് പകരം, ഞങ്ങൾ ഇതിലേക്ക് സൂചിപ്പിക്കുന്നു.
എന്തുകൊണ്ട് ഏക-മോഡൽ സ്വയം-പരിശോധന പരാജയപ്പെടുന്നു
സ്വാഭാവിക പരിഹാരം അതേ ഉപകരണം തന്നെ അതിന്റെ ശരിതന്നെയാണോ എന്ന് പരിശോധിക്കാൻ ചോദിക്കുക: "നിങ്ങൾക്ക് ഉറപ്പാണോ ആ ഉദ്ധരണി ശരിയാണെന്ന്?" ഇത് അപൂർവമായി സഹായിക്കുന്നു, കൂടാതെ പലപ്പോഴും കാര്യങ്ങൾ കൂടുതൽ മോശമാക്കുന്നു.
- ഉദ്ധരണി നിർമ്മിച്ച മോഡലിന് അഭിപ്രായത്തിന്റെ യാഥാർത്ഥ്യസ്മൃതി ഇല്ല — അതിനെ "സ്ഥിരീകരിക്കാൻ" ആവശ്യപ്പെടുന്നത് തെറ്റുണ്ടാക്കിയ സമാനമായ പാറ്റേൺ-മാച്ചിംഗ് വീണ്ടും നടത്തുന്നതാണ്.
- "ഇത് വാക്കുവാക്കായി സ്ഥിരീകരിക്കുക" പോലുള്ള പ്രേരണകൾ പലപ്പോഴും ആത്മവിശ്വാസത്തോടെ അതെ എന്ന മറുപടി നൽകുന്നു — ചിലപ്പോൾ പുതിയതായി സൃഷ്ടിച്ച പിന്തുണയുള്ള വിശദാംശങ്ങളോടുകൂടി.
- ഒരു മോഡലിന്റെ ആത്മവിശ്വാസ സ്കോർ ഉദ്ധരണി കൃത്യതയുമായി ബന്ധപ്പെടുന്നില്ല, അതിനാൽ അത് അപകടകരമായവയെ സ്വയം അടയാളപ്പെടുത്താൻ കഴിയില്ല.
എന്തുകൊണ്ട് ക്രോസ്-മോഡൽ അസമ്മതം അത് പിടിക്കുന്നു
ഒരു ഏകാന്തമായ ഗ്രൗണ്ടഡ് മോഡലിന് ഒരു റിട്രീവൽ ഉണ്ട്, കൂടാതെ അതിനെ ഉദ്ധരിക്കാനുള്ള ഒരു മാർഗം ഉണ്ട്. നിരവധി സ്വതന്ത്ര മോഡലുകൾ ഓരോന്നും സ്വതന്ത്രമായി റിട്രീവ് ചെയ്യുകയും ഉദ്ധരിക്കുകയും ചെയ്യുന്നു. നിങ്ങൾ ഒരേ ചോദ്യം നിരവധി മോഡലുകൾക്ക് ചോദിക്കുമ്പോൾ, അവയിൽ ഒരാൾ ഉദ്ധരണി നൽകുമ്പോൾ, മറ്റുള്ളവ അത് പുനരുത്പാദിപ്പിക്കാൻ കഴിയാത്തതായോ — അല്ലെങ്കിൽ മറ്റുള്ളവ വ്യക്തമായി പിന്തുണയില്ല എന്ന് റേറ്റ് ചെയ്യുന്നതായോ — ആ വിവാദം അലാറം ബെല്ലാണ്.
സ്വാതന്ത്ര്യ സിദ്ധാന്തം, ഉദ്ധരണികളിൽ പ്രയോഗിച്ചപ്പോൾ
ഒരു മോഡൽ യാഥാർത്ഥ്യമായ ഒരു കേസിൽ "അദാലത്ത് X നിശ്ചയിച്ചു" എന്നത് നിർമ്മിച്ചാൽ, മറ്റുള്ള മോഡലുകൾ — അവരുടെ സ്വന്തം അഭിപ്രായത്തിന്റെ സമാനമായ വീണ്ടെടുക്കലിൽ അടിസ്ഥാനമാക്കിയുള്ള — സാധാരണയായി ആ കൃത്യമായ നിർമ്മിത ഭാഷ പുനരാവിഷ്കരിക്കില്ല. ഒരു മോഡൽ മാത്രം ഉത്പാദിപ്പിക്കാൻ കഴിയുന്ന ഒരു ഉദ്ധരണി, മറ്റുള്ളവകൾ ദുർബലമായി വിലയിരുത്തുന്ന, കുറഞ്ഞ സമ്മതം ഉള്ള അവകാശമായി ഉയരുന്നു. നിങ്ങൾ ഒരു ദൃശ്യരഹിത പിശക് ദൃശ്യമായ ഒരു പതാകയാക്കി മാറ്റിയിരിക്കുന്നു. ഇത് പ്രാഥമിക ഉറവിടത്തോട് പരിശോധിക്കാൻ വിലമതിക്കാവുന്ന ഒരു ഉദ്ധരണിയെ സൂചിപ്പിക്കുന്നു — ഇത് ഉയർന്ന ആത്മവിശ്വാസമുള്ള ഒരു സ്ക്രീനാണ്, കൃത്യതയുടെ തെളിവല്ല.
AI-സഹായിത നിയമ ഗവേഷണത്തിന് ഒരു സ്ഥിരീകരണ ചെക്ക്ലിസ്റ്റ്
സമ്മത ഉപകരണം ഉപയോഗിക്കുന്നുണ്ടോ എന്നതിനെക്കുറിച്ച് ആലോചിക്കാതെ, ഒരിക്കലും സ്ഥിരീകരിക്കാത്ത AI ഔട്ട്പുട്ട് ഫയൽ ചെയ്യരുത്. കുറഞ്ഞത്:
- കേസ് നിലവിലുണ്ടെന്ന് സ്ഥിരീകരിക്കുക — എന്നാൽ അവിടെ നിർത്തരുത്; അപകടകരമായ പിശകുകൾ മറഞ്ഞിരിക്കുന്ന യഥാർത്ഥ ഉദ്ധരണി അവിടെ ആണ്
- പ്രാഥമിക ഉറവിടം എടുക്കുകയും ഉദ്ധരിച്ച ഭാഷയെ സാഹചര്യത്തിൽ വായിക്കുകയും ചെയ്യുക — ഓരോ ഉദ്ധരണിയും അതിന്റെ അഭിപ്രായത്തോട് നേരിട്ട്, എഐയുടെ സംഗ്രഹത്തോട് അല്ല, വാക്കുവാക്കായി സ്ഥിരീകരിക്കുക
- ഉദ്ധരണി പ്രസ്ഥാവനയെ പിന്തുണയ്ക്കുന്നുവെന്ന് പരിശോധിക്കുക — യാഥാർത്ഥ്യമായ ഉദ്ധരണി, അത് യാഥാർത്ഥത്തിൽ പിന്തുണയ്ക്കുന്ന ഒരു അവകാശവാദത്തിന് ബന്ധിപ്പിക്കപ്പെടാം
- സ്വതന്ത്ര മാതൃകകളുമായി ക്രോസ്-ചെക്ക് ചെയ്യുക — ഒരു മാതൃക മാത്രം ഉൽപ്പാദിപ്പിക്കുന്ന ഉദ്ധരണി അന്വേഷിക്കാനുള്ള ഒരു ചിഹ്നമാണ്, ഫയലിൽ ഇടേണ്ട ഒരു വസ്തുത അല്ല
- എപ്പോഴും "ഗ്രൗണ്ടഡ്" എന്നത് "വെരിഫൈഡ്" എന്നതുപോലെ പരിഗണിക്കരുത് — RAG കണ്ടുപിടുത്തത്തിന്റെ സാധ്യത കുറയ്ക്കുന്നു; ഇത് നിങ്ങളുടെ പരിശോധിക്കാനുള്ള കടമ നീക്കം ചെയ്യുന്നില്ല
സ്വതന്ത്ര മാതൃകകളുടെ തമ്മിലുള്ള ഏകമതം ഒരു ഉദ്ധരണി യാഥാർത്ഥ്യമാണെന്ന് നിങ്ങളുടെ ആത്മവിശ്വാസം ഉയർത്തുന്നു. ഇത് അതിനെ തെളിയിക്കുന്നില്ല. പ്രാഥമിക ഉറവിടം ഇപ്പോഴും അധികാരമാണ് — എഐ അതിനെ വേഗത്തിൽ കണ്ടെത്താൻ നിങ്ങളെ സഹായിക്കാൻ മാത്രമാണ് ഉണ്ടാകുന്നത്, കൂടാതെ മാതൃകകൾ എവിടെ വ്യത്യാസപ്പെടുന്നുവെന്ന് നിങ്ങളെ അറിയിക്കാൻ.
അവശ്യമായ ചോദ്യങ്ങൾ
ഏത് നിയമ-എഐ പരാജയം കൂടുതലായും ആളുകൾ കാണുന്നില്ല?
എല്ലാവർക്കും അറിയാവുന്ന വ്യാജ കേസല്ല, എന്നാൽ ഒരു യഥാർത്ഥ ഉദ്ധരണിയിൽ ഒളിച്ചിരിക്കുന്ന ഒരു നിർമ്മിത ഉദ്ധരണിയാണ് — ഉദ്ധരണി നിലവിലുണ്ട്, അത് cite-check കടന്നുപോകുന്നു, എന്നാൽ ഉദ്ധരിച്ച വാക്കുകൾ അഭിപ്രായത്തിൽ ഒരിക്കലും ഉണ്ടായിരുന്നില്ല.
എന്തുകൊണ്ട് ഏക-മോഡൽ സ്വയം-പരിശോധന ഒരു വ്യാജ ഉദ്ധരണി പിടികൂടുന്നില്ല?
കാരണം ഉദ്ധരണി യാഥാർത്ഥ്യമാണെന്ന് സ്വയം സ്ഥിരീകരണം കേസ് നിലവിലുണ്ടെന്ന് സ്ഥിരീകരിക്കുന്നു, അവിടെ തന്നെ നിർത്തുന്നു; മോഡലിന് അഭിപ്രായം യഥാർത്ഥത്തിൽ എന്ത് പറഞ്ഞുവെന്ന് സ്വതന്ത്രമായ രേഖ ഇല്ല.
ക്രോസ്-മോഡൽ താരതമ്യം എങ്ങനെ നിർമ്മിത ഉദ്ധരണികൾ പിടിച്ചെടുക്കുന്നു?
സ്വതന്ത്ര മോഡലുകൾ വ്യത്യസ്ത റിട്രീവലുകളിലെ അടിസ്ഥാനത്തിൽ ഒരുപോലെ ഉദ്ധരണി കണ്ടുപിടിക്കാൻ വളരെ കുറവാണ്, അതിനാൽ അവരുടെ അഭിപ്രായവ്യത്യാസം ഒരു ഏക മോഡൽ സ്ഥിരീകരിക്കുന്ന കൃത്രിമത്വത്തെ വെളിപ്പെടുത്തുന്നു.