ਏਆਈ ਪੀਅਰ ਰਿਵਿਊ ਕੀ ਹੈ?

ਏਆਈ ਪੀਅਰ ਰਿਵਿਊ ਕਈ ਏਆਈ ਮਾਡਲਾਂ ਦੇ ਤਰਕਾਂ ਦੀ ਸਮੀਖਿਆ ਅਤੇ ਦਰਜਾਬੰਦੀ ਕਰਨ ਦੀ ਪ੍ਰਕਿਰਿਆ ਹੈ, ਬਿਲਕੁਲ ਅਕਾਦਮਿਕ ਪੀਅਰ ਰਿਵਿਊ ਵਾਂਗ ਜੋ ਏਆਈ ਨਤੀਜਿਆਂ 'ਤੇ ਲਾਗੂ ਹੁੰਦੀ ਹੈ। ਇੱਕ ਹੀ ਮਾਡਲ ਦੇ ਜਵਾਬ 'ਤੇ ਭਰੋਸਾ ਕਰਨ ਦੀ ਬਜਾਏ, ਹਰ ਮਾਡਲ ਦੇ ਦਾਅਵੇ ਦੂਜੇ ਮਾਡਲਾਂ ਦੁਆਰਾ ਮੁਲਾਂਕਣ ਕੀਤੇ ਜਾਂਦੇ ਹਨ, ਅਤੇ ਉਹ ਤਰਕ ਜੋ ਕ੍ਰਾਸ-ਮਾਡਲ ਸਮੀਖਿਆ ਵਿੱਚ ਜੀਵਿਤ ਰਹਿੰਦੇ ਹਨ, ਉਹ ਭਰੋਸਾ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ। ਇਹ ਤਰਕ ਇੱਕ ਹੀ LLM ਨੂੰ ਜੱਜ ਵਜੋਂ ਵਰਤਣ ਦੇ ਜਾਣੇ ਪਛਾਣੇ ਸੀਮਾਵਾਂ 'ਤੇ ਆਧਾਰਿਤ ਹੈ: ਖੋਜ ਦਸਤਾਵੇਜ਼ ਸਥਿਤੀ ਪੱਖਪਾਤ (ਜੋ ਵੀ ਜਵਾਬ ਪਹਿਲਾਂ ਆਉਂਦਾ ਹੈ ਉਸਨੂੰ ਪਸੰਦ ਕਰਨਾ), ਵਿਸ਼ਾਲਤਾ ਪੱਖਪਾਤ (ਗੁਣਵੱਤਾ ਦੀ ਪਰਵਾਹ ਕੀਤੇ ਬਿਨਾਂ ਲੰਬੇ ਜਵਾਬਾਂ ਨੂੰ ਇਨਾਮ ਦੇਣਾ), ਅਤੇ ਸਵੈ-ਵਧਾਈ ਪੱਖਪਾਤ (ਇੱਕ ਮਾਡਲ ਆਪਣੇ ਹੀ ਨਤੀਜਿਆਂ ਨੂੰ ਪਸੰਦ ਕਰਦਾ ਹੈ)। ਕਈ ਮਾਡਲਾਂ ਵਿੱਚ ਮੁਲਾਂਕਣ ਫੈਲਾਉਣਾ ਅਤੇ ਇਹ ਗੁਪਤ ਕਰਨਾ ਕਿ ਕਿਸ ਦਾ ਤਰਕ ਦਰਜਾਬੰਦੀ ਕੀਤੀ ਜਾ ਰਹੀ ਹੈ, ਕਿਸੇ ਇੱਕ ਜੱਜ ਦੇ ਵਿਅਕਤੀਗਤ ਪੱਖਪਾਤ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ। ਕਿਉਂਕਿ ਵੱਖ-ਵੱਖ ਮਾਡਲ ਵੱਖਰੇ ਤਰੀਕੇ ਨਾਲ ਹਾਲੂਸੀਨੇਟ ਕਰਨ ਦੀ ਆਦਤ ਰੱਖਦੇ ਹਨ, ਇੱਕ ਬਣਾਵਟੀ ਜਾਂ ਅਸਮਰਥਿਤ ਦਾਅਵਾ ਅਕਸਰ ਦੂਜੇ ਮਾਡਲਾਂ ਦੁਆਰਾ ਖਰਾਬ ਦਰਜਾਬੰਦੀ ਕੀਤੀ ਜਾਂਦੀ ਹੈ, ਇਸ ਲਈ ਲਗਾਤਾਰ ਨੀਚੇ ਕ੍ਰਾਸ-ਮਾਡਲ ਰੇਟਿੰਗ ਉਹ ਦਾਅਵੇ ਝੰਡਾ ਲਗਾਉਂਦੇ ਹਨ ਜੋ ਮਨੁੱਖੀ ਪੁਸ਼ਟੀ ਦੀ ਲੋੜ ਹੈ। Argumentree.AI ਇਸ ਨੂੰ ਇਸ ਤਰੀਕੇ ਨਾਲ ਲਾਗੂ ਕਰਦਾ ਹੈ ਕਿ ਹਰ ਉਪਲਬਧ ਮਾਡਲ ਹਰ ਦੂਜੇ ਮਾਡਲ ਦੇ ਤਰਕਾਂ ਦੀ ਗੁਪਤ ਰੂਪ ਵਿੱਚ ਦਰਜਾਬੰਦੀ ਕਰਦਾ ਹੈ, ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਕਿਹੜੇ ਦਾਅਵੇ ਵਿਆਪਕ ਤੌਰ 'ਤੇ ਸਮਰਥਿਤ ਹਨ ਅਤੇ ਕਿਹੜੇ ਕਮਜ਼ੋਰ ਜਾਂ ਵਿਵਾਦਿਤ ਹਨ। ਇਹ ਮਨੁੱਖੀ ਫੈਸਲੇ ਨੂੰ ਵਧਾਉਂਦਾ ਹੈ ਨਾ ਕਿ ਇਸਨੂੰ ਬਦਲਦਾ ਹੈ।

ਕਲੈਕਟਿਵ ਏਆਈ ਬੁੱਧੀ ਵੱਲ ਵਾਪਸਕ੍ਰਾਸ-ਮਾਡਲ ਰੇਟਿੰਗ

ਕੀ ਹੈ
ਏਆਈ ਪੀਅਰ ਰਿਵਿਊ?

ਏਆਈ ਪੀਅਰ ਰਿਵਿਊ ਵਿੱਚ ਕਈ ਮਾਡਲ ਇੱਕ ਦੂਜੇ ਦੇ ਤਰਕਾਂ ਦੀ ਦਰਜਾਬੰਦੀ ਕਰਦੇ ਹਨ — ਅਕਾਦਮਿਕ ਪੀਅਰ ਰਿਵਿਊ, ਜੋ ਏਆਈ ਨਤੀਜਿਆਂ 'ਤੇ ਲਾਗੂ ਹੁੰਦੀ ਹੈ। ਗੁਪਤ ਕ੍ਰਾਸ-ਮਾਡਲ ਰੇਟਿੰਗ ਇੱਕ ਹੀ ਏਆਈ ਜੱਜ ਨੂੰ ਪਿੱਛੇ ਛੱਡਦੀ ਹੈ, ਜਿਸ ਦੀਆਂ ਰੇਟਿੰਗਾਂ ਪੱਖਪਾਤੀ ਹੋਣ ਦੀ ਜਾਣਕਾਰੀ ਹੈ।

TL;DR

ਏਆਈ ਪੀਅਰ ਰਿਵਿਊ ਮਾਡਲਾਂ ਨੂੰ ਇੱਕ ਦੂਜੇ ਦੇ ਤਰਕਾਂ ਦੀ ਦਰਜਾਬੰਦੀ ਕਰਨ ਲਈ ਬਣਾਉਂਦਾ ਹੈ ਨਾ ਕਿ ਇੱਕ ਜੱਜ 'ਤੇ ਭਰੋਸਾ ਕਰਨ ਲਈ। ਇੱਕਲ LLM ਜੱਜ ਸਥਿਤੀ, ਵਿਸ਼ਾਲਤਾ, ਅਤੇ ਸਵੈ-ਵਧਾਈ ਪੱਖਪਾਤ ਦਿਖਾਉਂਦੇ ਹਨ — ਕਈ ਮਾਡਲਾਂ ਵਿੱਚ ਰੇਟਿੰਗਾਂ ਫੈਲਾਉਣਾ, ਗੁਪਤ ਰੂਪ ਵਿੱਚ, ਉਹ ਪੱਖਪਾਤ ਘਟਾਉਂਦਾ ਹੈ ਅਤੇ ਕਮਜ਼ੋਰ ਜਾਂ ਹਾਲੂਸੀਨੇਟ ਕੀਤੇ ਦਾਅਵੇ ਨੂੰ ਸਾਹਮਣੇ ਲਿਆਉਂਦਾ ਹੈ।

ਪੀਅਰ ਰਿਵਿਊ, ਏਆਈ 'ਤੇ ਲਾਗੂ

ਅਕਾਦਮੀ ਵਿੱਚ, ਇੱਕ ਦਾਅਵਾ ਇਸ ਦੇ ਲੇਖਕ ਦੇ ਆਤਮਵਿਸ਼ਵਾਸ ਕਾਰਨ ਸਵੀਕਾਰ ਨਹੀਂ ਕੀਤਾ ਜਾਂਦਾ — ਇਸਨੂੰ ਸੁਤੰਤਰ ਪੀਅਰਾਂ ਦੁਆਰਾ ਸਮੀਖਿਆ ਕੀਤੀ ਜਾਂਦੀ ਹੈ ਜੋ ਤਰਕ ਅਤੇ ਸਬੂਤ ਦੀ ਜੱਜ ਕਰਦੇ ਹਨ। ਏਆਈ ਪੀਅਰ ਰਿਵਿਊ ਇਸ ਸਿਧਾਂਤ ਨੂੰ ਉਧਾਰ ਲੈਂਦਾ ਹੈ: ਇੱਕ ਮਾਡਲ ਦੇ ਜਵਾਬ 'ਤੇ ਭਰੋਸਾ ਕਰਨ ਦੀ ਬਜਾਏ, ਤੁਹਾਡੇ ਕੋਲ ਕਈ ਮਾਡਲਾਂ ਨੂੰ ਇੱਕ ਦੂਜੇ ਦੇ ਤਰਕਾਂ ਦੀ ਸਮੀਖਿਆ ਅਤੇ ਦਰਜਾਬੰਦੀ ਕਰਨ ਲਈ ਹੈ। ਉਹ ਦਾਅਵੇ ਜੋ ਕ੍ਰਾਸ-ਮਾਡਲ ਸਮੀਖਿਆ ਵਿੱਚ ਜੀਵਿਤ ਰਹਿੰਦੇ ਹਨ, ਉਹ ਭਰੋਸਾ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ; ਉਹ ਦਾਅਵੇ ਜੋ ਦੂਜੇ ਮਾਡਲਾਂ ਦੁਆਰਾ ਖਰਾਬ ਦਰਜਾਬੰਦੀ ਕੀਤੇ ਜਾਂਦੇ ਹਨ, ਉਹ ਝੰਡਾ ਲਗਾਏ ਜਾਂਦੇ ਹਨ।

ਸਿਰਫ ਇੱਕ ਏਆਈ ਨੂੰ ਜੱਜ ਵਜੋਂ ਕਿਉਂ ਨਹੀਂ ਵਰਤਣਾ?

ਇੱਕ ਆਕਰਸ਼ਕ ਛੋਟਾ ਰਸਤਾ ਇਹ ਹੈ ਕਿ ਇੱਕ ਹੀ ਮਜ਼ਬੂਤ ਮਾਡਲ ਨਤੀਜਿਆਂ ਦੀ ਗਰੇਡਿੰਗ ਕਰੇ — "LLM-ਜੱਜ ਵਜੋਂ" ਪੈਟਰਨ। ਸਮੱਸਿਆ: LLM ਜੱਜਾਂ 'ਤੇ ਖੋਜ ਨੇ ਸਿਸਟਮੈਟਿਕ ਪੱਖਪਾਤਾਂ ਦਾ ਦਸਤਾਵੇਜ਼ ਕੀਤਾ ਹੈ ਜੋ ਇੱਕ ਜੱਜ ਨੂੰ ਅਣਭਰੋਸੇਯੋਗ ਬਣਾਉਂਦੇ ਹਨ।

ਦਸਤਾਵੇਜ਼ ਕੀਤੇ ਗਏ ਇਕਲ-ਜੱਜ ਪੱਖਪਾਤ

  • ਸਥਿਤੀ ਪੱਖਪਾਤ — ਜੋ ਵੀ ਜਵਾਬ ਪਹਿਲਾਂ ਪੇਸ਼ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਉਸਨੂੰ ਪਸੰਦ ਕਰਨਾ
  • ਵਿਸ਼ਾਲਤਾ ਪੱਖਪਾਤ — ਗੁਣਵੱਤਾ ਦੀ ਪਰਵਾਹ ਕੀਤੇ ਬਿਨਾਂ ਲੰਬੇ ਜਵਾਬਾਂ ਨੂੰ ਇਨਾਮ ਦੇਣਾ
  • ਸਵੈ-ਵਧਾਈ ਪੱਖਪਾਤ — ਇੱਕ ਮਾਡਲ ਆਪਣੇ ਹੀ ਨਤੀਜਿਆਂ ਨੂੰ ਪਸੰਦ ਕਰਦਾ ਹੈ
  • ਇੱਕ ਇਕਲ ਜੱਜ ਦੀ ਵਿਅਕਤੀਗਤ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਹਰ ਦਰਜਾਬੰਦੀ 'ਤੇ ਲਾਗੂ ਹੁੰਦੀਆਂ ਹਨ

ਗੁਪਤ ਕ੍ਰਾਸ-ਮਾਡਲ ਰੇਟਿੰਗ ਕਿਵੇਂ ਮਦਦ ਕਰਦੀ ਹੈ

ਦੋ ਡਿਜ਼ਾਈਨ ਚੋਣਾਂ ਉਹ ਪੱਖਪਾਤਾਂ ਦਾ ਮੁਕਾਬਲਾ ਕਰਦੀਆਂ ਹਨ: ਬਹੁਤ ਸਾਰੇ ਮਾਡਲਾਂ ਵਿੱਚ ਰੇਟਿੰਗ ਫੈਲਾਉਣਾ, ਅਤੇ ਗੁਪਤ ਕਰਨਾ ਕਿ ਕਿਸ ਦਾ ਤਰਕ ਦਰਜਾਬੰਦੀ ਕੀਤੀ ਜਾ ਰਹੀ ਹੈ। ਇਹ ਇਕੱਠੇ ਸਮੱਗਰੀ ਦੀ ਜੱਜ ਕਰਦੇ ਹਨ, ਲੇਖਕਤਾ ਨਹੀਂ, ਅਤੇ ਕਿਸੇ ਇਕ ਮਾਡਲ ਦੀ ਵਿਅਕਤੀਗਤ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਨੂੰ ਔਸਤ ਕਰਦੇ ਹਨ।

1

ਕਈ ਮਾਡਲਾਂ ਤੋਂ ਤਰਕ ਇਕੱਠੇ ਕਰੋ

ਹਰ ਉਪਲਬਧ ਮਾਡਲ ਸੁਤੰਤਰ ਤੌਰ 'ਤੇ ਪੱਖ/ਵਿਰੋਧੀ ਤਰਕਾਂ ਵਿੱਚ ਯੋਗਦਾਨ ਦਿੰਦਾ ਹੈ।

2

ਲੇਖਕਤਾ ਹਟਾਓ

ਤਰਕਾਂ ਨੂੰ ਗੁਪਤ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਤਾਂ ਕਿ ਕੋਈ ਮਾਡਲ ਨਹੀਂ ਜਾਣਦਾ ਕਿ ਇਹ ਆਪਣਾ ਹੈ।

3

ਹਰ ਮਾਡਲ ਹਰ ਤਰਕ ਦੀ ਦਰਜਾਬੰਦੀ ਕਰਦਾ ਹੈ

ਰੇਟਿੰਗਾਂ ਮਾਡਲਾਂ ਵਿੱਚ ਫੈਲਾਈਆਂ ਜਾਂਦੀਆਂ ਹਨ, ਇੱਕ ਹੀ ਜੱਜ ਵਿੱਚ ਕੇਂਦ੍ਰਿਤ ਨਹੀਂ।

4

ਕ੍ਰਾਸ-ਮਾਡਲ ਸਿਗਨਲ ਨੂੰ ਇਕੱਠਾ ਕਰੋ

ਵਿਆਪਕ ਸਮਰਥਨ = ਭਰੋਸਾ; ਲਗਾਤਾਰ ਨੀਚੇ ਦਰਜਾਬੰਦੀ = ਇੱਕ ਕਮਜ਼ੋਰ ਜਾਂ ਹਾਲੂਸੀਨੇਟ ਕੀਤਾ ਗਿਆ ਦਾਅਵਾ ਪੁਸ਼ਟੀ ਕਰਨ ਲਈ।

ਉਦਾਹਰਣ — ਅਸਲ ਮਾਡਲ ਨਤੀਜਾ ਨਹੀਂ

ਇੱਕ ਮਾਡਲ ਦਾਅਵਾ ਕਰਦਾ ਹੈ "ਇਹ ਲਾਇਬ੍ਰੇਰੀ ਡਿਜ਼ਾਈਨ ਦੁਆਰਾ ਯਾਦਸ਼ਕਤ-ਸੁਰੱਖਿਅਤ ਹੈ" ਇੱਕ ਆਤਮਵਿਸ਼ਵਾਸੀ ਉਧਰਣ ਨਾਲ। ਗੁਪਤ ਪੀਅਰ ਰਿਵਿਊ ਦੇ ਅਧੀਨ, ਦੂਜੇ ਮਾਡਲ ਉਸ ਤਰਕ ਨੂੰ ਨੀਚੀ ਦਰਜਾਬੰਦੀ ਕਰਦੇ ਹਨ — ਕਈ ਇਹ ਨੋਟ ਕਰਦੇ ਹਨ ਕਿ ਉਧਰਿਤ ਗਾਰੰਟੀ ਅਸੁਰੱਖਿਅਤ ਇੰਟਰਓਪ ਪਾਥ ਨੂੰ ਕਵਰ ਨਹੀਂ ਕਰਦੀ। ਨੀਚੀ ਕ੍ਰਾਸ-ਮਾਡਲ ਰੇਟਿੰਗ ਦਾਅਵੇ ਨੂੰ ਮਨੁੱਖੀ ਜਾਂਚ ਲਈ ਝੰਡਾ ਲਗਾਉਂਦੀ ਹੈ, ਨਾ ਕਿ ਇੱਕ ਆਤਮਵਿਸ਼ਵਾਸੀ ਮਾਡਲ ਨੂੰ ਇਸਨੂੰ ਬਿਨਾਂ ਚੁਣੌਤੀ ਦੇ ਲਿਜਾਣ ਦੇ।

Argumentree.AI ਵਿੱਚ ਏਆਈ ਪੀਅਰ ਰਿਵਿਊ

ਹਰ ਉਪਲਬਧ ਮਾਡਲ ਹਰ ਦੂਜੇ ਮਾਡਲ ਦੇ ਤਰਕਾਂ ਦੀ ਗੁਪਤ ਰੂਪ ਵਿੱਚ ਦਰਜਾਬੰਦੀ ਕਰਦਾ ਹੈ — ਤਾਂ ਕਿ ਕਮਜ਼ੋਰ ਦਾਅਵੇ ਇੱਕ ਮਾਡਲ ਦੇ ਆਤਮਵਿਸ਼ਵਾਸ ਦੇ ਪਿੱਛੇ ਨਹੀਂ ਲੁਕ ਸਕਦੇ।

ਕਈ ਸੁਤੰਤਰ ਮਾਡਲ

ਤਰਕ ਕਈ ਮਾਡਲਾਂ ਤੋਂ ਆਉਂਦੇ ਹਨ, ਇੱਕ ਹੀ ਸਰੋਤ ਤੋਂ ਨਹੀਂ

ਗੁਪਤ ਕ੍ਰਾਸ-ਰੇਟਿੰਗ

ਹਰ ਮਾਡਲ ਹਰ ਦੂਜੇ ਮਾਡਲ ਦੇ ਤਰਕਾਂ ਦੀ ਦਰਜਾਬੰਦੀ ਕਰਦਾ ਹੈ ਬਿਨਾਂ ਲੇਖਕ ਨੂੰ ਜਾਣੇ

ਸਮਰਥਨ ਇੱਕ ਸਿਗਨਲ ਬਣ ਜਾਂਦਾ ਹੈ

ਵਿਆਪਕ ਤੌਰ 'ਤੇ ਸਮਰਥਿਤ ਤਰਕ ਉੱਥੇ ਚੜ੍ਹਦੇ ਹਨ; ਲਗਾਤਾਰ ਨੀਚੇ ਦਰਜਾਬੰਦੀ ਕੀਤੇ ਗਏ ਉਹ ਝੰਡਾ ਲਗਾਏ ਜਾਂਦੇ ਹਨ

ਕਮਜ਼ੋਰ ਦਾਅਵੇ ਸਾਹਮਣੇ ਆਉਂਦੇ ਹਨ

ਸੰਭਾਵਿਤ ਹਾਲੂਸੀਨੇਸ਼ਨ ਕ੍ਰਾਸ-ਮਾਡਲ ਵਿਵਾਦ ਦੇ ਤੌਰ 'ਤੇ ਪ੍ਰਗਟ ਹੁੰਦੇ ਹਨ ਜੋ ਪੁਸ਼ਟੀ ਕਰਨ ਲਈ।

ਅਕਸਰ ਪੁੱਛੇ ਜਾਣ ਵਾਲੇ ਸਵਾਲ

ਏਆਈ ਪੀਅਰ ਰਿਵਿਊ ਕੀ ਹੈ?

ਏਆਈ ਪੀਅਰ ਰਿਵਿਊ ਉਹ ਹੈ ਜਦੋਂ ਕਈ ਏਆਈ ਮਾਡਲ ਇੱਕ ਦੂਜੇ ਦੇ ਤਰਕਾਂ ਦੀ ਸਮੀਖਿਆ ਅਤੇ ਦਰਜਾਬੰਦੀ ਕਰਦੇ ਹਨ, ਬਿਲਕੁਲ ਅਕਾਦਮਿਕ ਪੀਅਰ ਰਿਵਿਊ ਵਾਂਗ ਜੋ ਏਆਈ ਨਤੀਜਿਆਂ 'ਤੇ ਲਾਗੂ ਹੁੰਦੀ ਹੈ। ਇੱਕ ਹੀ ਮਾਡਲ ਦੇ ਜਵਾਬ 'ਤੇ ਭਰੋਸਾ ਕਰਨ ਦੀ ਬਜਾਏ, ਹਰ ਮਾਡਲ ਦੇ ਦਾਅਵੇ ਦੂਜੇ ਮਾਡਲਾਂ ਦੁਆਰਾ ਮੁਲਾਂਕਣ ਕੀਤੇ ਜਾਂਦੇ ਹਨ। ਉਹ ਤਰਕ ਜੋ ਕ੍ਰਾਸ-ਮਾਡਲ ਸਮੀਖਿਆ ਵਿੱਚ ਜੀਵਿਤ ਰਹਿੰਦੇ ਹਨ, ਉਹ ਭਰੋਸਾ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ; ਉਹ ਦਾਅਵੇ ਜੋ ਦੂਜੇ ਮਾਡਲਾਂ ਦੁਆਰਾ ਖਰਾਬ ਦਰਜਾਬੰਦੀ ਕੀਤੇ ਜਾਂਦੇ ਹਨ, ਉਹ ਕਮਜ਼ੋਰ ਜਾਂ ਸੰਭਾਵਿਤ ਹਾਲੂਸੀਨੇਟ ਕੀਤਾ ਗਿਆ ਝੰਡਾ ਲਗਾਏ ਜਾਂਦੇ ਹਨ।

ਏਆਈ ਪੀਅਰ ਰਿਵਿਊ ਇੱਕ ਇਕਲ ਏਆਈ ਜੱਜ ਨਾਲੋਂ ਕਿਉਂ ਬਿਹਤਰ ਹੈ?

ਇੱਕ LLM ਨੂੰ ਜੱਜ ਵਜੋਂ ਵਰਤਣਾ ਪੱਖਪਾਤੀ ਹੋਣ ਦੀ ਜਾਣਕਾਰੀ ਹੈ। LLM-ਜੱਜ ਵਜੋਂ ਖੋਜ ਨੇ ਸਥਿਤੀ ਪੱਖਪਾਤ (ਜੋ ਵੀ ਜਵਾਬ ਪਹਿਲਾਂ ਆਉਂਦਾ ਹੈ ਉਸਨੂੰ ਪਸੰਦ ਕਰਨਾ), ਵਿਸ਼ਾਲਤਾ ਪੱਖਪਾਤ (ਗੁਣਵੱਤਾ ਦੀ ਪਰਵਾਹ ਕੀਤੇ ਬਿਨਾਂ ਲੰਬੇ ਜਵਾਬਾਂ ਨੂੰ ਇਨਾਮ ਦੇਣਾ), ਅਤੇ ਸਵੈ-ਵਧਾਈ ਪੱਖਪਾਤ (ਇੱਕ ਮਾਡਲ ਆਪਣੇ ਹੀ ਨਤੀਜਿਆਂ ਨੂੰ ਪਸੰਦ ਕਰਦਾ ਹੈ) ਦਾ ਦਸਤਾਵੇਜ਼ ਕੀਤਾ ਹੈ। ਕਈ ਮਾਡਲਾਂ ਵਿੱਚ ਮੁਲਾਂਕਣ ਫੈਲਾਉਣਾ ਅਤੇ ਇਹ ਗੁਪਤ ਕਰਨਾ ਕਿ ਕਿਸ ਦਾ ਤਰਕ ਦਰਜਾਬੰਦੀ ਕੀਤੀ ਜਾ ਰਹੀ ਹੈ, ਕਿਸੇ ਇੱਕ ਜੱਜ ਦੇ ਵਿਅਕਤੀਗਤ ਪੱਖਪਾਤ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ।

ਗੁਪਤ ਕ੍ਰਾਸ-ਮਾਡਲ ਰੇਟਿੰਗ ਪੱਖਪਾਤ ਨੂੰ ਕਿਵੇਂ ਘਟਾਉਂਦੀ ਹੈ?

ਜੇਕਰ ਇੱਕ ਮਾਡਲ ਜਾਣਦਾ ਹੈ ਕਿ ਕਿਹੜਾ ਤਰਕ ਇਸ ਦਾ ਹੈ, ਤਾਂ ਸਵੈ-ਵਧਾਈ ਪੱਖਪਾਤ ਇਸਨੂੰ ਆਪਣੇ ਆਪ ਨੂੰ ਉੱਚਾ ਦਰਜਾਬੰਦੀ ਕਰਨ ਲਈ ਬਣਾ ਸਕਦੀ ਹੈ। ਦਰਜਾਬੰਦੀ ਤੋਂ ਪਹਿਲਾਂ ਤਰਕਾਂ ਨੂੰ ਗੁਪਤ ਕਰਨਾ ਉਸ ਸੰਕੇਤ ਨੂੰ ਹਟਾਉਂਦਾ ਹੈ, ਇਸ ਲਈ ਹਰ ਮਾਡਲ ਸਮੱਗਰੀ ਦੀ ਜੱਜ ਕਰਦਾ ਹੈ ਨਾ ਕਿ ਲੇਖਕ ਦੀ। ਕਈ ਮਾਡਲਾਂ ਤੋਂ ਰੇਟਿੰਗਾਂ ਨੂੰ ਮਿਲਾਉਣਾ ਕਿਸੇ ਇੱਕ ਮਾਡਲ ਦੇ ਸਥਿਤੀ ਜਾਂ ਵਿਸ਼ਾਲਤਾ ਦੀ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਨੂੰ ਹੋਰ ਔਸਤ ਕਰਦਾ ਹੈ, ਇੱਕ ਇਕਲ ਜੱਜ ਨਾਲੋਂ ਵਧੀਆ ਸੰਕੇਤ ਉਤਪੰਨ ਕਰਦਾ ਹੈ।

ਕੀ ਏਆਈ ਪੀਅਰ ਰਿਵਿਊ ਹਾਲੂਸੀਨੇਸ਼ਨ ਨੂੰ ਪਕੜ ਸਕਦੀ ਹੈ?

ਇਹ ਉਨ੍ਹਾਂ ਨੂੰ ਸਾਹਮਣੇ ਲਿਆਉਣ ਵਿੱਚ ਮਦਦ ਕਰਦੀ ਹੈ। ਕਿਉਂਕਿ ਵੱਖ-ਵੱਖ ਮਾਡਲ ਵੱਖਰੇ ਤਰੀਕੇ ਨਾਲ ਹਾਲੂਸੀਨੇਟ ਕਰਨ ਦੀ ਆਦਤ ਰੱਖਦੇ ਹਨ, ਇੱਕ ਬਣਾਵਟੀ ਜਾਂ ਅਸਮਰਥਿਤ ਦਾਅਵਾ ਇੱਕ ਮਾਡਲ ਤੋਂ ਦੂਜੇ ਮਾਡਲਾਂ ਦੁਆਰਾ ਅਕਸਰ ਖਰਾਬ ਦਰਜਾਬੰਦੀ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਲਗਾਤਾਰ ਨੀਚੇ ਕ੍ਰਾਸ-ਮਾਡਲ ਰੇਟਿੰਗ ਇੱਕ ਲਾਲ ਝੰਡਾ ਹੈ ਕਿ ਇੱਕ ਦਾਅਵੇ ਨੂੰ ਮਨੁੱਖੀ ਪੁਸ਼ਟੀ ਦੀ ਲੋੜ ਹੈ। ਇਹ ਇੱਕ ਵਿਵਾਦ-ਪਛਾਣ ਸਿਗਨਲ ਹੈ, ਗਾਰੰਟੀ ਨਹੀਂ — ਜੇਕਰ ਹਰ ਮਾਡਲ ਇੱਕੋ ਹੀ ਗਲਤੀ ਸਾਂਝੀ ਕਰਦਾ ਹੈ, ਤਾਂ ਪੀਅਰ ਰਿਵਿਊ ਇਸਨੂੰ ਨਹੀਂ ਪਕੜੇਗੀ।

ਕੀ ਏਆਈ ਪੀਅਰ ਰਿਵਿਊ ਮਨੁੱਖੀ ਸਮੀਖਿਆ ਨੂੰ ਬਦਲਦੀ ਹੈ?

ਨਹੀਂ। ਏਆਈ ਪੀਅਰ ਰਿਵਿਊ ਮਨੁੱਖੀ ਫੈਸਲੇ ਨੂੰ ਪ੍ਰਾਥਮਿਕਤਾ ਦੇਣ ਅਤੇ ਵਧਾਉਣ ਲਈ ਡਿਜ਼ਾਈਨ ਕੀਤੀ ਗਈ ਹੈ, ਨਾ ਕਿ ਇਸਨੂੰ ਬਦਲਣ ਲਈ। ਇਹ ਤੁਹਾਨੂੰ ਦੱਸਦੀ ਹੈ ਕਿ ਕਿਹੜੇ ਦਾਅਵੇ ਮਾਡਲਾਂ ਵਿੱਚ ਵਿਆਪਕ ਤੌਰ 'ਤੇ ਸਮਰਥਿਤ ਹਨ ਅਤੇ ਕਿਹੜੇ ਵਿਵਾਦਿਤ ਜਾਂ ਕਮਜ਼ੋਰ ਹਨ, ਤਾਂ ਕਿ ਮਨੁੱਖ ਆਪਣੇ ਪੁਸ਼ਟੀ ਕਰਨ ਦੀ ਧਿਆਨ ਦੇ ਸਕਣ ਜਿੱਥੇ ਇਹ ਸਭ ਤੋਂ ਜ਼ਰੂਰੀ ਹੈ। ਅੰਤਿਮ ਫੈਸਲੇ ਅਤੇ ਉੱਚ-ਦਾਖਲੇ ਦੀ ਪੁਸ਼ਟੀ ਮਨੁੱਖੀ ਜ਼ਿੰਮੇਵਾਰੀ ਰਹਿੰਦੀ ਹੈ।

ਮਾਡਲਾਂ ਨੂੰ ਇੱਕ ਦੂਜੇ ਦੀ ਪੀਅਰ-ਰਿਵਿਊ ਕਰਨ ਦਿਓ

ਇੱਕ ਏਆਈ ਜੱਜ 'ਤੇ ਭਰੋਸਾ ਨਾ ਕਰੋ। ਦੇਖੋ ਕਿ ਹਰ ਮਾਡਲ ਹਰ ਦੂਜੇ ਮਾਡਲ ਦੇ ਤਰਕਾਂ ਦੀ ਦਰਜਾਬੰਦੀ ਕਿਵੇਂ ਕਰਦਾ ਹੈ।

ਮੁਫ਼ਤ ਸ਼ੁਰੂ ਕਰੋ