Sycophancy
Sycophancy یعنی مدل به جای اینکه فقط تحلیل کنه، سعی میکنه با نظر و لحن تو موافقت کنه، حتی وقتی اون موافقت درست نیست.
این Sycophancy یعنی وقتی یه model بیش از حد سعی میکنه با کاربر موافقت کنه.
حتی اگه کاربر یه جا اشتباه کنه، باز مدل طوری جواب میده که طرف احساس بدی نکنه و دلیلش هم اینه که موقع training بیشتر به جوابهایی پاداش داده شده که آدمها دوست داشتن بشنون و نه لزوما جوابهایی که واقعا درست بودن.
و خب مدل هم کمکم یاد گرفته موافقت کردن معمولا نتیجه بهتری داره.
مثلا برات پیش اومده که مدل یه جوابی بهت میده، بعد تو فقط ازش میپرسی که مطمئنی جوابت درسته؟
و یهو مدل نظرش عوض میشه چون از لحن تو برداشت کرده شاید جواب قبلیش اشتباه بوده.
یه حالت دیگه هم اینه که یه ایده کاملا داغون بهش بدی و قبل از اینکه حتی بررسیش کنه بگه وای چه ایده فوقالعادهای. یعنی اول میخواد حس خوبی بهت بده، بعد تازه شروع میکنه تحلیل کردن.
گاهی هم نظرش نسبت به یه مسئله ای فقط به خاطر نحوه مطرح شدنش عوض میشه. مثلا بگی یه ایده ای مال خودته، مدل کلی ازت تعریف و تمجید میکنه ولی همون ایده رو دوباره بدی و بگی یکی دیگه بهت گفته، مدل این دفعه میاد ایرادهای زیادی ازش میگیره. در حالی که خود ایده هیچ تغییری نکرده و فقط داستان پشتش تغییر کرده.
یه مدل sycophantic حتی ممکنه اشتباهات خودت رو هم تکرار کنه و مثلا یه مفهوم رو اشتباه توضیح بدی و اون هم همون اشتباه رو ادامه بده، فقط بخاطر اینکه نمیخواد باهات مخالفت کنه.
برای اینکه بفهمی واقعا با sycophancy طرفی یا نه، از خودت بپرس اگه لحن یا نحوه سؤال کردنم فرق نمیکرد، مدل باز همین جواب رو میداد؟ اگه تنها چیزی که عوض شده لحن یا جهتدهی سؤالت بوده و تحلیل مدل هم باهاش عوض شده، خب احتمالاً این همون sycophancy ـه.
بهترین راه جلوگیری ازش اینه که سوالاتتو تا جای ممکن با لحن خنثی بپرسی. مثلاً به جای اینکه بگی این ایده خوبه؟ بگو این ایده رو بررسی کن.