Sycophancy

Sycophancy یعنی مدل به جای اینکه فقط تحلیل کنه، سعی می‌کنه با نظر و لحن تو موافقت کنه، حتی وقتی اون موافقت درست نیست.

این Sycophancy یعنی وقتی یه model بیش از حد سعی می‌کنه با کاربر موافقت کنه.

حتی اگه کاربر یه جا اشتباه کنه، باز مدل طوری جواب میده که طرف احساس بدی نکنه و دلیلش هم اینه که موقع training بیشتر به جواب‌هایی پاداش داده شده که آدم‌ها دوست داشتن بشنون و نه لزوما جواب‌هایی که واقعا درست بودن.

و خب مدل هم کم‌کم یاد گرفته موافقت کردن معمولا نتیجه بهتری داره.

مثلا برات پیش اومده که مدل یه جوابی بهت میده، بعد تو فقط ازش میپرسی که مطمئنی جوابت درسته؟

و یهو مدل نظرش عوض میشه چون از لحن تو برداشت کرده شاید جواب قبلیش اشتباه بوده.

یه حالت دیگه هم اینه که یه ایده کاملا داغون بهش بدی و قبل از اینکه حتی بررسیش کنه بگه وای چه ایده فوق‌العاده‌ای. یعنی اول می‌خواد حس خوبی بهت بده، بعد تازه شروع می‌کنه تحلیل کردن.

گاهی هم نظرش نسبت به یه مسئله ای فقط به خاطر نحوه مطرح شدنش عوض میشه. مثلا بگی یه ایده ای مال خودته، مدل کلی ازت تعریف و تمجید می‌کنه ولی همون ایده رو دوباره بدی و بگی یکی دیگه بهت گفته، مدل این دفعه میاد ایرادهای زیادی ازش می‌گیره. در حالی که خود ایده هیچ تغییری نکرده و فقط داستان پشتش تغییر کرده.

یه مدل sycophantic حتی ممکنه اشتباهات خودت رو هم تکرار کنه و مثلا یه مفهوم رو اشتباه توضیح بدی و اون هم همون اشتباه رو ادامه بده، فقط بخاطر اینکه نمی‌خواد باهات مخالفت کنه.

برای اینکه بفهمی واقعا با sycophancy طرفی یا نه، از خودت بپرس اگه لحن یا نحوه سؤال کردنم فرق نمی‌کرد، مدل باز همین جواب رو می‌داد؟ اگه تنها چیزی که عوض شده لحن یا جهت‌دهی سؤالت بوده و تحلیل مدل هم باهاش عوض شده، خب احتمالاً این همون sycophancy ـه.

بهترین راه جلوگیری ازش اینه که سوالاتتو تا جای ممکن با لحن خنثی بپرسی. مثلاً به جای اینکه بگی این ایده خوبه؟ بگو این ایده رو بررسی کن.