Next-token prediction

مدل فقط با پیش‌بینی توکن بعدی، قدم‌به‌قدم کل خروجی رو میسازه و تمام رفتارهای مدل از همین مکانیزم به وجود میان.

این Next-token prediction تنها کاریه که یه Model واقعا از خودش انجام میده.

شما وقتی یه Context به مدل میدی، مدل سعی نمی‌کنه کل جواب رو یکجا بنویسه بلکه فقط حدس می‌زنه توکن بعدی چی باید باشه.

بعد اون Token رو به متن اضافه می‌کنه و بعد دوباره همین کار رو تکرار می‌کنه. این چرخه اون‌قدر ادامه پیدا می‌کنه تا یه جواب کامل ساخته بشه.

یعنی فرقی نداره خروجی یه جمله باشه، یه فایل هزار خطی باشه یا حتی یه Tool Call و همه‌شون دونه‌دونه و Token به Token ساخته میشن.

هر بار که مدل می‌خواد Token بعدی رو انتخاب کنه، کل Context Window رو چک میکنه و با استفاده از Parameters حساب می‌کنه احتمال اومدن هر Token چقدره.

بعد از بین اون احتمال‌ها یکی رو انتخاب می‌کنه و ادامه میده.

به خاطر همین ممکنه یه Prompt یکسان رو دو بار اجرا کنی و جواب‌ها دقیقاً یکی نباشن.

این موضوع یه سری رفتارهای عجیب مدل رو هم توضیح میده. مثلا مدل قبل از تولید یه Token بررسی نمی‌کنه که اون حرف واقعا درسته یا نه بلکه فقط بررسی می‌کنه که از نظر آماری محتمل‌ترین ادامه‌ چی میتونه باشه. به همین دلیل گاهی Hallucination اتفاق میفته و مدل با اعتمادبه‌نفس یه چیز پرتی میگه.

از اونجایی هم که جواب همیشه Token به Token تولید میشه، سرعت تولید متن یه محدودیت طبیعی برای سرعت هر Agent به حساب میاد. هرچقدر هم سیستم قوی باشه، مدل نمی‌تونه جواب رو یکجا تولید کنه و باید این فرآیند رو مرحله‌به‌مرحله طی کنه.