Model provider
Model Provider سرویسیه که Model رو اجرا میکنه و نتیجهی Inference رو برمیگردونه؛ هم کیفیت و دسترسی سرویس، هم هزینهی استفاده و هم مدلهای قابل استفاده تا حد زیادی به Model Provider بستگی دارن.
این Model Provider همون سیستمیه که یه Model رو برای Inference در اختیارت قرار میده.
معمولا وقتی از ChatGPT یا Claude استفاده میکنی، درخواستت میره سمت سرورهای شرکتهایی مثل OpenAI ، Anthropic یا Google و صد البته که شما میتونی یه Model رو با Ollama روی کامپیوتر خودت هم اجرا کنی.
نکتهی کنکوری اینه که Harness خودش مدل رو اجرا نمیکنه. فقط درخواست رو برای Model Provider میفرسته و جواب رو از اون دریافت میکنه.
خود Model و Parameters روی سرور یا دستگاهی قرار دارن که متعلق به Model Provider ـه. هر بار هم که یه درخواست میفرستی، Harness فقط Tokenها رو ارسال میکنه و جواب پیشبینیشده رو پس میگیره و نشونت میده. Model Provider همچنین مشخص میکنه که هزینهی استفاده چقدر باشه، چه مدلهایی در دسترس باشن و برای هر Input Token و Output Token چقدر باید پرداخت کنی.
یه نکتهی جالب اینه که شرکتی که مدل رو ساخته، لزوما همون شرکتی نیست که اون رو بهت ارائه میده. مثلاً سرویسهایی مثل Bedrock ، Vertex یا OpenRouter مدلهای شرکتهای دیگه رو هم اجرا و ارائه میکنن.
اگه هم بخوای همهچیز روی سیستم خودت اجرا بشه و هیچ دیتایی از کامپیوترت خارج نشه، میتونی از یه Model Provider محلی مثل Ollama استفاده کنی. معمولا این مدلها از مدلهای خیلی بزرگ ضعیفترن، ولی در عوض کنترل کامل دست خودته و هزینه استفاده هم به ازای هر Token نداری.