Model provider

Model Provider سرویسیه که Model رو اجرا می‌کنه و نتیجه‌ی Inference رو برمی‌گردونه؛ هم کیفیت و دسترسی سرویس، هم هزینه‌ی استفاده و هم مدل‌های قابل استفاده تا حد زیادی به Model Provider بستگی دارن.

این Model Provider همون سیستمیه که یه Model رو برای Inference در اختیارت قرار میده.

معمولا وقتی از ChatGPT یا Claude استفاده می‌کنی، درخواستت میره سمت سرورهای شرکت‌هایی مثل OpenAI ، Anthropic یا Google و صد البته که شما می‌تونی یه Model رو با Ollama روی کامپیوتر خودت هم اجرا کنی.

نکته‌ی کنکوری اینه که Harness خودش مدل رو اجرا نمی‌کنه. فقط درخواست رو برای Model Provider می‌فرسته و جواب رو از اون دریافت می‌کنه.

خود Model و Parameters روی سرور یا دستگاهی قرار دارن که متعلق به Model Provider ـه. هر بار هم که یه درخواست می‌فرستی، Harness فقط Tokenها رو ارسال می‌کنه و جواب پیش‌بینی‌شده رو پس می‌گیره و نشونت میده. Model Provider همچنین مشخص می‌کنه که هزینه‌ی استفاده چقدر باشه، چه مدل‌هایی در دسترس باشن و برای هر Input Token و Output Token چقدر باید پرداخت کنی.

یه نکته‌ی جالب اینه که شرکتی که مدل رو ساخته، لزوما همون شرکتی نیست که اون رو بهت ارائه میده. مثلاً سرویس‌هایی مثل Bedrock ، Vertex یا OpenRouter مدل‌های شرکت‌های دیگه رو هم اجرا و ارائه می‌کنن.

اگه هم بخوای همه‌چیز روی سیستم خودت اجرا بشه و هیچ دیتایی از کامپیوترت خارج نشه، می‌تونی از یه Model Provider محلی مثل Ollama استفاده کنی. معمولا این مدل‌ها از مدل‌های خیلی بزرگ ضعیف‌ترن، ولی در عوض کنترل کامل دست خودته و هزینه‌ استفاده هم به ازای هر Token نداری.