اجرای مدلهای زبانی بزرگ بهصورت محلی فقط به تعداد پارامترهای مدل بستگی ندارد. مقدار VRAM، اندازه پنجره متنی، نوع کوانتایز و میزان لایههایی که روی کارت گرافیک اجرا میشوند، همگی روی سرعت و کاربردپذیری مدل تأثیر دارند. به همین دلیل ممکن است مدلی روی کاغذ «قابل اجرا» باشد اما در عمل بهقدری کند شود که استفاده از آن آزاردهنده باشد.
برای کارتهایی با ۸ گیگابایت VRAM، اجرای یک مدل بزرگتر همیشه بهترین راهحل نیست. یک روش کاربردی این است که بهجای تلاش برای اجرای مدل ۸B یا بزرگتر، دو مدل کوچکتر را با وظایف متفاوت اجرا کنیم. در llama.cpp میتوان چند سرور را با پورتهای متفاوت اجرا کرد و هرکدام را در یک تب مرورگر باز نگه داشت. خود llama.cpp نیز در نسخههای جدید امکان اجرای چند مدل از طریق حالت Router را فراهم کرده است.
