اجرای مدل‌های زبانی بزرگ به‌صورت محلی فقط به تعداد پارامترهای مدل بستگی ندارد. مقدار VRAM، اندازه پنجره متنی، نوع کوانتایز و میزان لایه‌هایی که روی کارت گرافیک اجرا می‌شوند، همگی روی سرعت و کاربردپذیری مدل تأثیر دارند. به همین دلیل ممکن است مدلی روی کاغذ «قابل اجرا» باشد اما در عمل به‌قدری کند شود که استفاده از آن آزاردهنده باشد.

برای کارت‌هایی با ۸ گیگابایت VRAM، اجرای یک مدل بزرگ‌تر همیشه بهترین راه‌حل نیست. یک روش کاربردی این است که به‌جای تلاش برای اجرای مدل ۸B یا بزرگ‌تر، دو مدل کوچک‌تر را با وظایف متفاوت اجرا کنیم. در llama.cpp می‌توان چند سرور را با پورت‌های متفاوت اجرا کرد و هرکدام را در یک تب مرورگر باز نگه داشت. خود llama.cpp نیز در نسخه‌های جدید امکان اجرای چند مدل از طریق حالت Router را فراهم کرده است.