Qwen 3.8 27B یکی از مدل‌های جدید خانواده Qwen است که توجه زیادی را در اجرای لوکال مدل‌های زبانی جلب کرده است. مهم‌ترین ویژگی این نسخه، ارائه یک مدل ۲۷ میلیارد پارامتری است که برخلاف مدل‌های بسیار بزرگ ابری می‌تواند با کوانتایز مناسب روی سخت‌افزارهای مصرفی اجرا شود. نسخه ۲۷B در حال حاضر در Ollama نیز ارائه شده و از ورودی متن و تصویر پشتیبانی می‌کند.

در آزمایش‌های مختلف روی سخت‌افزارهای مصرفی، Qwen 3.8 27B برای برنامه‌نویسی، کارهای عامل‌محور و پردازش درخواست‌های طولانی عملکرد قابل توجهی نشان داده است. با این حال، نتیجه واقعی به کوانتایز، مقدار VRAM، اندازه Context و نرم‌افزار اجرای مدل وابسته است و نمی‌توان عملکرد یک سیستم را مستقیماً به سیستم دیگر تعمیم داد.

Qwen 3.8 27B چیست و چرا اجرای لوکال آن مهم است؟

Qwen 3.8 27B یک مدل Dense با حدود ۲۷ میلیارد پارامتر است. در این معماری برخلاف مدل‌های Mixture of Experts تمام پارامترهای مدل در زمان پردازش فعال هستند. مدل از معماری Hybrid Attention استفاده می‌کند و طبق اطلاعات مدل کارت رسمی، ظرفیت Context بومی آن به ۲۶۲ هزار توکن می‌رسد و امکان افزایش آن تا حدود یک میلیون توکن نیز وجود دارد.

این مدل برای کارهایی مانند برنامه‌نویسی، پژوهش، تولید محتوا، دنبال‌کردن دستورهای پیچیده و اجرای وظایف عامل‌محور طراحی شده است. پشتیبانی از تصویر و ویدیو نیز باعث می‌شود Qwen 3.8 27B فقط یک مدل متنی ساده نباشد و بتواند در سناریوهای چندرسانه‌ای نیز استفاده شود.

اهمیت نسخه ۲۷B در این است که اجرای مدل‌های بزرگ معمولاً به چندین کارت گرافیک یا سخت‌افزار سروری نیاز دارد. در مقابل، نسخه کوانتایز‌شده Qwen 3.8 27B را می‌توان روی کارت‌هایی با ۲۴ گیگابایت VRAM نیز اجرا کرد. آزمایش‌های مستقل روی RTX 3090 نشان داده‌اند که بسته به تنظیمات و اندازه Context می‌توان این مدل را به‌صورت کامل روی چنین کارتی قرار داد.

عملکرد Qwen 3.8 27B در برنامه‌نویسی و کارهای پیچیده

یکی از بخش‌های مهم Qwen 3.8 27B عملکرد آن در برنامه‌نویسی و وظایف Agentic است. در نتایج منتشرشده برای مدل، امتیاز SWE-bench Pro برابر با ۶۱.۷ و امتیاز Terminal Bench 2.1 برابر با ۷۳ گزارش شده است. در LiveCodeBench v6 نیز امتیاز ۹۰.۳ ثبت شده است. این اعداد نتایج آزمایش مدل در شرایط مشخص هستند و الزاماً نشان‌دهنده نتیجه‌ای یکسان روی سیستم شخصی نیستند.

در یک آزمایش عملی دیگر روی RTX 3090 نیز Qwen 3.8 27B برای اصلاح کد و اجرای یک وظیفه چندمرحله‌ای استفاده شده و توانسته یک پروژه واقعی را با ابزارهای محلی پردازش کند. چنین آزمایش‌هایی اهمیت استفاده از Harness و ابزارهای Agent را نشان می‌دهند زیرا کیفیت نهایی فقط به خود مدل وابسته نیست.

بررسی Qwen 3.8 27B؛ اجرای لوکال، مصرف VRAM و عملکرد در برنامه‌نویسی

در آزمایش‌های انجام‌شده روی یک سیستم مجهز به RTX 3090 نیز مدل برای ساخت یک شبیه‌ساز فیزیک سیالات از صفر به کار گرفته شده است. نتیجه نشان می‌دهد مدل می‌تواند از مرحله تولید کد ساده فراتر برود و در پروژه‌هایی که به چندین مرحله تولید و بررسی کد نیاز دارند نیز مورد استفاده قرار گیرد. البته محدودیت عملکرد در پروژه‌های سنگین همچنان وجود دارد و با افزایش پیچیدگی یا تعداد عناصر پردازشی سرعت کاهش پیدا می‌کند.

Qwen 3.8 27B روی RTX 3090 چقدر VRAM نیاز دارد؟

مقدار VRAM مورد نیاز فقط به تعداد پارامترهای مدل بستگی ندارد. نوع کوانتایز، اندازه Context و نوع KV Cache نیز تأثیر زیادی روی مصرف حافظه دارند. برای همین یک فایل مدل مشخص می‌تواند در یک سیستم با Context کوتاه به‌راحتی اجرا شود اما با افزایش Context به محدودیت VRAM برسد.

در یکی از آزمایش‌های منتشرشده، نسخه Q4_K_M مدل حدود ۱۶ تا ۱۸ گیگابایت فضا برای وزن‌های مدل نیاز داشته است. آزمایش دیگری با نسخه UD-Q4_K_XL نیز حجم حدود ۱۷.۹ گیگابایت را نشان داده است. در نتیجه کارت ۲۴ گیگابایتی مانند RTX 3090 برای اجرای نسخه‌های ۴ بیتی گزینه قابل استفاده‌ای محسوب می‌شود اما مقدار حافظه باقی‌مانده باید برای KV Cache و سایر اجزای اجرا در نظر گرفته شود.

به عنوان مثال، در یک آزمایش با Q4_K_M روی RTX 3090 مقدار مصرف VRAM با افزایش Context تا ۶۴ هزار توکن به حدود ۲۲ گیگابایت رسیده است. سرعت تولید نیز از حدود ۴۰ توکن بر ثانیه در Context کوتاه به حدود ۳۴ توکن بر ثانیه در Context ۶۴ هزار توکنی کاهش پیدا کرده است. این اعداد مربوط به همان پیکربندی آزمایشی هستند و نباید به‌عنوان سرعت قطعی برای همه سیستم‌ها در نظر گرفته شوند.

بررسی Qwen 3.8 27B؛ اجرای لوکال، مصرف VRAM و عملکرد در برنامه‌نویسی

در یک آزمایش دیگر نیز نسخه Q4_K_M با Context حدود ۱۰۰ هزار توکن روی سیستم دارای ۲۴ گیگابایت VRAM اجرا شده است. این موضوع نشان می‌دهد که انتخاب کوانتایز مناسب و مدیریت KV Cache می‌تواند تفاوت بزرگی در امکان اجرای مدل ایجاد کند.

بهترین کوانتایز برای اجرای Qwen 3.8 27B چیست؟

برای کارت گرافیک ۲۴ گیگابایتی، نسخه‌های ۴ بیتی معمولاً نقطه تعادل مناسبی بین کیفیت و مصرف حافظه ایجاد می‌کنند. نسخه‌های با دقت بالاتر می‌توانند به حافظه بیشتری نیاز داشته باشند و فضای کافی برای Context و KV Cache باقی نگذارند.

برای مثال، در یک آزمایش با Q4_K_M حدود ۱۷.۸ گیگابایت از VRAM برای خود مدل مصرف شده و با فعال‌کردن Context بسیار بزرگ مقدار مصرف به حدود ۲۲ گیگابایت رسیده است. بنابراین هنگام انتخاب مدل باید حجم فایل کوانتایز را به‌تنهایی ملاک قرار نداد.

اجرای Qwen 3.8 27B با Ollama و ابزارهای لوکال

Ollama یکی از روش‌های ساده برای اجرای Qwen 3.8 27B است. نسخه ۲۷B در مخزن رسمی Ollama با حجم حدود ۱۸ گیگابایت و Context پیش‌فرض ۲۵۶ هزار توکن فهرست شده است و امکان استفاده از آن در ابزارهای مختلف Agent نیز وجود دارد.

برای اجرای مدل در Ollama می‌توان از دستور زیر استفاده کرد:

ollama run qwen3.8

این روش برای کسانی مناسب است که می‌خواهند بدون درگیرشدن با تنظیمات پیچیده سرور مدل را اجرا کنند. در مقابل، ابزارهایی مانند llama.cpp و vLLM کنترل بیشتری روی مقدار Context، نوع KV Cache، کوانتایز و بهینه‌سازی سرعت در اختیار کاربر قرار می‌دهند.

بررسی Qwen 3.8 27B؛ اجرای لوکال، مصرف VRAM و عملکرد در برنامه‌نویسی

در استفاده حرفه‌ای‌تر، Qwen 3.8 27B می‌تواند به ابزارهای Agent متصل شود. Ollama در حال حاضر برای ابزارهایی مانند Claude Code و OpenCode و چند محیط Agent دیگر دستورهای آماده ارائه کرده است. این قابلیت باعث می‌شود مدل محلی فقط نقش یک چت‌بات را نداشته باشد و بتواند در فرایندهایی مانند بررسی فایل‌ها، اصلاح کد و اجرای وظایف چندمرحله‌ای نیز استفاده شود.

محدودیت‌های Qwen 3.8 27B در اجرای محلی

با وجود عملکرد قابل توجه، اجرای لوکال Qwen 3.8 27B به معنی حذف کامل مزیت مدل‌های ابری نیست. مهم‌ترین محدودیت، حافظه سخت‌افزار است. مدل‌های ابری بسیار بزرگ‌تر می‌توانند از منابعی استفاده کنند که روی یک کامپیوتر شخصی در دسترس نیست.

در آزمایش مورد بررسی، نسخه Q4_K_M مدل روی کارت ۲۴ گیگابایتی حدود ۱۷.۸ گیگابایت برای وزن‌های مدل مصرف کرده و همراه با Context حدود ۱۰۰ هزار توکن به حدود ۲۲ گیگابایت رسیده است. در مقابل، مدل بزرگ‌تر Qwen 3.8 با ۲.۴ تریلیون پارامتر حتی در حالت Q4 به حافظه‌ای در مقیاس بسیار بالاتر نیاز دارد.

Context نیز یکی دیگر از محدودیت‌های مهم است. هرچه مکالمه یا پروژه طولانی‌تر شود، حافظه بیشتری برای نگهداری اطلاعات Context لازم است. در سیستم‌های دارای VRAM محدود، کاهش Context یا استفاده از KV Cache فشرده‌تر می‌تواند به اجرای پایدارتر مدل کمک کند.

از طرف دیگر، سرعت اجرای مدل نیز ثابت نیست. نوع GPU، مقدار Context، کوانتایز، Backend و فعال‌بودن قابلیت‌هایی مانند Multi-Token Prediction می‌توانند نتیجه را تغییر دهند. بنابراین اعدادی مانند ۴۰ یا ۸۰ توکن بر ثانیه فقط زمانی قابل مقایسه هستند که شرایط آزمایش تقریباً یکسان باشد. برای نمونه، آزمایش‌های مختلف روی RTX 3090 سرعت‌هایی از حدود ۳۴ تا بیش از ۸۰ توکن بر ثانیه را با تنظیمات متفاوت گزارش کرده‌اند.

Qwen 3.8 27B برای چه کاربرانی مناسب است؟

Qwen 3.8 27B بیشتر برای کاربرانی جذاب است که می‌خواهند یک مدل نسبتاً قدرتمند را بدون ارسال دائمی اطلاعات به سرویس ابری اجرا کنند. برنامه‌نویسی، بررسی کد، تولید محتوا، تحلیل اسناد، کار با تصاویر و ساخت Agentهای محلی از کاربردهای مهم آن هستند.

مزیت اصلی این مدل نسبت به مدل‌های بسیار بزرگ، امکان اجرای آن روی سخت‌افزار مصرفی است. در عین حال، برای استفاده جدی باید مقدار VRAM و نوع کوانتایز را با دقت انتخاب کرد. کارت ۲۴ گیگابایتی می‌تواند برای نسخه‌های کوانتایز‌شده مناسب باشد اما اجرای Context بسیار بزرگ یا استفاده از دقت بالاتر ممکن است به حافظه بیشتری نیاز داشته باشد.

نتایج رسمی Qwen 3.8 27B نیز نشان می‌دهد تمرکز این مدل فقط روی پاسخ‌های معمولی چت نیست و بخش مهمی از توسعه آن به برنامه‌نویسی و وظایف Agentic اختصاص داشته است. برای همین، در صورتی که هدف اصلی اجرای لوکال برای برنامه‌نویسی باشد، قابلیت‌های آن اهمیت بیشتری از صرفاً تعداد پارامترها پیدا می‌کند.

در مجموع، Qwen 3.8 27B نشان می‌دهد فاصله میان مدل‌های قابل اجرای محلی و مدل‌های بسیار بزرگ ابری در برخی کاربردها کمتر شده است. با این حال، مقایسه منصفانه باید با درنظرگرفتن سخت‌افزار، کوانتایز، Context و ابزار اجرای مدل انجام شود و نتایج یک آزمایش منفرد نباید به همه کاربران تعمیم داده شود.