Buffalo147 AI

خانه › بلاگ

Grok 4.20؛ مدل سریع یک‌میلیون‌توکنی با حالت Reasoning و Non‑reasoning

جلد Grok 4.20 با طراحی سه‌بعدی مشکی و نور مسی

آخرین راستی‌آزمایی: ۱۲ سپتامبر ۲۰۲۶

در یک نگاه | Grok 4.20
تاریخ عرضه: ۱۰ مارس ۲۰۲۶
قیمت و شیوهٔ محاسبه: Input ۱٫۲۵ دلار؛ Output ۲٫۵۰ دلار؛ به‌ازای هر یک میلیون توکن تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.

مقدمه

Grok 4.20 برای تیمی جذاب است که بین «فکر عمیق» و «پاسخ سریع» حق انتخاب می‌خواهد. خانواده این مدل دو Snapshot اصلی دارد: نسخه Reasoning برای مسئله‌های پیچیده و نسخه Non‑reasoning برای پاسخ مستقیم و کم‌تأخیر. هر دو متن و تصویر می‌پذیرند و در API رسمی Context تا یک میلیون توکن دارند.

مدل در ۱۰ مارس ۲۰۲۶ روی API عرضه شد و به خانواده Grok شرکت xAI تعلق دارد؛ شرکتی که اکنون در مستندات رسمی با نام SpaceXAI معرفی می‌شود. صفحه رسمی آن بر سرعت، تبعیت دقیق از Prompt و Tool Calling تأکید دارد، اما ادعای «کمترین نرخ Hallucination بازار» ادعای سازنده است و بدون شرایط آزمون نباید به‌عنوان حقیقت عمومی بازنشر شود.

Grok 4.20 اکنون جدیدترین مدل خانواده نیست. مستند رسمی هنوز Endpointها و قیمت آن را فهرست می‌کند، درحالی‌که Artificial Analysis، Deployment مورد ارزیابی خود را Deprecated و جانشین پیشنهادی را Grok 4.3 اعلام کرده است. همین تفاوت نشان می‌دهد «وجود API» و «پیشنهاد برای پروژه جدید» دو مفهوم جدا هستند.

معرفی کامل Grok 4.20

نام Grok 4.20 به یک خانواده از Snapshotها و Aliasها اشاره می‌کند، نه فقط یک Endpoint مبهم. صفحه رسمی مدل، grok-4.20-0309-reasoning را Snapshot اصلی Reasoning نشان می‌دهد. نسخه Non‑reasoning نیز با شناسه grok-4.20-0309-non-reasoning در جدول رسمی قیمت حضور دارد.

شماتیک روند ورودی، مدل و خروجی برای Grok 4.20
نمای شماتیک روند درخواست تا خروجی برای Grok 4.20؛ قابلیت‌های دقیق در متن مقاله آمده‌اند.

Alias عمومی grok-4.20 کار را ساده می‌کند، اما ممکن است مقصد آن در طول زمان تغییر کند. اگر نتیجه قابل‌بازتولید، Audit یا Benchmark اهمیت دارد، از شناسه تاریخ‌دار استفاده کنید و آن را همراه Region، Reasoning effort و ابزارهای فعال ثبت کنید.

جایگاه 4.20 در خانواده Grok، مدلی نسبتاً اقتصادی با Context بسیار بزرگ و سرعت Decode بالاست. مدل‌های 4.5 و 4.6 بعداً سقف هوش و Coding را بالاتر بردند، ولی Context آن‌ها ۵۰۰ هزار توکن است و نرخ خروجی Standard بیشتری دارند. بنابراین 4.20 هنوز برای بعضی Pipelineهای متن بلند یا پرحجم یک گزینه قابل‌بررسی است، البته پس از کنترل وضعیت Lifecycle.

قابلیت‌های اصلی

دو مسیر Reasoning و Non‑reasoning

نسخه Reasoning پیش از پاسخ پردازش بیشتری انجام می‌دهد و برای تحلیل، برنامه‌ریزی، ریاضی و تصمیم‌های چندقیدی مناسب‌تر است. نسخه Non‑reasoning پاسخ مستقیم می‌دهد و برای استخراج، بازنویسی، طبقه‌بندی و UI تعاملی می‌تواند Latency بهتری داشته باشد.

این دو نسخه را نباید فقط با یک Prompt تصادفی مقایسه کرد. معیار درست شامل دقت، زمان تا اولین توکن، تعداد توکن خروجی، هزینه کل و نرخ نیاز به Retry روی Dataset واقعی محصول است.

Context یک‌میلیون‌توکنی

SpaceXAI برای Endpoint رسمی Context برابر ۱٬۰۰۰٬۰۰۰ توکن اعلام می‌کند. چنین ظرفیتی برای آرشیو طولانی، Repository، پرونده حقوقی یا Logهای چندروزه مفید است. بااین‌حال از ۲۰۰ هزار توکن، تعرفه Long Context به کل درخواست اعمال می‌شود و تراکم اطلاعات می‌تواند Retrieval هدفمند را بهتر از ارسال یک‌جای همه اسناد کند.

Artificial Analysis برای Deployment موسوم به 0309 v2 عدد دو میلیون توکن ثبت کرده است. چون این عدد با مستند API رسمی SpaceXAI یکسان نیست، Buffalo147 AI مشخصه رسمی یک میلیون را مبنا می‌گیرد و عدد دو میلیون را فقط ویژگی گزارش‌شده برای همان Deployment یا Provider مستقل می‌داند.

فهم متن و تصویر

مدل Screenshot، نمودار، عکس سند و رابط کاربری را می‌بیند و پاسخ متنی می‌دهد. این قابلیت برای استخراج اطلاعات بصری یا بررسی خطا مفید است. تولید بومی تصویر، ویدیو یا صوت جزو خروجی خود 4.20 نیست و به ابزار یا مدل دیگری نیاز دارد.

Tool Calling و اطلاعات تازه

Function Calling و Structured Outputs در صفحه مدل پشتیبانی می‌شوند. در Responses API می‌توان ابزارهایی مانند Web Search، X Search، Code Execution، Collections Search و Remote MCP را نیز به Workflow اضافه کرد. نتیجه زنده فقط با فراخوانی واقعی Search به دست می‌آید؛ دانش داخلی مدل جایگزین وب لحظه‌ای نیست.

Batch و Prompt Caching

Batch API برای Snapshotهای Reasoning و Non‑reasoning پشتیبانی می‌شود و نرخ Token بیست درصد تخفیف دارد. Cached Input نیز به‌طور جداگانه قیمت‌گذاری شده است. این دو امکان، 4.20 را برای پردازش غیرهم‌زمان و Promptهای ثابت تکراری جذاب می‌کنند.

خروجی ساختاریافته

Structured Outputs برای تبدیل سند به JSON، استخراج Entity یا هماهنگی با Workflow داده مفید است. Schema باید ساده و قابل‌اعتبارسنجی بماند؛ درست‌بودن ساختار به معنی درست‌بودن داده استخراج‌شده نیست.

مهم‌ترین نقاط قوت

  • Context رسمی یک‌میلیون‌توکنی برای فایل‌ها و مکالمات بزرگ
  • امکان انتخاب Snapshotهای Reasoning و Non‑reasoning
  • سرعت خروجی نزدیک ۱۰۰ توکن‌برثانیه در ارزیابی مستقل هر دو نسخه
  • TTFT بسیار پایین نسخه Non‑reasoning در Snapshot مستقل
  • قیمت ۱٫۲۵ دلار ورودی و ۲٫۵۰ دلار خروجی برای Context کوتاه
  • پشتیبانی از Batch با ۲۰ درصد تخفیف
  • ورودی تصویر، Structured Outputs و اکوسیستم ابزارهای سروری

محدودیت‌ها و نقاط ضعف

مهم‌ترین محدودیت، وضعیت چرخه عمر است. صفحه رسمی SpaceXAI هنوز مدل را در فهرست API دارد، اما Artificial Analysis Deployment ارزیابی‌شده را Deprecated می‌داند. برای پروژه جدید باید 4.20 را در کنار Grok 4.3، 4.5 یا 4.6 ارزیابی و Plan مهاجرت تعریف کرد.

سه معیار ارزیابی عملی برای Grok 4.20
معیارهای پیشنهادی برای آزمون Grok 4.20 با کار واقعی؛ این تصویر دادهٔ بنچمارک یا امتیاز گزارش‌شده نیست.

مدل Reasoning با وجود Decode سریع، طبق ارزیابی مستقل حدود ۱۸٫۱۷ ثانیه تا اولین توکن فاصله دارد؛ درنتیجه برای UX زنده ممکن است کند حس شود. نسخه Non‑reasoning شروع بسیار سریع‌تری دارد، ولی امتیاز هوش مستقل آن پایین‌تر است.

تعرفه درخواست‌های ۲۰۰ هزار توکنی یا بیشتر دو برابر می‌شود. Context بزرگ همچنین تضمین نمی‌کند مدل هر جزئیات دورافتاده را بازیابی کند؛ آزمون Needle-in-a-haystack روی اسناد واقعی و Citation به بخش منبع لازم است.

تعداد پارامترها، معماری دقیق، Knowledge Cutoff و سقف خروجی عددی عمومی قابل‌تأیید پیدا نشد. logprobs و top_logprobs نیز برای Grok 4.20 و مدل‌های جدیدتر پشتیبانی نمی‌شوند و طبق راهنمای رسمی ممکن است بدون خطا نادیده گرفته شوند.

کاربردهای واقعی Grok 4.20

جستجو در آرشیو بزرگ

می‌توان اسناد، Ticketها یا Transcriptهای طولانی را وارد کرد و از مدل خواست پاسخ را با شناسه سند و قطعه شاهد ارائه دهد. Retrieval اولیه و محدودکردن Context معمولاً دقت و هزینه را بهتر می‌کند.

API سریع برای استخراج داده

نسخه Non‑reasoning برای تبدیل متن به Schema، برچسب‌گذاری Ticket یا استخراج مشخصات محصول مناسب است. روی فیلدهای حساس، Validation و نمونه‌برداری انسانی ضروری است.

تحلیل مسئله با Reasoning

نسخه Reasoning برای مقایسه سناریوها، بررسی وابستگی‌ها یا تهیه برنامه مهاجرت کاربرد دارد. Prompt باید معیار تصمیم و اطلاعات ناکافی را مشخص کند تا مدل به‌جای پرکردن خلأ، ابهام را گزارش دهد.

پایش وب و شبکه X

با Web Search و X Search می‌توان گزارش رویداد یا بازخورد بازار ساخت. منبع رسمی، خبر، نظر و شایعه باید در ستون‌های جدا قرار بگیرند و Timestamp حفظ شود.

پردازش Batch اسناد

برای خلاصه‌سازی شبانه، دسته‌بندی کاتالوگ یا استخراج غیرهم‌زمان، Batch با تخفیف ۲۰ درصد هزینه را پایین می‌آورد. SLA آن با API بلادرنگ یکی نیست و بیشتر Jobها طبق مستندات در بازه تا ۲۴ ساعت تکمیل می‌شوند.

Grok 4.20 مناسب چه کسانی است؟

مدل برای تیم‌های داده، توسعه‌دهندگان Backend، سازندگان RAG، تحلیلگران و کسب‌وکارهایی مناسب است که Context بزرگ، قیمت متوسط و امکان تغییر میان Reasoning و پاسخ سریع می‌خواهند.

برای Agent کدنویسی مرزی یا پروژه‌ای که به جدیدترین کیفیت نیاز دارد، 4.6 منطقی‌تر است. برای سامانه‌ای با عمر طولانی نیز باید Lifecycle مدل و Aliasها قبل از انتخاب بررسی شود.

مشخصات فنی Grok 4.20

مشخصه مقدار تأییدشده
Developer SpaceXAI / xAI
Model Family Grok 4
Model Type مدل اختصاصی متن‌و‌تصویر با نسخه‌های Reasoning و Non‑reasoning
API Release ۱۰ مارس ۲۰۲۶
Reasoning Snapshot grok-4.20-0309-reasoning
Non-reasoning Snapshot grok-4.20-0309-non-reasoning
Common Alias grok-4.20؛ برای بازتولیدپذیری Snapshot تاریخ‌دار ترجیح دارد
Input متن و تصویر
Output متن
Context Window ۱٬۰۰۰٬۰۰۰ توکن در API رسمی SpaceXAI
Maximum Output عدد عمومی قابل‌تأیید پیدا نشد
Knowledge Cutoff عمومی اعلام نشده است
Vision بله، فهم تصویر
Native Image / Audio / Video Generation خیر
Function Calling / Structured Outputs بله
Web / X Search بله، ابزارمحور
Batch API بله؛ ۲۰٪ تخفیف Token
Regions us-east-1 و us-west-2
Published rate limits ۳۷ درخواست در ثانیه و ۱۰ میلیون توکن در دقیقه
API Availability در مستندات رسمی فهرست شده؛ Deployment مستقل AA با برچسب Deprecated

۵ نمونه پرامپت کاربردی

۱. انتخاب خودکار مسیر Reasoning

این درخواست‌ها را به دو گروه تقسیم کن: «پاسخ مستقیم» و «نیازمند استدلال». معیارها را بنویس، سپس برای هر گروه Reasoning یا Non‑reasoning را پیشنهاد بده. دقت، TTFT، توکن خروجی و هزینه را در Eval ثبت کن.

۲. پاسخ مستند از آرشیو طولانی

فقط بر اساس اسناد پیوست پاسخ بده. برای هر ادعا شناسه فایل، عنوان بخش و یک شاهد کوتاه بیاور. اگر پاسخ در اسناد نیست، «در منبع موجود نیست» بنویس و از دانش حافظه‌ای استفاده نکن.

۳. استخراج سریع JSON

هر Ticket را به JSON مطابق Schema زیر تبدیل کن: category، severity، product، customer_request و needs_human_review. هیچ فیلدی را حدس نزن؛ مقدار ناموجود را null بگذار و JSON را با Schema اعتبارسنجی کن.

۴. گزارش روند با وب و X

رویدادهای ۷۲ ساعت اخیر درباره [موضوع] را با Web Search و X Search بررسی کن. منابع رسمی، رسانه‌ها و پست‌های کاربران را جدا کن؛ برای هر مورد لینک، زمان انتشار و سطح اطمینان بده و شمار تکرار یک خبر را با تأیید مستقل اشتباه نگیر.

۵. تحلیل تصویری خطای محصول

Screenshot خطا، لاگ و راهنمای محصول را کنار هم بررسی کن. متن داخل تصویر را استخراج کن، علت‌های محتمل را با شاهد رتبه‌بندی کن و یک Runbook کوتاه بساز. هر فرضی که نیاز به دسترسی سیستم دارد جدا علامت بزن.

بنچمارک‌ها و ارزیابی عملکرد

SpaceXAI در صفحه مدل 4.20 جدول عددی جامع و هم‌شرطی با رقبا منتشر نکرده است. به همین دلیل، جدول زیر از ارزیابی مستقل Artificial Analysis در Snapshot بررسی‌شده استفاده می‌کند. امتیازهای 4.20 تخمینی‌اند و صفحه ارزیاب اعلام می‌کند مدل Deprecated شده و فقط بار پیش‌فرض ۱۰هزارتوکنی همچنان پایش می‌شود.

مدل / حالت Intelligence Index v4.3؛ ترکیب ۱۰ Eval سرعت خروجی TTFT تاریخ و وضعیت منبع
Grok 4.20 0309 v2 Reasoning ۲۶، تخمینی ۱۰۰٫۴ توکن‌برثانیه ۱۸٫۱۷ ثانیه بررسی ۱۲ سپتامبر ۲۰۲۶، AA؛ Deployment منسوخ
Grok 4.20 0309 v2 Non‑reasoning ۱۴، تخمینی ۹۸٫۹ توکن‌برثانیه ۰٫۵۹ ثانیه بررسی ۱۲ سپتامبر ۲۰۲۶، AA؛ Deployment منسوخ
Grok 4.5 High ۳۹ ۵۵٫۵ توکن‌برثانیه ۸٫۳۳ ثانیه بررسی ۱۲ سپتامبر ۲۰۲۶، AA
Grok 4.6 High ۴۴ ۵۳٫۶ توکن‌برثانیه ۲۹ ثانیه بررسی ۱۲ سپتامبر ۲۰۲۶، AA

Intelligence Index v4.3 شامل ارزیابی‌هایی برای کار دانشی Agentic، کار حرفه‌ای، Automation، Terminal، Coding، HLE، اسناد حرفه‌ای، فیزیک، قابلیت اتکا و Long Context است. مقایسه Reasoning با Non‑reasoning باید با احتیاط خوانده شود؛ این دو در کلاس‌های متفاوت رتبه‌بندی می‌شوند و بودجه تفکر یکسان ندارند.

4.20 Reasoning از نسخه مستقیم امتیاز هوش بالاتری دارد، اما TTFT آن نزدیک ۳۱ برابر است. مدل‌های 4.5 و 4.6 در شاخص ترکیبی جدیدتر قوی‌ترند، درحالی‌که 4.20 تقریباً دو برابر سریع‌تر Token تولید می‌کند و خروجی ارزان‌تری دارد. این همان Trade-off واقعی است: 4.20 برای throughput و Context بزرگ، نسل‌های بعد برای سقف کیفیت.

عدد Context دو میلیون در صفحه AA مربوط به Deployment مورد سنجش آن‌هاست و با Context یک میلیون در مستند رسمی xAI همسان نیست. همچنین عددهای Composite دلیل کافی برای انتخاب Agent نیستند؛ Eval باید Retrieval accuracy، نرخ استناد درست، Latency و هزینه روی ورودی واقعی را بسنجد.

مقایسه Grok 4.20 با رقبا

مدل انتخاب مناسب‌تر برای ملاحظه اصلی
Grok 4.20 Reasoning تحلیل اقتصادی‌تر با Context یک‌میلیونی نسل قدیمی‌تر و TTFT محسوس
Grok 4.20 Non‑reasoning استخراج، دسته‌بندی و UI سریع سقف استدلال پایین‌تر
Grok 4.5 Coding Agentic و کیفیت بیشتر با خروجی فشرده Context نصف و قیمت خروجی بالاتر
Grok 4.6 پروژه‌های بلندمدت و کدنویسی Frontier TTFT بالاتر، بدون Batch
Grok 4.20 Multi‑Agent پژوهش موازی و چندمنبعی هزینه و Latency چند Agent و API بتا

اگر وظیفه به یک میلیون توکن یا پردازش Batch نیاز دارد، 4.20 مزیت عملی دارد. اگر مسئله پیچیده اما Context زیر ۵۰۰ هزار است، کیفیت بالاتر 4.5 یا 4.6 می‌تواند تعداد Retry و دخالت انسانی را کاهش دهد. برای پژوهش عمیق، Multi‑Agent را فقط زمانی انتخاب کنید که موازی‌سازی واقعاً ارزش هزینه اضافی را داشته باشد.

قیمت و API

قیمت‌های Standard رسمی در ۱۲ سپتامبر ۲۰۲۶ و به دلار برای هر یک میلیون توکن:

نوع توکن کمتر از ۲۰۰K Prompt از ۲۰۰K Prompt به بالا
Input ۱٫۲۵ دلار ۲٫۵۰ دلار
Cached Input ۰٫۲۰ دلار ۰٫۴۰ دلار
Output ۲٫۵۰ دلار ۵ دلار

این نرخ برای Snapshotهای Reasoning و Non‑reasoning فهرست شده است. آستانه ۲۰۰ هزار توکن باعث می‌شود نرخ Long Context روی همه توکن‌های درخواست اعمال شود. Batch روی تمام انواع Token بیست درصد تخفیف دارد؛ بنابراین نرخ نهایی Batch برابر ۸۰ درصد ارقام جدول است.

فراخوانی ابزار جداگانه محاسبه می‌شود: Web Search و Code Execution هرکدام ۵ دلار برای هزار Call، File Attachments ده دلار و Collections Search برابر ۲٫۵۰ دلار برای هزار Call. قیمت X Search از ۲۱ سپتامبر ۲۰۲۶ طبق برنامه رسمی از مدل Call-based به تعداد پست و پروفایل واکشی‌شده تغییر می‌کند.

Grok 4.20 را در Buffalo147 AI امتحان کنید

برای شروع، یک کار را یک‌بار با Reasoning و یک‌بار با Non‑reasoning اجرا کنید و فقط کیفیت متن را نسنجید؛ TTFT، توکن، نرخ خطا و هزینه نهایی را کنار هم ببینید. برای سند طولانی نیز از مدل بخواهید محل دقیق شاهد را برگرداند.

شروع استفاده از Grok 4.20 در Buffalo147 AI

جمع‌بندی

ویژگی متمایز Grok 4.20 انتخاب میان Reasoning و پاسخ سریع در کنار Context یک‌میلیون‌توکنی و قیمت مناسب است. نسخه Non‑reasoning برای UX سریع و نسخه Reasoning برای مسئله‌های پیچیده‌تر کاربرد دارد.

در مقابل، مدل دیگر پرچم‌دار خانواده نیست، اطلاعات فنی مهمی مانند Knowledge Cutoff اعلام نشده و وضعیت Lifecycle میان API رسمی و Tracker مستقل یکسان توصیف نمی‌شود. این موارد برای Production به Pin کردن Snapshot و برنامه مهاجرت نیاز دارند.

اگر Context بسیار بزرگ، Batch یا throughput اولویت است، 4.20 هنوز ارزش Eval دارد. اگر بالاترین کیفیت Agentic یا Coding مهم‌تر است، 4.5 و به‌ویژه 4.6 نقطه شروع منطقی‌تری هستند.

پرسش‌های متداول

Grok 4.20 چیست؟

خانواده‌ای از مدل‌های اختصاصی SpaceXAI با ورودی متن و تصویر، Context رسمی یک میلیون توکن و نسخه‌های Reasoning و Non‑reasoning است.

تفاوت نسخه Reasoning و Non‑reasoning چیست؟

Reasoning برای مسئله پیچیده پردازش بیشتری انجام می‌دهد؛ Non‑reasoning سریع‌تر پاسخ می‌دهد. در Snapshot مستقل، نسخه Reasoning امتیاز هوش بالاتر و TTFT بسیار بیشتری داشت.

آیا Grok 4.20 برای برنامه‌نویسی مناسب است؟

برای تحلیل کد، استخراج و ابزارهای Code Execution قابل‌استفاده است؛ برای Coding Agentic مرزی، Grok 4.5 یا 4.6 معمولاً انتخاب جدیدتری است.

Context Window آن یک یا دو میلیون توکن است؟

مستند رسمی SpaceXAI برای API عدد یک میلیون را اعلام می‌کند. Artificial Analysis برای Deployment 0309 v2 خود دو میلیون ثبت کرده؛ این دو سطح دسترسی را نباید یکی دانست.

آیا Grok 4.20 API و Batch دارد؟

بله؛ Snapshotهای Reasoning و Non‑reasoning در API رسمی فهرست شده‌اند و Batch با تخفیف ۲۰ درصد پشتیبانی می‌شود.

آیا Grok 4.20 منسوخ شده است؟

Endpoint هنوز در مستند رسمی و Pricing دیده می‌شود، اما Artificial Analysis Deployment مورد سنجش خود را Deprecated می‌نامد. برای پروژه جدید، وضعیت حساب و Plan مهاجرت را بررسی کنید.

آیا Grok 4.20 به وب دسترسی دارد؟

بله، از طریق ابزار Web Search و همچنین X Search. دسترسی زنده ابزارمحور و مشمول هزینه جداست.

قیمت API چقدر است؟

برای Context کوتاه، ورودی ۱٫۲۵ و خروجی ۲٫۵۰ دلار به‌ازای یک میلیون توکن است؛ از ۲۰۰ هزار توکن به بالا نرخ‌ها دو برابر می‌شوند.

منابع

یادداشت تحریریه Buffalo147 AI: ادعای «کمترین Hallucination بازار» در صفحه سازنده بدون جدول هم‌شرط مستقل آمده و در این مقاله به‌عنوان ادعای Vendor گزارش شده است. اعداد AA مربوط به Deploymentهای مشخص‌اند و Context آن‌ها با مشخصات API رسمی یکسان نیست.

خواندنی‌های دیگر