Grok 4.20 Multi‑Agent؛ بررسی تیم ۴ یا ۱۶ ایجنتی برای پژوهش عمیق
آخرین راستیآزمایی: ۱۲ سپتامبر ۲۰۲۶
تاریخ عرضه: روز دقیق عرضه در متن فعلی ثبت نشده است.
قیمت و شیوهٔ محاسبه: Input ۱٫۲۵ دلار؛ Output ۲٫۵۰ دلار؛ بهازای هر یک میلیون توکن تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.
مقدمه
گاهی یک مدل واحد برای سؤال پیچیده، مسیری خطی را دنبال میکند و دیدگاههای جایگزین را از دست میدهد. Grok 4.20 Multi‑Agent برای شکستن همین الگو ساخته شده است: چند Agent بهطور همزمان سراغ بخشهای متفاوت مسئله میروند، منابع را جمع میکنند و یک Agent رهبر نتیجه را ترکیب میکند.
نام کامل رسمی این محصول Grok 4.20 Multi-Agent Beta است. در Master List پروژه نام کوتاهتر Grok 4.20 Multi‑Agent آمده، اما واژه Beta مهم است؛ SpaceXAI صریحاً هشدار میدهد رابط و رفتار API نهایی نیست و احتمال Breaking change وجود دارد.
این مدل در ۱۰ مارس ۲۰۲۶ وارد API شد و برای Deep Research چندمرحلهای طراحی شده است. ارزش آن در «تعداد Agent» بهتنهایی نیست؛ توان جستجوی موازی در وب و X، تحلیل داده، Cross-reference و ساخت پاسخ منبعدار است. همین معماری هزینه و Latency را نیز افزایش میدهد و برای هر سؤال ساده مناسب نیست.
معرفی کامل Grok 4.20 Multi‑Agent
Grok 4.20 Multi‑Agent یک Variant از خانواده Grok 4.20 است، نه مجموعهای از حسابهای چت که کاربر دستی کنار هم قرار دهد. Snapshot رسمی آن grok-4.20-multi-agent-0309 و Alias عمومی آن grok-4.20-multi-agent است. برای Production و Eval، شناسه تاریخدار قابلیت بازتولید بهتری دارد.

شرکت سازنده در فهرست پروژه xAI است و در منابع رسمی فعلی نام SpaceXAI را بهکار میبرد. مدل پایه مالکیتی است و جزئیات پارامترها یا معماری داخلی Agentها منتشر نشدهاند. آنچه در API دیده میشود یک رهبر، گروهی از Sub-agentها و ابزارهای سروری است.
مدل در دو چیدمان اجرا میشود: ۴ Agent برای پرسش متمرکز و ۱۶ Agent برای موضوع چندوجهی و عمیق. در xAI SDK تعداد با agent_count انتخاب میشود؛ در Responses API و SDKهای سازگار، Effortهای low یا medium به چیدمان ۴تایی و high یا xhigh به چیدمان ۱۶تایی نگاشت میشوند.
خروجی پیشفرض فقط Tool Callها و پاسخ نهایی Agent رهبر را نشان میدهد. وضعیت میانی Sub-agentها نمایش داده نمیشود؛ در xAI SDK تنها با use_encrypted_content=True میتوان محتوای رمزشده لازم برای ادامه گفتگو را در Response نگه داشت.
قابلیتهای اصلی
پژوهش موازی با چند Agent
Sub-agentها میتوانند بهطور همزمان منابع مختلف را جستجو، داده را تحلیل و دیدگاهها را مقایسه کنند. Leader یافتهها را ادغام میکند. این الگو برای سؤالهایی ارزش دارد که واقعاً قابل تقسیماند؛ مثلاً بررسی فناوری، اقتصاد، مقررات و ریسک یک بازار در چهار مسیر جدا.
اگر مسئله کوچک یا بسیار ترتیبی باشد، Agentهای بیشتر لزوماً کیفیت را بالا نمیبرند. ممکن است چند Agent یک منبع را تکرار کنند، اختلاف حلنشده ایجاد کنند یا هزینه را بدون ارزش افزوده افزایش دهند.
Web Search و X Search
ابزارهای web_search و x_search برای گردآوری اطلاعات تازه پشتیبانی میشوند. سیستم میتواند چند جستجو را موازی انجام دهد و Citation ارائه کند. تعداد اشاره به یک ادعا معادل چند منبع مستقل نیست؛ Syndication، نقلقول حلقوی و پستهای بدون مدرک باید در Prompt کنترل شوند.
Code Execution و تحلیل داده
Code Execution برای محاسبه، پاکسازی داده یا بررسی سازگاری ارقام کاربرد دارد. Collections Search نیز دادههای آپلودشده را وارد پژوهش میکند. ابزار Remote MCP امکان اتصال به سرورهای سازگار را میدهد، اما سطح دسترسی و Audit باید در لایه محصول مدیریت شود.
ورودی تصویر و Context بزرگ
مدل متن و تصویر میپذیرد و Context رسمی آن یک میلیون توکن است. برای نمونه میتوان چند نمودار، Screenshot و مجموعه سند را همزمان بررسی کرد. خروجی نهایی متن است و تولید بومی تصویر، ویدیو یا صوت ندارد.
گفتگوهای چندمرحلهای
با previous_response_id میتوان پژوهش را در چند Turn ادامه داد: ابتدا نقشه موضوع، سپس بررسی عمیق یک شاخه و در پایان نقد شواهد. این روش معمولاً از یک Prompt بسیار بزرگ قابلکنترلتر است.
Structured Outputs و Batch
صفحه مدل Structured Outputs و Batch API را پشتیبانیشده نشان میدهد. Batch برای Jobهای غیرهمزمان ۲۰ درصد تخفیف Token دارد. در یک Workflow پژوهشی باید آزمود که آیا خروجی ساختاریافته با پاسخهای بلند و Citationها سازگار میماند یا خیر.
مهمترین نقاط قوت
- تقسیم همزمان یک پژوهش پیچیده میان ۴ یا ۱۶ Agent
- ترکیب Web Search، X Search، Code Execution و Collections Search
- Context رسمی یکمیلیونتوکنی و ورودی تصویر
- مناسب برای Cross-reference و تحلیل چنددیدگاهی
- امکان ادامه تحقیق در چند Turn با
previous_response_id - پشتیبانی از Batch با ۲۰ درصد تخفیف Token
- خروجی تمیز Leader در حالت پیشفرض بدون نمایش انبوه وضعیت داخلی
محدودیتها و نقاط ضعف
این قابلیت همچنان Beta است و احتمال تغییر ناسازگار در API یا رفتار وجود دارد. برای سرویس Production باید Contract test، Pin کردن Snapshot، Feature flag و مسیر بازگشت به مدل تکعاملی داشته باشید.

هزینه فقط مربوط به پاسخ Leader نیست. تمام Input، Output و Reasoning tokenهای Leader و Sub-agentها محاسبه میشوند و هر Tool Call هر Agent نیز جداگانه صورتحساب دارد. یک درخواست ۱۶عاملی ممکن است چند برابر یک درخواست معمولی هزینه داشته باشد.
Custom tool یا Client-side function calling در Variant Multi‑Agent پشتیبانی نمیشود؛ فقط Built-in tools و Remote MCP قابلاستفادهاند. Chat Completions API نیز پشتیبانی نمیشود و باید از Responses API یا xAI SDK استفاده کرد. پارامتر max_tokens هم قابلاستفاده نیست.
فقط نتیجه Agent رهبر بهشکل خوانا برمیگردد. این طراحی Response را تمیز میکند، ولی Debug کردن اینکه کدام Sub-agent به نتیجه نادرست رسیده دشوارتر است. برای کاربرد ممیزیپذیر باید Citation coverage، Usage و Tool log را ذخیره کرد.
Rate limit منتشرشده ۹ درخواست در ثانیه و ۲٫۵ میلیون توکن در دقیقه است؛ بسیار پایینتر از Grok 4.20 تکعاملی. همچنین Agentهای بیشتر Latency و مصرف توکن را افزایش میدهند و کیفیت بهتر تضمینشده نیست.
کاربردهای واقعی Grok 4.20 Multi‑Agent
گزارش Due Diligence چندمحوری
چهار Agent میتوانند محصول، رقبا، ریسک حقوقی و شاخصهای مالی یک شرکت را جدا بررسی کنند. Leader باید اختلاف دادهها، تاریخ و منبع اولیه هر ادعا را نگه دارد؛ خروجی جایگزین بررسی حقوقی یا مالی متخصص نیست.
مرور ادبیات علمی
Agentها میتوانند شاخههای یک موضوع، مقالات کلیدی، روشها و نتایج مخالف را تقسیم کنند. Prompt باید DOI، تاریخ، وضعیت Peer review و تفاوت Preprint با مقاله چاپشده را الزام کند.
تحلیل بازار بین چند کشور
در یک مطالعه ورود به بازار، هر Agent میتواند مقررات، رقبا، قیمت یا رفتار مصرفکننده را بررسی کند. استفاده از ۱۶ Agent تنها وقتی ارزش دارد که ابعاد و منابع کافی برای تقسیم واقعی کار وجود داشته باشد.
راستیآزمایی یک ادعای خبری
Web و X Search برای ردیابی منبع اولیه، Timestamp و واکنشها مناسباند. سیستم باید خبر رسمی، گزارش رسانه و ادعای کاربر را جدا نگه دارد و «نبود شاهد» را نتیجه معتبر بداند.
بررسی فناوریهای رقیب
Agentها میتوانند مستندات رسمی، Benchmark، هزینه و محدودیت عملی چند فناوری را موازی بررسی کنند. Leader در پایان باید تفاوت Harnessها را توضیح دهد، نه اینکه فقط یک برنده معرفی کند.
Grok 4.20 Multi‑Agent مناسب چه کسانی است؟
این سیستم برای پژوهشگران، تحلیلگران بازار، تیمهای Due Diligence، روزنامهنگاران داده، مشاوران و سازندگان ابزار Deep Research مناسب است. شرط اصلی این است که مسئله چندبخشی، منابع متنوع و ارزش اقتصادی کافی برای موازیسازی داشته باشد.
برای FAQ ساده، خلاصهسازی یک فایل، استخراج JSON یا پاسخ زنده در UI، Grok 4.20 تکعاملی یا یک مدل سریعتر انتخاب منطقیتری است. اگر Custom function ضروری است، محدودیت فعلی Multi‑Agent مستقیماً مانع است.
مشخصات فنی Grok 4.20 Multi‑Agent
| مشخصه | مقدار تأییدشده |
|---|---|
| Developer | SpaceXAI / xAI |
| Official Name | Grok 4.20 Multi-Agent Beta |
| Model Family | Grok 4.20 |
| Model Type | سیستم پژوهشی اختصاصی با Leader و چند Sub-agent |
| API Release | ۱۰ مارس ۲۰۲۶ |
| Snapshot ID | grok-4.20-multi-agent-0309 |
| Common Alias | grok-4.20-multi-agent |
| Agent Configurations | ۴ Agent یا ۱۶ Agent |
| Input | متن و تصویر |
| Output | متنِ Agent رهبر |
| Context Window | ۱٬۰۰۰٬۰۰۰ توکن |
| Maximum Output | عدد عمومی اعلام نشده؛ max_tokens پشتیبانی نمیشود |
| Knowledge Cutoff | عمومی اعلام نشده است |
| Built-in Tools | Web Search، X Search، Code Execution و Collections Search |
| Remote MCP | بله |
| Client-side / Custom Tools | خیر |
| Chat Completions API | خیر |
| Responses API / xAI SDK | بله |
| Structured Outputs | در صفحه مدل پشتیبانیشده درج شده است |
| Batch API | بله؛ ۲۰٪ تخفیف Token |
| Regions | us-east-1 و us-west-2 |
| Published rate limits | ۹ درخواست در ثانیه و ۲٫۵ میلیون توکن در دقیقه |
| Stability | Beta؛ احتمال Breaking change |
۵ نمونه پرامپت کاربردی
۱. Due Diligence منبعمحور
شرکت [نام] را از چهار زاویه محصول، بازار، وضعیت مالی و ریسک حقوقی بررسی کن. هر Agent فقط یک زاویه را با منابع اولیه پوشش دهد. Leader اختلاف ارقام را حفظ کند و جدول نهایی شامل ادعا، شاهد، تاریخ، منبع و سطح اطمینان باشد.
۲. مرور علمی با ۱۶ Agent
یک مرور نظاممند اولیه درباره [موضوع] انجام بده. دامنه را به نظریه، روش، Dataset، نتایج مثبت، نتایج منفی، محدودیت و شکاف پژوهشی تقسیم کن. فقط مقاله یا Preprint قابلردیابی بیاور و DOI، سال، وضعیت داوری و تعارض نتایج را ثبت کن.
۳. مقایسه فنی چند محصول
[محصول A]، [محصول B] و [محصول C] را بر اساس مستندات رسمی، قیمت فعلی، SLA، امنیت، قابلیت مهاجرت و محدودیت API مقایسه کن. برای هر عدد لینک و تاریخ بده؛ تنظیمات Benchmark ناهمسان را در یک ستون جدا هشدار بده.
۴. راستیآزمایی خبر
ادعای زیر را با Web Search و X Search راستیآزمایی کن. مسیر انتشار را تا اولین منبع قابلشناسایی دنبال کن، نقلهای مستقل را از بازنشر جدا کن، Timeline بساز و در پایان نتیجه را «تأییدشده، ردشده، حلنشده» اعلام کن.
۵. پژوهش مرحلهای بازار
برای ورود محصول [نوع محصول] به [کشورها] ابتدا مقررات، رقبا، قیمت، کانال توزیع و رفتار مشتری را موازی بررسی کن. در این Turn فقط نقشه شواهد و خلأ داده را بده؛ توصیه نهایی را تا تأیید من ارائه نکن.
بنچمارکها و ارزیابی عملکرد
تا تاریخ بررسی، SpaceXAI برای Snapshot دقیق grok-4.20-multi-agent-0309 جدول Benchmark عددی و همشرطی مانند SWE-bench، GPQA یا HLE منتشر نکرده است. Arena در ۲۶ مارس ۲۰۲۶ اضافهشدن این Snapshot به Leaderboardهای Text، Vision و Search را ثبت کرده، اما صفحه عمومی قابلبازیابی در زمان بررسی امتیاز پایدار و دقیق همه بخشها را ارائه نکرد. بنابراین عددی از Snippetهای مبهم وارد مقاله نشده است.
| منبع / ارزیابی | چه چیزی را میسنجد؟ | نتیجه قابلتأیید برای نسخه دقیق | تاریخ |
|---|---|---|---|
| SpaceXAI Model & Multi-Agent Docs | قابلیت، معماری، ابزار و محدودیت عملی | امتیاز Benchmark رقابتی منتشر نشده | بررسی ۱۲ سپتامبر ۲۰۲۶ |
| Arena Text / Vision / Search | ترجیح کاربران در پاسخ، تصویر و جستجو | حضور مدل تأیید شده؛ امتیاز پایدار قابلاستخراج نبود | اضافهشدن ۲۶ مارس ۲۰۲۶ |
| Benchmark مستقل Agentic | کیفیت پژوهش چندمرحلهای و هزینه Task | نتیجه عمومی معتبر برای Snapshot دقیق پیدا نشد | بررسی ۱۲ سپتامبر ۲۰۲۶ |
این نبود عدد به معنی ضعیفبودن یا قویبودن مدل نیست؛ فقط یعنی ادعای رتبهبندی قابل دفاع نداریم. Benchmark مدل پایه Grok 4.20 را هم نمیتوان به Multi‑Agent تعمیم داد، زیرا Harness، تعداد Agent، ابزار، توکن و Latency تغییر میکند.
Eval پیشنهادی برای سنجش منصفانه
برای تصمیم Production، مجموعهای از ۳۰ تا ۱۰۰ سؤال واقعی بسازید و Grok 4.20 Multi‑Agent را با Grok 4.20 تکعاملی و یک رقیب Deep Research در شرایط یکسان مقایسه کنید:
| معیار | روش اندازهگیری |
|---|---|
| Citation precision | درصد Citationهایی که دقیقاً ادعای کنار خود را پشتیبانی میکنند |
| Citation coverage | سهم ادعاهای قابلبررسی که منبع معتبر دارند |
| Source independence | تعداد منابع واقعاً مستقل پس از حذف بازنشرها |
| Task success | درصد سؤالهایی که Rubric تخصصی را کامل پاس میکنند |
| Conflict handling | توان حفظ اختلاف منابع بهجای ادغام نادرست |
| Cost per accepted answer | مجموع Token و Tool cost تقسیم بر خروجی تأییدشده |
| End-to-end latency | زمان کامل از Request تا پاسخ قابلاستفاده |
مقایسه ۴ و ۱۶ Agent نیز باید جدا انجام شود. اگر ۱۶ Agent فقط Citation تکراری و هزینه بیشتر میسازند، معماری کوچکتر انتخاب بهتر است. Benchmark مفید در اینجا «هوش خام» نیست؛ کیفیت شواهد به ازای هزینه و زمان است.
مقایسه Grok 4.20 Multi‑Agent با رقبا
| گزینه | انتخاب مناسبتر برای | محدودیت یا Trade-off |
|---|---|---|
| Grok 4.20 Multi‑Agent، ۴ Agent | تحقیق متمرکز و سریعتر با چند منبع | عمق کمتر از چیدمان ۱۶تایی |
| Grok 4.20 Multi‑Agent، ۱۶ Agent | مسئله چندکشوری یا چندرشتهای با شاخههای مستقل | Token، Tool cost و Latency بسیار بیشتر |
| Grok 4.20 تکعاملی | خلاصه، استخراج، تحلیل خطی و کنترل هزینه | موازیسازی پژوهش داخلی ندارد |
| Grok 4.6 | Coding و Agentهای بلندمدت با Function Calling | سیستم Deep Research چندعاملی دقیقاً مشابه نیست |
| سرویسهای Deep Research رقیب | پژوهش تعاملی در UI یا اکوسیستم همان ارائهدهنده | API، Citation policy و قیمت باید جدا سنجیده شود |
Multi‑Agent زمانی برنده است که Task قابل تقسیم و کیفیت شواهد ارزش هزینه را داشته باشد. در کارهای ترتیبی، یک Agent قوی با ابزار و Prompt مناسب اغلب ارزانتر، قابلدیباگتر و سریعتر است.
قیمت و API
نرخ پایه رسمی مدل در ۱۲ سپتامبر ۲۰۲۶ به دلار و برای هر یک میلیون توکن است:
| نوع توکن | کمتر از ۲۰۰K Prompt | از ۲۰۰K Prompt به بالا |
|---|---|---|
| Input | ۱٫۲۵ دلار | ۲٫۵۰ دلار |
| Cached Input | ۰٫۲۰ دلار | ۰٫۴۰ دلار |
| Output | ۲٫۵۰ دلار | ۵ دلار |
این جدول ممکن است ارزان به نظر برسد، اما تمام توکنهای Leader و Sub-agentها، شامل Reasoning، محاسبه میشوند. تمام فراخوانیهای ابزار هر Agent نیز جداگانه قیمت دارند. بنابراین هزینه نهایی را با فیلدهای usage و server_side_tool_usage بسنجید، نه فقط طول پاسخ نهایی.
Web Search و Code Execution هرکدام ۵ دلار برای هزار Call، File Attachments ده دلار و Collections Search برابر ۲٫۵۰ دلار برای هزار Call هستند. X Search در تاریخ بررسی ۵ دلار برای هزار Call است و از ۲۱ سپتامبر ۲۰۲۶ طبق اعلام رسمی، براساس پست و پروفایل واکشیشده قیمتگذاری خواهد شد.
Batch برای این Snapshot ۲۰ درصد تخفیف Token دارد. آستانه Long Context از ۲۰۰ هزار توکن است و پس از عبور، نرخ بالاتر روی کل توکنهای Request اعمال میشود.
Grok 4.20 Multi‑Agent را در Buffalo147 AI امتحان کنید
یک سؤال واقعاً چندمحوری انتخاب کنید و از چهار Agent شروع کنید. در Prompt نوع منبع، بازه زمانی، قالب Citation و معیار پذیرش را دقیق بنویسید؛ فقط اگر پوشش شواهد کافی نبود، سراغ ۱۶ Agent بروید.
شروع استفاده از Grok 4.20 Multi‑Agent در Buffalo147 AI
جمعبندی
مهمترین مزیت Grok 4.20 Multi‑Agent توان تقسیم پژوهش میان چند Agent و ترکیب جستجو، تحلیل و Cross-reference است. برای Due Diligence، مرور علمی یا مقایسه چندبازاری میتواند خروجی غنیتری از یک مسیر خطی بسازد.
محدودیت اصلی، Beta بودن و هزینهای است که پشت پاسخ کوتاه Leader پنهان میماند. نبود Custom tools، نبود Chat Completions، ناتوانی در تنظیم max_tokens و دشواری مشاهده مسیر Sub-agentها نیز برای مهندسی Production مهماند.
این مدل را برای سؤالهای ساده انتخاب نکنید. زمانی ارزش دارد که هر شاخه پژوهش نقش مستقلی داشته باشد و کیفیت Citation بهازای هزینه با Eval واقعی تأیید شود.
پرسشهای متداول
Grok 4.20 Multi‑Agent چیست؟
نسخه Beta پژوهشی SpaceXAI است که یک Leader، چهار یا شانزده Agent را برای جستجو، تحلیل و ساخت پاسخ منبعدار هماهنگ میکند.
تفاوت ۴ و ۱۶ Agent چیست؟
چهار Agent برای تحقیق متمرکز و سریعتر پیشنهاد شدهاند؛ شانزده Agent برای موضوع عمیق و چندوجهی، با مصرف Token و Latency بیشتر.
آیا این مدل Benchmark معتبر دارد؟
حضور آن در Arenaهای Text، Vision و Search ثبت شده، اما تا تاریخ بررسی امتیاز عمومی پایدار و جدول همشرط معتبر برای Snapshot دقیق پیدا نشد. بنابراین عددی حدس زده نشده است.
آیا Grok 4.20 Multi‑Agent API دارد؟
بله، از xAI SDK و Responses API استفاده میکند. Chat Completions برای این Variant پشتیبانی نمیشود.
آیا میتوان Custom Function به آن داد؟
فعلاً خیر. Custom و Client-side tools پشتیبانی نمیشوند؛ Built-in tools و Remote MCP در دسترساند.
هزینه یک درخواست Multi‑Agent چگونه محاسبه میشود؟
توکنهای Leader و تمام Sub-agentها، Reasoning و همه Tool Callها محاسبه میشوند. به همین دلیل هزینه میتواند چند برابر پاسخ تکعاملی باشد.
آیا مدل به وب و X دسترسی دارد؟
بله، با ابزارهای Web Search و X Search. استفاده هر Agent از این ابزارها در Usage و هزینه محاسبه میشود.
آیا برای Production مناسب است؟
قابلآزمایش است، اما Beta بودن و احتمال Breaking change ایجاب میکند Snapshot پین، Contract test، Budget limit و Fallback داشته باشید.
منابع
- صفحه رسمی Grok 4.20 Multi-Agent Beta
- راهنمای رسمی Multi Agent
- قیمت رسمی API و ابزارهای SpaceXAI
- Release Notes رسمی API
- تغییرات رسمی Leaderboardهای Arena
یادداشت تحریریه Buffalo147 AI: برای Snapshot دقیق این مدل امتیاز Benchmark پایدار و قابلتأیید پیدا نشد. حضور در Leaderboard با داشتن رتبه فعلی قابلاستناد یکسان نیست؛ ازاینرو بهجای عددسازی، روش Eval عملی ارائه شده است.