Buffalo147 AI

خانه › بلاگ

Grok 4.20 Multi‑Agent؛ بررسی تیم ۴ یا ۱۶ ایجنتی برای پژوهش عمیق

جلد Grok 4.20 Multi-Agent با طراحی سه‌بعدی مشکی و نور مسی

آخرین راستی‌آزمایی: ۱۲ سپتامبر ۲۰۲۶

در یک نگاه | Grok 4.20 Multi-Agent
تاریخ عرضه: روز دقیق عرضه در متن فعلی ثبت نشده است.
قیمت و شیوهٔ محاسبه: Input ۱٫۲۵ دلار؛ Output ۲٫۵۰ دلار؛ به‌ازای هر یک میلیون توکن تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.

مقدمه

گاهی یک مدل واحد برای سؤال پیچیده، مسیری خطی را دنبال می‌کند و دیدگاه‌های جایگزین را از دست می‌دهد. Grok 4.20 Multi‑Agent برای شکستن همین الگو ساخته شده است: چند Agent به‌طور هم‌زمان سراغ بخش‌های متفاوت مسئله می‌روند، منابع را جمع می‌کنند و یک Agent رهبر نتیجه را ترکیب می‌کند.

نام کامل رسمی این محصول Grok 4.20 Multi-Agent Beta است. در Master List پروژه نام کوتاه‌تر Grok 4.20 Multi‑Agent آمده، اما واژه Beta مهم است؛ SpaceXAI صریحاً هشدار می‌دهد رابط و رفتار API نهایی نیست و احتمال Breaking change وجود دارد.

این مدل در ۱۰ مارس ۲۰۲۶ وارد API شد و برای Deep Research چندمرحله‌ای طراحی شده است. ارزش آن در «تعداد Agent» به‌تنهایی نیست؛ توان جستجوی موازی در وب و X، تحلیل داده، Cross-reference و ساخت پاسخ منبع‌دار است. همین معماری هزینه و Latency را نیز افزایش می‌دهد و برای هر سؤال ساده مناسب نیست.

معرفی کامل Grok 4.20 Multi‑Agent

Grok 4.20 Multi‑Agent یک Variant از خانواده Grok 4.20 است، نه مجموعه‌ای از حساب‌های چت که کاربر دستی کنار هم قرار دهد. Snapshot رسمی آن grok-4.20-multi-agent-0309 و Alias عمومی آن grok-4.20-multi-agent است. برای Production و Eval، شناسه تاریخ‌دار قابلیت بازتولید بهتری دارد.

شماتیک روند ورودی، مدل و خروجی برای Grok 4.20 Multi-Agent
نمای شماتیک روند درخواست تا خروجی برای Grok 4.20 Multi-Agent؛ قابلیت‌های دقیق در متن مقاله آمده‌اند.

شرکت سازنده در فهرست پروژه xAI است و در منابع رسمی فعلی نام SpaceXAI را به‌کار می‌برد. مدل پایه مالکیتی است و جزئیات پارامترها یا معماری داخلی Agentها منتشر نشده‌اند. آنچه در API دیده می‌شود یک رهبر، گروهی از Sub-agentها و ابزارهای سروری است.

مدل در دو چیدمان اجرا می‌شود: ۴ Agent برای پرسش متمرکز و ۱۶ Agent برای موضوع چندوجهی و عمیق. در xAI SDK تعداد با agent_count انتخاب می‌شود؛ در Responses API و SDKهای سازگار، Effortهای low یا medium به چیدمان ۴تایی و high یا xhigh به چیدمان ۱۶تایی نگاشت می‌شوند.

خروجی پیش‌فرض فقط Tool Callها و پاسخ نهایی Agent رهبر را نشان می‌دهد. وضعیت میانی Sub-agentها نمایش داده نمی‌شود؛ در xAI SDK تنها با use_encrypted_content=True می‌توان محتوای رمز‌شده لازم برای ادامه گفتگو را در Response نگه داشت.

قابلیت‌های اصلی

پژوهش موازی با چند Agent

Sub-agentها می‌توانند به‌طور هم‌زمان منابع مختلف را جستجو، داده را تحلیل و دیدگاه‌ها را مقایسه کنند. Leader یافته‌ها را ادغام می‌کند. این الگو برای سؤال‌هایی ارزش دارد که واقعاً قابل تقسیم‌اند؛ مثلاً بررسی فناوری، اقتصاد، مقررات و ریسک یک بازار در چهار مسیر جدا.

اگر مسئله کوچک یا بسیار ترتیبی باشد، Agentهای بیشتر لزوماً کیفیت را بالا نمی‌برند. ممکن است چند Agent یک منبع را تکرار کنند، اختلاف حل‌نشده ایجاد کنند یا هزینه را بدون ارزش افزوده افزایش دهند.

ابزارهای web_search و x_search برای گردآوری اطلاعات تازه پشتیبانی می‌شوند. سیستم می‌تواند چند جستجو را موازی انجام دهد و Citation ارائه کند. تعداد اشاره به یک ادعا معادل چند منبع مستقل نیست؛ Syndication، نقل‌قول حلقوی و پست‌های بدون مدرک باید در Prompt کنترل شوند.

Code Execution و تحلیل داده

Code Execution برای محاسبه، پاک‌سازی داده یا بررسی سازگاری ارقام کاربرد دارد. Collections Search نیز داده‌های آپلودشده را وارد پژوهش می‌کند. ابزار Remote MCP امکان اتصال به سرورهای سازگار را می‌دهد، اما سطح دسترسی و Audit باید در لایه محصول مدیریت شود.

ورودی تصویر و Context بزرگ

مدل متن و تصویر می‌پذیرد و Context رسمی آن یک میلیون توکن است. برای نمونه می‌توان چند نمودار، Screenshot و مجموعه سند را هم‌زمان بررسی کرد. خروجی نهایی متن است و تولید بومی تصویر، ویدیو یا صوت ندارد.

گفتگوهای چندمرحله‌ای

با previous_response_id می‌توان پژوهش را در چند Turn ادامه داد: ابتدا نقشه موضوع، سپس بررسی عمیق یک شاخه و در پایان نقد شواهد. این روش معمولاً از یک Prompt بسیار بزرگ قابل‌کنترل‌تر است.

Structured Outputs و Batch

صفحه مدل Structured Outputs و Batch API را پشتیبانی‌شده نشان می‌دهد. Batch برای Jobهای غیرهم‌زمان ۲۰ درصد تخفیف Token دارد. در یک Workflow پژوهشی باید آزمود که آیا خروجی ساختاریافته با پاسخ‌های بلند و Citationها سازگار می‌ماند یا خیر.

مهم‌ترین نقاط قوت

  • تقسیم هم‌زمان یک پژوهش پیچیده میان ۴ یا ۱۶ Agent
  • ترکیب Web Search، X Search، Code Execution و Collections Search
  • Context رسمی یک‌میلیون‌توکنی و ورودی تصویر
  • مناسب برای Cross-reference و تحلیل چنددیدگاهی
  • امکان ادامه تحقیق در چند Turn با previous_response_id
  • پشتیبانی از Batch با ۲۰ درصد تخفیف Token
  • خروجی تمیز Leader در حالت پیش‌فرض بدون نمایش انبوه وضعیت داخلی

محدودیت‌ها و نقاط ضعف

این قابلیت همچنان Beta است و احتمال تغییر ناسازگار در API یا رفتار وجود دارد. برای سرویس Production باید Contract test، Pin کردن Snapshot، Feature flag و مسیر بازگشت به مدل تک‌عاملی داشته باشید.

سه معیار ارزیابی عملی برای Grok 4.20 Multi-Agent
معیارهای پیشنهادی برای آزمون Grok 4.20 Multi-Agent با کار واقعی؛ این تصویر دادهٔ بنچمارک یا امتیاز گزارش‌شده نیست.

هزینه فقط مربوط به پاسخ Leader نیست. تمام Input، Output و Reasoning tokenهای Leader و Sub-agentها محاسبه می‌شوند و هر Tool Call هر Agent نیز جداگانه صورت‌حساب دارد. یک درخواست ۱۶عاملی ممکن است چند برابر یک درخواست معمولی هزینه داشته باشد.

Custom tool یا Client-side function calling در Variant Multi‑Agent پشتیبانی نمی‌شود؛ فقط Built-in tools و Remote MCP قابل‌استفاده‌اند. Chat Completions API نیز پشتیبانی نمی‌شود و باید از Responses API یا xAI SDK استفاده کرد. پارامتر max_tokens هم قابل‌استفاده نیست.

فقط نتیجه Agent رهبر به‌شکل خوانا برمی‌گردد. این طراحی Response را تمیز می‌کند، ولی Debug کردن اینکه کدام Sub-agent به نتیجه نادرست رسیده دشوارتر است. برای کاربرد ممیزی‌پذیر باید Citation coverage، Usage و Tool log را ذخیره کرد.

Rate limit منتشرشده ۹ درخواست در ثانیه و ۲٫۵ میلیون توکن در دقیقه است؛ بسیار پایین‌تر از Grok 4.20 تک‌عاملی. همچنین Agentهای بیشتر Latency و مصرف توکن را افزایش می‌دهند و کیفیت بهتر تضمین‌شده نیست.

کاربردهای واقعی Grok 4.20 Multi‑Agent

گزارش Due Diligence چندمحوری

چهار Agent می‌توانند محصول، رقبا، ریسک حقوقی و شاخص‌های مالی یک شرکت را جدا بررسی کنند. Leader باید اختلاف داده‌ها، تاریخ و منبع اولیه هر ادعا را نگه دارد؛ خروجی جایگزین بررسی حقوقی یا مالی متخصص نیست.

مرور ادبیات علمی

Agentها می‌توانند شاخه‌های یک موضوع، مقالات کلیدی، روش‌ها و نتایج مخالف را تقسیم کنند. Prompt باید DOI، تاریخ، وضعیت Peer review و تفاوت Preprint با مقاله چاپ‌شده را الزام کند.

تحلیل بازار بین چند کشور

در یک مطالعه ورود به بازار، هر Agent می‌تواند مقررات، رقبا، قیمت یا رفتار مصرف‌کننده را بررسی کند. استفاده از ۱۶ Agent تنها وقتی ارزش دارد که ابعاد و منابع کافی برای تقسیم واقعی کار وجود داشته باشد.

راستی‌آزمایی یک ادعای خبری

Web و X Search برای ردیابی منبع اولیه، Timestamp و واکنش‌ها مناسب‌اند. سیستم باید خبر رسمی، گزارش رسانه و ادعای کاربر را جدا نگه دارد و «نبود شاهد» را نتیجه معتبر بداند.

بررسی فناوری‌های رقیب

Agentها می‌توانند مستندات رسمی، Benchmark، هزینه و محدودیت عملی چند فناوری را موازی بررسی کنند. Leader در پایان باید تفاوت Harnessها را توضیح دهد، نه اینکه فقط یک برنده معرفی کند.

Grok 4.20 Multi‑Agent مناسب چه کسانی است؟

این سیستم برای پژوهشگران، تحلیلگران بازار، تیم‌های Due Diligence، روزنامه‌نگاران داده، مشاوران و سازندگان ابزار Deep Research مناسب است. شرط اصلی این است که مسئله چندبخشی، منابع متنوع و ارزش اقتصادی کافی برای موازی‌سازی داشته باشد.

برای FAQ ساده، خلاصه‌سازی یک فایل، استخراج JSON یا پاسخ زنده در UI، Grok 4.20 تک‌عاملی یا یک مدل سریع‌تر انتخاب منطقی‌تری است. اگر Custom function ضروری است، محدودیت فعلی Multi‑Agent مستقیماً مانع است.

مشخصات فنی Grok 4.20 Multi‑Agent

مشخصه مقدار تأییدشده
Developer SpaceXAI / xAI
Official Name Grok 4.20 Multi-Agent Beta
Model Family Grok 4.20
Model Type سیستم پژوهشی اختصاصی با Leader و چند Sub-agent
API Release ۱۰ مارس ۲۰۲۶
Snapshot ID grok-4.20-multi-agent-0309
Common Alias grok-4.20-multi-agent
Agent Configurations ۴ Agent یا ۱۶ Agent
Input متن و تصویر
Output متنِ Agent رهبر
Context Window ۱٬۰۰۰٬۰۰۰ توکن
Maximum Output عدد عمومی اعلام نشده؛ max_tokens پشتیبانی نمی‌شود
Knowledge Cutoff عمومی اعلام نشده است
Built-in Tools Web Search، X Search، Code Execution و Collections Search
Remote MCP بله
Client-side / Custom Tools خیر
Chat Completions API خیر
Responses API / xAI SDK بله
Structured Outputs در صفحه مدل پشتیبانی‌شده درج شده است
Batch API بله؛ ۲۰٪ تخفیف Token
Regions us-east-1 و us-west-2
Published rate limits ۹ درخواست در ثانیه و ۲٫۵ میلیون توکن در دقیقه
Stability Beta؛ احتمال Breaking change

۵ نمونه پرامپت کاربردی

۱. Due Diligence منبع‌محور

شرکت [نام] را از چهار زاویه محصول، بازار، وضعیت مالی و ریسک حقوقی بررسی کن. هر Agent فقط یک زاویه را با منابع اولیه پوشش دهد. Leader اختلاف ارقام را حفظ کند و جدول نهایی شامل ادعا، شاهد، تاریخ، منبع و سطح اطمینان باشد.

۲. مرور علمی با ۱۶ Agent

یک مرور نظام‌مند اولیه درباره [موضوع] انجام بده. دامنه را به نظریه، روش، Dataset، نتایج مثبت، نتایج منفی، محدودیت و شکاف پژوهشی تقسیم کن. فقط مقاله یا Preprint قابل‌ردیابی بیاور و DOI، سال، وضعیت داوری و تعارض نتایج را ثبت کن.

۳. مقایسه فنی چند محصول

[محصول A]، [محصول B] و [محصول C] را بر اساس مستندات رسمی، قیمت فعلی، SLA، امنیت، قابلیت مهاجرت و محدودیت API مقایسه کن. برای هر عدد لینک و تاریخ بده؛ تنظیمات Benchmark ناهمسان را در یک ستون جدا هشدار بده.

۴. راستی‌آزمایی خبر

ادعای زیر را با Web Search و X Search راستی‌آزمایی کن. مسیر انتشار را تا اولین منبع قابل‌شناسایی دنبال کن، نقل‌های مستقل را از بازنشر جدا کن، Timeline بساز و در پایان نتیجه را «تأییدشده، ردشده، حل‌نشده» اعلام کن.

۵. پژوهش مرحله‌ای بازار

برای ورود محصول [نوع محصول] به [کشورها] ابتدا مقررات، رقبا، قیمت، کانال توزیع و رفتار مشتری را موازی بررسی کن. در این Turn فقط نقشه شواهد و خلأ داده را بده؛ توصیه نهایی را تا تأیید من ارائه نکن.

بنچمارک‌ها و ارزیابی عملکرد

تا تاریخ بررسی، SpaceXAI برای Snapshot دقیق grok-4.20-multi-agent-0309 جدول Benchmark عددی و هم‌شرطی مانند SWE-bench، GPQA یا HLE منتشر نکرده است. Arena در ۲۶ مارس ۲۰۲۶ اضافه‌شدن این Snapshot به Leaderboardهای Text، Vision و Search را ثبت کرده، اما صفحه عمومی قابل‌بازیابی در زمان بررسی امتیاز پایدار و دقیق همه بخش‌ها را ارائه نکرد. بنابراین عددی از Snippetهای مبهم وارد مقاله نشده است.

منبع / ارزیابی چه چیزی را می‌سنجد؟ نتیجه قابل‌تأیید برای نسخه دقیق تاریخ
SpaceXAI Model & Multi-Agent Docs قابلیت، معماری، ابزار و محدودیت عملی امتیاز Benchmark رقابتی منتشر نشده بررسی ۱۲ سپتامبر ۲۰۲۶
Arena Text / Vision / Search ترجیح کاربران در پاسخ، تصویر و جستجو حضور مدل تأیید شده؛ امتیاز پایدار قابل‌استخراج نبود اضافه‌شدن ۲۶ مارس ۲۰۲۶
Benchmark مستقل Agentic کیفیت پژوهش چندمرحله‌ای و هزینه Task نتیجه عمومی معتبر برای Snapshot دقیق پیدا نشد بررسی ۱۲ سپتامبر ۲۰۲۶

این نبود عدد به معنی ضعیف‌بودن یا قوی‌بودن مدل نیست؛ فقط یعنی ادعای رتبه‌بندی قابل دفاع نداریم. Benchmark مدل پایه Grok 4.20 را هم نمی‌توان به Multi‑Agent تعمیم داد، زیرا Harness، تعداد Agent، ابزار، توکن و Latency تغییر می‌کند.

Eval پیشنهادی برای سنجش منصفانه

برای تصمیم Production، مجموعه‌ای از ۳۰ تا ۱۰۰ سؤال واقعی بسازید و Grok 4.20 Multi‑Agent را با Grok 4.20 تک‌عاملی و یک رقیب Deep Research در شرایط یکسان مقایسه کنید:

معیار روش اندازه‌گیری
Citation precision درصد Citationهایی که دقیقاً ادعای کنار خود را پشتیبانی می‌کنند
Citation coverage سهم ادعاهای قابل‌بررسی که منبع معتبر دارند
Source independence تعداد منابع واقعاً مستقل پس از حذف بازنشرها
Task success درصد سؤال‌هایی که Rubric تخصصی را کامل پاس می‌کنند
Conflict handling توان حفظ اختلاف منابع به‌جای ادغام نادرست
Cost per accepted answer مجموع Token و Tool cost تقسیم بر خروجی تأییدشده
End-to-end latency زمان کامل از Request تا پاسخ قابل‌استفاده

مقایسه ۴ و ۱۶ Agent نیز باید جدا انجام شود. اگر ۱۶ Agent فقط Citation تکراری و هزینه بیشتر می‌سازند، معماری کوچک‌تر انتخاب بهتر است. Benchmark مفید در اینجا «هوش خام» نیست؛ کیفیت شواهد به ازای هزینه و زمان است.

مقایسه Grok 4.20 Multi‑Agent با رقبا

گزینه انتخاب مناسب‌تر برای محدودیت یا Trade-off
Grok 4.20 Multi‑Agent، ۴ Agent تحقیق متمرکز و سریع‌تر با چند منبع عمق کمتر از چیدمان ۱۶تایی
Grok 4.20 Multi‑Agent، ۱۶ Agent مسئله چندکشوری یا چندرشته‌ای با شاخه‌های مستقل Token، Tool cost و Latency بسیار بیشتر
Grok 4.20 تک‌عاملی خلاصه، استخراج، تحلیل خطی و کنترل هزینه موازی‌سازی پژوهش داخلی ندارد
Grok 4.6 Coding و Agentهای بلندمدت با Function Calling سیستم Deep Research چندعاملی دقیقاً مشابه نیست
سرویس‌های Deep Research رقیب پژوهش تعاملی در UI یا اکوسیستم همان ارائه‌دهنده API، Citation policy و قیمت باید جدا سنجیده شود

Multi‑Agent زمانی برنده است که Task قابل تقسیم و کیفیت شواهد ارزش هزینه را داشته باشد. در کارهای ترتیبی، یک Agent قوی با ابزار و Prompt مناسب اغلب ارزان‌تر، قابل‌دیباگ‌تر و سریع‌تر است.

قیمت و API

نرخ پایه رسمی مدل در ۱۲ سپتامبر ۲۰۲۶ به دلار و برای هر یک میلیون توکن است:

نوع توکن کمتر از ۲۰۰K Prompt از ۲۰۰K Prompt به بالا
Input ۱٫۲۵ دلار ۲٫۵۰ دلار
Cached Input ۰٫۲۰ دلار ۰٫۴۰ دلار
Output ۲٫۵۰ دلار ۵ دلار

این جدول ممکن است ارزان به نظر برسد، اما تمام توکن‌های Leader و Sub-agentها، شامل Reasoning، محاسبه می‌شوند. تمام فراخوانی‌های ابزار هر Agent نیز جداگانه قیمت دارند. بنابراین هزینه نهایی را با فیلدهای usage و server_side_tool_usage بسنجید، نه فقط طول پاسخ نهایی.

Web Search و Code Execution هرکدام ۵ دلار برای هزار Call، File Attachments ده دلار و Collections Search برابر ۲٫۵۰ دلار برای هزار Call هستند. X Search در تاریخ بررسی ۵ دلار برای هزار Call است و از ۲۱ سپتامبر ۲۰۲۶ طبق اعلام رسمی، براساس پست و پروفایل واکشی‌شده قیمت‌گذاری خواهد شد.

Batch برای این Snapshot ۲۰ درصد تخفیف Token دارد. آستانه Long Context از ۲۰۰ هزار توکن است و پس از عبور، نرخ بالاتر روی کل توکن‌های Request اعمال می‌شود.

Grok 4.20 Multi‑Agent را در Buffalo147 AI امتحان کنید

یک سؤال واقعاً چندمحوری انتخاب کنید و از چهار Agent شروع کنید. در Prompt نوع منبع، بازه زمانی، قالب Citation و معیار پذیرش را دقیق بنویسید؛ فقط اگر پوشش شواهد کافی نبود، سراغ ۱۶ Agent بروید.

شروع استفاده از Grok 4.20 Multi‑Agent در Buffalo147 AI

جمع‌بندی

مهم‌ترین مزیت Grok 4.20 Multi‑Agent توان تقسیم پژوهش میان چند Agent و ترکیب جستجو، تحلیل و Cross-reference است. برای Due Diligence، مرور علمی یا مقایسه چندبازاری می‌تواند خروجی غنی‌تری از یک مسیر خطی بسازد.

محدودیت اصلی، Beta بودن و هزینه‌ای است که پشت پاسخ کوتاه Leader پنهان می‌ماند. نبود Custom tools، نبود Chat Completions، ناتوانی در تنظیم max_tokens و دشواری مشاهده مسیر Sub-agentها نیز برای مهندسی Production مهم‌اند.

این مدل را برای سؤال‌های ساده انتخاب نکنید. زمانی ارزش دارد که هر شاخه پژوهش نقش مستقلی داشته باشد و کیفیت Citation به‌ازای هزینه با Eval واقعی تأیید شود.

پرسش‌های متداول

Grok 4.20 Multi‑Agent چیست؟

نسخه Beta پژوهشی SpaceXAI است که یک Leader، چهار یا شانزده Agent را برای جستجو، تحلیل و ساخت پاسخ منبع‌دار هماهنگ می‌کند.

تفاوت ۴ و ۱۶ Agent چیست؟

چهار Agent برای تحقیق متمرکز و سریع‌تر پیشنهاد شده‌اند؛ شانزده Agent برای موضوع عمیق و چندوجهی، با مصرف Token و Latency بیشتر.

آیا این مدل Benchmark معتبر دارد؟

حضور آن در Arenaهای Text، Vision و Search ثبت شده، اما تا تاریخ بررسی امتیاز عمومی پایدار و جدول هم‌شرط معتبر برای Snapshot دقیق پیدا نشد. بنابراین عددی حدس زده نشده است.

آیا Grok 4.20 Multi‑Agent API دارد؟

بله، از xAI SDK و Responses API استفاده می‌کند. Chat Completions برای این Variant پشتیبانی نمی‌شود.

آیا می‌توان Custom Function به آن داد؟

فعلاً خیر. Custom و Client-side tools پشتیبانی نمی‌شوند؛ Built-in tools و Remote MCP در دسترس‌اند.

هزینه یک درخواست Multi‑Agent چگونه محاسبه می‌شود؟

توکن‌های Leader و تمام Sub-agentها، Reasoning و همه Tool Callها محاسبه می‌شوند. به همین دلیل هزینه می‌تواند چند برابر پاسخ تک‌عاملی باشد.

آیا مدل به وب و X دسترسی دارد؟

بله، با ابزارهای Web Search و X Search. استفاده هر Agent از این ابزارها در Usage و هزینه محاسبه می‌شود.

آیا برای Production مناسب است؟

قابل‌آزمایش است، اما Beta بودن و احتمال Breaking change ایجاب می‌کند Snapshot پین، Contract test، Budget limit و Fallback داشته باشید.

منابع

یادداشت تحریریه Buffalo147 AI: برای Snapshot دقیق این مدل امتیاز Benchmark پایدار و قابل‌تأیید پیدا نشد. حضور در Leaderboard با داشتن رتبه فعلی قابل‌استناد یکسان نیست؛ ازاین‌رو به‌جای عددسازی، روش Eval عملی ارائه شده است.

خواندنی‌های دیگر