Buffalo147 AI

خانه › بلاگ

Grok 4.6؛ بررسی مدل پرچم‌دار SpaceXAI برای کدنویسی و Agentهای بلندمدت

جلد Grok 4.6 با طراحی سه‌بعدی مشکی و نور مسی

آخرین راستی‌آزمایی: ۱۲ سپتامبر ۲۰۲۶

در یک نگاه | Grok 4.6
تاریخ عرضه: ۱۲ اوت ۲۰۲۶
قیمت و شیوهٔ محاسبه: نرخ Standard برای Prompt کمتر از ۲۰۰K: ورودی ۲ دلار و خروجی ۶ دلار به‌ازای هر میلیون توکن؛ برای متن بلند نرخ متفاوت است. تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.

مقدمه

Grok 4.6 مدلی برای پاسخ‌دادن به یک سؤال ساده و تمام‌کردن گفتگو نیست؛ تمرکز اصلی آن حفظ مسیر در کارهای طولانی است. چنین کاری می‌تواند از بررسی یک Codebase و اصلاح چند فایل شروع شود، با اجرای تست ادامه پیدا کند و به ساخت یک نسخه قابل‌استفاده از محصول برسد.

این مدل را شرکتی عرضه کرده که در Master List پروژه با نام xAI شناخته می‌شود و اکنون در وب‌سایت و مستندات رسمی از برند SpaceXAI استفاده می‌کند. Grok 4.6 در ۱۲ اوت ۲۰۲۶ جانشین Grok 4.5 شد و برای Coding، Agentic tasks، کارهای دانشی و خروجی‌های تعاملی یا بصری پیچیده‌تر آموزش دید.

اهمیت 4.6 در ترکیب چند ویژگی است: استدلال قابل‌تنظیم، ورودی متن و تصویر، Context برابر ۵۰۰ هزار توکن، Function Calling، Structured Outputs و دسترسی ابزارمحور به وب، شبکه X، اجرای کد و RAG. این ترکیب، آن را به گزینه‌ای جدی برای تیم‌هایی تبدیل می‌کند که مدل باید علاوه بر توضیح‌دادن، یک Workflow را تا رسیدن به نتیجه دنبال کند.

معرفی کامل Grok 4.6

Grok 4.6 مدل اختصاصی و رده‌بالای خانواده Grok است. شناسه مستقیم آن در API برابر grok-4.6 است و تعداد پارامترها یا جزئیات کامل معماری آن عمومی نشده‌اند. SpaceXAI این نسخه را با یک دوره آموزش تکمیلی طولانی‌تر از Grok 4.5، داده‌های فنی و مهندسی گزینش‌شده و آموزش تقویتی روی محیط‌های Agentic توسعه داده است.

شماتیک روند ورودی، مدل و خروجی برای Grok 4.6
نمای شماتیک روند درخواست تا خروجی برای Grok 4.6؛ قابلیت‌های دقیق در متن مقاله آمده‌اند.

طبق توضیح سازنده، محیط‌های آموزشی شامل کار دانشی، برنامه‌نویسی عمومی، بهینه‌سازی Kernel، توسعه وب و طراحی به کمک رایانه بوده‌اند. این جهت‌گیری توضیح می‌دهد چرا نمایش‌های رسمی مدل بیشتر بر ساخت اپلیکیشن، CAD و ادامه‌دادن پروژه در چند مرحله متمرکزند، نه فقط حل پرسش‌های کوتاه.

در سبد فعلی SpaceXAI، Grok 4.6 مدل پیشنهادی برای Coding و کارهای عمومی دشوار است. برای تولید تصویر و ویدیو، خانواده جداگانه Grok Imagine و برای صوت، مدل‌های Voice ارائه می‌شوند؛ بنابراین قابلیت دیدن تصویر در 4.6 را نباید با تولید بومی رسانه اشتباه گرفت.

مدل از API رسمی، Grok Build و برخی پلتفرم‌های همکار مانند Cursor، OpenRouter، Vercel و Cloudflare در دسترس است. وضعیت، نرخ و حتی نام Endpoint در سرویس واسط می‌تواند متفاوت باشد؛ برای یک استقرار قابل‌بازتولید، شناسه مدل و ارائه‌دهنده را در Log نگه دارید.

قابلیت‌های اصلی

کدنویسی Agentic و کار روی Codebase

Grok 4.6 برای زنجیره‌ای از عملیات مهندسی مناسب است: خواندن Repository، تشکیل فرضیه درباره Bug، ویرایش چند فایل، اجرای تست و بازبینی نتیجه. مزیت ادعاشده نسخه 4.6 نسبت به 4.5، ماندگاری بیشتر روی Trajectoryهای طولانی و خودآزمایی بیشتر پیش از رفتن به مرحله بعد است.

این توانایی جایگزین CI، بازبینی امنیتی یا مالکیت انسانی کد نیست. Agent باید در محیط ایزوله، با دسترسی محدود، Timeout، سقف هزینه و امکان Rollback اجرا شود.

استدلال قابل‌تنظیم

چهار سطح low، medium، high و xhigh برای Reasoning پشتیبانی می‌شود و مقدار پیش‌فرض high است. سطح بالاتر برای مسئله چندمرحله‌ای مفید است، اما معمولاً توکن و زمان بیشتری مصرف می‌کند. برای Routing حرفه‌ای، درخواست‌های ساده را با Effort پایین و فقط موارد دشوار را با Effort بالا اجرا کنید.

فهم تصویر

مدل متن و تصویر را به‌عنوان ورودی می‌پذیرد و می‌تواند Screenshot رابط کاربری، نمودار، تصویر خطا یا طرح محصول را تحلیل کند. خروجی خود مدل متن است. اگر Workflow به ساخت یا ویرایش تصویر نیاز دارد، باید ابزار Image Generation یا مدل Imagine جداگانه فراخوانی شود.

Context بلند و کار با فایل

پنجره Context رسمی ۵۰۰ هزار توکن است. این ظرفیت برای کد، گزارش، مکالمه و اسناد بزرگ مفید است، ولی ارسال همه داده‌ها همیشه تصمیم خوبی نیست. از آستانه Prompt برابر ۲۰۰ هزار توکن، تعرفه Long Context روی تمام توکن‌های همان درخواست اعمال می‌شود؛ Retrieval و Caching می‌توانند هم دقت و هم هزینه را بهتر کنند.

Tool Use و اطلاعات زنده

در Responses API می‌توان Web Search، X Search، Code Execution، Collections Search، فایل‌ها، Image Generation و Remote MCP را به Workflow اضافه کرد. Function Calling نیز برای اتصال سرویس‌های خارجی پشتیبانی می‌شود. اطلاعات زنده فقط زمانی قابل اتکاست که ابزار جستجو واقعاً فعال و Citationها حفظ شده باشند؛ خود مدل به‌تنهایی یک فید بلادرنگ نیست.

Structured Outputs

خروجی ساختاریافته برای استخراج فیلد، تولید JSON و اتصال مطمئن‌تر به Pipeline مناسب است. Schema معتبر احتمال خطای نحوی را کم می‌کند، اما صحت معنایی داده را تضمین نمی‌کند؛ Validation سمت برنامه همچنان لازم است.

مهم‌ترین نقاط قوت

  • عملکرد قوی در پروژه‌های کدنویسی و Agentic چندمرحله‌ای
  • توان ساخت First Pass قابل‌توجه برای اپ‌های تعاملی و بصری
  • Context ۵۰۰هزارتوکنی همراه با ورودی تصویر
  • چهار سطح Reasoning برای تنظیم کیفیت، هزینه و زمان
  • اکوسیستم ابزار کامل شامل Web Search، X Search، Code Execution و RAG
  • قیمت خروجی پایین‌تر از برخی مدل‌های Frontier هم‌رده در زمان بررسی
  • امکان استفاده مستقیم در API، Grok Build و ابزارهای توسعه همکار

محدودیت‌ها و نقاط ضعف

Grok 4.6 در ارزیابی مستقل Artificial Analysis مدل سریعی برای شروع پاسخ نیست. Snapshot بررسی‌شده TTFT حدود ۲۹ ثانیه و سرعت خروجی ۵۳٫۶ توکن در ثانیه دارد. برای IDE یا رابطی که باید فوراً بازخورد بدهد، این تأخیر ممکن است از اختلاف چند امتیاز هوش مهم‌تر باشد.

سه معیار ارزیابی عملی برای Grok 4.6
معیارهای پیشنهادی برای آزمون Grok 4.6 با کار واقعی؛ این تصویر دادهٔ بنچمارک یا امتیاز گزارش‌شده نیست.

مدل در همان ارزیابی مستقل نسبتاً پرگو توصیف شده است. پاسخ طولانی، به‌ویژه در Agentهای چندمرحله‌ای، هزینه و زمان بازبینی را بالا می‌برد؛ قالب خروجی، سقف بخش‌ها و معیار توقف را در Prompt مشخص کنید.

Batch API برای 4.6 پشتیبانی نمی‌شود. درخواست‌های بالای ۲۰۰ هزار توکن نیز با نرخ دوبرابر محاسبه می‌شوند. نسخه Fast در معرفی رسمی با دوبرابر قیمت عرضه شده است؛ بنابراین «Fast» الزاماً گزینه اقتصادی‌تر نیست.

این مدل تصویر را می‌فهمد اما خروجی بومی تصویر، ویدیو یا صوت ندارد. شمار پارامترها اعلام نشده و وزن‌ها باز نیستند. همچنین مدل می‌تواند منبع را بد تفسیر، ابزار نامناسب را فراخوانی یا پاسخ نادرست تولید کند؛ تأیید انسانی در تصمیم‌های حساس ضروری است.

کاربردهای واقعی Grok 4.6

ساخت نسخه اول یک محصول تعاملی

تیم محصول می‌تواند Brief، Design constraints و Stack را بدهد تا مدل ساختار پروژه، رابط اولیه، منطق اصلی و تست‌ها را ایجاد کند. این مورد با تمرکز رسمی 4.6 بر First Passهای بصری و Interactive هم‌راستاست.

رفع Bug چندفایلی

مدل می‌تواند Log، Issue، تست شکست‌خورده و فایل‌های مرتبط را بررسی کند، علت ریشه‌ای را رتبه‌بندی و Patch کوچک بسازد. شرط موفقیت باید اجرای تست و گزارش دقیق فایل‌های تغییرکرده باشد، نه صرفاً توضیح قانع‌کننده.

پژوهش فنی چندمنبعی

با Web Search، X Search و Code Execution می‌توان داده تازه را گردآوری، ادعاها را مقایسه و محاسبات را بازتولید کرد. برای خبر یا روند بازار، زمان بازیابی و تفکیک منبع اولیه از تفسیر ثانویه مهم است.

طراحی و ارزیابی CAD یا UI

ورودی تصویری به مدل اجازه می‌دهد Screenshot یا Render را با Requirement تطبیق دهد و فهرست اصلاحات بسازد. خروجی نهایی CAD یا تصویر از طریق ابزار مربوط تولید می‌شود، نه از کانال متن خود مدل.

Agent عملیات داخلی

با Function Calling می‌توان مدل را به Ticketing، پایگاه دانش یا سرویس‌های سازمانی متصل کرد. عملیات نوشتنی باید Allowlist، Approval انسانی و ثبت Audit داشته باشد.

Grok 4.6 مناسب چه کسانی است؟

این مدل بیش از همه برای برنامه‌نویسان، تیم‌های محصول، مهندسان، پژوهشگران، تحلیلگران و سازندگان Agent مناسب است؛ مخصوصاً وقتی کار چند مرحله دارد و مدل باید میان کد، تصویر، اسناد و ابزار حرکت کند.

برای چت کم‌تأخیر، طبقه‌بندی پرتعداد یا استخراج ساده، یک مدل کوچک‌تر یا Non-reasoning معمولاً منطقی‌تر است. اگر پردازش Batch یا Context یک‌میلیون‌توکنی نیاز قطعی پروژه است، Grok 4.20 یا یک رقیب متناسب باید هم‌زمان Eval شود.

مشخصات فنی Grok 4.6

مشخصه مقدار تأییدشده
Developer SpaceXAI؛ همان خانواده‌ای که پیش‌تر با برند xAI شناخته می‌شد
Model Family Grok 4
Model Type مدل اختصاصی چندوجهی ورودی و استدلالی برای Coding و Agentها
Release Date ۱۲ اوت ۲۰۲۶
API Model ID grok-4.6
Input متن و تصویر
Output متن
Context Window ۵۰۰٬۰۰۰ توکن
Maximum Output سقف عددی جداگانه در صفحه فعلی مدل اعلام نشده است
Knowledge Cutoff ۱ فوریه ۲۰۲۶
Reasoning Effort low، medium، high و xhigh؛ پیش‌فرض high
Vision بله، فهم تصویر
Native Audio / Video / Image Generation خیر؛ از مدل‌ها یا ابزارهای جداگانه استفاده می‌شود
Tool Use Function Calling، Web/X Search، Code Execution، RAG، فایل، Image Generation و Remote MCP
Structured Outputs بله
Web Search بله، ابزارمحور و با هزینه جدا
Batch API خیر
Regions shown in model page us-east-1 در نمای بررسی‌شده
Published rate limits ۱۵۰ درخواست در ثانیه و ۵۰ میلیون توکن در دقیقه
API Availability عمومی در API رسمی و چند پلتفرم همکار

۵ نمونه پرامپت کاربردی

۱. Agent رفع Bug با آزمون

این Repository، Issue و لاگ CI را بررسی کن. ابتدا علت‌های محتمل را با شاهد فایل/تابع رتبه‌بندی کن. سپس کوچک‌ترین Patch امن را بساز، تست مرتبط را اجرا کن و فقط در صورت عبور تست‌ها نتیجه را ارائه بده. فایل‌های تغییرکرده، ریسک Regression و فرمان Rollback را هم بنویس.

۲. ساخت اپ تعاملی از Brief

از این Product Brief یک نمونه کارکردی با [Stack] بساز. ابتدا معماری و Design tokens را مشخص کن، سپس صفحه اصلی و تعامل کلیدی را پیاده‌سازی کن. در پایان Accessibility، Responsive layout و سه مسیر خطا را تست کن و Screenshot هر وضعیت را تحلیل کن.

۳. پژوهش مهندسی با ابزار

درباره [موضوع فنی] فقط منابع اولیه و مستندات رسمی را با Web Search پیدا کن. ادعاها را در جدول «شاهد، تاریخ، سطح اطمینان» بیاور، اختلاف منابع را پنهان نکن و هر محاسبه را با Code Execution بازتولید کن.

۴. بازبینی UI از روی تصویر

این Screenshot را با معیارهای WCAG، سلسله‌مراتب بصری و Design System پیوست مقایسه کن. مشکلات را بر اساس شدت مرتب کن و برای هر مورد Selector احتمالی، تغییر پیشنهادی CSS و تست پذیرش بنویس. از حدس درباره عناصر خارج از تصویر خودداری کن.

۵. طراحی Agent سازمانی امن

برای Workflow زیر یک Agent طراحی کن. Function schema، مجوز هر ابزار، داده حساس، سقف دور و هزینه، Timeout، Human Approval و Audit log را مشخص کن. سپس سناریوهای Prompt Injection و Tool misuse را به تست‌های قابل اجرا تبدیل کن.

بنچمارک‌ها و ارزیابی عملکرد

نتایج جدول اول در ۱۲ اوت ۲۰۲۶ توسط SpaceXAI منتشر شده‌اند و Vendor-reported هستند. خود سازنده تصریح می‌کند امتیاز رقبا از System Cardها یا Leaderboardهای آن‌ها آمده است؛ بنابراین Harness، بودجه Reasoning و ابزارها الزاماً یکسان نیستند. هر Benchmark مهارت متفاوتی را می‌سنجد و جمع‌کردن ساده درصدها روش معتبری نیست.

Benchmark و آنچه می‌سنجد Grok 4.6 High Grok 4.5 High GPT-5.6 Sol Max Fable 5 Max تاریخ / منبع
AA Intelligence Index؛ ترکیب چند ارزیابی هوش ۶۱ ۵۶ ۶۱ ۶۲ ۱۲ اوت ۲۰۲۶، SpaceXAI؛ Vendor-reported
GDPVal-AA v2؛ کارهای حرفه‌ای و واقعی ۱٬۷۵۳ ۱٬۵۲۶ ۱٬۷۲۸ ۱٬۷۴۱ ۱۲ اوت ۲۰۲۶، SpaceXAI؛ Vendor-reported
CursorBench v3.2؛ عملکرد Agent کدنویسی در محیط Cursor ۶۹٫۹٪ ۶۶٫۷٪ ۶۷٫۲٪ ۷۰٫۵٪ ۱۲ اوت ۲۰۲۶، SpaceXAI؛ Vendor-reported
DeepSWE v1.1؛ حل Issueهای مهندسی نرم‌افزار ۶۵٫۹٪ ۵۴٪ ۷۳٪ ۷۰٪ ۱۲ اوت ۲۰۲۶، SpaceXAI؛ Vendor-reported
FrontierCode v1.1 Extended؛ Coding دشوار و طولانی ۶۱٫۳٪ ۵۶٫۶٪ ۶۰٫۶٪ ۶۳٫۶٪ ۱۲ اوت ۲۰۲۶، SpaceXAI؛ Vendor-reported
APEX-Agents؛ کارهای Agentic چندمرحله‌ای ۵۷٫۵٪ ۴۷٫۱٪ ۵۶٫۷٪ ۵۹٫۲٪ ۱۲ اوت ۲۰۲۶، SpaceXAI؛ Vendor-reported
Terminal-Bench v3.0؛ کار در Terminal و محیط واقعی ۲۶٪ ۱۵٫۷٪ ۳۴٫۶٪ ۳۴٫۱٪ ۱۲ اوت ۲۰۲۶، SpaceXAI؛ Vendor-reported
APEX-SWE؛ مهندسی نرم‌افزار Agentic ۵۶٫۴٪ ۵۳٫۶٪ اعلام نشده ۵۸٫۸٪ ۱۲ اوت ۲۰۲۶، SpaceXAI؛ Vendor-reported
AA-Briefcase؛ کار دانشی Agentic ۱٬۵۷۷ ۱٬۳۱۳ ۱٬۵۰۲ ۱٬۵۷۴ ۱۲ اوت ۲۰۲۶، SpaceXAI؛ Vendor-reported

اعداد رسمی نشان می‌دهند 4.6 نسبت به 4.5 در همه ردیف‌های مشترک جدول رشد کرده و در GDPVal-AA، APEX-Agents و AA-Briefcase رقابتی است. در مقابل، GPT-5.6 Sol و Fable 5 در DeepSWE و Terminal-Bench عدد بالاتری دارند؛ پس 4.6 را نمی‌توان بدون قید «بهترین مدل کدنویسی» نامید.

Snapshot مستقل Artificial Analysis

معیار مستقل Grok 4.6 High مرجع مقایسه در همان کلاس تاریخ / منبع
Intelligence Index v4.3؛ ترکیب ۱۰ ارزیابی جدید ۴۴ میانه کلاس هم‌قیمت: ۲۴ بررسی ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis
سرعت خروجی ۵۳٫۶ توکن‌برثانیه میانه کلاس: ۶۷ بررسی ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis
زمان تا نخستین توکن ۲۹ ثانیه میانه کلاس: ۳٫۶۵ ثانیه بررسی ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis
هزینه هر Task شاخص ۱٫۸۶ دلار روش وزن‌دهی اختصاصی AA بررسی ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis

امتیاز مستقل ۴۴ با عدد ۶۱ در نمودار زمان عرضه تناقض قابل‌استنتاجی ایجاد نمی‌کند؛ نسخه شاخص، مجموعه آزمون و Snapshot زمانی تغییر کرده‌اند و این دو عدد نباید به‌عنوان افت عملکرد از هم کم شوند. نتیجه کاربردی روشن‌تر است: کیفیت 4.6 بالا ارزیابی شده، اما شروع پاسخ کند و خروجی نسبتاً مفصل است.

مقایسه Grok 4.6 با رقبا

مدل در چه کاری انتخاب بهتری است؟ ملاحظه
Grok 4.6 پروژه‌های چندمرحله‌ای، اپ تعاملی، کدنویسی همراه با تصویر و ابزار TTFT بالا، بدون Batch و Context کمتر از یک میلیون
GPT-5.6 Sol DeepSWE و Terminal در جدول هم‌دوره، Workflowهای متصل به اکوسیستم OpenAI قیمت، Harness و Effort باید روی پروژه واقعی سنجیده شود
Fable 5 DeepSWE، Terminal و چند ارزیابی Frontier در جدول عرضه در همه کانال‌ها یا بازارها لزوماً همان دسترسی را ندارد
Grok 4.5 پاسخ فشرده‌تر و Cache ارزان‌تر در همان خانواده مدل قدیمی‌تر و در Benchmarkهای رسمی ضعیف‌تر از 4.6

برای ساخت اپ و ادامه کار در یک Agent بلندمدت، 4.6 انتخاب طبیعی خانواده Grok است. برای تعمیر Repository، نتایج DeepSWE و Terminal نشان می‌دهند ارزیابی با رقیب ضروری است. تصمیم نهایی باید بر اساس نرخ موفقیت، هزینه کل Trajectory، Latency و تعداد دخالت انسانی گرفته شود.

قیمت و API

قیمت‌های زیر نرخ Standard رسمی و به دلار برای هر یک میلیون توکن‌اند؛ آخرین بررسی ۱۲ سپتامبر ۲۰۲۶ انجام شده است. وقتی Prompt به ۲۰۰ هزار توکن یا بیشتر برسد، نرخ Long Context روی تمام توکن‌های درخواست اعمال می‌شود.

نوع توکن کمتر از ۲۰۰K Prompt از ۲۰۰K Prompt به بالا
Input ۲ دلار ۴ دلار
Cached Input ۰٫۵۰ دلار ۱ دلار
Output ۶ دلار ۱۲ دلار

Batch برای این مدل پشتیبانی نمی‌شود. نسخه Fast طبق معرفی رسمی دوبرابر نرخ Standard قیمت دارد و Priority Processing نیز در مستندات عمومی با ضریب دو برابر توصیف شده است؛ کانال دقیق سرویس را پیش از محاسبه بودجه بررسی کنید.

هزینه ابزار جداست: Web Search و Code Execution هرکدام ۵ دلار به‌ازای هزار فراخوانی، File Attachments ده دلار و Collections Search برابر ۲٫۵۰ دلار به‌ازای هزار فراخوانی‌اند. X Search در تاریخ بررسی ۵ دلار به‌ازای هزار Call است؛ مستند رسمی اعلام کرده از ۲۱ سپتامبر ۲۰۲۶ به ۵ دلار برای هزار پست واکشی‌شده و ۱۰ دلار برای هزار پروفایل واکشی‌شده تغییر می‌کند.

Grok 4.6 را در Buffalo147 AI امتحان کنید

یک کار واقعی و چندمرحله‌ای وارد کنید: Repository، Screenshot، معیار پذیرش و محدودیت ابزار را کنار هم بدهید و از مدل بخواهید نتیجه را با تست و شاهد تحویل دهد. برای کنترل هزینه، ابتدا دامنه کار را کوچک و Reasoning را متناسب با پیچیدگی تنظیم کنید.

شروع استفاده از Grok 4.6 در Buffalo147 AI

جمع‌بندی

مهم‌ترین مزیت Grok 4.6 توان ادامه‌دادن کارهای بلندمدت و ترکیب استدلال، کدنویسی، تصویر و ابزار است. این مدل برای تیمی که از AI یک همکار اجرایی می‌خواهد، کاربردی‌تر از مدلی است که فقط پاسخ کوتاه می‌دهد.

محدودیت اصلی آن Latency بالای حالت High، نبود Batch و افزایش دوبرابری نرخ در Context بلند است. نتایج Benchmark نیز برتری مطلق نشان نمی‌دهند؛ 4.6 در کار دانشی و Agentic قوی است، اما در بعضی آزمون‌های Terminal و SWE رقبا جلوترند.

برای ساخت محصول، پژوهش فنی و Agentهای مهندسی پیچیده انتخاب خوبی است. برای پاسخ سریع، پردازش حجمی یا عملیات ساده، Routing به مدل ارزان‌تر تجربه و هزینه بهتری می‌سازد.

پرسش‌های متداول

Grok 4.6 چیست؟

مدل پرچم‌دار SpaceXAI برای Coding، کارهای Agentic، تحلیل تصویر و کار دانشی چندمرحله‌ای است که در اوت ۲۰۲۶ عرضه شد.

آیا Grok 4.6 برای برنامه‌نویسی خوب است؟

بله؛ در CursorBench، FrontierCode و ارزیابی‌های Agentic عملکرد رقابتی دارد. بااین‌حال در DeepSWE و Terminal-Bench جدول رسمی، بعضی رقبا امتیاز بالاتری دارند.

Context Window مدل چقدر است؟

پنجره Context رسمی ۵۰۰ هزار توکن است. نرخ API برای Promptهای ۲۰۰ هزار توکن و بیشتر افزایش می‌یابد.

آیا Grok 4.6 به وب و X دسترسی دارد؟

بله، از طریق ابزارهای Web Search و X Search در API. این ابزارها هزینه جدا دارند و باید در درخواست فعال شوند.

آیا Grok 4.6 تصویر یا ویدیو می‌سازد؟

خود مدل خروجی متن دارد و تصویر را می‌فهمد. تولید تصویر یا ویدیو از طریق ابزار یا مدل‌های جداگانه Grok Imagine انجام می‌شود.

قیمت API Grok 4.6 چقدر است؟

برای Prompt کوتاه، ورودی ۲ دلار و خروجی ۶ دلار به‌ازای یک میلیون توکن است. از آستانه ۲۰۰ هزار توکن، این نرخ‌ها به ۴ و ۱۲ دلار می‌رسند.

Grok 4.6 بهتر است یا Grok 4.5؟

برای کارهای دشوار و Trajectoryهای طولانی، 4.6 انتخاب قوی‌تر است. 4.5 می‌تواند پاسخ فشرده‌تر و Cached Input ارزان‌تری داشته باشد.

آیا وزن‌های Grok 4.6 باز هستند؟

خیر؛ مدل Proprietary است و تعداد پارامترهای آن نیز به‌طور عمومی اعلام نشده است.

منابع

یادداشت تحریریه Buffalo147 AI: اعداد جدول نخست توسط سازنده گزارش شده‌اند و Harness رقبا الزاماً یکسان نیست. Snapshot مستقل Artificial Analysis جدا گزارش شده و به‌دلیل تغییر نسخه شاخص با عدد زمان عرضه قابل تبدیل مستقیم نیست.

خواندنی‌های دیگر