Buffalo147 AI

خانه › بلاگ

Grok 4.5؛ مدل مهندسی و کدنویسی کم‌مصرف SpaceXAI زیر ذره‌بین

جلد Grok 4.5 با طراحی سه‌بعدی مشکی و نور مسی

آخرین راستی‌آزمایی: ۱۲ سپتامبر ۲۰۲۶

در یک نگاه | Grok 4.5
تاریخ عرضه: ۸ ژوئیه ۲۰۲۶
قیمت و شیوهٔ محاسبه: Input ۲ دلار؛ Output ۶ دلار؛ به‌ازای هر یک میلیون توکن تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.

مقدمه

Grok 4.5 با یک هدف روشن عرضه شد: مدل فقط کد پیشنهاد ندهد، بلکه بتواند در یک محیط Agentic مسئله مهندسی را دنبال کند. خواندن Repository، کار با Terminal، اصلاح چند فایل، ساخت اپ و تهیه Artifactهای کاری از سناریوهایی هستند که SpaceXAI برای این نسل برجسته کرده است.

این مدل در ۸ ژوئیه ۲۰۲۶ وارد API شد و معرفی عمومی آن در ۱۶ ژوئیه منتشر شد. شرکت سازنده در Master List با نام xAI ثبت شده و اکنون منابع رسمی برند SpaceXAI را نمایش می‌دهند. Grok 4.5 مدت کوتاهی پرچم‌دار خانواده بود تا اینکه Grok 4.6 در اوت ۲۰۲۶ جایگاه بالاتر را گرفت.

چیزی که 4.5 را هنوز قابل‌توجه می‌کند، فقط امتیاز Coding نیست. سازنده آن را با Cursor توسعه داده، روی Rust، C و C++ و ساخت End-to-end برنامه آموزش داده و بر کاهش مراحل و توکن‌های لازم برای حل مسئله تأکید کرده است. بااین‌حال ادعاهای بهره‌وری و Benchmarkهای عرضه باید با برچسب Vendor-reported و در شرایط واقعی محصول دوباره سنجیده شوند.

معرفی کامل Grok 4.5

Grok 4.5 یک مدل اختصاصی Reasoning با ورودی متن و تصویر و خروجی متن است. شناسه API آن grok-4.5 و Aliasهای فعلی شامل grok-4.5-latest و grok-build-latest هستند. برای کنترل نسخه در Production بهتر است تا حد امکان شناسه ثابت و تغییرات Release Notes مانیتور شود.

شماتیک روند ورودی، مدل و خروجی برای Grok 4.5
نمای شماتیک روند درخواست تا خروجی برای Grok 4.5؛ قابلیت‌های دقیق در متن مقاله آمده‌اند.

مدل با ده‌ها هزار GPU از نوع NVIDIA GB300 و مجموعه داده‌های گزینش‌شده در علم، مهندسی، ریاضیات و Coding آموزش دیده است. SpaceXAI از Deduplication، Quality scoring و انتخاب Domain-specific و سپس RL روی صدها هزار کار Coding و Agentic سخن می‌گوید؛ جزئیات کامل داده، معماری و تعداد پارامترها عمومی نیست.

در زمان عرضه، 4.5 مدل پیش‌فرض Grok Build شد و در Cursor نیز در دسترس قرار گرفت. قابلیت‌های Office در Grok Build—مانند ساخت مدل Excel، اسلاید PowerPoint و سند Word—یک تجربه محصولی با ابزار است؛ نباید آن را با خروجی بومی فایل در Endpoint متن خام یکی دانست.

اکنون Grok 4.6 مدل جدیدتر و قوی‌تر خانواده است، اما 4.5 همچنان Endpoint رسمی دارد. Cache آن از 4.6 ارزان‌تر است و ارزیابی مستقل خروجی فشرده‌تری نشان می‌دهد؛ این دو نکته می‌توانند برای Workflowهای تکراری مهم باشند.

قابلیت‌های اصلی

مهندسی نرم‌افزار Agentic

مدل برای بازکردن Issue، جستجو در Codebase، ویرایش فایل، اجرای تست و ادامه تا رفع خطا طراحی شده است. Benchmarkهای عرضه بر SWE، Terminal و Marathon تمرکز دارند و آموزش رسمی نیز زبان‌های سطح پایین و ساخت برنامه کامل را پوشش داده است.

عامل اجرایی باید در Sandbox با مجوز محدود کار کند. مدل ممکن است تست ناکافی بنویسد، آسیب جانبی ایجاد کند یا دستور پرخطر پیشنهاد دهد؛ Branch جدا، CI، Review و Rollback اجزای ضروری‌اند.

استدلال با چهار سطح Effort

در صفحه فعلی مدل، low، medium، high و xhigh پشتیبانی می‌شوند و پیش‌فرض high است. این تنظیم به تیم اجازه می‌دهد کیفیت و هزینه را برای Taskهای مختلف کنترل کند. Effort بیشتر همیشه موفقیت بیشتر نمی‌آورد و باید با Success rate سنجیده شود.

فهم تصویر و ساخت رابط

Grok 4.5 می‌تواند Screenshot، دیاگرام و طرح UI را تحلیل کند و کد رابط بسازد. معرفی رسمی نمونه‌هایی مانند شبیه‌سازی سه‌بعدی منظومه شمسی را نشان می‌دهد. خود Endpoint متن، تصویر یا ویدیو تولید نمی‌کند؛ خروجی بصری از اجرای کد یا ابزار رسانه حاصل می‌شود.

کار با اسناد و Office

در محیط Grok Build، مدل برای Excel، Word و PowerPoint استفاده شده است: تحقیق وب، فرمول چند Sheet، شکل‌های بومی اسلاید و متن سند. موفقیت این Workflow به ابزار و Integration بستگی دارد و قابلیت یکسان در هر API client تضمین نمی‌شود.

Tool Use و جستجوی زنده

Function Calling، Structured Outputs و Reasoning در صفحه مدل رسمی‌اند. Responses API ابزارهای Web Search، X Search، Code Execution، Collections Search و Remote MCP را نیز ارائه می‌کند. برای هر ابزار باید مجوز، Budget و معیار توقف تعریف شود.

Context ۵۰۰هزارتوکنی

Context بزرگ برای Codebase و اسناد مهندسی مفید است. از Prompt برابر ۲۰۰ هزار توکن به بالا، نرخ Long Context به همه توکن‌های Request اعمال می‌شود؛ بنابراین Indexing و Retrieval هدفمند معمولاً از انباشتن تمام Repository بهتر است.

مهم‌ترین نقاط قوت

  • تمرکز مشخص روی مهندسی نرم‌افزار و Agentهای Coding
  • عملکرد رقابتی در Terminal-Bench و چند آزمون SWE هم‌دوره
  • Context ۵۰۰ هزار توکن همراه با فهم تصویر
  • خروجی نسبتاً فشرده در ارزیابی مستقل
  • چهار سطح Reasoning و Structured Outputs
  • Cache ارزان‌تر از Grok 4.6 در نرخ فعلی
  • Integration با Grok Build، Cursor و ابزارهای Office

محدودیت‌ها و نقاط ضعف

Grok 4.5 دیگر مدل پرچم‌دار خانواده نیست. Grok 4.6 در Benchmarkهای رسمی مشترک پیشرفت کرده و برای Trajectoryهای بلندتر آموزش بیشتری دیده است. انتخاب 4.5 برای پروژه جدید باید با دلیل مشخصی مانند Cache ارزان‌تر، رفتار فشرده‌تر یا نتیجه بهتر روی Dataset داخلی همراه باشد.

سه معیار ارزیابی عملی برای Grok 4.5
معیارهای پیشنهادی برای آزمون Grok 4.5 با کار واقعی؛ این تصویر دادهٔ بنچمارک یا امتیاز گزارش‌شده نیست.

Batch API پشتیبانی نمی‌شود و هزینه Long Context از آستانه ۲۰۰ هزار توکن دو برابر است. Context ۵۰۰ هزار توکن نیز از پنجره یک‌میلیونی Grok 4.20 کوچک‌تر است.

ارزیابی مستقل Artificial Analysis سرعت ۵۵٫۵ توکن‌برثانیه و TTFT حدود ۸٫۳۳ ثانیه را ثبت کرده؛ سریع‌تر از 4.6 برای شروع پاسخ است، اما از میانه کلاس مورد مقایسه کندتر است. عدد رسمی ۸۰ TPS مربوط به گزارش سازنده در زمان عرضه و شرایط سرویس خودش است؛ اختلاف با Snapshot مستقل طبیعی و ناشی از زمان، بار، Prompt و روش اندازه‌گیری است.

مدل فقط خروجی متن دارد. تعداد پارامترها، معماری دقیق، Knowledge Cutoff و Maximum Output عددی عمومی اعلام نشده‌اند. مثل هر LLM دیگری ممکن است کد ناامن یا پاسخ نادرست بسازد و در تصمیم حساس به Review نیاز دارد.

کاربردهای واقعی Grok 4.5

تعمیر یک Issue واقعی Repository

Issue، تست و ساختار پروژه را به Agent بدهید تا ابتدا Test reproduction بسازد، سپس Patch کوچک ارائه کند و CI را اجرا کند. هزینه موفقیت کامل—نه زیبایی Diff—معیار اصلی است.

مهاجرت کد سطح پایین

تمرکز آموزشی روی Rust، C و C++ آن را برای بررسی Memory safety، FFI یا Refactor ماژول‌های سیستمی قابل‌ارزیابی می‌کند. Sanitizer، Benchmark کارایی و Review متخصص همچنان لازم‌اند.

ساخت Prototype تعاملی

مدل می‌تواند از Brief به ساختار پروژه، Component و Interaction برسد و با Screenshot بازخورد بگیرد. برای طراحی نهایی باید Accessibility و سازگاری مرورگر جدا تست شود.

تهیه مدل Excel و گزارش مدیریتی

در Grok Build، می‌توان از داده و وب به Workbook چند Sheet، فرمول و یادداشت رسید و سپس همان یافته‌ها را به Word یا PowerPoint منتقل کرد. فرمول‌ها و منابع مالی باید مستقل اعتبارسنجی شوند.

Agent عملیات مهندسی

Function Calling امکان اتصال به Issue tracker، CI یا پایگاه دانش را می‌دهد. عملیات Merge، Deploy، حذف یا تغییر Permission باید Approval انسانی داشته باشند.

Grok 4.5 مناسب چه کسانی است؟

برنامه‌نویسان، مهندسان پلتفرم، تیم‌های DevTools، سازندگان Agent، تحلیلگران فنی و کاربران Grok Build مخاطبان اصلی‌اند. اگر Workflow شامل کد، Terminal، تصویر رابط و اسناد کاری است، ترکیب قابلیت‌های مدل ارزش بیشتری پیدا می‌کند.

برای جدیدترین کیفیت، ابتدا 4.6 را بسنجید. برای Batch، Context یک‌میلیونی یا پاسخ بسیار سریع، 4.20 یا مدل دیگری ممکن است مناسب‌تر باشد. کاربران عادی که فقط خلاصه یا بازنویسی می‌خواهند احتمالاً به این سطح مدل نیاز ندارند.

مشخصات فنی Grok 4.5

مشخصه مقدار تأییدشده
Developer SpaceXAI / xAI
Model Family Grok 4
Model Type مدل اختصاصی چندوجهی ورودی و استدلالی برای مهندسی و Agentها
API Availability Date ۸ ژوئیه ۲۰۲۶
Public Announcement ۱۶ ژوئیه ۲۰۲۶
API Model ID grok-4.5
Aliases grok-4.5-latest و grok-build-latest
Input متن و تصویر
Output متن
Context Window ۵۰۰٬۰۰۰ توکن
Maximum Output عدد عمومی قابل‌تأیید پیدا نشد
Knowledge Cutoff عمومی اعلام نشده است
Reasoning Effort low، medium، high و xhigh؛ پیش‌فرض high
Vision بله، فهم تصویر
Native Image / Audio / Video Generation خیر
Function Calling / Structured Outputs بله
Web / X Search and Code Execution بله، ابزارمحور
Batch API خیر
Regions us-east-1 و us-west-2
Published rate limits ۱۵۰ درخواست در ثانیه و ۵۰ میلیون توکن در دقیقه
Current Position API فعال؛ توسط Grok 4.6 به‌عنوان پرچم‌دار جایگزین شده است

۵ نمونه پرامپت کاربردی

۱. حل Issue با کمترین Patch

Issue و Repository را بررسی کن. اول تستی بنویس که خطا را بازتولید کند، بعد علت ریشه‌ای را با شاهد مشخص کن و کوچک‌ترین Patch ممکن را اعمال کن. تست‌های مرتبط و Regression را اجرا کن و تعداد توکن/مرحله و فایل‌های تغییرکرده را گزارش بده.

۲. ممیزی Rust و C++

مرز FFI بین این ماژول Rust و کتابخانه C++ را ممیزی کن. خطرهای Ownership، Lifetime، Undefined Behavior، Thread safety و Error propagation را با مسیر کد نشان بده. برای هر اصلاح تست Sanitizer و Benchmark کارایی پیشنهاد کن.

۳. ساخت اپ سه‌بعدی

با Three.js یک شبیه‌سازی تعاملی [موضوع] بساز. معماری Componentها، کنترل زمان، دوربین، UI و محدودیت Performance را تعریف کن؛ سپس نمونه را پیاده‌سازی و با Screenshotهای Desktop و Mobile از نظر خوانایی و تعامل بازبینی کن.

۴. Workbook مدیریتی

داده‌های پیوست و منابع وب رسمی را به یک مدل مالی چند Sheet تبدیل کن. Assumptionها، فرمول‌ها، سناریوی پایه/خوش‌بینانه/بدبینانه و Checksumها را اضافه کن. هیچ عددی را بدون منبع نساز و سلول‌های ورودی را از فرمول‌ها متمایز کن.

۵. Agent امن CI

یک Agent برای Triage خطاهای CI طراحی کن. ابزارها، مجوز Read/Write، Branch isolation، محدودیت فرمان Shell، سقف هزینه، Timeout، Approval قبل از Push و Log ممیزی را مشخص کن. پنج سناریوی Prompt Injection هم به تست تبدیل کن.

بنچمارک‌ها و ارزیابی عملکرد

جدول زیر از معرفی SpaceXAI در ۱۶ ژوئیه ۲۰۲۶ آمده و Vendor-reported است. خود صفحه می‌گوید ارقام رقبا از System Cardها یا Leaderboardهای منتشرشده گرفته شده‌اند. در بعضی ردیف‌ها Harness توسط ارائه‌دهنده و در بعضی توسط Datacurve اجرا شده؛ بنابراین مقایسه کاملاً هم‌شرط نیست.

Benchmark و آنچه می‌سنجد Grok 4.5 Fable 5 Max GPT-5.5 xHigh Opus 4.8 Max تاریخ / منبع
DeepSWE 1.0؛ حل Issue نرم‌افزاری با Harnessهای ارائه‌دهنده ۶۲٫۰٪ ۶۶٫۱٪ ۶۴٫۳۱٪ ۵۵٫۷۵٪ ۱۶ ژوئیه ۲۰۲۶، SpaceXAI؛ Vendor-reported
DeepSWE 1.1؛ mini-swe-agent با اجرای Datacurve ۵۳٪ ۷۰٪ ۶۷٪ ۵۹٪ ۱۶ ژوئیه ۲۰۲۶، SpaceXAI؛ Vendor-reported
SWE Marathon pass@1؛ حل مسئله در مسیرهای طولانی ۲۹٫۰٪ ۲۴٫۰٪ اعلام نشده ۲۶٫۰٪ ۱۶ ژوئیه ۲۰۲۶، SpaceXAI؛ Vendor-reported
Terminal-Bench 2.1؛ انجام وظایف واقعی Terminal ۸۳٫۳٪ ۸۴٫۳٪ ۸۳٫۴٪ ۷۸٫۹٪ ۱۶ ژوئیه ۲۰۲۶، SpaceXAI؛ Vendor-reported
SWE-bench Pro؛ رفع Issueهای دشوار Repository ۶۴٫۷٪ ۸۰٫۴٪ ۵۸٫۶٪ ۶۹٫۲٪ ۱۶ ژوئیه ۲۰۲۶، SpaceXAI؛ Vendor-reported

4.5 در SWE Marathon بالاترین عدد جدول را دارد و در Terminal-Bench تقریباً هم‌سطح Fable و GPT-5.5 است. در DeepSWE 1.1 و SWE-bench Pro، Fable و Opus 4.8 برتری دارند. تفاوت ۶۲٪ در DeepSWE 1.0 و ۵۳٪ در نسخه 1.1 نیز نشان می‌دهد نسخه Dataset و Harness می‌تواند نتیجه را جدی تغییر دهد.

SpaceXAI علاوه بر Success rate، میانگین ۱۵٬۹۵۴ Output token برای هر Task در SWE-bench Pro گزارش کرده و آن را با ۶۷٬۰۲۰ توکن Opus 4.8 Max مقایسه کرده است؛ یعنی حدود ۴٫۲ برابر کمتر. این ادعا نیز Vendor-reported است و تنها وقتی به هزینه واقعی تبدیل می‌شود که نرخ موفقیت، Tool calls و Retryها هم محاسبه شوند.

Snapshot مستقل Artificial Analysis

معیار مستقل Grok 4.5 High مرجع همان کلاس تاریخ / منبع
Intelligence Index v4.3؛ ترکیب ۱۰ ارزیابی ۳۹ میانه کلاس هم‌قیمت: ۲۴ بررسی ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis
سرعت خروجی ۵۵٫۵ توکن‌برثانیه میانه کلاس: ۶۷ بررسی ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis
TTFT ۸٫۳۳ ثانیه میانه کلاس: ۳٫۶۵ ثانیه بررسی ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis
هزینه هر Task شاخص ۱٫۰۴ دلار روش وزن‌دهی AA بررسی ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis
مجموع خروجی در اجرای شاخص ۷۷ میلیون توکن میانه کلاس: ۹۰ میلیون بررسی ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis

ارزیابی مستقل تصویر متعادلی می‌دهد: هوش بالاتر از میانه، خروجی نسبتاً فشرده، اما سرعت و Latency نه‌چندان ممتاز. برای Coding واقعی، معیار نهایی درصد Issueهای Merge‌شده بدون Regression و هزینه هر Patch پذیرفته‌شده است.

مقایسه Grok 4.5 با رقبا

مدل انتخاب مناسب‌تر برای ملاحظه اصلی
Grok 4.5 Agent کدنویسی، Rust/C++، Artifactهای Office و پاسخ فشرده‌تر نسل قبل از 4.6 و بدون Batch
Grok 4.6 Trajectory بلند، First Pass بصری و کیفیت Frontier جدیدتر TTFT مستقل بالاتر و Cache گران‌تر
Fable 5 DeepSWE 1.1 و SWE-bench Pro در جدول عرضه قیمت و دسترسی باید در کانال واقعی بررسی شود
Claude Opus 4.8 SWE-bench Pro و Workflowهای اکوسیستم Anthropic در گزارش Vendor توکن بسیار بیشتری مصرف کرده است
GPT-5.5 xHigh DeepSWE 1.1 و Terminal-Bench رقابتی Harness و Effort با Grok کاملاً یکسان نیست

اگر یک تیم از Cursor یا Grok Build استفاده می‌کند و هزینه خروجی Agent مهم است، 4.5 هنوز گزینه معناداری است. اگر هدف حفظ مسیر طولانی و کیفیت کلی بالاتر باشد، 4.6 نقطه شروع بهتر است. برای Repository مشخص، رقبا را با همان Container، ابزار، Budget و Timeout مقایسه کنید.

قیمت و API

نرخ Standard رسمی در ۱۲ سپتامبر ۲۰۲۶، به دلار و برای هر یک میلیون توکن:

نوع توکن کمتر از ۲۰۰K Prompt از ۲۰۰K Prompt به بالا
Input ۲ دلار ۴ دلار
Cached Input ۰٫۳۰ دلار ۰٫۶۰ دلار
Output ۶ دلار ۱۲ دلار

Batch API برای 4.5 پشتیبانی نمی‌شود. با رسیدن Prompt به ۲۰۰ هزار توکن، نرخ Long Context برای همه Tokenهای همان درخواست فعال می‌شود. Cache برای Context تکراری می‌تواند هزینه را کاهش دهد، اما اعتبار Cache و تغییر Prefix باید در Integration آزموده شود.

هزینه ابزار جداست: Web Search و Code Execution هرکدام ۵ دلار برای هزار Call، File Attachments ده دلار و Collections Search برابر ۲٫۵۰ دلار برای هزار Call. X Search طبق اطلاعیه رسمی از ۲۱ سپتامبر ۲۰۲۶ به قیمت‌گذاری براساس تعداد پست و پروفایل واکشی‌شده مهاجرت می‌کند.

Grok 4.5 را در Buffalo147 AI امتحان کنید

بهترین آزمون، یک Issue واقعی با تست شکست‌خورده و معیار Merge است. از مدل بخواهید تعداد مراحل، توکن و تغییرات را ثبت کند تا علاوه بر کیفیت Patch، بهره‌وری ادعاشده آن را هم بسنجید.

شروع استفاده از Grok 4.5 در Buffalo147 AI

جمع‌بندی

مهم‌ترین مزیت Grok 4.5 تمرکز تخصصی روی مهندسی Agentic و بهره‌وری توکن است. نتایج رسمی آن در Terminal و SWE Marathon رقابتی‌اند و Integration با Cursor و Grok Build برای ساخت نرم‌افزار و Artifactهای کاری ارزش عملی دارد.

محدودیت اصلی این است که 4.6 اکنون مدل جدیدتر خانواده است و 4.5 Batch ندارد. نتایج Benchmark نیز یک‌دست نیستند؛ در بعضی SWE evalها رقبای مستقیم فاصله محسوسی دارند.

برای تیمی که Coding، Terminal، اسناد Office و خروجی نسبتاً فشرده می‌خواهد، 4.5 هنوز انتخاب قابل‌آزمایشی است. برای پروژه جدید، آن را کنار 4.6 با معیار هزینه هر Task پذیرفته‌شده A/B Test کنید.

پرسش‌های متداول

Grok 4.5 چیست؟

مدل استدلالی و اختصاصی SpaceXAI برای مهندسی نرم‌افزار، Coding Agentic، تحلیل تصویر و کارهای دانشی است.

آیا Grok 4.5 برای برنامه‌نویسی خوب است؟

بله؛ در SWE Marathon و Terminal-Bench رسمی عملکرد رقابتی دارد. در DeepSWE 1.1 و SWE-bench Pro برخی رقبا امتیاز بالاتری ثبت کرده‌اند.

Grok 4.5 بهتر است یا Grok 4.6؟

4.6 برای پروژه‌های بلندتر و کیفیت جدیدتر مناسب‌تر است. 4.5 می‌تواند Cache ارزان‌تر، TTFT کمتر و خروجی فشرده‌تری داشته باشد.

Context Window آن چقدر است؟

۵۰۰ هزار توکن است. درخواست‌های ۲۰۰ هزار توکنی یا بیشتر با نرخ Long Context محاسبه می‌شوند.

آیا Grok 4.5 تصویر و فایل Office تولید می‌کند؟

Endpoint مدل خروجی متن دارد و تصویر را می‌فهمد. ساخت فایل Word، Excel یا PowerPoint در Grok Build به ابزار و Integration محصول وابسته است.

آیا Grok 4.5 API دارد؟

بله، با شناسه grok-4.5 در API رسمی در دسترس است و Function Calling و Structured Outputs را پشتیبانی می‌کند.

قیمت API Grok 4.5 چقدر است؟

در Context کوتاه، ورودی ۲ دلار، Cached Input سی سنت و خروجی ۶ دلار به‌ازای یک میلیون توکن است؛ نرخ Context بلند دو برابر می‌شود.

آیا Grok 4.5 رایگان است؟

API مصرفی و پولی است. معرفی اولیه استفاده محدود رایگان در Grok Build و Cursor را تبلیغ می‌کرد، اما دائمی‌بودن آن قابل‌تأیید نیست و باید طرح فعلی هر سرویس بررسی شود.

منابع

یادداشت تحریریه Buffalo147 AI: جدول اصلی و ادعای ۴٫۲ برابر توکن کمتر توسط SpaceXAI گزارش شده‌اند. چون Harnessها و شرایط همه رقبا یکسان نیست، نتیجه باید روی Repository و ابزار واقعی محصول بازآزمایی شود.

خواندنی‌های دیگر