Grok 4.5؛ مدل مهندسی و کدنویسی کممصرف SpaceXAI زیر ذرهبین
آخرین راستیآزمایی: ۱۲ سپتامبر ۲۰۲۶
تاریخ عرضه: ۸ ژوئیه ۲۰۲۶
قیمت و شیوهٔ محاسبه: Input ۲ دلار؛ Output ۶ دلار؛ بهازای هر یک میلیون توکن تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.
مقدمه
Grok 4.5 با یک هدف روشن عرضه شد: مدل فقط کد پیشنهاد ندهد، بلکه بتواند در یک محیط Agentic مسئله مهندسی را دنبال کند. خواندن Repository، کار با Terminal، اصلاح چند فایل، ساخت اپ و تهیه Artifactهای کاری از سناریوهایی هستند که SpaceXAI برای این نسل برجسته کرده است.
این مدل در ۸ ژوئیه ۲۰۲۶ وارد API شد و معرفی عمومی آن در ۱۶ ژوئیه منتشر شد. شرکت سازنده در Master List با نام xAI ثبت شده و اکنون منابع رسمی برند SpaceXAI را نمایش میدهند. Grok 4.5 مدت کوتاهی پرچمدار خانواده بود تا اینکه Grok 4.6 در اوت ۲۰۲۶ جایگاه بالاتر را گرفت.
چیزی که 4.5 را هنوز قابلتوجه میکند، فقط امتیاز Coding نیست. سازنده آن را با Cursor توسعه داده، روی Rust، C و C++ و ساخت End-to-end برنامه آموزش داده و بر کاهش مراحل و توکنهای لازم برای حل مسئله تأکید کرده است. بااینحال ادعاهای بهرهوری و Benchmarkهای عرضه باید با برچسب Vendor-reported و در شرایط واقعی محصول دوباره سنجیده شوند.
معرفی کامل Grok 4.5
Grok 4.5 یک مدل اختصاصی Reasoning با ورودی متن و تصویر و خروجی متن است. شناسه API آن grok-4.5 و Aliasهای فعلی شامل grok-4.5-latest و grok-build-latest هستند. برای کنترل نسخه در Production بهتر است تا حد امکان شناسه ثابت و تغییرات Release Notes مانیتور شود.

مدل با دهها هزار GPU از نوع NVIDIA GB300 و مجموعه دادههای گزینششده در علم، مهندسی، ریاضیات و Coding آموزش دیده است. SpaceXAI از Deduplication، Quality scoring و انتخاب Domain-specific و سپس RL روی صدها هزار کار Coding و Agentic سخن میگوید؛ جزئیات کامل داده، معماری و تعداد پارامترها عمومی نیست.
در زمان عرضه، 4.5 مدل پیشفرض Grok Build شد و در Cursor نیز در دسترس قرار گرفت. قابلیتهای Office در Grok Build—مانند ساخت مدل Excel، اسلاید PowerPoint و سند Word—یک تجربه محصولی با ابزار است؛ نباید آن را با خروجی بومی فایل در Endpoint متن خام یکی دانست.
اکنون Grok 4.6 مدل جدیدتر و قویتر خانواده است، اما 4.5 همچنان Endpoint رسمی دارد. Cache آن از 4.6 ارزانتر است و ارزیابی مستقل خروجی فشردهتری نشان میدهد؛ این دو نکته میتوانند برای Workflowهای تکراری مهم باشند.
قابلیتهای اصلی
مهندسی نرمافزار Agentic
مدل برای بازکردن Issue، جستجو در Codebase، ویرایش فایل، اجرای تست و ادامه تا رفع خطا طراحی شده است. Benchmarkهای عرضه بر SWE، Terminal و Marathon تمرکز دارند و آموزش رسمی نیز زبانهای سطح پایین و ساخت برنامه کامل را پوشش داده است.
عامل اجرایی باید در Sandbox با مجوز محدود کار کند. مدل ممکن است تست ناکافی بنویسد، آسیب جانبی ایجاد کند یا دستور پرخطر پیشنهاد دهد؛ Branch جدا، CI، Review و Rollback اجزای ضروریاند.
استدلال با چهار سطح Effort
در صفحه فعلی مدل، low، medium، high و xhigh پشتیبانی میشوند و پیشفرض high است. این تنظیم به تیم اجازه میدهد کیفیت و هزینه را برای Taskهای مختلف کنترل کند. Effort بیشتر همیشه موفقیت بیشتر نمیآورد و باید با Success rate سنجیده شود.
فهم تصویر و ساخت رابط
Grok 4.5 میتواند Screenshot، دیاگرام و طرح UI را تحلیل کند و کد رابط بسازد. معرفی رسمی نمونههایی مانند شبیهسازی سهبعدی منظومه شمسی را نشان میدهد. خود Endpoint متن، تصویر یا ویدیو تولید نمیکند؛ خروجی بصری از اجرای کد یا ابزار رسانه حاصل میشود.
کار با اسناد و Office
در محیط Grok Build، مدل برای Excel، Word و PowerPoint استفاده شده است: تحقیق وب، فرمول چند Sheet، شکلهای بومی اسلاید و متن سند. موفقیت این Workflow به ابزار و Integration بستگی دارد و قابلیت یکسان در هر API client تضمین نمیشود.
Tool Use و جستجوی زنده
Function Calling، Structured Outputs و Reasoning در صفحه مدل رسمیاند. Responses API ابزارهای Web Search، X Search، Code Execution، Collections Search و Remote MCP را نیز ارائه میکند. برای هر ابزار باید مجوز، Budget و معیار توقف تعریف شود.
Context ۵۰۰هزارتوکنی
Context بزرگ برای Codebase و اسناد مهندسی مفید است. از Prompt برابر ۲۰۰ هزار توکن به بالا، نرخ Long Context به همه توکنهای Request اعمال میشود؛ بنابراین Indexing و Retrieval هدفمند معمولاً از انباشتن تمام Repository بهتر است.
مهمترین نقاط قوت
- تمرکز مشخص روی مهندسی نرمافزار و Agentهای Coding
- عملکرد رقابتی در Terminal-Bench و چند آزمون SWE همدوره
- Context ۵۰۰ هزار توکن همراه با فهم تصویر
- خروجی نسبتاً فشرده در ارزیابی مستقل
- چهار سطح Reasoning و Structured Outputs
- Cache ارزانتر از Grok 4.6 در نرخ فعلی
- Integration با Grok Build، Cursor و ابزارهای Office
محدودیتها و نقاط ضعف
Grok 4.5 دیگر مدل پرچمدار خانواده نیست. Grok 4.6 در Benchmarkهای رسمی مشترک پیشرفت کرده و برای Trajectoryهای بلندتر آموزش بیشتری دیده است. انتخاب 4.5 برای پروژه جدید باید با دلیل مشخصی مانند Cache ارزانتر، رفتار فشردهتر یا نتیجه بهتر روی Dataset داخلی همراه باشد.

Batch API پشتیبانی نمیشود و هزینه Long Context از آستانه ۲۰۰ هزار توکن دو برابر است. Context ۵۰۰ هزار توکن نیز از پنجره یکمیلیونی Grok 4.20 کوچکتر است.
ارزیابی مستقل Artificial Analysis سرعت ۵۵٫۵ توکنبرثانیه و TTFT حدود ۸٫۳۳ ثانیه را ثبت کرده؛ سریعتر از 4.6 برای شروع پاسخ است، اما از میانه کلاس مورد مقایسه کندتر است. عدد رسمی ۸۰ TPS مربوط به گزارش سازنده در زمان عرضه و شرایط سرویس خودش است؛ اختلاف با Snapshot مستقل طبیعی و ناشی از زمان، بار، Prompt و روش اندازهگیری است.
مدل فقط خروجی متن دارد. تعداد پارامترها، معماری دقیق، Knowledge Cutoff و Maximum Output عددی عمومی اعلام نشدهاند. مثل هر LLM دیگری ممکن است کد ناامن یا پاسخ نادرست بسازد و در تصمیم حساس به Review نیاز دارد.
کاربردهای واقعی Grok 4.5
تعمیر یک Issue واقعی Repository
Issue، تست و ساختار پروژه را به Agent بدهید تا ابتدا Test reproduction بسازد، سپس Patch کوچک ارائه کند و CI را اجرا کند. هزینه موفقیت کامل—نه زیبایی Diff—معیار اصلی است.
مهاجرت کد سطح پایین
تمرکز آموزشی روی Rust، C و C++ آن را برای بررسی Memory safety، FFI یا Refactor ماژولهای سیستمی قابلارزیابی میکند. Sanitizer، Benchmark کارایی و Review متخصص همچنان لازماند.
ساخت Prototype تعاملی
مدل میتواند از Brief به ساختار پروژه، Component و Interaction برسد و با Screenshot بازخورد بگیرد. برای طراحی نهایی باید Accessibility و سازگاری مرورگر جدا تست شود.
تهیه مدل Excel و گزارش مدیریتی
در Grok Build، میتوان از داده و وب به Workbook چند Sheet، فرمول و یادداشت رسید و سپس همان یافتهها را به Word یا PowerPoint منتقل کرد. فرمولها و منابع مالی باید مستقل اعتبارسنجی شوند.
Agent عملیات مهندسی
Function Calling امکان اتصال به Issue tracker، CI یا پایگاه دانش را میدهد. عملیات Merge، Deploy، حذف یا تغییر Permission باید Approval انسانی داشته باشند.
Grok 4.5 مناسب چه کسانی است؟
برنامهنویسان، مهندسان پلتفرم، تیمهای DevTools، سازندگان Agent، تحلیلگران فنی و کاربران Grok Build مخاطبان اصلیاند. اگر Workflow شامل کد، Terminal، تصویر رابط و اسناد کاری است، ترکیب قابلیتهای مدل ارزش بیشتری پیدا میکند.
برای جدیدترین کیفیت، ابتدا 4.6 را بسنجید. برای Batch، Context یکمیلیونی یا پاسخ بسیار سریع، 4.20 یا مدل دیگری ممکن است مناسبتر باشد. کاربران عادی که فقط خلاصه یا بازنویسی میخواهند احتمالاً به این سطح مدل نیاز ندارند.
مشخصات فنی Grok 4.5
| مشخصه | مقدار تأییدشده |
|---|---|
| Developer | SpaceXAI / xAI |
| Model Family | Grok 4 |
| Model Type | مدل اختصاصی چندوجهی ورودی و استدلالی برای مهندسی و Agentها |
| API Availability Date | ۸ ژوئیه ۲۰۲۶ |
| Public Announcement | ۱۶ ژوئیه ۲۰۲۶ |
| API Model ID | grok-4.5 |
| Aliases | grok-4.5-latest و grok-build-latest |
| Input | متن و تصویر |
| Output | متن |
| Context Window | ۵۰۰٬۰۰۰ توکن |
| Maximum Output | عدد عمومی قابلتأیید پیدا نشد |
| Knowledge Cutoff | عمومی اعلام نشده است |
| Reasoning Effort | low، medium، high و xhigh؛ پیشفرض high |
| Vision | بله، فهم تصویر |
| Native Image / Audio / Video Generation | خیر |
| Function Calling / Structured Outputs | بله |
| Web / X Search and Code Execution | بله، ابزارمحور |
| Batch API | خیر |
| Regions | us-east-1 و us-west-2 |
| Published rate limits | ۱۵۰ درخواست در ثانیه و ۵۰ میلیون توکن در دقیقه |
| Current Position | API فعال؛ توسط Grok 4.6 بهعنوان پرچمدار جایگزین شده است |
۵ نمونه پرامپت کاربردی
۱. حل Issue با کمترین Patch
Issue و Repository را بررسی کن. اول تستی بنویس که خطا را بازتولید کند، بعد علت ریشهای را با شاهد مشخص کن و کوچکترین Patch ممکن را اعمال کن. تستهای مرتبط و Regression را اجرا کن و تعداد توکن/مرحله و فایلهای تغییرکرده را گزارش بده.
۲. ممیزی Rust و C++
مرز FFI بین این ماژول Rust و کتابخانه C++ را ممیزی کن. خطرهای Ownership، Lifetime، Undefined Behavior، Thread safety و Error propagation را با مسیر کد نشان بده. برای هر اصلاح تست Sanitizer و Benchmark کارایی پیشنهاد کن.
۳. ساخت اپ سهبعدی
با Three.js یک شبیهسازی تعاملی [موضوع] بساز. معماری Componentها، کنترل زمان، دوربین، UI و محدودیت Performance را تعریف کن؛ سپس نمونه را پیادهسازی و با Screenshotهای Desktop و Mobile از نظر خوانایی و تعامل بازبینی کن.
۴. Workbook مدیریتی
دادههای پیوست و منابع وب رسمی را به یک مدل مالی چند Sheet تبدیل کن. Assumptionها، فرمولها، سناریوی پایه/خوشبینانه/بدبینانه و Checksumها را اضافه کن. هیچ عددی را بدون منبع نساز و سلولهای ورودی را از فرمولها متمایز کن.
۵. Agent امن CI
یک Agent برای Triage خطاهای CI طراحی کن. ابزارها، مجوز Read/Write، Branch isolation، محدودیت فرمان Shell، سقف هزینه، Timeout، Approval قبل از Push و Log ممیزی را مشخص کن. پنج سناریوی Prompt Injection هم به تست تبدیل کن.
بنچمارکها و ارزیابی عملکرد
جدول زیر از معرفی SpaceXAI در ۱۶ ژوئیه ۲۰۲۶ آمده و Vendor-reported است. خود صفحه میگوید ارقام رقبا از System Cardها یا Leaderboardهای منتشرشده گرفته شدهاند. در بعضی ردیفها Harness توسط ارائهدهنده و در بعضی توسط Datacurve اجرا شده؛ بنابراین مقایسه کاملاً همشرط نیست.
| Benchmark و آنچه میسنجد | Grok 4.5 | Fable 5 Max | GPT-5.5 xHigh | Opus 4.8 Max | تاریخ / منبع |
|---|---|---|---|---|---|
| DeepSWE 1.0؛ حل Issue نرمافزاری با Harnessهای ارائهدهنده | ۶۲٫۰٪ | ۶۶٫۱٪ | ۶۴٫۳۱٪ | ۵۵٫۷۵٪ | ۱۶ ژوئیه ۲۰۲۶، SpaceXAI؛ Vendor-reported |
| DeepSWE 1.1؛ mini-swe-agent با اجرای Datacurve | ۵۳٪ | ۷۰٪ | ۶۷٪ | ۵۹٪ | ۱۶ ژوئیه ۲۰۲۶، SpaceXAI؛ Vendor-reported |
| SWE Marathon pass@1؛ حل مسئله در مسیرهای طولانی | ۲۹٫۰٪ | ۲۴٫۰٪ | اعلام نشده | ۲۶٫۰٪ | ۱۶ ژوئیه ۲۰۲۶، SpaceXAI؛ Vendor-reported |
| Terminal-Bench 2.1؛ انجام وظایف واقعی Terminal | ۸۳٫۳٪ | ۸۴٫۳٪ | ۸۳٫۴٪ | ۷۸٫۹٪ | ۱۶ ژوئیه ۲۰۲۶، SpaceXAI؛ Vendor-reported |
| SWE-bench Pro؛ رفع Issueهای دشوار Repository | ۶۴٫۷٪ | ۸۰٫۴٪ | ۵۸٫۶٪ | ۶۹٫۲٪ | ۱۶ ژوئیه ۲۰۲۶، SpaceXAI؛ Vendor-reported |
4.5 در SWE Marathon بالاترین عدد جدول را دارد و در Terminal-Bench تقریباً همسطح Fable و GPT-5.5 است. در DeepSWE 1.1 و SWE-bench Pro، Fable و Opus 4.8 برتری دارند. تفاوت ۶۲٪ در DeepSWE 1.0 و ۵۳٪ در نسخه 1.1 نیز نشان میدهد نسخه Dataset و Harness میتواند نتیجه را جدی تغییر دهد.
SpaceXAI علاوه بر Success rate، میانگین ۱۵٬۹۵۴ Output token برای هر Task در SWE-bench Pro گزارش کرده و آن را با ۶۷٬۰۲۰ توکن Opus 4.8 Max مقایسه کرده است؛ یعنی حدود ۴٫۲ برابر کمتر. این ادعا نیز Vendor-reported است و تنها وقتی به هزینه واقعی تبدیل میشود که نرخ موفقیت، Tool calls و Retryها هم محاسبه شوند.
Snapshot مستقل Artificial Analysis
| معیار مستقل | Grok 4.5 High | مرجع همان کلاس | تاریخ / منبع |
|---|---|---|---|
| Intelligence Index v4.3؛ ترکیب ۱۰ ارزیابی | ۳۹ | میانه کلاس همقیمت: ۲۴ | بررسی ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis |
| سرعت خروجی | ۵۵٫۵ توکنبرثانیه | میانه کلاس: ۶۷ | بررسی ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis |
| TTFT | ۸٫۳۳ ثانیه | میانه کلاس: ۳٫۶۵ ثانیه | بررسی ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis |
| هزینه هر Task شاخص | ۱٫۰۴ دلار | روش وزندهی AA | بررسی ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis |
| مجموع خروجی در اجرای شاخص | ۷۷ میلیون توکن | میانه کلاس: ۹۰ میلیون | بررسی ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis |
ارزیابی مستقل تصویر متعادلی میدهد: هوش بالاتر از میانه، خروجی نسبتاً فشرده، اما سرعت و Latency نهچندان ممتاز. برای Coding واقعی، معیار نهایی درصد Issueهای Mergeشده بدون Regression و هزینه هر Patch پذیرفتهشده است.
مقایسه Grok 4.5 با رقبا
| مدل | انتخاب مناسبتر برای | ملاحظه اصلی |
|---|---|---|
| Grok 4.5 | Agent کدنویسی، Rust/C++، Artifactهای Office و پاسخ فشردهتر | نسل قبل از 4.6 و بدون Batch |
| Grok 4.6 | Trajectory بلند، First Pass بصری و کیفیت Frontier جدیدتر | TTFT مستقل بالاتر و Cache گرانتر |
| Fable 5 | DeepSWE 1.1 و SWE-bench Pro در جدول عرضه | قیمت و دسترسی باید در کانال واقعی بررسی شود |
| Claude Opus 4.8 | SWE-bench Pro و Workflowهای اکوسیستم Anthropic | در گزارش Vendor توکن بسیار بیشتری مصرف کرده است |
| GPT-5.5 xHigh | DeepSWE 1.1 و Terminal-Bench رقابتی | Harness و Effort با Grok کاملاً یکسان نیست |
اگر یک تیم از Cursor یا Grok Build استفاده میکند و هزینه خروجی Agent مهم است، 4.5 هنوز گزینه معناداری است. اگر هدف حفظ مسیر طولانی و کیفیت کلی بالاتر باشد، 4.6 نقطه شروع بهتر است. برای Repository مشخص، رقبا را با همان Container، ابزار، Budget و Timeout مقایسه کنید.
قیمت و API
نرخ Standard رسمی در ۱۲ سپتامبر ۲۰۲۶، به دلار و برای هر یک میلیون توکن:
| نوع توکن | کمتر از ۲۰۰K Prompt | از ۲۰۰K Prompt به بالا |
|---|---|---|
| Input | ۲ دلار | ۴ دلار |
| Cached Input | ۰٫۳۰ دلار | ۰٫۶۰ دلار |
| Output | ۶ دلار | ۱۲ دلار |
Batch API برای 4.5 پشتیبانی نمیشود. با رسیدن Prompt به ۲۰۰ هزار توکن، نرخ Long Context برای همه Tokenهای همان درخواست فعال میشود. Cache برای Context تکراری میتواند هزینه را کاهش دهد، اما اعتبار Cache و تغییر Prefix باید در Integration آزموده شود.
هزینه ابزار جداست: Web Search و Code Execution هرکدام ۵ دلار برای هزار Call، File Attachments ده دلار و Collections Search برابر ۲٫۵۰ دلار برای هزار Call. X Search طبق اطلاعیه رسمی از ۲۱ سپتامبر ۲۰۲۶ به قیمتگذاری براساس تعداد پست و پروفایل واکشیشده مهاجرت میکند.
Grok 4.5 را در Buffalo147 AI امتحان کنید
بهترین آزمون، یک Issue واقعی با تست شکستخورده و معیار Merge است. از مدل بخواهید تعداد مراحل، توکن و تغییرات را ثبت کند تا علاوه بر کیفیت Patch، بهرهوری ادعاشده آن را هم بسنجید.
شروع استفاده از Grok 4.5 در Buffalo147 AI
جمعبندی
مهمترین مزیت Grok 4.5 تمرکز تخصصی روی مهندسی Agentic و بهرهوری توکن است. نتایج رسمی آن در Terminal و SWE Marathon رقابتیاند و Integration با Cursor و Grok Build برای ساخت نرمافزار و Artifactهای کاری ارزش عملی دارد.
محدودیت اصلی این است که 4.6 اکنون مدل جدیدتر خانواده است و 4.5 Batch ندارد. نتایج Benchmark نیز یکدست نیستند؛ در بعضی SWE evalها رقبای مستقیم فاصله محسوسی دارند.
برای تیمی که Coding، Terminal، اسناد Office و خروجی نسبتاً فشرده میخواهد، 4.5 هنوز انتخاب قابلآزمایشی است. برای پروژه جدید، آن را کنار 4.6 با معیار هزینه هر Task پذیرفتهشده A/B Test کنید.
پرسشهای متداول
Grok 4.5 چیست؟
مدل استدلالی و اختصاصی SpaceXAI برای مهندسی نرمافزار، Coding Agentic، تحلیل تصویر و کارهای دانشی است.
آیا Grok 4.5 برای برنامهنویسی خوب است؟
بله؛ در SWE Marathon و Terminal-Bench رسمی عملکرد رقابتی دارد. در DeepSWE 1.1 و SWE-bench Pro برخی رقبا امتیاز بالاتری ثبت کردهاند.
Grok 4.5 بهتر است یا Grok 4.6؟
4.6 برای پروژههای بلندتر و کیفیت جدیدتر مناسبتر است. 4.5 میتواند Cache ارزانتر، TTFT کمتر و خروجی فشردهتری داشته باشد.
Context Window آن چقدر است؟
۵۰۰ هزار توکن است. درخواستهای ۲۰۰ هزار توکنی یا بیشتر با نرخ Long Context محاسبه میشوند.
آیا Grok 4.5 تصویر و فایل Office تولید میکند؟
Endpoint مدل خروجی متن دارد و تصویر را میفهمد. ساخت فایل Word، Excel یا PowerPoint در Grok Build به ابزار و Integration محصول وابسته است.
آیا Grok 4.5 API دارد؟
بله، با شناسه grok-4.5 در API رسمی در دسترس است و Function Calling و Structured Outputs را پشتیبانی میکند.
قیمت API Grok 4.5 چقدر است؟
در Context کوتاه، ورودی ۲ دلار، Cached Input سی سنت و خروجی ۶ دلار بهازای یک میلیون توکن است؛ نرخ Context بلند دو برابر میشود.
آیا Grok 4.5 رایگان است؟
API مصرفی و پولی است. معرفی اولیه استفاده محدود رایگان در Grok Build و Cursor را تبلیغ میکرد، اما دائمیبودن آن قابلتأیید نیست و باید طرح فعلی هر سرویس بررسی شود.
منابع
- معرفی رسمی Grok 4.5
- صفحه رسمی مدل Grok 4.5
- قیمت رسمی API و ابزارهای SpaceXAI
- Release Notes رسمی API
- ارزیابی مستقل Grok 4.5 در Artificial Analysis
- معرفی رسمی Grok 4.6 برای مقایسه نسلها
یادداشت تحریریه Buffalo147 AI: جدول اصلی و ادعای ۴٫۲ برابر توکن کمتر توسط SpaceXAI گزارش شدهاند. چون Harnessها و شرایط همه رقبا یکسان نیست، نتیجه باید روی Repository و ابزار واقعی محصول بازآزمایی شود.