Buffalo147 AI

خانه › بلاگ

Grok Build 0.1؛ بررسی مدل سریع کدنویسی Agentic، API و Benchmarkهای واقعی

جلد Grok Build 0.1 با طراحی سه‌بعدی مشکی و نور مسی

آخرین راستی‌آزمایی: ۱۲ سپتامبر ۲۰۲۶

در یک نگاه | Grok Build 0.1
تاریخ عرضه: روز دقیق عرضه در متن فعلی ثبت نشده است.
قیمت و شیوهٔ محاسبه: Input ۱ دلار؛ Output ۲ دلار؛ به‌ازای هر یک میلیون توکن تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.

مقدمه

Grok Build 0.1 برای حالتی طراحی شده که مدل داخل یک Coding harness کار می‌کند: فایل می‌خواند، در Repository جستجو می‌کند، Terminal را به‌کار می‌گیرد، کد را ویرایش و نتیجه را تست می‌کند. اینجا کیفیت فقط با پاسخ متنی سنجیده نمی‌شود؛ مهم این است که Agent با چند دور Tool Call به Patch قابل‌قبول برسد.

SpaceXAI این مدل را ۱۹ مه ۲۰۲۶ در Early Access ثبت کرد و در ۲۹ مه API آن را در Public Beta معرفی کرد. نام شرکت در Master List xAI است و برند فعلی در منابع رسمی SpaceXAI. مدل با شناسه grok-build-0.1 همان مدلی معرفی شده که محصول Grok Build را نیرو می‌دهد.

یک نکته نسخه‌ای بسیار مهم وجود دارد: صفحه فعلی مدل، شناسه‌های grok-code-fast-1 را Alias همین Endpoint می‌داند، اما معرفی تاریخی Grok Code Fast 1 در اوت ۲۰۲۵ قیمت و Modality متفاوتی داشت. بنابراین Benchmark آن Snapshot تاریخی را نباید بدون توضیح به سرویس فعلی Grok Build 0.1 نسبت داد.

معرفی کامل Grok Build 0.1

Grok Build 0.1 یک مدل Proprietary و تخصصی Coding است، نه خود ابزار Terminal یا محیط کامل Grok Build. مدل از طریق API پاسخ می‌دهد؛ محصول Grok Build Harness، فایل، Terminal، ابزار، Session و تجربه کاربری را پیرامون مدل فراهم می‌کند. نتیجه یک مدل در Harness خوب می‌تواند کاملاً با Chat خام فرق داشته باشد.

شماتیک روند ورودی، مدل و خروجی برای Grok Build 0.1
نمای شماتیک روند درخواست تا خروجی برای Grok Build 0.1؛ قابلیت‌های دقیق در متن مقاله آمده‌اند.

صفحه فعلی API ورودی متن و تصویر، خروجی متن و Context برابر ۲۵۶ هزار توکن را نشان می‌دهد. Function Calling، Structured Outputs و Reasoning پشتیبانی می‌شوند. تعداد پارامتر، معماری و Knowledge Cutoff عمومی نشده‌اند.

Aliasهای رسمی شامل grok-code-fast-1، grok-code-fast و grok-code-fast-1-0825 هستند. نسخه تاریخی Grok Code Fast 1 از صفر با معماری جدید و Corpus غنی از کد، Pull Request و وظایف واقعی برنامه‌نویسی ساخته شد و برای ابزارهایی مانند grep، Terminal و File editing آموزش دید.

در معرفی Public Beta، SpaceXAI استفاده در Grok Build، Cursor، Hermes Agent، OpenClaw، Kilo Code و OpenCode و همچنین دسترسی از OpenRouter و Vercel AI Gateway را ذکر کرد. وضعیت و قیمت هر پلتفرم می‌تواند با API مستقیم متفاوت باشد.

قابلیت‌های اصلی

Coding Agentic

مدل برای چرخه Plan، Search، Edit، Test و Iterate بهینه شده است. از ساخت پروژه صفر تا یک، پاسخ به سؤال درباره Codebase و رفع Bug کوچک پشتیبانی می‌کند. عملکرد خوب به Harness، دستور ابزار، Sandbox و Feedback تست وابسته است.

Web Development و Prototype

یکی از سناریوهای رسمی، ساخت وب‌سایت از Prompt است. مدل می‌تواند Component، Style و Interaction بسازد و از روی Screenshot بازخورد بگیرد. برای Production باید Accessibility، امنیت، Responsive behavior و Performance جدا آزمایش شوند.

Debug و تعمیر هدفمند

با Log، تست شکست‌خورده و کد مرتبط می‌توان از مدل خواست علت ریشه‌ای را پیدا و Patch حداقلی ارائه کند. بهترین Workflow ابتدا Test reproduction و سپس تغییر کد است؛ توضیح قانع‌کننده بدون تست نتیجه محسوب نمی‌شود.

Tool Calling و MCP

Function Calling و Remote MCP اتصال به ابزارها و سرویس‌ها را ممکن می‌کنند. معرفی رسمی، MCP را یکی از کاربردهای مدل می‌داند. هر ابزار باید Schema محدود، مجوز کمینه، Timeout و Audit log داشته باشد.

فهم تصویر

صفحه فعلی grok-build-0.1 ورودی تصویر را پشتیبانی‌شده نشان می‌دهد؛ برای Screenshot خطا یا UI مفید است. معرفی تاریخی grok-code-fast-1 و صفحه قدیمی ارزیاب مستقل آن را Text-only ثبت کرده‌اند. برای Integration فعلی، مستند Endpoint رسمی مبناست و رفتار تصویر باید با یک Smoke test تأیید شود.

Structured Outputs و Caching

Structured Outputs برای برنامه تغییرات، گزارش تست یا Artifact ماشین‌خوان مفید است. Cached Input با نرخ جدا ارائه می‌شود و برای System prompt، راهنمای Repository یا Prefix تکراری هزینه را کاهش می‌دهد.

مهم‌ترین نقاط قوت

  • آموزش و طراحی مشخص برای Coding Agentic و Tool loop
  • سرعت بالای ادعاشده، بیش از ۱۰۰ توکن‌برثانیه در معرفی Public Beta
  • مهارت در Web Development، Debug و کار با Repository
  • آشنایی تاریخی با grep، Terminal و File editing
  • پشتیبانی فعلی از متن و تصویر و Context ۲۵۶ هزار توکن
  • Function Calling، Structured Outputs و MCP
  • قیمت فعلی پایین‌تر از مدل‌های Frontier عمومی برای خروجی Coding

محدودیت‌ها و نقاط ضعف

وضعیت عرضه نیاز به احتیاط دارد. معرفی ۲۹ مه مدل را Public Beta می‌نامد، ولی صفحه فعلی مدل برچسب Beta را نمایش نمی‌دهد و اعلان صریح GA قابل‌تأیید پیدا نشد. برای Production باید قرارداد API، Availability حساب و سیاست تغییر Alias بررسی شود.

سه معیار ارزیابی عملی برای Grok Build 0.1
معیارهای پیشنهادی برای آزمون Grok Build 0.1 با کار واقعی؛ این تصویر دادهٔ بنچمارک یا امتیاز گزارش‌شده نیست.

Benchmark عددی معتبر برای Snapshot دقیق فعلی grok-build-0.1 منتشر نشده است. عدد SWE-bench Verified برابر ۷۰٫۸٪ به grok-code-fast-1 در اوت ۲۰۲۵ و Harness داخلی xAI مربوط است؛ قیمت و Modality آن عرضه با صفحه فعلی فرق دارند.

Context مدل ۲۵۶ هزار توکن است؛ کمتر از Grok 4.3/4.20 و نصف 4.5/4.6. از ۲۰۰ هزار توکن نرخ Long Context فعال می‌شود و فقط ۵۶ هزار توکن ظرفیت بیشتر تا سقف باقی می‌ماند، پس عبور از این آستانه باید واقعاً توجیه داشته باشد.

Batch API پشتیبانی نمی‌شود. مدل تخصصی Coding است و برای پژوهش علمی، تحلیل حقوقی یا استدلال Frontier لزوماً انتخاب مناسبی نیست. امنیت Patch، License dependency و فرمان‌های Shell همواره باید بازبینی شوند.

کاربردهای واقعی Grok Build 0.1

رفع Bug در IDE

Agent می‌تواند Issue را بخواند، با rg فایل مربوط را پیدا کند، تست بازتولید بسازد و Patch را اجرا کند. دسترسی نوشتن باید به Branch یا Workspace ایزوله محدود باشد.

ساخت Landing Page از روی Brief

مدل می‌تواند Design constraints و Screenshot مرجع را به کد React یا HTML/CSS تبدیل کند. معیار پذیرش باید شامل Mobile، Keyboard navigation و Visual regression باشد.

Refactor کنترل‌شده

برای شکستن یک ماژول بزرگ، مدل می‌تواند ابتدا Dependency map و تست Characterization بسازد و Refactor را مرحله‌ای انجام دهد. هر مرحله باید قابل Rollback باشد.

نوشتن Integration مبتنی بر MCP

مدل می‌تواند Client یا ابزار MCP را با Schema، مدیریت خطا و تست Contract بسازد. Secret نباید داخل Prompt یا Log چاپ شود و Tool permissions باید محدود باشند.

Triage سریع CI

با Log و Diff می‌توان خطاها را دسته‌بندی و مالک احتمالی Component را مشخص کرد. اقدام خودکار مانند Re-run یا Merge فقط با Rule مشخص انجام شود.

Grok Build 0.1 مناسب چه کسانی است؟

توسعه‌دهندگان، تیم‌های DevTools، سازندگان IDE و Coding Agent، استارتاپ‌های Web و مهندسانی که چرخه تغییر و تست سریع می‌خواهند، مخاطب اصلی‌اند. بهترین تجربه در Harness ابزارمحور به دست می‌آید، نه چت بدون دسترسی به Repository.

برای تحلیل عمومی دشوار یا Context بسیار بزرگ، Grok 4.6 یا 4.3 مناسب‌تر است. برای تیمی که فقط Autocomplete می‌خواهد، یک مدل سبک‌تر یا ابزار اختصاصی Completion ممکن است ساده‌تر باشد.

مشخصات فنی Grok Build 0.1

مشخصه مقدار تأییدشده
Developer SpaceXAI / xAI
Model Family Grok Build / Grok Code Fast
Model Type مدل اختصاصی Reasoning برای Coding Agentic
Early Access ۱۹ مه ۲۰۲۶
Public Beta API Announcement ۲۹ مه ۲۰۲۶
API Model ID grok-build-0.1
Official Aliases grok-code-fast-1، grok-code-fast و grok-code-fast-1-0825
Input متن و تصویر در صفحه فعلی مدل
Output متن
Context Window ۲۵۶٬۰۰۰ توکن
Maximum Output عمومی اعلام نشده است
Knowledge Cutoff عمومی اعلام نشده است
Reasoning بله؛ سطح‌های قابل تنظیم عمومی در صفحه مدل ذکر نشده‌اند
Vision بله در Endpoint فعلی؛ Snapshot تاریخی Code Fast به‌صورت Text-only ثبت شده بود
Native Media Generation خیر
Function Calling / Structured Outputs بله
MCP Remote MCP از طریق ابزارها؛ مدل برای MCP معرفی شده است
Web / X Search and Code Execution در اکوسیستم ابزار Responses API قابل اتصال
Batch API خیر
Regions us-east-1 و us-west-2
Published rate limits ۳۷ درخواست در ثانیه و ۱۰ میلیون توکن در دقیقه
Current Stability Endpoint رسمی فعال؛ اعلان صریح GA پس از Public Beta پیدا نشد

۵ نمونه پرامپت کاربردی

۱. رفع Issue با تست اجباری

Issue و Repository را بررسی کن. قبل از تغییر کد، تستی بنویس که خطا را بازتولید کند. سپس کوچک‌ترین Patch را اعمال کن، تست هدف و Suite مرتبط را اجرا کن و Diff، ریسک Regression و فرمان Rollback را گزارش بده.

۲. ساخت رابط از Screenshot

این Screenshot و Design tokens را به Componentهای React قابل‌استفاده تبدیل کن. Mobile و Desktop، Focus state، Keyboard navigation و Empty/Error states را پیاده‌سازی کن. در پایان Screenshot خروجی را با مرجع مقایسه و اختلاف‌ها را اصلاح کن.

۳. Refactor مرحله‌ای

این ماژول را بدون تغییر رفتار به سه لایه تقسیم کن. ابتدا Dependency graph و تست Characterization بساز؛ سپس هر مرحله را در Commit منطقی جدا انجام بده. بعد از هر مرحله تست، Type check و Lint را اجرا کن و در شکست متوقف شو.

۴. ساخت MCP Server امن

برای سرویس [نام] یک MCP server حداقلی بساز. Schema ابزارها، Authentication، Timeout، Rate limit، Redaction لاگ و مدیریت خطا را پیاده‌سازی کن. Secret را هرگز در خروجی چاپ نکن و Contract test بنویس.

۵. Triage لاگ CI

این Log و Diff را تحلیل کن. خطاهای ریشه‌ای را از خطاهای زنجیره‌ای جدا کن، فایل و Commit محتمل را با شاهد مشخص کن و فقط یک آزمایش کم‌هزینه برای هر فرضیه پیشنهاد بده. بدون تأیید من Push یا Merge نکن.

بنچمارک‌ها و ارزیابی عملکرد

برای Snapshot دقیق فعلی Grok Build 0.1 جدول Benchmark هم‌شرط عمومی پیدا نشد. نزدیک‌ترین داده رسمی، عرضه تاریخی Alias grok-code-fast-1 در ۲۸ اوت ۲۰۲۵ است. چون صفحه فعلی Modality و قیمت دیگری دارد، این اعداد تاریخی و Vendor-reported هستند و نه نتیجه قطعی Endpoint فعلی.

Benchmark / معیار Grok Code Fast 1 تاریخی رقبا / مرجع تاریخ و منبع
SWE-bench Verified؛ درصد Issueهای واقعی GitHub حل‌شده ۷۰٫۸٪ امتیاز هم‌شرط رقبا در همان Harness منتشر نشد ۲۸ اوت ۲۰۲۵، xAI؛ Harness داخلی و Vendor-reported
سرعت خروجی API؛ فقط Final tokenها حدود ۱۹۰ TPS در نمودار عرضه Gemini 2.5 Pro، GPT-5، Claude Sonnet 4، Grok 4 و چند رقیب دیگر در نمودار؛ عددهای متنی کامل قابل‌بازیابی نبود ۲۸ اوت ۲۰۲۵، xAI؛ Vendor-reported
Intelligence Index v4.3؛ ۱۰ Eval ترکیبی ۱۴، تخمینی میانه کلاس گزارش‌شده: ۱۱ بررسی ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis؛ Snapshot تاریخی منسوخ

SWE-bench Verified توان حل Issue واقعی GitHub را می‌سنجد، اما Harness، ابزار، Timeout و تعداد تلاش اثر زیادی دارند. چون xAI عدد ۷۰٫۸٪ را با Harness داخلی خود گزارش کرده و امتیاز رقبا را در همان شرایط نداده، از آن نمی‌توان رتبه جهانی استخراج کرد.

Artificial Analysis صفحه Grok Code Fast 1 را Deprecated می‌داند و امتیاز ۱۴ را «تخمینی؛ ارزیابی مستقل در انتظار» برچسب می‌زند. آن صفحه قیمت صفر نشان می‌دهد که بازتاب دسترسی یا داده تاریخی است و با قیمت فعلی API رسمی تطابق ندارد؛ در این مقاله برای قیمت استفاده نشده است.

برای سنجش مدل فعلی، Grok Build 0.1 را با Grok 4.5/4.6 و یک Coding Agent رقیب روی یک Container، ابزار، Timeout و Budget یکسان اجرا کنید. معیارهای مناسب شامل درصد تست‌های عبوری، Regression، تعداد Tool Call، زمان تا Patch، هزینه هر Patch پذیرفته‌شده و میزان دخالت انسان‌اند.

مقایسه Grok Build 0.1 با رقبا

مدل انتخاب مناسب‌تر برای ملاحظه اصلی
Grok Build 0.1 Iteration سریع، Web Development، Debug و Harnessهای Coding Benchmark فعلی محدود و Context ۲۵۶K
Grok 4.5 Engineering Agentic دشوار و Repository بزرگ‌تر گران‌تر و بدون Batch، اما کیفیت بالاتر مستقل
Grok 4.6 Trajectory بلند، خودآزمایی و First Passهای پیچیده TTFT و قیمت بیشتر
GPT-5.6 Sol گزینه عمومی‌تر برای Coding Agent و رفع خطای چندمرحله‌ای ابزار، میزان استدلال و هزینه کل کار را با شرایط برابر بسنجید
Claude/Codex Coding Agents Workflowهای بالغ در اکوسیستم‌های مربوط قیمت و Harness با API خام قابل مقایسه مستقیم نیست

Grok Build 0.1 زمانی منطقی است که سرعت Loop و هزینه هر Iteration مهم باشد. برای Migration بزرگ یا Bug بسیار پیچیده، یک مدل Frontier ممکن است با درخواست کمتر نتیجه بهتری بدهد. هزینه نهایی Trajectory، نه نرخ Token، تعیین‌کننده است.

قیمت و API

قیمت فعلی رسمی در ۱۲ سپتامبر ۲۰۲۶، به دلار و برای هر یک میلیون توکن:

نوع توکن کمتر از ۲۰۰K Prompt از ۲۰۰K Prompt به بالا
Input ۱ دلار ۲ دلار
Cached Input ۰٫۲۰ دلار ۰٫۴۰ دلار
Output ۲ دلار ۴ دلار

Batch پشتیبانی نمی‌شود. چون Context سقف ۲۵۶ هزار دارد، بازه Long Context آن از ۲۰۰ تا ۲۵۶ هزار توکن است. عبور از آستانه نرخ تمام Tokenهای Request را دو برابر می‌کند.

در معرفی تاریخی Grok Code Fast 1، نرخ ۰٫۲۰ دلار Input، ۰٫۰۲ دلار Cache و ۱٫۵۰ دلار Output بود؛ این اعداد دیگر با صفحه فعلی grok-build-0.1 یکسان نیستند و نباید برای برآورد امروز استفاده شوند.

Tool cost جداست: Web Search و Code Execution هرکدام ۵ دلار برای هزار Call، File Attachments ده دلار و Collections Search برابر ۲٫۵۰ دلار برای هزار Call. هزینه MCP از سمت xAI Token-based است و سرویس MCP نیز ممکن است هزینه خودش را داشته باشد.

Grok Build 0.1 را در Buffalo147 AI امتحان کنید

یک Issue کوچک اما واقعی با تست مشخص انتخاب کنید و به مدل دسترسی محدود به Repository بدهید. زمان، Tool Call، توکن، Diff و نتیجه CI را ثبت کنید تا سرعت ادعاشده به معیار قابل‌تصمیم تبدیل شود.

شروع استفاده از Grok Build 0.1 در Buffalo147 AI

جمع‌بندی

مهم‌ترین مزیت Grok Build 0.1 تمرکز خالص روی Coding Agentic و Loop سریع ابزار است. برای Web Development، Debug و Patchهای کوچک در Harness مناسب می‌تواند گزینه‌ای اقتصادی باشد.

محدودیت اصلی، ابهام نسخه‌ای میان Endpoint فعلی و Alias تاریخی Grok Code Fast است. Benchmark مستقل کامل برای Snapshot فعلی نداریم، Context محدودتر است و Batch نیز پشتیبانی نمی‌شود.

این مدل برای تیمی مناسب است که می‌تواند آن را روی Repository واقعی Benchmark و خروجی را با CI کنترل کند. اگر مسئله بسیار پیچیده یا طولانی است، 4.5 و 4.6 را نیز با معیار هزینه هر Patch پذیرفته‌شده مقایسه کنید.

پرسش‌های متداول

Grok Build 0.1 چیست؟

مدل تخصصی SpaceXAI برای Agentهای کدنویسی، Web Development، Debug و Tool Calling است که با شناسه grok-build-0.1 در API عرضه می‌شود.

تفاوت مدل با محصول Grok Build چیست؟

مدل موتور هوش مصنوعی است؛ محصول Grok Build محیط، Terminal، فایل، ابزار و Harness را فراهم می‌کند. عملکرد Agent حاصل هر دو بخش است.

آیا Grok Build 0.1 همان Grok Code Fast 1 است؟

صفحه فعلی شناسه‌های Grok Code Fast را Alias می‌داند، اما قیمت و Modality فعلی با عرضه تاریخی فرق دارد. برای Benchmark باید Snapshot دقیق ثبت شود.

آیا این مدل برای برنامه‌نویسی خوب است؟

برای Coding Agentic و Iteration سریع طراحی شده است. نتیجه باید با تست Repository واقعی سنجیده شود، چون Benchmark فعلی نسخه دقیق محدود است.

آیا ورودی تصویر دارد؟

صفحه فعلی مدل بله می‌گوید. Snapshot تاریخی Grok Code Fast Text-only بود؛ بنابراین Integration تصویر را روی Endpoint فعلی Smoke test کنید.

Context Window آن چقدر است؟

۲۵۶ هزار توکن است و از ۲۰۰ هزار توکن به بالا نرخ Long Context اعمال می‌شود.

آیا API و Batch دارد؟

API رسمی فعال است، اما Batch برای این مدل پشتیبانی نمی‌شود. اعلان اولیه Public Beta بود و اعلان صریح GA پیدا نشد.

قیمت فعلی API چقدر است؟

برای Prompt زیر ۲۰۰ هزار توکن، Input یک دلار، Cached Input بیست سنت و Output دو دلار برای هر یک میلیون توکن است.

منابع

یادداشت تحریریه Buffalo147 AI: عدد ۷۰٫۸٪ و سرعت حدود ۱۹۰ TPS به Snapshot تاریخی Grok Code Fast 1 و Harness سازنده مربوط‌اند. به‌دلیل تفاوت قیمت و Modality با Endpoint فعلی، این اعداد Benchmark قطعی Grok Build 0.1 امروز محسوب نمی‌شوند.

خواندنی‌های دیگر