Gemini 3.1 Pro Preview؛ بررسی مدل استدلالی Google برای مسائل پیچیده و Agentها
آخرین راستیآزمایی: ۱۲ سپتامبر ۲۰۲۶
تاریخ عرضه: ۱۹ فوریه ۲۰۲۶
قیمت و شیوهٔ محاسبه: Prompt تا ۲۰۰K: ۲ دلار ورودی و ۱۲ دلار خروجی برای هر یک میلیون توکن تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.
مقدمه
Gemini 3.1 Pro برای پرسشهایی ساخته شد که پاسخ کوتاه برایشان کافی نیست: تحلیل یک سیستم پیچیده، ساخت نمونه تعاملی، حل الگوریتم دشوار یا اجرای چند مرحله ابزار با وابستگی میان گامها. Google این نسخه را ارتقای هسته استدلالی Gemini 3 Pro معرفی کرد.
در عمل، مدل میتواند متن، تصویر، صوت، ویدیو و PDF را کنار هم بفهمد، Repository بزرگ را تحلیل کند و از Function، Search یا Code Execution استفاده کند. امتیاز بسیار بالای رسمی در ARC-AGI-2، GPQA و BrowseComp نشان میدهد استدلال و استفاده از ابزار، محور اصلی طراحی آن بوده است.
اما نام کامل مدل یک هشدار مهم دارد: Preview. در ۱۲ سپتامبر ۲۰۲۶ هنوز شناسه Stable برای 3.1 Pro در صفحه مدل اعلام نشده و Endpoint رسمی همان gemini-3.1-pro-preview است. برای محصول حساس باید تغییر رفتار، حذف احتمالی Snapshot و برنامه مهاجرت را از ابتدا در نظر گرفت.
معرفی کامل Gemini 3.1 Pro Preview
Google مدل Gemini 3.1 Pro را در ۱۹ فوریه ۲۰۲۶ عرضه کرد. این مدل بر پایه Gemini 3 Pro ساخته شده و هنگام انتشار، پیشرفتهترین مدل عمومی Google برای مسائل پیچیده معرفی شد. شناسه API اصلی gemini-3.1-pro-preview است.

نسخه جداگانه gemini-3.1-pro-preview-customtools برای Workflowهایی ارائه شده که Bash و ابزارهای سفارشی مانند view_file یا search_code را ترکیب میکنند. Google هشدار میدهد این Endpoint بیرون از سناریوهای مناسب ابزار سفارشی ممکن است نوسان کیفیت داشته باشد.
دسترسی اعلامشده شامل Gemini API، AI Studio، Vertex AI، Gemini Enterprise، Antigravity، Gemini CLI، Android Studio، Gemini App و NotebookLM است. محدودیت و نام نمایشی مدل در هر محصول میتواند متفاوت باشد.
قابلیتهای اصلی
استدلال انتزاعی و حل مسئله
مدل برای کشف الگو، ترکیب چند منبع و برنامهریزی راهحلهای چندمرحلهای طراحی شده است. نتیجه ۷۷٫۱٪ در ARC-AGI-2 تأییدشده توسط ARC Prize، یکی از برجستهترین ادعاهای زمان عرضه بود؛ بااینحال این عدد Vendor-reported و مربوط به تنظیم مشخص است.
Coding پیشرفته و Creative Coding
3.1 Pro میتواند Repository را تحلیل، الگوریتم بسازد و رابطهای تعاملی مانند SVG متحرک یا Dashboard دادهمحور تولید کند. نمونههای رسمی شامل داشبورد مدار ایستگاه فضایی و تجربه سهبعدی تعاملی بودند، اما کد تولیدی همچنان به تست امنیت، Performance و دسترسپذیری نیاز دارد.
Agent و ابزارهای سفارشی
Function Calling، Code Execution، URL Context و Endpoint تخصصی Custom Tools برای اجرای Workflow چندمرحلهای در دسترساند. مدل میتواند ابزار مناسب را انتخاب کند، اما مجوز، Timeout، بودجه فراخوانی و شرط توقف باید بیرون از مدل اعمال شوند.
Search و Maps Grounding
Google Search Grounding و Maps Grounding داده تازه را وارد Context میکنند. این قابلیت برای پژوهش و تصمیم مکانی مفید است؛ Citationها باید حفظ شوند و هر Query Grounding میتواند هزینه جدا داشته باشد.
فهم چندوجهی و Context بزرگ
ورودی متن، تصویر، صوت، ویدیو و PDF با سقف ۱٬۰۴۸٬۵۷۶ توکن پشتیبانی میشود. مدل میتواند دادههای چندرسانهای و کل Repository را در یک مسئله ترکیب کند و تا ۶۵٬۵۳۶ توکن متن خروجی بدهد.
خروجی ساختاریافته و File Search
Structured Outputs و Caching پشتیبانی میشوند. File Search در صفحه مدل با قید «فقط AI Studio» ثبت شده است؛ بنابراین توسعهدهنده نباید بدون بررسی محیط، در دسترس بودن یکسان آن را در همه کانالها فرض کند.
مهمترین نقاط قوت
- استدلال انتزاعی بسیار قوی در ARC-AGI-2 رسمی
- عملکرد برجسته در GPQA، BrowseComp و MCP Atlas
- Coding و Algorithm Development در سطح مدل Pro
- Context یکمیلیونتوکنی و ورودی چندوجهی گسترده
- Endpoint ویژه برای Bash و Custom Tools
- توان ترکیب Search، Code و Tool Use در Workflowهای طولانی
محدودیتها و نقاط ضعف
وضعیت Preview مهمترین محدودیت عملی است. Google تضمین Stable بودن شناسه یا سازگاری بلندمدت این Endpoint را اعلام نکرده است. برای Production باید نام مدل Configurable، Regression Suite و مسیر Rollback وجود داشته باشد.

زمان رسیدن به اولین توکن در ارزیابی مستقل تنظیمشده حدود ۲۵٫۱۶ ثانیه بوده است. سرعت تولید پس از شروع خوب است، اما برای چت سریع یا UI واکنشی، مدلهای Flash تجربه بهتری میدهند.
قیمت برای Promptهای بیشتر از ۲۰۰ هزار توکن افزایش مییابد و خروجی شامل توکنهای Thinking است. Context یکمیلیونی به همین دلیل میتواند بسیار گران شود؛ Retrieval و Caching باید آگاهانه طراحی شوند.
Computer Use در صفحه قابلیتهای این شناسه اعلام نشده است، پس نباید آن را مفروض گرفت. تولید بومی تصویر یا صوت و Live API نیز پشتیبانی نمیشوند. تاریخ دقیق Knowledge Cutoff عمومی برای همین Snapshot در منابع رسمی بررسیشده پیدا نشد و نباید حدس زده شود.
کاربردهای واقعی Gemini 3.1 Pro Preview
تحلیل معماری نرمافزار
مدل میتواند Repository و مستندات را بررسی، وابستگیهای پرریسک را پیدا و برنامه مهاجرت مرحلهای با تست و Rollback پیشنهاد کند. تصمیم نهایی معماری باید توسط تیم فنی تأیید شود.
ساخت Prototype تعاملی
از یک Brief میتوان SVG متحرک، Dashboard یا تجربه سهبعدی کدنویسیشده ساخت. اجرای کد در Sandbox و بررسی Cross-browser ضروری است.
پژوهش چندمنبعی پیچیده
Search Grounding و Code Execution اجازه میدهند مدل منابع را جمع، داده را محاسبه و گزارش منبعدار بسازد. روش محاسبه و داده خام باید کنار نتیجه باقی بمانند.
Agent مهندسی با Custom Tools
Endpoint مخصوص Custom Tools برای ترکیب Bash، جستجوی کد و خواندن فایل طراحی شده است. دامنه Repository، فرمانهای مجاز و حداکثر دور باید محدود شوند.
تحلیل پرونده چندوجهی
یک مسئله میتواند همزمان شامل گزارش PDF، ویدیو، صدای جلسه و Screenshot باشد. مدل روابط میان منابع را استخراج میکند، اما ارجاع صفحه و Timestamp برای ممیزی لازم است.
این مدل مناسب چه کسانی است؟
Gemini 3.1 Pro Preview برای پژوهشگران، برنامهنویسان ارشد، تیمهای داده، سازندگان Agent و طراحان تجربههای تعاملی مناسب است که مسئله پیچیدهتر از یک پاسخ روزمره دارند و ریسک Preview را مدیریت میکنند.
برای ترجمه، دستهبندی یا چت پرتعداد، Flash-Lite انتخاب اقتصادیتری است. برای Production با نیاز شدید به ثبات نیز یک مدل Stable یا Snapshot جدیدتر باید در Eval حضور داشته باشد.
مشخصات فنی Gemini 3.1 Pro Preview
| مشخصه | مقدار تأییدشده |
|---|---|
| Developer | |
| Model Family | Gemini 3.1 Pro |
| Model Type | مدل اختصاصی چندوجهی و استدلالی رده Pro |
| Release Date | ۱۹ فوریه ۲۰۲۶ |
| Lifecycle | Preview در زمان بررسی |
| API Model ID | gemini-3.1-pro-preview |
| Custom Tools Endpoint | gemini-3.1-pro-preview-customtools |
| Based On | Gemini 3 Pro |
| Input | متن، تصویر، صوت، ویدیو و PDF |
| Output | متن |
| Context Window | ۱٬۰۴۸٬۵۷۶ توکن ورودی |
| Maximum Output | ۶۵٬۵۳۶ توکن |
| Knowledge Cutoff | در منابع رسمی بررسیشده برای این Snapshot اعلام نشده است |
| Thinking | بله |
| Vision / Audio / Video Understanding | بله |
| Native Image / Audio / Video Generation | خیر |
| Tool Use | Function Calling، Code Execution و Custom Tools |
| Web Search | از طریق Google Search Grounding |
| File Search | طبق صفحه مدل، فقط AI Studio |
| Computer Use | در صفحه مدل اعلام نشده است |
| Live API | خیر |
| API Availability | Gemini API و Google AI Studio؛ همچنین کانالهای Google Cloud اعلامشده |
۵ نمونه پرامپت کاربردی
۱. ممیزی معماری Repository
این Repository و ADRها را تحلیل کن. ابتدا نقشه مؤلفهها و مرز اعتماد را بساز، سپس سه ریسک معماری با شواهد فایل/خط ارائه کن. برنامه اصلاح باید مرحلهای، قابل Rollback و همراه تست پذیرش باشد؛ هیچ فایل را بدون تأیید تغییر نده.
۲. طراحی الگوریتم قابل اثبات
برای این مسئله سه رویکرد الگوریتمی پیشنهاد کن. پیچیدگی زمان و حافظه، حالتهای مرزی و دلیل رد یا انتخاب هر رویکرد را بنویس. سپس بهترین راه را پیادهسازی و با تست Property-based بررسی کن.
۳. Agent با ابزار سفارشی
فقط از
search_code،view_fileو Bashهای Allowlist استفاده کن. قبل از هر تغییر، فرضیه و فایل هدف را اعلام کن. پس از Patch تست مرتبط را اجرا کن و در صورت دو شکست پیاپی متوقف شو و شواهد را تحویل بده.
۴. پژوهش با Search و Code
درباره [موضوع] منابع اولیه ۱۲ ماه اخیر را با Search Grounding جمع کن. دادههای عددی را با Code Execution بازتولید کن، فرمول و ورودی را نشان بده و اختلاف منابع را بهجای میانگینگیری پنهان، جدا تحلیل کن.
۵. Prototype تعاملی
بر اساس این Brief یک Prototype تکفایلی HTML/CSS/JS بساز. هیچ کتابخانه خارجی استفاده نکن، Keyboard Navigation و Reduced Motion را رعایت کن و در پایان سناریوهای تست دستی و محدودیتهای Performance را بنویس.
بنچمارکها و ارزیابی عملکرد
جدول زیر بخشی از Model Card رسمی Google در فوریه ۲۰۲۶ است و Vendor-reported محسوب میشود. تنظیم Google برابر Thinking High، Anthropic برابر Max و OpenAI برابر xhigh بوده است؛ بنابراین حتی در یک جدول رسمی نیز بودجه استدلال کاملاً همسان نیست.
| Benchmark | Gemini 3.1 Pro | Gemini 3 Pro | Claude Sonnet 4.6 | Claude Opus 4.6 | GPT-5.2 |
|---|---|---|---|---|---|
| Humanity’s Last Exam، بدون ابزار | ۴۴٫۴٪ | ۳۷٫۵٪ | ۳۳٫۲٪ | ۴۰٫۰٪ | ۳۴٫۵٪ |
| ARC-AGI-2، Verified | ۷۷٫۱٪ | ۳۱٫۱٪ | ۵۸٫۳٪ | ۶۸٫۸٪ | ۵۲٫۹٪ |
| GPQA Diamond | ۹۴٫۳٪ | ۹۱٫۹٪ | ۸۹٫۹٪ | ۹۱٫۳٪ | ۹۲٫۴٪ |
| Terminal-Bench 2.0، Terminus-2 | ۶۸٫۵٪ | ۵۶٫۹٪ | ۵۹٫۱٪ | ۶۵٫۴٪ | ۵۴٫۰٪ |
| SWE-Bench Verified، یک تلاش | ۸۰٫۶٪ | ۷۶٫۲٪ | ۷۹٫۶٪ | ۸۰٫۸٪ | ۸۰٫۰٪ |
| LiveCodeBench Pro، Elo | ۲۸۸۷ | ۲۴۳۹ | — | — | ۲۳۹۳ |
| APEX-Agents | ۳۳٫۵٪ | ۱۸٫۴٪ | — | ۲۹٫۸٪ | ۲۳٫۰٪ |
| GDPval-AA، Elo | ۱۳۱۷ | ۱۱۹۵ | ۱۶۳۳ | ۱۶۰۶ | ۱۴۶۲ |
| BrowseComp، Search + Python + Browse | ۸۵٫۹٪ | ۵۹٫۲٪ | ۷۴٫۷٪ | ۸۴٫۰٪ | ۶۵٫۸٪ |
3.1 Pro در ARC-AGI-2 فاصله بسیار بزرگی با 3 Pro دارد و در GPQA، Terminal، LiveCodeBench، APEX و BrowseComp بهترین عدد جدول را میگیرد. SWE-Bench Verified تقریباً مساوی Opus 4.6 است. در GDPval-AA—کار دانشی حرفهای—هر دو Claude جلوترند؛ پس قدرت استدلال انتزاعی الزاماً به بهترین خروجی کسبوکار تبدیل نمیشود.
Google برای Terminal یک ردیف جدا از «بهترین Harness خوداظهاری» رقبا نیز آورده که با Terminus-2 همشرط نیست. آن اعداد عمداً در جدول اصلی Buffalo147 AI ادغام نشدهاند تا مقایسه ناعادلانه شکل نگیرد.
Artificial Analysis در Snapshot مستقل ۱۲ سپتامبر ۲۰۲۶، امتیاز ۳۰ در Intelligence Index v4.3، سرعت ۱۰۷٫۳ توکن بر ثانیه، TTFT حدود ۲۵٫۱۶ ثانیه و هزینه ۰٫۶۷ دلار برای هر وظیفه شاخص گزارش میکند. مصرف خروجی شاخص ۶۷ میلیون توکن بوده است.
شاخص مستقل جدیدتر شامل Terminal-Bench 4.0 و چند آزمون تازه است و امتیازش با درصدهای Model Card قابل تبدیل مستقیم نیست. نتیجه نشان میدهد مدل هنوز بالاتر از میانگین است، ولی جانشینهای سال ۲۰۲۶ میتوانند با قیمت یا سرعت بهتر رقابت کنند.
مقایسه Gemini 3.1 Pro Preview با رقبا
| مدل | انتخاب بهتر برای | ملاحظه |
|---|---|---|
| Gemini 3.1 Pro Preview | استدلال انتزاعی، Creative Coding و Agent با ابزار Google | Preview و TTFT بالا |
| Gemini 3.8 Flash | سرعت، هزینه و Agentهای Production پرتعداد | سقف بعضی استدلالهای Pro باید در Eval سنجیده شود |
| Claude Opus 5 | کار طولانی، Terminal سخت و محیط Anthropic | معمولاً کلاس هزینه بالاتری دارد |
| GPT-5.6 Sol | Coding و Agent پیچیده در اکوسیستم OpenAI | ابزار، کیفیت فارسی و Token Mix تعیینکنندهاند |
| Gemini 3 Pro | سازگاری با Snapshot قبلی | 3.1 در تقریباً همه ارزیابیهای رسمی پیشرفت دارد |
برای مسئلهای که ARC یا Coding پژوهشی مهم است، 3.1 Pro هنوز Baseline ارزشمندی است. برای سرویس جدید، Preview بودن و وجود Flashهای جدیدتر باعث میشود ثبات و هزینه نیز هموزن کیفیت خام سنجیده شوند.
قیمت و API
قیمت Standard بررسیشده در ۱۲ سپتامبر ۲۰۲۶؛ Free Tier برای این مدل در جدول رسمی موجود نیست:
- Prompt تا ۲۰۰K: ۲ دلار ورودی و ۱۲ دلار خروجی برای هر یک میلیون توکن
- Prompt بیشتر از ۲۰۰K: ۴ دلار ورودی و ۱۸ دلار خروجی
- Cache تا ۲۰۰K: ۰٫۲۰ دلار؛ بالاتر از ۲۰۰K: ۰٫۴۰ دلار
- Cache Storage: ۴٫۵۰ دلار برای هر یک میلیون توکن در ساعت
- Batch تا ۲۰۰K: ۱ دلار ورودی و ۶ دلار خروجی
- Batch بالاتر از ۲۰۰K: ۲ دلار ورودی و ۹ دلار خروجی
- Search و Maps Grounding پس از سهمیه ۵٬۰۰۰ درخواست ماهانه مشترک Gemini 3.x، هزینه جدا دارند.
خروجی شامل Thinking Tokens است. افزایش نرخ پس از ۲۰۰K باعث میشود استفاده از تمام Context بدون Retrieval هزینه زیادی داشته باشد. Endpoint Custom Tools همان قیمت 3.1 Pro Preview را دارد.
Gemini 3.1 Pro Preview را در Buffalo147 AI امتحان کنید
یک مسئله واقعاً پیچیده—مانند تحلیل معماری، الگوریتم یا پژوهش چندمنبعی—را با معیار پذیرش و بودجه ابزار مشخص اجرا کنید. برای تصمیم Production، همان تست را روی یک مدل Stable نیز انجام دهید تا ریسک Preview دیده شود.
شروع استفاده از Gemini 3.1 Pro Preview در Buffalo147 AI
جمعبندی
Gemini 3.1 Pro Preview در استدلال انتزاعی، پژوهش ابزارمحور و Coding پیشرفته مدل مهمی است. نتایج رسمی ARC-AGI-2، GPQA و BrowseComp سقف توان بالای آن را نشان میدهند و Endpoint Custom Tools برای Agentهای مهندسی مزیت مشخصی است.
محدودیت اصلی نه فقط قیمت، بلکه Preview بودن و Latency اولیه بالاست. همچنین در GDPval رسمی، مدلهای Claude زمان عرضه خروجی حرفهای بهتری ثبت کردهاند.
برای آزمایش مسئله دشوار و Prototype جدی، انتخاب خوبی است. برای سرویس پایدار و پرتعداد، 3.8 Flash یا یک مدل Stable رقیب باید حتماً در Eval و طرح Failover حضور داشته باشد.
پرسشهای متداول
Gemini 3.1 Pro Preview چیست؟
مدل چندوجهی و استدلالی رده Pro گوگل برای حل مسئله پیچیده، Coding پیشرفته، پژوهش و Agentهای چندمرحلهای است.
آیا Gemini 3.1 Pro هنوز Preview است؟
بله. در ۱۲ سپتامبر ۲۰۲۶ مستندات رسمی فقط شناسههای Preview اصلی و Custom Tools را فهرست میکنند.
Gemini 3.1 Pro برای برنامهنویسی خوب است؟
بله؛ در Model Card رسمی LiveCodeBench Pro برابر ۲۸۸۷ Elo و SWE-Bench Verified برابر ۸۰٫۶٪ دارد، اما نتیجه کد باید با تست واقعی تأیید شود.
تفاوت Endpoint معمولی و Custom Tools چیست؟
نسخه Custom Tools برای Workflow ترکیبی Bash و ابزارهای سفارشی بهینه شده است؛ Google درباره نوسان کیفیت در کارهای نامرتبط هشدار میدهد.
آیا این مدل Web Search دارد؟
بله، از طریق Google Search Grounding. دسترسی وب ابزارمحور است و Queryها پس از سهمیه ممکن است هزینه جدا داشته باشند.
آیا Gemini 3.1 Pro رایگان است؟
در جدول رسمی API برای این مدل Free Tier ارائه نشده است. دسترسی در اپهای Google به طرح و سهمیه حساب وابسته است.
منابع
- مستند رسمی Gemini 3.1 Pro Preview
- معرفی رسمی Gemini 3.1 Pro
- Model Card رسمی Gemini 3.1 Pro
- قیمت رسمی Gemini API
- ارزیابی مستقل Gemini 3.1 Pro Preview
یادداشت تحریریه Buffalo147 AI: جدول اصلی Vendor-reported است و تنظیم Thinking رقبا کاملاً یکسان نیست. نتیجه مستقل با شاخص جدیدتر جداگانه گزارش شده است.