Buffalo147 AI

خانه › بلاگ

Gemini 3.1 Pro Preview؛ بررسی مدل استدلالی Google برای مسائل پیچیده و Agentها

نام بزرگ Gemini 3.1 Pro Preview کنار منشور استدلالی و ابزارهای کدنویسی پیشرفته با نور مسی روی زمینه تیره

آخرین راستی‌آزمایی: ۱۲ سپتامبر ۲۰۲۶

در یک نگاه | Gemini 3.1 Pro Preview
تاریخ عرضه: ۱۹ فوریه ۲۰۲۶
قیمت و شیوهٔ محاسبه: Prompt تا ۲۰۰K: ۲ دلار ورودی و ۱۲ دلار خروجی برای هر یک میلیون توکن تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.

مقدمه

Gemini 3.1 Pro برای پرسش‌هایی ساخته شد که پاسخ کوتاه برایشان کافی نیست: تحلیل یک سیستم پیچیده، ساخت نمونه تعاملی، حل الگوریتم دشوار یا اجرای چند مرحله ابزار با وابستگی میان گام‌ها. Google این نسخه را ارتقای هسته استدلالی Gemini 3 Pro معرفی کرد.

در عمل، مدل می‌تواند متن، تصویر، صوت، ویدیو و PDF را کنار هم بفهمد، Repository بزرگ را تحلیل کند و از Function، Search یا Code Execution استفاده کند. امتیاز بسیار بالای رسمی در ARC-AGI-2، GPQA و BrowseComp نشان می‌دهد استدلال و استفاده از ابزار، محور اصلی طراحی آن بوده است.

اما نام کامل مدل یک هشدار مهم دارد: Preview. در ۱۲ سپتامبر ۲۰۲۶ هنوز شناسه Stable برای 3.1 Pro در صفحه مدل اعلام نشده و Endpoint رسمی همان gemini-3.1-pro-preview است. برای محصول حساس باید تغییر رفتار، حذف احتمالی Snapshot و برنامه مهاجرت را از ابتدا در نظر گرفت.

معرفی کامل Gemini 3.1 Pro Preview

Google مدل Gemini 3.1 Pro را در ۱۹ فوریه ۲۰۲۶ عرضه کرد. این مدل بر پایه Gemini 3 Pro ساخته شده و هنگام انتشار، پیشرفته‌ترین مدل عمومی Google برای مسائل پیچیده معرفی شد. شناسه API اصلی gemini-3.1-pro-preview است.

شماتیک روند ورودی، مدل و خروجی برای Gemini 3.1 Pro Preview
نمای شماتیک روند درخواست تا خروجی برای Gemini 3.1 Pro Preview؛ قابلیت‌های دقیق در متن مقاله آمده‌اند.

نسخه جداگانه gemini-3.1-pro-preview-customtools برای Workflowهایی ارائه شده که Bash و ابزارهای سفارشی مانند view_file یا search_code را ترکیب می‌کنند. Google هشدار می‌دهد این Endpoint بیرون از سناریوهای مناسب ابزار سفارشی ممکن است نوسان کیفیت داشته باشد.

دسترسی اعلام‌شده شامل Gemini API، AI Studio، Vertex AI، Gemini Enterprise، Antigravity، Gemini CLI، Android Studio، Gemini App و NotebookLM است. محدودیت و نام نمایشی مدل در هر محصول می‌تواند متفاوت باشد.

قابلیت‌های اصلی

استدلال انتزاعی و حل مسئله

مدل برای کشف الگو، ترکیب چند منبع و برنامه‌ریزی راه‌حل‌های چندمرحله‌ای طراحی شده است. نتیجه ۷۷٫۱٪ در ARC-AGI-2 تأییدشده توسط ARC Prize، یکی از برجسته‌ترین ادعاهای زمان عرضه بود؛ بااین‌حال این عدد Vendor-reported و مربوط به تنظیم مشخص است.

Coding پیشرفته و Creative Coding

3.1 Pro می‌تواند Repository را تحلیل، الگوریتم بسازد و رابط‌های تعاملی مانند SVG متحرک یا Dashboard داده‌محور تولید کند. نمونه‌های رسمی شامل داشبورد مدار ایستگاه فضایی و تجربه سه‌بعدی تعاملی بودند، اما کد تولیدی همچنان به تست امنیت، Performance و دسترس‌پذیری نیاز دارد.

Agent و ابزارهای سفارشی

Function Calling، Code Execution، URL Context و Endpoint تخصصی Custom Tools برای اجرای Workflow چندمرحله‌ای در دسترس‌اند. مدل می‌تواند ابزار مناسب را انتخاب کند، اما مجوز، Timeout، بودجه فراخوانی و شرط توقف باید بیرون از مدل اعمال شوند.

Search و Maps Grounding

Google Search Grounding و Maps Grounding داده تازه را وارد Context می‌کنند. این قابلیت برای پژوهش و تصمیم مکانی مفید است؛ Citationها باید حفظ شوند و هر Query Grounding می‌تواند هزینه جدا داشته باشد.

فهم چندوجهی و Context بزرگ

ورودی متن، تصویر، صوت، ویدیو و PDF با سقف ۱٬۰۴۸٬۵۷۶ توکن پشتیبانی می‌شود. مدل می‌تواند داده‌های چندرسانه‌ای و کل Repository را در یک مسئله ترکیب کند و تا ۶۵٬۵۳۶ توکن متن خروجی بدهد.

Structured Outputs و Caching پشتیبانی می‌شوند. File Search در صفحه مدل با قید «فقط AI Studio» ثبت شده است؛ بنابراین توسعه‌دهنده نباید بدون بررسی محیط، در دسترس بودن یکسان آن را در همه کانال‌ها فرض کند.

مهم‌ترین نقاط قوت

  • استدلال انتزاعی بسیار قوی در ARC-AGI-2 رسمی
  • عملکرد برجسته در GPQA، BrowseComp و MCP Atlas
  • Coding و Algorithm Development در سطح مدل Pro
  • Context یک‌میلیون‌توکنی و ورودی چندوجهی گسترده
  • Endpoint ویژه برای Bash و Custom Tools
  • توان ترکیب Search، Code و Tool Use در Workflowهای طولانی

محدودیت‌ها و نقاط ضعف

وضعیت Preview مهم‌ترین محدودیت عملی است. Google تضمین Stable بودن شناسه یا سازگاری بلندمدت این Endpoint را اعلام نکرده است. برای Production باید نام مدل Configurable، Regression Suite و مسیر Rollback وجود داشته باشد.

سه معیار ارزیابی عملی برای Gemini 3.1 Pro Preview
معیارهای پیشنهادی برای آزمون Gemini 3.1 Pro Preview با کار واقعی؛ این تصویر دادهٔ بنچمارک یا امتیاز گزارش‌شده نیست.

زمان رسیدن به اولین توکن در ارزیابی مستقل تنظیم‌شده حدود ۲۵٫۱۶ ثانیه بوده است. سرعت تولید پس از شروع خوب است، اما برای چت سریع یا UI واکنشی، مدل‌های Flash تجربه بهتری می‌دهند.

قیمت برای Promptهای بیشتر از ۲۰۰ هزار توکن افزایش می‌یابد و خروجی شامل توکن‌های Thinking است. Context یک‌میلیونی به همین دلیل می‌تواند بسیار گران شود؛ Retrieval و Caching باید آگاهانه طراحی شوند.

Computer Use در صفحه قابلیت‌های این شناسه اعلام نشده است، پس نباید آن را مفروض گرفت. تولید بومی تصویر یا صوت و Live API نیز پشتیبانی نمی‌شوند. تاریخ دقیق Knowledge Cutoff عمومی برای همین Snapshot در منابع رسمی بررسی‌شده پیدا نشد و نباید حدس زده شود.

کاربردهای واقعی Gemini 3.1 Pro Preview

تحلیل معماری نرم‌افزار

مدل می‌تواند Repository و مستندات را بررسی، وابستگی‌های پرریسک را پیدا و برنامه مهاجرت مرحله‌ای با تست و Rollback پیشنهاد کند. تصمیم نهایی معماری باید توسط تیم فنی تأیید شود.

ساخت Prototype تعاملی

از یک Brief می‌توان SVG متحرک، Dashboard یا تجربه سه‌بعدی کدنویسی‌شده ساخت. اجرای کد در Sandbox و بررسی Cross-browser ضروری است.

پژوهش چندمنبعی پیچیده

Search Grounding و Code Execution اجازه می‌دهند مدل منابع را جمع، داده را محاسبه و گزارش منبع‌دار بسازد. روش محاسبه و داده خام باید کنار نتیجه باقی بمانند.

Agent مهندسی با Custom Tools

Endpoint مخصوص Custom Tools برای ترکیب Bash، جستجوی کد و خواندن فایل طراحی شده است. دامنه Repository، فرمان‌های مجاز و حداکثر دور باید محدود شوند.

تحلیل پرونده چندوجهی

یک مسئله می‌تواند هم‌زمان شامل گزارش PDF، ویدیو، صدای جلسه و Screenshot باشد. مدل روابط میان منابع را استخراج می‌کند، اما ارجاع صفحه و Timestamp برای ممیزی لازم است.

این مدل مناسب چه کسانی است؟

Gemini 3.1 Pro Preview برای پژوهشگران، برنامه‌نویسان ارشد، تیم‌های داده، سازندگان Agent و طراحان تجربه‌های تعاملی مناسب است که مسئله پیچیده‌تر از یک پاسخ روزمره دارند و ریسک Preview را مدیریت می‌کنند.

برای ترجمه، دسته‌بندی یا چت پرتعداد، Flash-Lite انتخاب اقتصادی‌تری است. برای Production با نیاز شدید به ثبات نیز یک مدل Stable یا Snapshot جدیدتر باید در Eval حضور داشته باشد.

مشخصات فنی Gemini 3.1 Pro Preview

مشخصه مقدار تأییدشده
Developer Google
Model Family Gemini 3.1 Pro
Model Type مدل اختصاصی چندوجهی و استدلالی رده Pro
Release Date ۱۹ فوریه ۲۰۲۶
Lifecycle Preview در زمان بررسی
API Model ID gemini-3.1-pro-preview
Custom Tools Endpoint gemini-3.1-pro-preview-customtools
Based On Gemini 3 Pro
Input متن، تصویر، صوت، ویدیو و PDF
Output متن
Context Window ۱٬۰۴۸٬۵۷۶ توکن ورودی
Maximum Output ۶۵٬۵۳۶ توکن
Knowledge Cutoff در منابع رسمی بررسی‌شده برای این Snapshot اعلام نشده است
Thinking بله
Vision / Audio / Video Understanding بله
Native Image / Audio / Video Generation خیر
Tool Use Function Calling، Code Execution و Custom Tools
Web Search از طریق Google Search Grounding
File Search طبق صفحه مدل، فقط AI Studio
Computer Use در صفحه مدل اعلام نشده است
Live API خیر
API Availability Gemini API و Google AI Studio؛ همچنین کانال‌های Google Cloud اعلام‌شده

۵ نمونه پرامپت کاربردی

۱. ممیزی معماری Repository

این Repository و ADRها را تحلیل کن. ابتدا نقشه مؤلفه‌ها و مرز اعتماد را بساز، سپس سه ریسک معماری با شواهد فایل/خط ارائه کن. برنامه اصلاح باید مرحله‌ای، قابل Rollback و همراه تست پذیرش باشد؛ هیچ فایل را بدون تأیید تغییر نده.

۲. طراحی الگوریتم قابل اثبات

برای این مسئله سه رویکرد الگوریتمی پیشنهاد کن. پیچیدگی زمان و حافظه، حالت‌های مرزی و دلیل رد یا انتخاب هر رویکرد را بنویس. سپس بهترین راه را پیاده‌سازی و با تست Property-based بررسی کن.

۳. Agent با ابزار سفارشی

فقط از search_code، view_file و Bashهای Allowlist استفاده کن. قبل از هر تغییر، فرضیه و فایل هدف را اعلام کن. پس از Patch تست مرتبط را اجرا کن و در صورت دو شکست پیاپی متوقف شو و شواهد را تحویل بده.

۴. پژوهش با Search و Code

درباره [موضوع] منابع اولیه ۱۲ ماه اخیر را با Search Grounding جمع کن. داده‌های عددی را با Code Execution بازتولید کن، فرمول و ورودی را نشان بده و اختلاف منابع را به‌جای میانگین‌گیری پنهان، جدا تحلیل کن.

۵. Prototype تعاملی

بر اساس این Brief یک Prototype تک‌فایلی HTML/CSS/JS بساز. هیچ کتابخانه خارجی استفاده نکن، Keyboard Navigation و Reduced Motion را رعایت کن و در پایان سناریوهای تست دستی و محدودیت‌های Performance را بنویس.

بنچمارک‌ها و ارزیابی عملکرد

جدول زیر بخشی از Model Card رسمی Google در فوریه ۲۰۲۶ است و Vendor-reported محسوب می‌شود. تنظیم Google برابر Thinking High، Anthropic برابر Max و OpenAI برابر xhigh بوده است؛ بنابراین حتی در یک جدول رسمی نیز بودجه استدلال کاملاً همسان نیست.

Benchmark Gemini 3.1 Pro Gemini 3 Pro Claude Sonnet 4.6 Claude Opus 4.6 GPT-5.2
Humanity’s Last Exam، بدون ابزار ۴۴٫۴٪ ۳۷٫۵٪ ۳۳٫۲٪ ۴۰٫۰٪ ۳۴٫۵٪
ARC-AGI-2، Verified ۷۷٫۱٪ ۳۱٫۱٪ ۵۸٫۳٪ ۶۸٫۸٪ ۵۲٫۹٪
GPQA Diamond ۹۴٫۳٪ ۹۱٫۹٪ ۸۹٫۹٪ ۹۱٫۳٪ ۹۲٫۴٪
Terminal-Bench 2.0، Terminus-2 ۶۸٫۵٪ ۵۶٫۹٪ ۵۹٫۱٪ ۶۵٫۴٪ ۵۴٫۰٪
SWE-Bench Verified، یک تلاش ۸۰٫۶٪ ۷۶٫۲٪ ۷۹٫۶٪ ۸۰٫۸٪ ۸۰٫۰٪
LiveCodeBench Pro، Elo ۲۸۸۷ ۲۴۳۹ — — ۲۳۹۳
APEX-Agents ۳۳٫۵٪ ۱۸٫۴٪ — ۲۹٫۸٪ ۲۳٫۰٪
GDPval-AA، Elo ۱۳۱۷ ۱۱۹۵ ۱۶۳۳ ۱۶۰۶ ۱۴۶۲
BrowseComp، Search + Python + Browse ۸۵٫۹٪ ۵۹٫۲٪ ۷۴٫۷٪ ۸۴٫۰٪ ۶۵٫۸٪

3.1 Pro در ARC-AGI-2 فاصله بسیار بزرگی با 3 Pro دارد و در GPQA، Terminal، LiveCodeBench، APEX و BrowseComp بهترین عدد جدول را می‌گیرد. SWE-Bench Verified تقریباً مساوی Opus 4.6 است. در GDPval-AA—کار دانشی حرفه‌ای—هر دو Claude جلوترند؛ پس قدرت استدلال انتزاعی الزاماً به بهترین خروجی کسب‌وکار تبدیل نمی‌شود.

Google برای Terminal یک ردیف جدا از «بهترین Harness خوداظهاری» رقبا نیز آورده که با Terminus-2 هم‌شرط نیست. آن اعداد عمداً در جدول اصلی Buffalo147 AI ادغام نشده‌اند تا مقایسه ناعادلانه شکل نگیرد.

Artificial Analysis در Snapshot مستقل ۱۲ سپتامبر ۲۰۲۶، امتیاز ۳۰ در Intelligence Index v4.3، سرعت ۱۰۷٫۳ توکن بر ثانیه، TTFT حدود ۲۵٫۱۶ ثانیه و هزینه ۰٫۶۷ دلار برای هر وظیفه شاخص گزارش می‌کند. مصرف خروجی شاخص ۶۷ میلیون توکن بوده است.

شاخص مستقل جدیدتر شامل Terminal-Bench 4.0 و چند آزمون تازه است و امتیازش با درصدهای Model Card قابل تبدیل مستقیم نیست. نتیجه نشان می‌دهد مدل هنوز بالاتر از میانگین است، ولی جانشین‌های سال ۲۰۲۶ می‌توانند با قیمت یا سرعت بهتر رقابت کنند.

مقایسه Gemini 3.1 Pro Preview با رقبا

مدل انتخاب بهتر برای ملاحظه
Gemini 3.1 Pro Preview استدلال انتزاعی، Creative Coding و Agent با ابزار Google Preview و TTFT بالا
Gemini 3.8 Flash سرعت، هزینه و Agentهای Production پرتعداد سقف بعضی استدلال‌های Pro باید در Eval سنجیده شود
Claude Opus 5 کار طولانی، Terminal سخت و محیط Anthropic معمولاً کلاس هزینه بالاتری دارد
GPT-5.6 Sol Coding و Agent پیچیده در اکوسیستم OpenAI ابزار، کیفیت فارسی و Token Mix تعیین‌کننده‌اند
Gemini 3 Pro سازگاری با Snapshot قبلی 3.1 در تقریباً همه ارزیابی‌های رسمی پیشرفت دارد

برای مسئله‌ای که ARC یا Coding پژوهشی مهم است، 3.1 Pro هنوز Baseline ارزشمندی است. برای سرویس جدید، Preview بودن و وجود Flashهای جدیدتر باعث می‌شود ثبات و هزینه نیز هم‌وزن کیفیت خام سنجیده شوند.

قیمت و API

قیمت Standard بررسی‌شده در ۱۲ سپتامبر ۲۰۲۶؛ Free Tier برای این مدل در جدول رسمی موجود نیست:

  • Prompt تا ۲۰۰K: ۲ دلار ورودی و ۱۲ دلار خروجی برای هر یک میلیون توکن
  • Prompt بیشتر از ۲۰۰K: ۴ دلار ورودی و ۱۸ دلار خروجی
  • Cache تا ۲۰۰K: ۰٫۲۰ دلار؛ بالاتر از ۲۰۰K: ۰٫۴۰ دلار
  • Cache Storage: ۴٫۵۰ دلار برای هر یک میلیون توکن در ساعت
  • Batch تا ۲۰۰K: ۱ دلار ورودی و ۶ دلار خروجی
  • Batch بالاتر از ۲۰۰K: ۲ دلار ورودی و ۹ دلار خروجی
  • Search و Maps Grounding پس از سهمیه ۵٬۰۰۰ درخواست ماهانه مشترک Gemini 3.x، هزینه جدا دارند.

خروجی شامل Thinking Tokens است. افزایش نرخ پس از ۲۰۰K باعث می‌شود استفاده از تمام Context بدون Retrieval هزینه زیادی داشته باشد. Endpoint Custom Tools همان قیمت 3.1 Pro Preview را دارد.

Gemini 3.1 Pro Preview را در Buffalo147 AI امتحان کنید

یک مسئله واقعاً پیچیده—مانند تحلیل معماری، الگوریتم یا پژوهش چندمنبعی—را با معیار پذیرش و بودجه ابزار مشخص اجرا کنید. برای تصمیم Production، همان تست را روی یک مدل Stable نیز انجام دهید تا ریسک Preview دیده شود.

شروع استفاده از Gemini 3.1 Pro Preview در Buffalo147 AI

جمع‌بندی

Gemini 3.1 Pro Preview در استدلال انتزاعی، پژوهش ابزارمحور و Coding پیشرفته مدل مهمی است. نتایج رسمی ARC-AGI-2، GPQA و BrowseComp سقف توان بالای آن را نشان می‌دهند و Endpoint Custom Tools برای Agentهای مهندسی مزیت مشخصی است.

محدودیت اصلی نه فقط قیمت، بلکه Preview بودن و Latency اولیه بالاست. همچنین در GDPval رسمی، مدل‌های Claude زمان عرضه خروجی حرفه‌ای بهتری ثبت کرده‌اند.

برای آزمایش مسئله دشوار و Prototype جدی، انتخاب خوبی است. برای سرویس پایدار و پرتعداد، 3.8 Flash یا یک مدل Stable رقیب باید حتماً در Eval و طرح Failover حضور داشته باشد.

پرسش‌های متداول

Gemini 3.1 Pro Preview چیست؟

مدل چندوجهی و استدلالی رده Pro گوگل برای حل مسئله پیچیده، Coding پیشرفته، پژوهش و Agentهای چندمرحله‌ای است.

آیا Gemini 3.1 Pro هنوز Preview است؟

بله. در ۱۲ سپتامبر ۲۰۲۶ مستندات رسمی فقط شناسه‌های Preview اصلی و Custom Tools را فهرست می‌کنند.

Gemini 3.1 Pro برای برنامه‌نویسی خوب است؟

بله؛ در Model Card رسمی LiveCodeBench Pro برابر ۲۸۸۷ Elo و SWE-Bench Verified برابر ۸۰٫۶٪ دارد، اما نتیجه کد باید با تست واقعی تأیید شود.

تفاوت Endpoint معمولی و Custom Tools چیست؟

نسخه Custom Tools برای Workflow ترکیبی Bash و ابزارهای سفارشی بهینه شده است؛ Google درباره نوسان کیفیت در کارهای نامرتبط هشدار می‌دهد.

آیا این مدل Web Search دارد؟

بله، از طریق Google Search Grounding. دسترسی وب ابزارمحور است و Queryها پس از سهمیه ممکن است هزینه جدا داشته باشند.

آیا Gemini 3.1 Pro رایگان است؟

در جدول رسمی API برای این مدل Free Tier ارائه نشده است. دسترسی در اپ‌های Google به طرح و سهمیه حساب وابسته است.

منابع

یادداشت تحریریه Buffalo147 AI: جدول اصلی Vendor-reported است و تنظیم Thinking رقبا کاملاً یکسان نیست. نتیجه مستقل با شاخص جدیدتر جداگانه گزارش شده است.

خواندنی‌های دیگر