Gemini 2.5 Flash؛ مدل هیبریدی گوگل برای سرعت، Thinking و پردازش چندوجهی
آخرین راستیآزمایی: ۱۲ سپتامبر ۲۰۲۶
تاریخ عرضه: ۱۷ ژوئن ۲۰۲۵
قیمت و شیوهٔ محاسبه: Input متن، تصویر و ویدیو ۰٫۳۰ دلار؛ Output شامل Thinking ۲٫۵۰ دلار؛ بهازای هر یک میلیون توکن تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.
مقدمه
همه درخواستها به سنگینترین مدل Pro نیاز ندارند، اما خاموشکردن کامل استدلال هم همیشه جواب نمیدهد. Gemini 2.5 Flash برای همین فاصله ساخته شد: مدلی سریع و مقیاسپذیر که در صورت نیاز بیشتر فکر میکند و برای درخواست ساده میتواند پاسخ کمهزینهتری بدهد.
Google این مدل را نخستین مدل Flash با رویکرد «هیبریدی» معرفی کرد. توسعهدهنده میتواند Thinking را فعال، غیرفعال یا با بودجه کنترل کند. در کنار آن، پنجره یکمیلیونتوکنی، ورودی متن، تصویر، صوت و ویدیو و ابزارهایی مانند Search Grounding و Function Calling، دامنه استفاده را از چت تا پردازش اسناد گسترش میدهند.
Gemini 2.5 Flash اکنون جدیدترین Flash گوگل نیست، اما نسبت کیفیت، سرعت و قیمت آن هنوز برای نگهداری سامانههای موجود یا ساخت Baseline مهم است. وضعیت دسترسی و چرخه عمر کانال Cloud باید پیش از انتخاب برای محصول بلندمدت بررسی شود.
معرفی کامل Gemini 2.5 Flash
نسخه Stable این مدل در ۱۷ ژوئن ۲۰۲۵ عرضه شد و شناسه Gemini API آن gemini-2.5-flash است. جایگاه آن میان Pro و Flash-Lite قرار دارد: از Pro سریعتر و ارزانتر است و در مسئلههای دشوار معمولاً سقف کیفیت بالاتری از Lite دارد.

معماری دقیق و تعداد پارامترها عمومی نیست، اما Model Card آن را Transformer چندوجهی sparse Mixture-of-Experts معرفی میکند. Knowledge Cutoff رسمی ژانویه ۲۰۲۵ است؛ برای رخدادهای جدیدتر باید Search Grounding یا داده خودتان وارد Context شود.
دسترسی از Google AI Studio، Gemini Developer API و Vertex AI ممکن است. مدل در Gemini Developer API هنگام بررسی Stable است. صفحه Google Cloud تاریخ بازنشستگی ۲۰ اکتبر ۲۰۲۶ را نشان میدهد؛ این تاریخ نباید بدون بررسی به همه کانالها تعمیم داده شود.
قابلیتهای اصلی
Thinking قابلکنترل
مزیت متمایز Flash 2.5 کنترل میزان استدلال است. برای دستهبندی یا استخراج ساده میتوان Thinking را محدود کرد؛ برای برنامهریزی و ریاضی میتوان بودجه بیشتری داد. بودجه بیشتر میتواند کیفیت و هزینه و Latency را افزایش دهد، اما تضمین نمیکند همه پاسخها بهتر شوند.
پاسخ سریع و پردازش پرتعداد
Flash برای سرویسهای تعاملی، Backend محصول و پردازش حجم بالا طراحی شده است. Batch، Flex و Priority در مستندات قیمتگذاری پشتیبانی میشوند و هرکدام تعادل متفاوتی میان هزینه، ظرفیت و تأخیر دارند.
فهم متن، تصویر، صوت و ویدیو
مدل میتواند چهار رسانه اصلی را در ورودی تحلیل کند و تا ۶۵٬۵۳۶ توکن متن تولید کند. برای نمونه، میتوان ویدیوی پشتیبانی را با Transcript و Screenshot خطا بررسی کرد. مدل تصویر، ویدیو یا صدا تولید نمیکند.
Coding و اجرای کد
تولید کد، توضیح Error، نوشتن تست و تحلیل فایلهای متعدد از کاربردهای مهم آن است. Code Execution برای محاسبه یا کنترل نتیجه در دسترس است؛ اجرای کد تولیدی باید در Sandbox و با محدودیت منابع انجام شود.
Search، Maps و URL Context
Google Search Grounding، Maps Grounding و URL Context اطلاعات بیرونی را به درخواست وصل میکنند. Search با دانش آموزش یکسان نیست و برای پاسخ منبعدار باید Citationهای بازیابیشده حفظ شوند.
Function Calling و خروجی ساختاریافته
Function Calling و Structured Outputs برای اتصال مدل به سرویسها و تولید JSON قابلاعتبارسنجی مناسباند. File Search و Caching نیز در صفحه رسمی مدل پشتیبانی میشوند. مدل نباید مستقیماً مجوز عملیات حساس را در اختیار داشته باشد.
مهمترین نقاط قوت
- تعادل قوی میان کیفیت، سرعت و قیمت
- Thinking قابلکنترل برای جلوگیری از هزینه یکسان در همه درخواستها
- Context ورودی ۱٬۰۴۸٬۵۷۶ توکنی
- ورودی چندوجهی و تحلیل ویدیو و صوت
- اکوسیستم کامل Search، Maps، Function Calling و Code Execution
- سرعت تولید بالا در ارزیابی مستقل
محدودیتها و نقاط ضعف
کیفیت Flash در سختترین مسائل معمولاً پایینتر از 2.5 Pro است و در Agentهای پیچیده باید با Eval سنجیده شود. تنظیم نامناسب Thinking نیز میتواند یا هزینه را بیدلیل بالا ببرد یا کیفیت مسئله سخت را کاهش دهد.

مدل فقط متن خروجی میدهد؛ برای تولید بومی تصویر، صوت یا ویدیو باید از مدل دیگری استفاده شود. Live API هم برای این شناسه پشتیبانی نمیشود.
پنجره یکمیلیونی از نظر فنی جذاب است، اما ورودی طولانی همچنان هزینه و Latency دارد و ممکن است شواهد مهم میان داده زیاد گم شوند. Retrieval، تقسیم کار و Citation اجباری معمولاً نتیجه مطمئنتری میسازند.
در Artificial Analysis، Tracker مربوط به Snapshot اولیه با برچسب Deprecated دیده میشود، زیرا ارزیاب Snapshot تازهتری را دنبال کرده است. این برچسب به معنی حذف شناسه Stable از Gemini API نیست؛ دو مفهوم نباید با هم مخلوط شوند.
کاربردهای واقعی Gemini 2.5 Flash
پشتیبانی مشتری با مسیریابی هوشمند
مدل میتواند پیام، Screenshot و سابقه کوتاه کاربر را تحلیل، موضوع و فوریت را تعیین و پاسخ اولیه تولید کند. درخواست حساس باید به انسان یا مدل Pro مسیریابی شود.
پردازش ویدیوی آموزشی
از ویدیو و Transcript میتوان فصلبندی، نکات کلیدی، Quiz و Timestamp استخراج کرد. برای نقل دقیق باید Timestampها بهصورت نمونهای بازبینی شوند.
استخراج داده از اسناد
Structured Output به تبدیل فاکتور، فرم یا گزارش به JSON کمک میکند. Schema Validation و Queue بازبینی برای فیلدهای کماطمینان ضروری است.
دستیار Coding در IDE
سرعت بالاتر از Pro برای توضیح تابع، تولید تست کوچک و اصلاح تکرارشونده مناسب است. مسائل معماری یا Bugهای مبهم را میتوان با Route جدا به Pro فرستاد.
Agent جستجو و اقدام
مدل میتواند ابتدا Search انجام دهد، نتیجه را خلاصه کند و Function مناسب را فراخوانی کند. عملیات خرید، ارسال یا تغییر داده باید مرحله تأیید انسانی داشته باشد.
این مدل مناسب چه کسانی است؟
توسعهدهندگان اپلیکیشن، تیمهای پشتیبانی، تولیدکنندگان محتوای چندرسانهای، تحلیلگران و کسبوکارهایی که تعداد درخواست بالایی دارند بیشترین بهره را میبرند. Flash برای ساخت یک «مدل پیشفرض» خوب است که موارد بسیار دشوار را به Pro Escalate میکند.
اگر کار تقریباً همیشه دستهبندی یا استخراج ساده است، Flash-Lite ارزانتر خواهد بود. اگر هر درخواست مسئله علمی یا معماری پیچیده دارد، Pro میتواند کیفیت باثباتتری ارائه کند.
مشخصات فنی Gemini 2.5 Flash
| مشخصه | مقدار تأییدشده |
|---|---|
| Developer | |
| Model Family | Gemini 2.5 |
| Model Type | مدل اختصاصی چندوجهی، هیبریدی و sparse MoE |
| Stable Release | ۱۷ ژوئن ۲۰۲۵ |
| API Model ID | gemini-2.5-flash |
| Input | متن، تصویر، صوت و ویدیو؛ اسناد از مسیرهای پشتیبانیشده API |
| Output | متن |
| Context Window | ۱٬۰۴۸٬۵۷۶ توکن ورودی |
| Maximum Output | ۶۵٬۵۳۶ توکن |
| Knowledge Cutoff | ژانویه ۲۰۲۵ |
| Thinking | بله؛ قابلکنترل و قابلغیرفعالسازی بر اساس تنظیم API |
| Vision / Audio / Video Understanding | بله |
| Native Image / Audio / Video Generation | خیر |
| Tool Use | Function Calling، Code Execution، File Search و URL Context |
| Web Search | بله، از طریق Google Search Grounding |
| Maps Grounding | بله |
| Structured Output / Caching | بله |
| Live API | خیر |
| API Availability | Stable در Gemini Developer API؛ در Vertex AI نیز عرضه شده است |
| Google Cloud Lifecycle | صفحه Cloud تاریخ بازنشستگی ۲۰ اکتبر ۲۰۲۶ را ثبت کرده است |
۵ نمونه پرامپت کاربردی
۱. پاسخگویی پشتیبانی چندوجهی
پیام کاربر و Screenshot را تحلیل کن. خروجی را دقیقاً با Schema شامل
issue_type،urgency،evidence،suggested_replyوneeds_humanبده. اگر داده کافی نیست سؤال روشنکننده بساز و چیزی را حدس نزن.
۲. خلاصهسازی ویدیو با Timestamp
این ویدیوی آموزشی را به فصلهای منطقی تقسیم کن. برای هر فصل عنوان، Timestamp شروع، سه نکته و یک سؤال تمرینی بنویس. ادعاهایی را که از تصویر یا صدا قابل تأیید نیستند وارد نکن.
۳. بررسی سریع Pull Request
Diff و تستها را بررسی کن. ابتدا فقط خطاهای Correctness و Security را با فایل و خط گزارش بده؛ سپس تست کمینه برای بازتولید هر مورد بساز. از بازنویسی سلیقهای کد خودداری کن.
۴. استخراج JSON پرتعداد
اطلاعات این اسناد را طبق JSON Schema پیوست استخراج کن. برای هر فیلد
source_pageوconfidenceبده؛ مقدار ناموجود راnullبگذار و از ساختن شماره، تاریخ یا نام خودداری کن.
۵. مسیریابی Thinking
درخواست را ابتدا در یکی از سه سطح ساده، متوسط یا پیچیده طبقهبندی کن. برای ساده پاسخ کوتاه بده؛ برای متوسط فرضها را کنترل کن؛ برای پیچیده برنامه چندمرحلهای بساز و موارد نیازمند مدل Pro یا تأیید انسان را مشخص کن.
بنچمارکها و ارزیابی عملکرد
امتیازهای جدول از Model Card رسمی بهروزشده Gemini 2.5 Flash گرفته شدهاند و Vendor-reported هستند. ستون Flash مربوط به حالت Thinking مدل Stable است؛ آن را نباید با اجرای Non-thinking یا Snapshotهای Preview برابر دانست. تنظیم رقبا نیز کاملاً یکسان نیست.
| Benchmark و مفهوم | Gemini 2.5 Flash، Thinking | Gemini 2.5 Pro | Claude 4 Sonnet | تاریخ / منبع |
|---|---|---|---|---|
| Humanity’s Last Exam؛ دانش و استدلال بسیار دشوار | ۱۱٫۰٪ | ۲۱٫۶٪ | ۷٫۸٪ | Model Card، نسخه دسامبر ۲۰۲۵؛ Vendor-reported |
| GPQA Diamond؛ علم سطح تحصیلات تکمیلی | ۸۲٫۸٪ | ۸۶٫۴٪ | ۷۵٫۴٪ | Model Card، نسخه دسامبر ۲۰۲۵؛ Vendor-reported |
| AIME 2025؛ ریاضیات مسابقهای | ۷۲٫۰٪ | ۸۸٫۰٪ | ۷۰٫۵٪ | Model Card، نسخه دسامبر ۲۰۲۵؛ Vendor-reported |
| LiveCodeBench؛ حل مسائل Coding تازه | ۶۳٫۹٪ | ۶۹٫۰٪ | ۴۸٫۹٪ | Model Card، نسخه دسامبر ۲۰۲۵؛ Vendor-reported |
| SWE-bench Verified؛ تعمیر Issue واقعی GitHub | ۶۰٫۴٪ | ۵۹٫۶٪ | ۷۲٫۷٪ | Model Card، نسخه دسامبر ۲۰۲۵؛ Vendor-reported |
| MMMU؛ فهم چندوجهی دانشگاهی | ۷۹٫۷٪ | ۸۲٫۰٪ | ۷۴٫۴٪ | Model Card، نسخه دسامبر ۲۰۲۵؛ Vendor-reported |
| FACTS Grounding؛ صحت پاسخ واقعیتمحور | ۸۵٫۳٪ | ۸۷٫۸٪ | ۷۹٫۱٪ | Model Card، نسخه دسامبر ۲۰۲۵؛ Vendor-reported |
Flash در GPQA، MMMU و FACTS به Pro نزدیک میشود و در SWE-bench رسمی حتی اندکی بالاتر از Pro ثبت شده است، اما در HLE و AIME فاصله بیشتری دارد. Claude 4 Sonnet در SWE-bench جلوتر است؛ برای تعمیر Repository نباید فقط به سرعت Flash تکیه کرد.
ارزیابی مستقل Artificial Analysis دو حالت را جدا میکند. در Snapshot بررسیشده ۱۲ سپتامبر ۲۰۲۶، نسخه Reasoning امتیاز تخمینی ۱۳ در Intelligence Index v4.3، سرعت ۲۱۱٫۷ توکن بر ثانیه و TTFT حدود ۱۶٫۱۷ ثانیه دارد. نسخه Non-reasoning امتیاز تخمینی ۱۰، سرعت ۱۹۰٫۴ توکن بر ثانیه و TTFT حدود ۰٫۵۰ ثانیه ثبت کرده است.
این اعداد نشان میدهند Thinking میتواند کیفیت شاخص را بالا ببرد، اما شروع پاسخ را کندتر میکند. Tracker این Snapshotهای قدیمی را بهدلیل وجود نسخه ارزیابی تازهتر Deprecated نامیده است؛ این وضعیت مستقل از Stable بودن gemini-2.5-flash در API است.
مقایسه Gemini 2.5 Flash با رقبا
| مدل | انتخاب بهتر برای | ملاحظه اصلی |
|---|---|---|
| Gemini 2.5 Flash | محصول چندوجهی پرتعداد با Thinking قابلکنترل | تنظیم بودجه استدلال نیازمند Eval است |
| Gemini 2.5 Pro | مسائل علمی، ریاضی و تحلیل عمیقتر | کندتر و گرانتر |
| Gemini 2.5 Flash-Lite | استخراج، ترجمه و طبقهبندی بسیار ارزان | سقف کیفیت پایینتر در مسئله دشوار |
| Claude 4 Sonnet | تعمیر Repository و Agent Coding همدوره | هزینه، ابزار و Context متفاوتاند |
Flash انتخاب مناسبی برای Router اصلی محصول است: درخواست ساده را با Thinking کم پاسخ میدهد و مورد پیچیده را با بودجه بیشتر یا Pro اجرا میکند. برای Coding واقعی، SWE-bench رسمی به سود Sonnet است، اما سرعت و ابزارهای Google ممکن است در Workflow محصول ارزش بیشتری داشته باشند.
قیمت و API
قیمت Standard رسمی در ۱۲ سپتامبر ۲۰۲۶، به دلار برای هر یک میلیون توکن:
| نوع مصرف | قیمت |
|---|---|
| Input متن، تصویر و ویدیو | ۰٫۳۰ دلار |
| Input صوت | ۱ دلار |
| Output شامل Thinking | ۲٫۵۰ دلار |
| Cache Input متن، تصویر و ویدیو | ۰٫۰۳ دلار |
| Cache Input صوت | ۰٫۱۰ دلار |
| Cache Storage | ۱ دلار بهازای یک میلیون توکن در ساعت |
| Batch / Flex Input متن، تصویر و ویدیو | ۰٫۱۵ دلار |
| Batch / Flex Input صوت | ۰٫۵۰ دلار |
| Batch / Flex Output | ۱٫۲۵ دلار |
Priority برای ورودی عادی ۰٫۵۴ دلار، ورودی صوت ۱٫۸۰ دلار و خروجی ۴٫۵۰ دلار بهازای یک میلیون توکن اعلام شده است. Search و Maps Grounding سهمیه رایگان دارند و پس از آن بهترتیب ۳۵ و ۲۵ دلار برای هر هزار Grounded Prompt هزینه دارند. جزئیات سهمیه بر اساس Tier حساب تغییر میکند.
Free Tier محدود نیز ارائه میشود. توکنهای Thinking جزو Output صورتحساب میشوند؛ بنابراین هزینه یک Request صرفاً از متن پاسخ قابل مشاهده محاسبه نمیشود.
Gemini 2.5 Flash را در Buffalo147 AI امتحان کنید
برای شروع، یک کار واقعی مثل تحلیل Screenshot، استخراج ساختاریافته یا بررسی Pull Request را اجرا کنید. سپس همان درخواست را با Thinking کم و زیاد مقایسه کنید تا نقطه مناسب کیفیت، سرعت و هزینه محصول خودتان را پیدا کنید.
شروع استفاده از Gemini 2.5 Flash در Buffalo147 AI
جمعبندی
Gemini 2.5 Flash بهخاطر Thinking قابلکنترل، ورودی چندوجهی و قیمت میانه، یکی از کاربردیترین مدلهای نسل 2.5 برای ساخت محصول بود. در بسیاری از Benchmarkها به Pro نزدیک است و سرعت تولید مستقل بالایی دارد.
ضعف اصلی آن حساسیت نتیجه به تنظیم Thinking و فاصله با Pro در دشوارترین آزمونهاست. چرخه عمر Cloud نیز برای استقرار جدید باید جدی گرفته شود.
برای API پرترافیک، دستیار Coding سریع، تحلیل ویدیو یا استخراج سند انتخاب خوبی است. معماری اقتصادیتر این است که Flash مسیر اصلی باشد و فقط موارد سخت به Pro یا بازبینی انسان منتقل شوند.
پرسشهای متداول
Gemini 2.5 Flash چیست؟
مدل چندوجهی سریع Google با Context یکمیلیونتوکنی و Thinking قابلکنترل است که برای محصولهای پرتعداد و کمتأخیر طراحی شده است.
آیا میتوان Thinking را در Gemini 2.5 Flash خاموش کرد؟
بله، API امکان کنترل یا غیرفعالسازی Thinking را برای سناریوهای مناسب فراهم میکند. اثر آن بر کیفیت باید با Eval اندازهگیری شود.
Gemini 2.5 Flash برای Coding خوب است؟
برای توضیح کد، تست و اصلاح سریع مناسب است و در LiveCodeBench رسمی قوی ظاهر شده؛ برای تعمیر Repository پیچیده باید با Pro و رقبای Coding مقایسه شود.
آیا Gemini 2.5 Flash تصویر یا ویدیو تولید میکند؟
خیر. تصویر، صوت و ویدیو را میفهمد، اما خروجی بومی این مدل متن است.
آیا Gemini 2.5 Flash API و Free Tier دارد؟
بله، شناسه Stable آن در Gemini Developer API موجود است و Free Tier محدود نیز ارائه میشود.
تفاوت Gemini 2.5 Flash و Flash-Lite چیست؟
Flash سقف استدلال و Coding بالاتری دارد؛ Flash-Lite برای کمترین هزینه، طبقهبندی، ترجمه و استخراج پرتعداد بهینه شده است.
آیا مدل هنوز قابل استفاده است؟
در زمان بررسی، در Gemini Developer API Stable است. صفحه Cloud تاریخ بازنشستگی ۲۰ اکتبر ۲۰۲۶ را نشان میدهد و کانال استقرار باید جداگانه کنترل شود.
منابع
- مستند رسمی Gemini 2.5 Flash
- Model Card رسمی Gemini 2.5 Flash
- صفحه چرخه عمر Gemini 2.5 Flash در Google Cloud
- قیمت رسمی Gemini API
- ارزیابی مستقل حالت Reasoning
- ارزیابی مستقل حالت Non-reasoning
یادداشت تحریریه Buffalo147 AI: نتایج رسمی با Thinking گزارش شدهاند و با حالت Non-thinking همسان نیستند. تنظیم رقبا و Harnessها نیز تفاوت دارد؛ تصمیم Production باید بر اساس Eval اختصاصی باشد.