Gemini 2.5 Flash-Lite؛ بررسی مدل اقتصادی گوگل برای استخراج، ترجمه و حجم بالا
آخرین راستیآزمایی: ۱۲ سپتامبر ۲۰۲۶
تاریخ عرضه: ۲۲ ژوئیه ۲۰۲۵
قیمت و شیوهٔ محاسبه: Input متن، تصویر و ویدیو ۰٫۱۰ دلار؛ Output شامل Thinking ۰٫۴۰ دلار؛ بهازای هر یک میلیون توکن تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.
مقدمه
وقتی قرار است میلیونها پیام، سند یا ردیف داده پردازش شود، اختلاف چند سنت در هر میلیون توکن به هزینه جدی تبدیل میشود. Gemini 2.5 Flash-Lite برای همین نوع مقیاس طراحی شده است: پاسخ سریع، قیمت پایین و امکانات API کافی برای کارهای تکرارشونده.
پسوند Lite به معنی یک چتبات ساده و بدون ابزار نیست. مدل Context یکمیلیونتوکنی، ورودی چندوجهی، Structured Output، Function Calling، Search Grounding و Thinking دارد. تفاوت اصلی در اولویت طراحی است: Throughput و بهرهوری هزینه بالاتر از سقف استدلال مدل Pro قرار گرفتهاند.
برای دستهبندی تیکت، استخراج فیلد از سند، ترجمه کاتالوگ یا Moderation اولیه، این انتخاب میتواند منطقیتر از مدل بزرگ باشد. اما معماری خوب باید موارد مبهم و پرریسک را به مدل قویتر یا بازبین انسانی ارجاع دهد.
معرفی کامل Gemini 2.5 Flash-Lite
نسخه Stable مدل در ۲۲ ژوئیه ۲۰۲۵ عرضه شد و شناسه آن gemini-2.5-flash-lite است. این کوچکترین و اقتصادیترین عضو عمومی خانواده Gemini 2.5 محسوب میشود. Model Card معماری را Transformer چندوجهی sparse Mixture-of-Experts توصیف میکند و تعداد پارامترها را اعلام نمیکند.

Google مدل را برای ترجمه، طبقهبندی، استخراج داده و کاربردهای پرتعداد معرفی کرده است. Thinking را میتوان متناسب با کار تنظیم کرد؛ حالت Non-thinking برای کمترین تأخیر مناسبتر است و Thinking در بعضی آزمونها دقت را افزایش میدهد.
مدل در Google AI Studio، Gemini Developer API و Vertex AI عرضه شده است. در تاریخ بررسی، Gemini Developer API آن را Stable نشان میدهد؛ صفحه Google Cloud برای عرضه متناظر تاریخ بازنشستگی ۲۰ اکتبر ۲۰۲۶ دارد. Previewهای قدیمی Flash-Lite که خاموش شدهاند، نسخهای جدا از شناسه Stable هستند و Benchmark یا چرخه عمرشان نباید با GA ادغام شود.
قابلیتهای اصلی
طبقهبندی و استخراج ساختاریافته
Structured Outputs برای تبدیل متن یا سند به JSON با Schema مشخص بسیار مهم است. مدل میتواند موضوع، زبان، Intent، موجودیتها و فیلدهای کلیدی را استخراج کند. Validation در سطح برنامه همچنان لازم است و فیلد ناموجود باید بهجای حدس با null ثبت شود.
ترجمه و بازنویسی در مقیاس
Flash-Lite برای ترجمه دستهای، یکسانسازی لحن و تولید نسخههای کوتاه مناسب است. Glossary برند، زبان مقصد و ممنوعیت ترجمه اصطلاحات خاص را باید صریح در Prompt قرار داد.
Thinking اختیاری
برای کار ساده میتوان Thinking را خاموش یا محدود کرد تا پاسخ سریعتر باشد. برای سند مبهم یا دستهبندی چندقیدی، Thinking میتواند کمک کند؛ اما Benchmark رسمی نشان میدهد اثر آن در همه وظایف یکسان نیست و حتی بعضی امتیازها کاهش یافتهاند.
ورودی چندوجهی و Context بزرگ
مدل متن، تصویر، صوت، ویدیو و PDF را میفهمد و تا ۱٬۰۴۸٬۵۷۶ توکن ورودی میپذیرد. این قابلیت برای استخراج از اسکن، Transcript یا ویدیو مفید است؛ خروجی مدل فقط متن است.
ابزار و جستجو
Function Calling، Code Execution، File Search، URL Context، Google Search Grounding و Maps Grounding پشتیبانی میشوند. برای Agent کمهزینه مناسب است، اما مدل Lite نباید بدون محدودیت ابزار یا Approval به عملیات حساس دسترسی داشته باشد.
Batch، Caching و ظرفیت
نرخ Batch/Flex نصف نرخ Standard است و برای Jobهای غیرهمزمان ارزش زیادی دارد. Context Caching نیز در ورودیهای تکراری هزینه را کم میکند. برای SLA سخت، محدودیت نرخ و Region باید در حساب واقعی اندازهگیری شود.
مهمترین نقاط قوت
- یکی از پایینترین قیمتهای خانواده Gemini 2.5
- سرعت تولید بسیار بالا و TTFT بسیار کم در حالت Non-thinking
- مناسب برای استخراج، طبقهبندی، ترجمه و پردازش Batch
- Context یکمیلیونتوکنی و ورودی چندوجهی
- Structured Output و ابزارهای اکوسیستم Google
- امکان افزایش موقت کیفیت با Thinking بدون تغییر شناسه مدل
محدودیتها و نقاط ضعف
Flash-Lite برای سختترین استدلال، ریاضی و Coding طراحی نشده است. در Benchmarkهای رسمی HLE، GPQA، AIME و LiveCodeBench از Flash و Pro عقبتر است. استفاده از آن برای همه درخواستها فقط بهدلیل قیمت پایین میتواند نرخ خطای پنهان را بالا ببرد.

Thinking همیشه معجزه نمیکند. در Model Card Stable، امتیاز SWE-bench تکتلاش با Thinking از ۳۱٫۶٪ به ۲۷٫۶٪ کاهش یافته، هرچند نتیجه چندتلاش بهتر شده است. پس Budget باید با داده واقعی تنظیم شود، نه با فرض «فکر بیشتر همیشه بهتر است».
مدل تصویر، صوت یا ویدیو تولید نمیکند و Live API ندارد. اطلاعات پس از Knowledge Cutoff ژانویه ۲۰۲۵ نیز بدون Search یا Context تازه قابل اتکا نیست.
برچسب Deprecated در بعضی Trackerهای مستقل به Snapshot ارزیابیشده قدیمی مربوط است، نه لزوماً شناسه Stable API. از طرف دیگر، تاریخ بازنشستگی Cloud نزدیک است؛ استقرار جدید باید مدل جانشین و Regression Test داشته باشد.
کاربردهای واقعی Gemini 2.5 Flash-Lite
طبقهبندی تیکت پشتیبانی
میتوان Intent، محصول، فوریت و نیاز به اپراتور را بهصورت JSON استخراج کرد. Queue انسانی برای موارد کماطمینان یا شکایت حقوقی از کاهش هزینه مهمتر است.
استخراج فاکتور و فرم
تصویر یا PDF سند به فیلدهای ساختاریافته تبدیل میشود. شماره سند، مبلغ و تاریخ باید با Rule یا OCR ثانویه کنترل شوند؛ مدل نباید مقدار ناخوانا را بسازد.
ترجمه کاتالوگ محصول
هزاران توضیح محصول را میتوان با Glossary ثابت ترجمه و طول متن را برای رابط کاربری کنترل کرد. نمونههای تصادفی هر Batch باید QA زبانی شوند.
برچسبگذاری محتوای چندرسانهای
از تصویر، صوت یا ویدیو میتوان موضوع و Metadata اولیه استخراج کرد. برای تصمیم ایمنی یا Moderation نهایی، Policy Classifier تخصصی و انسان لازم است.
پیشپردازش برای مدل بزرگتر
Flash-Lite میتواند سندها را مرتب، بخش مرتبط را استخراج و فقط موارد دشوار را به Pro بفرستد. این معماری Cascading معمولاً هزینه را بدون افت بزرگ کیفیت کاهش میدهد.
این مدل مناسب چه کسانی است؟
تیمهای داده، فروشگاههای آنلاین، پلتفرمهای پشتیبانی، شرکتهای ترجمه، متخصصان مارکتینگ و توسعهدهندگان Pipelineهای حجیم مخاطبان اصلیاند. برای Startupی که باید هزینه هر درخواست را دقیق کنترل کند نیز گزینه جذابی است.
پژوهشگران یا برنامهنویسانی که مسئلههای پیچیده و کمتعداد دارند بهتر است Flash یا Pro را هم آزمایش کنند. در حوزههای حساس، Flash-Lite فقط میتواند مرحله اول پردازش باشد، نه تصمیمگیر نهایی.
مشخصات فنی Gemini 2.5 Flash-Lite
| مشخصه | مقدار تأییدشده |
|---|---|
| Developer | |
| Model Family | Gemini 2.5 |
| Model Type | مدل اختصاصی چندوجهی سبک و sparse MoE |
| Stable Release | ۲۲ ژوئیه ۲۰۲۵ |
| API Model ID | gemini-2.5-flash-lite |
| Input | متن، تصویر، صوت، ویدیو و PDF |
| Output | متن |
| Context Window | ۱٬۰۴۸٬۵۷۶ توکن ورودی |
| Maximum Output | ۶۵٬۵۳۶ توکن |
| Knowledge Cutoff | ژانویه ۲۰۲۵ |
| Thinking | بله؛ قابلکنترل و قابلغیرفعالسازی |
| Vision / Audio / Video Understanding | بله |
| Native Image / Audio / Video Generation | خیر |
| Tool Use | Function Calling، Code Execution، File Search و URL Context |
| Web Search | بله، از طریق Google Search Grounding |
| Maps Grounding | بله |
| Structured Output / Caching | بله |
| Live API | خیر |
| API Availability | Stable در Gemini Developer API؛ در Vertex AI نیز عرضه شده است |
| Google Cloud Lifecycle | صفحه Cloud تاریخ بازنشستگی ۲۰ اکتبر ۲۰۲۶ را ثبت کرده است |
۵ نمونه پرامپت کاربردی
۱. دستهبندی تیکت با Escalation
هر تیکت را در یکی از دستههای Schema طبقهبندی کن و JSON معتبر بده.
confidenceوreason_evidenceالزامی است. اگر اطمینان کمتر از ۰٫۸ یا موضوع حقوقی/پرداختی بود،needs_human=trueقرار بده و هیچ اقدام خودکاری پیشنهاد نکن.
۲. استخراج فیلد از فاکتور
از این PDF فقط
invoice_number،seller،issue_date،currency،subtotal،taxوtotalرا استخراج کن. برای هر فیلد شماره صفحه بده؛ متن ناخوانا راnullبگذار و جمع ارقام را با Code Execution کنترل کن.
۳. ترجمه با Glossary برند
این فایل محصولات را به فارسی روان ترجمه کن. اصطلاحات Glossary را عیناً رعایت کن، نام برند و SKU را تغییر نده، محدودیت طول هر فیلد را حفظ کن و موارد مبهم را در ستون
review_noteعلامت بزن.
۴. برچسبگذاری ویدیو
این ویدیوها را با Taxonomy پیوست برچسبگذاری کن. خروجی JSONL شامل شناسه، موضوع اصلی، سه Tag، زبان، بازههای زمانی مهم و سطح اطمینان باشد. محتوای نامشخص را حدس نزن.
۵. Router اقتصادی مدلها
درخواست را از نظر پیچیدگی، ریسک و نیاز به ابزار امتیاز بده. موارد ساده را پاسخ بده؛ موارد مبهم را به Gemini 2.5 Flash و مسائل پیچیده یا حساس را به Pro/انسان ارجاع بده. دلیل Route را در یک جمله ثبت کن.
بنچمارکها و ارزیابی عملکرد
جدول نخست مربوط به نسخه Stable gemini-2.5-flash-lite در Model Card سپتامبر ۲۰۲۵ و Vendor-reported است. نتایج Non-thinking و Thinking جدا آمدهاند؛ اعداد Previewهای خاموششده عمداً استفاده نشدهاند.
| Benchmark و مفهوم | Flash-Lite بدون Thinking | Flash-Lite با Thinking | 2.5 Flash با Thinking | تاریخ / منبع |
|---|---|---|---|---|
| Humanity’s Last Exam؛ دانش و استدلال بسیار دشوار | ۵٫۱٪ | ۶٫۹٪ | ۱۱٫۰٪ | سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported |
| GPQA Diamond؛ علم سطح تحصیلات تکمیلی | ۶۴٫۶٪ | ۶۶٫۷٪ | ۸۲٫۸٪ | سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported |
| AIME 2025؛ ریاضیات مسابقهای | ۴۹٫۸٪ | ۶۳٫۱٪ | ۷۲٫۰٪ | سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported |
| LiveCodeBench؛ مسائل Coding تازه | ۳۳٫۷٪ | ۳۴٫۳٪ | ۶۳٫۹٪ | سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported |
| SWE-bench Verified، یک تلاش؛ تعمیر GitHub Issue | ۳۱٫۶٪ | ۲۷٫۶٪ | ۶۰٫۴٪ | سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported |
| SWE-bench Verified، چند تلاش | ۴۲٫۶٪ | ۴۴٫۹٪ | — | سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported |
| FACTS Grounding؛ صحت پاسخ واقعیتمحور | ۸۴٫۱٪ | ۸۶٫۸٪ | ۸۵٫۳٪ | سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported |
| MMMU؛ فهم چندوجهی دانشگاهی | ۷۲٫۹٪ | ۷۲٫۹٪ | ۷۹٫۷٪ | سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported |
| Vibe-Eval؛ کیفیت ورودی تصویری دشوار | ۵۱٫۳٪ | ۵۷٫۵٪ | ۶۵٫۴٪ | سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported |
| MRCR در ۱۲۸K؛ بازیابی چندسوزنه از Context طولانی | ۱۶٫۶٪ | ۳۰٫۶٪ | ۷۴٫۰٪ | سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported |
Thinking بیشترین بهبود را در AIME، Vibe-Eval و MRCR ایجاد میکند، اما در MMMU تغییری ندارد و SWE-bench تکتلاش را ضعیفتر کرده است. Flash-Lite در FACTS رقابتی است، ولی فاصله Coding و Long-context Retrieval آن با Flash واضح است. این الگو با کاربرد واقعی سازگار است: استخراج و پاسخ واقعیتمحور مناسباند؛ تعمیر Repository و استدلال سنگین بهتر است Escalate شوند.
Artificial Analysis در Snapshot مستقل ۱۲ سپتامبر ۲۰۲۶، برای حالت Reasoning امتیاز تخمینی ۹ در Intelligence Index v4.3، سرعت ۳۳۴٫۰ توکن بر ثانیه و TTFT حدود ۱۷٫۲۱ ثانیه گزارش میکند. حالت Non-reasoning امتیاز تخمینی ۷، سرعت ۲۷۸٫۹ توکن بر ثانیه و TTFT حدود ۰٫۳۱ ثانیه دارد.
تأخیر آغاز بسیار کم در حالت Non-thinking نقطه قوت مهمی است؛ Thinking کیفیت شاخص را بالاتر میبرد، اما شروع پاسخ را بهشدت کندتر میکند. Tracker مستقل بعضی Snapshotها را بهدلیل نسخه ارزیابی جدیدتر Deprecated نامیده است و این برچسب با وضعیت Stable API یکی نیست.
مقایسه Gemini 2.5 Flash-Lite با رقبا
| مدل | انتخاب بهتر برای | ملاحظه اصلی |
|---|---|---|
| Gemini 2.5 Flash-Lite | استخراج، طبقهبندی، ترجمه و Batch با کمترین هزینه | استدلال و Coding دشوار ضعیفتر |
| Gemini 2.5 Flash | چت چندوجهی و مسئله متوسط با کیفیت بالاتر | ورودی و خروجی گرانتر |
| Gemini 2.5 Pro | تحلیل عمیق، پژوهش و Repository بزرگ | هزینه و Latency بسیار بالاتر |
رقیب واقعی Flash-Lite لزوماً یک مدل Frontier نیست؛ گاهی Pipeline قانونمحور یا سرویس OCR تخصصی همان کار را حل میکند. اگر Schema ثابت و داده تمیز باشد، راهکار تخصصی ممکن است ارزانتر و قابلکنترلتر باشد. اگر ورودی چندوجهی و ابزار Google لازم است، Flash-Lite مزیت یک Endpoint آماده را دارد.
قیمت و API
قیمت Standard رسمی در ۱۲ سپتامبر ۲۰۲۶، به دلار برای هر یک میلیون توکن:
| نوع مصرف | قیمت |
|---|---|
| Input متن، تصویر و ویدیو | ۰٫۱۰ دلار |
| Input صوت | ۰٫۳۰ دلار |
| Output شامل Thinking | ۰٫۴۰ دلار |
| Cache Input متن، تصویر و ویدیو | ۰٫۰۱ دلار |
| Cache Input صوت | ۰٫۰۳ دلار |
| Cache Storage | ۱ دلار بهازای یک میلیون توکن در ساعت |
| Batch / Flex Input متن، تصویر و ویدیو | ۰٫۰۵ دلار |
| Batch / Flex Input صوت | ۰٫۱۵ دلار |
| Batch / Flex Output | ۰٫۲۰ دلار |
Priority برای ورودی عادی ۰٫۱۸ دلار، ورودی صوت ۰٫۵۴ دلار و خروجی ۰٫۷۲ دلار بهازای یک میلیون توکن اعلام شده است. Search و Maps Grounding پس از سهمیه رایگان بهترتیب ۳۵ و ۲۵ دلار برای هر هزار Grounded Prompt هزینه دارند. در کار ارزانقیمت، هزینه Grounding میتواند از هزینه توکن بیشتر شود و باید فقط در Queryهای لازم فعال باشد.
Free Tier محدود وجود دارد. نرخ نهایی به Tier، Region، Feature و تغییرات صفحه رسمی وابسته است؛ پیش از بودجهبندی دوباره Pricing را بررسی کنید.
Gemini 2.5 Flash-Lite را در Buffalo147 AI امتحان کنید
بهترین تست، یک Batch واقعی و قابلاندازهگیری است: مثلاً صد سند را با Schema ثابت استخراج کنید، نرخ خطا و زمان را بسنجید و فقط موارد کماطمینان را به مدل قویتر بفرستید. این روش ارزش اقتصادی Flash-Lite را بهتر از یک سؤال نمایشی نشان میدهد.
شروع استفاده از Gemini 2.5 Flash-Lite در Buffalo147 AI
جمعبندی
مزیت اصلی Gemini 2.5 Flash-Lite هزینه بسیار پایین همراه با Context بزرگ، ورودی چندوجهی و ابزارهای کامل Gemini است. برای طبقهبندی، ترجمه، استخراج و پیشپردازش انبوه انتخابی هدفمند محسوب میشود.
محدودیت مهم، افت کیفیت در استدلال و Coding دشوار است. Benchmarkها همچنین نشان میدهند Thinking در همه وظایف سود یکسانی ندارد؛ تنظیم و Route باید دادهمحور باشد.
اگر حجم بالا و هزینه هر Request معیار اصلی است، Flash-Lite ارزش آزمایش دارد. برای تصمیم حساس یا مورد پیچیده، آن را در معماری Cascade به Flash، Pro یا انسان متصل کنید.
پرسشهای متداول
Gemini 2.5 Flash-Lite چیست؟
مدل سبک و چندوجهی Google برای کارهای پرتعداد مانند استخراج، طبقهبندی، ترجمه و پردازش ساختاریافته است.
آیا Gemini 2.5 Flash-Lite Thinking دارد؟
بله. Thinking قابلکنترل است، اما اثر آن به وظیفه بستگی دارد و میتواند Latency و هزینه خروجی را افزایش دهد.
آیا این مدل برای برنامهنویسی مناسب است؟
برای کد ساده و تبدیلهای تکراری قابل استفاده است، اما Benchmarkهای Coding آن از Flash و Pro پایینترند و برای Repository پیچیده پیشنهاد اول نیست.
Context Window مدل چقدر است؟
حداکثر ۱٬۰۴۸٬۵۷۶ توکن ورودی و ۶۵٬۵۳۶ توکن خروجی دارد.
آیا Gemini 2.5 Flash-Lite رایگان است؟
Free Tier محدود در AI Studio/Gemini API ارائه میشود. محدودیت نرخ و شرایط داده به حساب و منطقه وابسته است.
Flash-Lite بهتر است یا Flash؟
برای کمترین هزینه و Jobهای ساده، Flash-Lite بهتر است؛ برای استدلال، Coding و بازیابی پیچیده از Context طولانی، Flash معمولاً کیفیت بالاتری دارد.
آیا نسخه Stable با Previewهای قدیمی یکی است؟
خیر. شناسه Stable gemini-2.5-flash-lite را نباید با Snapshotهای Preview خاموششده یا Benchmarkهای آنها یکی دانست.
منابع
- مستند رسمی Gemini 2.5 Flash-Lite
- Model Card رسمی Gemini 2.5 Flash-Lite
- صفحه چرخه عمر Gemini 2.5 Flash-Lite در Google Cloud
- قیمت رسمی Gemini API
- ارزیابی مستقل حالت Reasoning
- ارزیابی مستقل حالت Non-reasoning
یادداشت تحریریه Buffalo147 AI: Benchmarkهای Stable و Preview جدا نگه داشته شدهاند. اعداد رسمی Vendor-reported هستند و تنظیم Thinking یا تعداد تلاش میتواند نتیجه را تغییر دهد.