Buffalo147 AI

خانه › بلاگ

Gemini 2.5 Flash-Lite؛ بررسی مدل اقتصادی گوگل برای استخراج، ترجمه و حجم بالا

جلد Gemini 2.5 Flash-Lite با طراحی سه‌بعدی مشکی و نور مسی

آخرین راستی‌آزمایی: ۱۲ سپتامبر ۲۰۲۶

در یک نگاه | Gemini 2.5 Flash-Lite
تاریخ عرضه: ۲۲ ژوئیه ۲۰۲۵
قیمت و شیوهٔ محاسبه: Input متن، تصویر و ویدیو ۰٫۱۰ دلار؛ Output شامل Thinking ۰٫۴۰ دلار؛ به‌ازای هر یک میلیون توکن تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.

مقدمه

وقتی قرار است میلیون‌ها پیام، سند یا ردیف داده پردازش شود، اختلاف چند سنت در هر میلیون توکن به هزینه جدی تبدیل می‌شود. Gemini 2.5 Flash-Lite برای همین نوع مقیاس طراحی شده است: پاسخ سریع، قیمت پایین و امکانات API کافی برای کارهای تکرارشونده.

پسوند Lite به معنی یک چت‌بات ساده و بدون ابزار نیست. مدل Context یک‌میلیون‌توکنی، ورودی چندوجهی، Structured Output، Function Calling، Search Grounding و Thinking دارد. تفاوت اصلی در اولویت طراحی است: Throughput و بهره‌وری هزینه بالاتر از سقف استدلال مدل Pro قرار گرفته‌اند.

برای دسته‌بندی تیکت، استخراج فیلد از سند، ترجمه کاتالوگ یا Moderation اولیه، این انتخاب می‌تواند منطقی‌تر از مدل بزرگ باشد. اما معماری خوب باید موارد مبهم و پرریسک را به مدل قوی‌تر یا بازبین انسانی ارجاع دهد.

معرفی کامل Gemini 2.5 Flash-Lite

نسخه Stable مدل در ۲۲ ژوئیه ۲۰۲۵ عرضه شد و شناسه آن gemini-2.5-flash-lite است. این کوچک‌ترین و اقتصادی‌ترین عضو عمومی خانواده Gemini 2.5 محسوب می‌شود. Model Card معماری را Transformer چندوجهی sparse Mixture-of-Experts توصیف می‌کند و تعداد پارامترها را اعلام نمی‌کند.

شماتیک روند ورودی، مدل و خروجی برای Gemini 2.5 Flash-Lite
نمای شماتیک روند درخواست تا خروجی برای Gemini 2.5 Flash-Lite؛ قابلیت‌های دقیق در متن مقاله آمده‌اند.

Google مدل را برای ترجمه، طبقه‌بندی، استخراج داده و کاربردهای پرتعداد معرفی کرده است. Thinking را می‌توان متناسب با کار تنظیم کرد؛ حالت Non-thinking برای کمترین تأخیر مناسب‌تر است و Thinking در بعضی آزمون‌ها دقت را افزایش می‌دهد.

مدل در Google AI Studio، Gemini Developer API و Vertex AI عرضه شده است. در تاریخ بررسی، Gemini Developer API آن را Stable نشان می‌دهد؛ صفحه Google Cloud برای عرضه متناظر تاریخ بازنشستگی ۲۰ اکتبر ۲۰۲۶ دارد. Previewهای قدیمی Flash-Lite که خاموش شده‌اند، نسخه‌ای جدا از شناسه Stable هستند و Benchmark یا چرخه عمرشان نباید با GA ادغام شود.

قابلیت‌های اصلی

طبقه‌بندی و استخراج ساختاریافته

Structured Outputs برای تبدیل متن یا سند به JSON با Schema مشخص بسیار مهم است. مدل می‌تواند موضوع، زبان، Intent، موجودیت‌ها و فیلدهای کلیدی را استخراج کند. Validation در سطح برنامه همچنان لازم است و فیلد ناموجود باید به‌جای حدس با null ثبت شود.

ترجمه و بازنویسی در مقیاس

Flash-Lite برای ترجمه دسته‌ای، یکسان‌سازی لحن و تولید نسخه‌های کوتاه مناسب است. Glossary برند، زبان مقصد و ممنوعیت ترجمه اصطلاحات خاص را باید صریح در Prompt قرار داد.

Thinking اختیاری

برای کار ساده می‌توان Thinking را خاموش یا محدود کرد تا پاسخ سریع‌تر باشد. برای سند مبهم یا دسته‌بندی چندقیدی، Thinking می‌تواند کمک کند؛ اما Benchmark رسمی نشان می‌دهد اثر آن در همه وظایف یکسان نیست و حتی بعضی امتیازها کاهش یافته‌اند.

ورودی چندوجهی و Context بزرگ

مدل متن، تصویر، صوت، ویدیو و PDF را می‌فهمد و تا ۱٬۰۴۸٬۵۷۶ توکن ورودی می‌پذیرد. این قابلیت برای استخراج از اسکن، Transcript یا ویدیو مفید است؛ خروجی مدل فقط متن است.

ابزار و جستجو

Function Calling، Code Execution، File Search، URL Context، Google Search Grounding و Maps Grounding پشتیبانی می‌شوند. برای Agent کم‌هزینه مناسب است، اما مدل Lite نباید بدون محدودیت ابزار یا Approval به عملیات حساس دسترسی داشته باشد.

Batch، Caching و ظرفیت

نرخ Batch/Flex نصف نرخ Standard است و برای Jobهای غیرهم‌زمان ارزش زیادی دارد. Context Caching نیز در ورودی‌های تکراری هزینه را کم می‌کند. برای SLA سخت، محدودیت نرخ و Region باید در حساب واقعی اندازه‌گیری شود.

مهم‌ترین نقاط قوت

  • یکی از پایین‌ترین قیمت‌های خانواده Gemini 2.5
  • سرعت تولید بسیار بالا و TTFT بسیار کم در حالت Non-thinking
  • مناسب برای استخراج، طبقه‌بندی، ترجمه و پردازش Batch
  • Context یک‌میلیون‌توکنی و ورودی چندوجهی
  • Structured Output و ابزارهای اکوسیستم Google
  • امکان افزایش موقت کیفیت با Thinking بدون تغییر شناسه مدل

محدودیت‌ها و نقاط ضعف

Flash-Lite برای سخت‌ترین استدلال، ریاضی و Coding طراحی نشده است. در Benchmarkهای رسمی HLE، GPQA، AIME و LiveCodeBench از Flash و Pro عقب‌تر است. استفاده از آن برای همه درخواست‌ها فقط به‌دلیل قیمت پایین می‌تواند نرخ خطای پنهان را بالا ببرد.

سه معیار ارزیابی عملی برای Gemini 2.5 Flash-Lite
معیارهای پیشنهادی برای آزمون Gemini 2.5 Flash-Lite با کار واقعی؛ این تصویر دادهٔ بنچمارک یا امتیاز گزارش‌شده نیست.

Thinking همیشه معجزه نمی‌کند. در Model Card Stable، امتیاز SWE-bench تک‌تلاش با Thinking از ۳۱٫۶٪ به ۲۷٫۶٪ کاهش یافته، هرچند نتیجه چندتلاش بهتر شده است. پس Budget باید با داده واقعی تنظیم شود، نه با فرض «فکر بیشتر همیشه بهتر است».

مدل تصویر، صوت یا ویدیو تولید نمی‌کند و Live API ندارد. اطلاعات پس از Knowledge Cutoff ژانویه ۲۰۲۵ نیز بدون Search یا Context تازه قابل اتکا نیست.

برچسب Deprecated در بعضی Trackerهای مستقل به Snapshot ارزیابی‌شده قدیمی مربوط است، نه لزوماً شناسه Stable API. از طرف دیگر، تاریخ بازنشستگی Cloud نزدیک است؛ استقرار جدید باید مدل جانشین و Regression Test داشته باشد.

کاربردهای واقعی Gemini 2.5 Flash-Lite

طبقه‌بندی تیکت پشتیبانی

می‌توان Intent، محصول، فوریت و نیاز به اپراتور را به‌صورت JSON استخراج کرد. Queue انسانی برای موارد کم‌اطمینان یا شکایت حقوقی از کاهش هزینه مهم‌تر است.

استخراج فاکتور و فرم

تصویر یا PDF سند به فیلدهای ساختاریافته تبدیل می‌شود. شماره سند، مبلغ و تاریخ باید با Rule یا OCR ثانویه کنترل شوند؛ مدل نباید مقدار ناخوانا را بسازد.

ترجمه کاتالوگ محصول

هزاران توضیح محصول را می‌توان با Glossary ثابت ترجمه و طول متن را برای رابط کاربری کنترل کرد. نمونه‌های تصادفی هر Batch باید QA زبانی شوند.

برچسب‌گذاری محتوای چندرسانه‌ای

از تصویر، صوت یا ویدیو می‌توان موضوع و Metadata اولیه استخراج کرد. برای تصمیم ایمنی یا Moderation نهایی، Policy Classifier تخصصی و انسان لازم است.

پیش‌پردازش برای مدل بزرگ‌تر

Flash-Lite می‌تواند سندها را مرتب، بخش مرتبط را استخراج و فقط موارد دشوار را به Pro بفرستد. این معماری Cascading معمولاً هزینه را بدون افت بزرگ کیفیت کاهش می‌دهد.

این مدل مناسب چه کسانی است؟

تیم‌های داده، فروشگاه‌های آنلاین، پلتفرم‌های پشتیبانی، شرکت‌های ترجمه، متخصصان مارکتینگ و توسعه‌دهندگان Pipelineهای حجیم مخاطبان اصلی‌اند. برای Startupی که باید هزینه هر درخواست را دقیق کنترل کند نیز گزینه جذابی است.

پژوهشگران یا برنامه‌نویسانی که مسئله‌های پیچیده و کم‌تعداد دارند بهتر است Flash یا Pro را هم آزمایش کنند. در حوزه‌های حساس، Flash-Lite فقط می‌تواند مرحله اول پردازش باشد، نه تصمیم‌گیر نهایی.

مشخصات فنی Gemini 2.5 Flash-Lite

مشخصه مقدار تأییدشده
Developer Google
Model Family Gemini 2.5
Model Type مدل اختصاصی چندوجهی سبک و sparse MoE
Stable Release ۲۲ ژوئیه ۲۰۲۵
API Model ID gemini-2.5-flash-lite
Input متن، تصویر، صوت، ویدیو و PDF
Output متن
Context Window ۱٬۰۴۸٬۵۷۶ توکن ورودی
Maximum Output ۶۵٬۵۳۶ توکن
Knowledge Cutoff ژانویه ۲۰۲۵
Thinking بله؛ قابل‌کنترل و قابل‌غیرفعال‌سازی
Vision / Audio / Video Understanding بله
Native Image / Audio / Video Generation خیر
Tool Use Function Calling، Code Execution، File Search و URL Context
Web Search بله، از طریق Google Search Grounding
Maps Grounding بله
Structured Output / Caching بله
Live API خیر
API Availability Stable در Gemini Developer API؛ در Vertex AI نیز عرضه شده است
Google Cloud Lifecycle صفحه Cloud تاریخ بازنشستگی ۲۰ اکتبر ۲۰۲۶ را ثبت کرده است

۵ نمونه پرامپت کاربردی

۱. دسته‌بندی تیکت با Escalation

هر تیکت را در یکی از دسته‌های Schema طبقه‌بندی کن و JSON معتبر بده. confidence و reason_evidence الزامی است. اگر اطمینان کمتر از ۰٫۸ یا موضوع حقوقی/پرداختی بود، needs_human=true قرار بده و هیچ اقدام خودکاری پیشنهاد نکن.

۲. استخراج فیلد از فاکتور

از این PDF فقط invoice_number، seller، issue_date، currency، subtotal، tax و total را استخراج کن. برای هر فیلد شماره صفحه بده؛ متن ناخوانا را null بگذار و جمع ارقام را با Code Execution کنترل کن.

۳. ترجمه با Glossary برند

این فایل محصولات را به فارسی روان ترجمه کن. اصطلاحات Glossary را عیناً رعایت کن، نام برند و SKU را تغییر نده، محدودیت طول هر فیلد را حفظ کن و موارد مبهم را در ستون review_note علامت بزن.

۴. برچسب‌گذاری ویدیو

این ویدیوها را با Taxonomy پیوست برچسب‌گذاری کن. خروجی JSONL شامل شناسه، موضوع اصلی، سه Tag، زبان، بازه‌های زمانی مهم و سطح اطمینان باشد. محتوای نامشخص را حدس نزن.

۵. Router اقتصادی مدل‌ها

درخواست را از نظر پیچیدگی، ریسک و نیاز به ابزار امتیاز بده. موارد ساده را پاسخ بده؛ موارد مبهم را به Gemini 2.5 Flash و مسائل پیچیده یا حساس را به Pro/انسان ارجاع بده. دلیل Route را در یک جمله ثبت کن.

بنچمارک‌ها و ارزیابی عملکرد

جدول نخست مربوط به نسخه Stable gemini-2.5-flash-lite در Model Card سپتامبر ۲۰۲۵ و Vendor-reported است. نتایج Non-thinking و Thinking جدا آمده‌اند؛ اعداد Previewهای خاموش‌شده عمداً استفاده نشده‌اند.

Benchmark و مفهوم Flash-Lite بدون Thinking Flash-Lite با Thinking 2.5 Flash با Thinking تاریخ / منبع
Humanity’s Last Exam؛ دانش و استدلال بسیار دشوار ۵٫۱٪ ۶٫۹٪ ۱۱٫۰٪ سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported
GPQA Diamond؛ علم سطح تحصیلات تکمیلی ۶۴٫۶٪ ۶۶٫۷٪ ۸۲٫۸٪ سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported
AIME 2025؛ ریاضیات مسابقه‌ای ۴۹٫۸٪ ۶۳٫۱٪ ۷۲٫۰٪ سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported
LiveCodeBench؛ مسائل Coding تازه ۳۳٫۷٪ ۳۴٫۳٪ ۶۳٫۹٪ سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported
SWE-bench Verified، یک تلاش؛ تعمیر GitHub Issue ۳۱٫۶٪ ۲۷٫۶٪ ۶۰٫۴٪ سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported
SWE-bench Verified، چند تلاش ۴۲٫۶٪ ۴۴٫۹٪ — سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported
FACTS Grounding؛ صحت پاسخ واقعیت‌محور ۸۴٫۱٪ ۸۶٫۸٪ ۸۵٫۳٪ سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported
MMMU؛ فهم چندوجهی دانشگاهی ۷۲٫۹٪ ۷۲٫۹٪ ۷۹٫۷٪ سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported
Vibe-Eval؛ کیفیت ورودی تصویری دشوار ۵۱٫۳٪ ۵۷٫۵٪ ۶۵٫۴٪ سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported
MRCR در ۱۲۸K؛ بازیابی چندسوزنه از Context طولانی ۱۶٫۶٪ ۳۰٫۶٪ ۷۴٫۰٪ سپتامبر ۲۰۲۵، Model Card Google؛ Vendor-reported

Thinking بیشترین بهبود را در AIME، Vibe-Eval و MRCR ایجاد می‌کند، اما در MMMU تغییری ندارد و SWE-bench تک‌تلاش را ضعیف‌تر کرده است. Flash-Lite در FACTS رقابتی است، ولی فاصله Coding و Long-context Retrieval آن با Flash واضح است. این الگو با کاربرد واقعی سازگار است: استخراج و پاسخ واقعیت‌محور مناسب‌اند؛ تعمیر Repository و استدلال سنگین بهتر است Escalate شوند.

Artificial Analysis در Snapshot مستقل ۱۲ سپتامبر ۲۰۲۶، برای حالت Reasoning امتیاز تخمینی ۹ در Intelligence Index v4.3، سرعت ۳۳۴٫۰ توکن بر ثانیه و TTFT حدود ۱۷٫۲۱ ثانیه گزارش می‌کند. حالت Non-reasoning امتیاز تخمینی ۷، سرعت ۲۷۸٫۹ توکن بر ثانیه و TTFT حدود ۰٫۳۱ ثانیه دارد.

تأخیر آغاز بسیار کم در حالت Non-thinking نقطه قوت مهمی است؛ Thinking کیفیت شاخص را بالاتر می‌برد، اما شروع پاسخ را به‌شدت کندتر می‌کند. Tracker مستقل بعضی Snapshotها را به‌دلیل نسخه ارزیابی جدیدتر Deprecated نامیده است و این برچسب با وضعیت Stable API یکی نیست.

مقایسه Gemini 2.5 Flash-Lite با رقبا

مدل انتخاب بهتر برای ملاحظه اصلی
Gemini 2.5 Flash-Lite استخراج، طبقه‌بندی، ترجمه و Batch با کمترین هزینه استدلال و Coding دشوار ضعیف‌تر
Gemini 2.5 Flash چت چندوجهی و مسئله متوسط با کیفیت بالاتر ورودی و خروجی گران‌تر
Gemini 2.5 Pro تحلیل عمیق، پژوهش و Repository بزرگ هزینه و Latency بسیار بالاتر

رقیب واقعی Flash-Lite لزوماً یک مدل Frontier نیست؛ گاهی Pipeline قانون‌محور یا سرویس OCR تخصصی همان کار را حل می‌کند. اگر Schema ثابت و داده تمیز باشد، راهکار تخصصی ممکن است ارزان‌تر و قابل‌کنترل‌تر باشد. اگر ورودی چندوجهی و ابزار Google لازم است، Flash-Lite مزیت یک Endpoint آماده را دارد.

قیمت و API

قیمت Standard رسمی در ۱۲ سپتامبر ۲۰۲۶، به دلار برای هر یک میلیون توکن:

نوع مصرف قیمت
Input متن، تصویر و ویدیو ۰٫۱۰ دلار
Input صوت ۰٫۳۰ دلار
Output شامل Thinking ۰٫۴۰ دلار
Cache Input متن، تصویر و ویدیو ۰٫۰۱ دلار
Cache Input صوت ۰٫۰۳ دلار
Cache Storage ۱ دلار به‌ازای یک میلیون توکن در ساعت
Batch / Flex Input متن، تصویر و ویدیو ۰٫۰۵ دلار
Batch / Flex Input صوت ۰٫۱۵ دلار
Batch / Flex Output ۰٫۲۰ دلار

Priority برای ورودی عادی ۰٫۱۸ دلار، ورودی صوت ۰٫۵۴ دلار و خروجی ۰٫۷۲ دلار به‌ازای یک میلیون توکن اعلام شده است. Search و Maps Grounding پس از سهمیه رایگان به‌ترتیب ۳۵ و ۲۵ دلار برای هر هزار Grounded Prompt هزینه دارند. در کار ارزان‌قیمت، هزینه Grounding می‌تواند از هزینه توکن بیشتر شود و باید فقط در Queryهای لازم فعال باشد.

Free Tier محدود وجود دارد. نرخ نهایی به Tier، Region، Feature و تغییرات صفحه رسمی وابسته است؛ پیش از بودجه‌بندی دوباره Pricing را بررسی کنید.

Gemini 2.5 Flash-Lite را در Buffalo147 AI امتحان کنید

بهترین تست، یک Batch واقعی و قابل‌اندازه‌گیری است: مثلاً صد سند را با Schema ثابت استخراج کنید، نرخ خطا و زمان را بسنجید و فقط موارد کم‌اطمینان را به مدل قوی‌تر بفرستید. این روش ارزش اقتصادی Flash-Lite را بهتر از یک سؤال نمایشی نشان می‌دهد.

شروع استفاده از Gemini 2.5 Flash-Lite در Buffalo147 AI

جمع‌بندی

مزیت اصلی Gemini 2.5 Flash-Lite هزینه بسیار پایین همراه با Context بزرگ، ورودی چندوجهی و ابزارهای کامل Gemini است. برای طبقه‌بندی، ترجمه، استخراج و پیش‌پردازش انبوه انتخابی هدفمند محسوب می‌شود.

محدودیت مهم، افت کیفیت در استدلال و Coding دشوار است. Benchmarkها همچنین نشان می‌دهند Thinking در همه وظایف سود یکسانی ندارد؛ تنظیم و Route باید داده‌محور باشد.

اگر حجم بالا و هزینه هر Request معیار اصلی است، Flash-Lite ارزش آزمایش دارد. برای تصمیم حساس یا مورد پیچیده، آن را در معماری Cascade به Flash، Pro یا انسان متصل کنید.

پرسش‌های متداول

Gemini 2.5 Flash-Lite چیست؟

مدل سبک و چندوجهی Google برای کارهای پرتعداد مانند استخراج، طبقه‌بندی، ترجمه و پردازش ساختاریافته است.

آیا Gemini 2.5 Flash-Lite Thinking دارد؟

بله. Thinking قابل‌کنترل است، اما اثر آن به وظیفه بستگی دارد و می‌تواند Latency و هزینه خروجی را افزایش دهد.

آیا این مدل برای برنامه‌نویسی مناسب است؟

برای کد ساده و تبدیل‌های تکراری قابل استفاده است، اما Benchmarkهای Coding آن از Flash و Pro پایین‌ترند و برای Repository پیچیده پیشنهاد اول نیست.

Context Window مدل چقدر است؟

حداکثر ۱٬۰۴۸٬۵۷۶ توکن ورودی و ۶۵٬۵۳۶ توکن خروجی دارد.

آیا Gemini 2.5 Flash-Lite رایگان است؟

Free Tier محدود در AI Studio/Gemini API ارائه می‌شود. محدودیت نرخ و شرایط داده به حساب و منطقه وابسته است.

Flash-Lite بهتر است یا Flash؟

برای کمترین هزینه و Jobهای ساده، Flash-Lite بهتر است؛ برای استدلال، Coding و بازیابی پیچیده از Context طولانی، Flash معمولاً کیفیت بالاتری دارد.

آیا نسخه Stable با Previewهای قدیمی یکی است؟

خیر. شناسه Stable gemini-2.5-flash-lite را نباید با Snapshotهای Preview خاموش‌شده یا Benchmarkهای آن‌ها یکی دانست.

منابع

یادداشت تحریریه Buffalo147 AI: Benchmarkهای Stable و Preview جدا نگه داشته شده‌اند. اعداد رسمی Vendor-reported هستند و تنظیم Thinking یا تعداد تلاش می‌تواند نتیجه را تغییر دهد.

خواندنی‌های دیگر