Gemini 3.5 Flash-Lite؛ مدل فوقسریع Google برای Subagent و پردازش انبوه
آخرین راستیآزمایی: ۱۲ سپتامبر ۲۰۲۶
تاریخ عرضه: ۲۱ ژوئیه ۲۰۲۶
قیمت و شیوهٔ محاسبه: Standard: ۰٫۳۰ دلار ورودی و ۲٫۵۰ دلار خروجی برای هر یک میلیون توکن؛ نرخ ورودی برای متن، تصویر، ویدیو و صوت یکسان اعلام شده است. تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.
مقدمه
در یک سیستم Agentic، همه مراحل به گرانترین مدل نیاز ندارند. بخش زیادی از کار شامل دستهبندی، استخراج یک Schema، ترجمه کوتاه، خواندن رسید یا اجرای یک وظیفه محدود است. Gemini 3.5 Flash-Lite دقیقاً برای همین لایه پرتعداد ساخته شده است.
Google این مدل را سریعترین و اقتصادیترین عضو کلاس 3.5 معرفی میکند. ورودی متن، تصویر، صوت، ویدیو و PDF، Context یکمیلیونتوکنی و ابزارهایی مانند Function Calling و Computer Use باعث میشوند پسوند «Lite» را با «فقط یک مدل متنی ساده» اشتباه نگیریم.
نقطه تصمیم مهم، کیفیت در برابر حجم است. 3.5 Flash-Lite در چند بنچمارک Agent و Coding به مدلهای بزرگتر نزدیک میشود، اما برای برنامهریزی مبهم یا استدلال دشوار هنوز بهتر است یک مدل Master قویتر کار را تقسیم و نتیجه را کنترل کند.
معرفی کامل Gemini 3.5 Flash-Lite
Gemini 3.5 Flash-Lite در ۲۱ ژوئیه ۲۰۲۶ همراه Gemini 3.6 Flash عرضه شد. مدل بر پایه Gemini 3.1 Flash-Lite ساخته شده، اما برای Agentهای پرتعداد، Document Parsing و سرعت بیشتر ارتقا یافته است. شناسه Stable آن gemini-3.5-flash-lite است.

جایگاه این مدل در معماری محصول معمولاً «Worker» یا Subagent است: مدل Master هدف و محدودیت را تعیین میکند و چند نمونه Flash-Lite، کارهای کوچک و مستقل را موازی انجام میدهند. البته خود مدل نیز Function Calling و Thinking دارد و برای بعضی Workflowهای سبک میتواند نقش هماهنگکننده را بگیرد.
در زمان بررسی، دسترسی از طریق Gemini API، Google AI Studio، Gemini Enterprise Agent Platform و برخی سطوح Gemini App وجود دارد. سهمیه مصرفکننده، منطقه و قابلیت هر سطح ممکن است با API تفاوت داشته باشد.
قابلیتهای اصلی
پردازش انبوه با Latency پایین
مدل برای تعداد زیاد درخواست کوتاه و مشخص بهینه شده است. Google هنگام عرضه سرعت ۳۵۰ توکن خروجی در ثانیه را به نقل از Artificial Analysis مطرح کرد؛ Snapshot مستقل فعلی عدد نزدیک ۳۴۲٫۸ را نشان میدهد.
Subagent و Agentic Search
3.5 Flash-Lite میتواند یک جستجوی محدود، استخراج شواهد یا بررسی یک بخش از Repository را انجام دهد و نتیجه ساختاریافته به Agent اصلی برگرداند. تقسیم وظیفه باید صریح باشد؛ Subagent کوچک برای تصمیم راهبردی مبهم انتخاب مناسبی نیست.
ترجمه، طبقهبندی و استخراج داده
کارهای پرتکراری مانند ترجمه Ticket، تشخیص Intent، برچسبگذاری محصول و تبدیل رسید به JSON با نقاط قوت این مدل همراستا هستند. Structured Outputs به ثبات قالب کمک میکند، اما اعتبارسنجی Schema و قواعد دامنه باید در سرور انجام شود.
تحلیل اسناد و رسانه
ورودی متن، تصویر، صوت، ویدیو و PDF پشتیبانی میشود. مدل میتواند فاکتور، Screenshot، ضبط مکالمه یا ویدیوی کوتاه را تحلیل کند و متن تحویل دهد؛ خروجی مستقیم تصویر، صوت یا ویدیو ندارد.
Thinking قابل تنظیم
Google استفاده از سطحهای Minimal و Low را برای کار کمهزینه و سطحهای بالاتر را برای Subagentهای چندمرحلهای پیشنهاد میکند. افزایش Thinking باید با بهبود نرخ موفقیت سنجیده شود، زیرا توکنهای استدلال در هزینه خروجی حساب میشوند.
ابزار و Computer Use
Function Calling، Code Execution، File Search، Search و Maps Grounding، URL Context و Computer Use در دسترساند؛ Computer Use وضعیت Preview دارد. اجرای ابزار باید در Sandbox و زیر محدودیت دسترسی انجام شود.
مهمترین نقاط قوت
- سرعت بسیار بالای تولید در API مستقل اندازهگیریشده
- قیمت پایین برای ورودی چندوجهی و Batch
- جهش بزرگ نسبت به 3.1 Flash-Lite در Coding، Terminal و کار دانشی
- Context یکمیلیونتوکنی و خروجی تا ۶۵٬۵۳۶ توکن
- پشتیبانی از Computer Use و مجموعه کامل ابزارهای Gemini
- مناسب برای معماری Master–Worker و پردازش موازی حجم بالا
محدودیتها و نقاط ضعف
مدل Lite برای دشوارترین استدلالها ساخته نشده است. در Terminal-Bench 2.1 و SWE-Bench Pro، GPT-5.4 mini در جدول رسمی کمی جلوتر است؛ در GDPVal نیز فاصله کوچکی به نفع آن دیده میشود.

Knowledge Cutoff عمدتاً مارس ۲۰۲۶ است، اما Google هشدار میدهد برخی حوزهها ممکن است عملاً تا ژانویه ۲۰۲۵ محدود باشند. Search Grounding برای داده تازه لازم است و خود مدل ممکن است Hallucination داشته باشد.
TTFT مستقل حدود ۷٫۳۲ ثانیه برای تنظیم ارزیابیشده ثبت شده است. این عدد نسبت به سرعت خروجی زیاد به نظر میرسد و نشان میدهد Thinking میتواند پاسخ اولیه را عقب بیندازد؛ برای UI تعاملی سطح پایینتر را آزمایش کنید.
Computer Use هنوز Preview است و خروجی بومی رسانه یا Live API وجود ندارد. در کار انبوه، حتی خطای یکدرصدی میتواند هزاران رکورد نادرست بسازد؛ Sampling، Human Review و Validation ضروریاند.
کاربردهای واقعی Gemini 3.5 Flash-Lite
شبکه Subagent برای پژوهش
Agent اصلی میتواند فهرستی از منابع را تقسیم کند و هر Worker فقط یک منبع را از نظر تاریخ، ادعا و شواهد بررسی کند. مرحله نهایی باید تعارضها را جمعبندی و Citationها را کنترل کند.
پردازش رسید و فاکتور
تصویر یا PDF به Schema شامل فروشنده، تاریخ، ارز، اقلام و جمع تبدیل میشود. اختلاف جمع یا فیلد ناخوانا باید به صف بازبینی برود، نه اینکه حدس زده شود.
ترجمه Ticket در مقیاس بالا
مدل میتواند پیامهای پشتیبانی را ترجمه و همزمان Intent و فوریت را طبقهبندی کند. نام محصول و اصطلاحات باید با Glossary ثابت شوند.
برچسبگذاری کاتالوگ چندوجهی
تصویر و توضیح محصول کنار هم تحلیل میشوند تا دسته، رنگ، جنس و ریسک مرجوعی استخراج شود. Confidence Threshold میتواند موارد مبهم را به انسان بسپارد.
Agent سبک برای کار اداری
با Function Calling یا Computer Use محدود، مدل میتواند اطلاعات را از فرم بخواند و پیشنویس ورود داده بسازد. ثبت نهایی، پرداخت و حذف باید تأیید انسانی داشته باشند.
این مدل مناسب چه کسانی است؟
Gemini 3.5 Flash-Lite برای تیمهای Data Operations، فروشگاههای آنلاین، مراکز پشتیبانی، سازندگان Agent، شرکتهای ترجمه و محصولاتی مناسب است که میلیونها درخواست کوچک و چندوجهی دارند.
اگر هر درخواست پیچیدگی زیاد، پیامد مالی یا نیاز به برنامهریزی طولانی دارد، 3.6 یا 3.8 Flash و مدلهای Pro باید بهعنوان Master یا مسیر Escalation استفاده شوند.
مشخصات فنی Gemini 3.5 Flash-Lite
| مشخصه | مقدار تأییدشده |
|---|---|
| Developer | |
| Model Family | Gemini 3.5 Flash-Lite |
| Model Type | مدل اختصاصی چندوجهی، استدلالی و اقتصادی |
| Release Date | ۲۱ ژوئیه ۲۰۲۶ |
| Lifecycle | Stable در زمان بررسی |
| API Model ID | gemini-3.5-flash-lite |
| Based On | Gemini 3.1 Flash-Lite |
| Input | متن، تصویر، صوت، ویدیو و PDF |
| Output | متن |
| Context Window | ۱٬۰۴۸٬۵۷۶ توکن ورودی |
| Maximum Output | ۶۵٬۵۳۶ توکن |
| Knowledge Cutoff | عمدتاً مارس ۲۰۲۶؛ برخی حوزهها ممکن است ژانویه ۲۰۲۵ باشند |
| Thinking | بله، قابل تنظیم |
| Vision / Audio / Video Understanding | بله |
| Native Media Generation | خیر |
| Tool Use | Function Calling، Code Execution، File Search و ابزارهای Grounding |
| Web Search | از طریق Google Search Grounding |
| Computer Use | Preview |
| Live API | خیر |
| API Availability | Gemini API و Google AI Studio |
۵ نمونه پرامپت کاربردی
۱. Worker پژوهش منبعمحور
فقط URL اختصاصیافته را بررسی کن. تاریخ انتشار، سه ادعای اصلی، شواهد مستقیم و محدودیت منبع را در JSON برگردان. از هیچ منبع دیگری استفاده نکن و هر فیلد یافتنشده را
nullبگذار.
۲. استخراج فاکتور
این تصویر فاکتور را طبق Schema به JSON تبدیل کن. برای هر مقدار Confidence بده و کنترل کن جمع اقلام با مبلغ نهایی برابر باشد. عدد ناخوانا را حدس نزن و رکورد را
needs_review: trueعلامت بزن.
۳. ترجمه پشتیبانی با Glossary
پیام را به فارسی طبیعی ترجمه کن و اصطلاحات Glossary پیوست را دقیق حفظ کن. فقط JSON شامل
translation،intentوurgencyبرگردان؛ اطلاعات شخصی را در خلاصه تکرار نکن.
۴. برچسبگذاری محصول
تصویر و توضیح محصول را بررسی کن. دسته، رنگ غالب، جنس قابل مشاهده و ریسک مرجوعی را استخراج کن. میان ویژگی مشاهدهشده و ویژگی ادعاشده در متن تمایز بگذار.
۵. Subagent کدنویسی محدود
فقط ماژول [نام ماژول] را برای علت این خطا بررسی کن. حداکثر سه فایل را باز کن، علت محتمل و یک Patch کوچک پیشنهاد بده و تست مرتبط بنویس. هیچ فایل خارج از دامنه را تغییر نده.
بنچمارکها و ارزیابی عملکرد
جدول زیر از Model Card رسمی Google در ژوئیه ۲۰۲۶ است و Vendor-reported محسوب میشود. GPT-5.4 mini و Haiku 4.5 رقبای اقتصادی همردهاند؛ خط تیره یعنی Google عدد قابل مقایسه منتشر نکرده است.
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite | GPT-5.4 mini | Claude Haiku 4.5 |
|---|---|---|---|---|
| SWE-Bench Pro | ۵۴٫۲٪ | ۳۸٫۳٪ | ۵۴٫۴٪ | ۳۹٫۵٪ |
| Terminal-Bench 2.1 | ۵۴٫۰٪ | ۳۱٫۰٪ | ۵۹٫۲٪ | ۴۴٫۲٪ |
| MLE-Bench | ۳۹٫۲٪ | ۲۲٫۰٪ | — | — |
| GDPVal-AA v2، Elo | ۱۱۴۰ | ۶۴۲ | ۱۱۷۱ | ۹۰۷ |
| OSWorld-Verified | ۷۴٫۰٪ | ۵۴٫۳٪ | ۷۲٫۱٪ | ۵۰٫۷٪ |
| CharXiv، بدون ابزار | ۷۴٫۵٪ | ۷۳٫۲٪ | ۸۰٫۳٪ | ۶۱٫۷٪ |
| GDM-MRCR v2 در 128K | ۷۲٫۲٪ | ۶۰٫۱٪ | ۴۲٫۷٪ | ۳۵٫۳٪ |
| GDM-MRCR v2 در 1M | ۲۱٫۳٪ | ۱۲٫۳٪ | — | — |
جهش نسبت به 3.1 در Terminal، GDPVal و Long Context بزرگ است. مدل در OSWorld از GPT-5.4 mini جلو میافتد و در SWE-Pro تقریباً مساوی است؛ GPT-5.4 mini در Terminal، GDPVal و CharXiv برتری دارد. بنابراین 3.5 Flash-Lite برای Worker چندوجهی و GUI جذابتر و رقیب OpenAI برای بعضی Coding Flowها قویتر است.
Artificial Analysis در ارزیابی مستقل ۱۲ سپتامبر ۲۰۲۶ امتیاز ۲۳ در Intelligence Index v4.3، سرعت ۳۴۲٫۸ توکن بر ثانیه، TTFT حدود ۷٫۳۲ ثانیه و هزینه ۰٫۱۲ دلار برای هر وظیفه شاخص گزارش میکند. مدل در اجرای شاخص ۵۹ میلیون توکن خروجی مصرف کرده که در رده خود نسبتاً فشرده است.
سرعت مستقل نزدیک به ادعای ۳۵۰ توکن Google است و نقش پردازش انبوه را تأیید میکند. بااینحال، نمره ترکیبی ۲۳ پایینتر از Flashهای بزرگتر است؛ بنابراین Router باید درخواست مبهم یا سخت را به مدل قویتر ارتقا دهد.
برای Eval داخلی، فقط Accuracy میانگین را نسنجید. نرخ JSON معتبر، درصد رکورد نیازمند بازبینی، هزینه بهازای رکورد صحیح و P95 Latency معیارهای مناسبتری برای یک مدل Lite هستند.
مقایسه Gemini 3.5 Flash-Lite با رقبا
| مدل | انتخاب مناسب برای | محدودیت نسبی |
|---|---|---|
| Gemini 3.5 Flash-Lite | Worker چندوجهی، سند، ترجمه و Agent پرتعداد | سقف استدلال پایینتر از Flash کامل |
| Gemini 3.1 Flash-Lite | حفظ Snapshot قدیمی با هزینه خروجی کمتر | کیفیت Agent و Coding بهوضوح پایینتر است |
| GPT-5.4 mini | Terminal و بعضی Workflowهای Coding | در OSWorld و Context بلند جدول Google عقبتر است |
| Claude Haiku 4.5 | وظایف سریع در اکوسیستم Anthropic | در بیشتر اعداد جدول عرضه از 3.5 Lite پایینتر است |
| Gemini 3.8 Flash | Master Agent و وظیفه پیچیده | برای میلیونها استخراج ساده گرانتر و بیشازنیاز است |
معماری ترکیبی اغلب بهترین نتیجه را میدهد: 3.5 Flash-Lite برای Worker و 3.8 Flash برای برنامهریزی، بررسی تعارض و Escalation. این تقسیم میتواند کیفیت مدل بزرگ را با هزینه نزدیکتر به مدل Lite ترکیب کند.
قیمت و API
قیمت عمومی بررسیشده در ۱۲ سپتامبر ۲۰۲۶:
- Standard: ۰٫۳۰ دلار ورودی و ۲٫۵۰ دلار خروجی برای هر یک میلیون توکن؛ نرخ ورودی برای متن، تصویر، ویدیو و صوت یکسان اعلام شده است.
- Context Cache: ۰٫۰۳ دلار؛ ذخیره Cache برابر ۱ دلار برای هر یک میلیون توکن در ساعت
- Batch: ۰٫۱۵ دلار ورودی و ۱٫۲۵ دلار خروجی
- Flex: ۰٫۱۵ دلار ورودی و ۱٫۲۵ دلار خروجی
- Priority: ۰٫۵۴ دلار ورودی و ۴٫۵۰ دلار خروجی
- Free Tier وجود دارد؛ Grounding در Paid Tier پس از ۵٬۰۰۰ درخواست رایگان مشترک Gemini 3.x، طبق نرخ فعلی ۱۴ دلار بهازای ۱٬۰۰۰ Query است.
توکنهای Thinking در قیمت خروجی محاسبه میشوند. برای کار انبوه، Batch یا Flex و کاهش Thinking میتوانند هزینه را کم کنند، به شرط آنکه نرخ خطا افزایش نامطلوب نداشته باشد.
Gemini 3.5 Flash-Lite را در Buffalo147 AI امتحان کنید
یک نمونه واقعی از کار پرتعداد خود—مانند فاکتور، Ticket یا برچسب محصول—را با Schema و معیار پذیرش روشن اجرا کنید. سپس زمان، هزینه و درصد رکورد صحیح را بسنجید تا معلوم شود مدل برای لایه Worker شما مناسب است یا نه.
شروع استفاده از Gemini 3.5 Flash-Lite در Buffalo147 AI
جمعبندی
Gemini 3.5 Flash-Lite یکی از جذابترین مدلهای Worker سال ۲۰۲۶ است: سریع، چندوجهی، ابزارمحور و بهاندازه کافی توانمند برای بخش بزرگی از کارهای ساختاریافته. جهش آن نسبت به 3.1 Lite در Agent و Coding واقعی است.
محدودیت مهم، سقف استدلال و Latency اولیه Thinking است. مدل برای تصمیمهای مبهم یا پرریسک نباید بدون Router، Validation و مسیر Escalation استفاده شود.
برای ترجمه، Document Parsing، طبقهبندی و Subagentهای موازی، نسبت سرعت به کیفیت آن بسیار رقابتی است. در معماری حرفهای، بهترین جایگاهش اغلب زیر نظر یک Master Agent قویتر است.
پرسشهای متداول
Gemini 3.5 Flash-Lite چیست؟
مدل اقتصادی و چندوجهی Google برای پردازش انبوه، Subagent، ترجمه، استخراج داده و Workflowهای کمتأخیر است.
سرعت Gemini 3.5 Flash-Lite چقدر است؟
Artificial Analysis در Snapshot فعلی حدود ۳۴۲٫۸ توکن خروجی در ثانیه اندازه گرفته است؛ سرعت واقعی با طول ورودی، Thinking و بار سرویس تغییر میکند.
آیا Gemini 3.5 Flash-Lite برای برنامهنویسی خوب است؟
برای وظایف محدود و Subagent کدنویسی مناسب است و در SWE-Bench Pro رسمی ۵۴٫۲٪ گرفته، اما برای معماری یا Debug دشوار بهتر است مدل قویتر نیز در چرخه باشد.
آیا این مدل Computer Use دارد؟
بله، مستندات فعلی Computer Use را با وضعیت Preview ثبت میکنند. عملیات حساس باید محدود و تأیید شوند.
تفاوت 3.5 Flash-Lite با 3.5 Flash چیست؟
نسخه Lite برای سرعت، هزینه و حجم بالا بهینه شده؛ Flash کامل سقف استدلال و Agent بالاتری دارد و برای نقش Master مناسبتر است.
آیا API رایگان است؟
Free Tier وجود دارد، اما سهمیه محدود است. مصرف بیشتر، Cache و ابزارهای Grounding طبق جدول رسمی هزینه دارند.
منابع
- مستند رسمی Gemini 3.5 Flash-Lite
- معرفی رسمی Gemini 3.5 Flash-Lite و 3.6 Flash
- Model Card رسمی Gemini 3.5 Flash-Lite
- قیمت رسمی Gemini API
- ارزیابی مستقل Gemini 3.5 Flash-Lite
یادداشت تحریریه Buffalo147 AI: جدول مقایسه Google، Vendor-reported است. سرعت و Intelligence Index مستقل با Snapshot جاری Artificial Analysis جداگانه ارائه شدهاند.