Buffalo147 AI

خانه › بلاگ

Gemini 3.5 Flash-Lite؛ مدل فوق‌سریع Google برای Subagent و پردازش انبوه

نام بزرگ Gemini 3.5 Flash-Lite روی شبکه‌ای از Subagentهای سریع و جریان اسناد با نور مسی در پس‌زمینه مشکی

آخرین راستی‌آزمایی: ۱۲ سپتامبر ۲۰۲۶

در یک نگاه | Gemini 3.5 Flash-Lite
تاریخ عرضه: ۲۱ ژوئیه ۲۰۲۶
قیمت و شیوهٔ محاسبه: Standard: ۰٫۳۰ دلار ورودی و ۲٫۵۰ دلار خروجی برای هر یک میلیون توکن؛ نرخ ورودی برای متن، تصویر، ویدیو و صوت یکسان اعلام شده است. تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.

مقدمه

در یک سیستم Agentic، همه مراحل به گران‌ترین مدل نیاز ندارند. بخش زیادی از کار شامل دسته‌بندی، استخراج یک Schema، ترجمه کوتاه، خواندن رسید یا اجرای یک وظیفه محدود است. Gemini 3.5 Flash-Lite دقیقاً برای همین لایه پرتعداد ساخته شده است.

Google این مدل را سریع‌ترین و اقتصادی‌ترین عضو کلاس 3.5 معرفی می‌کند. ورودی متن، تصویر، صوت، ویدیو و PDF، Context یک‌میلیون‌توکنی و ابزارهایی مانند Function Calling و Computer Use باعث می‌شوند پسوند «Lite» را با «فقط یک مدل متنی ساده» اشتباه نگیریم.

نقطه تصمیم مهم، کیفیت در برابر حجم است. 3.5 Flash-Lite در چند بنچمارک Agent و Coding به مدل‌های بزرگ‌تر نزدیک می‌شود، اما برای برنامه‌ریزی مبهم یا استدلال دشوار هنوز بهتر است یک مدل Master قوی‌تر کار را تقسیم و نتیجه را کنترل کند.

معرفی کامل Gemini 3.5 Flash-Lite

Gemini 3.5 Flash-Lite در ۲۱ ژوئیه ۲۰۲۶ همراه Gemini 3.6 Flash عرضه شد. مدل بر پایه Gemini 3.1 Flash-Lite ساخته شده، اما برای Agentهای پرتعداد، Document Parsing و سرعت بیشتر ارتقا یافته است. شناسه Stable آن gemini-3.5-flash-lite است.

شماتیک روند ورودی، مدل و خروجی برای Gemini 3.5 Flash-Lite
نمای شماتیک روند درخواست تا خروجی برای Gemini 3.5 Flash-Lite؛ قابلیت‌های دقیق در متن مقاله آمده‌اند.

جایگاه این مدل در معماری محصول معمولاً «Worker» یا Subagent است: مدل Master هدف و محدودیت را تعیین می‌کند و چند نمونه Flash-Lite، کارهای کوچک و مستقل را موازی انجام می‌دهند. البته خود مدل نیز Function Calling و Thinking دارد و برای بعضی Workflowهای سبک می‌تواند نقش هماهنگ‌کننده را بگیرد.

در زمان بررسی، دسترسی از طریق Gemini API، Google AI Studio، Gemini Enterprise Agent Platform و برخی سطوح Gemini App وجود دارد. سهمیه مصرف‌کننده، منطقه و قابلیت هر سطح ممکن است با API تفاوت داشته باشد.

قابلیت‌های اصلی

پردازش انبوه با Latency پایین

مدل برای تعداد زیاد درخواست کوتاه و مشخص بهینه شده است. Google هنگام عرضه سرعت ۳۵۰ توکن خروجی در ثانیه را به نقل از Artificial Analysis مطرح کرد؛ Snapshot مستقل فعلی عدد نزدیک ۳۴۲٫۸ را نشان می‌دهد.

3.5 Flash-Lite می‌تواند یک جستجوی محدود، استخراج شواهد یا بررسی یک بخش از Repository را انجام دهد و نتیجه ساختاریافته به Agent اصلی برگرداند. تقسیم وظیفه باید صریح باشد؛ Subagent کوچک برای تصمیم راهبردی مبهم انتخاب مناسبی نیست.

ترجمه، طبقه‌بندی و استخراج داده

کارهای پرتکراری مانند ترجمه Ticket، تشخیص Intent، برچسب‌گذاری محصول و تبدیل رسید به JSON با نقاط قوت این مدل هم‌راستا هستند. Structured Outputs به ثبات قالب کمک می‌کند، اما اعتبارسنجی Schema و قواعد دامنه باید در سرور انجام شود.

تحلیل اسناد و رسانه

ورودی متن، تصویر، صوت، ویدیو و PDF پشتیبانی می‌شود. مدل می‌تواند فاکتور، Screenshot، ضبط مکالمه یا ویدیوی کوتاه را تحلیل کند و متن تحویل دهد؛ خروجی مستقیم تصویر، صوت یا ویدیو ندارد.

Thinking قابل تنظیم

Google استفاده از سطح‌های Minimal و Low را برای کار کم‌هزینه و سطح‌های بالاتر را برای Subagentهای چندمرحله‌ای پیشنهاد می‌کند. افزایش Thinking باید با بهبود نرخ موفقیت سنجیده شود، زیرا توکن‌های استدلال در هزینه خروجی حساب می‌شوند.

ابزار و Computer Use

Function Calling، Code Execution، File Search، Search و Maps Grounding، URL Context و Computer Use در دسترس‌اند؛ Computer Use وضعیت Preview دارد. اجرای ابزار باید در Sandbox و زیر محدودیت دسترسی انجام شود.

مهم‌ترین نقاط قوت

  • سرعت بسیار بالای تولید در API مستقل اندازه‌گیری‌شده
  • قیمت پایین برای ورودی چندوجهی و Batch
  • جهش بزرگ نسبت به 3.1 Flash-Lite در Coding، Terminal و کار دانشی
  • Context یک‌میلیون‌توکنی و خروجی تا ۶۵٬۵۳۶ توکن
  • پشتیبانی از Computer Use و مجموعه کامل ابزارهای Gemini
  • مناسب برای معماری Master–Worker و پردازش موازی حجم بالا

محدودیت‌ها و نقاط ضعف

مدل Lite برای دشوارترین استدلال‌ها ساخته نشده است. در Terminal-Bench 2.1 و SWE-Bench Pro، GPT-5.4 mini در جدول رسمی کمی جلوتر است؛ در GDPVal نیز فاصله کوچکی به نفع آن دیده می‌شود.

سه معیار ارزیابی عملی برای Gemini 3.5 Flash-Lite
معیارهای پیشنهادی برای آزمون Gemini 3.5 Flash-Lite با کار واقعی؛ این تصویر دادهٔ بنچمارک یا امتیاز گزارش‌شده نیست.

Knowledge Cutoff عمدتاً مارس ۲۰۲۶ است، اما Google هشدار می‌دهد برخی حوزه‌ها ممکن است عملاً تا ژانویه ۲۰۲۵ محدود باشند. Search Grounding برای داده تازه لازم است و خود مدل ممکن است Hallucination داشته باشد.

TTFT مستقل حدود ۷٫۳۲ ثانیه برای تنظیم ارزیابی‌شده ثبت شده است. این عدد نسبت به سرعت خروجی زیاد به نظر می‌رسد و نشان می‌دهد Thinking می‌تواند پاسخ اولیه را عقب بیندازد؛ برای UI تعاملی سطح پایین‌تر را آزمایش کنید.

Computer Use هنوز Preview است و خروجی بومی رسانه یا Live API وجود ندارد. در کار انبوه، حتی خطای یک‌درصدی می‌تواند هزاران رکورد نادرست بسازد؛ Sampling، Human Review و Validation ضروری‌اند.

کاربردهای واقعی Gemini 3.5 Flash-Lite

شبکه Subagent برای پژوهش

Agent اصلی می‌تواند فهرستی از منابع را تقسیم کند و هر Worker فقط یک منبع را از نظر تاریخ، ادعا و شواهد بررسی کند. مرحله نهایی باید تعارض‌ها را جمع‌بندی و Citationها را کنترل کند.

پردازش رسید و فاکتور

تصویر یا PDF به Schema شامل فروشنده، تاریخ، ارز، اقلام و جمع تبدیل می‌شود. اختلاف جمع یا فیلد ناخوانا باید به صف بازبینی برود، نه اینکه حدس زده شود.

ترجمه Ticket در مقیاس بالا

مدل می‌تواند پیام‌های پشتیبانی را ترجمه و هم‌زمان Intent و فوریت را طبقه‌بندی کند. نام محصول و اصطلاحات باید با Glossary ثابت شوند.

برچسب‌گذاری کاتالوگ چندوجهی

تصویر و توضیح محصول کنار هم تحلیل می‌شوند تا دسته، رنگ، جنس و ریسک مرجوعی استخراج شود. Confidence Threshold می‌تواند موارد مبهم را به انسان بسپارد.

Agent سبک برای کار اداری

با Function Calling یا Computer Use محدود، مدل می‌تواند اطلاعات را از فرم بخواند و پیش‌نویس ورود داده بسازد. ثبت نهایی، پرداخت و حذف باید تأیید انسانی داشته باشند.

این مدل مناسب چه کسانی است؟

Gemini 3.5 Flash-Lite برای تیم‌های Data Operations، فروشگاه‌های آنلاین، مراکز پشتیبانی، سازندگان Agent، شرکت‌های ترجمه و محصولاتی مناسب است که میلیون‌ها درخواست کوچک و چندوجهی دارند.

اگر هر درخواست پیچیدگی زیاد، پیامد مالی یا نیاز به برنامه‌ریزی طولانی دارد، 3.6 یا 3.8 Flash و مدل‌های Pro باید به‌عنوان Master یا مسیر Escalation استفاده شوند.

مشخصات فنی Gemini 3.5 Flash-Lite

مشخصه مقدار تأییدشده
Developer Google
Model Family Gemini 3.5 Flash-Lite
Model Type مدل اختصاصی چندوجهی، استدلالی و اقتصادی
Release Date ۲۱ ژوئیه ۲۰۲۶
Lifecycle Stable در زمان بررسی
API Model ID gemini-3.5-flash-lite
Based On Gemini 3.1 Flash-Lite
Input متن، تصویر، صوت، ویدیو و PDF
Output متن
Context Window ۱٬۰۴۸٬۵۷۶ توکن ورودی
Maximum Output ۶۵٬۵۳۶ توکن
Knowledge Cutoff عمدتاً مارس ۲۰۲۶؛ برخی حوزه‌ها ممکن است ژانویه ۲۰۲۵ باشند
Thinking بله، قابل تنظیم
Vision / Audio / Video Understanding بله
Native Media Generation خیر
Tool Use Function Calling، Code Execution، File Search و ابزارهای Grounding
Web Search از طریق Google Search Grounding
Computer Use Preview
Live API خیر
API Availability Gemini API و Google AI Studio

۵ نمونه پرامپت کاربردی

۱. Worker پژوهش منبع‌محور

فقط URL اختصاص‌یافته را بررسی کن. تاریخ انتشار، سه ادعای اصلی، شواهد مستقیم و محدودیت منبع را در JSON برگردان. از هیچ منبع دیگری استفاده نکن و هر فیلد یافت‌نشده را null بگذار.

۲. استخراج فاکتور

این تصویر فاکتور را طبق Schema به JSON تبدیل کن. برای هر مقدار Confidence بده و کنترل کن جمع اقلام با مبلغ نهایی برابر باشد. عدد ناخوانا را حدس نزن و رکورد را needs_review: true علامت بزن.

۳. ترجمه پشتیبانی با Glossary

پیام را به فارسی طبیعی ترجمه کن و اصطلاحات Glossary پیوست را دقیق حفظ کن. فقط JSON شامل translation، intent و urgency برگردان؛ اطلاعات شخصی را در خلاصه تکرار نکن.

۴. برچسب‌گذاری محصول

تصویر و توضیح محصول را بررسی کن. دسته، رنگ غالب، جنس قابل مشاهده و ریسک مرجوعی را استخراج کن. میان ویژگی مشاهده‌شده و ویژگی ادعاشده در متن تمایز بگذار.

۵. Subagent کدنویسی محدود

فقط ماژول [نام ماژول] را برای علت این خطا بررسی کن. حداکثر سه فایل را باز کن، علت محتمل و یک Patch کوچک پیشنهاد بده و تست مرتبط بنویس. هیچ فایل خارج از دامنه را تغییر نده.

بنچمارک‌ها و ارزیابی عملکرد

جدول زیر از Model Card رسمی Google در ژوئیه ۲۰۲۶ است و Vendor-reported محسوب می‌شود. GPT-5.4 mini و Haiku 4.5 رقبای اقتصادی هم‌رده‌اند؛ خط تیره یعنی Google عدد قابل مقایسه منتشر نکرده است.

Benchmark Gemini 3.5 Flash-Lite Gemini 3.1 Flash-Lite GPT-5.4 mini Claude Haiku 4.5
SWE-Bench Pro ۵۴٫۲٪ ۳۸٫۳٪ ۵۴٫۴٪ ۳۹٫۵٪
Terminal-Bench 2.1 ۵۴٫۰٪ ۳۱٫۰٪ ۵۹٫۲٪ ۴۴٫۲٪
MLE-Bench ۳۹٫۲٪ ۲۲٫۰٪ — —
GDPVal-AA v2، Elo ۱۱۴۰ ۶۴۲ ۱۱۷۱ ۹۰۷
OSWorld-Verified ۷۴٫۰٪ ۵۴٫۳٪ ۷۲٫۱٪ ۵۰٫۷٪
CharXiv، بدون ابزار ۷۴٫۵٪ ۷۳٫۲٪ ۸۰٫۳٪ ۶۱٫۷٪
GDM-MRCR v2 در 128K ۷۲٫۲٪ ۶۰٫۱٪ ۴۲٫۷٪ ۳۵٫۳٪
GDM-MRCR v2 در 1M ۲۱٫۳٪ ۱۲٫۳٪ — —

جهش نسبت به 3.1 در Terminal، GDPVal و Long Context بزرگ است. مدل در OSWorld از GPT-5.4 mini جلو می‌افتد و در SWE-Pro تقریباً مساوی است؛ GPT-5.4 mini در Terminal، GDPVal و CharXiv برتری دارد. بنابراین 3.5 Flash-Lite برای Worker چندوجهی و GUI جذاب‌تر و رقیب OpenAI برای بعضی Coding Flowها قوی‌تر است.

Artificial Analysis در ارزیابی مستقل ۱۲ سپتامبر ۲۰۲۶ امتیاز ۲۳ در Intelligence Index v4.3، سرعت ۳۴۲٫۸ توکن بر ثانیه، TTFT حدود ۷٫۳۲ ثانیه و هزینه ۰٫۱۲ دلار برای هر وظیفه شاخص گزارش می‌کند. مدل در اجرای شاخص ۵۹ میلیون توکن خروجی مصرف کرده که در رده خود نسبتاً فشرده است.

سرعت مستقل نزدیک به ادعای ۳۵۰ توکن Google است و نقش پردازش انبوه را تأیید می‌کند. بااین‌حال، نمره ترکیبی ۲۳ پایین‌تر از Flashهای بزرگ‌تر است؛ بنابراین Router باید درخواست مبهم یا سخت را به مدل قوی‌تر ارتقا دهد.

برای Eval داخلی، فقط Accuracy میانگین را نسنجید. نرخ JSON معتبر، درصد رکورد نیازمند بازبینی، هزینه به‌ازای رکورد صحیح و P95 Latency معیارهای مناسب‌تری برای یک مدل Lite هستند.

مقایسه Gemini 3.5 Flash-Lite با رقبا

مدل انتخاب مناسب برای محدودیت نسبی
Gemini 3.5 Flash-Lite Worker چندوجهی، سند، ترجمه و Agent پرتعداد سقف استدلال پایین‌تر از Flash کامل
Gemini 3.1 Flash-Lite حفظ Snapshot قدیمی با هزینه خروجی کمتر کیفیت Agent و Coding به‌وضوح پایین‌تر است
GPT-5.4 mini Terminal و بعضی Workflowهای Coding در OSWorld و Context بلند جدول Google عقب‌تر است
Claude Haiku 4.5 وظایف سریع در اکوسیستم Anthropic در بیشتر اعداد جدول عرضه از 3.5 Lite پایین‌تر است
Gemini 3.8 Flash Master Agent و وظیفه پیچیده برای میلیون‌ها استخراج ساده گران‌تر و بیش‌ازنیاز است

معماری ترکیبی اغلب بهترین نتیجه را می‌دهد: 3.5 Flash-Lite برای Worker و 3.8 Flash برای برنامه‌ریزی، بررسی تعارض و Escalation. این تقسیم می‌تواند کیفیت مدل بزرگ را با هزینه نزدیک‌تر به مدل Lite ترکیب کند.

قیمت و API

قیمت عمومی بررسی‌شده در ۱۲ سپتامبر ۲۰۲۶:

  • Standard: ۰٫۳۰ دلار ورودی و ۲٫۵۰ دلار خروجی برای هر یک میلیون توکن؛ نرخ ورودی برای متن، تصویر، ویدیو و صوت یکسان اعلام شده است.
  • Context Cache: ۰٫۰۳ دلار؛ ذخیره Cache برابر ۱ دلار برای هر یک میلیون توکن در ساعت
  • Batch: ۰٫۱۵ دلار ورودی و ۱٫۲۵ دلار خروجی
  • Flex: ۰٫۱۵ دلار ورودی و ۱٫۲۵ دلار خروجی
  • Priority: ۰٫۵۴ دلار ورودی و ۴٫۵۰ دلار خروجی
  • Free Tier وجود دارد؛ Grounding در Paid Tier پس از ۵٬۰۰۰ درخواست رایگان مشترک Gemini 3.x، طبق نرخ فعلی ۱۴ دلار به‌ازای ۱٬۰۰۰ Query است.

توکن‌های Thinking در قیمت خروجی محاسبه می‌شوند. برای کار انبوه، Batch یا Flex و کاهش Thinking می‌توانند هزینه را کم کنند، به شرط آنکه نرخ خطا افزایش نامطلوب نداشته باشد.

Gemini 3.5 Flash-Lite را در Buffalo147 AI امتحان کنید

یک نمونه واقعی از کار پرتعداد خود—مانند فاکتور، Ticket یا برچسب محصول—را با Schema و معیار پذیرش روشن اجرا کنید. سپس زمان، هزینه و درصد رکورد صحیح را بسنجید تا معلوم شود مدل برای لایه Worker شما مناسب است یا نه.

شروع استفاده از Gemini 3.5 Flash-Lite در Buffalo147 AI

جمع‌بندی

Gemini 3.5 Flash-Lite یکی از جذاب‌ترین مدل‌های Worker سال ۲۰۲۶ است: سریع، چندوجهی، ابزارمحور و به‌اندازه کافی توانمند برای بخش بزرگی از کارهای ساختاریافته. جهش آن نسبت به 3.1 Lite در Agent و Coding واقعی است.

محدودیت مهم، سقف استدلال و Latency اولیه Thinking است. مدل برای تصمیم‌های مبهم یا پرریسک نباید بدون Router، Validation و مسیر Escalation استفاده شود.

برای ترجمه، Document Parsing، طبقه‌بندی و Subagentهای موازی، نسبت سرعت به کیفیت آن بسیار رقابتی است. در معماری حرفه‌ای، بهترین جایگاهش اغلب زیر نظر یک Master Agent قوی‌تر است.

پرسش‌های متداول

Gemini 3.5 Flash-Lite چیست؟

مدل اقتصادی و چندوجهی Google برای پردازش انبوه، Subagent، ترجمه، استخراج داده و Workflowهای کم‌تأخیر است.

سرعت Gemini 3.5 Flash-Lite چقدر است؟

Artificial Analysis در Snapshot فعلی حدود ۳۴۲٫۸ توکن خروجی در ثانیه اندازه گرفته است؛ سرعت واقعی با طول ورودی، Thinking و بار سرویس تغییر می‌کند.

آیا Gemini 3.5 Flash-Lite برای برنامه‌نویسی خوب است؟

برای وظایف محدود و Subagent کدنویسی مناسب است و در SWE-Bench Pro رسمی ۵۴٫۲٪ گرفته، اما برای معماری یا Debug دشوار بهتر است مدل قوی‌تر نیز در چرخه باشد.

آیا این مدل Computer Use دارد؟

بله، مستندات فعلی Computer Use را با وضعیت Preview ثبت می‌کنند. عملیات حساس باید محدود و تأیید شوند.

تفاوت 3.5 Flash-Lite با 3.5 Flash چیست؟

نسخه Lite برای سرعت، هزینه و حجم بالا بهینه شده؛ Flash کامل سقف استدلال و Agent بالاتری دارد و برای نقش Master مناسب‌تر است.

آیا API رایگان است؟

Free Tier وجود دارد، اما سهمیه محدود است. مصرف بیشتر، Cache و ابزارهای Grounding طبق جدول رسمی هزینه دارند.

منابع

یادداشت تحریریه Buffalo147 AI: جدول مقایسه Google، Vendor-reported است. سرعت و Intelligence Index مستقل با Snapshot جاری Artificial Analysis جداگانه ارائه شده‌اند.

خواندنی‌های دیگر