Gemini 3.1 Flash-Lite؛ مدل اقتصادی Google برای ترجمه، Transcription و Routing
آخرین راستیآزمایی: ۱۲ سپتامبر ۲۰۲۶
تاریخ عرضه: ۳ مارس ۲۰۲۶
قیمت و شیوهٔ محاسبه: Standard ورودی متن، تصویر و ویدیو: ۰٫۲۵ دلار برای هر یک میلیون توکن؛ Standard خروجی، شامل Thinking: ۱٫۵۰ دلار تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.
مقدمه
انتخاب مدل هوش مصنوعی همیشه به معنای انتخاب بالاترین امتیاز نیست. گاهی محصول باید در هر ثانیه هزاران پیام را ترجمه، فایل صوتی را رونویسی یا درخواستها را میان مدلهای دیگر مسیریابی کند. در این شرایط، هر صدم دلار و هر ثانیه Latency اهمیت دارد.
Gemini 3.1 Flash-Lite برای همین دسته ساخته شد. Google آن را در زمان عرضه سریعترین و اقتصادیترین مدل سری Gemini 3 مینامید و نمونههای رسمیاش بر ترجمه، Transcription، استخراج داده، خلاصهسازی سند و Model Routing تمرکز داشتند.
امروز 3.5 Flash-Lite جانشین قویتر آن است، اما 3.1 هنوز شناسه Stable دارد و قیمت خروجی پایینتری ارائه میکند. ارزش مدل به این بستگی دارد که وظیفه شما چقدر ساده، پرتعداد و حساس به هزینه است.
معرفی کامل Gemini 3.1 Flash-Lite
Gemini 3.1 Flash-Lite در ۳ مارس ۲۰۲۶ ابتدا بهصورت Preview عرضه شد و اکنون در مستندات رسمی با شناسه Stable gemini-3.1-flash-lite فهرست شده است. مدل بر پایه Gemini 3 Pro ساخته شده، اما برای حجم زیاد و تأخیر کم بهینه شده است.

جایگاه آن در خانواده، پایینتر از Flash کامل و Pro از نظر سقف توان و پایینتر از 3.5 Flash-Lite از نظر نسل است. در عوض، نرخ Standard برابر ۰٫۲۵ دلار ورودی متنی/تصویری/ویدیویی و ۱٫۵۰ دلار خروجی، آن را برای Pipelineهای پرتعداد قابل توجه میکند.
دسترسی از طریق Gemini API، Google AI Studio، Vertex AI و طبق Model Card بعضی محصولات Google فراهم است. نوع نمایش مدل در محصول مصرفکننده و سهمیه آن ممکن است با API متفاوت باشد.
قابلیتهای اصلی
ترجمه سریع و کنترلشده
System Instruction میتواند مدل را به خروجی صرفاً ترجمهشده محدود کند. برای مقیاس حرفهای، Glossary، حفظ Placeholder و تست نامهای خاص ضروری است؛ زیرا سرعت بالا خطای اصطلاح را بیاهمیت نمیکند.
Transcription بدون Pipeline جداگانه
فایل صوتی مستقیماً به مدل داده میشود و خروجی متن است. این روش برای Voice Note، جلسه و محتوای کوتاه ساده است، اما قابلیتهای تخصصی مانند Diarization یا Timestamp کلمهبهکلمه باید در Eval بررسی شوند و برای نیاز دقیق ممکن است مدل Transcribe اختصاصی بهتر باشد.
Model Routing
3.1 Flash-Lite میتواند پیچیدگی درخواست را طبقهبندی و آن را به Flash یا Pro هدایت کند. Google اشاره میکند Gemini CLI نیز از الگویی مشابه برای تشخیص پیچیدگی استفاده میکند. Router باید قابل ممیزی باشد و خطای False Negative—ارسال کار سخت به مدل کوچک—اندازهگیری شود.
استخراج داده و JSON
Structured Outputs برای استخراج Entity، Sentiment، Risk و فیلدهای سند مناسب است. JSON معتبر بهتنهایی معنای داده صحیح نیست؛ Range، Enum و قواعد کسبوکار باید جدا اعتبارسنجی شوند.
ورودی چندوجهی و Context بزرگ
متن، تصویر، صوت، ویدیو و PDF با سقف ورودی یکمیلیون توکن پشتیبانی میشوند. مدل خروجی متنی تا ۶۵٬۵۳۶ توکن دارد و رسانه تولید نمیکند.
Thinking و ابزارها
Thinking قابل تنظیم، Function Calling، Code Execution، File Search، Search و Maps Grounding و URL Context پشتیبانی میشوند. برخلاف 3.5 Flash-Lite، Computer Use برای این مدل پشتیبانی نمیشود و Live API نیز ندارد.
مهمترین نقاط قوت
- قیمت پایین برای ترجمه، Routing و استخراج پرتعداد
- سرعت خروجی بالا در ارزیابیهای رسمی و مستقل
- ورودی مستقیم صوت برای Transcription ساده
- Context یکمیلیونتوکنی و پشتیبانی از PDF و ویدیو
- Structured Output و Function Calling برای Pipeline تولید
- عملکرد چندوجهی و علمی قوی نسبت به رده قیمت در زمان عرضه
محدودیتها و نقاط ضعف
3.5 Flash-Lite در Coding، Agent و Long Context پیشرفت بزرگی دارد. اگر اختلاف ۱ دلار در هر میلیون توکن خروجی تعیینکننده نیست، جانشین جدیدتر غالباً کیفیت بیشتری ارائه میدهد.

Computer Use پشتیبانی نمیشود و مدل خروجی تصویر، صوت یا ویدیو ندارد. برای مکالمه صوتی بلادرنگ نیز Live API این شناسه در دسترس نیست.
Knowledge Cutoff در ارزیابی مستقل ژانویه ۲۰۲۵ ثبت شده است. Model Card رسمی تاریخ دقیق جداگانهای اعلام نمیکند؛ بنابراین اطلاعات تازه باید با Grounding تأمین شوند و نباید تاریخ فراتر را حدس زد.
Artificial Analysis این نسخه را بهدلیل وجود 3.5 Flash-Lite در Tracker خود Deprecated علامت زده و فقط Workload پیشفرض 10K را بهروز نگه میدارد. این برچسب به معنای حذف از Gemini API نیست؛ مستندات Google همچنان شناسه Stable را نشان میدهند.
کاربردهای واقعی Gemini 3.1 Flash-Lite
ترجمه پیام و Review
میتوان پیامهای چت یا نظرهای فروشگاه را به زبان مقصد ترجمه و همزمان موضوع و لحن را برچسبگذاری کرد. داده شخصی باید پیش از پردازش مدیریت شود.
رونویسی Voice Note
فایل صوتی کوتاه به متن و فهرست اقدام تبدیل میشود. برای جلسه چندنفره، تشخیص گوینده و Timestamp دقیق را جدا آزمایش کنید.
Router چندمدلی
درخواست مشخص و کوتاه به Flash-Lite، کار چندمرحلهای به Flash و مسئله پیچیده به Pro هدایت میشود. یک مسیر بازگشت برای پاسخ نامطمئن یا شکست ابزار لازم است.
Triage اسناد ورودی
PDFهای ورودی بر اساس نوع، زبان، فوریت و وجود فیلدهای الزامی دستهبندی میشوند. فایل مبهم یا ناقص به صف انسانی میرود.
تحلیل Review محصول
Aspect، Sentiment، نقل کوتاه و ریسک مرجوعی از متن Review استخراج میشود. این کاربرد با نمونه رسمی Developer Guide همراستاست.
این مدل مناسب چه کسانی است؟
Gemini 3.1 Flash-Lite برای تیمهای Localization، پشتیبانی، فروشگاه آنلاین، Document Operations و سازندگان Gateway چندمدلی مناسب است که حجم زیاد و بودجه محدود دارند.
برای Agentهای دارای GUI، از 3.5 Flash-Lite یا مدل سازگار با Computer Use استفاده کنید. برای کدنویسی پیچیده، تحلیل راهبردی یا خروجی با ریسک بالا نیز Escalation به Flash کامل یا Pro لازم است.
مشخصات فنی Gemini 3.1 Flash-Lite
| مشخصه | مقدار تأییدشده |
|---|---|
| Developer | |
| Model Family | Gemini 3.1 Flash-Lite |
| Model Type | مدل اختصاصی چندوجهی، استدلالی و اقتصادی |
| Release Date | ۳ مارس ۲۰۲۶ |
| Lifecycle | Stable در Google API؛ جانشین 3.5 Flash-Lite موجود است |
| API Model ID | gemini-3.1-flash-lite |
| Based On | Gemini 3 Pro |
| Input | متن، تصویر، صوت، ویدیو و PDF |
| Output | متن |
| Context Window | ۱٬۰۴۸٬۵۷۶ توکن ورودی |
| Maximum Output | ۶۵٬۵۳۶ توکن |
| Knowledge Cutoff | Google تاریخ دقیق جداگانه اعلام نکرده؛ Tracker مستقل ژانویه ۲۰۲۵ ثبت کرده است |
| Thinking | بله، قابل تنظیم |
| Vision / Audio / Video Understanding | بله |
| Native Media Generation | خیر |
| Tool Use | Function Calling، Code Execution، File Search و ابزارهای Grounding |
| Web Search | از طریق Google Search Grounding |
| Computer Use | خیر |
| Live API | خیر |
| API Availability | Gemini API، Google AI Studio و Vertex AI |
۵ نمونه پرامپت کاربردی
۱. ترجمه با Glossary
متن را به فارسی روان ترجمه کن. اصطلاحات Glossary و Placeholderهای داخل
{}را بدون تغییر نگه دار. فقط متن ترجمهشده را خروجی بده و هیچ توضیح اضافه ننویس.
۲. Transcription و اقدامها
این Voice Note را رونویسی کن. بخش نامطمئن را با
[نامفهوم]علامت بزن و سپس فقط موارد اقدام، مسئول و موعدی را که صریحاً گفته شده در JSON جدا کن؛ اطلاعات نگفتهشده را حدس نزن.
۳. Router مدل
درخواست را طبق Rubric به
LITE،FLASHیاPROطبقهبندی کن. تعداد گام، نیاز به ابزار، ابهام و ریسک را بسنج. فقط JSON شاملroute،reason_shortوconfidenceبرگردان.
۴. Triage فایل PDF
این PDF را بدون خلاصه طولانی طبقهبندی کن. نوع سند، زبان، تاریخ، فیلدهای مفقود و فوریت را طبق Schema برگردان. اگر کیفیت اسکن پایین است،
manual_reviewرا true کن.
۵. تحلیل Review
Review مشتری را به Aspectهای جدا تقسیم کن. برای هر Aspect امتیاز احساس ۱ تا ۵، عبارت شاهد کوتاه و ریسک مرجوعی را بده. درباره ویژگیای که در متن نیست چیزی نساز.
بنچمارکها و ارزیابی عملکرد
جدول زیر بخشی از Model Card Google در مارس ۲۰۲۶ است و Vendor-reported محسوب میشود. تنظیم 3.1 Flash-Lite برابر High است و تنظیم رقبا در عنوان Model Card متفاوت؛ بنابراین اعداد را فقط با درنظرگرفتن ستون و Harness بخوانید.
| Benchmark | Gemini 3.1 Flash-Lite | Gemini 2.5 Flash Dynamic | GPT-5 mini High | Claude Haiku 4.5 ET | Grok 4.1 Fast Reasoning |
|---|---|---|---|---|---|
| Output Speed، توکن/ثانیه | ۳۶۳ | ۲۴۹ | ۷۱ | ۱۰۸ | ۱۴۵ |
| Humanity’s Last Exam، بدون ابزار | ۱۶٫۰٪ | ۱۱٫۰٪ | ۱۶٫۷٪ | ۹٫۷٪ | ۱۷٫۶٪ |
| GPQA Diamond | ۸۶٫۹٪ | ۸۲٫۸٪ | ۸۲٫۳٪ | ۷۳٫۰٪ | ۸۴٫۳٪ |
| MMMU-Pro | ۷۶٫۸٪ | ۶۶٫۷٪ | ۷۴٫۱٪ | ۵۸٫۰٪ | ۶۳٫۰٪ |
| Video-MMMU | ۸۴٫۸٪ | ۷۹٫۲٪ | ۸۲٫۵٪ | — | ۷۴٫۶٪ |
| MMMLU چندزبانه | ۸۸٫۹٪ | ۸۶٫۶٪ | ۸۴٫۹٪ | ۸۳٫۰٪ | ۸۶٫۸٪ |
| LiveCodeBench | ۷۲٫۰٪ | ۶۲٫۶٪ | ۸۰٫۴٪ | ۵۳٫۲٪ | ۷۶٫۵٪ |
| MRCR v2 در 128K | ۶۰٫۱٪ | ۵۴٫۳٪ | ۵۲٫۵٪ | ۳۵٫۳٪ | ۵۴٫۶٪ |
3.1 Flash-Lite در سرعت، GPQA، MMMU، Video-MMMU، چندزبانه و MRCR بهترین عدد جدول را دارد. GPT-5 mini و Grok در HLE و LiveCodeBench جلو میافتند؛ پس مدل Google برای پردازش چندوجهی و حجم بالا جذابتر از حل سختترین مسئله کدنویسی است.
در Snapshot مستقل ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis امتیاز ۱۶ در Intelligence Index v4.3، سرعت ۲۹۲٫۶ توکن بر ثانیه، TTFT حدود ۵٫۶۵ ثانیه و هزینه ۰٫۰۴ دلار برای هر وظیفه شاخص ثبت کرده است. مصرف کل خروجی شاخص ۵۴ میلیون توکن بوده است.
عدد سرعت مستقل فعلی از ۳۶۳ زمان عرضه پایینتر است. این تناقض نیست؛ بار زیرساخت، طول ورودی، روش اندازهگیری و Snapshot زمانی متفاوتاند. برای ظرفیتسنجی، P50 و P95 سرویس خود را اندازه بگیرید.
جانشین 3.5 Flash-Lite در شاخص مستقل امتیاز ۲۳ و سرعت بالاتری دارد، اما قیمت خروجیاش ۲٫۵۰ دلار است. بنابراین 3.1 برای وظیفهای که امتیاز ۱۶ کافی است، هنوز میتواند هزینه کمتر داشته باشد.
مقایسه Gemini 3.1 Flash-Lite با رقبا
| مدل | بهترین سناریو | ملاحظه |
|---|---|---|
| Gemini 3.1 Flash-Lite | ترجمه، Routing، Transcription ساده و JSON پرتعداد | Agent و Coding ضعیفتر از نسل 3.5 |
| Gemini 3.5 Flash-Lite | Worker پیچیدهتر، Computer Use و سند دشوار | خروجی گرانتر است |
| GPT-5 mini | LiveCodeBench و بعضی استدلالهای دشوارتر | در جدول عرضه کندتر و Context کوچکتر است |
| Claude Haiku 4.5 | Workflowهای سریع Anthropic | قیمت بیشتر و چند امتیاز رسمی پایینتر |
| Grok 4.1 Fast | HLE و Coding بهتر در جدول زمان عرضه | سرعت و فهم چندوجهی 3.1 Flash-Lite بالاتر گزارش شده است |
اگر Router میسازید، میتوانید خود 3.1 را بهعنوان لایه اول نگه دارید و فقط درخواستهای سخت را بالا ببرید. هزینه واقعی این معماری به دقت Routing وابسته است، نه صرفاً قیمت مدل کوچک.
قیمت و API
قیمت بررسیشده در ۱۲ سپتامبر ۲۰۲۶:
- Standard ورودی متن، تصویر و ویدیو: ۰٫۲۵ دلار برای هر یک میلیون توکن
- Standard ورودی صوت: ۰٫۵۰ دلار
- Standard خروجی، شامل Thinking: ۱٫۵۰ دلار
- Context Cache: ۰٫۰۲۵ دلار برای متن/تصویر/ویدیو و ۰٫۰۵ دلار برای صوت؛ Storage برابر ۱ دلار برای هر یک میلیون توکن در ساعت
- Batch و Flex: ۰٫۱۲۵ دلار ورودی متن/تصویر/ویدیو، ۰٫۲۵ دلار صوت و ۰٫۷۵ دلار خروجی
- Priority: ۰٫۴۵ دلار ورودی متن/تصویر/ویدیو، ۰٫۹۰ دلار صوت و ۲٫۷۰ دلار خروجی
- Free Tier موجود است؛ Grounding پس از سهمیه رایگان مشترک هزینه جدا دارد.
برای Transcription، دوبرابر بودن نرخ ورودی صوت را در بودجه لحاظ کنید. مدل تخصصی Transcribe ممکن است برای نیازهای طولانی یا Timestamp دقیق، هزینه مؤثر متفاوتی داشته باشد.
Gemini 3.1 Flash-Lite را در Buffalo147 AI امتحان کنید
یک نمونه ترجمه، Voice Note یا درخواست Routing واقعی را اجرا کنید و خروجی را با معیار مشخص—حفظ Glossary، خطای واژه، JSON معتبر یا دقت Route—بسنجید. وظیفه کوچک و تکرارشونده بهترین آزمون این مدل است.
شروع استفاده از Gemini 3.1 Flash-Lite در Buffalo147 AI
جمعبندی
Gemini 3.1 Flash-Lite هنوز یک ابزار اقتصادی برای ترجمه، استخراج، Transcription ساده و Routing است. سرعت زیاد و ورودی چندوجهی آن، امکاناتی فراتر از یک Classifier متنی ارزان فراهم میکنند.
ضعف اصلی، فاصله کیفیت با 3.5 Flash-Lite و نبود Computer Use است. Tracker مستقل نیز آن را بهدلیل جانشین جدید Deprecated میداند، هرچند API رسمی همچنان Stable است.
اگر وظیفه روشن و پرتعداد است و 3.1 در Eval شما حد کیفیت را پاس میکند، قیمت پایینتر آن مزیت واقعی دارد. برای کار پیچیده، مدل را بهعنوان Router یا Worker نگه دارید و مسیر ارتقا تعریف کنید.
پرسشهای متداول
Gemini 3.1 Flash-Lite چیست؟
مدل چندوجهی و کمهزینه Google برای ترجمه، Transcription، استخراج داده، طبقهبندی و Routing درخواستها در حجم بالا است.
آیا Gemini 3.1 Flash-Lite هنوز فعال است؟
بله، Google آن را Stable فهرست میکند. Artificial Analysis فقط بهدلیل عرضه جانشین جدیدتر، صفحه خود را Deprecated علامت زده است.
آیا این مدل فایل صوتی را رونویسی میکند؟
بله، صوت را مستقیم دریافت و متن تولید میکند. برای Diarization یا Timestamp دقیق باید کیفیت را با مدل Transcribe تخصصی مقایسه کرد.
آیا Gemini 3.1 Flash-Lite برای Coding مناسب است؟
برای کد کوتاه و وظیفه محدود قابل استفاده است، اما 3.5 Flash-Lite و Flashهای کامل در کار Agentic Coding قویترند.
تفاوت 3.1 و 3.5 Flash-Lite چیست؟
3.5 کیفیت بالاتر، سرعت بیشتر و Computer Use دارد؛ 3.1 نرخ خروجی پایینتر و Snapshot قدیمیتر ارائه میکند.
آیا Gemini 3.1 Flash-Lite رایگان است؟
Free Tier دارد، اما سهمیه محدود است. Paid Tier بر اساس نوع ورودی، خروجی، Cache و Grounding هزینه دارد.
منابع
- مستند رسمی Gemini 3.1 Flash-Lite
- اعلام عرضه Gemini 3.1 Flash-Lite
- Model Card رسمی Gemini 3.1 Flash-Lite
- قیمت رسمی Gemini API
- ارزیابی مستقل Gemini 3.1 Flash-Lite
یادداشت تحریریه Buffalo147 AI: اعداد جدول عرضه Vendor-reported هستند. سرعت جاری و Intelligence Index از Snapshot مستقل و جدیدتر گرفته شدهاند و شرایط آزمون یکسان نیست.