Buffalo147 AI

خانه › بلاگ

Gemini 3.1 Flash-Lite؛ مدل اقتصادی Google برای ترجمه، Transcription و Routing

نام واضح Gemini 3.1 Flash-Lite کنار مسیر سریع ترجمه، صوت و Routing با نور مسی روی زمینه تیره

آخرین راستی‌آزمایی: ۱۲ سپتامبر ۲۰۲۶

در یک نگاه | Gemini 3.1 Flash-Lite
تاریخ عرضه: ۳ مارس ۲۰۲۶
قیمت و شیوهٔ محاسبه: Standard ورودی متن، تصویر و ویدیو: ۰٫۲۵ دلار برای هر یک میلیون توکن؛ Standard خروجی، شامل Thinking: ۱٫۵۰ دلار تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.

مقدمه

انتخاب مدل هوش مصنوعی همیشه به معنای انتخاب بالاترین امتیاز نیست. گاهی محصول باید در هر ثانیه هزاران پیام را ترجمه، فایل صوتی را رونویسی یا درخواست‌ها را میان مدل‌های دیگر مسیریابی کند. در این شرایط، هر صدم دلار و هر ثانیه Latency اهمیت دارد.

Gemini 3.1 Flash-Lite برای همین دسته ساخته شد. Google آن را در زمان عرضه سریع‌ترین و اقتصادی‌ترین مدل سری Gemini 3 می‌نامید و نمونه‌های رسمی‌اش بر ترجمه، Transcription، استخراج داده، خلاصه‌سازی سند و Model Routing تمرکز داشتند.

امروز 3.5 Flash-Lite جانشین قوی‌تر آن است، اما 3.1 هنوز شناسه Stable دارد و قیمت خروجی پایین‌تری ارائه می‌کند. ارزش مدل به این بستگی دارد که وظیفه شما چقدر ساده، پرتعداد و حساس به هزینه است.

معرفی کامل Gemini 3.1 Flash-Lite

Gemini 3.1 Flash-Lite در ۳ مارس ۲۰۲۶ ابتدا به‌صورت Preview عرضه شد و اکنون در مستندات رسمی با شناسه Stable gemini-3.1-flash-lite فهرست شده است. مدل بر پایه Gemini 3 Pro ساخته شده، اما برای حجم زیاد و تأخیر کم بهینه شده است.

شماتیک روند ورودی، مدل و خروجی برای Gemini 3.1 Flash-Lite
نمای شماتیک روند درخواست تا خروجی برای Gemini 3.1 Flash-Lite؛ قابلیت‌های دقیق در متن مقاله آمده‌اند.

جایگاه آن در خانواده، پایین‌تر از Flash کامل و Pro از نظر سقف توان و پایین‌تر از 3.5 Flash-Lite از نظر نسل است. در عوض، نرخ Standard برابر ۰٫۲۵ دلار ورودی متنی/تصویری/ویدیویی و ۱٫۵۰ دلار خروجی، آن را برای Pipelineهای پرتعداد قابل توجه می‌کند.

دسترسی از طریق Gemini API، Google AI Studio، Vertex AI و طبق Model Card بعضی محصولات Google فراهم است. نوع نمایش مدل در محصول مصرف‌کننده و سهمیه آن ممکن است با API متفاوت باشد.

قابلیت‌های اصلی

ترجمه سریع و کنترل‌شده

System Instruction می‌تواند مدل را به خروجی صرفاً ترجمه‌شده محدود کند. برای مقیاس حرفه‌ای، Glossary، حفظ Placeholder و تست نام‌های خاص ضروری است؛ زیرا سرعت بالا خطای اصطلاح را بی‌اهمیت نمی‌کند.

Transcription بدون Pipeline جداگانه

فایل صوتی مستقیماً به مدل داده می‌شود و خروجی متن است. این روش برای Voice Note، جلسه و محتوای کوتاه ساده است، اما قابلیت‌های تخصصی مانند Diarization یا Timestamp کلمه‌به‌کلمه باید در Eval بررسی شوند و برای نیاز دقیق ممکن است مدل Transcribe اختصاصی بهتر باشد.

Model Routing

3.1 Flash-Lite می‌تواند پیچیدگی درخواست را طبقه‌بندی و آن را به Flash یا Pro هدایت کند. Google اشاره می‌کند Gemini CLI نیز از الگویی مشابه برای تشخیص پیچیدگی استفاده می‌کند. Router باید قابل ممیزی باشد و خطای False Negative—ارسال کار سخت به مدل کوچک—اندازه‌گیری شود.

استخراج داده و JSON

Structured Outputs برای استخراج Entity، Sentiment، Risk و فیلدهای سند مناسب است. JSON معتبر به‌تنهایی معنای داده صحیح نیست؛ Range، Enum و قواعد کسب‌وکار باید جدا اعتبارسنجی شوند.

ورودی چندوجهی و Context بزرگ

متن، تصویر، صوت، ویدیو و PDF با سقف ورودی یک‌میلیون توکن پشتیبانی می‌شوند. مدل خروجی متنی تا ۶۵٬۵۳۶ توکن دارد و رسانه تولید نمی‌کند.

Thinking و ابزارها

Thinking قابل تنظیم، Function Calling، Code Execution، File Search، Search و Maps Grounding و URL Context پشتیبانی می‌شوند. برخلاف 3.5 Flash-Lite، Computer Use برای این مدل پشتیبانی نمی‌شود و Live API نیز ندارد.

مهم‌ترین نقاط قوت

  • قیمت پایین برای ترجمه، Routing و استخراج پرتعداد
  • سرعت خروجی بالا در ارزیابی‌های رسمی و مستقل
  • ورودی مستقیم صوت برای Transcription ساده
  • Context یک‌میلیون‌توکنی و پشتیبانی از PDF و ویدیو
  • Structured Output و Function Calling برای Pipeline تولید
  • عملکرد چندوجهی و علمی قوی نسبت به رده قیمت در زمان عرضه

محدودیت‌ها و نقاط ضعف

3.5 Flash-Lite در Coding، Agent و Long Context پیشرفت بزرگی دارد. اگر اختلاف ۱ دلار در هر میلیون توکن خروجی تعیین‌کننده نیست، جانشین جدیدتر غالباً کیفیت بیشتری ارائه می‌دهد.

سه معیار ارزیابی عملی برای Gemini 3.1 Flash-Lite
معیارهای پیشنهادی برای آزمون Gemini 3.1 Flash-Lite با کار واقعی؛ این تصویر دادهٔ بنچمارک یا امتیاز گزارش‌شده نیست.

Computer Use پشتیبانی نمی‌شود و مدل خروجی تصویر، صوت یا ویدیو ندارد. برای مکالمه صوتی بلادرنگ نیز Live API این شناسه در دسترس نیست.

Knowledge Cutoff در ارزیابی مستقل ژانویه ۲۰۲۵ ثبت شده است. Model Card رسمی تاریخ دقیق جداگانه‌ای اعلام نمی‌کند؛ بنابراین اطلاعات تازه باید با Grounding تأمین شوند و نباید تاریخ فراتر را حدس زد.

Artificial Analysis این نسخه را به‌دلیل وجود 3.5 Flash-Lite در Tracker خود Deprecated علامت زده و فقط Workload پیش‌فرض 10K را به‌روز نگه می‌دارد. این برچسب به معنای حذف از Gemini API نیست؛ مستندات Google همچنان شناسه Stable را نشان می‌دهند.

کاربردهای واقعی Gemini 3.1 Flash-Lite

ترجمه پیام و Review

می‌توان پیام‌های چت یا نظرهای فروشگاه را به زبان مقصد ترجمه و هم‌زمان موضوع و لحن را برچسب‌گذاری کرد. داده شخصی باید پیش از پردازش مدیریت شود.

رونویسی Voice Note

فایل صوتی کوتاه به متن و فهرست اقدام تبدیل می‌شود. برای جلسه چندنفره، تشخیص گوینده و Timestamp دقیق را جدا آزمایش کنید.

Router چندمدلی

درخواست مشخص و کوتاه به Flash-Lite، کار چندمرحله‌ای به Flash و مسئله پیچیده به Pro هدایت می‌شود. یک مسیر بازگشت برای پاسخ نامطمئن یا شکست ابزار لازم است.

Triage اسناد ورودی

PDFهای ورودی بر اساس نوع، زبان، فوریت و وجود فیلدهای الزامی دسته‌بندی می‌شوند. فایل مبهم یا ناقص به صف انسانی می‌رود.

تحلیل Review محصول

Aspect، Sentiment، نقل کوتاه و ریسک مرجوعی از متن Review استخراج می‌شود. این کاربرد با نمونه رسمی Developer Guide هم‌راستاست.

این مدل مناسب چه کسانی است؟

Gemini 3.1 Flash-Lite برای تیم‌های Localization، پشتیبانی، فروشگاه آنلاین، Document Operations و سازندگان Gateway چندمدلی مناسب است که حجم زیاد و بودجه محدود دارند.

برای Agentهای دارای GUI، از 3.5 Flash-Lite یا مدل سازگار با Computer Use استفاده کنید. برای کدنویسی پیچیده، تحلیل راهبردی یا خروجی با ریسک بالا نیز Escalation به Flash کامل یا Pro لازم است.

مشخصات فنی Gemini 3.1 Flash-Lite

مشخصه مقدار تأییدشده
Developer Google
Model Family Gemini 3.1 Flash-Lite
Model Type مدل اختصاصی چندوجهی، استدلالی و اقتصادی
Release Date ۳ مارس ۲۰۲۶
Lifecycle Stable در Google API؛ جانشین 3.5 Flash-Lite موجود است
API Model ID gemini-3.1-flash-lite
Based On Gemini 3 Pro
Input متن، تصویر، صوت، ویدیو و PDF
Output متن
Context Window ۱٬۰۴۸٬۵۷۶ توکن ورودی
Maximum Output ۶۵٬۵۳۶ توکن
Knowledge Cutoff Google تاریخ دقیق جداگانه اعلام نکرده؛ Tracker مستقل ژانویه ۲۰۲۵ ثبت کرده است
Thinking بله، قابل تنظیم
Vision / Audio / Video Understanding بله
Native Media Generation خیر
Tool Use Function Calling، Code Execution، File Search و ابزارهای Grounding
Web Search از طریق Google Search Grounding
Computer Use خیر
Live API خیر
API Availability Gemini API، Google AI Studio و Vertex AI

۵ نمونه پرامپت کاربردی

۱. ترجمه با Glossary

متن را به فارسی روان ترجمه کن. اصطلاحات Glossary و Placeholderهای داخل {} را بدون تغییر نگه دار. فقط متن ترجمه‌شده را خروجی بده و هیچ توضیح اضافه ننویس.

۲. Transcription و اقدام‌ها

این Voice Note را رونویسی کن. بخش نامطمئن را با [نامفهوم] علامت بزن و سپس فقط موارد اقدام، مسئول و موعدی را که صریحاً گفته شده در JSON جدا کن؛ اطلاعات نگفته‌شده را حدس نزن.

۳. Router مدل

درخواست را طبق Rubric به LITE، FLASH یا PRO طبقه‌بندی کن. تعداد گام، نیاز به ابزار، ابهام و ریسک را بسنج. فقط JSON شامل route، reason_short و confidence برگردان.

۴. Triage فایل PDF

این PDF را بدون خلاصه طولانی طبقه‌بندی کن. نوع سند، زبان، تاریخ، فیلدهای مفقود و فوریت را طبق Schema برگردان. اگر کیفیت اسکن پایین است، manual_review را true کن.

۵. تحلیل Review

Review مشتری را به Aspectهای جدا تقسیم کن. برای هر Aspect امتیاز احساس ۱ تا ۵، عبارت شاهد کوتاه و ریسک مرجوعی را بده. درباره ویژگی‌ای که در متن نیست چیزی نساز.

بنچمارک‌ها و ارزیابی عملکرد

جدول زیر بخشی از Model Card Google در مارس ۲۰۲۶ است و Vendor-reported محسوب می‌شود. تنظیم 3.1 Flash-Lite برابر High است و تنظیم رقبا در عنوان Model Card متفاوت؛ بنابراین اعداد را فقط با درنظرگرفتن ستون و Harness بخوانید.

Benchmark Gemini 3.1 Flash-Lite Gemini 2.5 Flash Dynamic GPT-5 mini High Claude Haiku 4.5 ET Grok 4.1 Fast Reasoning
Output Speed، توکن/ثانیه ۳۶۳ ۲۴۹ ۷۱ ۱۰۸ ۱۴۵
Humanity’s Last Exam، بدون ابزار ۱۶٫۰٪ ۱۱٫۰٪ ۱۶٫۷٪ ۹٫۷٪ ۱۷٫۶٪
GPQA Diamond ۸۶٫۹٪ ۸۲٫۸٪ ۸۲٫۳٪ ۷۳٫۰٪ ۸۴٫۳٪
MMMU-Pro ۷۶٫۸٪ ۶۶٫۷٪ ۷۴٫۱٪ ۵۸٫۰٪ ۶۳٫۰٪
Video-MMMU ۸۴٫۸٪ ۷۹٫۲٪ ۸۲٫۵٪ — ۷۴٫۶٪
MMMLU چندزبانه ۸۸٫۹٪ ۸۶٫۶٪ ۸۴٫۹٪ ۸۳٫۰٪ ۸۶٫۸٪
LiveCodeBench ۷۲٫۰٪ ۶۲٫۶٪ ۸۰٫۴٪ ۵۳٫۲٪ ۷۶٫۵٪
MRCR v2 در 128K ۶۰٫۱٪ ۵۴٫۳٪ ۵۲٫۵٪ ۳۵٫۳٪ ۵۴٫۶٪

3.1 Flash-Lite در سرعت، GPQA، MMMU، Video-MMMU، چندزبانه و MRCR بهترین عدد جدول را دارد. GPT-5 mini و Grok در HLE و LiveCodeBench جلو می‌افتند؛ پس مدل Google برای پردازش چندوجهی و حجم بالا جذاب‌تر از حل سخت‌ترین مسئله کدنویسی است.

در Snapshot مستقل ۱۲ سپتامبر ۲۰۲۶، Artificial Analysis امتیاز ۱۶ در Intelligence Index v4.3، سرعت ۲۹۲٫۶ توکن بر ثانیه، TTFT حدود ۵٫۶۵ ثانیه و هزینه ۰٫۰۴ دلار برای هر وظیفه شاخص ثبت کرده است. مصرف کل خروجی شاخص ۵۴ میلیون توکن بوده است.

عدد سرعت مستقل فعلی از ۳۶۳ زمان عرضه پایین‌تر است. این تناقض نیست؛ بار زیرساخت، طول ورودی، روش اندازه‌گیری و Snapshot زمانی متفاوت‌اند. برای ظرفیت‌سنجی، P50 و P95 سرویس خود را اندازه بگیرید.

جانشین 3.5 Flash-Lite در شاخص مستقل امتیاز ۲۳ و سرعت بالاتری دارد، اما قیمت خروجی‌اش ۲٫۵۰ دلار است. بنابراین 3.1 برای وظیفه‌ای که امتیاز ۱۶ کافی است، هنوز می‌تواند هزینه کمتر داشته باشد.

مقایسه Gemini 3.1 Flash-Lite با رقبا

مدل بهترین سناریو ملاحظه
Gemini 3.1 Flash-Lite ترجمه، Routing، Transcription ساده و JSON پرتعداد Agent و Coding ضعیف‌تر از نسل 3.5
Gemini 3.5 Flash-Lite Worker پیچیده‌تر، Computer Use و سند دشوار خروجی گران‌تر است
GPT-5 mini LiveCodeBench و بعضی استدلال‌های دشوارتر در جدول عرضه کندتر و Context کوچک‌تر است
Claude Haiku 4.5 Workflowهای سریع Anthropic قیمت بیشتر و چند امتیاز رسمی پایین‌تر
Grok 4.1 Fast HLE و Coding بهتر در جدول زمان عرضه سرعت و فهم چندوجهی 3.1 Flash-Lite بالاتر گزارش شده است

اگر Router می‌سازید، می‌توانید خود 3.1 را به‌عنوان لایه اول نگه دارید و فقط درخواست‌های سخت را بالا ببرید. هزینه واقعی این معماری به دقت Routing وابسته است، نه صرفاً قیمت مدل کوچک.

قیمت و API

قیمت بررسی‌شده در ۱۲ سپتامبر ۲۰۲۶:

  • Standard ورودی متن، تصویر و ویدیو: ۰٫۲۵ دلار برای هر یک میلیون توکن
  • Standard ورودی صوت: ۰٫۵۰ دلار
  • Standard خروجی، شامل Thinking: ۱٫۵۰ دلار
  • Context Cache: ۰٫۰۲۵ دلار برای متن/تصویر/ویدیو و ۰٫۰۵ دلار برای صوت؛ Storage برابر ۱ دلار برای هر یک میلیون توکن در ساعت
  • Batch و Flex: ۰٫۱۲۵ دلار ورودی متن/تصویر/ویدیو، ۰٫۲۵ دلار صوت و ۰٫۷۵ دلار خروجی
  • Priority: ۰٫۴۵ دلار ورودی متن/تصویر/ویدیو، ۰٫۹۰ دلار صوت و ۲٫۷۰ دلار خروجی
  • Free Tier موجود است؛ Grounding پس از سهمیه رایگان مشترک هزینه جدا دارد.

برای Transcription، دوبرابر بودن نرخ ورودی صوت را در بودجه لحاظ کنید. مدل تخصصی Transcribe ممکن است برای نیازهای طولانی یا Timestamp دقیق، هزینه مؤثر متفاوتی داشته باشد.

Gemini 3.1 Flash-Lite را در Buffalo147 AI امتحان کنید

یک نمونه ترجمه، Voice Note یا درخواست Routing واقعی را اجرا کنید و خروجی را با معیار مشخص—حفظ Glossary، خطای واژه، JSON معتبر یا دقت Route—بسنجید. وظیفه کوچک و تکرارشونده بهترین آزمون این مدل است.

شروع استفاده از Gemini 3.1 Flash-Lite در Buffalo147 AI

جمع‌بندی

Gemini 3.1 Flash-Lite هنوز یک ابزار اقتصادی برای ترجمه، استخراج، Transcription ساده و Routing است. سرعت زیاد و ورودی چندوجهی آن، امکاناتی فراتر از یک Classifier متنی ارزان فراهم می‌کنند.

ضعف اصلی، فاصله کیفیت با 3.5 Flash-Lite و نبود Computer Use است. Tracker مستقل نیز آن را به‌دلیل جانشین جدید Deprecated می‌داند، هرچند API رسمی همچنان Stable است.

اگر وظیفه روشن و پرتعداد است و 3.1 در Eval شما حد کیفیت را پاس می‌کند، قیمت پایین‌تر آن مزیت واقعی دارد. برای کار پیچیده، مدل را به‌عنوان Router یا Worker نگه دارید و مسیر ارتقا تعریف کنید.

پرسش‌های متداول

Gemini 3.1 Flash-Lite چیست؟

مدل چندوجهی و کم‌هزینه Google برای ترجمه، Transcription، استخراج داده، طبقه‌بندی و Routing درخواست‌ها در حجم بالا است.

آیا Gemini 3.1 Flash-Lite هنوز فعال است؟

بله، Google آن را Stable فهرست می‌کند. Artificial Analysis فقط به‌دلیل عرضه جانشین جدیدتر، صفحه خود را Deprecated علامت زده است.

آیا این مدل فایل صوتی را رونویسی می‌کند؟

بله، صوت را مستقیم دریافت و متن تولید می‌کند. برای Diarization یا Timestamp دقیق باید کیفیت را با مدل Transcribe تخصصی مقایسه کرد.

آیا Gemini 3.1 Flash-Lite برای Coding مناسب است؟

برای کد کوتاه و وظیفه محدود قابل استفاده است، اما 3.5 Flash-Lite و Flashهای کامل در کار Agentic Coding قوی‌ترند.

تفاوت 3.1 و 3.5 Flash-Lite چیست؟

3.5 کیفیت بالاتر، سرعت بیشتر و Computer Use دارد؛ 3.1 نرخ خروجی پایین‌تر و Snapshot قدیمی‌تر ارائه می‌کند.

آیا Gemini 3.1 Flash-Lite رایگان است؟

Free Tier دارد، اما سهمیه محدود است. Paid Tier بر اساس نوع ورودی، خروجی، Cache و Grounding هزینه دارد.

منابع

یادداشت تحریریه Buffalo147 AI: اعداد جدول عرضه Vendor-reported هستند. سرعت جاری و Intelligence Index از Snapshot مستقل و جدیدتر گرفته شده‌اند و شرایط آزمون یکسان نیست.

خواندنی‌های دیگر