Buffalo147 AI

خانه › بلاگ

Gemini 3.5 Live Translate چیست؟ بررسی کاربرد، مشخصات و محدودیت‌ها

جلد Gemini 3.5 Live Translate با طراحی سه‌بعدی مشکی و نور مسی

آخرین راستی‌آزمایی: ۲۶ سپتامبر ۲۰۲۶

در یک نگاه | Gemini 3.5 Live Translate
تاریخ عرضه: روز دقیق عرضه در متن فعلی ثبت نشده است.
قیمت و شیوهٔ محاسبه: در منبع بررسی‌شده نرخ ثابت عمومی ثبت نشده؛ تعرفه به پلن، منطقه یا شیوهٔ مصرف وابسته است. تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.

معرفی و جایگاه مدل

Gemini 3.5 Live Translate مدل پیش‌نمایش ترجمه گفتار به گفتار Google برای مکالمه کم‌تأخیر است. برخلاف رونویسی Gemini 3.5 Transcribe، هدف آن شنیدن صحبت به یک زبان و تولید صدای ترجمه‌شده با متن همراه است. برای خدمات پشتیبانی چندزبانه یا گفت‌وگوی راه‌دور مناسب آزمون است، ولی روان بودن صدا مساوی درستی نام، اصطلاح تخصصی یا دستور نیست. جفت زبان و رضایت شرکت‌کنندگان را پیش از شروع جلسه مشخص کنید؛ ترجمه هم‌زمان ممکن است با تأخیر و بازنویسی جزئی همراه باشد.

مشخصات فنی و دسترسی

شناسه gemini-3.5-live-translate-preview و مسیر Live API است؛ ورودی گفتار و خروجی گفتار ترجمه‌شده و متن رونوشت است. راهنمای Live Translation پوشش بیش از ۷۰ زبان را اعلام می‌کند؛ این عدد دلیل یکسان بودن کیفیت همه جفت‌ها نیست. کارت مدل زمینه ورودی ۱۳۱٬۰۷۲ و خروجی ۶۵٬۵۳۶ توکن نشان می‌دهد، اما محدودیت نشست، قطع ارتباط و هزینه صوت را از مستند Live جدا بخوانید. قابلیت‌هایی مانند Function Calling، Grounding و Batch در این کارت پشتیبانی نمی‌شوند. جهت ترجمه را در تنظیمات صریح تعیین کنید.

شماتیک روند ورودی، مدل و خروجی برای Gemini 3.5 Live Translate
نمای شماتیک روند درخواست تا خروجی برای Gemini 3.5 Live Translate؛ قابلیت‌های دقیق در متن مقاله آمده‌اند.

کاربردهای عملی

برای تماس پشتیبانی، ابتدا با گفت‌وگوی آزمایشی کوتاه فارسی و زبان مقصد اتصال WebSocket، میکروفن و بلندگو را کنترل کنید. بخشی از مکالمه را با متن و صدای اصلی کنار ترجمه ذخیره کنید تا اشتباه اصطلاح برند قابل تشخیص باشد. هنگام تغییر گوینده یا سکوت طولانی، شروع نوبت جدید را بررسی کنید و در محیط شلوغ از هدفون یا حذف بازخورد استفاده کنید. در مکالمه حساس مالی و درمانی، مترجم انسانی را در حلقه بازبینی نگه دارید. کیفیت گفتار طبیعی را در صدای واقعی هر دو سوی تماس بشنوید.

بنچمارک‌ها و روش ارزیابی

تجربه «ترجمه روان و دقیق» در معرفی گوگل ادعای سازنده است. برای مجموعه‌ای از جفت زبان‌ها، خطای معنایی، جابه‌جایی اعداد، حفظ نام خاص و تأخیر از پایان عبارت تا شروع صدای مقصد را اندازه بگیرید. زبان مبدأ و مقصد، سرعت حرف‌زدن و وجود صدای پس‌زمینه را ثبت کنید. در آزمون واقعی، حداقل ۳۰ جمله با نام خاص، عدد، سکوت، تغییر زبان و گوینده ضبط کنید. میزان درست‌بودن محتوا را با متن مرجع و بازبینی انسانی، تأخیر اولین پاسخ و انتهای نوبت، قطع‌ شدن گفتار، تداوم صدا و بهای هر دقیقه مکالمه قابل‌استفاده گزارش دهید. ادعاهای کیفی صفحه سازنده Vendor-reported است؛ تا اجرای مستقل در زبان و محیط هدف، آن را امتیاز قطعی فارسی یا رتبه عمومی نخوانید. برای مقایسه با مدل‌های Batch، تأخیر شبکه و پردازش قطعه‌های زنده را یکسان‌سازی کنید.

سه معیار ارزیابی عملی برای Gemini 3.5 Live Translate
معیارهای پیشنهادی برای آزمون Gemini 3.5 Live Translate با کار واقعی؛ این تصویر دادهٔ بنچمارک یا امتیاز گزارش‌شده نیست.

قیمت‌گذاری و محدودیت‌ها

پیش‌نمایش بودن مدل و وابستگی به استریم برای اپلیکیشن تولیدی باید مدیریت شود. متن رونوشت ممکن است با صدای ترجمه‌شده اندکی تفاوت داشته باشد و در لحظه تغییر کند. قیمت و سقف صوت ورودی و خروجی را در حساب عملی بررسی کنید؛ از محدودیت تعداد توکن کارت، مدت جلسه قطعی نتیجه نگیرید. استریم زنده به اتصال پایدار، مدیریت قطع و وصل، مرزبندی نوبت و رضایت برای ضبط صدا نیاز دارد. هر جا فهم گفتار یا ترجمه بر تصمیم انسانی اثر می‌گذارد، امکان بازپخش متن و انتقال به اپراتور فراهم کنید. محدودیت Preview و سقف استفاده ممکن است عوض شود؛ نرخ‌های امروز را از صفحه قیمت و محدودیت حساب خود بخوانید.

مقایسه با گزینه‌های نزدیک

برای تصمیم میان Gemini 3.5 Live Translate و Gemini 3.1 Flash Live، فقط نام یا نسخه را معیار قرار ندهید. اول نوع کار را یکسان کنید: رونویسی را با نرخ خطای واژه و نام خاص، گفتار مصنوعی را با تلفظ فارسی و تأخیر، و موسیقی را با انسجام قطعه و حق استفاده بسنجید. مدل زنده و مدل پردازش آفلاین ممکن است در کیفیت و تأخیر هدف متفاوتی داشته باشند؛ خروجی آن‌ها را بدون هم‌تراز کردن وظیفه رتبه‌بندی نکنید. برای تصمیم نهایی، هزینه هر دقیقه یا فایل قابل‌استفاده و محدودیت دانلود و مجوز انتشار را در طرح واقعی خود بررسی کنید.

پرسش‌های متداول

خروجی صوت است یا متن؟

هر دو؛ گفتار ترجمه‌شده و رونوشت متنی.

آیا همان Gemini 3.5 Transcribe است؟

خیر؛ Transcribe گفتار را به متن تبدیل می‌کند و این مدل گفتار ترجمه‌شده می‌سازد.

جمع‌بندی

برای مکالمه چندزبانه کم‌تأخیر ارزش آزمایش دارد. نرخ خطای ترجمه و تأخیر واقعی را برای جفت زبان و محیط خود بسنجید.

مدل‌های موجود در Buffalo147 AI را ببینید

منابع رسمی

خواندنی‌های دیگر