Gemini 3.1 Flash TTS چیست؟ بررسی کاربرد، مشخصات و محدودیتها
آخرین راستیآزمایی: ۲۶ سپتامبر ۲۰۲۶
تاریخ عرضه: روز دقیق عرضه در متن فعلی ثبت نشده است.
قیمت و شیوهٔ محاسبه: در منبع بررسیشده نرخ ثابت عمومی ثبت نشده؛ تعرفه به پلن، منطقه یا شیوهٔ مصرف وابسته است. تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.
معرفی و جایگاه مدل
Gemini 3.1 Flash TTS Preview متن را به گفتار تبدیل میکند و برای کنترل لحن در روایت از Prompt و برچسبهای صوتی بهره میبرد. در بهروزرسانی رسمی ۲۴ سپتامبر ۲۰۲۶، Google آن را Legacy Preview توصیف کرده و برای پروژه جدید مهاجرت به Gemini 3.8 Flash TTS یا Flash-Lite TTS را توصیه میکند. مقاله این نسخه برای آشنایی و نگهداری پروژههای موجود است. آن را با Gemini 3.1 Flash Live که مکالمه دوطرفه و ورودی صوتی دارد یکی ندانید؛ کارت TTS ورودی متن و خروجی صوت را نشان میدهد.
مشخصات فنی و دسترسی
شناسه gemini-3.1-flash-tts-preview، سقف ورودی ۸٬۱۹۲ توکن و سقف خروجی ۱۶٬۳۸۴ توکن در کارت مدل آمده است. Streaming برای مدلهای TTS از نسخه 3.1 به بعد پشتیبانی میشود، اما خود این شناسه در Live API طبق کارت پشتیبانی ندارد؛ جریان خروجی TTS را با نشست گفتوگوی Live اشتباه نگیرید. قابلیت Batch در کارت پشتیبانی میشود. برای لحن و بیان، متن و Audio Tag را طبق راهنمای Speech Generation بنویسید و صدای خروجی را در فایل موردنظر ذخیره کنید. در مهاجرت، قالب پیشفرض نسخه جدید ممکن است WAV دارای Header باشد، درحالیکه خروجی قدیمی PCM خام بوده است.

کاربردهای عملی
برای نریشن ویدیوی کوتاه، متن را به بندهای منطقی بشکنید، تلفظ اسم برند و عدد را با چند نوشتار امتحان کنید و لحن موردنیاز را با برچسبهایی که مستند پشتیبانی میکند تعیین کنید. هر خروجی را گوش دهید، سکوت اول و آخر را پاک کنید و میزان صدا را در تدوین یکسان کنید. در پروژه Legacy، هنگام مهاجرت به Gemini 3.8 TTS، کد نوشتن فایل را با نمونه WAV و PCM جدا تست کنید تا فایل دوبار Header نگیرد. اگر واکنش زنده Agent لازم است، محدودیت Preview و تأخیر را در برابر مدل Live ارزیابی کنید.
بنچمارکها و روش ارزیابی
توصیف طبیعیبودن و کنترل لحن ادعای سازنده است. برای متن فارسی همراه اعداد، حروف انگلیسی و علائم مکث تست شنیداری کور انجام دهید و سازگاری لحن را در سه اجرای یک متن ثبت کنید. خطای فایل خروجی در مهاجرت فرمت را جدا از کیفیت مدل گزارش کنید. برای مقایسه عملی، همان متنهای خبری، تبلیغاتی و گفتوگویی را با سه نوع لحن اجرا کنید. تلفظ نام فارسی و انگلیسی، مکث، سرعت گفتار، فهمپذیری، ثبات گوینده در چند برداشت و زمان رسیدن اولین قطعه را با داور فارسیزبان بسنجید. نرخ خروجی خطا یا بریدهشده و هزینه هر دقیقه صدای پذیرفتهشده را نیز اضافه کنید. دادههای نمایش دادهشده از طرف سازنده Vendor-reported هستند؛ برای یک نام مدل معین، نسخه، قالب فایل و صدای انتخابی را نگه دارید.

قیمتگذاری و محدودیتها
از عدد سقف توکن نمیتوان طول قطعی گفتار بدون وقفه را نتیجه گرفت. قیمت Batch و حالت تعاملی ممکن است متفاوت باشد. برچسب Legacy Preview به معنی خاموششدن اعلامشده در همین لحظه نیست، اما ریسک برنامهریزی دارد؛ تاریخ Deprecation را دنبال کنید. رضایت صاحب صدای مرجع و حقوق متن پیش از انتشار لازم است. صدای مصنوعی میتواند نام، عدد و عبارات حساس را اشتباه بیان کند؛ گوشدادن قبل از انتشار ضروری است. استفاده از صدای شخصیت واقعی بدون رضایت مجاز نیست. بسته به سرویس، قیمت ورودی متن، خروجی صوت و سهمیه Batch فرق دارد و یک عدد کلی برای همه حالتها دقیق نیست. قالب فایل، نرخ نمونهبرداری و حق استفاده تجاری را در همان مسیر تولید بررسی کنید.
مقایسه با گزینههای نزدیک
برای تصمیم میان Gemini 3.1 Flash TTS و Qwen3-TTS-Flash و Eleven Flash v2.5، فقط نام یا نسخه را معیار قرار ندهید. اول نوع کار را یکسان کنید: رونویسی را با نرخ خطای واژه و نام خاص، گفتار مصنوعی را با تلفظ فارسی و تأخیر، و موسیقی را با انسجام قطعه و حق استفاده بسنجید. مدل زنده و مدل پردازش آفلاین ممکن است در کیفیت و تأخیر هدف متفاوتی داشته باشند؛ خروجی آنها را بدون همتراز کردن وظیفه رتبهبندی نکنید. برای تصمیم نهایی، هزینه هر دقیقه یا فایل قابلاستفاده و محدودیت دانلود و مجوز انتشار را در طرح واقعی خود بررسی کنید.
پرسشهای متداول
آیا هنوز مدل پیشنهادی برای پروژه تازه است؟
خیر؛ گوگل مهاجرت به 3.8 Flash TTS یا 3.8 Flash-Lite TTS را پیشنهاد میکند.
آیا به Live API متصل میشود؟
در کارت این نسخه Live API پشتیبانی نشده است.
جمعبندی
برای پروژه موجود قابل مستندسازی است؛ مسیر جایگزین 3.8 و فرمت فایل را قبل از گسترش تولید آزمایش کنید.
مدلهای موجود در Buffalo147 AI را ببینید