Gemini 3.5 Transcribe چیست؟ بررسی کاربرد، مشخصات و محدودیتها
آخرین راستیآزمایی: ۲۶ سپتامبر ۲۰۲۶
تاریخ عرضه: روز دقیق عرضه در متن فعلی ثبت نشده است.
قیمت و شیوهٔ محاسبه: در منبع بررسیشده نرخ ثابت عمومی ثبت نشده؛ تعرفه به پلن، منطقه یا شیوهٔ مصرف وابسته است. تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.
معرفی و جایگاه مدل
Gemini 3.5 Transcribe سرویس تبدیل گفتار به متن است. مدل اصلی gemini-3.5-transcribe فایل صوتی را میگیرد و متن، برچسب گوینده و زمانبندی واژه میدهد؛ نسخه جداگانه gemini-3.5-transcribe-live برای استریم زنده عرضه شده است. این دو را در یک جدول ظرفیت مخلوط نکنید. برای تولید زیرنویس، صورتجلسه و جستوجوی آرشیو مفید است، اما خروجی خودکار جای تأیید نقلقول توسط انسان را نمیگیرد. Google تشخیص بیش از ۸۵ زبان و گفتار با جابهجایی زبان در یک قطعه را در کارت معرفی میکند.
مشخصات فنی و دسترسی
در حالت فایل، ورودی حداکثر یک ساعت است و اگر Diarization یا زمانبندی واژه فعال باشد سقف درخواست ۳۰ دقیقه میشود. کارت تشخیص گوینده تا ۸ نفر را با حالت سه نفر و بیشتر آزمایشی میداند. Custom Vocabulary تا ۱٬۰۰۰ اصطلاح پشتیبانی میشود، ولی با Diarization و Timestamps همزمان سازگار نیست. زمانبندی کلمهای در نسخه Live پشتیبانی نشده و میتواند دقت متن نسخه فایل را کاهش دهد. نشست Live طبق جدول تا ۱۰ دقیقه است. این محدودیتهای ترکیبی را قبل از طراحی Pipeline مستند کنید؛ قیمت دو endpoint را از صفحه تعرفه همان تاریخ بگیرید.

کاربردهای عملی
برای پادکست فارسی، فایل را به قطعههای قابل بازبینی با همپوشانی کوتاه تقسیم و متن خام را نگه دارید. اگر نام برندها مهمتر از گویندهها هستند، واژگان سفارشی را آزمایش کنید؛ اگر برچسب گوینده لازم است، چون ترکیب همزمان مجاز نیست آن را در گذر جدا اجرا یا انسانی تصحیح کنید. در خروجی زیرنویس، زمان هر واژه را با گوشدادن در ابتدا و پایان جمله بررسی کنید. فایلهای طولانی را بر اساس سقف یک ساعت یا ۳۰ دقیقه ویژگیدار تقسیم کنید و زمانِ آغاز قطعه را به Timestamp نهایی اضافه کنید.
بنچمارکها و روش ارزیابی
ادعای دقت در ۸۵+ زبان Vendor-reported است. WER فارسی را با لهجه، دو یا سه نفر، اصطلاح محصول و موسیقی زمینه بسنجید. یک بار بدون ویژگیهای اضافی و یک بار با Timestamps اجرا کنید تا اثر محدودیت دقت روشن شود. خطای تفکیک گوینده را جدا گزارش دهید. آزمون دستکم ۲۰ فایل با نویز محیط، لهجه، نام خاص، دو گوینده و تغییر زبان انجام دهید. نرخ خطای واژه (WER) برای رونوشت خام، تأخیر، خطای برچسب گوینده و خطای زمانبندی را جدا اندازه بگیرید. گزارش خود را با تعداد فایل، طول، زبان و شیوه پاکسازی متن کامل کنید؛ عدد اعلامی سازنده Vendor-reported است و جای آزمون فایلهای شما را نمیگیرد. متن و زمانبندی ظاهراً دقیق باید با فایل صوتی بازشنوی شود، مخصوصاً ارقام و نقلقولها.

قیمتگذاری و محدودیتها
زمانبندی واژه و Custom Vocabulary طبق جدول نمیتوانند با هم فعال باشند؛ انتخاب را بر اساس نیاز محصول انجام دهید. اگر جلسه محرمانه است، انتقال فایل، دوره نگهداری و دسترسی حساب را بررسی کنید. نسخه Live بهخاطر نشست محدود و بدون زمانبندی واژه جایگزین مستقیم پردازش آرشیوی نیست. رونویسی خودکار ممکن است جمله نامفهوم را با جمله ظاهراً معتبر پر کند. درباره جلسه محرمانه یا داده مشتری، سیاست نگهداری داده و منطقه پردازش را بررسی کنید. زمانبندی و تشخیص گوینده را بهویژه در همپوشانی صدا تصحیح کنید. نرخ دقیقه یا توکن به مسیر درخواست و روز خرید وابسته است.
مقایسه با گزینههای نزدیک
برای تصمیم میان Gemini 3.5 Transcribe و Scribe v2 و Mistral Voxtral Mini Transcribe 2، فقط نام یا نسخه را معیار قرار ندهید. اول نوع کار را یکسان کنید: رونویسی را با نرخ خطای واژه و نام خاص، گفتار مصنوعی را با تلفظ فارسی و تأخیر، و موسیقی را با انسجام قطعه و حق استفاده بسنجید. مدل زنده و مدل پردازش آفلاین ممکن است در کیفیت و تأخیر هدف متفاوتی داشته باشند؛ خروجی آنها را بدون همتراز کردن وظیفه رتبهبندی نکنید. برای تصمیم نهایی، هزینه هر دقیقه یا فایل قابلاستفاده و محدودیت دانلود و مجوز انتشار را در طرح واقعی خود بررسی کنید.
پرسشهای متداول
آیا همزمان گوینده و واژگان سفارشی دارد؟
طبق کارت مدل، این دو گزینه ناسازگارند.
فایل با زمانبندی چقدر میتواند طول بکشد؟
در این حالت تا ۳۰ دقیقه در هر درخواست.
جمعبندی
برای رونوشت فایل با برچسب و زمانبندی گزینه خوبی برای آزمون است. ناسازگاری ویژگیها و بازشنوی متن نهایی را در جریان کار لحاظ کنید.
مدلهای موجود در Buffalo147 AI را ببینید