Buffalo147 AI

خانه › بلاگ

Gemini 3.5 Transcribe چیست؟ بررسی کاربرد، مشخصات و محدودیت‌ها

جلد Gemini 3.5 Transcribe با طراحی سه‌بعدی مشکی و نور مسی

آخرین راستی‌آزمایی: ۲۶ سپتامبر ۲۰۲۶

در یک نگاه | Gemini 3.5 Transcribe
تاریخ عرضه: روز دقیق عرضه در متن فعلی ثبت نشده است.
قیمت و شیوهٔ محاسبه: در منبع بررسی‌شده نرخ ثابت عمومی ثبت نشده؛ تعرفه به پلن، منطقه یا شیوهٔ مصرف وابسته است. تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.

معرفی و جایگاه مدل

Gemini 3.5 Transcribe سرویس تبدیل گفتار به متن است. مدل اصلی gemini-3.5-transcribe فایل صوتی را می‌گیرد و متن، برچسب گوینده و زمان‌بندی واژه می‌دهد؛ نسخه جداگانه gemini-3.5-transcribe-live برای استریم زنده عرضه شده است. این دو را در یک جدول ظرفیت مخلوط نکنید. برای تولید زیرنویس، صورتجلسه و جست‌وجوی آرشیو مفید است، اما خروجی خودکار جای تأیید نقل‌قول توسط انسان را نمی‌گیرد. Google تشخیص بیش از ۸۵ زبان و گفتار با جابه‌جایی زبان در یک قطعه را در کارت معرفی می‌کند.

مشخصات فنی و دسترسی

در حالت فایل، ورودی حداکثر یک ساعت است و اگر Diarization یا زمان‌بندی واژه فعال باشد سقف درخواست ۳۰ دقیقه می‌شود. کارت تشخیص گوینده تا ۸ نفر را با حالت سه نفر و بیشتر آزمایشی می‌داند. Custom Vocabulary تا ۱٬۰۰۰ اصطلاح پشتیبانی می‌شود، ولی با Diarization و Timestamps هم‌زمان سازگار نیست. زمان‌بندی کلمه‌ای در نسخه Live پشتیبانی نشده و می‌تواند دقت متن نسخه فایل را کاهش دهد. نشست Live طبق جدول تا ۱۰ دقیقه است. این محدودیت‌های ترکیبی را قبل از طراحی Pipeline مستند کنید؛ قیمت دو endpoint را از صفحه تعرفه همان تاریخ بگیرید.

شماتیک روند ورودی، مدل و خروجی برای Gemini 3.5 Transcribe
نمای شماتیک روند درخواست تا خروجی برای Gemini 3.5 Transcribe؛ قابلیت‌های دقیق در متن مقاله آمده‌اند.

کاربردهای عملی

برای پادکست فارسی، فایل را به قطعه‌های قابل بازبینی با هم‌پوشانی کوتاه تقسیم و متن خام را نگه دارید. اگر نام برندها مهم‌تر از گوینده‌ها هستند، واژگان سفارشی را آزمایش کنید؛ اگر برچسب گوینده لازم است، چون ترکیب هم‌زمان مجاز نیست آن را در گذر جدا اجرا یا انسانی تصحیح کنید. در خروجی زیرنویس، زمان هر واژه را با گوش‌دادن در ابتدا و پایان جمله بررسی کنید. فایل‌های طولانی را بر اساس سقف یک ساعت یا ۳۰ دقیقه ویژگی‌دار تقسیم کنید و زمانِ آغاز قطعه را به Timestamp نهایی اضافه کنید.

بنچمارک‌ها و روش ارزیابی

ادعای دقت در ۸۵+ زبان Vendor-reported است. WER فارسی را با لهجه، دو یا سه نفر، اصطلاح محصول و موسیقی زمینه بسنجید. یک بار بدون ویژگی‌های اضافی و یک بار با Timestamps اجرا کنید تا اثر محدودیت دقت روشن شود. خطای تفکیک گوینده را جدا گزارش دهید. آزمون دست‌کم ۲۰ فایل با نویز محیط، لهجه، نام خاص، دو گوینده و تغییر زبان انجام دهید. نرخ خطای واژه (WER) برای رونوشت خام، تأخیر، خطای برچسب گوینده و خطای زمان‌بندی را جدا اندازه بگیرید. گزارش خود را با تعداد فایل، طول، زبان و شیوه پاک‌سازی متن کامل کنید؛ عدد اعلامی سازنده Vendor-reported است و جای آزمون فایل‌های شما را نمی‌گیرد. متن و زمان‌بندی ظاهراً دقیق باید با فایل صوتی بازشنوی شود، مخصوصاً ارقام و نقل‌قول‌ها.

سه معیار ارزیابی عملی برای Gemini 3.5 Transcribe
معیارهای پیشنهادی برای آزمون Gemini 3.5 Transcribe با کار واقعی؛ این تصویر دادهٔ بنچمارک یا امتیاز گزارش‌شده نیست.

قیمت‌گذاری و محدودیت‌ها

زمان‌بندی واژه و Custom Vocabulary طبق جدول نمی‌توانند با هم فعال باشند؛ انتخاب را بر اساس نیاز محصول انجام دهید. اگر جلسه محرمانه است، انتقال فایل، دوره نگهداری و دسترسی حساب را بررسی کنید. نسخه Live به‌خاطر نشست محدود و بدون زمان‌بندی واژه جایگزین مستقیم پردازش آرشیوی نیست. رونویسی خودکار ممکن است جمله نامفهوم را با جمله ظاهراً معتبر پر کند. درباره جلسه محرمانه یا داده مشتری، سیاست نگهداری داده و منطقه پردازش را بررسی کنید. زمان‌بندی و تشخیص گوینده را به‌ویژه در هم‌پوشانی صدا تصحیح کنید. نرخ دقیقه یا توکن به مسیر درخواست و روز خرید وابسته است.

مقایسه با گزینه‌های نزدیک

برای تصمیم میان Gemini 3.5 Transcribe و Scribe v2 و Mistral Voxtral Mini Transcribe 2، فقط نام یا نسخه را معیار قرار ندهید. اول نوع کار را یکسان کنید: رونویسی را با نرخ خطای واژه و نام خاص، گفتار مصنوعی را با تلفظ فارسی و تأخیر، و موسیقی را با انسجام قطعه و حق استفاده بسنجید. مدل زنده و مدل پردازش آفلاین ممکن است در کیفیت و تأخیر هدف متفاوتی داشته باشند؛ خروجی آن‌ها را بدون هم‌تراز کردن وظیفه رتبه‌بندی نکنید. برای تصمیم نهایی، هزینه هر دقیقه یا فایل قابل‌استفاده و محدودیت دانلود و مجوز انتشار را در طرح واقعی خود بررسی کنید.

پرسش‌های متداول

آیا هم‌زمان گوینده و واژگان سفارشی دارد؟

طبق کارت مدل، این دو گزینه ناسازگارند.

فایل با زمان‌بندی چقدر می‌تواند طول بکشد؟

در این حالت تا ۳۰ دقیقه در هر درخواست.

جمع‌بندی

برای رونوشت فایل با برچسب و زمان‌بندی گزینه خوبی برای آزمون است. ناسازگاری ویژگی‌ها و بازشنوی متن نهایی را در جریان کار لحاظ کنید.

مدل‌های موجود در Buffalo147 AI را ببینید

منابع رسمی

خواندنی‌های دیگر