Buffalo147 AI

خانه › بلاگ

Scribe v2 چیست؟ بررسی کاربرد، مشخصات و محدودیت‌ها

جلد Scribe v2 با طراحی سه‌بعدی مشکی و نور مسی

آخرین راستی‌آزمایی: ۲۶ سپتامبر ۲۰۲۶

در یک نگاه | Scribe v2
تاریخ عرضه: روز دقیق عرضه در متن فعلی ثبت نشده است.
قیمت و شیوهٔ محاسبه: در منبع بررسی‌شده نرخ ثابت عمومی ثبت نشده؛ تعرفه به پلن، منطقه یا شیوهٔ مصرف وابسته است. تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.

معرفی و جایگاه مدل

Scribe v2 مدل رونویسی فایل گفتار ElevenLabs برای زیرنویس، صورتجلسه و جست‌وجوی آرشیو است. شناسه API scribe_v2، در برابر scribe_v2_realtime برای استریم و scribe_v2_medical برای ضبط پزشکی، مسیر عمومی Batch را مشخص می‌کند. شرکت پوشش بیش از ۹۰ زبان، زمان‌بندی واژه و تفکیک گوینده را معرفی می‌کند؛ دقت جمله خاص به کیفیت ضبط و زبان وابسته است. تولید صوت توسط Eleven v3 یا Flash انجام می‌شود و Scribe خود گفتار نمی‌سازد. برای سند رسمی، بازبینی اعداد و نقل‌قول را در فرایند انتشار بگذارید.

مشخصات فنی و دسترسی

کارت مدل‌ها برای Scribe v2 ویژگی‌های Word-level Timestamp، Diarization تا ۳۲ گوینده، Keyterm Prompting تا ۱٬۰۰۰ اصطلاح، تشخیص موجودیت با ۶۵ نوع، Audio Tag پویا و ویرایش متن با دستور زبان طبیعی را فهرست می‌کند. این سقف‌ها کیفیت یکسان برچسب‌گذاری در گفت‌وگوی شلوغ را تضمین نمی‌کنند. اگر در فایل حساس تغییر متن خواسته شد، رونوشت خام را نیز برای مقایسه نگه دارید. درخواست Batch پس از دریافت فایل پردازش می‌شود؛ تأخیر آن را با Stream حدود ۱۵۰ms نسخه Realtime یکی ندانید. قیمت براساس مدت فایل و طرح را از مستند روز بخوانید.

شماتیک روند ورودی، مدل و خروجی برای Scribe v2
نمای شماتیک روند درخواست تا خروجی برای Scribe v2؛ قابلیت‌های دقیق در متن مقاله آمده‌اند.

کاربردهای عملی

برای زیرنویس ویدیوی گفت‌وگویی، فایل با صدای روشن و زمان کلیپ مشخص بدهید و واژه‌های فنی ضروری را در Keyterm قرار دهید. خروجی زمان‌دار را به فرمت زیرنویس تبدیل و برش جمله‌ها را با تماشای فیلم اصلاح کنید. برای گفت‌وگوی چند نفر، کیفیت برچسب گوینده را به‌خصوص هنگام صحبت هم‌زمان بررسی کنید. اگر ویرایش طبیعی متن را به کار می‌برید، تاریخچه تغییر را ثبت کنید تا جمله خلاف فایل اصلی وارد مقاله نشود. برای متن فارسی، چند نمونه با لهجه و اسم خاص انتخاب کنید و WER را محاسبه کنید.

بنچمارک‌ها و روش ارزیابی

شعار «دقت پیشرفته» و آمار پوشش زبان Vendor-reported است. آزمون مستقل باید WER، خطای گوینده و زمان‌بندی و نرخ اشتباه نام‌ها را با نسخه خام و پس از Keyterm نشان دهد. کیفیت با یک فایل استودیویی قابل تعمیم به تلفن و جلسه نیست. آزمون دست‌کم ۲۰ فایل با نویز محیط، لهجه، نام خاص، دو گوینده و تغییر زبان انجام دهید. نرخ خطای واژه (WER) برای رونوشت خام، تأخیر، خطای برچسب گوینده و خطای زمان‌بندی را جدا اندازه بگیرید. گزارش خود را با تعداد فایل، طول، زبان و شیوه پاک‌سازی متن کامل کنید؛ عدد اعلامی سازنده Vendor-reported است و جای آزمون فایل‌های شما را نمی‌گیرد. متن و زمان‌بندی ظاهراً دقیق باید با فایل صوتی بازشنوی شود، مخصوصاً ارقام و نقل‌قول‌ها.

سه معیار ارزیابی عملی برای Scribe v2
معیارهای پیشنهادی برای آزمون Scribe v2 با کار واقعی؛ این تصویر دادهٔ بنچمارک یا امتیاز گزارش‌شده نیست.

قیمت‌گذاری و محدودیت‌ها

رونویسی حتی با برچسب Entity کامل نیست و ممکن است داده شخصی را در متن برجسته کند. کنترل دسترسی به فایل و متن، رضایت ضبط و بازبینی نقل‌قول ضروری‌اند. تعداد ۳۲ گوینده سقف قابلیت است، نه دقت ثابت برای جلسه ۳۲ نفره. هزینه هر دقیقه در طرح و منطقه حساب تغییر می‌کند. رونویسی خودکار ممکن است جمله نامفهوم را با جمله ظاهراً معتبر پر کند. درباره جلسه محرمانه یا داده مشتری، سیاست نگهداری داده و منطقه پردازش را بررسی کنید. زمان‌بندی و تشخیص گوینده را به‌ویژه در هم‌پوشانی صدا تصحیح کنید. نرخ دقیقه یا توکن به مسیر درخواست و روز خرید وابسته است.

مقایسه با گزینه‌های نزدیک

برای تصمیم میان Scribe v2 و Gemini 3.5 Transcribe و Mistral Voxtral Mini Transcribe 2، فقط نام یا نسخه را معیار قرار ندهید. اول نوع کار را یکسان کنید: رونویسی را با نرخ خطای واژه و نام خاص، گفتار مصنوعی را با تلفظ فارسی و تأخیر، و موسیقی را با انسجام قطعه و حق استفاده بسنجید. مدل زنده و مدل پردازش آفلاین ممکن است در کیفیت و تأخیر هدف متفاوتی داشته باشند؛ خروجی آن‌ها را بدون هم‌تراز کردن وظیفه رتبه‌بندی نکنید. برای تصمیم نهایی، هزینه هر دقیقه یا فایل قابل‌استفاده و محدودیت دانلود و مجوز انتشار را در طرح واقعی خود بررسی کنید.

پرسش‌های متداول

آیا Scribe v2 پاسخ زنده می‌دهد؟

این شناسه برای رونویسی فایل است؛ Realtime مدل جداگانه دارد.

آیا گوینده و زمان واژه را مشخص می‌کند؟

هر دو قابلیت در کارت رسمی ثبت شده‌اند.

جمع‌بندی

برای آرشیو چندزبانه با زمان‌بندی کاربردی است. رونوشت خام، نقل‌قول‌ها و برچسب گوینده را انسانی بازبینی کنید.

مدل‌های موجود در Buffalo147 AI را ببینید

منابع رسمی

خواندنی‌های دیگر