Scribe v2 چیست؟ بررسی کاربرد، مشخصات و محدودیتها
آخرین راستیآزمایی: ۲۶ سپتامبر ۲۰۲۶
تاریخ عرضه: روز دقیق عرضه در متن فعلی ثبت نشده است.
قیمت و شیوهٔ محاسبه: در منبع بررسیشده نرخ ثابت عمومی ثبت نشده؛ تعرفه به پلن، منطقه یا شیوهٔ مصرف وابسته است. تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.
معرفی و جایگاه مدل
Scribe v2 مدل رونویسی فایل گفتار ElevenLabs برای زیرنویس، صورتجلسه و جستوجوی آرشیو است. شناسه API scribe_v2، در برابر scribe_v2_realtime برای استریم و scribe_v2_medical برای ضبط پزشکی، مسیر عمومی Batch را مشخص میکند. شرکت پوشش بیش از ۹۰ زبان، زمانبندی واژه و تفکیک گوینده را معرفی میکند؛ دقت جمله خاص به کیفیت ضبط و زبان وابسته است. تولید صوت توسط Eleven v3 یا Flash انجام میشود و Scribe خود گفتار نمیسازد. برای سند رسمی، بازبینی اعداد و نقلقول را در فرایند انتشار بگذارید.
مشخصات فنی و دسترسی
کارت مدلها برای Scribe v2 ویژگیهای Word-level Timestamp، Diarization تا ۳۲ گوینده، Keyterm Prompting تا ۱٬۰۰۰ اصطلاح، تشخیص موجودیت با ۶۵ نوع، Audio Tag پویا و ویرایش متن با دستور زبان طبیعی را فهرست میکند. این سقفها کیفیت یکسان برچسبگذاری در گفتوگوی شلوغ را تضمین نمیکنند. اگر در فایل حساس تغییر متن خواسته شد، رونوشت خام را نیز برای مقایسه نگه دارید. درخواست Batch پس از دریافت فایل پردازش میشود؛ تأخیر آن را با Stream حدود ۱۵۰ms نسخه Realtime یکی ندانید. قیمت براساس مدت فایل و طرح را از مستند روز بخوانید.

کاربردهای عملی
برای زیرنویس ویدیوی گفتوگویی، فایل با صدای روشن و زمان کلیپ مشخص بدهید و واژههای فنی ضروری را در Keyterm قرار دهید. خروجی زماندار را به فرمت زیرنویس تبدیل و برش جملهها را با تماشای فیلم اصلاح کنید. برای گفتوگوی چند نفر، کیفیت برچسب گوینده را بهخصوص هنگام صحبت همزمان بررسی کنید. اگر ویرایش طبیعی متن را به کار میبرید، تاریخچه تغییر را ثبت کنید تا جمله خلاف فایل اصلی وارد مقاله نشود. برای متن فارسی، چند نمونه با لهجه و اسم خاص انتخاب کنید و WER را محاسبه کنید.
بنچمارکها و روش ارزیابی
شعار «دقت پیشرفته» و آمار پوشش زبان Vendor-reported است. آزمون مستقل باید WER، خطای گوینده و زمانبندی و نرخ اشتباه نامها را با نسخه خام و پس از Keyterm نشان دهد. کیفیت با یک فایل استودیویی قابل تعمیم به تلفن و جلسه نیست. آزمون دستکم ۲۰ فایل با نویز محیط، لهجه، نام خاص، دو گوینده و تغییر زبان انجام دهید. نرخ خطای واژه (WER) برای رونوشت خام، تأخیر، خطای برچسب گوینده و خطای زمانبندی را جدا اندازه بگیرید. گزارش خود را با تعداد فایل، طول، زبان و شیوه پاکسازی متن کامل کنید؛ عدد اعلامی سازنده Vendor-reported است و جای آزمون فایلهای شما را نمیگیرد. متن و زمانبندی ظاهراً دقیق باید با فایل صوتی بازشنوی شود، مخصوصاً ارقام و نقلقولها.

قیمتگذاری و محدودیتها
رونویسی حتی با برچسب Entity کامل نیست و ممکن است داده شخصی را در متن برجسته کند. کنترل دسترسی به فایل و متن، رضایت ضبط و بازبینی نقلقول ضروریاند. تعداد ۳۲ گوینده سقف قابلیت است، نه دقت ثابت برای جلسه ۳۲ نفره. هزینه هر دقیقه در طرح و منطقه حساب تغییر میکند. رونویسی خودکار ممکن است جمله نامفهوم را با جمله ظاهراً معتبر پر کند. درباره جلسه محرمانه یا داده مشتری، سیاست نگهداری داده و منطقه پردازش را بررسی کنید. زمانبندی و تشخیص گوینده را بهویژه در همپوشانی صدا تصحیح کنید. نرخ دقیقه یا توکن به مسیر درخواست و روز خرید وابسته است.
مقایسه با گزینههای نزدیک
برای تصمیم میان Scribe v2 و Gemini 3.5 Transcribe و Mistral Voxtral Mini Transcribe 2، فقط نام یا نسخه را معیار قرار ندهید. اول نوع کار را یکسان کنید: رونویسی را با نرخ خطای واژه و نام خاص، گفتار مصنوعی را با تلفظ فارسی و تأخیر، و موسیقی را با انسجام قطعه و حق استفاده بسنجید. مدل زنده و مدل پردازش آفلاین ممکن است در کیفیت و تأخیر هدف متفاوتی داشته باشند؛ خروجی آنها را بدون همتراز کردن وظیفه رتبهبندی نکنید. برای تصمیم نهایی، هزینه هر دقیقه یا فایل قابلاستفاده و محدودیت دانلود و مجوز انتشار را در طرح واقعی خود بررسی کنید.
پرسشهای متداول
آیا Scribe v2 پاسخ زنده میدهد؟
این شناسه برای رونویسی فایل است؛ Realtime مدل جداگانه دارد.
آیا گوینده و زمان واژه را مشخص میکند؟
هر دو قابلیت در کارت رسمی ثبت شدهاند.
جمعبندی
برای آرشیو چندزبانه با زمانبندی کاربردی است. رونوشت خام، نقلقولها و برچسب گوینده را انسانی بازبینی کنید.
مدلهای موجود در Buffalo147 AI را ببینید