Buffalo147 AI

خانه › بلاگ

Gemini Omni Flash چیست؟ بررسی مدل ویدیوساز مکالمه‌ای گوگل با صدا و ویرایش هوشمند

جلد Gemini Omni Flash با طراحی سه‌بعدی مشکی و نور مسی

آخرین راستی‌آزمایی: ۱۲ سپتامبر ۲۰۲۶

در یک نگاه | Gemini Omni Flash
تاریخ عرضه: ۲۷ اوت ۲۰۲۶
قیمت و شیوهٔ محاسبه: Input متن، تصویر، ویدیو یا صوت: ۱٫۵۰ دلار؛ خروجی متن و Reasoning: ۹ دلار به‌ازای هر یک میلیون توکن. تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.

مقدمه

مدل‌های ویدیویی معمولاً یک کلیپ می‌سازند و برای اصلاح آن باید Prompt تازه‌ای از ابتدا نوشت. Gemini Omni Flash با ایده متفاوتی عرضه شد: کاربر با مدل درباره ویدیو گفتگو می‌کند، نتیجه را می‌بیند و تغییرهایی مانند حرکت دوربین، سوژه، صدا یا جزئیات صحنه را با دستور بعدی اعمال می‌کند.

Google این مدل را نخستین عضو خانواده Gemini Omni و گامی برای «ساخت یا ویرایش هر چیز از هر ورودی» معرفی کرده است؛ نقطه شروع آن ویدیو است. مدل می‌تواند کلیپ را همراه گفتار، موسیقی و افکت صوتی بسازد و علاوه بر Text-to-Video، ویرایش ویدیو را نیز در یک جریان مکالمه‌ای انجام دهد.

بااین‌حال باید نام دقیق را جدی گرفت. gemini-omni-flash-preview نسخه پایه و Preview است و با gemini-omni-1.1-flash که در ۲۷ اوت ۲۰۲۶ عرضه شد یکی نیست. نسخه 1.1 امکانات تولید حرفه‌ای‌تری دارد؛ این مقاله فقط درباره Gemini Omni Flash پایه است.

معرفی کامل Gemini Omni Flash

Google دسترسی مصرف‌کننده به Gemini Omni را در ۱۹ مه ۲۰۲۶ در محصولاتی مانند Gemini، Flow و YouTube معرفی کرد. Endpoint توسعه‌دهندگان با شناسه gemini-omni-flash-preview در ۳۰ ژوئن ۲۰۲۶ از طریق Gemini API و Google AI Studio وارد Public Preview شد.

شماتیک روند ورودی، مدل و خروجی برای Gemini Omni Flash
نمای شماتیک روند درخواست تا خروجی برای Gemini Omni Flash؛ قابلیت‌های دقیق در متن مقاله آمده‌اند.

Model Card آن را یک Transformer با پشتیبانی بومی متن، تصویر، ویدیو و صوت معرفی می‌کند که روی داده‌های همین چهار Modalities آموزش دیده است. خروجی هدف، ویدیوی باکیفیت و دارای صداست. در صفحه فعلی Google Cloud، مدل علاوه بر ویدیو می‌تواند پاسخ متنی نیز برگرداند.

Omni Flash جای یک LLM عمومی، ادیتور تایم‌لاین یا مدل تصویر ثابت را نمی‌گیرد. تخصص آن ساخت و تغییر شات ویدیویی کوتاه با درک دستور طبیعی است. نسخه پایه اکنون بیشتر یک نقطه ورود تاریخی و Preview محسوب می‌شود، زیرا Omni 1.1 Flash کنترل، Resolution و تداوم بیشتری ارائه می‌کند.

قابلیت‌های اصلی

تولید ویدیو از متن همراه صدا

مدل از توضیح متنی، ویدیویی با گفتار، موسیقی و افکت صوتی تولید می‌کند. Prompt خوب باید سوژه، حرکت، دوربین، نور، ریتم و طراحی صدا را مشخص کند. صفحه فنی نسخه پایه Resolution برابر 720p و نسبت‌های 16:9 و 9:16 را ثبت کرده است.

ویرایش ویدیو با زبان طبیعی

کاربر می‌تواند ویدیو را وارد و با دستور متنی بخش‌هایی از صحنه، حرکت، سبک یا صدا را تغییر دهد. این روش برای ساخت Variation و اصلاح سریع Concept مفید است؛ بااین‌حال حفظ کامل چهره، لباس یا پس‌زمینه در چند Edit تضمین‌شده نیست.

درک چندوجهی

Model Card ورودی متن، تصویر، صوت و ویدیو را در سطح مدل توصیف می‌کند. اما مستند فعلی Endpoint پایه در Google Cloud، Audio Input را «پشتیبانی‌نشده» و Image-to-Video و Reference-to-Video را نیز در فهرست قابلیت‌های API «پشتیبانی‌نشده» نشان می‌دهد. بنابراین قابلیت پژوهشی یا محصول مصرف‌کننده را نباید بدون بررسی به API تعمیم داد.

Thinking برای فهم دستور و فیزیک صحنه

Thinking در Endpoint پشتیبانی می‌شود. هدف، تفسیر بهتر دستور پیچیده، روابط فضایی و حرکت است؛ نه نمایش Chain-of-Thought به کاربر. Google در معرفی مدل بر فهم جهان و شبیه‌سازی فیزیک تأکید کرده، ولی نتیجه همچنان ممکن است در حرکت پیچیده خطا داشته باشد.

تولید گفتار، موسیقی و افکت صوتی

Sound Generation رسمی شامل Speech، Music و Sound Effects است. هماهنگی صدا و تصویر یکی از مزیت‌های اصلی مدل است. تغییر گفتار افراد در ویرایش از نظر ایمنی محدود شده و استفاده از هویت واقعی بدون رضایت می‌تواند مشکل حقوقی و اخلاقی ایجاد کند.

Content Credentials و SynthID

صفحه Cloud پشتیبانی از C2PA را ثبت کرده و Google برای محتوای ساخته یا ویرایش‌شده در محصولاتش SynthID نامرئی را نیز توضیح داده است. این ابزارها به شفافیت منشأ کمک می‌کنند، اما جای مجوز استفاده از چهره، موسیقی یا دارایی برند را نمی‌گیرند.

تفاوت قابلیت مدل با Endpoint فعلی

این بخش برای جلوگیری از برداشت اشتباه ضروری است. Model Card دامنه کلی خانواده و توان مدل را شرح می‌دهد، اما صفحه Endpoint نشان می‌دهد چه چیزی امروز از API پایه قابل فراخوانی است.

موضوع سطح مدل / Model Card Endpoint gemini-omni-flash-preview در ۱۲ سپتامبر ۲۰۲۶
ورودی متن بله بله
ورودی تصویر بله بله، اما Image-to-Video به‌عنوان قابلیت مستقل پشتیبانی‌نشده ثبت شده است
ورودی صوت بله پشتیبانی‌نشده
ورودی ویدیو بله بله، برای ویرایش ویدیو
خروجی ویدیو با صدا بله بله
خروجی متن در معرفی اصلی محور نیست صفحه Cloud آن را پشتیبانی‌شده نشان می‌دهد
Reference-to-Video در ارزیابی مدل وجود دارد در صفحه API پایه پشتیبانی‌نشده
Extend / First & Last Frame / 4K مربوط به به‌روزرسانی 1.1 در نسخه پایه پشتیبانی‌نشده

این جدول نشان می‌دهد چرا باید Exact Model ID را در مقاله، کد و Benchmark حفظ کرد. یک Demo در Flow یا قابلیت Omni 1.1 الزاماً در Endpoint پایه قابل استفاده نیست.

مهم‌ترین نقاط قوت

  • ساخت و ویرایش ویدیو در یک مدل و یک جریان مکالمه‌ای
  • تولید هم‌زمان گفتار، موسیقی و افکت صوتی
  • درک بهتر دستورهای مربوط به حرکت، دوربین و تغییر صحنه
  • نتیجه رسمی قوی در ترجیح انسانی Text-to-Video و Video Editing
  • خروجی افقی و عمودی 720p برای محتوای کوتاه
  • C2PA و SynthID برای شفافیت محتوای مولد

محدودیت‌ها و نقاط ضعف

مدل در وضعیت Preview است و Google برای شناسه پایه تاریخ بازنشستگی ۳۰ ژوئن ۲۰۲۷ را اعلام کرده است. Preview می‌تواند سهمیه، رفتار و قرارداد پایداری متفاوتی از مدل GA داشته باشد.

سه معیار ارزیابی عملی برای Gemini Omni Flash
معیارهای پیشنهادی برای آزمون Gemini Omni Flash با کار واقعی؛ این تصویر دادهٔ بنچمارک یا امتیاز گزارش‌شده نیست.

مستند رسمی، حفظ کامل Consistency در Editهای پی‌درپی، صحنه‌های دارای حرکت پیچیده و نوشتن متن کاملاً صحیح داخل ویدیو را جزو محدودیت‌های شناخته‌شده می‌داند. برای لوگو، زیرنویس یا متن قانونی بهتر است لایه گرافیکی پس از تولید اضافه شود.

Endpoint پایه 720p و کلیپ کوتاه را هدف می‌گیرد. Extend، First/Last Frame، پیش‌نمایش 360p، 1080p و 4K امکانات Omni 1.1 هستند و نباید به نسخه پایه نسبت داده شوند.

System Instructions، Structured Output، Context Caching، RAG، Function Calling، Code Execution، Grounding، Computer Use و Live API در صفحه فعلی این مدل پشتیبانی نمی‌شوند. بنابراین «Omni» به معنی Agent همه‌کاره نیست؛ این مدل یک موتور ویدیویی تخصصی است.

Google Cloud در جدول Consumption، Fixed Quota را پشتیبانی‌شده و Batch، Provisioned Throughput و Pay-as-you-go را پشتیبانی‌نشده نشان می‌دهد، هرچند صفحه Pricing نرخ توکنی عمومی منتشر کرده است. دسترسی واقعی و شیوه صورتحساب را باید در حساب و قرارداد خود تأیید کرد.

کاربردهای واقعی Gemini Omni Flash

ساخت Concept تبلیغاتی کوتاه

از Brief محصول می‌توان شات ده‌ثانیه‌ای با حرکت دوربین و Sound Design ساخت و سپس رنگ، ریتم یا جای سوژه را با Edit مکالمه‌ای تغییر داد. متن قیمت و لوگو بهتر است در نرم‌افزار تدوین اضافه شوند.

ویرایش خلاقانه B-roll

یک کلیپ موجود را می‌توان به حال‌وهوای متفاوت برد، نور یا محیط را عوض کرد و Variation ساخت. تیم باید نسخه اصلی، Prompt و مجوز دارایی را برای ردگیری نگه دارد.

محتوای عمودی شبکه اجتماعی

نسبت 9:16 و صدای بومی برای Reels یا Shorts مناسب است. Hook بصری باید در ثانیه‌های اول Prompt شود و Caption دقیق پس از تولید روی ویدیو قرار گیرد.

Prototype شات سینمایی

کارگردان یا Storyboard Artist می‌تواند حرکت دوربین، میزانسن و طراحی صدا را پیش از تولید واقعی آزمایش کند. خروجی مرجع خلاق است، نه جایگزین قطعی Previsualization فنی.

آموزش تصویری کوتاه

می‌توان یک مفهوم را با تصویرسازی و Narration کوتاه نمایش داد. هر محتوای علمی یا عددی باید از نظر صحت بازبینی شود و متن روی تصویر در Post-production ساخته شود.

این مدل مناسب چه کسانی است؟

سازندگان ویدیو، آژانس‌های تبلیغاتی، طراحان Motion، تیم‌های Social Media، توسعه‌دهندگان ابزار خلاق و Storyboard Artistها مخاطبان اصلی‌اند. برای تیمی که می‌خواهد ویدیو را با گفت‌وگو اصلاح کند، Omni ایده Workflow جذابی ارائه می‌دهد.

برای پروژه جدید حرفه‌ای، Omni 1.1 Flash معمولاً نامزد منطقی‌تری است؛ نسخه پایه بیشتر برای سازگاری Workflow موجود، مقایسه یا دسترسی خاص ارزش دارد. تدوین‌گری که کنترل Frame-accurate، Timeline چندلایه یا متن بدون خطا می‌خواهد همچنان به ابزار Post-production نیاز دارد.

مشخصات فنی Gemini Omni Flash

مشخصه مقدار تأییدشده
Developer Google DeepMind
Model Family Gemini Omni
Model Type Transformer بومی چندوجهی برای تولید و ویرایش ویدیو
Consumer Introduction ۱۹ مه ۲۰۲۶
Developer API Release ۳۰ ژوئن ۲۰۲۶
API Model ID gemini-omni-flash-preview
Lifecycle Preview؛ بازنشستگی اعلام‌شده ۳۰ ژوئن ۲۰۲۷
API Input متن، تصویر و ویدیو؛ Audio Input در صفحه فعلی پشتیبانی‌نشده
Output متن و ویدیوی دارای صدا در صفحه Cloud
Maximum Input Tokens ۱۳۱٬۰۷۲
Maximum Output Tokens ۵۷٬۹۲۰
Thinking بله
Text-to-Video بله
Video Editing بله
Sound Generation گفتار، موسیقی و افکت صوتی
Base Resolution 720p
Aspect Ratios 16:9 و 9:16
Maximum Images per Prompt ۱۰
Video Technical Limit حداکثر طول درج‌شده ۱۰ ثانیه؛ حداکثر ۳ ویدیو در Prompt
Image-to-Video / Reference-to-Video API در صفحه فعلی نسخه پایه پشتیبانی‌نشده
Extend / First & Last Frames خیر؛ مربوط به Omni 1.1 Flash
Tools / Web Search پشتیبانی‌نشده
Structured Output / Caching / Live API پشتیبانی‌نشده
C2PA بله
API Availability Preview در Gemini API، Google AI Studio و Google Cloud؛ سهمیه می‌تواند محدود باشد

توکن‌های فنی ویدیو با توکن متن معنای یکسان ندارند. سقف ۵۷٬۹۲۰ توکن خروجی با فرمول فعلی دقیقاً معادل ده ثانیه ویدیوی 720p است.

۵ نمونه پرامپت کاربردی

۱. تبلیغ محصول با Sound Design

یک ویدیوی ۱۰ ثانیه‌ای 16:9 از هدفون مشکی روی سطح سنگ تیره بساز. دوربین با حرکت Arc آرام نزدیک شود؛ یک خط نور مسی #C56240 روی بدنه حرکت کند. صدای محیط استودیویی مینیمال، یک ضرب Bass نرم و صدای کلیک دقیق هنگام روشن‌شدن دستگاه. بدون نوشته و بدون لوگوی ساختگی.

۲. ویدیوی عمودی شبکه اجتماعی

ویدیوی ۹:۱۶ ده‌ثانیه‌ای بساز: در ثانیه اول نمای Macro از دانه قهوه، سپس Match Cut به ریختن قهوه در فنجان. نور صبح گرم، حرکت طبیعی بخار، صدای آسیاب و ریختن مایع هم‌زمان. هیچ متن داخل تصویر تولید نکن.

۳. ویرایش رنگ و محیط کلیپ

این ویدیو را ویرایش کن؛ حرکت و زمان‌بندی سوژه تغییر نکند. محیط را به استودیوی گرافیتی تیره با Accent مسی تبدیل کن، نور Key از سمت چپ باشد و انعکاس‌های ناخواسته حذف شوند. گفتار اصلی حفظ شود و فقط نویز پس‌زمینه کمتر شود.

۴. شات آموزشی کوتاه

یک ویدیوی ۱۰ ثانیه‌ای آموزشی از گردش آب در طبیعت بساز. یک شات پیوسته با حرکت دوربین از سطح دریا به ابر و سپس بارش؛ سبک واقع‌گرای علمی، برچسب یا متن داخل تصویر نداشته باشد. Narration فارسی کوتاه و افکت باد و باران هماهنگ باشد.

۵. اصلاح مکالمه‌ای با Constraint

روی خروجی قبلی فقط این سه تغییر را اعمال کن: حرکت دوربین ۳۰٪ آهسته‌تر، نور پس‌زمینه گرم‌تر و موسیقی کم‌حجم‌تر. چهره، لباس، کادر، دیالوگ و طول کلیپ دقیقاً تا حد امکان حفظ شوند. اگر حفظ کامل ممکن نیست، تغییرات دیگر ایجاد نکن.

بنچمارک‌ها و ارزیابی عملکرد

Google برای Gemini Omni Flash نتیجه‌های Human Preference منتشر کرده، اما در صفحه قابل بررسی امتیاز عددی مدل و رقبا را ارائه نکرده است. جدول زیر به‌جای ساختن عدد، رتبه یا نتیجه اعلام‌شده، اندازه نمونه و وضعیت انتشار را نشان می‌دهد. همه موارد Vendor-reported هستند و ارزیابی مستقل محسوب نمی‌شوند.

Benchmark / ارزیابی و مفهوم Gemini Omni Flash رقبای مستقیم اندازه و تاریخ منبع / ملاحظه
Video Editing Internal؛ ترجیح کلی و پیروی از دستور نتیجه پیشرو؛ امتیاز عددی منتشر نشده مدل‌های پیشرو، نام و امتیاز منتشر نشده ۵۰۴ مثال؛ مه ۲۰۲۶ صفحه رسمی Gemini Omni؛ Vendor-reported
MovieGenBench؛ Text-to-Video با ترجیح انسانی و پیروی از دستور بهترین نتیجه اعلام‌شده؛ عدد منتشر نشده خروجی مدل‌های ویدیویی رقیب؛ اعداد منتشر نشده ۱٬۰۰۳ Prompt؛ مه ۲۰۲۶ Benchmark عمومی Meta، ارزیابی گزارش‌شده Google
Fast Motion Internal؛ حرکت‌های ورزشی و پرشتاب نمودار نتیجه معرفی شده، عدد قابل‌بررسی در متن منتشر نشده نام و عدد رقبا منتشر نشده ۵۰۰ Prompt؛ مه ۲۰۲۶ صفحه رسمی Gemini Omni؛ Vendor-reported
VBench I2V؛ ساخت ویدیو از تصویر و متن مشترکاً در گروه پیشرو؛ عدد منتشر نشده Grok Imagine Video و Kling نیز هم‌رتبه پیشرو ۳۵۵ جفت تصویر و متن؛ مه ۲۰۲۶ صفحه رسمی Gemini Omni؛ Vendor-reported
Reference-to-Video Internal؛ ترجیح کلی و پایبندی گفتار نتیجه پیشرو؛ عدد منتشر نشده مدل‌های پیشرو، نام و امتیاز کامل منتشر نشده ۴۶۸ مثال؛ مه ۲۰۲۶ صفحه رسمی Gemini Omni؛ Vendor-reported

نتایج رسمی، قوت مدل در پیروی از دستور، ویرایش و هماهنگی مرجع با گفتار را نشان می‌دهند. VBench I2V نیز برتری مطلق را تأیید نمی‌کند؛ Omni با Grok Imagine Video و Kling در گروه پیشرو مساوی گزارش شده است.

تا تاریخ ۱۲ سپتامبر ۲۰۲۶، ارزیابی مستقل عمومی با امتیازهای قابل‌بازتولید و هم‌شرط برای شناسه دقیق gemini-omni-flash-preview پیدا نشد. بنابراین رتبه رسمی را نباید حکم قطعی بازار دانست. نبود Promptها، Seedها، خروجی خام، نام کامل همه رقبا و Confidence Interval امکان مقایسه دقیق را محدود می‌کند.

برای Eval واقعی، حداقل ۳۰ Prompt از سبک خودتان انتخاب کنید و هر خروجی را کور و دونفره از نظر پیروی از دستور، تداوم سوژه، فیزیک حرکت، هم‌زمانی صدا، Artifact و هزینه بسنجید. این روش برای انتخاب مدل ویدیو از یک رتبه کلی مفیدتر است.

مقایسه Gemini Omni Flash با رقبا

مدل انتخاب بهتر برای ملاحظه اصلی
Gemini Omni Flash Preview ویرایش مکالمه‌ای و کلیپ 720p کوتاه با صدای بومی Preview و محدودیت کنترل‌های نسل پایه
Gemini Omni 1.1 Flash پروژه جدید با Extend، First/Last Frame، 360p Draft و خروجی تا 4K شناسه و قابلیت‌های متفاوت؛ مقاله پایه نباید با آن ادغام شود
Kling Workflowهای Image-to-Video؛ در VBench رسمی Google هم‌رتبه Omni گزارش شده عدد دقیق مقایسه منتشر نشده و نسخه Kling باید مشخص باشد
Grok Imagine Video گزینه مستقیم Image-to-Video؛ در همان VBench هم‌رتبه گزارش شده نتیجه فقط یک ارزیابی Vendor-reported است

برای ساخت جدید در اکوسیستم Google، Omni 1.1 معمولاً انتخاب کامل‌تری است. Gemini Omni Flash پایه زمانی معنا دارد که Workflow موجود به همین Endpoint وابسته باشد یا تیم بخواهد رفتار نسل اول را مقایسه کند. Kling و Grok در ارزیابی I2V رسمی هم‌سطح گزارش شده‌اند و برای این سناریو A/B Test ضروری است.

قیمت و API

صفحه رسمی Google Cloud در ۱۲ سپتامبر ۲۰۲۶ نرخ‌های زیر را برای Gemini Omni Flash و Omni 1.1 Flash منتشر کرده است:

نوع مصرف قیمت رسمی
Input متن، تصویر، ویدیو یا صوت ۱٫۵۰ دلار برای هر یک میلیون توکن
Text Output و Reasoning ۹ دلار برای هر یک میلیون توکن
Video Output با صدا ۱۷٫۵۰ دلار برای هر یک میلیون توکن

برای ورودی، هر تصویر ۱٬۱۲۰ توکن، هر ثانیه صوت ۳۲ توکن و هر ثانیه ویدیو ۵٬۷۹۲ توکن محاسبه می‌شود. برای خروجی ویدیو، نرخ Tokenization برابر ۱٬۹۳۱ توکن در ثانیه 360p، ۵٬۷۹۲ در 720p، ۸٬۶۸۸ در 1080p و ۱۷٬۳۷۶ در 4K است.

نسخه پایه طبق صفحه فنی فقط 720p ارائه می‌کند. با فرمول رسمی، ده ثانیه خروجی 720p حدود ۵۷٬۹۲۰ توکن و تقریباً ۱٫۰۱ دلار هزینه Video Output دارد؛ ورودی و Text/Reasoning جدا محاسبه می‌شوند. نرخ تقریبی ۰٫۱۰ دلار برای هر ثانیه 720p با همین محاسبه سازگار است.

قیمت منتشرشده به معنی دسترسی بدون محدودیت نیست. صفحه مدل Fixed Quota را پشتیبانی‌شده و گزینه‌های معمول Batch، Provisioned Throughput و Pay-as-you-go را پشتیبانی‌نشده ثبت کرده است. Free Tier عمومی قابل‌تأییدی برای این Endpoint پیدا نشد؛ وضعیت پروژه و صورتحساب را در Console بررسی کنید.

Gemini Omni Flash را در Buffalo147 AI امتحان کنید

با یک شات کوتاه و دقیق شروع کنید: سوژه، حرکت دوربین، نور، مدت، نسبت تصویر و طراحی صدا را روشن بنویسید. پس از خروجی اول فقط یک یا دو متغیر را تغییر دهید تا بفهمید مدل کدام بخش دستور را واقعاً کنترل می‌کند.

شروع استفاده از Gemini Omni Flash در Buffalo147 AI

جمع‌بندی

Gemini Omni Flash ایده مهمی را وارد تولید ویدیو کرد: ساخت و ویرایش صحنه با مکالمه، در یک مدل که صدا را نیز هم‌زمان تولید می‌کند. نتایج رسمی در پیروی از دستور و Video Editing امیدوارکننده‌اند و Workflow آن برای ابزارهای خلاق جذاب است.

محدودیت اصلی، Preview بودن و فاصله امکانات Endpoint پایه با دامنه کامل Model Card و جانشین 1.1 است. Consistency، حرکت پیچیده و متن داخل ویدیو نیز هنوز نقاط پرریسک‌اند.

برای بررسی نسل اول Omni یا حفظ یک Integration موجود، این مدل ارزشمند است. برای پروژه تازه و خروجی حرفه‌ای، Omni 1.1 را نیز حتماً ارزیابی کنید و انتخاب نهایی را با Promptهای واقعی، Blind Review و هزینه هر کلیپ انجام دهید.

پرسش‌های متداول

Gemini Omni Flash چیست؟

مدل چندوجهی Google DeepMind برای ساخت و ویرایش مکالمه‌ای ویدیوی کوتاه با گفتار، موسیقی و افکت صوتی است.

آیا Gemini Omni Flash همان Gemini Omni 1.1 Flash است؟

خیر. نسخه پایه شناسه gemini-omni-flash-preview دارد؛ 1.1 مدل جدیدتری با Extend، First/Last Frame، Draft 360p و خروجی تا 4K است.

آیا Gemini Omni Flash از متن ویدیو می‌سازد؟

بله. Text-to-Video و Video Editing در Endpoint پایه پشتیبانی می‌شوند و خروجی می‌تواند صدا نیز داشته باشد.

حداکثر طول ویدیو چقدر است؟

صفحه فنی نسخه پایه حداکثر طول ۱۰ ثانیه را با یا بدون صدا ثبت کرده است.

آیا مدل Image-to-Video دارد؟

در ارزیابی سطح مدل، Image-to-Video سنجیده شده است؛ اما صفحه فعلی Endpoint پایه این قابلیت مستقل را پشتیبانی‌نشده نشان می‌دهد. قابلیت محصول مصرف‌کننده را به API تعمیم ندهید.

قیمت یک ویدیوی ۱۰ ثانیه‌ای چقدر است؟

Video Output ده‌ثانیه‌ای 720p بر اساس نرخ رسمی حدود ۱٫۰۱ دلار است؛ هزینه ورودی و Reasoning جدا اضافه می‌شود.

آیا Gemini Omni Flash API رایگان دارد؟

Free Tier عمومی قابل‌تأیید پیدا نشد. Endpoint Preview است و دسترسی می‌تواند به پروژه، Region و Fixed Quota وابسته باشد.

آیا Benchmark مستقل برای مدل وجود دارد؟

در زمان بررسی، نتیجه مستقل عمومی و هم‌شرط برای Exact Model ID پیدا نشد. Google نتایج ترجیح انسانی منتشر کرده، اما امتیازهای عددی کامل رقبا را ارائه نکرده است.

منابع

یادداشت تحریریه Buffalo147 AI: همه نتایج Benchmark این مقاله Vendor-reported هستند و Google امتیازهای عددی کامل را منتشر نکرده است. به‌جای حدس، نتیجه کیفی، اندازه نمونه و محدودیت مقایسه ثبت شده‌اند.

خواندنی‌های دیگر