Gemini Omni Flash چیست؟ بررسی مدل ویدیوساز مکالمهای گوگل با صدا و ویرایش هوشمند
آخرین راستیآزمایی: ۱۲ سپتامبر ۲۰۲۶
تاریخ عرضه: ۲۷ اوت ۲۰۲۶
قیمت و شیوهٔ محاسبه: Input متن، تصویر، ویدیو یا صوت: ۱٫۵۰ دلار؛ خروجی متن و Reasoning: ۹ دلار بهازای هر یک میلیون توکن. تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.
مقدمه
مدلهای ویدیویی معمولاً یک کلیپ میسازند و برای اصلاح آن باید Prompt تازهای از ابتدا نوشت. Gemini Omni Flash با ایده متفاوتی عرضه شد: کاربر با مدل درباره ویدیو گفتگو میکند، نتیجه را میبیند و تغییرهایی مانند حرکت دوربین، سوژه، صدا یا جزئیات صحنه را با دستور بعدی اعمال میکند.
Google این مدل را نخستین عضو خانواده Gemini Omni و گامی برای «ساخت یا ویرایش هر چیز از هر ورودی» معرفی کرده است؛ نقطه شروع آن ویدیو است. مدل میتواند کلیپ را همراه گفتار، موسیقی و افکت صوتی بسازد و علاوه بر Text-to-Video، ویرایش ویدیو را نیز در یک جریان مکالمهای انجام دهد.
بااینحال باید نام دقیق را جدی گرفت. gemini-omni-flash-preview نسخه پایه و Preview است و با gemini-omni-1.1-flash که در ۲۷ اوت ۲۰۲۶ عرضه شد یکی نیست. نسخه 1.1 امکانات تولید حرفهایتری دارد؛ این مقاله فقط درباره Gemini Omni Flash پایه است.
معرفی کامل Gemini Omni Flash
Google دسترسی مصرفکننده به Gemini Omni را در ۱۹ مه ۲۰۲۶ در محصولاتی مانند Gemini، Flow و YouTube معرفی کرد. Endpoint توسعهدهندگان با شناسه gemini-omni-flash-preview در ۳۰ ژوئن ۲۰۲۶ از طریق Gemini API و Google AI Studio وارد Public Preview شد.

Model Card آن را یک Transformer با پشتیبانی بومی متن، تصویر، ویدیو و صوت معرفی میکند که روی دادههای همین چهار Modalities آموزش دیده است. خروجی هدف، ویدیوی باکیفیت و دارای صداست. در صفحه فعلی Google Cloud، مدل علاوه بر ویدیو میتواند پاسخ متنی نیز برگرداند.
Omni Flash جای یک LLM عمومی، ادیتور تایملاین یا مدل تصویر ثابت را نمیگیرد. تخصص آن ساخت و تغییر شات ویدیویی کوتاه با درک دستور طبیعی است. نسخه پایه اکنون بیشتر یک نقطه ورود تاریخی و Preview محسوب میشود، زیرا Omni 1.1 Flash کنترل، Resolution و تداوم بیشتری ارائه میکند.
قابلیتهای اصلی
تولید ویدیو از متن همراه صدا
مدل از توضیح متنی، ویدیویی با گفتار، موسیقی و افکت صوتی تولید میکند. Prompt خوب باید سوژه، حرکت، دوربین، نور، ریتم و طراحی صدا را مشخص کند. صفحه فنی نسخه پایه Resolution برابر 720p و نسبتهای 16:9 و 9:16 را ثبت کرده است.
ویرایش ویدیو با زبان طبیعی
کاربر میتواند ویدیو را وارد و با دستور متنی بخشهایی از صحنه، حرکت، سبک یا صدا را تغییر دهد. این روش برای ساخت Variation و اصلاح سریع Concept مفید است؛ بااینحال حفظ کامل چهره، لباس یا پسزمینه در چند Edit تضمینشده نیست.
درک چندوجهی
Model Card ورودی متن، تصویر، صوت و ویدیو را در سطح مدل توصیف میکند. اما مستند فعلی Endpoint پایه در Google Cloud، Audio Input را «پشتیبانینشده» و Image-to-Video و Reference-to-Video را نیز در فهرست قابلیتهای API «پشتیبانینشده» نشان میدهد. بنابراین قابلیت پژوهشی یا محصول مصرفکننده را نباید بدون بررسی به API تعمیم داد.
Thinking برای فهم دستور و فیزیک صحنه
Thinking در Endpoint پشتیبانی میشود. هدف، تفسیر بهتر دستور پیچیده، روابط فضایی و حرکت است؛ نه نمایش Chain-of-Thought به کاربر. Google در معرفی مدل بر فهم جهان و شبیهسازی فیزیک تأکید کرده، ولی نتیجه همچنان ممکن است در حرکت پیچیده خطا داشته باشد.
تولید گفتار، موسیقی و افکت صوتی
Sound Generation رسمی شامل Speech، Music و Sound Effects است. هماهنگی صدا و تصویر یکی از مزیتهای اصلی مدل است. تغییر گفتار افراد در ویرایش از نظر ایمنی محدود شده و استفاده از هویت واقعی بدون رضایت میتواند مشکل حقوقی و اخلاقی ایجاد کند.
Content Credentials و SynthID
صفحه Cloud پشتیبانی از C2PA را ثبت کرده و Google برای محتوای ساخته یا ویرایششده در محصولاتش SynthID نامرئی را نیز توضیح داده است. این ابزارها به شفافیت منشأ کمک میکنند، اما جای مجوز استفاده از چهره، موسیقی یا دارایی برند را نمیگیرند.
تفاوت قابلیت مدل با Endpoint فعلی
این بخش برای جلوگیری از برداشت اشتباه ضروری است. Model Card دامنه کلی خانواده و توان مدل را شرح میدهد، اما صفحه Endpoint نشان میدهد چه چیزی امروز از API پایه قابل فراخوانی است.
| موضوع | سطح مدل / Model Card | Endpoint gemini-omni-flash-preview در ۱۲ سپتامبر ۲۰۲۶ |
|---|---|---|
| ورودی متن | بله | بله |
| ورودی تصویر | بله | بله، اما Image-to-Video بهعنوان قابلیت مستقل پشتیبانینشده ثبت شده است |
| ورودی صوت | بله | پشتیبانینشده |
| ورودی ویدیو | بله | بله، برای ویرایش ویدیو |
| خروجی ویدیو با صدا | بله | بله |
| خروجی متن | در معرفی اصلی محور نیست | صفحه Cloud آن را پشتیبانیشده نشان میدهد |
| Reference-to-Video | در ارزیابی مدل وجود دارد | در صفحه API پایه پشتیبانینشده |
| Extend / First & Last Frame / 4K | مربوط به بهروزرسانی 1.1 | در نسخه پایه پشتیبانینشده |
این جدول نشان میدهد چرا باید Exact Model ID را در مقاله، کد و Benchmark حفظ کرد. یک Demo در Flow یا قابلیت Omni 1.1 الزاماً در Endpoint پایه قابل استفاده نیست.
مهمترین نقاط قوت
- ساخت و ویرایش ویدیو در یک مدل و یک جریان مکالمهای
- تولید همزمان گفتار، موسیقی و افکت صوتی
- درک بهتر دستورهای مربوط به حرکت، دوربین و تغییر صحنه
- نتیجه رسمی قوی در ترجیح انسانی Text-to-Video و Video Editing
- خروجی افقی و عمودی 720p برای محتوای کوتاه
- C2PA و SynthID برای شفافیت محتوای مولد
محدودیتها و نقاط ضعف
مدل در وضعیت Preview است و Google برای شناسه پایه تاریخ بازنشستگی ۳۰ ژوئن ۲۰۲۷ را اعلام کرده است. Preview میتواند سهمیه، رفتار و قرارداد پایداری متفاوتی از مدل GA داشته باشد.

مستند رسمی، حفظ کامل Consistency در Editهای پیدرپی، صحنههای دارای حرکت پیچیده و نوشتن متن کاملاً صحیح داخل ویدیو را جزو محدودیتهای شناختهشده میداند. برای لوگو، زیرنویس یا متن قانونی بهتر است لایه گرافیکی پس از تولید اضافه شود.
Endpoint پایه 720p و کلیپ کوتاه را هدف میگیرد. Extend، First/Last Frame، پیشنمایش 360p، 1080p و 4K امکانات Omni 1.1 هستند و نباید به نسخه پایه نسبت داده شوند.
System Instructions، Structured Output، Context Caching، RAG، Function Calling، Code Execution، Grounding، Computer Use و Live API در صفحه فعلی این مدل پشتیبانی نمیشوند. بنابراین «Omni» به معنی Agent همهکاره نیست؛ این مدل یک موتور ویدیویی تخصصی است.
Google Cloud در جدول Consumption، Fixed Quota را پشتیبانیشده و Batch، Provisioned Throughput و Pay-as-you-go را پشتیبانینشده نشان میدهد، هرچند صفحه Pricing نرخ توکنی عمومی منتشر کرده است. دسترسی واقعی و شیوه صورتحساب را باید در حساب و قرارداد خود تأیید کرد.
کاربردهای واقعی Gemini Omni Flash
ساخت Concept تبلیغاتی کوتاه
از Brief محصول میتوان شات دهثانیهای با حرکت دوربین و Sound Design ساخت و سپس رنگ، ریتم یا جای سوژه را با Edit مکالمهای تغییر داد. متن قیمت و لوگو بهتر است در نرمافزار تدوین اضافه شوند.
ویرایش خلاقانه B-roll
یک کلیپ موجود را میتوان به حالوهوای متفاوت برد، نور یا محیط را عوض کرد و Variation ساخت. تیم باید نسخه اصلی، Prompt و مجوز دارایی را برای ردگیری نگه دارد.
محتوای عمودی شبکه اجتماعی
نسبت 9:16 و صدای بومی برای Reels یا Shorts مناسب است. Hook بصری باید در ثانیههای اول Prompt شود و Caption دقیق پس از تولید روی ویدیو قرار گیرد.
Prototype شات سینمایی
کارگردان یا Storyboard Artist میتواند حرکت دوربین، میزانسن و طراحی صدا را پیش از تولید واقعی آزمایش کند. خروجی مرجع خلاق است، نه جایگزین قطعی Previsualization فنی.
آموزش تصویری کوتاه
میتوان یک مفهوم را با تصویرسازی و Narration کوتاه نمایش داد. هر محتوای علمی یا عددی باید از نظر صحت بازبینی شود و متن روی تصویر در Post-production ساخته شود.
این مدل مناسب چه کسانی است؟
سازندگان ویدیو، آژانسهای تبلیغاتی، طراحان Motion، تیمهای Social Media، توسعهدهندگان ابزار خلاق و Storyboard Artistها مخاطبان اصلیاند. برای تیمی که میخواهد ویدیو را با گفتوگو اصلاح کند، Omni ایده Workflow جذابی ارائه میدهد.
برای پروژه جدید حرفهای، Omni 1.1 Flash معمولاً نامزد منطقیتری است؛ نسخه پایه بیشتر برای سازگاری Workflow موجود، مقایسه یا دسترسی خاص ارزش دارد. تدوینگری که کنترل Frame-accurate، Timeline چندلایه یا متن بدون خطا میخواهد همچنان به ابزار Post-production نیاز دارد.
مشخصات فنی Gemini Omni Flash
| مشخصه | مقدار تأییدشده |
|---|---|
| Developer | Google DeepMind |
| Model Family | Gemini Omni |
| Model Type | Transformer بومی چندوجهی برای تولید و ویرایش ویدیو |
| Consumer Introduction | ۱۹ مه ۲۰۲۶ |
| Developer API Release | ۳۰ ژوئن ۲۰۲۶ |
| API Model ID | gemini-omni-flash-preview |
| Lifecycle | Preview؛ بازنشستگی اعلامشده ۳۰ ژوئن ۲۰۲۷ |
| API Input | متن، تصویر و ویدیو؛ Audio Input در صفحه فعلی پشتیبانینشده |
| Output | متن و ویدیوی دارای صدا در صفحه Cloud |
| Maximum Input Tokens | ۱۳۱٬۰۷۲ |
| Maximum Output Tokens | ۵۷٬۹۲۰ |
| Thinking | بله |
| Text-to-Video | بله |
| Video Editing | بله |
| Sound Generation | گفتار، موسیقی و افکت صوتی |
| Base Resolution | 720p |
| Aspect Ratios | 16:9 و 9:16 |
| Maximum Images per Prompt | ۱۰ |
| Video Technical Limit | حداکثر طول درجشده ۱۰ ثانیه؛ حداکثر ۳ ویدیو در Prompt |
| Image-to-Video / Reference-to-Video API | در صفحه فعلی نسخه پایه پشتیبانینشده |
| Extend / First & Last Frames | خیر؛ مربوط به Omni 1.1 Flash |
| Tools / Web Search | پشتیبانینشده |
| Structured Output / Caching / Live API | پشتیبانینشده |
| C2PA | بله |
| API Availability | Preview در Gemini API، Google AI Studio و Google Cloud؛ سهمیه میتواند محدود باشد |
توکنهای فنی ویدیو با توکن متن معنای یکسان ندارند. سقف ۵۷٬۹۲۰ توکن خروجی با فرمول فعلی دقیقاً معادل ده ثانیه ویدیوی 720p است.
۵ نمونه پرامپت کاربردی
۱. تبلیغ محصول با Sound Design
یک ویدیوی ۱۰ ثانیهای 16:9 از هدفون مشکی روی سطح سنگ تیره بساز. دوربین با حرکت Arc آرام نزدیک شود؛ یک خط نور مسی #C56240 روی بدنه حرکت کند. صدای محیط استودیویی مینیمال، یک ضرب Bass نرم و صدای کلیک دقیق هنگام روشنشدن دستگاه. بدون نوشته و بدون لوگوی ساختگی.
۲. ویدیوی عمودی شبکه اجتماعی
ویدیوی ۹:۱۶ دهثانیهای بساز: در ثانیه اول نمای Macro از دانه قهوه، سپس Match Cut به ریختن قهوه در فنجان. نور صبح گرم، حرکت طبیعی بخار، صدای آسیاب و ریختن مایع همزمان. هیچ متن داخل تصویر تولید نکن.
۳. ویرایش رنگ و محیط کلیپ
این ویدیو را ویرایش کن؛ حرکت و زمانبندی سوژه تغییر نکند. محیط را به استودیوی گرافیتی تیره با Accent مسی تبدیل کن، نور Key از سمت چپ باشد و انعکاسهای ناخواسته حذف شوند. گفتار اصلی حفظ شود و فقط نویز پسزمینه کمتر شود.
۴. شات آموزشی کوتاه
یک ویدیوی ۱۰ ثانیهای آموزشی از گردش آب در طبیعت بساز. یک شات پیوسته با حرکت دوربین از سطح دریا به ابر و سپس بارش؛ سبک واقعگرای علمی، برچسب یا متن داخل تصویر نداشته باشد. Narration فارسی کوتاه و افکت باد و باران هماهنگ باشد.
۵. اصلاح مکالمهای با Constraint
روی خروجی قبلی فقط این سه تغییر را اعمال کن: حرکت دوربین ۳۰٪ آهستهتر، نور پسزمینه گرمتر و موسیقی کمحجمتر. چهره، لباس، کادر، دیالوگ و طول کلیپ دقیقاً تا حد امکان حفظ شوند. اگر حفظ کامل ممکن نیست، تغییرات دیگر ایجاد نکن.
بنچمارکها و ارزیابی عملکرد
Google برای Gemini Omni Flash نتیجههای Human Preference منتشر کرده، اما در صفحه قابل بررسی امتیاز عددی مدل و رقبا را ارائه نکرده است. جدول زیر بهجای ساختن عدد، رتبه یا نتیجه اعلامشده، اندازه نمونه و وضعیت انتشار را نشان میدهد. همه موارد Vendor-reported هستند و ارزیابی مستقل محسوب نمیشوند.
| Benchmark / ارزیابی و مفهوم | Gemini Omni Flash | رقبای مستقیم | اندازه و تاریخ | منبع / ملاحظه |
|---|---|---|---|---|
| Video Editing Internal؛ ترجیح کلی و پیروی از دستور | نتیجه پیشرو؛ امتیاز عددی منتشر نشده | مدلهای پیشرو، نام و امتیاز منتشر نشده | ۵۰۴ مثال؛ مه ۲۰۲۶ | صفحه رسمی Gemini Omni؛ Vendor-reported |
| MovieGenBench؛ Text-to-Video با ترجیح انسانی و پیروی از دستور | بهترین نتیجه اعلامشده؛ عدد منتشر نشده | خروجی مدلهای ویدیویی رقیب؛ اعداد منتشر نشده | ۱٬۰۰۳ Prompt؛ مه ۲۰۲۶ | Benchmark عمومی Meta، ارزیابی گزارششده Google |
| Fast Motion Internal؛ حرکتهای ورزشی و پرشتاب | نمودار نتیجه معرفی شده، عدد قابلبررسی در متن منتشر نشده | نام و عدد رقبا منتشر نشده | ۵۰۰ Prompt؛ مه ۲۰۲۶ | صفحه رسمی Gemini Omni؛ Vendor-reported |
| VBench I2V؛ ساخت ویدیو از تصویر و متن | مشترکاً در گروه پیشرو؛ عدد منتشر نشده | Grok Imagine Video و Kling نیز همرتبه پیشرو | ۳۵۵ جفت تصویر و متن؛ مه ۲۰۲۶ | صفحه رسمی Gemini Omni؛ Vendor-reported |
| Reference-to-Video Internal؛ ترجیح کلی و پایبندی گفتار | نتیجه پیشرو؛ عدد منتشر نشده | مدلهای پیشرو، نام و امتیاز کامل منتشر نشده | ۴۶۸ مثال؛ مه ۲۰۲۶ | صفحه رسمی Gemini Omni؛ Vendor-reported |
نتایج رسمی، قوت مدل در پیروی از دستور، ویرایش و هماهنگی مرجع با گفتار را نشان میدهند. VBench I2V نیز برتری مطلق را تأیید نمیکند؛ Omni با Grok Imagine Video و Kling در گروه پیشرو مساوی گزارش شده است.
تا تاریخ ۱۲ سپتامبر ۲۰۲۶، ارزیابی مستقل عمومی با امتیازهای قابلبازتولید و همشرط برای شناسه دقیق gemini-omni-flash-preview پیدا نشد. بنابراین رتبه رسمی را نباید حکم قطعی بازار دانست. نبود Promptها، Seedها، خروجی خام، نام کامل همه رقبا و Confidence Interval امکان مقایسه دقیق را محدود میکند.
برای Eval واقعی، حداقل ۳۰ Prompt از سبک خودتان انتخاب کنید و هر خروجی را کور و دونفره از نظر پیروی از دستور، تداوم سوژه، فیزیک حرکت، همزمانی صدا، Artifact و هزینه بسنجید. این روش برای انتخاب مدل ویدیو از یک رتبه کلی مفیدتر است.
مقایسه Gemini Omni Flash با رقبا
| مدل | انتخاب بهتر برای | ملاحظه اصلی |
|---|---|---|
| Gemini Omni Flash Preview | ویرایش مکالمهای و کلیپ 720p کوتاه با صدای بومی | Preview و محدودیت کنترلهای نسل پایه |
| Gemini Omni 1.1 Flash | پروژه جدید با Extend، First/Last Frame، 360p Draft و خروجی تا 4K | شناسه و قابلیتهای متفاوت؛ مقاله پایه نباید با آن ادغام شود |
| Kling | Workflowهای Image-to-Video؛ در VBench رسمی Google همرتبه Omni گزارش شده | عدد دقیق مقایسه منتشر نشده و نسخه Kling باید مشخص باشد |
| Grok Imagine Video | گزینه مستقیم Image-to-Video؛ در همان VBench همرتبه گزارش شده | نتیجه فقط یک ارزیابی Vendor-reported است |
برای ساخت جدید در اکوسیستم Google، Omni 1.1 معمولاً انتخاب کاملتری است. Gemini Omni Flash پایه زمانی معنا دارد که Workflow موجود به همین Endpoint وابسته باشد یا تیم بخواهد رفتار نسل اول را مقایسه کند. Kling و Grok در ارزیابی I2V رسمی همسطح گزارش شدهاند و برای این سناریو A/B Test ضروری است.
قیمت و API
صفحه رسمی Google Cloud در ۱۲ سپتامبر ۲۰۲۶ نرخهای زیر را برای Gemini Omni Flash و Omni 1.1 Flash منتشر کرده است:
| نوع مصرف | قیمت رسمی |
|---|---|
| Input متن، تصویر، ویدیو یا صوت | ۱٫۵۰ دلار برای هر یک میلیون توکن |
| Text Output و Reasoning | ۹ دلار برای هر یک میلیون توکن |
| Video Output با صدا | ۱۷٫۵۰ دلار برای هر یک میلیون توکن |
برای ورودی، هر تصویر ۱٬۱۲۰ توکن، هر ثانیه صوت ۳۲ توکن و هر ثانیه ویدیو ۵٬۷۹۲ توکن محاسبه میشود. برای خروجی ویدیو، نرخ Tokenization برابر ۱٬۹۳۱ توکن در ثانیه 360p، ۵٬۷۹۲ در 720p، ۸٬۶۸۸ در 1080p و ۱۷٬۳۷۶ در 4K است.
نسخه پایه طبق صفحه فنی فقط 720p ارائه میکند. با فرمول رسمی، ده ثانیه خروجی 720p حدود ۵۷٬۹۲۰ توکن و تقریباً ۱٫۰۱ دلار هزینه Video Output دارد؛ ورودی و Text/Reasoning جدا محاسبه میشوند. نرخ تقریبی ۰٫۱۰ دلار برای هر ثانیه 720p با همین محاسبه سازگار است.
قیمت منتشرشده به معنی دسترسی بدون محدودیت نیست. صفحه مدل Fixed Quota را پشتیبانیشده و گزینههای معمول Batch، Provisioned Throughput و Pay-as-you-go را پشتیبانینشده ثبت کرده است. Free Tier عمومی قابلتأییدی برای این Endpoint پیدا نشد؛ وضعیت پروژه و صورتحساب را در Console بررسی کنید.
Gemini Omni Flash را در Buffalo147 AI امتحان کنید
با یک شات کوتاه و دقیق شروع کنید: سوژه، حرکت دوربین، نور، مدت، نسبت تصویر و طراحی صدا را روشن بنویسید. پس از خروجی اول فقط یک یا دو متغیر را تغییر دهید تا بفهمید مدل کدام بخش دستور را واقعاً کنترل میکند.
شروع استفاده از Gemini Omni Flash در Buffalo147 AI
جمعبندی
Gemini Omni Flash ایده مهمی را وارد تولید ویدیو کرد: ساخت و ویرایش صحنه با مکالمه، در یک مدل که صدا را نیز همزمان تولید میکند. نتایج رسمی در پیروی از دستور و Video Editing امیدوارکنندهاند و Workflow آن برای ابزارهای خلاق جذاب است.
محدودیت اصلی، Preview بودن و فاصله امکانات Endpoint پایه با دامنه کامل Model Card و جانشین 1.1 است. Consistency، حرکت پیچیده و متن داخل ویدیو نیز هنوز نقاط پرریسکاند.
برای بررسی نسل اول Omni یا حفظ یک Integration موجود، این مدل ارزشمند است. برای پروژه تازه و خروجی حرفهای، Omni 1.1 را نیز حتماً ارزیابی کنید و انتخاب نهایی را با Promptهای واقعی، Blind Review و هزینه هر کلیپ انجام دهید.
پرسشهای متداول
Gemini Omni Flash چیست؟
مدل چندوجهی Google DeepMind برای ساخت و ویرایش مکالمهای ویدیوی کوتاه با گفتار، موسیقی و افکت صوتی است.
آیا Gemini Omni Flash همان Gemini Omni 1.1 Flash است؟
خیر. نسخه پایه شناسه gemini-omni-flash-preview دارد؛ 1.1 مدل جدیدتری با Extend، First/Last Frame، Draft 360p و خروجی تا 4K است.
آیا Gemini Omni Flash از متن ویدیو میسازد؟
بله. Text-to-Video و Video Editing در Endpoint پایه پشتیبانی میشوند و خروجی میتواند صدا نیز داشته باشد.
حداکثر طول ویدیو چقدر است؟
صفحه فنی نسخه پایه حداکثر طول ۱۰ ثانیه را با یا بدون صدا ثبت کرده است.
آیا مدل Image-to-Video دارد؟
در ارزیابی سطح مدل، Image-to-Video سنجیده شده است؛ اما صفحه فعلی Endpoint پایه این قابلیت مستقل را پشتیبانینشده نشان میدهد. قابلیت محصول مصرفکننده را به API تعمیم ندهید.
قیمت یک ویدیوی ۱۰ ثانیهای چقدر است؟
Video Output دهثانیهای 720p بر اساس نرخ رسمی حدود ۱٫۰۱ دلار است؛ هزینه ورودی و Reasoning جدا اضافه میشود.
آیا Gemini Omni Flash API رایگان دارد؟
Free Tier عمومی قابلتأیید پیدا نشد. Endpoint Preview است و دسترسی میتواند به پروژه، Region و Fixed Quota وابسته باشد.
آیا Benchmark مستقل برای مدل وجود دارد؟
در زمان بررسی، نتیجه مستقل عمومی و همشرط برای Exact Model ID پیدا نشد. Google نتایج ترجیح انسانی منتشر کرده، اما امتیازهای عددی کامل رقبا را ارائه نکرده است.
منابع
- صفحه رسمی Gemini Omni
- Model Card رسمی Gemini Omni Flash
- مستند Endpoint نسخه Preview در Google Cloud
- قیمت رسمی Gemini Omni
- معرفی رسمی دسترسی توسعهدهندگان
- معرفی رسمی Gemini Omni 1.1 Flash
یادداشت تحریریه Buffalo147 AI: همه نتایج Benchmark این مقاله Vendor-reported هستند و Google امتیازهای عددی کامل را منتشر نکرده است. بهجای حدس، نتیجه کیفی، اندازه نمونه و محدودیت مقایسه ثبت شدهاند.