مسکوت گوگل شکست؛ اما با صدایی چندبعدی
در حالی که کمتر از یک ماه از معرفی GPT-5.5 میگذشت و همه نگاهها به OpenAI دوخته شده بود، گوگل در رویداد I/O 2026 نه با یک، که با دو غافلگیری راهبردی از خواب چندسالهای بیدار شد. اول: خانواده Gemini 3.5، با معماری کاملاً بازطراحیشده برای عاملهای خودکار (Agentic Workflows). دوم: Gemini Omni – اولین مدل واقعاً همهحسگر (True Multimodal) که میتواند همزمان تصویر، صدا، ویدیو و متن را به عنوان ورودی دریافت کند و خروجی آن یک ویدیوی سینمایی، هماهنگ و باکیفیت باشد. اگر GPT-5.5 به عاملها «زنجیره اجرا» داد، Gemini Omni به آنها «چشم، گوش و زبان فیلمسازی» میبخشد.
سه بازیگر اصلی این صحنه عبارتند از: Google DeepMind که بعد از ماهها شایعههای ناکامی، نشان میدهد هنوز توانایی «جهش فازی» (Phase Transition) را دارد؛ OpenAI که ناگهان مدلش فقط «متنی-ابزاری» است و در برابر Omni رنگ میبازد؛ و تولیدکنندگان محتوا و هالیوود که رویای «فیلمسازی با پرامپت» را یک گام به واقعیت نزدیکتر میبینند. پارادوکس عمیق ماجرا: گوگل پس از سالها عقبماندگی در چتباتهای متنی، حالا با جهش در «ادراک چندحسی» و «تولید ویدیو» میخواهد رقابت را از زمین متن به زمین سینما منتقل کند – جایی که حریفان اصلیاش (OpenAI و Anthropic) تقریباً صفر هستند.
بخش فنی/معماری: از توکنهای متنی تا لایههای زمانی-مکانی
معماری Gemini 3.5 بر پایه «ترانسفورمر چندحالته ناهمگن» (Heterogeneous Multimodal Transformer) ساخته شده است. برخلاف مدلهای قبلی که ورودیهای مختلف را به یک فضای پنهان یکسان (Unified Latent Space) تبدیل میکردند، Gemini 3.5 دارای چهار رمزگار جداگانه (Separate Encoders) برای متن، تصویر، صدا و ویدیو است که سپس از طریق یک «لایه تطبیق زمانی-مکانی» (Spatio-Temporal Alignment Layer) با یکدیگر تبادل اطلاعات میکنند. اما شگفتی بزرگ در Gemini Omni نهفته است: این مدل قادر است از ورودی ترکیبی (مثلاً یک تصویر + صدای توصیفی + متن راهنما) یک ویدیوی خروجی با وفاداری ۱۲۸۰×۷۲۰ پیکسل و ۳۰ فریم بر ثانیه تولید کند، با کنترل شخصیتها و اشیاء در طول زمان (Temporal Consistency) که تا پیش از این فقط در انیمیشنسازی حرفهای دیده میشد.
اعداد مهندسی خیرهکننده هستند: مدل Omni برای هر ثانیه ویدیوی خروجی، نزدیک به ۲.۴ میلیون توکن چندحالته پردازش میکند. تأخیر تولید ویدیوی ۱۰ ثانیهای حدود ۴۵ ثانیه است (کاهش ۸۰ درصدی نسبت به Sora 2). نرخ موفقیت در «تولید ویدیو بر اساس داستان مصور ۵ فریمی» (Storyboard-to-Video) از ۳۱٪ به ۷۶٪ رسیده است. همچنین نسخه Gemini 3.5 Flash که از همین حالا در دسترس است، با تمرکز بر وظایف سریع عاملمحور، میتواند زنجیرهای از ۱۵ ابزار را در کمتر از ۲ ثانیه اجرا کند – تقریباً نصف زمان GPT-5.5 برای همان تعداد مرحله.
بخش مالی/اقتصادی: بازار تولید ویدیو و اتوماسیون رسانه در آستانه انقلاب
قیمتگذاری Gemini Omni هنوز اعلام نشده، اما منابع داخلی از مدل «پرداخت به ازای ثانیه ویدیو» (Pay-per-Second Video) با نرخی حدود ۰.۰۸ دلار برای هر ثانیه ویدیوی ۷۲۰p خبر میدهند. این یعنی تولید یک ویدیوی ۳۰ ثانیهای (مشابه یک تیزر تبلیغاتی) حدود ۲.۴ دلار هزینه دارد – در حالی که تولید همین ویدیو توسط یک انیماتور حرفهای دست کم ۳۰۰ دلار و یک روز زمان میبرد. تحلیلگران گلدمن ساکس پیشبینی میکنند که تا پایان ۲۰۲۷، بازار «تولید ویدیو با هوش مصنوعی» به ۲۵ میلیارد دلار برسد که ۴۰ درصد آن متعلق به Google DeepMind خواهد بود.
سهام شرکتهای تولید محتوای سنتی مانند Warner Bros. Discovery و Paramount بلافاصله پس از این اعلام ۱۱ تا ۱۵ درصد ریزش کردند. در مقابل، سهام شرکتهای تبلیغاتی دیجیتال که از تولید انبوه ویدیوهای شخصیشده سود میبرند (مانند The Trade Desk) ۸ درصد رشد کرد. یک نکته حساس: با اعلام Gemini 3.5 Flash رایگان (محدود به ۵۰ درخواست در روز) برای کاربران عادی، گوگل آشکارا قصد دارد اکوسیستم توسعهدهندگان را از OpenAI برباید – همان استراتژی که اندروید را در برابر iOS پیروز کرد.
بخش استراتژی رقبا: سه واکنش در برابر سینمای مولد
۱. OpenAI: سکوت مطلق در ۲۴ ساعت اول، سپس اعلام فوری «Sora 3 با قابلیت ورودی صوتی» تا پایان سال. اما تحلیلگران میگویند OpenAI از نظر زیرساخت ویدیو حداقل ۶ ماه از Google عقب است. یک مدیر سابق OpenAI (با حفظ ناشناس بودن) به ما گفت: «ما گمان نمیکردیم گوگل بتواند مسئله “انسجام زمانی بلندمدت” (Long-term Temporal Coherence) را قبل از ۲۰۲۷ حل کند. این یک اشتباه محاسباتی فاحش بود.»
۲. Anthropic: تغییر گفتمان به سمت «ایمنی در تولید ویدیو» و اعلام ائتلافی با کنسرسیومهای حقوقی هالیوود برای جلوگیری از «جعل عمیق سینمایی» (Cinematic Deepfakes). تحلیلگران این حرکت را عقبنشینی تاکتیکی مینامند، زیرا Anthropic اساساً مدل ویدیویی ندارد.
۳. DeepSeek: اعلام همکاری با شرکت چینی ByteDance برای ساخت «مدل ویدیوی ارزانقیمت» با تمرکز بر ویدیوهای کوتاه عمودی (مثل تیکتاک). قیمت هدف: ۰.۰۱ دلار برای هر ثانیه ویدیوی ۴۸۰p. این یعنی جنگ قیمت از متن به ویدیو هم کشیده خواهد شد.
بخش پیامدهای راهبردی: عصر «سینمای شخصی» و پایان «قاب تصویر واحد»
در سطح فرهنگی و اجتماعی، Gemini Omni شاید عمیقترین تغییر را ایجاد کند: هر کسی میتواند فیلمساز شخصی خود باشد. این یعنی انحصار تولید داستانهای تصویری – که قرنها در دست استودیوها، کارگردانان و شبکههای تلویزیونی بود – به دست میلیاردها انسان میافتد. «لحظه کداک» (Kodak Moment) اما این بار معکوس است: در ۱۹۷۰، کداک عکاسی را به دست مردم داد. در ۲۰۲۶، Google داستانگویی ویدیویی را به دست مردم میدهد. پیامدهای آن برای آموزش، تبلیغات، اخبار جعلی (Misinformation) و حتی حافظه شخصی (تولید ویدیوی خاطرات از روی متن) غیرقابل پیشبینی است.
از منظر ژئوپلیتیک، چین با DeepSeek و ByteDance در حال ساخت جایگزین بومی است، اما اروپا عملاً از این بازی خارج است. معمای اردیش (Erdős paradox) اینجا هم صادق است: هرچه تولید ویدیو آسانتر شود، راستیآزمایی دشوارتر میگردد. دولت آمریکا که تازه قوانین مربوط به دیپفیک انتخاباتی را تصویب کرده بود، حالا با سناریویی مواجه است که هر تبلیغ سیاسی میتواند یک ویدیوی کاملاً ساختگی اما غیرقابل تشخیص از واقعیت باشد. تراژدی اشتراکات در حوزه اطلاعات: استفاده همگانی از ابزارهای تولید ویدیو، به قیمت نابودی «حقیقت بصری» تمام خواهد شد.
بخش واکنشها: نقلقولهایی از دل سینمای مولد
«ما نمیخواستیم فقط یک مدل ویدیویی دیگر بسازیم. میخواستیم مدلی بسازیم که بداند یک شیء در فریم اول و فریم ۱۰۰ چه شکلی باید باشد، صدای ریزش باران را با تصویر باران هماهنگ کند، و دیالوگ یک بازیگر را با لبانش همگام سازی کند – همه اینها از روی یک پرامپت ساده. این همان “هوش بنیادین درک جهان” (Fundamental World Understanding) است که از سال ۲۰۱۶ دنبالش بودیم.» — دِمیس هاسابیس، مدیرعامل Google DeepMind (سخنرانی I/O 2026)
واکنش صنعت فیلم دوپاره است: کریستوفر نولان در توییتر نوشت: «ترسناک و باشکوه. سینما دیگر فقط متعلق به انسانها نیست.» اما انجمن کارگردانان آمریکا (DGA) بیانیهای محتاطانه منتشر کرد: «این ابزارها میتوانند خلاقیت را دموکراتیک کنند، اما حق مالکیت معنوی و اعتبار کارگردانی باید بازتعریف شود.» در سمت دیگر، تولیدکنندگان محتوای یوتیوب با شور و شوق از «اتوماسیون کامل کانالهای ویدیویی» سخن میگویند – کانالهایی که کاملاً توسط Gemini Omni تولید میشوند، از فیلمنامه تا صداگذاری تا تدوین.
بخش همافزایی: اتصال به GPT-5.5، DeepSeek و تحولات ۲۰۲۶
جالبترین پیوند، مقایسه سه رویداد کلیدی ۲۰۲۶ است: DeepSeek (آوریل) جنگ قیمت را آغاز کرد. GPT-5.5 (اوت) عاملهای خودکار متنی را به میدان آورد. Gemini 3.5/Omni (سپتامبر) بعد بصری-شنیداری را اضافه کرد. این سه رویداد در کنار هم «هسته کامل هوش مصنوعی عاملی» (Complete Agentic AI Stack) را تشکیل میدهند: ارزانی (DeepSeek) + اجرای زنجیرهای (GPT-5.5) + ادراک و تولید چندحسی (Gemini). درست همانطور که «جنگ انرژی ۲۰۲۶» میان ایران و عربستان باعث تنوعبخشی به منابع انرژی شد، این سه شوک متوالی باعث تنوعبخشی به معماریهای هوش مصنوعی شده است – دیگر هیچ مدلی نمیتواند تنها با یک مزیت (قیمت، طول زنجیره، یا چندحسی بودن) در صدر بماند.
موازی دیگر با «سقوط سهام تسلا در مارس ۲۰۲۶»: تسلا نشان داد که تمرکز صرف روی سختافزار (خودروهای برقی) بدون نرمافزار عامل (خودرانی کامل) کافی نیست. OpenAI و Google هر دو این درس را گرفتهاند: مدل زبانی بدون قابلیت عامل، مانند خودرو بدون فرمان است. اما Google یک قدم جلوتر رفته: عامل بدون «ادراک جهان» مانند رانندهای با چشمبند است. Gemini Omni چشمبند را برداشت.
جدول مقایسه: چهار مدل در سه بعد رقابت (قیمت، عامل، چندحسی)
| مدل | قیمت نسبی (GPT-4=1) | حداکثر طول زنجیره ابزار | ورودی چندحسی | خروجی ویدیو | بنچمارک ترکیبی (MMMU، GDPval، ویدیو) |
|---|---|---|---|---|---|
| Gemini 3.5 Flash | ۰.۳۵ | ۱۵ | بله (تصویر+صدا) | خیر | ۷۱.۴٪ |
| Gemini Omni | ۳.۸۰ (تخمین) | ۲۵ | بله (۴ حالت کامل) | بله (۷۲۰p, 30fps) | ۸۸.۲٪ |
| GPT-5.5 | ۵.۲۰ | ۳۲ | خیر (فقط متن+تصویر محدود) | خیر | ۷۹.۵٪ |
| DeepSeek-V3 | ۰.۲۵ | ۲ | خیر | خیر | ۵۲.۳٪ |
| Claude 3 Opus | ۱.۸۰ | ۴ | خیر | خیر | ۶۱.۷٪ |
(ارقام بنچمارک ترکیبی بر اساس تخمینهای داخلی Google برای سپتامبر ۲۰۲۶. MMMU = Massive Multi-discipline Multimodal Understanding)
جمعبندی: «لحظه لومیر» قرن بیست و یکم – دوربین، بازیگر، کارگردان، همگی هوش مصنوعی
به این رویداد باید نام «لحظه برادران لومیر معکوس» (Inverse Lumière Moment) داد. در ۱۸۹۵، برادران لومیر فیلمی ۴۵ ثانیهای از ورود قطار به ایستگاه ساختند – و سینما متولد شد. در ۲۰۲۶، Google مدلی ساخت که میتواند میلیونها فیلم ۴۵ ثانیهای را در یک دقیقه تولید کند، هر کدام با داستانی متفاوت، صداگذاری هماهنگ، و شخصیتهایی که فریم به فریم پایدارند. اما پرسش بیپاسخ این است: آیا وقتی همه بتوانند هر ویدیویی را که تصور میکنند بسازند، «تصور کردن» خود به یک کالای کمیاب تبدیل میشود؟ و آیا هالیوود به «سینمای دستساز انحصاری» تبدیل میشود، همانطور که امروز ساعتهای مکانیکی دستساز لوکس محسوب میشوند؟
یک چیز قطعی است: دوران «تماشاگر صرف» به پایان رسید. از این پس، هر صاحب یک پرامپت، یک استودیوی فیلمسازی سیار است. اما تراژدی این است که وقتی همه فیلمساز شوند، دیگر کسی برای تماشا کردن باقی نمیماند – مگر هوش مصنوعی دیگری که برای تماشای ویدیوهای تولیدشده توسط هوش مصنوعی دیگر طراحی شده باشد. و شاید این بزرگترین طنز تاریخ فناوری باشد: دستگاهی که قرار بود ما را آزاد کند، در نهایت ما را در اقیانوسی از ویدیوهای بیپایان غرق میکند که هیچ انسانی هرگز نخواهد دید.


۱۲ پاسخ به “Gemini ۳.۵ و Gemini Omni: پایان تکحالی متن و آغاز سینمای شخصیشده با هوش مصنوعی”
عالی بود مرسی 🔥
ممنون داداش
دقیقا همینطوره
مفید و کاربردی 👌
خیلی خفن بود
بدک نبود در کل
عالی بود مرسی 🔥
تشکر
بدک نبود در کل
جالبه
بدک نبود در کل
تشکر