توقف پروژهٔ Sora و تداوم Veo: واگرایی راهبردی OpenAI و گوگل در میدان ویدئوی مولد

زمان مطالعه: ۵ دقیقه

تصمیم OpenAI به توقف پروژهٔ تولید ویدئوی Sora در برابر عرضهٔ مدل Veo 3.1 Lite توسط گوگل، نه یک عقب‌نشینی ساده، که بازتابی از بازآرایی راهبردی عمیق‌تری در صنعت هوش مصنوعی مولد است. این دو حرکت هم‌زمان، شکاف میان «جاه‌طلبی پژوهشی» و «واقع‌گرایی تجاری» را در یکی از پرمصرف‌ترین حوزه‌های محاسباتی عیان می‌کند و نشان می‌دهد که مسیر رسیدن به تولید ویدئوی مولد در مقیاس انبوه، هنوز با موانع اقتصادی، فنی و حقوقی پرشماری روبروست.


۱. کالبدشکافی توقف Sora: اقتصاد واحد و چالش استنتاج

پروژهٔ Sora که در فوریهٔ ۲۰۲۴ با نمایش خیره‌کننده‌ای از تولید ویدئوهای یک‌دقیقه‌ای از طریق دیفیوژن فضازمانی معرفی شد، از همان ابتدا با پرسش‌های بی‌پاسخ دربارهٔ هزینهٔ استنتاج و مدل تجاری همراه بود. بر اساس گزارش‌های داخلی، هزینهٔ استنتاج هر دقیقه ویدئوی Sora با کیفیت 1080p، بین ۸ تا ۱۵ دلار برآورد می‌شد – رقمی که در مقایسه با قیمت‌گذاری اشتراک ChatGPT Pro (200 دلار در ماه)، هرگونه ارائهٔ انبوه را به شدت زیان‌ده می‌ساخت. سه عامل کلیدی در توقف این پروژه مؤثر بوده‌اند:

  • فشار اقتصادی ناشی از بازگشت سرمایه: OpenAI که پیشتر ۱۲۲ میلیارد دلار سرمایه جذب کرده، تحت فشار سرمایه‌گذاران برای نشان دادن مسیر روشنی به سوی سودآوری قرار دارد. نگهداری زیرساخت استنتاج Sora نیازمند تخصیص بخش قابل‌توجهی از کلاسترهای گران‌بهای NVIDIA H100/B200 بود که می‌توانست به جای تولید ویدئوی زیان‌ده، صرف آموزش مدل‌های زبانی نسل بعد (GPT-5.5) یا استنتاج مدل‌های پرحاشیه‌تر شود. تحلیلگران داخلی OpenAI به این نتیجه رسیدند که «هزینهٔ فرصت» تخصیص GPU به Sora، در قیاس با تخصیص همان منابع به APIهای متنی و کدنویسی، غیرقابل توجیه است.
  • فروپاشی کیفیت در ویدئوهای بلند: در حالی که کلیپ‌های کوتاه Sora از انسجام فضایی خوبی برخوردار بودند، تداوم منطقی صحنه در ویدئوهای بیش از ۳۰ ثانیه به سرعت افت می‌کرد. اشیاء تغییر ماهیت می‌دادند، چهره‌ها ناپایدار می‌شدند و پدیدهٔ «رانش زمینه» (Context Drift) پدیدار می‌گشت. این چالش فنی که ریشه در معماری دیفیوژن-ترنسفورمر مدل دارد، نیازمند یک جهش الگوریتمی بود، نه صرفاً افزایش مقیاس آموزش.
  • موانع حقوقی و اعتباری: با افزایش نگرانی‌ها دربارهٔ دیپ‌فیک و سوءاستفاده‌های انتخاباتی، OpenAI با ریسک حقوقی فزاینده‌ای مواجه بود. هزینهٔ تطبیق‌پذیری (Compliance) و واترمارک‌گذاری مقاوم برای خروجی‌های ویدئویی، لایهٔ دیگری از پیچیدگی عملیاتی را اضافه می‌کرد که در نهایت، ترازوی هزینه-فایده را به ضرر Sora سنگین‌تر کرد.

۲. Veo 3.1 Lite: رویکرد سبک‌وزن و عمل‌گرای گوگل

در نقطهٔ مقابل، گوگل با معرفی Veo 3.1 Lite به شکل غیرمستقیم بر تعهد خود به این حوزه تأکید کرد، اما با رویکردی به‌طرز چشمگیری متفاوت از Sora. Veo 3.1 Lite یک مدل «سبک‌وزن» از خانوادهٔ Veo است که به‌جای رقابت در تولید ویدئوهای سینمایی بلند، بر کلیپ‌های ۴ تا ۸ ثانیه‌ای با تأخیر زیر ۵ ثانیه متمرکز شده است. این مدل با بهره‌گیری از معماری ترکیبی «دیفیوژن + مدل زبانی بصری» (Diffusion + VLM) و اجرای مستقیم روی واحدهای پردازش تانسوری نسل ششم (TPUv6)، هزینهٔ هر ثانیه ویدئو را تا یک‌پنجم نسل قبلی کاهش داده است.

دلایل تداوم راهبردی گوگل در این حوزه عبارت‌اند از:

  • یکپارچگی عمودی با YouTube: مالکیت گوگل بر YouTube، بزرگ‌ترین پلتفرم ویدئویی جهان، یک مزیت ساختاری بی‌بدیل است. Veo 3.1 Lite می‌تواند بدون نیاز به جذب کاربران جدید، مستقیماً در ابزارهای تولید محتوای YouTube (مانند YouTube Create) ادغام شود و درآمدزایی را از طریق تبلیغات یا اشتراک کانال‌ها محقق سازد.
  • مدل «انبوه-ارزان»: گوگل به جای تعقیب کیفیت سینمایی، استراتژی «تعداد بالا، هزینهٔ پایین» را برگزیده است. در این مدل، تولید میلیاردها کلیپ کوتاه برای تبلیغات برنامه‌ای (Programmatic Ads)، پیش‌نمایش محتوا و شبکه‌های اجتماعی، بازار بزرگ‌تری نسبت به ویدئوهای بلند داستانی ایجاد می‌کند و هزینهٔ استنتاج را در مقیاس انبوه توجیه‌پذیر می‌سازد.
  • تعویق ریسک به آینده: عرضهٔ مدل Lite به گوگل امکان می‌دهد که ضمن حفظ حضور خود در میدان، چالش‌های کیفیت ویدئوهای بلند را به نسل‌های بعدی (Veo 4) موکول کند، بی‌آنکه وعده‌ای زودهنگام داده باشد که نتواند به آن عمل کند.

۳. داده‌های تقریبی مقایسهٔ فنی-اقتصادی

جدول زیر مقایسهٔ تخمینی دو رویکرد را بر اساس گزارش‌های صنعتی نشان می‌دهد:

شاخصOpenAI Sora (متوقف‌شده)Google Veo 3.1 Lite
حداکثر طول ویدئو۶۰ ثانیه۸ ثانیه
هزینهٔ تقریبی هر دقیقه ویدئو۸ تا ۱۵ دلار۱.۵ تا ۳ دلار (معادل‌سازی)
تأخیر تولید هر کلیپ۲ تا ۱۰ دقیقهزیر ۵ ثانیه
رزولوشن خروجی1080p720p (Lite)
تعداد GPU/TPU مورد نیاز برای استنتاج هم‌زمان ۱۰۰۰ کاربر~۴۰,۰۰۰ H100~۸,۰۰۰ TPUv6
تعداد کاربران فعال ماهانه (تخمینی)≤ ۱۰۰,۰۰۰ (دسترسی محدود)≥ ۵ میلیون (در اکوسیستم Google)
مدل درآمدیاشتراک مستقیم (برنامه‌ریزی‌شده)تبلیغات + اشتراک YouTube
وضعیت حقوقی/تنظیمیریسک بالا، نیازمند واترمارکینگ مقاومریسک مدیریت‌شده از طریق Content ID موجود

۴. پیامدهای راهبردی: واگرایی در فلسفهٔ محصول

توقف Sora و تداوم Veo، بیش از آنکه یک پیروزی یا شکست ساده باشد، نشان‌دهندهٔ یک واگرایی فلسفی در صنعت هوش مصنوعی است:

  • OpenAI به وضوح در حال اولویت‌بندی مجدد منابع محدود خود به سمت مدل‌های زبانی و استدلالی است که حاشیهٔ سود بالاتر، مسیر روشن‌تری به سوی ASI و کاربردهای سازمانی فوری‌تری دارند. توقف Sora را باید در ادامهٔ همان منطقی دید که منجر به بازنگری در طرح‌های عظیم مراکز داده شد: بازگشت به هستهٔ اصلی کسب‌وکار (زبان و کد) و پرهیز از انحراف منابع به حوزه‌هایی که هنوز مدل اقتصادی پایداری ندارند.
  • گوگل با پذیرش یک نسخهٔ «به‌اندازهٔ کافی خوب» (Good Enough) از فناوری ویدئوی مولد، عملاً در حال آزمایش و تربیت بازار است، بی‌آنکه خود را در معرض ریسک‌های مالی یا اعتباری یک رونمایی بزرگ قرار دهد. این رویکرد محافظه‌کارانه اما مستمر، با استراتژی تاریخی گوگل در ورود تدریجی به بازارهای نوظهور هم‌خوانی دارد.

پیامد بلندمدت این واگرایی، آن است که میدان ویدئوی مولد احتمالاً به دو لایه تفکیک خواهد شد: یک لایهٔ «انبوه-ارزان» که در اختیار بازیگران دارای پلتفرم توزیع (مانند گوگل/YouTube و احتمالاً Meta/Instagram) خواهد بود، و یک لایهٔ «حرفه‌ای-گران» که استودیوهای جلوه‌های ویژه و تولید محتوا (مانند Runway) آن را هدف می‌گیرند. شرکت‌هایی که نه پلتفرم توزیع دارند و نه بازار تخصصی، در میانهٔ این دو لایه گرفتار خواهند شد – سرنوشتی که ظاهراً OpenAI با توقف Sora از آن گریخته است.

مقاله رو دوست داشتی؟ نظرت چیه؟

۹ پاسخ به “توقف پروژهٔ Sora و تداوم Veo: واگرایی راهبردی OpenAI و گوگل در میدان ویدئوی مولد”

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *