تصمیم OpenAI به توقف پروژهٔ تولید ویدئوی Sora در برابر عرضهٔ مدل Veo 3.1 Lite توسط گوگل، نه یک عقبنشینی ساده، که بازتابی از بازآرایی راهبردی عمیقتری در صنعت هوش مصنوعی مولد است. این دو حرکت همزمان، شکاف میان «جاهطلبی پژوهشی» و «واقعگرایی تجاری» را در یکی از پرمصرفترین حوزههای محاسباتی عیان میکند و نشان میدهد که مسیر رسیدن به تولید ویدئوی مولد در مقیاس انبوه، هنوز با موانع اقتصادی، فنی و حقوقی پرشماری روبروست.
۱. کالبدشکافی توقف Sora: اقتصاد واحد و چالش استنتاج
پروژهٔ Sora که در فوریهٔ ۲۰۲۴ با نمایش خیرهکنندهای از تولید ویدئوهای یکدقیقهای از طریق دیفیوژن فضازمانی معرفی شد، از همان ابتدا با پرسشهای بیپاسخ دربارهٔ هزینهٔ استنتاج و مدل تجاری همراه بود. بر اساس گزارشهای داخلی، هزینهٔ استنتاج هر دقیقه ویدئوی Sora با کیفیت 1080p، بین ۸ تا ۱۵ دلار برآورد میشد – رقمی که در مقایسه با قیمتگذاری اشتراک ChatGPT Pro (200 دلار در ماه)، هرگونه ارائهٔ انبوه را به شدت زیانده میساخت. سه عامل کلیدی در توقف این پروژه مؤثر بودهاند:
- فشار اقتصادی ناشی از بازگشت سرمایه: OpenAI که پیشتر ۱۲۲ میلیارد دلار سرمایه جذب کرده، تحت فشار سرمایهگذاران برای نشان دادن مسیر روشنی به سوی سودآوری قرار دارد. نگهداری زیرساخت استنتاج Sora نیازمند تخصیص بخش قابلتوجهی از کلاسترهای گرانبهای NVIDIA H100/B200 بود که میتوانست به جای تولید ویدئوی زیانده، صرف آموزش مدلهای زبانی نسل بعد (GPT-5.5) یا استنتاج مدلهای پرحاشیهتر شود. تحلیلگران داخلی OpenAI به این نتیجه رسیدند که «هزینهٔ فرصت» تخصیص GPU به Sora، در قیاس با تخصیص همان منابع به APIهای متنی و کدنویسی، غیرقابل توجیه است.
- فروپاشی کیفیت در ویدئوهای بلند: در حالی که کلیپهای کوتاه Sora از انسجام فضایی خوبی برخوردار بودند، تداوم منطقی صحنه در ویدئوهای بیش از ۳۰ ثانیه به سرعت افت میکرد. اشیاء تغییر ماهیت میدادند، چهرهها ناپایدار میشدند و پدیدهٔ «رانش زمینه» (Context Drift) پدیدار میگشت. این چالش فنی که ریشه در معماری دیفیوژن-ترنسفورمر مدل دارد، نیازمند یک جهش الگوریتمی بود، نه صرفاً افزایش مقیاس آموزش.
- موانع حقوقی و اعتباری: با افزایش نگرانیها دربارهٔ دیپفیک و سوءاستفادههای انتخاباتی، OpenAI با ریسک حقوقی فزایندهای مواجه بود. هزینهٔ تطبیقپذیری (Compliance) و واترمارکگذاری مقاوم برای خروجیهای ویدئویی، لایهٔ دیگری از پیچیدگی عملیاتی را اضافه میکرد که در نهایت، ترازوی هزینه-فایده را به ضرر Sora سنگینتر کرد.
۲. Veo 3.1 Lite: رویکرد سبکوزن و عملگرای گوگل
در نقطهٔ مقابل، گوگل با معرفی Veo 3.1 Lite به شکل غیرمستقیم بر تعهد خود به این حوزه تأکید کرد، اما با رویکردی بهطرز چشمگیری متفاوت از Sora. Veo 3.1 Lite یک مدل «سبکوزن» از خانوادهٔ Veo است که بهجای رقابت در تولید ویدئوهای سینمایی بلند، بر کلیپهای ۴ تا ۸ ثانیهای با تأخیر زیر ۵ ثانیه متمرکز شده است. این مدل با بهرهگیری از معماری ترکیبی «دیفیوژن + مدل زبانی بصری» (Diffusion + VLM) و اجرای مستقیم روی واحدهای پردازش تانسوری نسل ششم (TPUv6)، هزینهٔ هر ثانیه ویدئو را تا یکپنجم نسل قبلی کاهش داده است.
دلایل تداوم راهبردی گوگل در این حوزه عبارتاند از:
- یکپارچگی عمودی با YouTube: مالکیت گوگل بر YouTube، بزرگترین پلتفرم ویدئویی جهان، یک مزیت ساختاری بیبدیل است. Veo 3.1 Lite میتواند بدون نیاز به جذب کاربران جدید، مستقیماً در ابزارهای تولید محتوای YouTube (مانند YouTube Create) ادغام شود و درآمدزایی را از طریق تبلیغات یا اشتراک کانالها محقق سازد.
- مدل «انبوه-ارزان»: گوگل به جای تعقیب کیفیت سینمایی، استراتژی «تعداد بالا، هزینهٔ پایین» را برگزیده است. در این مدل، تولید میلیاردها کلیپ کوتاه برای تبلیغات برنامهای (Programmatic Ads)، پیشنمایش محتوا و شبکههای اجتماعی، بازار بزرگتری نسبت به ویدئوهای بلند داستانی ایجاد میکند و هزینهٔ استنتاج را در مقیاس انبوه توجیهپذیر میسازد.
- تعویق ریسک به آینده: عرضهٔ مدل Lite به گوگل امکان میدهد که ضمن حفظ حضور خود در میدان، چالشهای کیفیت ویدئوهای بلند را به نسلهای بعدی (Veo 4) موکول کند، بیآنکه وعدهای زودهنگام داده باشد که نتواند به آن عمل کند.
۳. دادههای تقریبی مقایسهٔ فنی-اقتصادی
جدول زیر مقایسهٔ تخمینی دو رویکرد را بر اساس گزارشهای صنعتی نشان میدهد:
| شاخص | OpenAI Sora (متوقفشده) | Google Veo 3.1 Lite |
|---|---|---|
| حداکثر طول ویدئو | ۶۰ ثانیه | ۸ ثانیه |
| هزینهٔ تقریبی هر دقیقه ویدئو | ۸ تا ۱۵ دلار | ۱.۵ تا ۳ دلار (معادلسازی) |
| تأخیر تولید هر کلیپ | ۲ تا ۱۰ دقیقه | زیر ۵ ثانیه |
| رزولوشن خروجی | 1080p | 720p (Lite) |
| تعداد GPU/TPU مورد نیاز برای استنتاج همزمان ۱۰۰۰ کاربر | ~۴۰,۰۰۰ H100 | ~۸,۰۰۰ TPUv6 |
| تعداد کاربران فعال ماهانه (تخمینی) | ≤ ۱۰۰,۰۰۰ (دسترسی محدود) | ≥ ۵ میلیون (در اکوسیستم Google) |
| مدل درآمدی | اشتراک مستقیم (برنامهریزیشده) | تبلیغات + اشتراک YouTube |
| وضعیت حقوقی/تنظیمی | ریسک بالا، نیازمند واترمارکینگ مقاوم | ریسک مدیریتشده از طریق Content ID موجود |
۴. پیامدهای راهبردی: واگرایی در فلسفهٔ محصول
توقف Sora و تداوم Veo، بیش از آنکه یک پیروزی یا شکست ساده باشد، نشاندهندهٔ یک واگرایی فلسفی در صنعت هوش مصنوعی است:
- OpenAI به وضوح در حال اولویتبندی مجدد منابع محدود خود به سمت مدلهای زبانی و استدلالی است که حاشیهٔ سود بالاتر، مسیر روشنتری به سوی ASI و کاربردهای سازمانی فوریتری دارند. توقف Sora را باید در ادامهٔ همان منطقی دید که منجر به بازنگری در طرحهای عظیم مراکز داده شد: بازگشت به هستهٔ اصلی کسبوکار (زبان و کد) و پرهیز از انحراف منابع به حوزههایی که هنوز مدل اقتصادی پایداری ندارند.
- گوگل با پذیرش یک نسخهٔ «بهاندازهٔ کافی خوب» (Good Enough) از فناوری ویدئوی مولد، عملاً در حال آزمایش و تربیت بازار است، بیآنکه خود را در معرض ریسکهای مالی یا اعتباری یک رونمایی بزرگ قرار دهد. این رویکرد محافظهکارانه اما مستمر، با استراتژی تاریخی گوگل در ورود تدریجی به بازارهای نوظهور همخوانی دارد.
پیامد بلندمدت این واگرایی، آن است که میدان ویدئوی مولد احتمالاً به دو لایه تفکیک خواهد شد: یک لایهٔ «انبوه-ارزان» که در اختیار بازیگران دارای پلتفرم توزیع (مانند گوگل/YouTube و احتمالاً Meta/Instagram) خواهد بود، و یک لایهٔ «حرفهای-گران» که استودیوهای جلوههای ویژه و تولید محتوا (مانند Runway) آن را هدف میگیرند. شرکتهایی که نه پلتفرم توزیع دارند و نه بازار تخصصی، در میانهٔ این دو لایه گرفتار خواهند شد – سرنوشتی که ظاهراً OpenAI با توقف Sora از آن گریخته است.


۹ پاسخ به “توقف پروژهٔ Sora و تداوم Veo: واگرایی راهبردی OpenAI و گوگل در میدان ویدئوی مولد”
خیلی خفن بود
پشمام چقدر خوب بود
عالی بود مرسی 🔥
پشمام چقدر خوب بود
مرسی بابت محتوای ناب
بدک نبود در کل
مفید و کاربردی 👌
خوب بود
بدک نبود در کل