رونمایی گوگل از Gemini ۳.۵: از Flash تا Pro — گوگل با معماری SubCube، قیمت‌گذاری تهاجمی و عامل‌های خودمختار، فصل جدید رقابت هوش مصنوعی را رقم زد

زمان مطالعه: ۷ دقیقه

گوگل در ۲۹ اردیبهشت ۱۴۰۵ (۱۹ مه ۲۰۲۶) و در جریان کنفرانس سالانه Google I/O، از خانواده جدید مدل‌های هوش مصنوعی خود با نام Gemini 3.5 پرده برداشت. این رونمایی که در آمفی‌تئاتر Shoreline مانتین‌ویو کالیفرنیا انجام شد، شامل سه مدل Flash، Pro و Ultra است و به‌طور خاص بر روی قابلیت‌های «عامل‌های خودمختار» (Agentic Capabilities) و «وظایف چندمرحله‌ای بلندمدت» (Long-Horizon Tasks) متمرکز است. سوندار پیچای، مدیرعامل گوگل، در سخنرانی اصلی خود اعلام کرد که «عامل‌های هوش مصنوعی تاکنون تنها به ۰.۱٪ از مردم جهان رسیده‌اند و مأموریت گوگل، رساندن این توانمندی به میلیاردها کاربر است». این رونمایی که با کاهش قیمت‌های چشمگیر و عرضه هم‌زمان مدل‌های چندوجهی همراه بود، عملاً یک اعلان جنگ تمام‌عیار به OpenAI و Anthropic در هر دو جبهه «قابلیت» و «قیمت» محسوب می‌شود.

۱. معماری فنی: SubCube و MoE فوق‌ریزدانه

نوآوری اصلی در قلب Gemini 3.5 Flash، یک سازوکار توجه جدید به نام SubCube است که جایگزین Flash Attention استاندارد شده و در شرایط بهینه می‌تواند تا ۵۲ برابر سریع‌تر از سازوکارهای توجه پیشین عمل کند. این جهش در سرعت پردازش توجه، به Flash امکان می‌دهد که به‌طور پیش‌فرض از یک پنجره زمینه (Context Window) عظیم ۱ میلیون توکن پشتیبانی کند که در شرایط خاص می‌تواند تا ۱۲ میلیون توکن نیز افزایش یابد. این گستردگی پنجره زمینه، برای اجرای روان و بدون وقفه وظایف طولانی‌مدت عامل‌محور حیاتی است، چرا که عامل می‌تواند کل تاریخچه یک پروژه را بدون نیاز به خلاصه‌سازی یا فراموشی در حافظه خود نگه دارد.

دومین رکن معماری Gemini 3.5، استفاده از یک معماری «ترکیبی از متخصصان» (Mixture of Experts – MoE) با دانه‌بندی بسیار ریز است. برخلاف معماری‌های سنتی MoE که از ۸ یا ۱۶ متخصص تشکیل می‌شوند، مدل Flash از ۲۵۶ متخصص کوچک (Micro-Experts) بهره می‌برد و در هر بار پردازش، تنها ۴ متخصص از میان آن‌ها فعال می‌شوند. این رویکرد نوآورانه به مدل امکان می‌دهد تا ضمن حفظ تعداد پارامترهای فعال بسیار پایین، فضای ویژگی چندوجهی (Multimodal Feature Space) وسیعی را پوشش دهد و به تعادل بی‌سابقه‌ای میان کارایی و سرعت دست یابد. نتیجه این معماری، مدلی است که در بنچمارک‌های استدلال انتزاعی، به‌ویژه ARC-AGI-2 که توانایی یادگیری مفاهیم جدید را می‌سنجد، به امتیاز ۷۶.۲٪ دست یافته است.

۲. عملکرد و بنچمارک‌ها: سرعت چهار برابری در برابر GPT-5.5

ادعای اصلی گوگل در مورد سرعت Gemini 3.5 Flash این است که این مدل در خروجی توکن در ثانیه، ۴ برابر سریع‌تر از سایر مدل‌های مرزی از جمله GPT-5.5 xhigh و Claude Opus 4.7 عمل می‌کند و به سرعت ۲۸۹ توکن در ثانیه دست می‌یابد. در معیار «زمان تا اولین توکن» (TTFT)، Flash به رقمی در حدود ۶۵ میلی‌ثانیه رسیده است؛ این در حالی است که یک چشم بر هم زدن انسان بین ۱۰۰ تا ۱۵۰ میلی‌ثانیه زمان می‌برد. به بیان ساده، این مدل سریع‌تر از آن چیزی است که انسان بتواند مکث آن را حس کند.

این برتری صرفاً به سرعت ختم نمی‌شود. گوگل مدعی است که Flash در بنچمارک‌های کدنویسی و عامل‌محور، از مدل پرچمدار نسل قبلی خود یعنی Gemini 3.1 Pro پیشی گرفته است:

  • Terminal-Bench 2.1 (کدنویسی ترمینالی): ۷۶.۲٪ برای Flash در برابر ۷۰.۳٪ برای ۳.۱ Pro
  • GDPval-AA (وظایف با ارزش اقتصادی): ۱۶۵۶ Elo
  • MCP Atlas (جریان‌های کاری چندمرحله‌ای): ۸۳.۶٪ که بالاترین امتیاز در میان تمام مدل‌ها محسوب می‌شود
  • CharXiv Reasoning (درک چندوجهی): ۸۴.۲٪

در مقایسه مستقیم با GPT-5.5، تصویر رقابتی پیچیده‌تری پدیدار می‌شود. در حالی که Flash در وظایف ترمینالی به عملکردی نزدیک به GPT-5.5 دست می‌یابد و در MCP Atlas با ۸۳.۶٪ در برابر ۷۵.۳٪ پیشتاز است، در SWE-Bench Pro که یک معیار جامع مهندسی نرم‌افزار است، همچنان از GPT-5.5 و Claude Opus 4.7 عقب‌تر است. این الگوی عملکردی نشان می‌دهد که Flash برای حجم بالایی از وظایف عملی و تکراری مهندسی طراحی شده، در حالی که رقبا ممکن است در وظایفی که نیازمند درک عمیق‌تر و استدلال پیچیده‌ترند، برتری داشته باشند.

۳. عامل‌های خودمختار و پلتفرم Antigravity: قلب استراتژی جدید گوگل

شاید مهم‌ترین وجه تمایز Gemini 3.5، طراحی آن برای عصر «عامل‌های خودمختار» باشد. برخلاف رقبایی که عامل‌ها را به‌عنوان یک لایه اضافی بر روی مدل‌های زبانی موجود می‌سازند، گوگل مدل Flash را از اساس برای این منظور طراحی کرده است. در جریان یک نمایش زنده در I/O، مهندسان گوگل نشان دادند که چگونه می‌توان از ده‌ها عامل موازی مبتنی بر Flash برای ساخت یک سیستم‌عامل کامل از ابتدا استفاده کرد.

بستر اصلی این تحول، پلتفرم Antigravity 2.0 است؛ یک محیط توسعه یکپارچه (IDE) که به‌عنوان «زیستگاه بومی عامل‌ها» طراحی شده است. این پلتفرم به عامل‌ها امکان می‌دهد تا کد بنویسند، فایل‌ها را مدیریت کنند و وظایف طولانی‌مدت را بدون دخالت انسان به انجام برسانند. در نسخه بهینه‌سازی‌شده‌ای که گوگل در Antigravity ارائه می‌دهد، سرعت Flash تا ۱۲ برابر افزایش می‌یابد.

راهبرد گوگل برای استقرار این عامل‌ها، یک معماری دوگانه است. Gemini 3.5 Pro که در ماه ژوئن (خرداد/تیر ۱۴۰۵) عرضه خواهد شد، نقش «ارکستراتور و برنامه‌ریز» را ایفا می‌کند، در حالی که Flash به‌عنوان «زیرعامل‌های اجرایی» (Sub-agents) برای انجام وظایف سنگین و تکراری به کار گرفته می‌شود. به‌گفته تولسی دوشی، مدیر ارشد محصول گوگل، این عامل‌ها می‌توانند ساعت‌ها به‌طور مستقل کار کنند و تنها در نقاط تصمیم‌گیری حساس یا مواجهه با مشکلات امنیتی، از کاربر اجازه بگیرند.

۴. اقتصاد و قیمت‌گذاری: استراتژی «بهتر و ارزان‌تر»

گوگل در I/O 2026 تنها به برتری فنی بسنده نکرد، بلکه یک جنگ قیمتی تمام‌عیار را نیز آغاز نمود. قیمت API برای Flash به ازای هر ۱ میلیون توکن ورودی ۱.۵۰ دلار و برای خروجی ۹.۰۰ دلار تعیین شده است که آن را به‌طور قابل‌توجهی ارزان‌تر از GPT-5.5 (با قیمت ۵.۰۰ دلار برای ورودی) می‌کند. پیچای در سخنرانی خود با اشاره به صرفه‌جویی‌های ناشی از این قیمت‌گذاری گفت: «اگر شرکتی که روزانه ۱ تریلیون توکن مصرف می‌کند، ۸۰٪ از بار کاری خود را به مدل‌های Flash منتقل کند، می‌تواند سالانه بیش از ۱ میلیارد دلار صرفه‌جویی کند».

گوگل همچنین تغییراتی در ساختار اشتراک‌های خود اعمال کرد: بالاترین سطح اشتراک (AI Ultra) از ۲۵۰ دلار به ۲۰۰ دلار در ماه کاهش یافت و یک رده جدید ۱۰۰ دلاری نیز برای کاربرانی که به قابلیت‌های عامل‌محور سنگین نیاز دارند اما در سطح سازمانی نیستند، معرفی شد. این حرکت، مستقیماً فشار رقابتی بر OpenAI و مدل ۲۰۰ دلاری ChatGPT Pro آن وارد می‌کند.

۵. چشم‌انداز رقابتی: سه‌قطبی جدید هوش مصنوعی

رونمایی Gemini 3.5 را باید در چارچوب رقابت فشرده سه‌جانبه‌ای تحلیل کرد که اکنون میان گوگل، OpenAI و Anthropic در جریان است. هر یک از این سه بازیگر، استراتژی متمایزی را دنبال می‌کنند:

شاخصGoogle (Gemini 3.5)OpenAI (GPT-5.5)Anthropic (Claude Opus 4.7)
مدل پرچمدارFlash (اکنون)، Pro (ژوئن)GPT-5.5 xhighClaude Opus 4.7
نقطه قوت اصلیسرعت + عاملیتاستدلال عمیق + کدنویسیایمنی + دقت
قیمت ورودی (۱M token)۱.۵۰ دلار (Flash)۵.۰۰ دلار۶.۰۰ دلار
سرعت خروجی (tokens/sec)۲۸۹ (۴ برابر رقبا)~۷۲~۷۲
استراتژی غالبارزان‌تر + سریع‌تر + بومی در اکوسیستمقدرتمندترین + حق اشتراک بالاایمن‌ترین + سازمانی

استراتژی گوگل به‌وضوح بر «اقتصاد مقیاس» و «ادغام عمودی» استوار است. با ۹ میلیارد کاربر ماهانه اکوسیستم گوگل (شامل ۲.۵ میلیارد کاربر AI Overviews و ۱ میلیارد کاربر AI Mode)، این شرکت می‌تواند مدل‌های خود را مستقیماً در معرض دید گسترده‌ترین پایگاه کاربری جهان قرار دهد. این مزیت توزیع، رقبایی که فاقد چنین بستر عظیمی هستند را در موقعیت دشواری قرار می‌دهد.

۶. جمع‌بندی: پایان عصر «مدل‌های صرفاً گفتگوگر»

رونمایی از Gemini 3.5 نشان می‌دهد که صنعت هوش مصنوعی به‌طور قطعی از عصر «مدل‌های گفتگوگر» (Conversational Models) به عصر «عامل‌های خودمختار» (Autonomous Agents) وارد شده است. گوگل با ترکیب سه عنصر «سرعت چهار برابری»، «قیمت‌گذاری تهاجمی» و «ادغام عمیق در بزرگ‌ترین پایگاه کاربری جهان»، استاندارد جدیدی برای رقابت در این عرصه تعریف کرده است. سؤال راهبردی که اکنون پیش روی صنعت قرار دارد، این است: آیا OpenAI و Anthropic قادر خواهند بود با مزیت «قدرت استدلال» خود، در برابر موج «اقتصاد مقیاس» گوگل مقاومت کنند؟ یا اینکه عصر جدید هوش مصنوعی، بیش از آنکه به «باهوش‌ترین» مدل تعلق داشته باشد، به «در دسترس‌ترین» و «مقرون‌به‌صرفه‌ترین» آن تعلق خواهد یافت؟

مقاله رو دوست داشتی؟ نظرت چیه؟

۶ پاسخ به “رونمایی گوگل از Gemini ۳.۵: از Flash تا Pro — گوگل با معماری SubCube، قیمت‌گذاری تهاجمی و عامل‌های خودمختار، فصل جدید رقابت هوش مصنوعی را رقم زد”

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *