DiffusionGemma: پایان «تایپ‌رایتر» و آغاز «ماشین چاپ» در عصر هوش مصنوعی محلی

زمان مطالعه: ۶ دقیقه

«در حالی که میدان نبرد مدل‌ها به سمت “ممنوعیت‌های دولتی” و “امنیت ملی” می‌رفت، گوگل یک “انقلاب زیرساختی” خاموش به راه انداخت: با الهام از دنیای تصویر، قواعد تولید متن را از “تک‌تک حروف” به “یک‌باره صفحه” تغییر داد. این یعنی “هوش مصنوعی سریع” حالا دیگر فقط برای ابر نیست؛ برای لپ‌تاپ شماست.»


مقدمه: وقتی «نویز تصادفی» به «متن هوشمند» تبدیل می‌شود

در تاریخ ۱۰ ژوئن ۲۰۲۶، گوگل از مدل آزمایشی منبع‌باز DiffusionGemma رونمایی کرد. اما این مدل، برخلاف تمام مدل‌های زبانی بزرگ متداول، یک قدم به عقب و یک جهش به جلو برداشت: به جای «تولید کلمه‌به‌کلمه»، از تکنیک «گسترش» (Diffusion) – همان تکنیکی که برای تولید تصاویر استفاده می‌شود – برای تولید متن استفاده کرد.

سه بازیگر اصلی این تحول عبارت‌اند از: Google DeepMind که با این مدل، مرز میان «تولید تصویر» و «تولید متن» را برای همیشه محو کرده است؛ توسعه‌دهندگان محلی که حالا می‌توانند با سخت‌افزار معمولی، مدلی با سرعت ۱۰۰۰ توکن در ثانیه را اجرا کنند؛ و اکوسیستم منبع‌باز که یک مدل ۲۶ میلیارد پارامتری با مجوز Apache 2.0 دریافت کرده است. پارادوکس ماجرا این است: گوگل برای «سریع‌تر کردن» متن، به «آهسته‌ترین» فرآیند در تصویر – یعنی حذف نویز گام‌به‌گام – پناه برده است؛ و نتیجه، انقلابی در «بهره‌وری سخت‌افزار» شده است.


معماری فنی: «بوم‌نقاشی ۲۵۶ توکنی» به جای «تایپ‌رایتر»

برای درک DiffusionGemma، باید تفاوت بنیادین آن با مدل‌های سنتی را فهمید:

  • مدل‌های سنتی (Autoregressive): مانند یک تایپ‌رایتر عمل می‌کنند؛ کلمه به کلمه، از چپ به راست، و هر کلمه به کلمه‌ی قبلی وابسته است. این روش در ابر کارآمد است (چون هزاران کاربر را همزمان پردازش می‌کند)، اما در اجرای محلی، گلوگاه «پهنای باند حافظه» (Memory Bandwidth) ایجاد می‌کند: GPU باید وزن‌های مدل را برای هر توکن از حافظه بارگذاری کند و بخش اعظم توان پردازشی خود را بیکار نگه می‌دارد.
  • DiffusionGemma: مانند یک «ماشین چاپ» یا «بوم‌نقاشی» عمل می‌کند. به جای تولید توکن‌به‌توکن، یک «بوم» (Canvas) به اندازه ۲۵۶ توکن را با توکن‌های تصادفی پر می‌کند و سپس طی چندین مرحله، این توکن‌های تصادفی را هم‌زمان به سمت متن نهایی «پالایش» (Denoise) می‌کند. این یعنی GPU یک بار، یک بلوک کامل ۲۵۶ توکنی را پردازش می‌کند و گلوگاه را از «پهنای باند حافظه» به «قدرت محاسبات» منتقل می‌سازد – و دقیقاً همان جایی که GPUها در آن قوی هستند.

معماری دقیق این مدل:

  • پایه: بر اساس خانواده Gemma 4 با معماری Mixture-of-Experts (MoE) ۲۶ میلیارد پارامتری ساخته شده است.
  • پارامترهای فعال: در هر بار استنتاج، تنها ۳.۸ میلیارد پارامتر فعال می‌شوند.
  • پنجره متنی: ۲۵۶ توکن در هر «بوم»؛ برای متون بلندتر، از مکانیزم «بلوک خودرگرسیون گسترش» (Block Autoregressive Diffusion) استفاده می‌کند که بوم‌های ۲۵۶ توکنی را پشت سر هم پردازش می‌کند.
  • ورودی چندوجهی: به‌صورت بومی از ورودی‌های متن، تصویر و ویدئو پشتیبانی می‌کند.
  • معماری: از یک رمزگزار خودرگرسیون (Encoder) برای پردازش پرامپت و یک رمزگشای دوطرفه (Decoder with Bidirectional Attention) برای تولید متن استفاده می‌کند.
  • حالت تفکر (Thinking Mode): دارای کانال‌های استدلال قابل‌پیکربندی برای حل مسائل گام‌به‌گام است.

عملکرد: ۴ برابر سریع‌تر، با یک‌چهارم حافظه

اعداد عملکرد DiffusionGemma، مرزهای ممکن را جابه‌جا کرده است:

  • سرعت خیره‌کننده: روی یک NVIDIA H100، به بیش از ۱۰۰۰ توکن در ثانیه می‌رسد. روی GeForce RTX 5090، سرعت به ۷۰۰+ توکن در ثانیه می‌رسد. این یعنی ۴ برابر سریع‌تر از مدل‌های خودرگرسیون هم‌تراز در همان سخت‌افزار. در مقام مقایسه، Gemma 4 26B A4B با MTP تنها به ۳۰۰+ توکن در ثانیه می‌رسد.
  • حافظه کم‌مصرف: با وجود ۲۶ میلیارد پارامتر، به لطف معماری MoE و کوانتیزاسیون، تنها ۱۸ گیگابایت VRAM اشغال می‌کند – یعنی روی یک RTX 4090 به‌راحتی اجرا می‌شود.
  • توانایی خوداصلاحی: مدل می‌تواند در حین تولید، کل بلوک ۲۵۶ توکنی را هم‌زمان ارزیابی کرده و اشتباهات را اصلاح کند. این برخلاف مدل‌های سنتی است که پس از تولید یک توکن، راه برگشتی ندارند.
  • عملکرد در بنچمارک‌ها: در LiveCodeBench امتیاز ۳۰.۹٪، در BigCodeBench امتیاز ۴۵.۴٪ و در HumanEval امتیاز ۸۹.۶٪ کسب کرده است. در AIME 2025 نیز امتیاز ۲۳.۳٪ را ثبت کرده است.

قمار استراتژیک گوگل: «سرعت» در برابر «کیفیت»

گوگل با DiffusionGemma، یک قمار عمدی انجام داده است. این مدل به‌صراحت یک «مدل آزمایشی» (Experimental) معرفی شده است و گوگل تأکید کرده که کیفیت خروجی آن از Gemma 4 استاندارد پایین‌تر است.

این قمار در چه نقطه‌ای تعریف می‌شود؟

  • مخاطب هدف: محققان و توسعه‌دهندگانی که به دنبال سرعت در تعاملات محلی هستند، نه حداکثر کیفیت برای تولید محتوای نهایی.
  • موارد استفاده ایده‌آل: ویرایش درون‌خطی (In-line Editing)، تکمیل کد (Code Completion)، تولید ساختارهای غیرخطی مانند دنباله‌های اسید آمینه یا گراف‌های ریاضی.
  • محدودیت‌ها: در بارهای کاری با QPS بالا (درخواست در ثانیه) در ابر، مزیت سرعت آن کاهش می‌یابد و مدل‌های خودرگرسیون همچنان کارآمدتر هستند.

به عبارت دیگر، گوگل با DiffusionGemma، یک «مسیر موازی» برای هوش مصنوعی گشوده است: یک مسیر برای «کیفیت» (Gemma 4) و یک مسیر برای «سرعت» (DiffusionGemma). و این دقیقاً همان چیزی است که اکوسیستم منبع‌باز به آن نیاز داشت: آزادی انتخاب بین «بهترین» و «سریع‌ترین».


جدول مقایسه: DiffusionGemma در برابر Gemma 4

ویژگیDiffusionGemmaGemma 4 (استاندارد)
روش تولیدگسترش (Diffusion) – هم‌زمان و بلوکیخودرگرسیون (Autoregressive) – توکن‌به‌توکن
معماری۲۶B MoE (۳.۸B فعال)۲۶B MoE (۴B فعال)
سرعت (H100)۱۰۰۰+ توکن/ثانیه~۳۰۰+ توکن/ثانیه (با MTP)
حافظه موردنیاز~۱۸GB VRAM~۱۸GB VRAM
کیفیت خروجیپایین‌تر از Gemma 4استاندارد طلایی
موارد استفادهتعاملات محلی، ویرایش لحظه‌ای، کدنویسیتولید محتوای باکیفیت
مجوزApache 2.0Apache 2.0
وضعیتآزمایشی (Experimental)تولیدی (Production)

«لحظه‌ای که متن از تصویر الهام گرفت»

نام این رویداد را باید «لحظه هم‌گرایی» گذاشت. DiffusionGemma نشان داد که مرز بین «تولید تصویر» و «تولید متن» نه فقط قابل‌عبور، که می‌تواند منبعی برای نوآوری باشد. گوگل با الهام از Stable Diffusion، یک مدل زبانی ساخته که مثل یک نقاش عمل می‌کند: از یک بوم خالی شروع می‌کند، لایه‌به‌لایه آن را پر می‌کند، و در نهایت یک اثر کامل را هم‌زمان به نمایش می‌گذارد.

پرسش بی‌پاسخ این است: آیا «کیفیت» قربانی «سرعت» خواهد شد، یا با بهبودهای آینده، DiffusionGemma به سطح Gemma 4 خواهد رسید؟ گوگل خود تأکید کرده که از طریق فاین‌تونینگ می‌توان عملکرد آن را در وظایف خاص بهبود بخشید – و نمونه‌ی حل Sudoku با دقت ۱۰۰٪، گواه این ادعاست.

یک چیز قطعی است: DiffusionGemma با ۱۰۰۰ توکن در ثانیه و ۱۸ گیگابایت حافظه، ثابت کرد که «هوش مصنوعی سریع» دیگر فقط برای ابر نیست؛ حالا روی لپ‌تاپ شما نیز اجرا می‌شود. این مدل با معماری نوآورانه‌ی خود، به توسعه‌دهندگان محلی این امکان را داده که بدون نیاز به ابر، با سرعتی بی‌سابقه، برنامه‌های تعاملی هوش مصنوعی بسازند. سؤال این نیست که آیا این رویکرد جایگزین مدل‌های سنتی خواهد شد – که نخواهد شد. سؤال این است که آیا اکوسیستم منبع‌باز می‌تواند از این «دوگانگی سرعت و کیفیت» برای خلق نسل جدیدی از برنامه‌های محلی استفاده کند.

مقاله رو دوست داشتی؟ نظرت چیه؟

۱۳ پاسخ به “DiffusionGemma: پایان «تایپ‌رایتر» و آغاز «ماشین چاپ» در عصر هوش مصنوعی محلی”

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *