راه‌اندازی سکوی FarsiVQA: طلوع «بینایی-مکالمه» فارسی و گشایش مرزهای دسترسی‌پذیری دیجیتال

زمان مطالعه: ۷ دقیقه

در ۳۰ مه ۲۰۲۶ (۹ خرداد ۱۴۰۵)، پژوهشکده هوش مصنوعی دانشگاه صنعتی شریف — همان نهادی که زیرساخت محاسباتی‌اش در فروردین امسال هدف حمله قرار گرفت — با رونمایی از سکوی «FarsiVQA» (سیستم پرسش و پاسخ بصری فارسی)، نشان داد که «نوآوری» در ایران نه‌تنها متوقف نشده، بلکه وارد عرصه‌های کاملاً جدیدی شده است. این سامانه که قادر است پرسش‌های کاربر را درباره تصاویر به زبان فارسی پاسخ دهد، نخستین پلتفرم بومی «پرسش و پاسخ بصری» (Visual Question Answering – VQA) برای زبان فارسی است و می‌تواند برای افراد کم‌بینا و نابینا، آموزش مجازی، تحلیل محتوای بصری شبکه‌های اجتماعی، و حتی کاربردهای پزشکی و صنعتی استفاده شود. نکتهٔ راهبردی آنکه نسخه اولیه این سامانه به‌صورت کاملاً متن‌باز در اختیار استارتاپ‌ها و توسعه‌دهندگان قرار گرفته است.


۱. VQA چیست و چرا FarsiVQA یک جهش محسوب می‌شود؟

پرسش و پاسخ بصری (Visual Question Answering) یکی از پیشرفته‌ترین شاخه‌های هوش مصنوعی چندوجهی است که در آن، مدل باید هم‌زمان «بینایی کامپیوتر» (برای درک تصویر) و «پردازش زبان طبیعی» (برای درک سؤال و تولید پاسخ) را با هم ترکیب کند. به زبان ساده، کاربر یک تصویر (مثلاً عکس یک خیابان شلوغ، یک بشقاب غذا، یا یک نمودار پزشکی) را به همراه یک پرسش متنی (مثلاً «چند ماشین در این تصویر هست؟»، «این غذا چه موادی داره؟»، یا «فلش نمودار به کدوم سمت اشاره می‌کنه؟») به سامانه می‌دهد، و سامانه باید پاسخی دقیق، مرتبط و به زبان طبیعی فارسی تولید کند.

این فناوری پیش‌تر عمدتاً برای زبان انگلیسی (توسط مدل‌هایی مانند GPT-4V، Gemini، و Claude) توسعه یافته بود. اما FarsiVQA نخستین سامانه‌ای است که این قابلیت را به طور بومی برای زبان فارسی — با تمام چالش‌های خاص آن: خط راست‌به‌چپ، واژگان غنی و چندلایه، اصطلاحات عامیانه، و کمبود مجموعه‌داده‌های بصری برچسب‌خورده فارسی — پیاده‌سازی کرده است.


۲. معماری فنی: پیوند «چشم» و «زبان» فارسی

بر اساس مستندات فنی منتشرشده توسط پژوهشکده هوش مصنوعی شریف، FarsiVQA از یک معماری دو‌بخشی «رمزگذار-ترکیب‌کننده-رمزگشا» (Encoder-Fusion-Decoder) بهره می‌برد:

  • رمزگذار بینایی (Vision Encoder): یک مدل ViT (Vision Transformer) که بر روی مجموعه‌داده‌های داخلی (شامل تصاویر صحنه‌های شهری ایران، اشیاء روزمره با بافت فرهنگی ایرانی، علائم راهنمایی فارسی، و تصاویر پزشکی) تنظیم دقیق (Fine-tune) شده است. این رمزگذار، تصویر ورودی را به یک بردار بازنمایی چندبعدی تبدیل می‌کند که «محتوا» و «روابط فضایی» اشیاء در تصویر را کدگذاری می‌نماید.
  • رمزگذار زبان (Language Encoder): نسخه‌ای سبک‌شده از مدل زبانی بومی «آرمان» (همان مدلی که در سامانه دُرسا نیز استفاده شده) که پرسش فارسی کاربر را به یک بردار معنایی تبدیل می‌کند. این رمزگذار، نه‌تنها خود کلمات، که «نیت» (Intent) پرسش را نیز — مثلاً «شمارش»، «تشخیص رنگ»، «تحلیل رابطه»، یا «توصیف» — استخراج می‌کند.
  • لایه ترکیب چندوجهی (Multimodal Fusion Layer): یک شبکه ترنسفورمر که بردارهای بینایی و زبانی را در یک «فضای بازنمایی مشترک» (Joint Embedding Space) ترکیب می‌کند. این لایه، «توجه متقاطع» (Cross-Attention) میان بخش‌های مختلف تصویر و کلمات پرسش را محاسبه می‌کند و تشخیص می‌دهد که «کدام قسمت تصویر» به «کدام بخش پرسش» مربوط است.
  • رمزگشای پاسخ (Answer Decoder): یک مدل زبانی که پاسخ نهایی را — به صورت یک جمله کامل فارسی — تولید می‌کند. این پاسخ می‌تواند یک «بله/خیر» ساده، یک عدد (پاسخ به پرسش‌های شمارشی)، یک رنگ، یا یک توصیف چندجمله‌ای باشد.

۳. کاربردها: از عصای دیجیتال نابینایان تا تحلیل محتوای شبکه‌های اجتماعی

FarsiVQA با انتشار متن‌باز، عملاً یک «زیرساخت چندمنظوره» (General-Purpose Infrastructure) برای نوآوری در کاربردهای بصری-زبانی ایجاد کرده است:

  • دستیار افراد کم‌بینا و نابینا: یک فرد نابینا می‌تواند با تلفن همراه خود از محیط اطرافش عکس بگیرد و به زبان فارسی بپرسد: «جلوی من پله هست؟»، «این اسکناس چنده؟»، «رنگ چراغ راهنما چیه؟»، یا «داخل این قوطی کنسرو چی نوشته؟». FarsiVQA می‌تواند به عنوان «عصای دیجیتال» (Digital Cane) برای حدود ۱.۵ میلیون ایرانی دارای اختلال بینایی عمل کند و استقلال آن‌ها را در زندگی روزمره به طور چشمگیری افزایش دهد.
  • آموزش مجازی و تولید محتوای آموزشی: معلمان و تولیدکنندگان محتوای آموزشی می‌توانند از FarsiVQA برای «برچسب‌گذاری خودکار» تصاویر کتاب‌های درسی، «تولید پرسش و پاسخ» از نمودارها و نقشه‌ها، و «ساخت آزمون‌های تعاملی» استفاده کنند. برای مثال، یک معلم جغرافیا می‌تواند نقشه ایران را به سامانه بدهد و بپرسد: «استان‌های هم‌مرز با خلیج فارس رو نشون بده.»
  • تحلیل محتوای بصری شبکه‌های اجتماعی: با توجه به رشد انفجاری محتوای بصری در پلتفرم‌های فارسی‌زبان (اینستاگرام، ایتا، روبیکا، تلگرام)، FarsiVQA می‌تواند به عنوان یک ابزار «تحلیل خودکار محتوا» برای شناسایی تصاویر نامناسب، تشخیص اخبار جعلی بصری، یا پایش تبلیغات غیرمجاز استفاده شود.
  • کاربردهای پزشکی و صنعتی: در حوزه پزشکی، پزشکان می‌توانند تصاویر رادیولوژی یا درماتولوژی را به همراه پرسش‌های تشخیصی به سامانه بدهند. در صنعت، تکنسین‌ها می‌توانند از تصاویر قطعات معیوب، عیب‌یابی کنند.

۴. پیامدهای راهبردی: متن‌باز بودن به مثابه موتور نوآوری

تصمیم پژوهشکده شریف به انتشار متن‌باز FarsiVQA، یک «انتخاب راهبردی هوشمندانه» است که سه پیامد مهم دارد:

  • دموکراتیزه کردن فناوری VQA: با انتشار رایگان وزن‌ها، کد منبع و مستندات، هر استارتاپ، آزمایشگاه دانشگاهی، یا توسعه‌دهنده مستقل می‌تواند FarsiVQA را دریافت کند، آن را برای کاربرد خاص خود (مثلاً تشخیص آفات کشاورزی از روی عکس برگ‌ها، یا راهنمای گردشگران در اماکن تاریخی) تنظیم دقیق کند، و محصول خود را بسازد. این یعنی «VQA فارسی» از انحصار یک نهاد خارج شده و به یک «کالای عمومی» (Public Good) تبدیل می‌شود.
  • ایجاد اکوسیستم و شبکه effects: همان‌طور که مدل‌های متن‌باز چینی (Qwen و DeepSeek) یک اکوسیستم جهانی از توسعه‌دهندگان ایجاد کرده‌اند، FarsiVQA نیز می‌تواند به «هسته» یک اکوسیستم بومی از استارتاپ‌ها و نوآوران در حوزه «بینایی-زبان فارسی» تبدیل شود. هر چه تعداد کاربران و توسعه‌دهندگان بیشتر شود، بازخوردها بیشتر، مدل بهتر، و کاربردها گسترده‌تر خواهند شد.
  • نماد تاب‌آوری: رونمایی از FarsiVQA توسط دانشگاه صنعتی شریف — نهادی که مرکز داده و زیرساخت‌هایش در فروردین ۱۴۰۵ هدف حمله فیزیکی قرار گرفت — یک «نماد قدرتمند از تاب‌آوری» است. این اقدام، این پیام را مخابره می‌کند: «شما می‌توانید ساختمان‌های ما را تخریب کنید، اما نمی‌توانید نوآوری ما را متوقف کنید. ما از خاکستر، با سامانه‌ای قوی‌تر بازمی‌گردیم.»

۵. هم‌افزایی با سایر گام‌های ملی: از دُرسا تا FarsiVQA

FarsiVQA را باید در ادامه یک مسیر مشخص دید:

  • دُرسا (دستیار راهنمای سلامت) که در ۲۸ مه رونمایی شد، از مدل آرمان برای «پرسش و پاسخ متنی» در حوزه سلامت استفاده می‌کند.
  • FarsiVQA اکنون همان مدل آرمان را با «بینایی کامپیوتر» پیوند می‌زند و آن را به حوزه «پرسش و پاسخ بصری» گسترش می‌دهد.

این یعنی ایران در حال ساخت یک «خانواده مدل‌های چندوجهی بومی» است: از متن خالص (آرمان)، به متن-سلامت (دُرسا)، و اکنون به متن-تصویر (FarsiVQA). گام بعدی — که احتمالاً در ماه‌های آینده شاهد آن خواهیم بود — افزودن «صدا» به این خانواده (برای تعامل صوتی با کاربران کم‌سواد یا نابینا) و سپس «ویدئو» (برای تحلیل محتوای ویدئویی) خواهد بود.

شاخصدُرسا (دستیار سلامت)FarsiVQA (پرسش و پاسخ بصری)
تاریخ رونمایی۲۸ مه ۲۰۲۶۳۰ مه ۲۰۲۶
حوزه کاربردسلامت (تشخیص بالینی)عمومی (بینایی-زبان)
مدل زبانی پایهآرمانآرمان
ورودی‌هامتن (علائم بیمار)تصویر + متن (پرسش فارسی)
خروجیتشخیص اولیه + ارجاعپاسخ متنی فارسی
وضعیت دسترسیدولتی (مراکز بهداشت)متن‌باز (عمومی)
کاربرد شاخصغربالگری در مناطق محرومدستیار نابینایان، آموزش، تحلیل محتوا

۶. جمع‌بندی: FarsiVQA، آجری دیگر در بنای «ایران هوشمند»

راه‌اندازی FarsiVQA، یک «لحظه جهش» در اکوسیستم هوش مصنوعی ایران است. این سامانه، نه‌تنها یک ابزار فنی، که یک «زیرساخت ملی» برای نسل بعدی نوآوری‌ها در حوزه «تعامل بصری-زبانی» است. با متن‌باز شدن آن، درهای نوآوری به روی هزاران استارتاپ، پژوهشگر و توسعه‌دهنده ایرانی گشوده می‌شود که می‌توانند بر روی این شانه‌ها بایستند و کاربردهایی خلق کنند که امروز حتی تصورش را هم نمی‌کنیم.

از نابینایی که با FarsiVQA «می‌بیند»، تا دانش‌آموزی که با آن «می‌آموزد»، تا پزشکی که با آن «تشخیص می‌دهد»، این سامانه نمادی از «هوش مصنوعی در خدمت انسان» است — نه در خدمت قدرت، نه در خدمت سود، که در خدمت «دسترسی»، «عدالت» و «کرامت انسانی». و این، شاید والاترین مأموریتی باشد که یک فناوری می‌تواند برای یک ملت داشته باشد.

مقاله رو دوست داشتی؟ نظرت چیه؟

۱۴ پاسخ به “راه‌اندازی سکوی FarsiVQA: طلوع «بینایی-مکالمه» فارسی و گشایش مرزهای دسترسی‌پذیری دیجیتال”

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *