در ۳۰ مه ۲۰۲۶ (۹ خرداد ۱۴۰۵)، پژوهشکده هوش مصنوعی دانشگاه صنعتی شریف — همان نهادی که زیرساخت محاسباتیاش در فروردین امسال هدف حمله قرار گرفت — با رونمایی از سکوی «FarsiVQA» (سیستم پرسش و پاسخ بصری فارسی)، نشان داد که «نوآوری» در ایران نهتنها متوقف نشده، بلکه وارد عرصههای کاملاً جدیدی شده است. این سامانه که قادر است پرسشهای کاربر را درباره تصاویر به زبان فارسی پاسخ دهد، نخستین پلتفرم بومی «پرسش و پاسخ بصری» (Visual Question Answering – VQA) برای زبان فارسی است و میتواند برای افراد کمبینا و نابینا، آموزش مجازی، تحلیل محتوای بصری شبکههای اجتماعی، و حتی کاربردهای پزشکی و صنعتی استفاده شود. نکتهٔ راهبردی آنکه نسخه اولیه این سامانه بهصورت کاملاً متنباز در اختیار استارتاپها و توسعهدهندگان قرار گرفته است.
۱. VQA چیست و چرا FarsiVQA یک جهش محسوب میشود؟
پرسش و پاسخ بصری (Visual Question Answering) یکی از پیشرفتهترین شاخههای هوش مصنوعی چندوجهی است که در آن، مدل باید همزمان «بینایی کامپیوتر» (برای درک تصویر) و «پردازش زبان طبیعی» (برای درک سؤال و تولید پاسخ) را با هم ترکیب کند. به زبان ساده، کاربر یک تصویر (مثلاً عکس یک خیابان شلوغ، یک بشقاب غذا، یا یک نمودار پزشکی) را به همراه یک پرسش متنی (مثلاً «چند ماشین در این تصویر هست؟»، «این غذا چه موادی داره؟»، یا «فلش نمودار به کدوم سمت اشاره میکنه؟») به سامانه میدهد، و سامانه باید پاسخی دقیق، مرتبط و به زبان طبیعی فارسی تولید کند.
این فناوری پیشتر عمدتاً برای زبان انگلیسی (توسط مدلهایی مانند GPT-4V، Gemini، و Claude) توسعه یافته بود. اما FarsiVQA نخستین سامانهای است که این قابلیت را به طور بومی برای زبان فارسی — با تمام چالشهای خاص آن: خط راستبهچپ، واژگان غنی و چندلایه، اصطلاحات عامیانه، و کمبود مجموعهدادههای بصری برچسبخورده فارسی — پیادهسازی کرده است.
۲. معماری فنی: پیوند «چشم» و «زبان» فارسی
بر اساس مستندات فنی منتشرشده توسط پژوهشکده هوش مصنوعی شریف، FarsiVQA از یک معماری دوبخشی «رمزگذار-ترکیبکننده-رمزگشا» (Encoder-Fusion-Decoder) بهره میبرد:
- رمزگذار بینایی (Vision Encoder): یک مدل ViT (Vision Transformer) که بر روی مجموعهدادههای داخلی (شامل تصاویر صحنههای شهری ایران، اشیاء روزمره با بافت فرهنگی ایرانی، علائم راهنمایی فارسی، و تصاویر پزشکی) تنظیم دقیق (Fine-tune) شده است. این رمزگذار، تصویر ورودی را به یک بردار بازنمایی چندبعدی تبدیل میکند که «محتوا» و «روابط فضایی» اشیاء در تصویر را کدگذاری مینماید.
- رمزگذار زبان (Language Encoder): نسخهای سبکشده از مدل زبانی بومی «آرمان» (همان مدلی که در سامانه دُرسا نیز استفاده شده) که پرسش فارسی کاربر را به یک بردار معنایی تبدیل میکند. این رمزگذار، نهتنها خود کلمات، که «نیت» (Intent) پرسش را نیز — مثلاً «شمارش»، «تشخیص رنگ»، «تحلیل رابطه»، یا «توصیف» — استخراج میکند.
- لایه ترکیب چندوجهی (Multimodal Fusion Layer): یک شبکه ترنسفورمر که بردارهای بینایی و زبانی را در یک «فضای بازنمایی مشترک» (Joint Embedding Space) ترکیب میکند. این لایه، «توجه متقاطع» (Cross-Attention) میان بخشهای مختلف تصویر و کلمات پرسش را محاسبه میکند و تشخیص میدهد که «کدام قسمت تصویر» به «کدام بخش پرسش» مربوط است.
- رمزگشای پاسخ (Answer Decoder): یک مدل زبانی که پاسخ نهایی را — به صورت یک جمله کامل فارسی — تولید میکند. این پاسخ میتواند یک «بله/خیر» ساده، یک عدد (پاسخ به پرسشهای شمارشی)، یک رنگ، یا یک توصیف چندجملهای باشد.
۳. کاربردها: از عصای دیجیتال نابینایان تا تحلیل محتوای شبکههای اجتماعی
FarsiVQA با انتشار متنباز، عملاً یک «زیرساخت چندمنظوره» (General-Purpose Infrastructure) برای نوآوری در کاربردهای بصری-زبانی ایجاد کرده است:
- دستیار افراد کمبینا و نابینا: یک فرد نابینا میتواند با تلفن همراه خود از محیط اطرافش عکس بگیرد و به زبان فارسی بپرسد: «جلوی من پله هست؟»، «این اسکناس چنده؟»، «رنگ چراغ راهنما چیه؟»، یا «داخل این قوطی کنسرو چی نوشته؟». FarsiVQA میتواند به عنوان «عصای دیجیتال» (Digital Cane) برای حدود ۱.۵ میلیون ایرانی دارای اختلال بینایی عمل کند و استقلال آنها را در زندگی روزمره به طور چشمگیری افزایش دهد.
- آموزش مجازی و تولید محتوای آموزشی: معلمان و تولیدکنندگان محتوای آموزشی میتوانند از FarsiVQA برای «برچسبگذاری خودکار» تصاویر کتابهای درسی، «تولید پرسش و پاسخ» از نمودارها و نقشهها، و «ساخت آزمونهای تعاملی» استفاده کنند. برای مثال، یک معلم جغرافیا میتواند نقشه ایران را به سامانه بدهد و بپرسد: «استانهای هممرز با خلیج فارس رو نشون بده.»
- تحلیل محتوای بصری شبکههای اجتماعی: با توجه به رشد انفجاری محتوای بصری در پلتفرمهای فارسیزبان (اینستاگرام، ایتا، روبیکا، تلگرام)، FarsiVQA میتواند به عنوان یک ابزار «تحلیل خودکار محتوا» برای شناسایی تصاویر نامناسب، تشخیص اخبار جعلی بصری، یا پایش تبلیغات غیرمجاز استفاده شود.
- کاربردهای پزشکی و صنعتی: در حوزه پزشکی، پزشکان میتوانند تصاویر رادیولوژی یا درماتولوژی را به همراه پرسشهای تشخیصی به سامانه بدهند. در صنعت، تکنسینها میتوانند از تصاویر قطعات معیوب، عیبیابی کنند.
۴. پیامدهای راهبردی: متنباز بودن به مثابه موتور نوآوری
تصمیم پژوهشکده شریف به انتشار متنباز FarsiVQA، یک «انتخاب راهبردی هوشمندانه» است که سه پیامد مهم دارد:
- دموکراتیزه کردن فناوری VQA: با انتشار رایگان وزنها، کد منبع و مستندات، هر استارتاپ، آزمایشگاه دانشگاهی، یا توسعهدهنده مستقل میتواند FarsiVQA را دریافت کند، آن را برای کاربرد خاص خود (مثلاً تشخیص آفات کشاورزی از روی عکس برگها، یا راهنمای گردشگران در اماکن تاریخی) تنظیم دقیق کند، و محصول خود را بسازد. این یعنی «VQA فارسی» از انحصار یک نهاد خارج شده و به یک «کالای عمومی» (Public Good) تبدیل میشود.
- ایجاد اکوسیستم و شبکه effects: همانطور که مدلهای متنباز چینی (Qwen و DeepSeek) یک اکوسیستم جهانی از توسعهدهندگان ایجاد کردهاند، FarsiVQA نیز میتواند به «هسته» یک اکوسیستم بومی از استارتاپها و نوآوران در حوزه «بینایی-زبان فارسی» تبدیل شود. هر چه تعداد کاربران و توسعهدهندگان بیشتر شود، بازخوردها بیشتر، مدل بهتر، و کاربردها گستردهتر خواهند شد.
- نماد تابآوری: رونمایی از FarsiVQA توسط دانشگاه صنعتی شریف — نهادی که مرکز داده و زیرساختهایش در فروردین ۱۴۰۵ هدف حمله فیزیکی قرار گرفت — یک «نماد قدرتمند از تابآوری» است. این اقدام، این پیام را مخابره میکند: «شما میتوانید ساختمانهای ما را تخریب کنید، اما نمیتوانید نوآوری ما را متوقف کنید. ما از خاکستر، با سامانهای قویتر بازمیگردیم.»
۵. همافزایی با سایر گامهای ملی: از دُرسا تا FarsiVQA
FarsiVQA را باید در ادامه یک مسیر مشخص دید:
- دُرسا (دستیار راهنمای سلامت) که در ۲۸ مه رونمایی شد، از مدل آرمان برای «پرسش و پاسخ متنی» در حوزه سلامت استفاده میکند.
- FarsiVQA اکنون همان مدل آرمان را با «بینایی کامپیوتر» پیوند میزند و آن را به حوزه «پرسش و پاسخ بصری» گسترش میدهد.
این یعنی ایران در حال ساخت یک «خانواده مدلهای چندوجهی بومی» است: از متن خالص (آرمان)، به متن-سلامت (دُرسا)، و اکنون به متن-تصویر (FarsiVQA). گام بعدی — که احتمالاً در ماههای آینده شاهد آن خواهیم بود — افزودن «صدا» به این خانواده (برای تعامل صوتی با کاربران کمسواد یا نابینا) و سپس «ویدئو» (برای تحلیل محتوای ویدئویی) خواهد بود.
| شاخص | دُرسا (دستیار سلامت) | FarsiVQA (پرسش و پاسخ بصری) |
|---|---|---|
| تاریخ رونمایی | ۲۸ مه ۲۰۲۶ | ۳۰ مه ۲۰۲۶ |
| حوزه کاربرد | سلامت (تشخیص بالینی) | عمومی (بینایی-زبان) |
| مدل زبانی پایه | آرمان | آرمان |
| ورودیها | متن (علائم بیمار) | تصویر + متن (پرسش فارسی) |
| خروجی | تشخیص اولیه + ارجاع | پاسخ متنی فارسی |
| وضعیت دسترسی | دولتی (مراکز بهداشت) | متنباز (عمومی) |
| کاربرد شاخص | غربالگری در مناطق محروم | دستیار نابینایان، آموزش، تحلیل محتوا |
۶. جمعبندی: FarsiVQA، آجری دیگر در بنای «ایران هوشمند»
راهاندازی FarsiVQA، یک «لحظه جهش» در اکوسیستم هوش مصنوعی ایران است. این سامانه، نهتنها یک ابزار فنی، که یک «زیرساخت ملی» برای نسل بعدی نوآوریها در حوزه «تعامل بصری-زبانی» است. با متنباز شدن آن، درهای نوآوری به روی هزاران استارتاپ، پژوهشگر و توسعهدهنده ایرانی گشوده میشود که میتوانند بر روی این شانهها بایستند و کاربردهایی خلق کنند که امروز حتی تصورش را هم نمیکنیم.
از نابینایی که با FarsiVQA «میبیند»، تا دانشآموزی که با آن «میآموزد»، تا پزشکی که با آن «تشخیص میدهد»، این سامانه نمادی از «هوش مصنوعی در خدمت انسان» است — نه در خدمت قدرت، نه در خدمت سود، که در خدمت «دسترسی»، «عدالت» و «کرامت انسانی». و این، شاید والاترین مأموریتی باشد که یک فناوری میتواند برای یک ملت داشته باشد.


۱۴ پاسخ به “راهاندازی سکوی FarsiVQA: طلوع «بینایی-مکالمه» فارسی و گشایش مرزهای دسترسیپذیری دیجیتال”
جالبه
بدک نبود در کل
بدک نبود در کل
پشمام چقدر خوب بود
خوب بود
عالی بود مرسی 🔥
دقیقا همینطوره
خوب بود
بدک نبود در کل
ممنون داداش
تشکر
مرسی بابت محتوای ناب
خیلی خفن بود
ممنون داداش