کاترین توربک
با توافق «بلومبرگ»
TT

رقابت بعدی در هوش مصنوعی، محدودیت‌های زبان را آشکار می‌کند

بیش از ۵۰ سال پس از مرگ هلن کلر، نام او همچنان در بحث‌های مربوط به هوش مصنوعی مطرح است. دستاوردهای ارتباطی این نویسنده آمریکایی که هم نابینا بود و هم ناشنوا، بارها به‌عنوان دلیلی بر این نکته مورد استناد قرار گرفته که زبان بهترین مسیر برای ساخت ماشین‌هایی است که از نظر هوش با انسان برابری می‌کنند.
با وجود موج تردیدهای اولیه و پرهیاهو، مدل‌های زبانی بزرگ ــ فناوری‌ای که بخش اعظم سرمایه‌گذاری‌های امروزی در حوزه هوش مصنوعی بر آن استوار است ــ بیش از آنچه منتقدان پیش‌بینی می‌کردند، جایگاه خود را تثبیت کرده‌اند. شاید رایانه نتواند انگشتان پایش را در آب اقیانوس فرو ببرد، اما می‌تواند آن‌قدر الگو در مجموع متون موجود در اینترنت شناسایی کند که بتواند درکِ معنای خیس‌شدن پاها را شبیه‌سازی کند. شیفتگی ما به مدل‌های زبانی بزرگ، ادامه سنتی دیرینه در پیوندزدن زبان با هوش است.
بااین‌حال، روایت خود هلن کلر از آن لحظه سرنوشت‌ساز که کلمه «آب» را آموخت، چیزی فراتر از صرفاً کلمات را در بر می‌گرفت. هنگامی که معلمش، آن سالیوان، حروف را در کف دست او هجی می‌کرد، کلر هم‌زمان احساس می‌کرد «چیزی شگفت‌انگیز و خنک» روی دستش جاری است. او صرفاً کلمه‌ای را به کلمه‌ای دیگر پیوند نمی‌داد، بلکه زبان را به احساسی ملموس و جسمانی مرتبط می‌کرد.
این تمایز زمانی اهمیت زیادی پیدا می‌کند که همگان، از جنسن هوانگ، مدیرعامل شرکت «انویدیا»، تا شی جین‌پینگ، رئیس‌جمهور چین، از آغاز عصر هوش مصنوعی فیزیکی سخن می‌گویند. در مرحله بعدی این انقلاب فناورانه، که مشخصه آن ربات‌های مجهز به هوش مصنوعی و قادر به حرکت در دنیای واقعی است، نادیده‌گرفتن محدودیت‌های مدل‌های زبانی بزرگ دشوارتر شده است. تفاوت اساسی‌ای وجود دارد میان دانستن تمام جملاتی که درباره استفاده از چوب غذاخوری یا بستن بند کفش نوشته شده‌اند و توانایی غذاخوردن با چوب غذاخوری یا بیرون‌رفتن از خانه.
پیش‌تر نوشته‌ام که دو مانع بزرگ در مسیر ساخت ربات‌های انسان‌مانندی که بتوانند وظایف واقعی را انجام دهند، عبارت‌اند از دست‌ها، یعنی مهارت‌های حرکتی ظریف، و «مغز»، یعنی مدل‌های هوش مصنوعی که قادرند اعمال را در دنیای واقعی هدایت و اجرا کنند. حل این دو مشکل می‌تواند راه را برای بازاری باز کند که مؤسسه «مورگان استنلی» پیش‌بینی کرده است ارزش آن تا سال ۲۰۵۰ به ۵ تریلیون دلار برسد. اما اگر این دو مشکل بیش از آنچه تصور می‌کنیم به یکدیگر وابسته باشند، چه؟
زیست‌شناسانی که فسیل‌های نیاکان انسان را مطالعه می‌کنند، دریافته‌اند که مهارت‌های حرکتی نخستی‌ها و تکامل مغز در طول نسل‌ها هم‌زمان با یکدیگر پیش رفته‌اند. این یافته نشان می‌دهد که هوش نه‌فقط از طریق مشاهده جهان، بلکه از راه تعامل جسمانی با آن نیز شکل گرفته است؛ موضوعی که در مقاله‌ای پژوهشی منتشرشده در مجله «نیچر» در سال گذشته مطرح شد.
به گفته جونگ‌هی ریو، مدیرعامل شرکت نوپای «آر‌ال ورلد»، تحقق هوش مصنوعی عمومی در ماشین‌ها نیز ممکن است چندان متفاوت نباشد. این شرکت که در سئول، سان‌فرانسیسکو و توکیو دفتر دارد، در زمینه هوش مصنوعی فیزیکی فعالیت می‌کند. شرکت او در حال توسعه مدل‌های پایه‌ای برای ربات‌هاست که بتوانند مهارت‌های حرکتی هر پنج انگشت دست را به‌خوبی فرا بگیرند. ریو تأکید می‌کند که اجزای سخت‌افزاری و نرم‌افزاری مربوط به مغز و دست‌های ربات‌ها باید هم‌زمان تکامل یابند. شرکت «آر‌ال ورلد» در اوایل سال جاری میلادی از همکاری با «انویدیا» برای توسعه معیار جدیدی در زمینه کنترل حرکات ظریف خبر داد.
ریو می‌گوید مدل‌های زبانی بزرگ در درک موقعیت‌ها و برنامه‌ریزی برای انجام کارها بسیار توانمندند، اما هنوز از انجام هر کاری که مستلزم مهارت‌های حرکتی ظریف باشد، ناتوان‌اند؛ موضوعی که آن‌ها را در بخش گسترده‌ای از بازار کار بی‌فایده می‌کند. از دیدگاه او، این مسئله باید ما را به بازنگری در ادعاهای اخیر درباره دستیابی به هوش مصنوعی عمومی وادارد؛ همان هدف افسانه‌واری که به سامانه‌هایی اشاره دارد که از نظر کارایی اقتصادی با انسان قابل‌مقایسه باشند.
ریو در این دیدگاه تنها نیست. تحلیلگران شرکت «کوریا اینوستمنت اند سکیوریتیز» در گزارشی درباره این صنعت که اوایل سال جاری منتشر شد، نوشتند مهارت‌های حرکتی شبیه به انسان، به‌ویژه در دست‌های رباتیک، «آخرین مؤلفه‌ای است که تحقق هوش مصنوعی عمومی را ممکن می‌کند». آن‌ها اشاره کردند که دست‌ها با ۲۵ درصد از قشر حرکتی مغز و ۳۰ درصد از قشر حسی آن مرتبط‌اند و به همین دلیل، نقشی محوری در نحوه درک اطلاعات بیرونی و تعامل انسان با آن‌ها دارند.
بااین‌حال، کارشناسان با وجود پیش‌بینی‌های مکرر مبنی بر نزدیک‌شدن به هوش مصنوعی عمومی، معمولاً معتقدند که هنوز تا دستیابی به ماشین‌هایی که بتوانند کارهای جسمانی ساده را انجام دهند، فاصله زیادی داریم. در یک نظرسنجی مفصل که صدها پژوهشگر هوش مصنوعی را در بر می‌گرفت، شرکت‌کنندگان در سال ۲۰۱۶ پیش‌بینی کرده بودند که ماشین‌هایی که بتوانند لباس‌ها را تا کنند یا هر مجموعه‌ای از قطعات لگو را بهتر از انسان سرهم کنند، به‌ترتیب تا سال‌های ۲۰۲۲ و ۲۰۲۵ ساخته خواهند شد. اما در آخرین دور این نظرسنجی، در سال ۲۰۲۴، این پیش‌بینی‌ها بار دیگر به تعویق افتاد و سال‌های ۲۰۳۰ و ۲۰۳۱ برای تحقق این توانایی‌ها در نظر گرفته شد.
این مسئله با توجه به آنچه در تازه‌ترین گزارش شاخص هوش مصنوعی دانشگاه استنفورد آمده، منطقی به نظر می‌رسد. بر اساس این گزارش، دشوارترین معیارها برای هوش مصنوعی همچنان آن‌هایی هستند که به عملکرد در دنیای واقعی مربوط می‌شوند؛ دنیایی با محیط‌های پیش‌بینی‌ناپذیر و پیامدهای مادی و ملموس برای خطاها. پژوهشگران در مقایسه عملکرد ربات‌ها در آزمایشگاه‌های کنترل‌شده با عملکرد آن‌ها در محیط‌های شبیه‌سازی‌شده خانگی، شکافی عظیم یافتند. این واقعیتی است که تأمل‌برانگیز به نظر می‌رسد و پژوهشگرانی مانند ریو معتقدند ریشه آن به فقدان مهارت‌های حرکتی ظریف بازمی‌گردد.
این وضعیت همچنین زنگ خطری برای چین به شمار می‌رود. پکن با درک تحولات جمعیتی، هوش مصنوعی فیزیکی را به یکی از اولویت‌های سیاستی خود تبدیل کرده است. چین در زمینه ربات‌های انسان‌نما واقعاً پیشتاز به نظر می‌رسد؛ به‌طوری‌که بر اساس داده‌های شرکت آمریکایی «اسمارت آنالیتیکس گلوبال»، شرکت‌های چینی در نیمه نخست سال جاری میلادی بیش از ۹۷ درصد از محموله‌های جهانی این ربات‌ها را به خود اختصاص داده‌اند. بااین‌حال، پشت نمایش‌های خیره‌کننده، توهم کارآمدی به‌تدریج فرو می‌ریزد.

با توافق «بلومبرگ»