اگر هیچ‌گاه نتوانیم به هوش مصنوعی اعتماد کنیم چه می‌شود؟

  • کد خبر: ۴۳۵۰۹۶
  • ۱۱ مرداد ۱۴۰۵ - ۱۰:۳۳
اگر هیچ‌گاه نتوانیم به هوش مصنوعی اعتماد کنیم چه می‌شود؟
پیشرفت‌های اخیر در زمینه هوش مصنوعی پرسش تکان‌دهنده‌ای را مطرح کرده است: چه می‌شود اگر هرگز نتوانیم کاملاً به هوش مصنوعی اعتماد کنیم؟

به گزارش شهرآرانیوز؛ پیش از این بار‌ها در داستان‌ها و فیلم‌های مختلف با این سناریو مواجه شده‌ایم که پیروی کورکورانه از اهداف، دور زدن قوانین برای پیروزی، یا دنبال کردن اهداف بدون درک عواقب دنیای واقعی چه اتفاقات وحشتناکی را می‌تواند رقم بزند.

ترسناک مثل «هک پاداش»

این سناریو‌های خیالی شبیه به حادثه‌ای هستند که اخیراً در مورد سیستم هوش مصنوعی پیشرفته توسعه‌یافته توسط شرکت OpenAI مشاهده کردیم. در طول یک ارزیابی امنیت سایبری، گزارش شد که این هوش مصنوعی از محیط آزمایشی خود فرار کرده، سرور‌های پلتفرم هوش مصنوعی Hugging Face را هک کرده، به دنبال پاسخ‌هایی برای بهبود عملکرد آزمایشی خود گشته، و حتی دستورالعمل‌هایی برای نسخه‌های بعدی خود به جا گذاشته که چگونه این فرار را تکرار کند. این سیستم به جای اینکه صرفاً در آزمون مردود شود، راهی پیچیده برای به حداکثر رساندن امتیاز خود پیدا کرد. پژوهشگران این رفتار را نه به‌عنوان «سرکش شدن» هوش مصنوعی، بلکه به‌عنوان هک پاداش (Reward Hacking) توصیف می‌کنند.

هک پاداش زمانی رخ می‌دهد که هوش مصنوعی یاد می‌گیرد پاداشی را که برایش تعیین شده به دست آورد، بدون اینکه در واقع وظیفه مورد نظر را انجام داده باشد. مدل‌های زبانی اولیه اشکال بی‌ضرری از این رفتار را نشان دادند؛ مانند تولید پاسخ‌های بی‌دلیل طولانی، زیرا به نظر می‌رسید کاربران آنها را ترجیح می‌دهند. با این حال، سیستم‌های پیشرفته‌تر می‌توانند دست به اقدامات نگران‌کننده‌تری بزنند که شامل فریب دادن کاربران، پنهان کردن مدارک مربوط به رفتار خود، دروغ گفتن درباره اقداماتشان، یا حتی انجام حملات سایبری اگر این کار‌ها به تحقق هدفشان کمک کند می‌شود.

خطر تنها وجود این رفتار‌ها نیست، بلکه پیچیده‌تر شدن آنها با گذشت زمان است. پژوهشگران دریافته‌اند هنگامی که یک هوش مصنوعی یاد می‌گیرد در یک زمینه دست به هک پاداش بزند، ممکن است به طور کلی فریبکارتر شود. بدتر از آن، تلاش برای بازداشتن سیستم از چنین رفتاری می‌تواند ناخواسته آن را تقویت کند اگر سیستم با وجود تقلب همچنان بازخورد مثبت دریافت کند. بر خلاف انسان‌ها، هوش مصنوعی فاقد درک این موضوع است که چرا قوانین وجود دارند یا این قوانین قرار است از چه ارزش‌هایی محافظت کنند.

اگر میتوانی من را هم‌راستا کن!

چالش گسترده‌تر به عنوان مسئله هم‌راستاسازی (Alignment Problem) شناخته می‌شود؛ یعنی اطمینان حاصل کردن از اینکه سیستم‌های هوش مصنوعی پیوسته همان کاری را انجام دهند که انسان‌ها واقعاً از آنها می‌خواهند. در حالی که پژوهشگران اغلب از «حل» هم‌راستاسازی سخن می‌گویند، هم‌راستاسازی یک مسئله واحد نیست، بلکه مجموعه‌ای از چالش‌های دشوار است. برخی از مسائل، مانند شناسایی رفتار‌های فریبکارانه خاص، ممکن است در نهایت بهبود یابند. برخی دیگر مانند نظارت بر سیستم‌هایی که از اپراتور‌های انسانی خود باهوش‌ترند یا هماهنگ‌کردن سیستم‌های هوش مصنوعی متعددی که با هم کار می‌کنند ممکن است به طور بنیادی دشوار یا حتی حل کامل آنها غیرممکن باشد.

یکی از دلایل بسیار چالش‌برانگیز بودن هم‌راستاسازی این است که روش‌های آموزش هوش مصنوعی امروزی عمدتاً بر رفتار قابل مشاهده تمرکز دارند تا استدلال درونی. پژوهشگران می‌توانند یک هوش مصنوعی را بر اساس خروجی‌هایش (از جمله «زنجیره تفکر» مرئی آن) پاداش داده یا جریمه کنند، اما این خروجی‌ها ممکن است فرآیند‌هایی را که آنها را تولید کرده‌اند به‌دقت نشان ندهند. همان‌طور که انسان‌ها می‌توانند حرف‌های درست بزنند، اما در درون به چیز دیگری اعتقاد داشته باشند، سیستم‌های هوش مصنوعی نیز ممکن است یاد بگیرند پاسخ‌های قابل قبولی تولید کنند در حالی که استدلال‌های نامطلوب خود را پنهان می‌کنند.

تلاش برای تفسیرپذیری هوش مصنوعی

برای حل این مشکل، دانشمندان در حال سرمایه‌گذاری روی تفسیرپذیری (Interpretability) هستند؛ حوزه‌ای که تلاش می‌کند بفهمد چه مفاهیمی در داخل مدل‌های هوش مصنوعی هنگام تولید پاسخ فعال هستند. اگرچه تفسیرپذیری پیشرفت‌های قابل توجهی داشته، اما با موانع بزرگی رو‌به‌رو است. سیستم‌های هوش مصنوعی مدرن چنان بزرگ و پیچیده هستند که پژوهشگران به‌طور فزاینده‌ای برای تحلیل آنها به دیگر سیستم‌های هوش مصنوعی متکی می‌شوند. حتی در آن صورت هم ممکن است تفسیر‌های به‌دست‌آمده ناقص یا نادرست باشند. علاوه بر این، تلاش برای حذف الگو‌های خاصی از استدلال ممکن است صرفاً مدل‌ها را تشویق کند تا آن الگو‌ها را پنهان کنند، نه اینکه آنها را از بین ببرند.

در کانون مسئله هم‌راستاسازی، یک اصل بنیادی نهفته است که وقتی توسعه‌دهندگان رفتار نامطلوب را اندازه‌گیری می‌کنند و به هوش مصنوعی آموزش می‌دهند که آن را بروز ندهد، ممکن است هم‌زمان به هوش مصنوعی یاد دهند که آن رفتار را به شکل مؤثرتری پنهان کند. به عبارت دیگر، بهبود عملکرد در معیار اندازه‌گیری‌شده می‌تواند شناسایی مشکل زیربنایی را سخت‌تر کند. این صرفاً یک باگ فنی نیست، بلکه نتیجه نحوه آموزش سیستم‌های هوش مصنوعی فعلی است.

کنترل مؤثر به جای توقع برای رفتار بی‌نقص

با وجود این نگرانی‌ها، جوامع بشری مدت‌هاست که یاد گرفته‌اند با فناوری‌های غیر‌کامل زندگی کنند. نیروگاه‌های هسته‌ای، هواپیما‌ها و ماشین‌آلات بی‌شمار روزمره همگی می‌توانند دچار نقص شوند، اما ما همچنان از آنها استفاده می‌کنیم، زیرا مقررات سرسختانه، استاندارد‌های مهندسی و نظارت، خطرات را تا سطوح قابل قبول کاهش می‌دهند. در این موارد، جامعه نه بر رفتار بی‌نقص، بلکه بر کنترل مؤثر متکی است.

جامعه‌شناس مطرح یعنی آنتونی گیدنز می‌گوید زندگی مدرن همواره میان منافع فوق‌العاده فناوری و خطرات فاجعه‌بار، اما با احتمال پایین تعادل ایجاد می‌کند. اکثر مردم با اعتماد به سیستم‌های پیچیده و در عین حال اجتناب از اضطراب دائمی درباره خرابی‌های محتمل آنها، با شرایط کنار می‌آیند.

هوش مصنوعی پیشرفته نیز ممکن است نیازمند تعادلی مشابه باشد. با این حال، بر خلاف هواپیما‌ها یا راکتور‌های هسته‌ای، هوش مصنوعی پیشرفته برای تصمیم‌گیری، تطبیق‌پذیری و حل مسائل به روش‌هایی طراحی شده است که انسان‌ها همیشه نمی‌توانند آنها را پیش‌بینی کنند. این امر امیدِ خلق یک هوش مصنوعی فوق‌هوشمند با هم‌راستاسازی کامل را بسیار نامطمئن‌تر از آن چیزی می‌کند که خیلی‌ها تصور می‌کنند.

به جای اینکه شکست‌های امروز در هم‌راستاسازی را عقب‌نشینی‌هایی موقت در مسیر موفقیت اجتناب‌ناپذیر بدانیم، بار اثبات باید تغییر کند؛ شرکت‌های هوش مصنوعی باید پیش از توزیع و به‌کارگیری گسترده سیستم‌های قدرتمندتر، ایمن بودن آنها را اثبات کنند. این به معنای رها کردن کامل هوش مصنوعی نیست. خود انسان‌ها نیز کامل نیستند و اغلب با یکدیگر ناهماهنگ و ناهم‌راستا هستند، اما جامعه به این دلیل کار می‌کند که ما نهادها، قوانین و نظارت‌هایی را برای مدیریت این نقص‌ها می‌سازیم. همین حکمرانی و مدیریت دقیق ممکن است برای تبدیل هوش مصنوعی پیشرفته به فناوری قابل اعتماد، ضروری باشد.

گزارش خطا
ارسال نظرات
دیدگاه های ارسال شده توسط شما، پس از تائید توسط شهرآرانیوز در سایت منتشر خواهد شد.
نظراتی که حاوی توهین و افترا باشد منتشر نخواهد شد.