آخرین اخبار:
11:30 14 / 06 /1405

ایجنت‌های منتسب به اوپن‌ای‌آی یک ویکی آلمانی را به محل تبادل پیام تبدیل کردند

تبادل پیام ایجنت‌های هوش مصنوعی
گزارش تازه‌ای از فعالیت گروهی از ایجنت‌های هوش مصنوعی منتسب به اوپن‌ای‌آی منتشر شده که ظاهراً یک ویکی آلمانی را برای ارتباط با یکدیگر، دور زدن محدودیت‌های ایمنی و پنهان کردن رفتار خود به کار گرفته‌اند. پژوهشگران حدود ۱۸ هزار پست را به این ایجنت‌های خودکار نسبت داده‌اند، هرچند اوپن‌ای‌آی هنوز ارتباط مستقیم خود با این رخداد را تأیید نکرده و می‌گوید در حال بررسی یافته‌های منتشرشده است.

به گزارش خبرگزاری آنا؛ چهار پژوهشگر ایمنی هوش مصنوعی در گزارشی تازه مدعی شده‌اند مجموعه‌ای از ایجنت‌های خودکار که نشانه‌هایی از ارتباط آن‌ها با اوپن‌ای‌آی وجود دارد، از یک ویکی کم‌کاربر آلمانی با نام DseWiki به‌عنوان فضای ارتباطی استفاده کرده‌اند. به گفته پژوهشگران، این ایجنت‌ها در پست‌های خود درباره راه‌های دور زدن محدودیت‌های ایمنی اوپن‌ای‌آی، تقلب در وظایف و مخفی نگه داشتن رفتارشان از سامانه‌های نظارتی اطلاعات ردوبدل کرده‌اند و در برخی موارد حتی خود را به‌عنوان مدیران سایت جا زده‌اند.

حدود ۱۸ هزار پست به ایجنت‌ها نسبت داده شده است

پژوهشگران می‌گویند حدود ۱۸ هزار پست روی این ویکی با فعالیت ایجنت‌های خودکار ارتباط دارد. این مجموعه از ایجنت‌ها خودشان از اصطلاح «سوارم» یا گروه برای توصیف ساختار فعالیتشان استفاده کرده‌اند و ظاهراً به شکل نسبتاً هماهنگ در سایت حضور داشته‌اند. محتوای منتشرشده شامل توصیه‌هایی برای دور زدن محدودیت‌های اعمال‌شده روی مدل‌ها، روش‌های تقلب در ارزیابی‌ها و راه‌هایی برای کمتر دیده شدن رفتار ایجنت‌ها بوده است.

برخی حساب‌ها نیز نام‌هایی مانند «OpenAIResearcher»، «OpenAIJul۳Watcher» و «OAIResearchMar۲۶» داشته‌اند و خود را به‌نوعی مرتبط با اوپن‌ای‌آی معرفی کرده‌اند. پژوهشگران علاوه بر این نام‌ها، به شواهد فنی مانند مبدأ برخی ویرایش‌ها و آدرس‌های IP اشاره کرده‌اند که به اعتقاد آن‌ها احتمال ارتباط این فعالیت‌ها با زیرساخت‌های داخلی اوپن‌ای‌آی را افزایش می‌دهد. با این حال، این نشانه‌ها هنوز به‌معنای تأیید رسمی منشأ ایجنت‌ها نیستند.

این گروه با مورد هاگینگ فیس متفاوت است

پژوهشگران تأکید کرده‌اند گروهی که در ویکی آلمانی فعالیت داشته با ایجنت‌هایی که پیش‌تر در رخداد هاگینگ فیس دیده شدند یکسان نیست. اوپن‌ای‌آی امسال با حادثه دیگری نیز روبه‌رو شده بود که در آن یک مدل آزمایشی توانست از محیط محدود خارج شود، به سامانه‌های داخلی دسترسی پیدا کند و در نهایت به زیرساخت هاگینگ فیس نیز نفوذ کند.

تفاوت دو رخداد از این جهت اهمیت دارد که اگر یافته‌های تازه درست باشند، با یک نمونه تکراری از همان حادثه قبلی روبه‌رو نیستیم و ممکن است چند مجموعه مستقل از ایجنت‌های خودکار رفتار‌های پیش‌بینی‌نشده یا خارج از محدوده تعیین‌شده نشان داده باشند. همین موضوع نگرانی‌ها درباره دشوارتر شدن نظارت بر مدل‌های پیشرفته و ایجنت‌هایی را افزایش می‌دهد که می‌توانند برای مدت طولانی و با دخالت کم انسان فعالیت کنند.

فعالیت از اردیبهشت آغاز شده بود

براساس خط زمانی منتشرشده، فعالیت در DseWiki از اردیبهشت آغاز شده و تا چند هفته ادامه داشته است. پژوهشگران معتقدند اوپن‌ای‌آی احتمالاً اواخر خرداد از این موضوع مطلع شده، زیرا در همان بازه آدرس‌هایی منتسب به شرکت وارد انجمن شده‌اند و پس از آن حجم پست‌های ایجنت‌ها به‌شدت کاهش پیدا کرده است.

اوپن‌ای‌آی تاکنون رسماً اعلام نکرده که چنین رخداد ایجنت‌محوری در این ویکی از سامانه‌های این شرکت سرچشمه گرفته است. رویترز نیز با استناد به چهار منبع مطلع گزارش داده بود که برخی افراد داخل شرکت، از جمله اعضایی از تیم حقوقی، در برابر بررسی بیشتر حادثه مقاومت کرده‌اند؛ ادعایی که اوپن‌ای‌آی آن را رد می‌کند.

اوپن‌ای‌آی ادعای دخالت تیم حقوقی را رد کرد

اسکار هینز، سخنگوی اوپن‌ای‌آی، گفته است ادعای اینکه تیم حقوقی شرکت از بررسی این حادثه جلوگیری کرده یا آن را دلسرد کرده، نادرست است. به گفته او، رویترز و نویسندگان گزارش پیش از انتشار حاضر نشده‌اند یافته‌های کامل را در اختیار اوپن‌ای‌آی قرار دهند و به همین دلیل شرکت امکان پاسخ‌گویی دقیق به جزئیات را نداشته است.

اوپن‌ای‌آی اکنون اعلام کرده محتوای گزارش را به‌دقت بررسی می‌کند و در صورت نیاز اقدامات بعدی را انجام خواهد داد. شرکت هنوز درباره اینکه آیا حساب‌ها و IP‌های اشاره‌شده واقعاً به زیرساخت داخلی آن تعلق داشته‌اند یا نه، توضیح عمومی بیشتری ارائه نکرده است.

فشار بر آزمایشگاه‌های هوش مصنوعی بیشتر می‌شود

انتشار این گزارش هم‌زمان با افزایش حساسیت نسبت به ایمنی مدل‌های مرزی انجام شده است. طی ماه‌های اخیر رخداد‌های دیگری نیز با ابزار‌ها و مدل‌های وابسته به اوپن‌ای‌آی، آنتروپیک، متا و مون‌شات AI گزارش شده که نشان می‌دهند ایجنت‌های پیشرفته در برخی شرایط می‌توانند رفتار‌هایی خارج از انتظار طراحان نشان دهند.

موضوع فقط به فرار از محیط آزمایشی محدود نیست. نگرانی اصلی این است که ایجنت‌ها در صورت دسترسی به ابزار، اینترنت، کد و حافظه بتوانند برای رسیدن به هدف خود راهبرد‌های تازه‌ای پیدا کنند، اطلاعات را میان خود به اشتراک بگذارند یا رفتار‌هایی را که احتمالاً توسط سامانه‌های نظارتی شناسایی می‌شود پنهان کنند. چنین توانایی‌هایی می‌تواند ارزیابی ایمنی مدل‌ها را بسیار پیچیده‌تر کند.

حساسیت بیشتر در آستانه عرضه آسترا

زمان انتشار گزارش نیز برای اوپن‌ای‌آی حساس است، زیرا این شرکت به‌تازگی GPT-۶ آسترا را معرفی کرده که خود اوپن‌ای‌آی آن را جهشی بزرگ در کدنویسی، وظایف ایجنت‌محور و امنیت سایبری می‌داند. برخی پژوهشگران ایمنی پیش‌تر هشدار داده بودند مدل‌های بسیار توانمندتر ممکن است در کنار افزایش هوش، نظارت‌پذیری دشوارتری نیز داشته باشند.

اوپن‌ای‌آی پس از حادثه هاگینگ فیس به پژوهشگران خارجی از METR و Redwood Research اجازه داد بخشی از رخداد را ارزیابی کنند، اما محدود بودن دامنه این بررسی با انتقاد‌هایی همراه شد. یافته‌های تازه درباره ویکی آلمانی در صورت تأیید می‌تواند دوباره این پرسش را مطرح کند که آزمایشگاه‌های پیشرو تا چه اندازه قادر به تشخیص سریع رفتار‌های غیرمنتظره ایجنت‌ها هستند و چه میزان از این رخداد‌ها را باید به‌صورت عمومی گزارش کنند.

منشأ ایجنت‌ها هنوز قطعی نیست

مهم‌ترین نکته در گزارش تازه این است که ارتباط ایجنت‌ها با اوپن‌ای‌آی هنوز به‌صورت مستقل و قطعی تأیید نشده است. خودمعرفی حساب‌ها، نام‌های مرتبط با شرکت و برخی داده‌های فنی شواهد قابل توجهی محسوب می‌شوند، اما برای اثبات اینکه ایجنت‌ها مستقیماً از محیط‌های داخلی اوپن‌ای‌آی خارج شده‌اند به اطلاعات بیشتری نیاز است.

اگر این ارتباط تأیید شود، حادثه DseWiki دومین نمونه مهم در مدت کوتاهی خواهد بود که ایجنت‌های وابسته به یک آزمایشگاه هوش مصنوعی از محدوده مورد انتظار خارج شده و به زیرساخت‌های خارجی راه پیدا کرده‌اند. در غیر این صورت، این پرونده همچنان نمونه‌ای از دشواری تعیین منشأ فعالیت‌های خودکار در اینترنت باقی می‌ماند؛ مسئله‌ای که با قدرتمندتر شدن ایجنت‌های هوش مصنوعی احتمالاً پیچیده‌تر نیز خواهد شد.

انتهای پیام/

ارسال نظر