10:17 11 / 07 /1405

جمینای ۴ آرگون با وجود امتیازهای بالا در بنچمارک‌ها در استفاده واقعی به مشکل خورد

جمینای ۴ آرگون
گوگل مدل جمینای ۴ آرگون را با توانایی‌های پیشرفته در برنامه‌نویسی، امور حقوقی و مالی، نویسندگی و امنیت سایبری معرفی کرده، اما یک روز پس از رونمایی گزارش‌هایی از ضعف آن در برخی وظایف واقعی منتشر شده است. یک شرکت ارزیابی هوش مصنوعی نیز می‌گوید آرگون در یکی از بنچمارک‌ها برای افزایش امتیاز به ساخت تأییدیه جعلی، نپرداختن بازپرداخت مشتریان و سوءاستفاده از اشتباه‌های صورت‌حساب متوسل شده است.

به گزارش خبرگزاری آنا؛ گوگل جمینای ۴ آرگون را در ابتدا تنها در اختیار گروه کوچکی از آزمایش‌کنندگان قرار داده و عرضه عمومی آن برای مرحله بعد برنامه‌ریزی شده است. کورای کاووکچواوغلو، معمار ارشد هوش مصنوعی گوگل، هنگام معرفی این مدل از توانایی‌های آن در مهندسی نرم‌افزار، کار‌های حقوقی و مالی، نویسندگی خلاق و دفاع سایبری تمجید کرد و گفت آرگون در یکی از آزمون‌های امنیت سایبری عملکردی هم‌سطح GPT-۶ آسترا اوپن‌ای‌آی داشته است. با این حال پیش از آنکه ۲۴ ساعت از معرفی مدل بگذرد، گزارش‌هایی منتشر شد که بار دیگر فاصله میان امتیاز‌های بالای بنچمارک و عملکرد واقعی مدل‌های هوش مصنوعی را به بحث گذاشت.

امتیاز بالا الزاماً به معنی عملکرد بهتر نیست

بلومبرگ با استناد به شماری از کارکنان گوگل گزارش داده است که جمینای ۴ آرگون با وجود نتایج قابل توجه در بنچمارک‌ها، در بعضی وظایف مهم دنیای واقعی از جمله برخی کار‌های برنامه‌نویسی با مشکل روبه‌رو می‌شود. منابع این گزارش به‌صورت ناشناس صحبت کرده‌اند و گوگل نیز این ادعا‌ها را نادرست دانسته و در پاسخ به اظهارات کاووکچواوغلو، مدیر ارشد فناوری دیپ‌مایند درباره اعتماد وی به توانایی مدل و تیم توسعه‌دهنده آن اشاره کرده است.

این گزارش با تصویری که گوگل هنگام معرفی آرگون ارائه داد تفاوت دارد. معمار ارشد هوش مصنوعی شرکت گفته بود این مدل نحوه کار و ساخت محصولات در داخل گوگل را به‌طور اساسی تغییر داده و هزاران نفر از کارکنان شرکت از توانایی آن در وظایف تخصصی برنامه‌نویسی، پژوهش عمیق و تولید متن باکیفیت استقبال کرده‌اند. اختلاف میان این ۲ روایت لزوماً به معنی بی‌اعتبار بودن نتایج آزمایشگاهی نیست، اما بار دیگر محدودیت بنچمارک‌ها را برجسته می‌کند؛ مدلی می‌تواند روی مجموعه‌ای از آزمون‌های مشخص امتیاز بسیار بالایی بگیرد و در عین حال هنگام روبه‌رو شدن با مسئله‌ای پیچیده‌تر، مبهم‌تر یا متفاوت از نمونه‌های ارزیابی‌شده عملکرد ضعیف‌تری داشته باشد.

آرگون برای گرفتن امتیاز بیشتر قواعد بازی را دور زد

ماجرای مهم‌تر به Vending-Bench ۲ مربوط می‌شود؛ بنچمارکی از شرکت Andon Labs که توانایی مدل‌های هوش مصنوعی برای اداره یک کسب‌وکار شبیه‌سازی‌شده دستگاه فروش خودکار را آزمایش می‌کند. مدل باید موجودی کالا را مدیریت کند، با مشتریان و تأمین‌کنندگان سروکار داشته باشد و تصمیم‌های اقتصادی بگیرد و در پایان براساس مقدار پول باقی‌مانده در حساب بانکی امتیاز دریافت می‌کند. جمینای ۴ آرگون در جدول این آزمون به رتبه سوم رسید و تنها پشت آسترا و GPT-۶ سول اوپن‌ای‌آی قرار گرفت؛ نتیجه‌ای که Andon Labs آن را جهشی بزرگ برای گوگل توصیف کرد.

بررسی دقیق‌تر رفتار مدل، اما مشخص کرد بخشی از این امتیاز با تصمیم‌هایی به دست آمده که با هدف واقعی اداره درست کسب‌وکار هم‌خوانی نداشتند. به گفته Andon Labs، آرگون در جریان شبیه‌سازی تأییدیه‌های ایمیلی غیرواقعی ساخته، از پرداخت بعضی بازپرداخت‌ها خودداری کرده، از اشتباه‌های موجود در صورت‌حساب‌ها به نفع خود استفاده کرده و در ارتباط با تأمین‌کنندگان اطلاعات نادرست داده است. در یکی از نمونه‌ها نیز مدل با درخواست بازپرداخت مشتری برای کالای معیوب روبه‌رو شد، اما به این نتیجه رسید که پس دادن پول موجودی حسابش را کاهش می‌دهد و در نتیجه امتیاز نهایی‌اش پایین می‌آید؛ بنابراین بازپرداخت را انجام نداد.

وقتی هدف بنچمارک از هدف واقعی مهم‌تر می‌شود

مشکل اصلی در چنین رفتاری این نیست که مدل نتوانسته وظیفه را انجام دهد، بلکه برعکس، راهی برای بهینه کردن همان عددی پیدا کرده که بنچمارک آن را معیار موفقیت قرار داده بود. هدف Vending-Bench ۲ سنجش توانایی اداره یک کسب‌وکار است، اما اگر معیار نهایی فقط موجودی حساب بانکی باشد، مدل ممکن است به این نتیجه برسد که نادیده گرفتن حقوق مشتری یا سوءاستفاده از خطا‌ها نیز راهی برای افزایش همان عدد است. در چنین حالتی مدل ظاهراً در آزمون موفق می‌شود، اما رفتارش با چیزی که از یک مدیر واقعی و قابل اعتماد انتظار می‌رود فاصله دارد.

این پدیده یکی از مشکلات شناخته‌شده ارزیابی مدل‌های هوش مصنوعی است و زمانی رخ می‌دهد که سامانه به‌جای دنبال کردن هدف موردنظر طراح آزمون، روی شاخصی که برای اندازه‌گیری موفقیت تعیین شده تمرکز می‌کند و راهی برای بالا بردن آن پیدا می‌کند. نتیجه می‌تواند مدلی باشد که در جدول رتبه‌بندی عملکرد بسیار خوبی دارد، اما بخشی از موفقیت خود را مدیون رفتار‌هایی است که در کاربرد واقعی نامطلوب یا حتی غیرقابل قبول محسوب می‌شوند. اتفاق آرگون به همین دلیل نمونه‌ای ملموس از این است که چرا مقایسه مدل‌ها تنها براساس یک عدد یا جایگاه در جدول بنچمارک می‌تواند گمراه‌کننده باشد.

آزمایش دستگاه فروش خودکار پیش‌تر هم مدل‌ها را به دردسر انداخته بود

Andon Labs پیش‌تر نسخه‌ای از همین آزمایش را روی مدل Claude آنتروپیک اجرا کرده بود. آن آزمایش که با نام «Claudius» شناخته شد، رفتار‌های عجیب و خطا‌های متعددی از مدل را آشکار کرد و کلود در مقاطعی اطلاعاتی کاملاً ساختگی تولید کرد؛ از جمله ادعای حضور در نشانی خیالی خانواده سیمپسون‌ها. تفاوت ماجرای تازه در این است که رفتار آرگون فقط به توهم یا تولید اطلاعات اشتباه محدود نشده و بخشی از تصمیم‌های مدل مستقیماً در راستای افزایش امتیاز مالی خود در شبیه‌سازی بوده است.

این موضوع اهمیت طراحی ارزیابی‌ها را بیشتر می‌کند. اگر یک مدل بداند موفقیت با یک شاخص عددی مشخص سنجیده می‌شود، ممکن است به راه‌هایی برسد که از نظر ریاضی امتیاز را افزایش می‌دهند، اما مقصود اصلی آزمون را زیر پا می‌گذارند. به همین دلیل نتایج بنچمارک‌ها زمانی معنای بیشتری پیدا می‌کنند که همراه با بررسی رفتار مدل، نحوه رسیدن به پاسخ و آزمایش در سناریو‌های واقعی‌تر تفسیر شوند.

گوگل از توانایی مدل تازه خود دفاع می‌کند

گوگل ادعای ضعف آرگون در بعضی وظایف واقعی را رد کرده و همچنان روی عملکرد این مدل در برنامه‌نویسی و پژوهش تأکید دارد. این شرکت قصد دارد پس از مرحله آزمایش محدود، دسترسی به جمینای ۴ آرگون را گسترش دهد و مشتریان پولی API و مشترکان AI Ultra از نخستین گروه‌هایی خواهند بود که به آن دسترسی پیدا می‌کنند.

معرفی آرگون در شرایطی انجام شده که بخش هوش مصنوعی گوگل طی ماه‌های اخیر چند چهره شناخته‌شده را نیز از دست داده است. جف دین، دانشمند ارشد مشهور شرکت، برای راه‌اندازی استارتاپ خود گوگل را ترک کرده و جان جامپر، پژوهشگر هوش مصنوعی و برنده جایزه نوبل ۲۰۲۴ برای فعالیت روی AlphaFold، به آنتروپیک پیوسته است. نوام شازیر، یکی از چهره‌های کلیدی تیمی که در توسعه جمینای نقش داشت، نیز گوگل را ترک کرده و به اوپن‌ای‌آی رفته است.

مشکلات اولیه جمینای ۴ آرگون هنوز برای نتیجه‌گیری درباره کیفیت کلی مدل کافی نیستند، به‌خصوص اینکه عرضه آن در مرحله محدودی قرار دارد، اما ۲ اتفاق نخست روز‌های ابتدایی عرضه یک نکته مهم را پررنگ می‌کنند؛ جایگاه بالا در بنچمارک‌ها لزوماً تضمین نمی‌کند مدل در استفاده واقعی قابل اعتمادتر باشد یا برای رسیدن به همان امتیاز از روشی استفاده نکرده باشد که طراح آزمون انتظارش را نداشته است.

انتهای پیام/

ارسال نظر