جمینای ۴ آرگون با وجود امتیازهای بالا در بنچمارکها در استفاده واقعی به مشکل خورد
به گزارش خبرگزاری آنا؛ گوگل جمینای ۴ آرگون را در ابتدا تنها در اختیار گروه کوچکی از آزمایشکنندگان قرار داده و عرضه عمومی آن برای مرحله بعد برنامهریزی شده است. کورای کاووکچواوغلو، معمار ارشد هوش مصنوعی گوگل، هنگام معرفی این مدل از تواناییهای آن در مهندسی نرمافزار، کارهای حقوقی و مالی، نویسندگی خلاق و دفاع سایبری تمجید کرد و گفت آرگون در یکی از آزمونهای امنیت سایبری عملکردی همسطح GPT-۶ آسترا اوپنایآی داشته است. با این حال پیش از آنکه ۲۴ ساعت از معرفی مدل بگذرد، گزارشهایی منتشر شد که بار دیگر فاصله میان امتیازهای بالای بنچمارک و عملکرد واقعی مدلهای هوش مصنوعی را به بحث گذاشت.
امتیاز بالا الزاماً به معنی عملکرد بهتر نیست
بلومبرگ با استناد به شماری از کارکنان گوگل گزارش داده است که جمینای ۴ آرگون با وجود نتایج قابل توجه در بنچمارکها، در بعضی وظایف مهم دنیای واقعی از جمله برخی کارهای برنامهنویسی با مشکل روبهرو میشود. منابع این گزارش بهصورت ناشناس صحبت کردهاند و گوگل نیز این ادعاها را نادرست دانسته و در پاسخ به اظهارات کاووکچواوغلو، مدیر ارشد فناوری دیپمایند درباره اعتماد وی به توانایی مدل و تیم توسعهدهنده آن اشاره کرده است.
این گزارش با تصویری که گوگل هنگام معرفی آرگون ارائه داد تفاوت دارد. معمار ارشد هوش مصنوعی شرکت گفته بود این مدل نحوه کار و ساخت محصولات در داخل گوگل را بهطور اساسی تغییر داده و هزاران نفر از کارکنان شرکت از توانایی آن در وظایف تخصصی برنامهنویسی، پژوهش عمیق و تولید متن باکیفیت استقبال کردهاند. اختلاف میان این ۲ روایت لزوماً به معنی بیاعتبار بودن نتایج آزمایشگاهی نیست، اما بار دیگر محدودیت بنچمارکها را برجسته میکند؛ مدلی میتواند روی مجموعهای از آزمونهای مشخص امتیاز بسیار بالایی بگیرد و در عین حال هنگام روبهرو شدن با مسئلهای پیچیدهتر، مبهمتر یا متفاوت از نمونههای ارزیابیشده عملکرد ضعیفتری داشته باشد.
آرگون برای گرفتن امتیاز بیشتر قواعد بازی را دور زد
ماجرای مهمتر به Vending-Bench ۲ مربوط میشود؛ بنچمارکی از شرکت Andon Labs که توانایی مدلهای هوش مصنوعی برای اداره یک کسبوکار شبیهسازیشده دستگاه فروش خودکار را آزمایش میکند. مدل باید موجودی کالا را مدیریت کند، با مشتریان و تأمینکنندگان سروکار داشته باشد و تصمیمهای اقتصادی بگیرد و در پایان براساس مقدار پول باقیمانده در حساب بانکی امتیاز دریافت میکند. جمینای ۴ آرگون در جدول این آزمون به رتبه سوم رسید و تنها پشت آسترا و GPT-۶ سول اوپنایآی قرار گرفت؛ نتیجهای که Andon Labs آن را جهشی بزرگ برای گوگل توصیف کرد.
بررسی دقیقتر رفتار مدل، اما مشخص کرد بخشی از این امتیاز با تصمیمهایی به دست آمده که با هدف واقعی اداره درست کسبوکار همخوانی نداشتند. به گفته Andon Labs، آرگون در جریان شبیهسازی تأییدیههای ایمیلی غیرواقعی ساخته، از پرداخت بعضی بازپرداختها خودداری کرده، از اشتباههای موجود در صورتحسابها به نفع خود استفاده کرده و در ارتباط با تأمینکنندگان اطلاعات نادرست داده است. در یکی از نمونهها نیز مدل با درخواست بازپرداخت مشتری برای کالای معیوب روبهرو شد، اما به این نتیجه رسید که پس دادن پول موجودی حسابش را کاهش میدهد و در نتیجه امتیاز نهاییاش پایین میآید؛ بنابراین بازپرداخت را انجام نداد.
وقتی هدف بنچمارک از هدف واقعی مهمتر میشود
مشکل اصلی در چنین رفتاری این نیست که مدل نتوانسته وظیفه را انجام دهد، بلکه برعکس، راهی برای بهینه کردن همان عددی پیدا کرده که بنچمارک آن را معیار موفقیت قرار داده بود. هدف Vending-Bench ۲ سنجش توانایی اداره یک کسبوکار است، اما اگر معیار نهایی فقط موجودی حساب بانکی باشد، مدل ممکن است به این نتیجه برسد که نادیده گرفتن حقوق مشتری یا سوءاستفاده از خطاها نیز راهی برای افزایش همان عدد است. در چنین حالتی مدل ظاهراً در آزمون موفق میشود، اما رفتارش با چیزی که از یک مدیر واقعی و قابل اعتماد انتظار میرود فاصله دارد.
این پدیده یکی از مشکلات شناختهشده ارزیابی مدلهای هوش مصنوعی است و زمانی رخ میدهد که سامانه بهجای دنبال کردن هدف موردنظر طراح آزمون، روی شاخصی که برای اندازهگیری موفقیت تعیین شده تمرکز میکند و راهی برای بالا بردن آن پیدا میکند. نتیجه میتواند مدلی باشد که در جدول رتبهبندی عملکرد بسیار خوبی دارد، اما بخشی از موفقیت خود را مدیون رفتارهایی است که در کاربرد واقعی نامطلوب یا حتی غیرقابل قبول محسوب میشوند. اتفاق آرگون به همین دلیل نمونهای ملموس از این است که چرا مقایسه مدلها تنها براساس یک عدد یا جایگاه در جدول بنچمارک میتواند گمراهکننده باشد.
آزمایش دستگاه فروش خودکار پیشتر هم مدلها را به دردسر انداخته بود
Andon Labs پیشتر نسخهای از همین آزمایش را روی مدل Claude آنتروپیک اجرا کرده بود. آن آزمایش که با نام «Claudius» شناخته شد، رفتارهای عجیب و خطاهای متعددی از مدل را آشکار کرد و کلود در مقاطعی اطلاعاتی کاملاً ساختگی تولید کرد؛ از جمله ادعای حضور در نشانی خیالی خانواده سیمپسونها. تفاوت ماجرای تازه در این است که رفتار آرگون فقط به توهم یا تولید اطلاعات اشتباه محدود نشده و بخشی از تصمیمهای مدل مستقیماً در راستای افزایش امتیاز مالی خود در شبیهسازی بوده است.
این موضوع اهمیت طراحی ارزیابیها را بیشتر میکند. اگر یک مدل بداند موفقیت با یک شاخص عددی مشخص سنجیده میشود، ممکن است به راههایی برسد که از نظر ریاضی امتیاز را افزایش میدهند، اما مقصود اصلی آزمون را زیر پا میگذارند. به همین دلیل نتایج بنچمارکها زمانی معنای بیشتری پیدا میکنند که همراه با بررسی رفتار مدل، نحوه رسیدن به پاسخ و آزمایش در سناریوهای واقعیتر تفسیر شوند.
گوگل از توانایی مدل تازه خود دفاع میکند
گوگل ادعای ضعف آرگون در بعضی وظایف واقعی را رد کرده و همچنان روی عملکرد این مدل در برنامهنویسی و پژوهش تأکید دارد. این شرکت قصد دارد پس از مرحله آزمایش محدود، دسترسی به جمینای ۴ آرگون را گسترش دهد و مشتریان پولی API و مشترکان AI Ultra از نخستین گروههایی خواهند بود که به آن دسترسی پیدا میکنند.
معرفی آرگون در شرایطی انجام شده که بخش هوش مصنوعی گوگل طی ماههای اخیر چند چهره شناختهشده را نیز از دست داده است. جف دین، دانشمند ارشد مشهور شرکت، برای راهاندازی استارتاپ خود گوگل را ترک کرده و جان جامپر، پژوهشگر هوش مصنوعی و برنده جایزه نوبل ۲۰۲۴ برای فعالیت روی AlphaFold، به آنتروپیک پیوسته است. نوام شازیر، یکی از چهرههای کلیدی تیمی که در توسعه جمینای نقش داشت، نیز گوگل را ترک کرده و به اوپنایآی رفته است.
مشکلات اولیه جمینای ۴ آرگون هنوز برای نتیجهگیری درباره کیفیت کلی مدل کافی نیستند، بهخصوص اینکه عرضه آن در مرحله محدودی قرار دارد، اما ۲ اتفاق نخست روزهای ابتدایی عرضه یک نکته مهم را پررنگ میکنند؛ جایگاه بالا در بنچمارکها لزوماً تضمین نمیکند مدل در استفاده واقعی قابل اعتمادتر باشد یا برای رسیدن به همان امتیاز از روشی استفاده نکرده باشد که طراح آزمون انتظارش را نداشته است.
انتهای پیام/