آخرین اخبار:
19:19 02 / 07 /1405

آنتروپیک کلود اوپوس ۵.۵ را با هزینه کمتر و تمرکز بیشتر بر ایجنت‌ها عرضه کرد

کلود اوپوس ۵.۵ آنتروپیک
آنتروپیک کلود اوپوس ۵.۵ را به‌عنوان مدل تازه خود برای برنامه‌نویسی ایجنتی، کار با رایانه و وظایف حرفه‌ای طولانی عرضه کرده که در بارهای کاری معمول حدود ۴۰ درصد ارزان‌تر از نسل قبل تمام می‌شود. مدل جدید در آزمایش‌های خود شرکت عملکرد بهتری در چند آزمون برنامه‌نویسی و کار دانشی ثبت کرده و هم‌زمان با افزایش توانایی‌ها، مجموعه گسترده‌تری از ارزیابی‌ها و محدودیت‌های ایمنی را نیز به همراه دارد.

به گزارش خبرگزاری آنا؛ اوپوس ۵.۵ نخستین عضو خانواده جدید کلود ۵.۵ است و سونت ۵.۵ و هایکو ۵.۵ نیز طی هفته‌های آینده به آن اضافه خواهند شد. تمرکز اصلی نسل تازه روی وظایفی قرار دارد که مدل باید برای مدت طولانی بدون دخالت مداوم کاربر روی یک پروژه کار کند، از جابه‌جایی و اصلاح کد‌های بزرگ گرفته تا پژوهش، تحلیل اسناد و استفاده از ابزار‌های مختلف. پنجره زمینه یک میلیون توکنی و حداکثر خروجی ۱۲۸ هزار توکنی نیز برای همین نوع وظایف در نظر گرفته شده و قابلیت «تفکر تطبیقی» به‌صورت دائمی فعال است تا عمق پردازش براساس دشواری کار تغییر کند.

هزینه کمتر با سرعت بیشتر

قیمت استفاده از رابط برنامه‌نویسی برای هر یک میلیون توکن ورودی ۴ دلار و برای خروجی ۲۰ دلار تعیین شده که نسبت به اوپوس ۵ حدود ۲۰ درصد کاهش دارد. آنتروپیک می‌گوید تفاوت در استفاده واقعی بیشتر است و به‌دلیل نیاز کمتر به پردازش و توکن، هزینه اجرای بار‌های کاری معمول در تنظیمات پیش‌فرض حدود ۴۰ درصد کاهش پیدا می‌کند. هزینه خواندن حافظه موقت نیز به ۲۰ سنت برای هر یک میلیون توکن رسیده و تولید خروجی بیش از ۳۰ درصد سریع‌تر از نسل قبل انجام می‌شود.

این کاهش هزینه برای ایجنت‌های برنامه‌نویسی اهمیت بیشتری دارد، زیرا چنین سامانه‌هایی ممکن است ساعت‌ها میان فایل‌ها و ابزار‌های مختلف حرکت کنند و حجم زیادی از زمینه قبلی را بار‌ها بخوانند. آنتروپیک برای نشان دادن تفاوت عملی به آزمایش‌هایی اشاره کرده که در یکی از آن‌ها یک مهاجرت کد شامل ۶۸۰ هزار خط در کمتر از یک روز تکمیل شد. نمونه دیگری نیز به اصلاح یک پایگاه کد ۲۰۰ هزار خطی در کمتر از ۳ ساعت مربوط می‌شود که نسل قبلی برای همان کار بیش از ۲۰ ساعت زمان و حدود ۲.۵ برابر توکن بیشتر مصرف کرده بود. این نتایج توسط خود شرکت و مشتریان منتخب آن ارائه شده‌اند و هنوز نباید معادل ارزیابی مستقل عملکرد در تمام پروژه‌های واقعی در نظر گرفته شوند.

تمرکز اصلی روی برنامه‌نویسی ایجنتی است

نتایج منتشرشده از سوی شرکت جهش مدل تازه در اجرای وظایف چندمرحله‌ای برنامه‌نویسی را نشان می‌دهند. امتیاز آن در Terminal-Bench ۴.۰ به ۶۶.۴ درصد رسیده، در حالی که اوپوس ۵ امتیاز ۵۲.۳ درصد را ثبت کرده بود. نتیجه FrontierCode نیز از ۴۸ درصد به ۵۴.۴ درصد و CursorBench از ۴۶.۶ درصد به ۵۷.۸ درصد افزایش یافته است. مدل تازه در آزمون GDPval-AA برای کار‌های حرفه‌ای نیز امتیاز ۱۸۴۶ را به دست آورده که بالاتر از ۱۷۰۸ نسل قبلی است. خود آنتروپیک در عین حال تأکید می‌کند اختلاف چند امتیازی در این سطح از توانایی الزاماً تصویر دقیقی از تفاوت تجربه واقعی میان مدل‌ها ارائه نمی‌کند.

بهبود فقط به نتیجه نهایی محدود نشده و شرکت تلاش کرده مدل با مراحل و توکن‌های کمتری به پاسخ برسد. گزارش‌های آزمایشی ارائه‌شده از سوی توسعه‌دهندگانی مانند گیت‌هاب، اسپاتیفای و چند شرکت نرم‌افزاری به کاهش تعداد رفت‌وبرگشت‌ها، خروجی کوتاه‌تر و اجرای سریع‌تر بعضی فرایند‌ها اشاره دارند. این جهت‌گیری نشان می‌دهد رقابت مدل‌های پیشرفته به‌تدریج از «بالاترین امتیاز بنچمارک» به مقدار کار مفیدی منتقل می‌شود که یک ایجنت می‌تواند با هزینه، زمان و دخالت انسانی کمتر به پایان برساند.

آنتروپیک کلود اوپوس ۵.۵ را با هزینه کمتر و تمرکز بیشتر بر ایجنت‌ها عرضه کرد

آنتروپیک روی ایمنی بیشتر تأکید می‌کند

عرضه مدل تازه کمی پس از آن انجام شده که داریو آمودی، مدیرعامل آنتروپیک، خواستار «تنظیم سرعت در مرز توسعه» هوش مصنوعی شد تا سازوکار‌های ایمنی فرصت عقب نماندن از توانایی مدل‌ها را داشته باشند. به گفته آنتروپیک، این درخواست به معنای توقف عرضه نسل فعلی مدل‌ها نیست و خطر‌های آن‌ها را با مجموعه‌ای از ارزیابی‌های داخلی و خارجی، محدودیت‌های سایبری و زیستی و نظارت پس از انتشار قابل مدیریت می‌داند. اوپوس ۵.۵ پیش از عرضه توسط ارزیابان خارجی نیز بررسی شده و در ممیزی رفتاری خود شرکت که نزدیک به ۲ هزار سناریو را پوشش می‌دهد، در بیشتر شاخص‌های مربوط به رفتار ناسازگار نتیجه بهتری از مدل‌های اخیر کلود ثبت کرده است.

در یکی از آزمون‌های تازه برای بررسی تلاش مدل جهت عبور از مرز‌های محیط محدودشده، تعداد چنین تلاش‌هایی حدود ۸۵ درصد کمتر از اوپوس ۵ و میتوس ۵.۱ بوده است. با این حال آنتروپیک یک محدودیت مهم را نیز پذیرفته و می‌گوید مدل گاهی متوجه می‌شود که در حال ارزیابی است، موضوعی که می‌تواند رفتار آن در آزمایش را با شرایط واقعی متفاوت کند. شرکت در نتیجه تأکید دارد هنوز روشی برای شناسایی تمام رفتار‌های نامطلوب پیش از انتشار مدل وجود ندارد.

مدل‌های قدرتمندتر به مقررات بیشتری نیاز خواهند داشت

نگرانی اصلی آنتروپیک بیشتر به نسل‌هایی مربوط می‌شود که در آینده بتوانند بخش بزرگی از پژوهش و توسعه هوش مصنوعی را خودکار کنند. شرکت معتقد است اگر مدل‌ها به مرحله‌ای برسند که بتوانند در توسعه مدل‌های بعدی نقش مستقل و گسترده‌ای ایفا کنند، آزمایش‌ها و محدودیت‌های فعلی دیگر به‌تنهایی استاندارد ایمنی کافی نخواهند بود و سیاست‌گذاری عمومی باید سهم بیشتری در تعیین نحوه توسعه و استفاده از آن‌ها داشته باشد.

آنتروپیک در عین حال توسعه مدل‌ها را ادامه می‌دهد و اوپوس ۵.۵ اکنون از طریق رابط برنامه‌نویسی شرکت، آمازون Bedrock، گوگل کلاد و مایکروسافت Foundry در دسترس است. عرضه این نسل نشان می‌دهد راهبرد فعلی شرکت کاهش سرعت انتشار مدل‌های موجود نیست و تمرکز بیشتر روی افزایش بهره‌وری و ایجاد سازوکار‌های سخت‌گیرانه‌تر برای نسل‌هایی قرار دارد که ممکن است توانایی‌های آن‌ها از محدوده ابزار‌های فعلی ایمنی فراتر برود.

انتهای پیام/

ارسال نظر