دانش و فناوری

آنتروپیک از مدل Claude Opus 5.5 رونمایی کرد؛ عملکردی هم‌سطح Fable 5.1 اما ارزان‌تر

آنتروپیک از Claude Opus 5.5، نخستین مدل از خانواده جدید Claude 5.5، رونمایی کرد. این مدل در بیشتر کارها عملکردی هم‌سطح Claude Fable 5.1 دارد و هزینه اجرای آن ۴۰ درصد کمتر از Opus 5 است.

کلاد Opus 5.5 نسبت به Opus 5 پیشرفت قابل‌توجهی داشته و آنتروپیک آن را مدل پیشرو جدید خود معرفی می‌کند. آزمایش‌کنندگان اولیه در پیچیده‌ترین کارهای خود جهش‌های محسوسی در عملکرد آن مشاهده کرده‌اند. آنتروپیک می‌گوید یکی از آزمایش‌کنندگان با استفاده از این مدل مهاجرت ۶۸۰ هزار خط کد را در کمتر از یک روز انجام داد؛ کاری که انجام آن برای یک تیم مهندسی هفته‌ها زمان می‌برد.

Opus 5.5 همچنین در پیدا و برطرف کردن ناکارآمدی‌های نرم‌افزاری عملکرد خوبی دارد. وقتی از آن خواسته شد زمان بارگذاری تمام صفحات یک اپلیکیشن وب را کاهش دهد، در ۳۹ مورد از ۴۰ مورد موفق شد. در مقابل، Opus 5 بهبودهای کوچک‌تری ایجاد کرد که رفتار اپلیکیشن را نیز تغییر می‌داد. در آزمایش دیگری، چند مدل Claude مأمور شدند تنها با دریافت یک پرامپت، یک بازی بسازند و Opus 5.5 از نظر کیفیت گرافیکی و پرداخت نهایی، امتیاز بیشتری از تمام مدل‌های دیگر به دست آورد.

ایمنی

Opus 5.5 در ارزیابی رفتاری خودکار آنتروپیک، که مجموعه‌ای از آزمون‌های هم‌راستایی برای بررسی Claude در هزاران سناریوی شبیه‌سازی‌شده است، بهترین امتیاز ثبت‌شده میان مدل‌های این شرکت را به دست آورده است. این مدل در مقایسه با مدل‌های اخیر احتمال بسیار کمتری دارد که اقداماتی با بازگشت دشوار انجام دهد یا خارج از محدوده تعیین‌شده عمل کند. همچنین مقاومت آن در برابر حملات تزریق پرامپت از Opus 5 بیشتر است.

آنتروپیک دامنه آزمون‌های هم‌راستایی خود را نیز گسترش داده تا وظایف طولانی‌تر، وظایف غیرممکن و سناریوهای مبتنی بر حوادث واقعی را پوشش دهد؛ هرچند این ارزیابی‌ها همچنان محدودیت‌هایی دارند. جزئیات کامل ارزیابی در System Card مربوط به Opus 5.5 منتشر شده است.

از آنجا که Opus 5.5 در زیست‌شناسی و امنیت سایبری عملکردی مشابه Claude Mythos 5.1 دارد، آنتروپیک آن را با تدابیر ایمنی مشابه Claude Fable 5.1 عرضه می‌کند. سازمان‌های تأییدشده می‌توانند برای استفاده از Opus 5.5 در پژوهش‌های زیست‌شناسی به برنامه Life Sciences Verification Program درخواست دهند. آنتروپیک همچنین طی هفته‌های آینده دسترسی به Cyber Verification Program را گسترش می‌دهد تا متخصصان تأییدشده امنیت سایبری بتوانند از Opus 5.5 در کارهای خود استفاده کنند.

هزینه و سرعت

Opus 5.5 برای ارائه خدمات به توان پردازشی کمتری نسبت به Opus 5 نیاز دارد و قیمت‌گذاری آن نیز این موضوع را منعکس می‌کند. آزمایش‌های آنتروپیک نشان می‌دهند که این مدل در تنظیمات پیش‌فرض و کارهای معمول، ۴۰ درصد ارزان‌تر از Opus 5 است.

قیمت هر یک میلیون توکن ورودی و خروجی به‌ترتیب ۴ و ۲۰ دلار است که ۲۰ درصد کمتر از Opus 5 محسوب می‌شود. خواندن توکن‌های کش‌شده که بخش عمده هزینه کارهای عاملی و کدنویسی را تشکیل می‌دهند، به ازای هر یک میلیون توکن ۰.۲۰ دلار هزینه دارد؛ یعنی ۶۰ درصد کمتر از Opus 5. Opus 5.5 همچنین خروجی را بیش از ۳۰ درصد سریع‌تر از Opus 5 تولید می‌کند.

علاوه بر کاهش قیمت، آنتروپیک محدودیت استفاده پنج‌ساعته را در طرح‌های Pro، Max و Team افزایش داده است. کاربران اشتراکی همچنین امکان دریافت مجدد سهمیه محدودیت نرخ را دارند و می‌توانند این امکان را ذخیره کرده و هر زمان که خواستند استفاده کنند.

ارتباطات

Opus 5.5 در مقایسه با مدل‌های قبلی ارتباط طبیعی‌تری دارد. آزمایش‌کنندگان اولیه نوشته‌های آن را واضح‌تر و دنبال کردن آنها را آسان‌تر دانسته‌اند؛ موضوعی که بخشی از بازخوردهای رایج درباره Opus 5 را برطرف می‌کند. این مدل مهم‌ترین اطلاعات را در ابتدای پاسخ قرار می‌دهد و سبک نگارشش باعث می‌شود در جلسات کاری طولانی، همراه کاری بهتری باشد. یکی از آزمایش‌کنندگان اولیه درباره آن گفته است: «مثل خودم می‌نویسد.»

آنتروپیک نیز در استفاده داخلی خود متوجه شده که دنبال کردن و بررسی کارهای Opus 5.5 آسان‌تر است؛ مزیتی که علاوه بر کاربرد عملی، از نظر ایمنی نیز اهمیت دارد.

Claude Sonnet 5.5 و Claude Haiku 5.5 طی هفته‌های آینده عرضه خواهند شد و بسیاری از بهبودهای عملکرد، بهره‌وری و ایمنی Opus 5.5 را ارائه خواهند کرد.

عملکرد و بهره‌وری هزینه

در بنچمارک‌های آنتروپیک، Claude Opus 5.5 در کدنویسی عاملی، استفاده از رایانه و کارهای دانشی پیشتاز است. بااین‌حال، آنتروپیک می‌گوید در این سطح از قابلیت، اختلاف امتیازهای بنچمارک‌ها دیگر راهنمای کاملاً قابل‌اعتمادی برای تفاوت عملکرد در دنیای واقعی نیست. در استفاده داخلی این شرکت، فاصله Opus 5.5 و Claude Fable 5.1 کمتر از چیزی بوده که امتیازهای بنچمارک نشان می‌دهند.

مزیت Opus 5.5 در بهره‌وری واضح‌تر است. این مدل به ازای هر توکن هزینه کمتری نسبت به Opus 5 دارد و برای هر کار نیز توکن‌های کمتری مصرف می‌کند؛ در مجموع، این موارد باعث کاهش ۴۰ درصدی هزینه می‌شوند.

حالت سریع Opus 5.5 نیز در Claude Code و Claude Platform با سرعت حداکثر ۲.۵ برابر در دسترس است. این حالت به ازای هر یک میلیون توکن ورودی ۸ دلار و به ازای هر یک میلیون توکن خروجی ۴۰ دلار هزینه دارد.

کدنویسی

Opus 5.5 به‌ویژه برای کارهای طولانی و گسترده مانند مهاجرت و ممیزی کل یک پایگاه کد عملکرد خوبی دارد. یکی از آزمایش‌کنندگان اولیه از این مدل برای ممیزی و اصلاح یک پایگاه کد ۲۰۰ هزار خطی در کمتر از سه ساعت استفاده کرد؛ درحالی‌که Opus 5 برای همین کار بیش از ۲۰ ساعت زمان برد و ۲.۵ برابر توکن بیشتری مصرف کرد.

در یک آزمایش داخلی، آنتروپیک از Opus 5.5 و Fable 5.1 خواستند HAProxy، نرم‌افزار پرکاربردی که بار ترافیک وب را میان سرورها توزیع می‌کند، از زبان C به Rust منتقل کنند. هر دو نسخه تقریباً تمام آزمون‌های رگرسیون خود HAProxy را با موفقیت پشت سر گذاشتند، اما Opus 5.5 این کار را در ۹.۵ ساعت در مقابل ۱۲ ساعت برای Fable 5.1 انجام داد و هزینه آن ۵۱ درصد کمتر بود.

Opus 5.5 در کدنویسی عاملی، نتایجی در سطح پیشرفته ارائه می‌دهد و هزینه آن نیز کسری از هزینه مدل‌های رقیب است. در سطح تلاش پیش‌فرض FrontierCode، این مدل GPT-6 Astra را با حدود ۲۰ درصد هزینه هر کار شکست می‌دهد. در Terminal Bench 4.0 نیز عملکردی مشابه Astra با حدود ۴۰ درصد هزینه آن دارد. در CursorBench هم با هزینه‌ای حدود یک‌سوم GPT-5.6 Sol، امتیاز Opus 5.5 حدود ۱۱ امتیاز بیشتر است.

ایمن‌ترین عامل کدنویسی

شرکت‌هایی که از عوامل هوش مصنوعی در سیستم‌های خود استفاده می‌کنند باید مطمئن باشند این عوامل مطابق انتظار عمل می‌کنند؛ به‌ویژه زمانی که برای ساعت‌های طولانی به‌صورت خودکار فعالیت دارند. Opus 5.5 دارای یک طبقه‌بند است که پیش از اجرای هر اقدام آن را بررسی می‌کند، یک سندباکس متن‌باز دارد که تیم‌های امنیتی می‌توانند آن را ممیزی کنند و از قابلیت بررسی کد برای شناسایی آسیب‌پذیری‌ها پیش از ادغام آنها برخوردار است.

خود مدل نیز دفاع‌های قدرتمندتری دارد. در برابر حملات تزریق پرامپت، Opus 5.5 در تمام تنظیماتی که آنتروپیک آزمایش کرده، ازجمله کدنویسی، استفاده از ابزارها، استفاده از رایانه و وب‌گردی، عملکردی برابر یا بهتر از Opus 5 داشته است. در بنچمارکی که شرکت امنیت هوش مصنوعی Gray Swan انجام داده، Opus 5.5 همراه با Fable 5.1 پایین‌ترین نرخ موفقیت حملات تزریق پرامپت را در میان تمام مدل‌های آزمایش‌شده داشته است.

کارهای دانشی

Opus 5.5 به‌عنوان یک پژوهشگر قابل‌اعتماد و توانمند معرفی شده است. در یک آزمایش داخلی، آنتروپیک از Opus 5.5، Fable 5.1 و Opus 5 خواست گزارشی درباره عملکرد فصلی یک شرکت تهیه کنند و فقط از اطلاعات موجود در نسخه‌ای از وب استفاده کنند که پیدا کردن گزارش درآمدی در آن دشوار بود.

یک ارزیاب خودکار تمام ارقام و نقل‌قول‌ها را با منابع مقایسه کرد. در تنظیمات مختلف میزان تلاش، ۱۶ مورد از ۱۸ گزارش Opus 5.5 از معیار کیفی آنتروپیک عبور کردند؛ در این ارزیابی، وجود هر رقم یا نقل‌قول ساختگی باعث رد شدن گزارش می‌شد. Fable 5.1 و Opus 5 در هیچ‌یک از تلاش‌های خود نتوانستند از این معیار عبور کنند.

Opus 5.5 در تحلیل مالی و کارهای تجاری نیز عملکرد قدرتمندی دارد. Walleye Capital، یک شرکت سرمایه‌گذاری و از آزمایش‌کنندگان اولیه، گزارش داده که Opus 5.5 در پایین‌ترین سطح تنظیمات، بخش عمده آزمون‌های ارزیابی این شرکت را حل کرده است. در تنظیمات بالاتر، عملکرد آن بهتر هم شد و حتی متوجه خطایی در دستورالعمل‌های ارزیابی شرکت شد و آن را اصلاح کرد. هیچ مدل دیگری پیش از آن این خطا را شناسایی نکرده بود.

در آزمایش دیگری، آنتروپیک از Opus 5.5 و Opus 5 خواست یک ادغام پیشنهادی میان دو شرکت فرضی نرم‌افزار منابع انسانی را تحلیل کنند. هر دو مدل یک مدل مالی در Excel ساختند و سپس آن را به ارائه‌ای مدیریتی درباره منطقی بودن این معامله با قیمت پیشنهادی تبدیل کردند.

هر دو مدل به نتیجه یکسانی درباره معامله رسیدند، اما مدل مالی Opus 5.5 جزئیات بیشتری داشت و ارائه آن خواناتر بود؛ درحالی‌که مدل Opus 5 خطاهای جزئی داشت. Opus 5.5 این کار را در ۶۳ دقیقه در مقابل ۹۳ دقیقه برای Opus 5 انجام داد و هزینه تولید آن ۵۰ درصد کمتر بود.

در ارزیابی‌های مربوط به کارهای دانشی، Opus 5.5 ضمن مصرف توکن کمتر، عملکرد بهتری نسبت به سایر مدل‌ها دارد. در GDPval-AA v2.1، آزمونی برای سنجش کارهای واقعی در ۴۴ شغل، Opus 5.5 امتیاز ۱۸۴۶ Elo را به دست آورده که بالاتر از Fable 5.1 و Opus 5 است. در سطح تلاش پیش‌فرض، یعنی متوسط، Opus 5.5 با حدود یک‌پنجم هزینه هر کار، GPT-6 Astra را در بالاترین سطح تلاش شکست می‌دهد. این مدل همچنین در بنچمارک‌های مربوط به گردش کارهای تجاری و جمع‌آوری داده در مقیاس بزرگ، عملکرد بهتری نسبت به سایر مدل‌ها داشته است.

ارتباطات

آنتروپیک تغییرات قابل‌توجهی در نحوه نگارش و ارتباط Opus 5.5 ایجاد کرده است؛ حوزه‌ای که یکی از رایج‌ترین موضوعات بازخورد درباره Opus 5 بود. پیام‌های مدل اکنون در نگاه اول بسیار آسان‌تر قابل‌درک هستند و آزمایش‌کنندگان گفته‌اند این ویژگی در جلسات کاری طولانی به آنها کمک کرده است.

Opus 5.5 مهم‌ترین اطلاعات را در ابتدای پاسخ قرار می‌دهد، کمتر از اصطلاحات تخصصی یا عبارت‌های نامتعارف استفاده می‌کند و قواعد نگارشی تعیین‌شده از سوی کاربر را بهتر دنبال می‌کند. آنتروپیک می‌گوید این ویژگی‌ها Opus 5.5 را به همکاری بهتر تبدیل کرده‌اند.

کند کردن روند پیشرفت مرزهای هوش مصنوعی

هفته گذشته، داریو آمودی، مدیرعامل آنتروپیک، استدلال کرد که روند پیشرفت هوش مصنوعی باید به‌گونه‌ای تنظیم شود که اقدامات ایمنی همچنان جلوتر از قابلیت‌های مدل‌ها حرکت کنند. از دید او، این رویکرد راهی برای ایمن نگه داشتن هوش مصنوعی، حفظ رقابت با چین و بهره‌مندی از مزایای این فناوری، به‌ویژه در حوزه‌هایی مانند زیست‌شناسی و پزشکی، است.

آنتروپیک می‌گوید خطرات مدل‌های امروزی را تا حد زیادی درک می‌کند و برای مدیریت آنها آمادگی مناسبی دارد. بااین‌حال، با افزایش قابلیت مدل‌ها ممکن است خطرات جدی‌تری به‌سرعت ظاهر شوند و باید از هم‌اکنون برای آنها آماده شد. به همین دلیل، اقدامات ایمنی این شرکت هم‌زمان در دو بازه زمانی دنبال می‌شود.

اقدامات ایمنی برای مدل‌های فعلی

نسل فعلی مدل‌ها به مجموعه‌ای تثبیت‌شده از اقدامات ایمنی متکی است که شامل آزمون‌های گسترده هم‌راستایی، ارزیابی پیش از عرضه توسط سازمان‌های خارجی مانند METR و Frontier Design و تدابیر ایمنی متناسب با قابلیت‌های هر مدل در حوزه‌های پرخطر مانند امنیت سایبری و زیست‌شناسی می‌شود.

آنتروپیک این اقدامات را با عرضه هر مدل اصلاح می‌کند. این شرکت معتقد است اقدامات مذکور برای جدی‌ترین خطراتی که مدل‌های امروزی ایجاد می‌کنند مناسب هستند و تصویری گسترده، هرچند نه کامل، از طیف خطرات جدی ارائه می‌دهند.

آنتروپیک همچنین توانایی خود برای آموزش و ارزیابی مدل‌های هم‌راستا را دنبال می‌کند و درباره مدل‌های عمومی و داخلی خود در گزارش‌های خطری که تحت «سیاست مقیاس‌دهی مسئولانه» منتشر می‌شوند، گزارش می‌دهد. این سیاست چارچوبی داوطلبانه برای مدیریت خطرات فاجعه‌بار ناشی از سامانه‌های پیشرفته هوش مصنوعی است.

آماده‌سازی برای مدل‌های آینده

آنتروپیک در حال آماده‌سازی فرایندهای آموزش و ارزیابی خود برای مدل‌های پیشرفته‌تر است. این شرکت نحوه فیلتر کردن محیط‌های مورد استفاده در یادگیری تقویتی را سخت‌گیرانه‌تر می‌کند، زیرا محیط‌های معیوب یکی از منابع اصلی رفتارهای ناهماهنگ هستند.

این شرکت همچنین در حال بهبود پاداش‌های هم‌راستایی و توسعه فرایندهای خودکار برای تولید سناریوهای جدید و متنوع در آموزش ایمنی است. علاوه بر این، اقدامات امنیتی و نظارتی خود را تقویت می‌کند و به‌طور ویژه روی بهبود نظارت و ارزیابی مبتنی بر تفسیرپذیری تمرکز دارد. آنتروپیک امیدوار است این روش‌ها وابستگی به ممیزی زنجیره استدلال مدل، یعنی استدلالی که مدل هنگام کار به‌صورت مکتوب ارائه می‌کند، را کاهش دهند.

مدل‌هایی با قابلیت‌های بالاتر، مانند مدل‌هایی که می‌توانند تمام فرایند پژوهش هوش مصنوعی را به‌طور کامل خودکار کنند، به استاندارد ایمنی بالاتری نیاز دارند. بخش مهمی از درخواست آنتروپیک برای کند کردن روند پیشرفت مرزهای هوش مصنوعی بر این انتظار استوار بود که چنین مدل‌هایی به‌زودی قابل آموزش باشند.

آنتروپیک برای این مدل‌ها فرض نمی‌کند اقدامات بالا به‌تنهایی استاندارد ایمنی موردنظر را تأمین کنند. این شرکت معتقد است هرچه هوش مصنوعی توانمندتر می‌شود، سیاست‌گذاری عمومی باید نقش بیشتری در تضمین ایمنی سامانه‌هایی داشته باشد که مردم به آنها اتکا می‌کنند.

ایجاد چنین ظرفیتی زمان می‌برد و آنتروپیک می‌گوید زیرساخت لازم برای آن را آغاز کرده است. این شرکت همچنین به مشارکت در بحث‌های سیاست‌گذاری با دولت‌ها و صنعت، ازجمله درباره رویکردهای قانون‌گذاری و هماهنگی بین‌المللی، ادامه خواهد داد.

هم‌راستایی

در مجموعه ارزیابی اصلی آنتروپیک، یعنی یک ممیزی رفتاری خودکار که Claude را در نزدیک به ۲ هزار سناریو بررسی می‌کند، Opus 5.5 در تقریباً تمام معیارهای مربوط به رفتار ناهماهنگ، عملکرد بهتری از تمام مدل‌های اخیر Claude داشته است. این مدل همچنین در بیشتر معیارهای صداقت، قدرتمندترین مدل آنتروپیک محسوب می‌شود.

Opus 5.5 در چندین رفتاری که در حوادث اخیر امنیت سایبری نقش داشتند نیز نسبت به مدل‌های قبلی پیشرفت کرده است؛ ازجمله استدلال جانبدارانه یا هدف‌محور، تلاش برای خروج از سندباکس و انجام اقدامات آسیب‌زا پس از آنکه مدل به این نتیجه می‌رسد در محیطی شبیه‌سازی‌شده قرار دارد.

در یک ارزیابی جدید برای سنجش تمایل مدل به عبور از مرزهای محصورسازی، Opus 5.5 حدود ۸۵ درصد کمتر از Opus 5 یا Claude Mythos 5.1 تلاش کرد این مرزها را دور بزند. تمام تلاش‌های Opus 5.5 نیز شدت پایینی داشتند و خود مدل آنها را گزارش کرد. برای تیم‌هایی که Claude را بدون نظارت مستقیم روی کدها و سیستم‌های خود اجرا می‌کنند، این موضوع به اندازه قابلیت خام مدل اهمیت دارد.

بااین‌حال، آنتروپیک می‌گوید ایجاد ارزیابی‌هایی که بتوانند پیش از عرضه، تمام خطاهای مدل را با اطمینان شناسایی کنند همچنان مسئله‌ای حل‌نشده است. این شرکت نشانه‌هایی دیده که Opus 5.5 اغلب احتمال می‌دهد در حال ارزیابی شدن است؛ موضوعی که سنجش نحوه رفتار مدل در طیف گسترده محیط‌های واقعی را دشوار می‌کند.

آنتروپیک انتظار دارد با گسترش این محیط‌ها و افزایش قابلیت مدل‌ها، این چالش نیز بیشتر شود؛ مگر اینکه در حوزه تفسیرپذیری پیشرفت حاصل شود. این شرکت می‌گوید با وجود اطمینان از بهبود گسترده Opus 5.5 در حوزه‌هایی که قابل اندازه‌گیری هستند، اقدامات هم‌راستایی خود را با تدابیر ایمنی زیر همراه کرده است.

تدابیر ایمنی

با قدرتمندتر شدن مدل‌ها، تدابیر ایمنی سخت‌گیرانه‌تر یکی از راه‌های جلوگیری از تبدیل قابلیت‌های جدید به ابزار سوءاستفاده هستند. Opus 5.5 نخستین مدل Opus است که با مجموعه‌ای از تدابیر ایمنی مشابه Fable 5.1 در حوزه‌های امنیت سایبری، زیست‌شناسی و استخراج قابلیت مدل عرضه می‌شود. در تمام این موارد، وظایف در صورت نیاز به‌صورت شفاف به مدل دیگری واگذار می‌شوند.

امنیت سایبری

از آنجا که Opus 5.5 قابلیت‌های بسیار قدرتمندی در امنیت سایبری دارد، آنتروپیک تدابیر ایمنی مشابه Fable 5.1 را برای این مدل اعمال می‌کند. کاربران می‌توانند به‌عنوان بخشی از چرخه معمول توسعه نرم‌افزار، با Opus 5.5 باگ‌های کد خود را شناسایی و برطرف کنند، اما بیشتر وظایف امنیت سایبری به Opus 4.8 هدایت خواهند شد.

آنتروپیک قصد دارد برنامه Cyber Verification Program را به‌زودی برای متخصصان دفاع سایبری گسترش دهد تا Opus 5.5 را نیز شامل شود. برنامه جدید سه سطح برای دسترسی مورداعتماد با میزان دسترسی فزاینده خواهد داشت که شامل دسترسی به مدل‌های Claude Mythos نیز می‌شود. Claude Security هم‌اکنون با دسترسی به Claude Mythos 5.1 در دسترس است.

زیست‌شناسی

Opus 5.5 در حوزه زیست‌شناسی قابلیت بالایی دارد و در بسیاری از زمینه‌های کاری، عملکرد آن از Opus 5 بهتر و هم‌سطح یا بهتر از Claude Mythos 5.1 است. برای نمونه، Opus 5.5 در یک ارزیابی پیش‌بینی و طراحی مولکولی بلندمدت که با همکاری Dyno Therapeutics انجام شد، پیشرفت‌هایی به دست آورد. ارزیابان متخصص نیز نوآوری علمی آن را هم‌سطح بهترین مدلی دانستند که آزمایش کرده بودند.

به همین دلیل، Opus 5.5 از همان تدابیر ایمنی زیست‌شناسی Fable 5.1 استفاده می‌کند. کاربرانی که این تدابیر مانع انجام فعالیت‌های تحقیق و توسعه آنها می‌شود، می‌توانند برای برنامه جدید Life Sciences Verification Program درخواست دهند. این برنامه به سازمان‌های تأییدشده مانند آزمایشگاه‌های دانشگاهی، استارتاپ‌ها و شرکت‌های داروسازی امکان دسترسی به تدابیر ایمنی متناسب با طیف کامل فعالیت‌های مرتبط با زیست‌شناسی را می‌دهد.

استخراج قابلیت مدل

حملات استخراج قابلیت مدل یا Distillation که در آنها مهاجمان از هزاران حساب جعلی برای استخراج قابلیت‌های یک مدل در مقیاس صنعتی استفاده می‌کنند، خطرات امنیتی و ایمنی ملی ایجاد می‌کنند. این فرایند به عوامل مخرب اجازه می‌دهد مدل‌های بسیار توانمندی را بدون تدابیر ایمنی تعبیه‌شده در Claude ایجاد کنند.

گزارش اطلاعات تهدید آنتروپیک در سپتامبر ۲۰۲۶ جزئیات فعالیت‌های غیرقانونی استخراج قابلیتی را که این شرکت تاکنون شناسایی و مختل کرده، ارائه می‌دهد.

Opus 5.5 با قابلیت «استدلال حفظ‌شده» عرضه می‌شود؛ سازوکار ضد استخراج قابلیتی که آنتروپیک آن را همراه Fable 5.1 معرفی کرد. این قابلیت مانع از آن می‌شود که کاربران API با ویرایش زمینه قبلی Claude، تلاش کنند استدلال مدل را استخراج کنند.

این قابلیت برای حساب‌های API ایجادشده از ۳۱ اوت ۲۰۲۶ به بعد روی Fable 5.1 و Opus 5.5 اعمال می‌شود. آنتروپیک جزئیات این تغییر را در مرکز راهنمای خود توضیح داده و مستندات استدلال حفظ‌شده نیز نحوه آزمایش و به‌روزرسانی یکپارچه‌سازی‌ها را نشان می‌دهند.

نگهداری داده و انطباق با قوانین

مانند مدل‌های قبلی Opus، Opus 5.5 با امکان نگهداری صفر داده در دسترس است.

همچنین مانند Fable 5.1، Opus 5.5 برای انطباق با قانون هوش مصنوعی اتحادیه اروپا از اقدامات واترمارک‌گذاری آنتروپیک بهره می‌برد. این مدل همچنین دیگر امکان غیرفعال کردن حالت «thinking» را ندارد.

دسترسی

Claude Opus 5.5 اکنون روی تمام پلتفرم‌ها، ازجمله Amazon Web Services، Google Cloud و Microsoft Azure، در دسترس است. توسعه‌دهندگان در Claude Platform نیز می‌توانند با مدل claude-opus-5-5 کار خود را آغاز کنند.

آگهی
دکمه بازگشت به بالا