arXiv:2609.02786ترجمه شده

تکامل ایمن: تکامل همزمان زیرساخت و سیاست از تجربه عامل برای همسوسازی ایمنی

Qinghua Mao، Wanying Qu، Dadi Guo، Leitao Yuan، Qingyu Liu، Yu Li، Guanxu Chen، Yanwei Fu، Xi Lin، Xia Hu، Dongrui Liu

چکیده

عملکرد عامل‌های مبتنی بر مدل‌های زبانی بزرگ (LLM) از تعامل هم‌زمان مدل پایه و چارچوب اجرایی در محیط نشأت می‌گیرد. این ویژگی آن‌ها را در برابر آسیب‌های ایمنی آسیب‌پذیر می‌سازد؛ چه در پاسخ‌های نهایی مضر و چه در مسیرهای اجرایی چندمرحله‌ای. سازوکارهای هم‌راستاسازی ایمنی موجود عموماً بر به‌روزرسانی چارچوب اجرایی بیرونی یا بهینه‌سازی سیاست تکیه دارند؛ با این حال، هیچ‌یک از این دو رویکرد به‌تنهایی قادر به پُر کردن شکاف میان کنترل زمان اجرا و ایمنی ذاتی نیست. در این مقاله، چارچوب خودتکاملی مبتنی بر تجربه‌ای به نام SafeEvolve را برای هم‌راستاسازی ایمنی عامل‌ها پیشنهاد می‌کنیم. SafeEvolve از تجربه ایمنی حاصل‌شده از مسیرهای اجرایی تکمیل‌شدهٔ درون‌خط‌مشی بهره می‌برد تا حلقه‌ای پیوسته از هم‌تکاملی چارچوب اجرایی و سیاست را هدایت کند. در بخش چارچوب اجرایی، SafeEvolve شواهد ایمنی سطح‌مسیر را به به‌روزرسانی‌های محدودشده در سطح مؤلفه‌ها — شامل پرامپت ایمنی و مهارت‌های سلسله‌مراتبی — تبدیل می‌کند و مصنوعات چارچوب اجرایی قابل‌ممیزی و قابل‌بازگشت تولید می‌نماید. در بخش سیاست، SafeEvolve از یک الگوی دومرحله‌ای SFT-RL پیروی می‌کند؛ به‌گونه‌ای که SFT مبتنی بر به‌کارگیری چارچوب اجرایی، سیاست را برای بهره‌گیری فعال از مصنوعات تکامل‌یافتهٔ چارچوب اجرایی آماده می‌سازد، و RL تقویت‌شده با چارچوب اجرایی، رفتارهای ایمنی خودمختار را در فرایند کاوش چندمرحله‌ای از طریق پاداش‌های تجزیه‌شده توسط تأییدکننده شکل می‌دهد. SafeEvolve از طریق هم‌تکاملی چارچوب اجرایی و سیاست، تجربه ایمنی را به یک چارچوب اجرایی تکامل‌یافته در زمان اجرا و رفتار سیاستی بهبودیافته تبدیل می‌کند. آزمایش‌ها بر روی معیارهای ایمنی عاملی نشان می‌دهد که SafeEvolve در مقایسه با خطوط پایه موجود، به موازنه‌ای قوی‌تر میان ایمنی و سودمندی دست می‌یابد. برای مدل Qwen3.5-4B، این روش کاهش سه‌برابری نرخ پذیرش حمله (ASR) را در AgentDojo به همراه داشته و در عین حال سودمندی در حالت‌های خوش‌خیم را از ۵۹٫۷۹٪ به ۶۱٫۸۶٪ ارتقا می‌دهد.

متن کامل

علوم کامپیوتر > هوش مصنوعی arXiv:2609.02786v1 (cs) [ارسال شده در ۲ سپتامبر ۲۰۲۶] **عنوان:** SafeEvolve: تکامل همزمان مهار و سیاست از تجربه عامل برای هم‌راستاسازی ایمنی **نویسندگان:** Qinghua Mao، Wanying Qu، Dadi Guo، Leitao Yuan، Qingyu Liu، Yu Li، Guanxu Chen، Yanwei Fu، Xi Lin، Xia Hu، Dongrui Liu مشاهده PDF مقاله با عنوان SafeEvolve: تکامل همزمان مهار و سیاست از تجربه عامل برای هم‌راستاسازی ایمنی، توسط Qinghua Mao و ۱۰ نویسنده دیگر مشاهده PDF HTML (آزمایشی) **چکیده:** عملکرد عامل‌های مبتنی بر مدل‌های زبانی بزرگ (LLM) به‌طور مشترک توسط مدل پایه و مهار (harness) مورد استفاده در تعامل با محیط شکل می‌گیرد. این امر آن‌ها را در معرض خطرات ایمنی هم در پاسخ‌های نهایی مضر و هم در مسیرهای اجرای چندمرحله‌ای قرار می‌دهد. مکانیزم‌های هم‌راستاسازی ایمنی موجود اغلب به‌صورت جداگانه بر به‌روزرسانی‌های مهار خارجی یا بهینه‌سازی سیاست تکیه می‌کنند، با این حال استفاده از هر یک از این الگوها به‌تنهایی نمی‌تواند شکاف میان کنترل زمان اجرا و ایمنی ذاتی را پر کند. ما SafeEvolve را پیشنهاد می‌کنیم، یک چارچوب خودتکاملی مبتنی بر تجربه برای هم‌راستاسازی ایمنی عامل. SafeEvolve از تجربه ایمنی به‌دست‌آمده از مسیرهای تکمیل‌شده on-policy برای هدایت یک حلقه پیوسته از تکامل همزمان مهار و سیاست بهره می‌برد. در سمت مهار، SafeEvolve شواهد ایمنی سطح مسیر را به به‌روزرسانی‌های محدودشده در سطح مؤلفه‌ها شامل prompt ایمنی و مهارت‌های سلسله‌مراتبی تبدیل می‌کند و مصنوعات مهار قابل‌ممیزی و قابل‌بازگشت تولید می‌کند. در سمت سیاست، SafeEvolve از یک الگوی دومرحله‌ای SFT-RL پیروی می‌کند، که در آن SFT مبتنی بر استفاده از مهار، سیاست را برای بهره‌برداری فعالانه از مصنوعات تکامل‌یافته مهار bootstrap می‌کند، و RL تقویت‌شده با مهار، رفتارهای ایمنی مستقل را در طول کاوش چندمرحله‌ای از طریق پاداش‌های تجزیه‌شده توسط تأییدکننده شکل می‌دهد. از طریق تکامل همزمان مهار و سیاست، SafeEvolve تجربه ایمنی را به یک مهار زمان اجرای تکامل‌یافته و رفتار سیاستی بهبودیافته تبدیل می‌کند. آزمایش‌ها روی معیارهای ایمنی عاملی نشان می‌دهد که SafeEvolve به موازنه ایمنی-مفیدبودن قوی‌تری نسبت به خطوط مبنای موجود دست می‌یابد. برای Qwen3.5-4B، SafeEvolve کاهشی $3\times$ در نرخ موفقیت حمله (ASR) روی AgentDojo به دست می‌آورد، در حالی که مفیدبودن سالم را از ۵۹.۷۹٪ به ۶۱.۸۶٪ بهبود می‌بخشد. **توضیحات:** موضوعات: هوش مصنوعی (cs.AI)؛ رمزنگاری و امنیت (cs.CR) **استناد به صورت:** arXiv:2609.02786 [cs.AI] (یا arXiv:2609.02786v1 [cs.AI] برای این نسخه) https://doi.org/10.48550/arXiv.2609.02786 برای کسب اطلاعات بیشتر درباره DOI صادر شده توسط arXiv از طریق DataCite (ثبت در انتظار) **تاریخچه ارسال:** از: Qinghua Mao [مشاهده ایمیل] [v1] چهارشنبه، ۲ سپتامبر ۲۰۲۶، ۱۶:۱۹:۵۴ UTC (۹,۸۳۵ KB) **ابزارهای کتاب‌شناختی** ابزارهای کتاب‌شناختی و استنادی کاوشگر کتاب‌شناختی تغییر وضعیت کاوشگر کتاب‌شناختی (کاوشگر چیست؟) مقالات مرتبط تغییر وضعیت مقالات مرتبط (مقالات مرتبط چیست؟) نقشه‌های ادبیاتی تغییر وضعیت نقشه‌های ادبیاتی (نقشه‌های ادبیاتی چیست؟) scite.ai تغییر وضعیت استنادهای هوشمند scite (استنادهای هوشمند چیست؟) **کد، داده، رسانه** کد، داده و رسانه مرتبط با این مقاله alphaXiv تغییر وضعیت alphaXiv (alphaXiv چیست؟) پیوندها به کد تغییر وضعیت CatalyzeX Code Finder for Papers (CatalyzeX Code Finder for Papers چیست؟) DagsHub تغییر وضعیت DagsHub (DagsHub چیست؟) GotitPub Gotit.pub (GotitPub چیست؟) Huggingface نمایش Hugging Face (Huggingface چیست؟) ScienceCast نمایش ScienceCast (ScienceCast چیست؟) دموها دموها Replicate نمایش Replicate (Replicate چیست؟) Spaces نمایش Hugging Face Spaces (Spaces چیست؟) Spaces نمایش TXYZ.AI (TXYZ.AI چیست؟) مقالات مرتبط ابزارهای توصیه‌گر و جستجو پیوند به Influence Flower Influence Flower (Influence Flowers چیست؟) نمایش توصیه‌گر هسته CORE Recommender (CORE چیست؟) نویسنده venue مؤسسه موضوع درباره arXivLabs arXivLabs: پروژه‌های آزمایشی با همکاری جامعه arXivLabs چارچوبی است که به همکاران اجازه می‌دهد تا ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه داده و به اشتراک بگذارند. هم افراد و هم سازمان‌هایی که با arXivLabs کار می‌کنند، ارزش‌های ما در زمینه شفافیت، جامعه، تعالی و حریم خصوصی داده‌های کاربران را پذیرفته و قبول کرده‌اند. arXiv متعهد به این ارزش‌ها است و تنها با شرکایی که به آنها پایبند هستند همکاری می‌کند. ایده‌ای برای پروژه‌ای دارید که برای جامعه arXiv ارزش افزوده ایجاد کند؟ درباره arXivLabs بیشتر بدانید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال‌سازی MathJax (MathJax چیست؟)