arXiv:2608.27439ترجمه شده

User Safety: safe

Junjie Zhang، Hui Liu، Kecheng Chen، Xianbo Mo، Changsheng Chen، Haoliang Li

چکیده

اهداف: - حفظ لحن آکادمیک و دقت فنی - حفظ فرمول‌های ریاضی، قطعات کد و ارجاعات ثابت (مانند [1]، (معادله ۲)) - استفاده از اصطلاحات فنی استاندارد فارسی - برای مخففات، حفظ مخفف انگلیسی در پرانتز پس از فارسی: «یادگیری ماشین (ML)» - حفظ سرصفحه‌ها و ساختار بخش‌بندی - استفاده از فارسی رسمی (نه عامیانه) - خروجی فقط ترجمه فارسی، بدون توضیح یا یادداشت متن: عوامل مبتنی بر مدل‌های زبانی بزرگ (LLM) به‌طور فزاینده‌ای در پلتفرم‌های اجرایی سطح محصول مستقر می‌شوند. در این فضا، حملات فاجعه‌بار می‌توانند منجر به سوءاستفاده از ابزارها و تغییرات دائمی وضعیت شوند و خطرات بیشتری نسبت به تنها تولید متن ناامن ایجاد کنند. روش‌های موجود برای رید-تیمینگ خودکار اغلب بر اساس حملات ثابت هستند، در حالی که حمله‌گران عمومی اخیر چندین ابزار حمله فاجعه‌بار را هماهنگ می‌کنند و از طریق بازیابی مبتنی بر مسیر، پتانسیل قوی‌تری نشان می‌دهند. با این حال، چنین بازیابی‌ای می‌تواند با استفاده از تجربیات گمراه‌کننده ناشی از سوگیری بازیابی و اعتبار ابزارهای نامشخص، مشکلاتی ایجاد کند. مسیرهای کامل هزینه زمینه را افزایش می‌دهند و در عین حال قابلیت تفسیرپذیری را کاهش می‌دهند. ما RedEvoAgent را پیشنهاد می‌کنیم، یک عامل رید-تیمینگ سیاه‌جعبه که مسیرهای حمله‌ای میان‌موردی را به مهارت حمله‌ای فشرده و قابل خواندن توسط انسان تقلیل می‌دهد. این مهارت حمله‌ای از طریق پروفایل‌سازی اثربخشی ابزارها و اختصاص ابزار تصمیم‌گیری برای به‌روزرسانی مهارت، و یک مکانیزم اعتبارسنجی معکوس که تنها به‌روزرسانی‌هایی را که عملکرد اعتبارسنجی را بهبود می‌بخشند، حفظ می‌کند، به‌صورت انعطاف‌پذیری تکامل می‌یابد. آزمایش‌های انجام شده روی چندین بنچمارک، مدل هدف و پلتفرم‌های اجرایی هدف نشان می‌دهند که RedEvoAgent نسبت به پایه‌های ثابت و عمومی بهتر عمل می‌کند، کارایی ابزارها را بهبود می‌بخشد و در میان مدل‌های حمله‌گر و پلتفرم‌های اجرایی هدف قابل انتقال است.

متن کامل

علوم رایانه > رمزنگاری و امنیت arXiv:2608.27439v1 (cs) [ارسال شده در ۲۷ اوت ۲۰۲۶] **عنوان:** RedEvoAgent: عامل رید-تیمینگ خودکار با ارتقای مهارت مبتنی بر تجربه **نویسندگان:** جانجیه چانگ، هوی لیو، کچنگ چن، ایکسینبو مو، چانگشنگ چن، هائولیانگ لی [مشاهده PDF] این مقاله با عنوان *RedEvoAgent: عامل رید-تیمینگ خودکار با ارتقای مهارت مبتنی بر تجربه* توسط جانجیه چانگ و ۵ نویسنده دیگر [مشاهده PDF] [HTML (آزمایشی)] --- **چکیده:** عوامل مبتنی بر مدل‌های زبانی بزرگ (LLM) به‌طور فزاینده‌ای در حلقه‌های اجرایی سطح محصول مستقر می‌شوند، جایی که حملات فاجعه‌ساز ممکن است منجر به استفاده ناخواسته از ابزارها و ایجاد تغییرات دائمی در وضعیت سیستم شوند که خطرات بیشتری نسبت به تولید متن‌های ناایمن ایجاد می‌کنند. روش‌های موجود رید-تیمینگ خودکار اغلب بر حملات ثابت مبتنی‌اند، در حالی که حمله‌گران عاملی اخیر چندین ابزار فاجعه‌ساز را هماهنگ می‌کنند و از طریق بازیابی مبتنی بر مسیر، نشان داده‌های قوی‌تری ارائه می‌دهند. با این حال، چنین بازیابی‌هایی می‌توانند تجربیات گمراه‌کننده‌ای ایجاد کنند؛ زیرا بازیابی مکرر باعث دوباره استفاده از ابزارهای با اعتبار نامشخص می‌شود و مسیرهای کامل منجر به افزودن بار زمینه‌ای می‌شوند در حالی که خوانایی را کاهش می‌دهند. ما **RedEvoAgent** را پیشنهاد می‌کنیم: عاملی رید-تیمینگ سیاه‌صندوقی که مسیرهای حمله‌ای را در مهارت حمله‌ای فشرده و قابل خواندن توسط انسان تقسیم می‌کند. این مهارت حمله‌ای از طریق پروفایل‌سازی پراستفاده‌ترین ابزار و اختصاص ابزار برای تصمیم‌گیری در به‌روزرسانی مهارت، به‌صورت انعطاف‌پذیر ارتقا می‌یابد؛ و یک سازوکار اعتبارسنجی حفظ می‌کند که تنها به‌روزرسانی‌هایی را که عملکرد اعتبارسنجی را بهبود می‌بخشند، دارد. آزمایش‌ها بر روی چندین بنچمارک، مدل هدف و حلقه‌های اجرایی هدف نشان می‌دهند که RedEvoAgent از پایه‌های ثابت و عاملی پیشی می‌گیرد، کارایی ابزارها را بهبود می‌بخشد و در میان مدل‌های حمله‌گر و حلقه‌های اجرایی هدف قابل انتقال است. **موضوات:** رمزنگاری و امنیت (cs.CR)؛ هوش مصنوعی (cs.AI) **ارجاع به عنوان:** arXiv:2608.27439 [cs.CR] (یا arXiv:2608.27439v1 [cs.CR] برای این نسخه) https://doi.org/10.48550/arXiv.2608.27439 برای یادگیری بیشتر در مورد DOI منتشر شده توسط arXiv از طریق DataCite (در انتظار ثبت) **تاریخچه ارسال از:** جانجیه چانگ [مشاهده ایمیل] [v1] جمعه، ۲۷ اوت ۲۰۲۶ ۱۷:۵۵:۳۳ UTC (۱٬۸۹۶ KB) --- **ابزارهای کتابشناسی و ارجاع‌دهی:** - اکتشافگر کتابشناسی - قفل اکتشافگر کتابشناسی (اکتشافگر چیست؟) - اسناد مرتبط (چیست؟) - Litmaps قفل Litmaps (چیست؟) - scite.ai قفل استی Smart Citations (سبک‌های هوشمند چیست؟) **کد، داده، رسانه:** کد، داده و رسانه مرتبط با این مقاله - alphaXiv قفل alphaXiv (چیست؟) - CatalyzeX برای اسناد (چیست؟) - DagsHub قفل DagsHub (چیست؟) - GotitPub قفل Gotit.pub (چیست؟) - Huggingface قفل Hugging Face (چیست؟) - ScienceCast قفل ScienceCast (چیست؟) --- **دموها:** - Replicate قفل Replicate (چیست؟) **فضاها:** - فضاهای Hugging Face قفل فضاهای Hugging Face (چیست؟) - TXYZ.AI قفل TXYZ.AI (چیست؟) --- **ابزارهای پیشنهاددهنده و جستجو:** - لینک به Influence Flower (گل‌های تأثیر چیست؟) - هسته پیشنهاددهنده CORE - پیشنهادگر (CORE چیست؟) --- **نویسنده محل انتشار:** نهاد موضوع درباره arXivLabs: پروژه‌های آزمایشی با همکاران جامعه arXivLabs یک چارچوب است که به همکاران اجازه می‌دهد ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه داده و به اشتراک بگذارند. هر افراد و سازمان‌هایی که با arXivLabs کار می‌کنند، ارزش‌های ما شفافیت، جامعه، تمیزی و حریم خصوصی داده کاربر را پذیرفته و پسندیده‌اند. arXiv متعهد این ارزش‌ها است و فقط با شرکایی کار می‌کند که از آن‌ها پیروی می‌کنند. ایده‌ای برای یک پروژه دارید که ارزشی به جامعه arXiv اضافه کند؟ بیشتر درباره arXivLabs بیامیزد. **کدام نویسندگان این مقاله تأییدکننده هستند؟** | غیرفعال کردن MathJax (MathJax چیست؟) |