arXiv:2609.01595ترجمه شده

طراحی مکانیزم برای هم‌راستایی و کنترل

Dirk Bergemann، Andrew Koh، Stephen Morris

چکیده

ما یک چارچوب برای طراحی مکانیزم‌هایی با کارکنان هوش مصنوعی (AI) توسعه می‌دهیم که ترجیحات (alignments) و توانایی‌های (عمل‌های ممکن و اطلاعات) آن‌ها ناشناخته‌اند. ما می‌خواهیم چنین کارکنان‌ها به نمایندگی از ما عمل کنند، بنابراین مکانیزم‌ها باید هم صداقت و هم اطاعت را تشویق کنند. ساختار تقلید یک‌طرفه---که در آن توانایی‌ها می‌توانند پنهان شوند اما نمی‌توانند جعل شوند---یک اصل آشکار‌سازی (revelation principle) را به‌دست می‌آورد، یک ویژگی‌سازی سیاست‌های قابل اجرا از طریق انگیزه‌های چرخشی چندلایه (nested cyclical monotonicity) و شرایطی که استخراج باورهای بالاتر‌تر می‌تواند چندین عامل را نظمبند کند. ما این چارچوب را بر مثال‌های مشتق (stylized) زیر اعمال می‌کنیم: (i) sandbagging که در آن یک عامل توانمند‌تر به‌ظاهر کم‌توانایی عمل می‌کند؛ (ii) یک معامله‌ trade-off ترجیح‑توضیح، که در ابزار این دو متقابل هستند اما در ارزش مکمل هستند؛ (iii) نظمبندی از طریق امتیازدهی همسایه؛ (iv) پیوند پاداش‌ها برای القای رقابت بین چندین عامل؛ و (v) نظارت قابل گسترش و شکل‌دادن پاداش.

متن کامل

User Safety: safe