arXiv:2608.28475ترجمه شده

COVER: ارزیابی قابل شناسایی مسیریابی ائتلاف

Raghul Sugumar، Amrit Gopinath

چکیده

هنگامی که یک سامانه چندعاملی، تیم‌بندی خود را تغییر می‌دهد، پیام‌ها و پاسخ نهایی تولیدشده توسط آن نیز تغییر می‌کند؛ بنابراین، اختلاف دقت سرتاسری (end-to-end) به‌تنهایی نمی‌تواند اثر مسیریابی (routing) را تشخیص دهد. ما یک چارچوب ارزیابی معرفی می‌کنیم که پیش از تولید نتایج، مرز اطلاعات عمومی، پشته‌ی پایین‌دستی G، و یک خانواده‌ی متناهی از تیم‌های مجاز را تثبیت می‌کند. COVER، رنجش (regret) اوراکل (oracle) دقیق در بنچمارک متناهی را با شرط آن پشته شناسایی می‌کند. برای هر مجموعه‌ی متناهی از سیاست‌های ثابت، اجرای اجتماع تیم‌های منتخب متمایز آن‌ها، کمینه‌ی پشتیبانی بدون فرضیه برای هر مقایسه‌ی زوجی سیاست‌ها است، هرچند این امر در مورد رنجش اوراکل مطلق صدق نمی‌کند. دو جدول کنترل‌شده با تقسیم‌های مجزا بر اساس شناسه‌ی منبع، این ابزار را ارزیابی می‌کنند. در MuSiQue-12، یک کنترل مثبت ممتاز از پیش‌تعیین‌شده، رنجش را از ۰.۵۳۲ به ۰.۴۰۲ بهبود می‌بخشد؛ یک کنترل واسط عمومی پس‌وقوعی به ۰.۴۲۴ در مقابل ۰.۵۵۴ می‌رسد. در HotpotQA-4، یک ارزیاب مستقیم عمومی از پیش‌تعیین‌شده، رنجش را از ۰.۳۱۳ به ۰.۱۱۰ بهبود می‌دهد. در اجرای Llama با پشته‌ی ثابت، رنجش مسیر تأییدشده به میزان ۰.۱۹۰ بهبود می‌یابد، در حالی که بهبود پاسخ خام ۰.۰۱۰ است و بازه‌ی آن از صفر عبور می‌کند. یک اعتبارسنجی تغییر نوع در ToolSandbox پنج‌خانواده‌ای، به‌طور جامع ۱۶ تیم اعلام‌شده را بر روی ۱۴ نوع وظیفه‌ی دست‌نخورده ارزیابی می‌کند (۲۲۴/۲۲۴ ردیف معتبر): اوراکل خانواده‌ی اعلام‌شده به تکمیل شواهد ایمن ۰.۷۶۸ می‌رسد، در حالی که مسیریاب ثابت آینده‌نگر به ۰.۶۳۷ می‌رسد (رنجش ۰.۱۳۱) و در معیار از پیش‌اعلام‌شده‌ی ۰.۱۰ ناکام می‌ماند. یک مقایسه‌گر پس‌وقوعی متأخر به ۰.۶۵۵ می‌رسد و با میانگین ۴.۵۷ کارگر در مقابل ۵.۰۰ کارگر هم‌خوانی دارد. بنابراین، COVER بدون ایجاد یک برد مسیریابی، فضای انتخاب (selection headroom) را آشکار می‌سازد. یک تشخیص متقاطع پشته‌ای نشان می‌دهد که امتیازات مطلق به G وابسته‌اند، اما هیچ برهم‌کنش قابل‌ردیابی میان مسیریاب و نهایی‌ساز (finalizer) یافت نمی‌شود. COVER یک روش‌شناسی سنجش قابل‌حسابرسی است، نه ادعایی بر برتری مسیریابی عاملی جهانی یا ناوردای پشته.