چکیده
هنگامی که یک سامانه چندعاملی، تیمبندی خود را تغییر میدهد، پیامها و پاسخ نهایی تولیدشده توسط آن نیز تغییر میکند؛ بنابراین، اختلاف دقت سرتاسری (end-to-end) بهتنهایی نمیتواند اثر مسیریابی (routing) را تشخیص دهد. ما یک چارچوب ارزیابی معرفی میکنیم که پیش از تولید نتایج، مرز اطلاعات عمومی، پشتهی پاییندستی G، و یک خانوادهی متناهی از تیمهای مجاز را تثبیت میکند. COVER، رنجش (regret) اوراکل (oracle) دقیق در بنچمارک متناهی را با شرط آن پشته شناسایی میکند. برای هر مجموعهی متناهی از سیاستهای ثابت، اجرای اجتماع تیمهای منتخب متمایز آنها، کمینهی پشتیبانی بدون فرضیه برای هر مقایسهی زوجی سیاستها است، هرچند این امر در مورد رنجش اوراکل مطلق صدق نمیکند. دو جدول کنترلشده با تقسیمهای مجزا بر اساس شناسهی منبع، این ابزار را ارزیابی میکنند. در MuSiQue-12، یک کنترل مثبت ممتاز از پیشتعیینشده، رنجش را از ۰.۵۳۲ به ۰.۴۰۲ بهبود میبخشد؛ یک کنترل واسط عمومی پسوقوعی به ۰.۴۲۴ در مقابل ۰.۵۵۴ میرسد. در HotpotQA-4، یک ارزیاب مستقیم عمومی از پیشتعیینشده، رنجش را از ۰.۳۱۳ به ۰.۱۱۰ بهبود میدهد. در اجرای Llama با پشتهی ثابت، رنجش مسیر تأییدشده به میزان ۰.۱۹۰ بهبود مییابد، در حالی که بهبود پاسخ خام ۰.۰۱۰ است و بازهی آن از صفر عبور میکند. یک اعتبارسنجی تغییر نوع در ToolSandbox پنجخانوادهای، بهطور جامع ۱۶ تیم اعلامشده را بر روی ۱۴ نوع وظیفهی دستنخورده ارزیابی میکند (۲۲۴/۲۲۴ ردیف معتبر): اوراکل خانوادهی اعلامشده به تکمیل شواهد ایمن ۰.۷۶۸ میرسد، در حالی که مسیریاب ثابت آیندهنگر به ۰.۶۳۷ میرسد (رنجش ۰.۱۳۱) و در معیار از پیشاعلامشدهی ۰.۱۰ ناکام میماند. یک مقایسهگر پسوقوعی متأخر به ۰.۶۵۵ میرسد و با میانگین ۴.۵۷ کارگر در مقابل ۵.۰۰ کارگر همخوانی دارد. بنابراین، COVER بدون ایجاد یک برد مسیریابی، فضای انتخاب (selection headroom) را آشکار میسازد. یک تشخیص متقاطع پشتهای نشان میدهد که امتیازات مطلق به G وابستهاند، اما هیچ برهمکنش قابلردیابی میان مسیریاب و نهاییساز (finalizer) یافت نمیشود. COVER یک روششناسی سنجش قابلحسابرسی است، نه ادعایی بر برتری مسیریابی عاملی جهانی یا ناوردای پشته.