arXiv:2609.04198ترجمه شده

مهندسی تمیز، اندازه‌گیری ناپایدار: یک شکست اعتمادپذیری پیش‌ثبت‌شده رصدگرهای جعبه‌سیاه LLM در نقاط پایانی مشترک

Haoyaun Zhu، Jie Zhang

چکیده

داوران مدل‌های زبانی اکنون با داده‌های آموزشی سر و کار دارند، تولیدات را امتیاز می‌دهند و لیست‌های برتر را پیش می‌برند. این داوران در واقع ابزاری اندازه‌گیرنده‌اند، اما بر یک فرضی که به ندرت بیان می‌شود استوارند: درخواستی که به نام همان مدل ارسال شده، فردا همان‌طور که امروز است، بازخوانی می‌شود. ما این فرض را در دو کمپین پیش‌ثبت‌شده بررسی کردیم؛ هر کدام با تعیین آستانه‌هایی پیش از زمان ارزیابی طراحی شده بودند و هیچ‌یک به عبور از اعتبارسنجی ابزار خود نرسیدند. در مجموع ۵۲٬۹۸۸ تلاش درخواستی که بازبینی شدند، رتبه‌های تکراری همان‌صفحه‌ای با ضریب اسپیرمان ۰٫۴۰۰ در مقابل آستانه مورد نیاز ۰٫۹۰ موافقت کردند؛ و بازنگری‌های یکسانی روز بعدی با همان بایت (byte-identical) ضریب ۰٫۷۸ در مقابل نیاز ۰٫۹۹ را نشان دادند. در هر صورت، رکورد عملکرد در حداکثر (ceiling) بود. سه مکانیزم برای این فاصله توضیح می‌دهند: نخست، نقشه‌سازی از برچسب به معنا که بازخوانی‌ها را به همان اندازه سیگنال (signal) تحت تأثیر قرار می‌دهد؛ دوم، شکاف‌های نامزد هفت دستور از حد نویز خود ابزار؛ و سوم، ورودی‌های یکسانی بایت که رتبه‌های متفاوتی تولید می‌کنند — نویزهایی که خوانش‌های دقیق-تغییر (exact-permutation) تقویت می‌کنند. هیچ‌یک از جایگزینی معیار یا نمونه‌برداری در مقیاس (grid) تست‌شده این مشکل را اصلاح نکرد. پیشنهادات پیش‌ثبت‌شده بعدی مشکل را محدودتر ساختند: صبر بر روزهای نمونه‌شده فایده‌ای نداشت (۰٫۸۰۵ در مقابل ۰٫۸۰۰، که در پنج روز دیگر تکرار شد)؛ تغییر تامین‌کننده (provider) فایده‌ای نداشت (چهار تامین‌کننده مشترک سقف را داشتند، میانه‌ها بین ۰٫۷۴ تا ۰٫۸۸، و هیچ‌یک از فیلدهای متادیتا (metadata) این را پیش‌بینی نمی‌کرد)؛ خودسرایی بر هسته‌های بدون وابستگی به دسته (batch-invariant kernels) تنها در زمانی که سرور ساکت بود فایده‌آمد؛ و در خطاهای ساختاری با شکاف‌های شناخته‌شده، جدایی خوانش (readout) نوع خطا را دنبال می‌کند، نه حجم آن. ما شواهد را به یک پله‌ای سه‌مرحله‌ای هویت-نمایش (snapshot-identity ladder) ترکیب کردیم، هشت قانون طراحی و یک چک‌لیست گزارش‌دهی ارائه دادیم؛ یک آزمایش پیش‌نمایش (pilot) با حدود ۲٪ حجم تماس مطالعه، هر دو دروازه غیرقابل دسترس را پیش از آن آشکار می‌کرد. تمام نتایج اندازه‌گیری رفتار خارجی بر روی زیرساخت مشترک سرویس‌دهی (shared serving infrastructure) مربوط می‌شوند. در یک نقطهٔ مشترک (shared endpoint)، نام مدل یک ابزار ثابت (frozen instrument) نیست؛ ارزیابی پیش‌ثبت‌شده (preregistered evaluation) باید ابزار خود را قبل از قفل هر دروازه (gate) بر آن اندازه‌گیری کند.

متن کامل

کاربر: ایمن scite استنادات هوشمند (استنادات هوشمند چیست؟) فعال‌سازی alphaXiv (alphaXiv چیست؟) پیوندها به کد فعال‌سازی CatalyzeX جستجوگر کد برای مقالات (CatalyzeX چیست؟) DagsHub فعال‌سازی DagsHub (DagsHub چیست؟) GotitPub فعال‌سازی Gotit.pub (Gotit.pub چیست؟) Huggingface فعال‌سازی Hugging Face (Hugging Face چیست؟) ScienceCast فعال‌سازی ScienceCast (ScienceCast چیست؟) دموها دموها Replicate فعال‌سازی Replicate (Replicate چیست؟) Spaces فعال‌سازی Hugging Face Spaces (Spaces چیست؟) Spaces فعال‌سازی TXYZ.AI (TXYZ.AI چیست؟) مقالات مرتبط سیستم‌های توصیه‌گر و ابزارهای جستجو پیوند به Influence Flower فعال‌سازی Influence Flower (Influence Flower چیست؟) فعال‌سازی توصیه‌گر CORE (CORE چیست؟) نویسنده venue مؤسسه موضوع درباره arXivLabs arXivLabs: پروژه‌های آزمایشی با همکاری جامعه arXivLabs چارچوبی است که به همکاران اجازه می‌دهد ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه داده و به اشتراک بگذارند. هم افراد و هم سازمان‌هایی که با arXivLabs کار می‌کنند، ارزش‌های ما را در زمینه‌های شفافیت، جامعه، تعالی و حریم خصوصی داده‌های کاربران پذیرفته و قبول کرده‌اند. arXiv متعهد به این ارزش‌ها است و تنها با شرکایی کار می‌کند که به آنها پایبند باشند. ایده‌ای برای پروژه‌ای دارید که ارزشی به جامعه arXiv بیفزاید؟ درباره arXivLabs بیشتر بدانید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال‌سازی MathJax (MathJax چیست؟)