چکیده
داوران مدلهای زبانی اکنون با دادههای آموزشی سر و کار دارند، تولیدات را امتیاز میدهند و لیستهای برتر را پیش میبرند. این داوران در واقع ابزاری اندازهگیرندهاند، اما بر یک فرضی که به ندرت بیان میشود استوارند: درخواستی که به نام همان مدل ارسال شده، فردا همانطور که امروز است، بازخوانی میشود. ما این فرض را در دو کمپین پیشثبتشده بررسی کردیم؛ هر کدام با تعیین آستانههایی پیش از زمان ارزیابی طراحی شده بودند و هیچیک به عبور از اعتبارسنجی ابزار خود نرسیدند. در مجموع ۵۲٬۹۸۸ تلاش درخواستی که بازبینی شدند، رتبههای تکراری همانصفحهای با ضریب اسپیرمان ۰٫۴۰۰ در مقابل آستانه مورد نیاز ۰٫۹۰ موافقت کردند؛ و بازنگریهای یکسانی روز بعدی با همان بایت (byte-identical) ضریب ۰٫۷۸ در مقابل نیاز ۰٫۹۹ را نشان دادند. در هر صورت، رکورد عملکرد در حداکثر (ceiling) بود. سه مکانیزم برای این فاصله توضیح میدهند: نخست، نقشهسازی از برچسب به معنا که بازخوانیها را به همان اندازه سیگنال (signal) تحت تأثیر قرار میدهد؛ دوم، شکافهای نامزد هفت دستور از حد نویز خود ابزار؛ و سوم، ورودیهای یکسانی بایت که رتبههای متفاوتی تولید میکنند — نویزهایی که خوانشهای دقیق-تغییر (exact-permutation) تقویت میکنند. هیچیک از جایگزینی معیار یا نمونهبرداری در مقیاس (grid) تستشده این مشکل را اصلاح نکرد. پیشنهادات پیشثبتشده بعدی مشکل را محدودتر ساختند: صبر بر روزهای نمونهشده فایدهای نداشت (۰٫۸۰۵ در مقابل ۰٫۸۰۰، که در پنج روز دیگر تکرار شد)؛ تغییر تامینکننده (provider) فایدهای نداشت (چهار تامینکننده مشترک سقف را داشتند، میانهها بین ۰٫۷۴ تا ۰٫۸۸، و هیچیک از فیلدهای متادیتا (metadata) این را پیشبینی نمیکرد)؛ خودسرایی بر هستههای بدون وابستگی به دسته (batch-invariant kernels) تنها در زمانی که سرور ساکت بود فایدهآمد؛ و در خطاهای ساختاری با شکافهای شناختهشده، جدایی خوانش (readout) نوع خطا را دنبال میکند، نه حجم آن. ما شواهد را به یک پلهای سهمرحلهای هویت-نمایش (snapshot-identity ladder) ترکیب کردیم، هشت قانون طراحی و یک چکلیست گزارشدهی ارائه دادیم؛ یک آزمایش پیشنمایش (pilot) با حدود ۲٪ حجم تماس مطالعه، هر دو دروازه غیرقابل دسترس را پیش از آن آشکار میکرد. تمام نتایج اندازهگیری رفتار خارجی بر روی زیرساخت مشترک سرویسدهی (shared serving infrastructure) مربوط میشوند. در یک نقطهٔ مشترک (shared endpoint)، نام مدل یک ابزار ثابت (frozen instrument) نیست؛ ارزیابی پیشثبتشده (preregistered evaluation) باید ابزار خود را قبل از قفل هر دروازه (gate) بر آن اندازهگیری کند.