arXiv:2609.02797ترجمه شده

کتاب‌های هلندی برای مدل‌های زبانی

Isaiah Andrews، Suproteem Sarkar

چکیده

مردم به‌طور روزافزونی از مدل‌های زبانی برای پشتیبانی از تصمیم‌گیری در زندگی استفاده می‌کنند. بسیاری از این تصمیمات مستلزم پیش‌بینی احتمالاتی هستند: احتمال وقوع یک رویداد مهم زندگی، یک بلای طبیعی، یا یک نتیجه اقتصادی چقدر است؟ کاربران مدل‌های زبانی ممکن است به‌صورت ضمنی فرض کنند که این پیش‌بینی‌ها از یک مدل احتمالی منسجم و جهانی نشأت می‌گیرند. در این مقاله، انسجام پیش‌بینی‌های احتمالاتی مدل‌های زبانی را با روشی ارزیابی می‌کنیم که بر قضیه‌ای منسوب به دِ فینِتی استوار است. پیش‌بینی‌ها را از مدل‌های زبانی درباره رویدادهایی استخراج می‌کنیم که از داده‌های بازده سهام تولید شده‌اند. سپس از برنامه‌های خطی برای محاسبه بیشترین سود بازی آربیتراژی هلندی استفاده می‌کنیم — سودی که یک آربیتراژگر می‌تواند با شرط‌بندی برخلاف احتمالات تولیدشده توسط مدل تضمین کند — و از آن به‌عنوان معیاری برای سنجش انسجام بهره می‌بریم. روش ما به برچسب‌های نتایج نیازی ندارد؛ بنابراین می‌توانیم انسجام را حتی در شرایطی ارزیابی کنیم که نتایج مشاهده نشده یا هنوز رخ نداده‌اند. شواهد قابل‌توجهی از ناسازگاری در پیش‌بینی‌های مدل‌های زبانی می‌یابیم. این ناسازگاری زمانی تشدید می‌شود که روابط منطقی پیچیده‌تری میان رویدادها وجود داشته باشد، و جزئیات زمینه‌ای نامربوط می‌توانند ناسازگاری را تا یک مرتبه بزرگی افزایش دهند. در پایان، به بحث درباره این می‌پردازیم که چگونه استراتژی‌های آموزشی جایگزین ممکن است انسجام احتمالاتی را بهبود بخشند.

متن کامل

اقتصاد > اقتصاد عمومی arXiv:2609.02797v1 (econ) [ارسال شده در ۲ سپتامبر ۲۰۲۶] عنوان: کتاب‌های Dutch برای مدل‌های زبانی نویسندگان: ایزایا اندروز، سوپروتیم سارکار مشاهده نسخه PDF مقاله با عنوان «کتاب‌های Dutch برای مدل‌های زبانی» اثر ایزایا اندروز و سوپروتیم سارکار مشاهده PDF HTML (آزمایشی) چکیده: مردم روزبه‌روز بیشتر از مدل‌های زبانی برای پشتیبانی از تصمیمات مهم زندگی خود بهره می‌برند. بسیاری از این تصمیمات دربرگیرنده یک پیش‌بینی احتمالی هستند: احتمال وقوع یک رویداد بزرگ زندگی، یک فاجعهٔ طبیعی، یا یک پیامد اقتصادی چقدر است؟ کاربران مدل‌های زبانی ممکن است ناآگاهانه باور داشته باشند که این پیش‌بینی‌ها از یک مدل جهانی منسجم سرچشمه می‌گیرند. در این مقاله، ما با بهره‌گیری از روشی که بر قضیه‌ای از دو فینتی بنا شده است، به ارزیابی انسجام پیش‌بینی‌های احتمالی مدل‌های زبانی می‌پردازیم. ما پیش‌بینی‌های مدل‌های زبانی دربارهٔ رویدادهایی را که از داده‌های بازده سهام تولید شده‌اند استخراج می‌کنیم. سپس با استفاده از برنامه‌ریزی خطی، بزرگ‌ترین سود کتاب Dutch را محاسبه می‌کنیم — سودی که یک آربیتراژگر می‌تواند با شرط‌بندی در خلاف جهت احتمالات تولیدشده توسط مدل تضمین کند — و از آن به‌عنوان معیاری برای سنجش عدم انسجام بهره می‌بریم. روش ما به برچسب‌های نتیجه نیازی ندارد، از این رو می‌توانیم انسجام را حتی در شرایطی که نتایج هنوز مشاهده نشده‌اند یا محقق نشده‌اند نیز ارزیابی کنیم. یافته‌های ما شواهد قابل‌توجهی از عدم انسجام در پیش‌بینی‌های مدل‌های زبانی به دست می‌دهد. این عدم انسجام با غنی‌تر شدن روابط منطقی میان رویدادها افزایش می‌یابد، و جزئیات متنی نامربوط می‌توانند عدم انسجام را تا یک مرتبهٔ بزرگی تشدید کنند. در پایان، به بحث دربارهٔ این می‌پردازیم که چگونه راهبردهای آموزشی جایگزین ممکن است انسجام احتمالی را بهبود بخشند. توضیحات: موضوعات: اقتصاد عمومی (econ.GN); هوش مصنوعی (cs.AI); پردازش زبان طبیعی و محاسبات زبانی (cs.CL); یادگیری ماشین (cs.LG) استناد به: arXiv:2609.02797 [econ.GN] (یا arXiv:2609.02797v1 [econ.GN] برای این نسخه) https://doi.org/10.48550/arXiv.2609.02797 سوابق ارسال از: ایزایا اندروز [مشاهده ایمیل] [v1] چهارشنبه، ۲ سپتامبر ۲۰۲۶ ساعت ۱۶:۳۱:۴۷ UTC (۱۱۶ کیلوبایت) نویسنده venue سازمان موضوع دربارهٔ arXivLabs آزمایشگاه‌های آرکایو (arXivLabs): پروژه‌های آزمایشی با همکاری اجتماع آزمایشگاه‌های آرکایو (arXivLabs) چارچوبی است که به همکاران اجازه می‌دهد تا ویژگی‌های جدید آرکایو را مستقیماً در وب‌سایت ما توسعه داده و به اشتراک بگذارند. هم افراد و هم سازمان‌هایی که با آزمایشگاه‌های آرکایو (arXivLabs) کار می‌کنند، ارزش‌های ما مبنی بر شفافیت، اجتماع، تعالی و حریم خصوصی داده‌های کاربران را پذیرفته‌اند. آرکایو (arXiv) به این ارزش‌ها متعهد است و تنها با شرکایی که به آن‌ها پایبند هستند همکاری می‌کند. ایده‌ای برای پروژه‌ای دارید که برای اجتماع آرکایو (arXiv) ارزش‌افزا باشد؟ دربارهٔ آزمایشگاه‌های آرکایو (arXivLabs) بیشتر بدانید. کدام نویسندگان این مقاله تأییدکننده (endorser) هستند؟ | غیرفعال‌سازی MathJax (MathJax چیست؟)