چکیده
گسترش سریع ارزیابیهای مقیاس بزرگ و پذیرش رو به رشد تولید خودکار آیتمها، نگرانیهای مربوط به تکرار تصادفی محتوا را تشدید کرده است، به طوری که عناصر غیر مرتبط با ساختار (مانند قالببندی یا تزریق زمینهای) بهطور تصادفی در سطح آیتمها تکرار میشوند. معیارهای سنتی شباهت مانند BLEU یا cosine similarity، اغلب قادر به شناسایی لایههای ساختاری و معنایی خفی هستند که همزمان شاخصهای شباهت درکشده را تولید میکنند. این مطالعه چارچوب دوبعدی برای تحلیل خودکار شباهت آیتم (AISA) با استفاده از مدلهای زبان بزرگ (LLM) را پیشنهاد میدهد که شباهت را از طریق تجزیه ساختاریافته و ارتباط معنایی محقق مینماید. اعتبار روانسنجی نشان میدهد که معیارهای استخراجشده توسط LLM بیشتر با شاخصهای وابستگی موضعی و غیر مرتبط با ساختار و گروهبندی بهتر با پارامترهای آیتم همخوانی دارند، در حالی که روشهای سنتی مبتنی بر متن کارآمدتر نیستند. چارچوب فوق در ادامه از طریق کاربرد در تستهای تطبیقی کامپیوتری (CAT) ارزیابی میشود. شبیهسازیها نشان میدهند که گنجاندن محدودیتهای شباهت مبتنی بر LLM در انتخاب آیتمها، پایداری تخمین را بهبود میبخشد و بدون ایجاد تعامل کمی با کارایی، تفاوت را کاهش میدهد؛ در حالی که محدودیتهای مبتنی بر معیارهای سنتی عملکرد ضعیفتری دارند. این یافتهها استفاده از AISA مبتنی بر LLM را در حفظ مقیاسپذیری بانکهای آزمون، ترکیب محتواآگاه تستها و تستهای تطبیقی حساس به تجربه در زمینههای متنوع برجسته میکنند.
متن کامل
**علوم کامپیوتر > هوش مصنوعی arXiv:2608.24825v1 (cs) [ارائه شده در ۲۵ اوت ۲۰۲۶]**
**عنوان: یک چارچوب دو بعدی LLM برای تحلیل شباهت محتوای عارضه موردی خودکار در ارزیابیهای مقیاس بزرگ**
**نویسندگان: جینگ هوانگ، جیهونگ ژانگ، هوآ-هوآ چانگ**
**چکیده:**
توسعه سریع ارزیابیهای مقیاس بزرگ و افزایش پذیرش تولید خودکار مورد، نگرانیها در مورد تکرار محتوای عارضه را تشدید کرده است؛ در این موارد، عناصر غیر ساختاری مانند واژهگذاری یا بافتبندی زمینهای به طور ناخواسته در سراسر موارد تکراری ظاهر میشوند. معیارهای سنتی شباهت مانند BLEU یا شباهت کسینوس عموماً قادر به شناسایی لایههای ساختاری و معنایی ظریف نیستند که همزمان تکرار درکشده را تحت تأثیر قرار میدهند. این مطالعه یک چارچوب دو بعدی برای تحلیل خودکار شباهت مورد (AISA) مبتنی بر مدلهای زبانی بزرگ (LLM) پیشنهاد میدهد؛ در این چارچوب، شباهت از طریق تجزیه ساختاری و وابستگی معنایی مقداردهی میشود. نتایج اعتبارسنجی روانسنجی نشان میدهد که معیارهای استخراجشده از LLM با شاخصهای وابستگی محلی غیر ساختاری همارتباط بیشتری دارند و گروهبندیهای پارامتری مورد را بهطور منسجمتری نسبت به معیارهای سنتی مبتنی بر متن ایجاد میکنند. این چارچوب با بهکارگیری در آزمون تطبیقی کامپیوتری (CAT) ارزیابی گردیده است. شبیهسازیها نشان میدهند که ادغام محدودیتهای شباهت مبتنی بر LLM در فرآیند انتخاب مورد، ثبات برآورد را افزایش میدهد و سوگیری را با کمترین هزینه کارایی کاهش میدهد؛ در عین حال، برتری آن نسبت به محدودیتهای مبتنی بر معیارهای سنتی ثابت میشود. این نتایج پتانسیل AISA مبتنی بر LLM را برای تدوین بانک مورد مقیاسپذیر، مونتاژ آزمون آگاه از محتوا و اجرای آزمون تطبیقی حساس به تجربه در بافتهای مختلف ارزیابی برجسته میسازد.
**نظرات:**
**موضوعات: هوش مصنوعی (cs.AI)**
**استناد: arXiv:2608.24825 [cs.AI] (یا arXiv:2608.24825v1 [cs.AI] برای این نسخه)**
https://doi.org/10.48550/arXiv.2608.24825
**تاریخچهpresentation:**
**از: جینگ هوانگ [مشاهده ایمیل]**
[v1] سهشنبه، ۲۵ اوت ۲۰۲۶ ۱۷:۰۷:۱۶ UTC (۱،۰۶۸ کیلوبایت)
**ابزارهای کتابداری و استناد**
**کاوشگر کتابداری** - کاوشگر کتابداری را باز/بسته کنید (کاوشگر چیست؟)
**مقالات مرتبط** - مقالات مرتبط را باز/بسته کنید (مقالات مرتبط چیست؟)
**Litmaps** - Litmaps را باز/بسته کنید (Litmaps چیست؟)
**scite.ai** - استنادات هوشمند scite را باز/بسته کنید (استنادات هوشمند چیست؟)
**کد، داده، رسانه**
**کد، داده و رسانه مرتبط با این مقاله**
**alphaXiv** - alphaXiv را باز/بسته کنید (alphaXiv چیست؟)
**لینکهای کد** - یابنده کد CatalyzeX برای مقالات را باز/بسته کنید (CatalyzeX چیست؟)
**DagsHub** - DagsHub را باز/بسته کنید (DagsHub چیست؟)
**GotitPub** - Gotit.pub را باز/بسته کنید (GotitPub چیست؟)
**Huggingface** - Hugging Face را باز/بسته کنید (Huggingface چیست؟)
**ScienceCast** - ScienceCast را باز/بسته کنید (ScienceCast چیست؟)
**نمونهها**
**نمونهها** - Replicate را باز/بسته کنید
e (Replicate چیست؟)
تغییر Spaces Hugging Face Spaces (Spaces چیست؟)
تغییر Spaces TXYZ.AI (TXYZ.AI چیست؟)
مقالات مرتبط
رکنشدهندهها و ابزارهای جستجو
لینک به Influence Flower
Influence Flower (Influence Flowers چیست؟)
تغییر رکنشدهنده CORE (CORE چیست؟)
نویسنده, محل نگهداری, مؤسسه, موضوع, درباره arXivLabs
arXivLabs: پروژههای آزمایشی با مشارکت جامعه
arXivLabs فریمورکای است که به مشارکتکنندگان امکان میدهد ویژگیهای جدید arXiv را مستقیماً در وبسایت ما توسعه و به اشتراک بگذارند.
همه افراد و سازمانهایی که با arXivLabs کار میکنند، ارزشهای ما را پذیرا و پذیرفتهاند: شفافیت، جامعه، برتری، و حریم خصوصی دادههای کاربر.
arXiv به این ارزشها متعهد است و تنها با شریکهایی که به آنها پایبند هستند کار میکند.
آیا ایدهای برای پروژهای دارید که ارزش اضافه برای جامعه arXiv ایجاد کند؟
برای اطلاعات بیشتر دربارهٔ arXivLabs، به صفحه مربوطه مراجعه کنید.
کدام نویسندگان این مقاله را حمایتکنندگان میدانند؟
| غیرفعالسازی MathJax (MathJax چیست؟)