arXiv:2608.24825ترجمه شده

یک چارچوب LLM دو بعدی برای تحلیل خودکار شباهت محتوای تصادفی آیتم‌ها در ارزیابی‌های مقیاس‌گسترده

Jing Huang، Jihong Zhang، Hua-Hua Chang

چکیده

گسترش سریع ارزیابی‌های مقیاس بزرگ و پذیرش رو به رشد تولید خودکار آیتم‌ها، نگرانی‌های مربوط به تکرار تصادفی محتوا را تشدید کرده است، به طوری که عناصر غیر مرتبط با ساختار (مانند قالب‌بندی یا تزریق زمینه‌ای) به‌طور تصادفی در سطح آیتم‌ها تکرار می‌شوند. معیارهای سنتی شباهت مانند BLEU یا cosine similarity، اغلب قادر به شناسایی لایه‌های ساختاری و معنایی خفی هستند که همزمان شاخص‌های شباهت درک‌شده را تولید می‌کنند. این مطالعه چارچوب دوبعدی برای تحلیل خودکار شباهت آیتم (AISA) با استفاده از مدل‌های زبان بزرگ (LLM) را پیشنهاد می‌دهد که شباهت را از طریق تجزیه ساختاریافته و ارتباط معنایی محقق می‌نماید. اعتبار روان‌سنجی نشان می‌دهد که معیارهای استخراج‌شده توسط LLM بیشتر با شاخص‌های وابستگی موضعی و غیر مرتبط با ساختار و گروه‌بندی بهتر با پارامترهای آیتم همخوانی دارند، در حالی که روش‌های سنتی مبتنی بر متن کارآمدتر نیستند. چارچوب فوق در ادامه از طریق کاربرد در تست‌های تطبیقی کامپیوتری (CAT) ارزیابی می‌شود. شبیه‌سازی‌ها نشان می‌دهند که گنجاندن محدودیت‌های شباهت مبتنی بر LLM در انتخاب آیتم‌ها، پایداری تخمین را بهبود می‌بخشد و بدون ایجاد تعامل کمی با کارایی، تفاوت را کاهش می‌دهد؛ در حالی که محدودیت‌های مبتنی بر معیارهای سنتی عملکرد ضعیف‌تری دارند. این یافته‌ها استفاده از AISA مبتنی بر LLM را در حفظ مقیاس‌پذیری بانک‌های آزمون، ترکیب محتوا‌آگاه تست‌ها و تست‌های تطبیقی حساس به تجربه در زمینه‌های متنوع برجسته می‌کنند.

متن کامل

**علوم کامپیوتر > هوش مصنوعی arXiv:2608.24825v1 (cs) [ارائه شده در ۲۵ اوت ۲۰۲۶]** **عنوان: یک چارچوب دو بعدی LLM برای تحلیل شباهت محتوای عارضه موردی خودکار در ارزیابی‌های مقیاس بزرگ** **نویسندگان: جینگ هوانگ، جی‌هونگ ژانگ، هوآ-هوآ چانگ** **چکیده:** توسعه سریع ارزیابی‌های مقیاس بزرگ و افزایش پذیرش تولید خودکار مورد، نگرانی‌ها در مورد تکرار محتوای عارضه را تشدید کرده است؛ در این موارد، عناصر غیر ساختاری مانند واژه‌گذاری یا بافت‌بندی زمینه‌ای به طور ناخواسته در سراسر موارد تکراری ظاهر می‌شوند. معیارهای سنتی شباهت مانند BLEU یا شباهت کسینوس عموماً قادر به شناسایی لایه‌های ساختاری و معنایی ظریف نیستند که همزمان تکرار درک‌شده را تحت تأثیر قرار می‌دهند. این مطالعه یک چارچوب دو بعدی برای تحلیل خودکار شباهت مورد (AISA) مبتنی بر مدل‌های زبانی بزرگ (LLM) پیشنهاد می‌دهد؛ در این چارچوب، شباهت از طریق تجزیه ساختاری و وابستگی معنایی مقداردهی می‌شود. نتایج اعتبارسنجی روان‌سنجی نشان می‌دهد که معیارهای استخراج‌شده از LLM با شاخص‌های وابستگی محلی غیر ساختاری هم‌ارتباط بیشتری دارند و گروه‌بندی‌های پارامتری مورد را به‌طور منسجم‌تری نسبت به معیارهای سنتی مبتنی بر متن ایجاد می‌کنند. این چارچوب با به‌کارگیری در آزمون تطبیقی کامپیوتری (CAT) ارزیابی گردیده است. شبیه‌سازی‌ها نشان می‌دهند که ادغام محدودیت‌های شباهت مبتنی بر LLM در فرآیند انتخاب مورد، ثبات برآورد را افزایش می‌دهد و سوگیری را با کمترین هزینه کارایی کاهش می‌دهد؛ در عین حال، برتری آن نسبت به محدودیت‌های مبتنی بر معیارهای سنتی ثابت می‌شود. این نتایج پتانسیل AISA مبتنی بر LLM را برای تدوین بانک مورد مقیاس‌پذیر، مونتاژ آزمون آگاه از محتوا و اجرای آزمون تطبیقی حساس به تجربه در بافت‌های مختلف ارزیابی برجسته می‌سازد. **نظرات:** **موضوعات: هوش مصنوعی (cs.AI)** **استناد: arXiv:2608.24825 [cs.AI] (یا arXiv:2608.24825v1 [cs.AI] برای این نسخه)** https://doi.org/10.48550/arXiv.2608.24825 **تاریخچهpresentation:** **از: جینگ هوانگ [مشاهده ایمیل]** [v1] سه‌شنبه، ۲۵ اوت ۲۰۲۶ ۱۷:۰۷:۱۶ UTC (۱،۰۶۸ کیلوبایت) **ابزارهای کتابداری و استناد** **کاوشگر کتابداری** - کاوشگر کتابداری را باز/بسته کنید (کاوشگر چیست؟) **مقالات مرتبط** - مقالات مرتبط را باز/بسته کنید (مقالات مرتبط چیست؟) **Litmaps** - Litmaps را باز/بسته کنید (Litmaps چیست؟) **scite.ai** - استنادات هوشمند scite را باز/بسته کنید (استنادات هوشمند چیست؟) **کد، داده، رسانه** **کد، داده و رسانه مرتبط با این مقاله** **alphaXiv** - alphaXiv را باز/بسته کنید (alphaXiv چیست؟) **لینک‌های کد** - یابنده کد CatalyzeX برای مقالات را باز/بسته کنید (CatalyzeX چیست؟) **DagsHub** - DagsHub را باز/بسته کنید (DagsHub چیست؟) **GotitPub** - Gotit.pub را باز/بسته کنید (GotitPub چیست؟) **Huggingface** - Hugging Face را باز/بسته کنید (Huggingface چیست؟) **ScienceCast** - ScienceCast را باز/بسته کنید (ScienceCast چیست؟) **نمونه‌ها** **نمونه‌ها** - Replicate را باز/بسته کنید e (Replicate چیست؟) تغییر Spaces Hugging Face Spaces (Spaces چیست؟) تغییر Spaces TXYZ.AI (TXYZ.AI چیست؟) مقالات مرتبط رکنش‌دهنده‌ها و ابزارهای جستجو لینک به Influence Flower Influence Flower (Influence Flowers چیست؟) تغییر رکنش‌دهنده CORE (CORE چیست؟) نویسنده, محل نگهداری, مؤسسه, موضوع, درباره arXivLabs arXivLabs: پروژه‌های آزمایشی با مشارکت جامعه arXivLabs فریم‌ورک‌ای است که به مشارکت‌کنندگان امکان می‌دهد ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه و به اشتراک بگذارند. همه افراد و سازمان‌هایی که با arXivLabs کار می‌کنند، ارزش‌های ما را پذیرا و پذیرفته‌اند: شفافیت، جامعه، برتری، و حریم خصوصی داده‌های کاربر. arXiv به این ارزش‌ها متعهد است و تنها با شریک‌هایی که به آن‌ها پایبند هستند کار می‌کند. آیا ایده‌ای برای پروژه‌ای دارید که ارزش اضافه برای جامعه arXiv ایجاد کند؟ برای اطلاعات بیشتر دربارهٔ arXivLabs، به صفحه مربوطه مراجعه کنید. کدام نویسندگان این مقاله را حمایت‌کنندگان می‌دانند؟ | غیرفعال‌سازی MathJax (MathJax چیست؟)