arXiv:2608.27402ترجمه شده

نحوه سازمان‌دهی و ساختاردهی دانش اخلاقی توسط مدل‌های زبانی

Orion Reblitz-Richardson

چکیده

مدل‌های زبانی بزرگ چگونه دانش اخلاقی را سازماندهی می‌کنند؟ این مدل‌ها توانایی گسترده‌ای در تشخیص محتوای اخلاقی دارند، اما این تشخیص تنها در سطحی آستانه‌ای و ابتدایی صورت می‌گیرد. پرسش اصلی ما این است که آیا این مدل‌ها فراتر رفته و بنیان‌های اخلاقی را از یکدیگر متمایز می‌سازند و روابط بین آن‌ها را به‌صورتی هندسی سازماندهی می‌کنند. برای پاسخ به این پرسش، شش پروب خطی مستقل را بر مدل‌های زبانی با وزن‌های آزاد آموزش می‌دهیم؛ یکی برای هر دسته از نظریه بنیان‌های اخلاقی (مراقبت/آسیب، انصاف/تقلب، آزادی/ستم، وفاداری/خیانت، اقتدار/سرپیچی، و تقدس/تحقیر). سپس بررسی می‌کنیم که جهت‌های حاصل در فضای بازنمایی چگونه با یکدیگر مرتبط‌اند. یافته‌های ما نشان می‌دهد که این جهت‌ها نه در یک آشکارساز اخلاقی واحد ادغام می‌شوند و نه کاملاً از یکدیگر مستقل‌اند، بلکه تقریباً بیشینه‌ی ابعاد مستقل را اشغال می‌کنند و در عین حال یک مؤلفه مشترک مثبت را به اشتراک دارند. این مؤلفه مشترک، امضای یکپارچگی است و نسبت به مجموعه‌ای از مفاهیم غیراخلاقی که به‌طور متناظر ساخته شده‌اند، مختصِ حوزه اخلاق است (میانگین کسینوس زوجی ۰.۲۶ در برابر ۰.۰۱۳). این ساختار هندسی در معماری‌ها و مقیاس‌های مختلف مدل‌ها سازگار باقی می‌ماند و از مراحل نخستین پیش‌آموزش آغاز می‌شود، یعنی مدت‌ها پیش از اشباع دقت پروب. ساختاری که مدل کشف می‌کند، هیچ نشانه‌ای از تمایز فردگرایانه/پیوندی که نظریه بنیان‌های اخلاقی پیش‌بینی می‌کند ندارد (اگرچه توان آماری این آزمون پایین است: تنها ۲۰ افراز نامزد وجود دارد)، بلکه بازتاب‌دهنده آمارهای پیکره متنی است. با گسترش به معضلات اخلاقی، جهت هر معضل تا حدی از بنیان‌های مؤلفه خود ترکیب می‌شود، به میزان ۲.۷ برابر خط پایه جفت‌نامتناظر، در حالی که بیشتر واریانس آن، ساختاری مختص به تعارض را رمزگذاری می‌کند. مدل، خودِ تنش اخلاقی را بازنمایی می‌کند، نه یک قضاوت از پیش حل‌شده.

متن کامل

علوم کامپیوتر > محاسبات و زبان arXiv:2608.27402v1 (cs) [ارسال شده در ۲۷ اوت ۲۰۲۶] **عنوان:** مدل‌های زبانی چگونه دانش اخلاقی را سازماندهی و ساختاربندی می‌کنند **نویسندگان:** اوریون ربلیتز-ریچاردسون مشاهده PDF مقاله با عنوان «How Language Models Organize and Structure Moral Knowledge»، توسط اوریون ربلیتز-ریچاردسون مشاهده PDF HTML (آزمایشی) **چکیده:** مدل‌های زبانی بزرگ (LLMs) چگونه دانش اخلاقی را سازماندهی می‌کنند؟ این مدل‌ها محتوای اخلاقی را در سطحی گسترده تشخیص می‌دهند، اما تشخیص صرف، آستانه‌ای پایین به شمار می‌رود. در این پژوهش می‌پرسیم آیا این مدل‌ها فراتر رفته‌اند، بنیان‌های اخلاقی گوناگون را از یکدیگر تمیز می‌دهند و روابط میان آن‌ها را به شکلی هندسی سازماندهی می‌کنند. ما شش پروب خطی مستقل را بر مدل‌های زبانی با وزن‌های باز آموزش می‌دهیم—یکی برای هر دسته از نظریه بنیان‌های اخلاقی (MFT): مراقبت/آسیب، انصاف/تقلب، آزادی/ستم، وفاداری/خیانت، اقتدار/سرکشی، و قداست/تحقیر—و بررسی می‌کنیم که بردارهای حاصل چگونه در فضای بازنمایی با یکدیگر مرتبط‌اند. درمی‌یابیم که این بردارها نه در یک آشکارساز اخلاقی واحد فرو می‌ریزند و نه از یکدیگر جدا می‌شوند؛ بلکه تقریباً تعداد حداکثری از ابعاد مستقل را در بر می‌گیرند، در حالی که یک مؤلفه مشترک مثبت نیز میان آن‌ها به اشتراک گذاشته می‌شود. این مؤلفه مشترک، نشانه یکپارچگی است و در مقایسه با مجموعه‌ای از مفاهیم غیراخلاقی همتا که به همان شیوه ساخته شده‌اند، مختص اخلاق است (میانگین کسینوس زوجی ۰.۲۶ در برابر ۰.۰۱۳). این هندسه در معماری‌ها و مقیاس‌های گوناگون سازگار است و رژیم یکپارچگی خود را در مراحل اولیه پیش‌آموزش می‌یابد، پیش از آنکه دقت پروب به اشباع برسد. ساختاری که مدل کشف می‌کند هیچ شاهدی از تمایز فردگرایانه/پیوندی که نظریه بنیان‌های اخلاقی پیش‌بینی می‌کند، نشان نمی‌دهد (آزمون دارای توان آماری ناکافی: تنها ۲۰ افراز نامزد وجود دارد) و بازتابی از آمارهای پیکره متنی است. با گسترش تحلیل به معضلات اخلاقی، هر بردار معضل تا حدی از ترکیب بنیان‌های مولفه‌ای خود شکل می‌گیرد—۲.۷ برابر خط پایه جفت‌های ناهمخوان—اما بخش عمده واریانس آن، ساختاری مختص تعارض اخلاقی را رمزگذاری می‌کند. به عبارت دیگر، مدل خودِ تنش اخلاقی را بازنمایی می‌کند، نه یک قضاوت از پیش حل‌شده را. **توضیحات:** موضوعات: محاسبات و زبان (cs.CL); هوش مصنوعی (cs.AI); یادگیری ماشین (cs.LG) رده‌های ACM: I.2.6; I.2.7 **استناد به صورت:** arXiv:2608.27402 [cs.CL] (یا arXiv:2608.27402v1 [cs.CL] برای این نسخه) https://doi.org/10.48550/arXiv.2608.27402 برای اطلاعات بیشتر درباره DOI صادر شده توسط arXiv از طریق DataCite (در انتظار ثبت) مراجعه کنید. **تاریخچه ارسال** [نمایش ناشناس برای نویسنده] از: اوریون ربلیتز-ریچاردسون [مشاهده ایمیل] [v1] پنجشنبه، ۲۷ اوت ۲۰۲۶، ۱۷:۳۰:۳۰ UTC (۲۲۱ کیلوبایت) **ابزارهای کتابشناختی** ابزارهای کتابشناختی و استنادی کاوشگر کتابشناختی تغییر وضعیت کاوشگر کتابشناختی (کاوشگر چیست؟) مقالات مرتبط تغییر وضعیت مقالات مرتبط (مقالات مرتبط چیست؟) نقشه‌های ادبیات تغییر وضعیت نقشه‌های ادبیات (نقشه‌های ادبیات چیست؟) scite.ai تغییر وضعیت استنادهای هوشمند scite (استنادهای هوشمند چیست؟) **کد، داده، رسانه** کد، داده و رسانه مرتبط با این مقاله alphaXiv تغییر وضعیت alphaXiv (alphaXiv چیست؟) پیوندها به کد تغییر وضعیت CatalyzeX، یابنده کد برای مقالات (CatalyzeX چیست؟) DagsHub تغییر وضعیت DagsHub (DagsHub چیست؟) GotitPub تغییر وضعیت Gotit.pub (Gotit.pub چیست؟) Huggingface T تغییر وضعیت Hugging Face (Huggingface چیست؟) ScienceCast تغییر وضعیت ScienceCast (ScienceCast چیست؟) نمایش‌ها نمایش‌ها Replicate تغییر وضعیت Replicate (Replicate چیست؟) Spaces تغییر وضعیت Hugging Face Spaces (Spaces چیست؟) Spaces تغییر وضعیت TXYZ.AI (TXYZ.AI چیست؟) **مقالات مرتبط** سیستم‌های پیشنهاددهنده و ابزارهای جستجو پیوند به Influence Flower Influence Flower (گل‌های تأثیرگذاری چیست؟) سیستم پیشنهاددهنده اصلی تغییر وضعیت CORE Recommender (CORE Recommender چیست؟) نویسنده مجله مؤسسه موضوع **درباره arXivLabs** arXivLabs: پروژه‌های آزمایشی با همکاران جامعه arXivLabs چارچوبی است که به همکاران امکان می‌دهد تا ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه دهند و به اشتراک بگذارند. هم افراد و هم سازمان‌هایی که با arXivLabs همکاری می‌کنند، ارزش‌های ما—از جمله آزادی، جامعه‌محوری، برتری، و حریم خصوصی داده‌های کاربران—را پذیرفته‌اند. arXiv به این ارزش‌ها متعهد است و تنها با شرکایی همکاری می‌کند که به آن‌ها پایبند باشند. آیا ایده‌ای برای پروژه‌ای دارید که برای جامعه arXiv ارزش‌آفرین باشد؟ درباره arXivLabs بیشتر بدانید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)