arXiv:2609.04172ترجمه شده

بازاندیشی در تقطیر سیاست آن‌لاین مدل‌های زبان بزرگ (LLMs) II: یک مثال آموزشی

Zixuan Fu، Bingxiang He، Yuxin Zuo، Haohuan Huang، Jinqian Zhang، Ruhang Xiao، Cheng Qian، Qinyu Luo، Huan-ang Gao، Yudong Wang، Zhiyuan Liu، Ning Ding، Chaojun Xiao

چکیده

User Safety: safe

متن کامل

# ریدیزاین تخلیق روی‌سیاستیک مدل‌های زبانی بزرگ II: یک مثال آموزشی **نویسندگان:** زیکوان فو، بینگ‌شیانگ هو، یوکسین زوو، هائوهوان هوانگ، جین‌چیان ژانگ، روهانگ شیائو، چنگ چیان، چینیو لوو، هوآن-آنگ گائو، یودونگ وانگ، زهی‌یوان لیو، نینگ دینگ، چائوجون شیائو **چکیده:** تخلیق روی‌سیاستیک (OPD) عملکردهای تولیدشده توسط دانش‌آموز را با نظارت توکنی سطحی از معلم ترکیب می‌کند. پژوهش‌های قبلی عمدتاً رفتار الگوریتمی این فرآیند را بررسی کرده و نقش داده آموزشی را نامشخص گذاشته‌اند. در این مقاله، این نقش را در حداقل داده بررسی می‌کنیم؛ یعنی آموزش با یک پرسش. OPD به صورت تک‌مرات برای صدها گام بهبود می‌یابد و بیشتر کسب‌وکار OPD داده‌کامل را در حوزه‌های وظیفه و خانواده مدل‌ها بازیابی می‌کند. نتایج این به شدت از طریق حالت‌هایی که در طول آموزش بازدید می‌شوند و نرخ هم‌ترازی دانش‌آموز با معلم توضیح داده می‌شود. ما «پوشش حالت» — نسبت حالت‌هایی که مجموعه پرسش به آن‌ها می‌رسد به نسبت حالت‌هایی که داده‌کامل OPD بازدید می‌کند — را اندازه‌گیری می‌کنیم. هر پرسش تنها ۷۱.۵٪ را پوشش می‌دهد، بیشتر آن در ۱۰۰ گام اول. افزودن پرسش‌های معنایی متفاوت، پوشش و دقت اعتبارسنجی را هم‌زمان بالا می‌برد تا ۱۶ پرسش به ۹۸.۹٪ برسد و داده‌کامل را مطابق‌سازی کند. با این حال، هم‌ترازی با سرعت مشابهی پیش می‌رود چه OPD روی یک پرسش و چه روی کل مجموعه آموزشی. حتی مجموعه ثابتی از حالت‌ها نیز صدها گام برای جذب نیاز دارد. بنابراین OPD در داده‌محور اما نه در الگوریتم‌گرسنه عمل می‌کند. رول‌آوت‌های آن نظارت گسترده‌ای را سریع آشکار می‌کنند، در حالی که دانش‌آموز این نظارت را به‌تدریج و به‌آرام‌تر جذب می‌کند. نتیجه پوشش حالت به OPD چندمعلمی نیز گسترش می‌یابد؛ جایی که ۱۶ پرسش معنایی متنوع در هر حوزه، MOPD داده‌کامل را مطابق‌سازی می‌کند. به‌عنوان یک آزمون استرس بیشتر، الگوهای سبک‌محتوا و پرسش‌های وایلدچت خارج از حوزه نیز به خط پایه پرسش واقعی نزدیک می‌شوند. محتوای وظیفه و پوشش حالت قابل تفکیک بوده‌اند. امیدواریم این یافته‌ها کار آینده را به سمت کارایی گام OPD هدایت کنند و بازبررسی مکانیسم‌های داده و موفقیت‌های اخیر آن در آموزش پسین مرزی را تحریک نمایند. **کلیدواژه‌ها:** هوش مصنوعی (cs.AI)؛ زبان‌شناسی محاسباتی (cs.CL) **یادداشت:** arXiv:2609.04172 [cs.AI] — ارسال شده در ۳ شهریور ۲۰۲۶ **مرتبط با این مقاله** توییچ alphaXiv alphaXiv (alphaXiv چیست؟) لینک‌های کد توییچ CatalyzeX یابندهٔ کد برای مقالات (CatalyzeX چیست؟) توییچ DagsHub DagsHub (DagsHub چیست؟) توییچ Gotit.pub Gotit.pub (GotitPub چیست؟) توییچ Hugging Face Hugging Face (Hugging Face چیست؟) توییچ ScienceCast ScienceCast (ScienceCast چیست؟) دیموهای دیمو توییچ Replicate Replicate (Replicate چیست؟) توییچ Spaces Hugging Face Spaces (Spaces چیست؟) توییچ Spaces TXYZ.AI (TXYZ.AI چیست؟) مقالات مرتبط سیستم‌های توصیه و جستجو لینک به Influence Flower Influence Flower (Influence Flowers چیست؟) توییچ سیستم توصیه CORE CORE Recommender (CORE چیست؟) نویسنده مکان مؤسسة موضوع دربارهٔ arXivLabs arXivLabs: پروژه‌های آزمایشی با همکاران جامعه arXivLabs یک چارچوب است که به همکاران اجازه می‌دهد ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه و به اشتراک بگذارند. هر دو افراد و سازمان‌هایی که با arXivLabs همکاری دارند، ارزش‌های ما از جمله باز بودن، جامعه، برتری و حریم خصوصی داده‌های کاربران را پذیرفته و پذیرفته‌اند. arXiv به این ارزش‌ها متعهد است و تنها با همکاری‌هایی که به آن‌ها پایبند هستند، همکاری می‌کند. آیا ایده‌ای برای پروژه‌ای دارید که بتواند ارزش افزایی برای جامعه arXiv به وجود آورد؟ بیشتر دربارهٔ arXivLabs بیاموزید. کدام نویسندگان این مقاله تاییدکننده هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟) |