arXiv:2609.01573ترجمه شده

گسترش تخصیص بودجه برچسب‌گذاری تقریباً بهینه SFT-RL از LLM‌های کوچک به بزرگ

Jingtan Wang، Arun Verma، Xiaoqiang Lin، Zhengyuan Liu، Nancy F. Chen، Daniela Rus، Bryan Kian Hsiang Low

چکیده

ایمنی کاربر: ایمن

متن کامل

**عنوان:** مقیاس‌بندی تخصیص بهینه بودجه حاشیه‌نویسی SFT-RL از مدل‌های زبانی کوچک به بزرگ **نویسندگان:** جینگتان وانگ، آرون ورما، شیائوچیانگ لین، ژنگوان لیو، نانسی اف. چن، دانیلا روس، برایان کیان هسیانگ لو **چکیده:** تقسیم بودجه حاشیه‌نویسی ثابت بین تنظیم دقیق نظارتی (SFT) و یادگیری تقویتی (RL) در پس‌آموزش مدل‌های زبانی بزرگ (LLM) همچنان یک مشکل باز مانده است. کارهای پیشین تنها روندهای کلی را توصیف می‌کنند (به عنوان مثال، SFT در رژیم‌های داده کم predominat است)، چارچوبی تخصیص principled ندارند و بررسی نمی‌کنند که آیا نسبت بهینه SFT‑RL برای مقیاس‌های مختلف مدل قابل انتقال است یا خیر. ما این مشکل را از منظر نزدیک‑به‑بهینه بودن صحنه می‌کنیم: به جستجوی یک نسبت SFT‑RL بهینه واحد، ناحیه نزدیک‑به‑بهینه را تعریف می‌کنیم، یعنی مجموعه‌ای از تخصیص‌هایی که عملکرد آن‌ها در بازه تلرانس مشخصی از حداکثر عملکرد قرار دارد. به‌طور تجربی، این ناحیه حتی برای تلرانس‌های کوچک (۲ تا ۱۰ درصد) گسترده است؛ با افزایش مقیاس-model گسترش می‌یابد و به‌صورت قابل اعتماد از مدل‌های نماینده کوچک به مدل‌های هدف بزرگ منتقل می‌شود. این نتیجه یک استراتژی عملی به وجود می‌آورد: کافی است با استفاده از یک مدل نماینده کوچک، ناحیه نزدیک‑به‑بهینه قابل انتقال را شناسایی کرد و از جستجوی جامع در مقیاس بزرگ صرفه‌جویی کرد. نتایج ما به‌صورت پایدار در مختلف وظایف، خانواده‌های مدل و هر دو روش RL مبتنی بر ترجیح off‑policy و reward‑modeling on‑policy تأیید می‌شود. همچنین بررسی می‌کنیم که چگونه عدم تقارن در هزینه‌های حاشیه‌نویسی داده‌های SFT و RL ناحیه نزدیک‑به‑بهینه را تغییر می‌دهد. **موضوعات:** محاسبات و زبان (cs.CL) هوش مصنوعی (cs.AI) یادگیری ماشین (cs.LG) **استناد:** arXiv:2609.01573 [cs.CL] (یا arXiv:2609.01573v1 [cs.CL] برای این نسخه) https://doi.org/10.48550/arXiv.2609.01573 (Influence Flowers چیست؟) توصیل‌گر هسته‌ای CORE (CORE چیست؟) نویسنده محل انتشار سازمان موضوع دربارهٔ arXivLabs arXivLabs: پروژه‌های آزمایشی با همکاران جامعه arXivLabs چارچوبی است که به همکاران اجازه می‌دهد ویژگی‌های جدیدی را مستقیماً در وبسایت ما توسعه دهند و به اشتراک بگذارند. هم افراد و هم سازمان‌هایی که با arXivLabs کار می‌کنند، ارزش‌های ما در زمینه‌های openness، community، excellence و حریم خصوصی داده‌های کاربری را پذیرفته‌اند و آن را رعایت کرده‌اند. arXiv به این ارزش‌ها متعهد است و تنها با شرکایی همکاری می‌کند که به آن پایبند باشند. ایده‌ای برای پروژه‌ای دارید که ارزشی به جامعهٔ arXiv اضافه کند؟ دربارهٔ arXivLabs بیشتر بدانید. کدام نویسندگان این مقاله، حامی هستند؟ | غیرعالگسازی MathJax (MathJax چیست؟)