arXiv:2608.27449ترجمه شده

SWE-Prime: کم‌تر مسیرها، عملکرد بهتر

Dewu Zheng، Ruizhe Ye، Yanlin Wang، Yang Ye، Hongyu Zhang، Ensheng Shi، Xilin Liu، Yuchi Ma، Jianxing Yu، Zibin Zheng

چکیده

برای بهبود توانایی مدل‌های زبانی بزرگ در حل مسائل نرم‌افزاری واقعی، پژوهش‌های پیشین بر ساخت دیتاست‌های مسیر عامل (agent trajectory) در مقیاس بزرگ و انجام تنظیم دقیق نظارتی (SFT) بر مسیرهای موفق تمرکز کرده‌اند. با این حال، موفقیت در یک وظیفه لزوماً نشانگر ارائه نظارت با کیفیت بالا نیست: مسیرهای موفق ممکن است همچنان شامل گام‌های نامؤثر، تکراری یا پرریسک باشند. استفاده مستقیم از چنین مسیرهایی برای SFT می‌تواند نظارت نویزی ایجاد کند و مدل‌ها را به تقلید رفتارهای ناخواسته در حل مسئله ترغیب نماید. بنابراین، ما روشی برای انتخاب داده SFT با دو سطحی و دو مرحله‌ای به نام SWE-Prime پیشنهاد می‌کنیم که به‌صورت تدریجی داده‌های آموزشی را در سطوح مسیر و بخش فیلتر و انتخاب می‌کند. به‌طور خاص، مرحله اول غربالگری سطح مسیر را بر اساس کیفیت فرآیند، کیفیت نتیجه و نمایندگی داده انجام می‌دهد و زیرمجموعه‌ای با کیفیت و نمایندگی مناسب از مسیرهای موفق را انتخاب می‌کند. مرحله دوم انتخاب سطح بخش را با گروه‌بندی گام‌های متوالی به بخش‌های معنایی و ارزیابی هر بخش بر اساس سودمندی آن در راه‌حل نهایی، قابلیت یادگیری و خطرات بالقوه انجام می‌دهد. در طول SFT، تمام بخش‌ها در توالی حفظ می‌شوند تا زمینه حفظ شود، در حالی که فقط بخش‌های منتخب در محاسبه تابع زیان مشارکت می‌کنند. آزمایش‌ها روی SWE-Bench Pro و SWE-Bench Verified نشان می‌دهند که آموزش بر روی ۱۰ درصد زیرمجموعه مسیرهای منتخب توسط SWE-Prime، عملکرد بهتری نسبت به آموزش بر روی کل دیتاست حل‌شده فراهم می‌کند و بهبودهای نسبی تا ۱۲.۲ درصد و ۲۴.۲ درصدی به دست می‌آورد.

متن کامل

عنوان: SWE-Prime: مسیر کمتر، عملکرد بهتر نویسندگان: Dewu Zheng، Ruizhe Ye، Yanlin Wang، Yang Ye، Hongyu Zhang، Ensheng Shi، Xilin Liu، Yuchi Ma، Jianxing Yu، Zibin Zheng خلاصه: برای بهبود توانایی مدل‌های زبانی بزرگ در حل مسائل نرم‌افزاری واقعی، کارهای پیشین بر سر ساخت مجموعه‌های داده‌ی مسیر عامل در مقیاس بزرگ و انجام تنظیم دقیق تحت نظارت (SFT) بر روی مسیرها موفق تمرکز داشته‌اند. با این حال، موفقیت در انجام وظیفه تضمینی برای نظارت با کیفیت بالا نیست: مسیرهای موفق ممکن است همچنان شامل مراحل ناکارآمد، تکراری یا پرخطر باشند. استفاده مستقیم از چنین مسیرهایی برای SFT می‌تواند نظارت نویزی ایجاد کرده و مدل‌ها را ترغیب کند تا رفتارهای نامطلوب در حل مسئله را تقلید کنند. بنابراین، ما SWE-Prime را معرفی می‌کنیم که یک روش انتخاب داده‌های SFT با گرانولاریته چندلایه و دو مرحله‌ای است که به تدریج داده‌های آموزشی را در سطح مسیر و بخش فیلتر می‌کند. به طور خاص، مرحله اول غربالگری سطح مسیر بر اساس کیفیت فرآیند، کیفیت نتیجه و نمایندگی داده‌ها انجام می‌شود و زیرمجموعه‌ای باکیفیت و نماینده از مسیرها را انتخاب می‌کند. مرحله دوم انتخاب سطح بخش را با گروه‌بندی پله‌های متوالی به بخش‌های معنایی و ارزیابی هر بخش بر اساس مشارکت آن در راه‌حل نهایی، قابلیت یادگیری و ریسک‌های بالقوه انجام می‌دهد. در طول SFT، تمام بخش‌ها به ترتیب باقی می‌مانند تا زمینه حفظ شود، در حالی که فقط بخش‌های انتخاب شده در محاسبه هدرد مشارکت دارند. آزمایشات بر روی SWE-Bench Pro و SWE-Bench Verified نشان می‌دهد که آموزش بر روی زیرمجموعه مسیر ۱۰٪ انتخاب شده توسط SWE-Prime عملکرد آموزش بر روی مجموعه داده‌ی کامل حل‌شده را بهتر می‌رساند و سودهای عملکرد نسبی تا ۱۲.۲٪ و ۲۴.۲٪ به ترتیب حاصل می‌شود. نظرات: مهندسی نرم‌افزار (cs.SE)، هوش مصنوعی (cs.AI)، محاسبات و زبان (cs.CL) استناد: arXiv:2608.27449 [cs.SE] (یا arXiv:2608.27449v1 [cs.SE] برای این نسخه) https://doi.org/10.48550/arXiv.2608.27449 فوکوس برای یادداشت بیشتر: DOI منتشرشده توسط arXiv از طریق DataCite (در انتظار ثبت) User Safety: safe