چکیده
User Safety: safe
متن کامل
**علوم کامپیوتر > هوش مصنوعی arXiv:2609.22068v1 (cs) [ارائه شده در ۱۸ سپتامبر ۲۰۲۶]**
**عنوان:** CodeMidas: مقیاسپذیری محیطهای RL کدنویسی عاملگرا از روی خود کد
**نویسندگان:** Bowen Ye, Lei Li, Shicheng Li, Zihao Yue, Linghao Zhang, Hanglong Lv, Yuanxin Liu, Wenhan Ma, Hao Tian, Rang Li, Jinhao Dong, Yikai Zhao, Xiangwei Deng, Hailin Zhang, Liang Zhao, Qi Liu, Lingpeng Kong, Tong Yang, Fuli Luo
**مشاهده PDF مقاله با عنوان «CodeMidas: Scaling Agentic Coding RL Environments from Code Itself»، توسط Bowen Ye و هجده نویسندهٔ دیگر**
**مشاهده PDF | HTML (تجربی)**
**چکیده:** آموزش عاملهای کدنویسی قادر از طریق یادگیری تقویتی (RL) مستلزم داشتن وظایف متنوع و تأییدکنندهٔ قابل اعتماد است. مخازن کد منبعباز حاوی اینگونه وظایف غنی هستند، اما روشهای موجود معمولاً به مصنوعات توسعه مانند Issues و Commits متکی هستند و طیف قابل استخراج وظایف را محدود میسازند. برای مقیاسپذیری بهتر محیطهای RL، ما CodeMidas را معرفی میکنیم؛ یک لولهچین عاملگرا که عملکردهای پیادهسازیشده موجود در مخازن کد را به محیطهای RL قابل اجرا تبدیل میکند، با استفاده از کد منبع بهعنوان تنها ورودی خاص وظیفه. در CodeMidas، هر مرحله از ساخت محیط به یک عامل مخصص میشود: این عوامل ابتدا عملکردهای پیادهسازیشده را کاوش میکنند تا مشخصات رفتاری استخراج کنند؛ سپس تستهایی بر پایهٔ اجرای کد اصلی میسازند؛ و در نهایت، کاندیدهای وظیفه از طریق بررسیهای اجرا و رولاوتهای (rollouts) تکراری اعتبارسنجی و فیلتر میشوند. مجموعه داده حاصل شامل ۵٬۵۴۵ وظیفه آموزشی از ۳٬۱۸۵ مخزن کد منبعباز است که ۲۳ زبان برنامهنویسی و ۱۵ حوزه فنی را پوشش میدهد. آموزش مدل MiMo‑V2.5 بر این وظایف با الگوریتم GRPO، عملکرد را در پنج معیار متنوع بهبود میبخشد؛ شامل تعمیر مسئله (DeepSWE + ۱۱٫۷٪)، ساخت برنامه کامل (ProgramBench + ۱۷٪)، و کار ترمینال (Terminal‑Bench v2.1 + ۸٫۵٪). تستهای ابلیشن نشان میدهند که افزایش تعداد وظایف آموزشی با کیفیت بالا، عملکرد را ارتقا میبخشد. تحلیل مسیرها (trajectory analysis) می‑گواهد که عامل آموزشدیده با RL، رفتارهای بهتری از جمله افزایش کاوش مخزن کد و خود‑تأیید (self‑verification) متنوعتر نشان میدهد. این نتایج تأیید میکنند که کد منبع میتواند بهعنوان پایهٔ مقیاسپذیر برای ساخت محیطهای RL عمل کند و عاملهای کدنویسی را در طیف وسیعی از وظایف نرمافزاری بهبود بخشد.
**موضوعات:** هوش مصنوعی (cs.AI)
**استشهاد به صورت:** arXiv:2609.22068 [cs.AI] (یا arXiv:2609.22068v1 [cs.AI] برای این نسخه) https://doi.org/10.48550/arXiv.2609.22068
**تمرکز برای یادگیری بیشتر** DOI صادرشده توسط arXiv از طریق DataCite (در انتظار ثبت)
**تاریخچه ارائه** از: Rang Li [مشاهده ایمیل] [v1] جمعه، ۱۸ سپتامبر ۲۰۲۶ ۱۷:۵۵:۱۷ UTC (۲۳۷ KB)
**ابزارهای بیблиوگرافیک** ابزارهای بیibliوگرافیک و استشهاد
**کاوشگر بیibliوگرافیک** تغییر وضعیت کاوشگر بیibliوگرافیک (کاوشگر چیست؟)
**مقالات مرتبط** تغییر وضعیت مقالات مرتبط (مقالات مرتبط چیست؟)
**Litmaps** تغییر وضعیت Litmaps (Litmaps چیست؟)
**scite.ai** تغییر وضعیت استشهادهای هوشمند scite (استشهادهای هوشمند چیست؟)
**کد، داده، رسانه** کد، داده و رسانه مرتبط با این مقاله
**alphaXiv** تغییر وضعیت alphaXiv (alphaXiv چیست؟)
**لینکها به کد** تغییر وضعیت یابنده کد CatalyzeX برای مقالات (CatalyzeX چیست؟)
yzeX?) DagsHub باز و بسته کردن DagsHub (DagsHub چیست؟) GotitPub باز و بسته کردن Gotit.pub (GotitPub چیست؟) Hugging Face باز و بسته کردن Hugging Face (Hugging Face چیست؟) ScienceCast باز و بسته کردن ScienceCast (ScienceCast چیست؟) نمایشها نمایشها Replicate باز و بسته کردن Replicate (Replicate چیست؟) Spaces باز و بسته کردن Hugging Face Spaces (Spaces چیست؟) Spaces باز و بسته کردن TXYZ.AI (TXYZ.AI چیست؟) مقالات مرتبط سامانههای توصیهگر و ابزارهای جستجو پیوند به Influence Flower Influence Flower (Influence Flowers چیست؟) باز و بسته کردن توصیهگر CORE CORE Recommender (CORE چیست؟) نویسنده محل انتشار مؤسسه موضوع درباره arXivLabs arXivLabs: پروژههای آزمایشی با مشارکتکنندگان جامعه arXivLabs چارچوبی است که به مشارکتکنندگان امکان میدهد قابلیتهای جدید arXiv را توسعه داده و مستقیماً در وبسایت ما به اشتراک بگذارند. هم افراد و هم سازمانهایی که با arXivLabs همکاری میکنند، ارزشهای ما در زمینه گشودگی، اجتماعمحوری، تعالی و حریم خصوصی دادههای کاربران را پذیرفتهاند. arXiv به این ارزشها متعهد است و فقط با شرکایی همکاری میکند که از آنها پیروی میکنند. آیا ایدهای برای پروژهای دارید که برای جامعه arXiv ارزش افزوده ایجاد کند؟ درباره arXivLabs بیشتر بدانید. کدامیک از نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)