arXiv:2608.24876ترجمه شده

تکامل حافظه کاری تجربه‌ای بازگشتی برای چارچوهای عامل با افق طولانی

Zhaochen Yu، Yingcheng Wu، Zhenfei Yin، Kaiyuan Chen، Zhe Zhao، Mengdi Wang، Shuicheng Yan، Ling Yang

چکیده

بهبود خود‑بازگشتی (RSI) در وظایف افق‌طولانی دشوار می‌ماند؛ جایی که سابقه‌های رشدگی وضعیت وظیفه را مبهم می‌سازند و فراخوانی مهارت را نامتناسب می‌کنند. ما Recuris را معرفی می‌کنیم، یک معماری حافظه تجربی‑کار بازگشتی برای وظایف افق‌طولانی عامل، که در آن حافظه کار پیشرفت وظیفه را پیگیری می‌کند و از حافظه تجربی انتخاب مهارت را راهنمایی می‌کند؛ به طوری که استفاده از مهارت بر اساس نیازهای کنونی، نه تاریخ کامل، مبتنی باشد. این ارتباط همچنین اجرا را به شواهد ساختاری تبدیل می‌کند که شکست‌ها را به اجزای خاص حافظه محدود می‌کند. در طول وظایف، یک متا‑agens ثابت این شواهد را به‌روزرسانی‌های محلی validation‑gated در حافظه مهارت تبدیل می‌کند؛ این کار اجرا را تغییر می‌دهد و شواهد جدیدی تولید می‌کند و یک حلقه تکامل حافظه بازگشتی محدود را تشکیل می‌دهد. در چهار بنچمارک افق‌طولانی و ده مدل، Recuris در 35 از 37 زوج مدل‑بنچمارک تکمیل‌شده، موفقیت وظیفه را افزایش می‌دهد و مدل‌های پیش‌رو را به سطح موفقیت وظیفه SOTA می‌رساند: در tau‑bench، GPT‑5.6 Sol را +17.8 امتیاز و Claude Opus 5 را +15.6 امتیاز افزایش می‌دهد؛ Opus 5 به 87.9٪ می‌رسد؛ و Qwen3.6‑27B/35B را روی SkillFlow به ترتیب +16.6 و +13.5 امتیاز افزایش می‌دهد. مزیت با افزایش افق تعامل گسترش می‌یابد؛ تا +32.2 امتیاز روی وظایف طولانی‌ترین و شکست‌های رایج افق‌طولانی تا 80٪ کاهش می‌یابد. این نتایج حافظه بازگشتی‑ évolutionی را به‌عنوان یک پایهٔ مقیاس‌پذیر برای RSI قرار می‌دهند؛ که عامل‌ها را قادر می‌سازد تا تجربه جمع‌آوری‌شده را به‌طور مستمر به رفتار افق‌طولانی مؤثرتر تبدیل کنند. کد: https://github.com/Gen-Verse/Recuris

متن کامل

علوم کامپیوتر > هوش مصنوعی arXiv:2608.24876v1 (cs) [ارسال‌شده در ۲۵ اوت ۲۰۲۶] **عنوان:** تکامل بازگشتیِ حافظه‌ی تجربی-کاربردی برای عاملانِ افق‌زمانیِ طولانی **نویسندگان:** ژائوچن یو، ینگچنگ وو، ژنفی یین، کایوان چن، ژه ژائو، منگدی وانگ، شویچنگ یان، لینگ یانگ برای مشاهده نسخه PDF مقاله با عنوان «تکامل بازگشتیِ حافظه‌ی تجربی-کاربردی برای عاملانِ افق‌زمانیِ طولانی» نوشته ژائوچن یو و هفت نویسنده دیگر، اینجا کلیک کنید. **مشاهده PDF** | **HTML (آزمایشی)** --- **چکیده:** بهبود خودکار بازگشتی (RSI) در وظایفِ افق‌زمانیِ طولانی همچنان چالش‌برانگیز است، چرا که تاریخچه‌های رو به رشد، وضعیت وظیفه را مبهم می‌سازند و فراخوانی مهارت‌ها را دچار خطا می‌کنند. ما معماری **Recuris** را معرفی می‌کنیم: یک سامانه‌ی حافظه‌ی تجربی-کاربردیِ بازگشتی برای عاملانِ افق‌زمانیِ طولانی. در این معماری، حافظه‌ی کاربردی پیشرفتِ وظیفه را ردیابی کرده و انتخاب مهارت‌ها را از حافظه‌ی تجربی هدایت می‌کند، به‌گونه‌ای که به‌کارگیری مهارت‌ها بر اساس نیازهای لحظه‌حاضر — نه تاریخچه‌ی کامل — صورت می‌گیرد. این اتصال، اجرای کار را به شواهد ساختاری تبدیل می‌کند که شکست‌ها را به اجزای خاصِ حافظه محدود می‌سازد. در سراسر وظایف، یک متا-عاملِ ثابت این شواهد را به به‌روزرسانی‌هایِ محدودشده و تأییدشده‌ی حافظه‌ی مهارت تبدیل می‌کند، که اجرای کار را بازسازی کرده و شواهد جدیدی تولید می‌کنند. این فرآیند، یک چرخه‌ی بازگشتیِ محدود برای تکامل حافظه را تشکیل می‌دهد. در چهار معیار سنجش با افق‌زمانیِ طولانی و بر روی ده مدل، Recuris موفقیت در وظایف را در ۳۵ مورد از ۳۷ جفتِ مدل-معیار سنجش تکمیل‌شده بهبود می‌بخشد و مدل‌های پیشرو را به سطح موفقیت SOTA در وظایف می‌رساند. در tau-bench، این معماری ۱۷.۸ امتیاز به GPT-5.6 Sol و ۱۵.۶ امتیاز به Claude Opus 5 اضافه می‌کند و Opus 5 را به ۸۷.۹٪ می‌رساند. همچنین، ۱۶.۶ و ۱۳.۵ امتیاز به Qwen3.6-27B و Qwen3.6-35B در SkillFlow اضافه می‌کند. این برتری با افزایش افق تعامل گسترش می‌یابد، تا ۳۲.۲ امتیاز در طولانی‌ترین وظایف، و شکست‌های رایج در افق‌زمانیِ طولانی تا ۸۰٪ کاهش می‌یابند. این نتایج، تکامل بازگشتیِ حافظه را به عنوان یک پایه‌ی قابل‌مقیاس برای RSI مطرح می‌کنند و به عاملان امکان می‌دهند تا به طور مداوم تجربه‌ی انباشته‌شده را به رفتارهای افق‌زمانیِ طولانی‌تر و مؤثرتر تبدیل کنند. **کد:** [این آدرس](https) **نظرات:** **موضوعات:** هوش مصنوعی (cs.AI)؛ محاسبات و زبان (cs.CL) **استناد:** arXiv:2608.24876 [cs.AI] (یا arXiv:2608.24876v1 [cs.AI] برای این نسخه) https://doi.org/10.48550/arXiv.2608.24876 برای کسب اطلاعات بیشتر به DOI صادرشده توسط arXiv از طریق DataCite (در انتظار ثبت‌نام) مراجعه کنید. **تاریخچه ارسال:** از: لینگ یانگ [مشاهده ایمیل] [v1] سه‌شنبه، ۲۵ اوت ۲۰۲۶، ۱۷:۵۶:۳۵ UTC (۱,۵۷۰ کیلوبایت) --- **ابزارهای کتاب‌شناسی:** ابزارهای کتاب‌شناسی و استناد، جستجوگر کتاب‌شناسی (فعال/غیرفعال)، مقالات مرتبط (فعال/غیرفعال)، Litmaps (فعال/غیرفعال)، scite.ai (فعال/غیرفعال)، کد، داده، رسانه (فعال/غیرفعال)، alphaXiv (فعال/غیرفعال)، لینک‌های کد (فعال/غیرفعال)، CatalyzeX Code Finder (فعال/غیرفعال)، DagsHub (فعال/غیرفعال)، GotitPub (فعال/غیرفعال)، Huggingface (فعال/غیرفعال)، ScienceCast (فعال/غیرفعال) --- **Demos** Replicate (Replicate چیست؟) | Hugging Face Spaces (Spaces چیست؟) | TXYZ.AI (TXYZ.AI چیست؟) **مقالات مرتبط** سیستم‌های پیشنهادکننده و جستجو لینک به Influence Flower (Influence Flowers چه هستند؟) پیشنهادکننده اصلی CORE Recommender (CORE چیست؟) **نویسنده | مکان | موسسه | موضوع** درباره arXivLabs **arXivLabs: پروژه‌های آزمایشی با همکاران جامعه** arXivLabs چارچوبی است که به همکاران اجازه می‌دهد ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه و به اشتراک بگذارند. هر دو افراد و سازمان‌هایی که با arXivLabs کار می‌کنند، ارزش‌های ما از جمله باز بودن، جامعه، برتری و حریم خصوصی داده‌های کاربر را پذیرفته‌اند. arXiv به این ارزش‌ها متعهد است و تنها با شرکایی که به آن‌ها پایبند هستند همکاری می‌کند. آیا ایده‌ای برای پروژه‌ای دارید که بتواند برای جامعه arXiv ارزش افزوده بیاورد؟ [بیشتر درباره arXivLabs بیاموزید](https) **کدام نویسندگان این مقاله تاییدکننده هستند؟** | غیرفعال کردن MathJax (MathJax چیست؟) |