arXiv:2608.23565ترجمه شده

ReWorld: یک مدل جهان تعاملی با حافظه در افق طولانی

Zhifei Chen، Luozhou Wang، Guibao Shen، Dongyu Yan، Shuai Yang، Tianshuo Xu، Yihua Du، Wei Wang، Tianyi Gui، Lianghua Huang، Yingcong Chen

چکیده

User Safety: safe

متن کامل

**عنوان: ReWorld: یک مدل جهانی تعاملی با حافظه افق بلند** **نویسندگان:** Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang, Tianshuo Xu, Yihua Du, Wei Wang, Tianyi Gui, Lianghua Huang, Yingcong Chen **چکیده:** یک مدل جهانی تعاملی باید اقدامات کاربر را پیگیری کند، مکان‌های نمایش داده‌شده را به خاطر بسپارد و به‌صورت بلادرنگ (real‑time) استریم نماید. تضاد در اینجا ساختاری است: کنترل به افقی کوتاه نیاز دارد، در حالی که حافظه به افقی نامحدود نیاز دارد. ReWorld این دو را در طول آموزش تفکیک می‌کند و در زمان استنتاج (inference) آن‌ها را محدود می‌سازد. پنجره‌های توجه مخلوط در هر سر (mixed per‑head attention windows) اکثر سرها را به گذشته نزدیک محدود می‌کنند؛ در مقابل، یک مجموعة کوچک از سرهای جهانی به کل تاریخچه توجه دارند. همچنین، مسیریابی تصادفی سرها (random head routing) مانع از اختصاص این قابلیت‌ها به سرهای خاص می‌شود. حذف تصادفی تکه‌ها (random chunk dropping) تاریخچه‌های پراکنده را در توزیع داده‌های داخل (in‑distribution) قرار می‌دهد. در زمان استنتاج، کل گذشته تحت یک بودجه ثابت قرار می‌گیرد: یک حافظه نهان KV محدود که توسط یک بانک نقاط شاخص (landmark bank) با نمایه‌ی وضعیت (pose‑indexed) پشتیبانی می‌شود و از طریق آن، نقاط شاخص نزدیک به وضعیت فعلی بازیابی می‌شود. یک موتور داده با مقیاس متری هم‑تراز، هشت منبع (شامل پروازهای رندر شده در Unreal، گشت‌وگذار در بازی و فیلم‌های دنیای واقعی) را روی یک مقیاس اقدام فیزیکی واحد قرار می‌دهد؛ به طوری که فشار دادن یک کلید یکسان، دوربین را در هر منبع به مسافتی یکسانی حرکت می‌دهد و مسیرهای پالیندرومی (palindrome trajectories) شواهد بازگشت لازم برای آموزش حافظه را فراهم می‌آورد. سپس تقطیر تطبیق توزیع (distribution‑matching distillation)، که به یک آداپتور LoRA محدود شده است، نمونه‌برداری را به چهار گام فشرده می‌سازد: یک بدنه (backbone) واحد هم در حالت چندگامی با دقت بالا و هم در حالت تعاملی بلادرنگ کار می‌کند و ویدیوهای با رزولوشن ۷۰۴×۱۲۸۰ را در دنیای فوتورئالیستی، سبک بازی و استایل‑دار استریم می‌نماید. تحت یک پروتکل سه محوره شامل پیروی از اقدام، یادآوری افق بلند و کیفیت ویدیو، این مدل نسبت به شش مدل جهانی تعاملی اخیر، بهترین دقت کنترل (خطای چرخش $11.95^\circ$ و بهترین سازگاری حرکت دوربین) و بهترین کیفیت تولید را به دست آورده است؛ همچنین در اجراهای رفت‌وبرگشتی یک دقیقه‌ای ($64$ ثانیه، $384$ لیتنت)، حافظه نهان ۱۲‑تکه‌ای ثابت آن همچنان نمای اولیه را بازسازی می‌کند — در بازه‌هایی که پنجره لغزان (sliding window) شواهد را حذف کرده و توجه کامل KV با کمبود حافظه مواجه می‌شود. **توضیحات:** **موضوعات:** هوش مصنوعی (cs.AI) **ارجاع:** arXiv:2608.23565 [cs.AI] (یا arXiv:2608.23565v1 [cs.AI] برای این نسخه) https://doi.org/10.48550/arXiv.2608.23565 کد رسانه، داده و رسانه مرتبط با این مقاله alphaXiv Toggle alphaXiv (چه است alphaXiv?) لینک به کد Toggle CatalyzeX Finder کد برای مقالات (چه است CatalyzeX?) DagsHub Toggle DagsHub (چه است DagsHub?) GotitPub Toggle Gotit.pub (چه است GotitPub?) Huggingface Toggle Hugging Face (چه است Huggingface?) ScienceCast Toggle ScienceCast (چه است ScienceCast?) Demos Demos Toggle Replicate (چه است Replicate?) Spaces Toggle Hugging Face Spaces (چه است Spaces?) Spaces Toggle TXYZ.AI (چه است TXYZ.AI?) پروژه‌های مرتبط، توصیه‌کنندگان و ابزارهای جستجو لینک به Influence Flower Influence Flower (چه هستند Influence Flowers?) تغییر Core Recommender (چه است CORE?) نویسندگان مقاله | غیرفعال‌سازی MathJax (چه است MathJax?) arXivLabs: پروژه‌های آزمایشی با مشارکت جامعه arXivLabs یک چارچوب است که به مشارکت‌کنندگان امکان می‌دهد ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه و به اشتراک بگذارند. هم افراد و سازمان‌هایی که با arXivLabs کار می‌کنند، ارزش‌های ما را پذیرفته و پذیرا شده‌اند: شفافیت، جامعه، فراگردی و حریم خصوصی داده‌های کاربری. arXiv به این ارزش‌ها متعهد است و تنها با شرکایی که به آن‌ها پایبند هستند، کار می‌کند. آیا ایده‌ای برای پروژه‌ای دارید که ارزش اضافه برای جامعه arXiv ایجاد کند؟ برای اطلاعات بیشتر دربارهٔ arXivLabs بیشتر بخوانید.