چکیده
کارهای پیچیدهٔ دستکاری روباتگر اغلب به حافظهٔ بلندمدت از رویدادها و اقدامات گذشته نیاز دارند. چون شرطزنی بر تمام تاریخچه منجر به ارتباطات ضعیف و تخریب عملکرد میشود، بسیاری از روشهای حافظه سیاست، اطلاعات تاریخی را از طریق پرسوجوهای پرهزین مدلهای زبانی بزرگ (VLM) در حلقه فشرده میکنند تا فقط دادههای مرتبط با وظیفه پردازش شوند. در این مقاله، یک رویکرد جایگزین پیشنهاد میدهیم که در زمان آموزش، پرسوجوهای پرhezین VLM انجام شود تا یک حافظهٔ پنهان سبکوزن یاد بگیرد که در زمان اجرا بهصورت کارآمد قابل پرسوجو باشد. این نمایش را \textbf{workspace token} مینامیم و آن را به دو مرحله به دست میآوریم: (1) از یک VLM برای استخراج اطلاعات جار و تاریخی لازم برای تکمیل وظیفه استفاده میکنیم؛ (2) سپس این اطلاعات را با استفاده از یک تابع loss بازسازی مجموعه (set‑reconstruction decoder loss) به \textbf{workspace token} فشرده میکنیم. در هر دو محیط شبیهسازی و سختافزار نشان میدهیم که \textbf{workspace token} میتواند به جای مشاهدات در زمان اجرا بهعنوان ورودی به کار رود، به طوری که سیاستها بتوانند وظایف حافظهمحور را بدون استدلال VLM در حلقه حل کنند. در مقابل، مشاهده کردیم که \textbf{workspace token}ها نه تنها سبکتر هستند، بلکه عملکرد سیاست را نیز بهبود میبخشند.
متن کامل
مدلهای جهانی: حافظه سبکوزن رباتیک از طریق نظارت مبتنی بر حساسیت
نیتیش داشورا، دوغلاس چن، ایدان شنفلد، جان مارانگولا، پولک اگراوال، ماکس سیمچویتز
**خلاصه:** وظایف پیچیده رباتیک مبتنی بر دستورالعمل بهطور مکرر به حافظه بلندمدت از رویدادها و اقدامات گذشته نیاز دارند. اگرچه تنظیم سیاستها بر اساس تاریخچه کامل منجر به در معرض قرار گرفتن سیاستها در همبستگیهای نادرست و کاهش عملکرد میشود، بسیاری از رویکردهای حافظه سیاست اطلاعات تاریخی را از طریق پرسوجوی پرهزینه VLM در حلقه بازگشتی فشردهسازی میکنند تا فقط اطلاعات مرتبط با وظیفه پردازش شوند. در این مقاله، ما یک رویکرد جایگزین ارائه میدهیم که در آن پرسوجوی VLM بهصورت محاسباتی در زمان آموزش برای یادگیری حافظه پنهان سبکوزن انجام میشود تا در زمان اجرا بهطور کارآمد قابل دسترسی برای پرسش باشد. نمایش ما، که آن را «توکن فضای کار» مینامیم، با (۱) استفاده از یک VLM برای شناسایی اطلاعات فعلی و تاریخی لازم برای تکمیل یک وظیفه، و سپس (۲) خلاصهسازی این اطلاعات به توکن فضای کار با استفاده از هزینه ضایع بازسازی مجموعه، آموزشدیده شده است. در هر دو شبیهسازی و روی سختافزار واقعی، نشان میدهیم که توکن فضای کار میتواند بهعنوان جایگزینی بدون تغییر برای مشاهدات در زمان اجرا استفاده شود، که به سیاستها اجازه میدهد وظایف سنگین از نظر حافظه را بدون نیاز به استدلال VLM در حلقه بازگشتی حل کنند. بهجالب توجه، متوجه شدیم که توکنهای فضای کار نه تنها سبکتر بلکه منجر به بهبود عملکرد سیاستها نیز میشوند.
**توضیحات:**
موضوعات: رباتیک (cs.RO)، هوش مصنوعی (cs.AI)
ارجاع: arXiv:2609.20820 [cs.RO] (یا arXiv:2609.20820v1 [cs.RO] برای نسخه این مقاله)
https://doi.org/10.48550/arXiv.2609.20820
تمرکز برای دانستن بیشتر درباره رابطه DOI منتشرشده توسط arXiv (در انتظار ثبت)
تاریخ ارسال:
نیتیش داشورا [نمایش ایمیل] [v1] ۱۷ سپتامبر ۲۰۲۶ ۱۷:۵۹:۳۵ UTC (۱۲٬۹۸۴ کیبایت)
اطلاعات ارتباطی:
تاریخچه ارسال از: نیتیش داشورا [نمایش ایمیل] [v1] ۱۷ سپتامبر ۲۰۲۶ ۱۷:۵۹:۳۵ UTC (۱۲٬۹۸۴ کیبایت)
*نکته: بخشهای اصلی مقاله که شامل عنوان، نویسندگان، خلاصه، توضیحات، ارجاعات و تاریخ ارسال است، ترجمه شدهاند. ساختار اصلی مقاله حفظ شده است و اصطلاحات فنی بهصورت مناسب به فارسی تبدیل شدهاند.*
تغییر وضعیت پیشنهاددهنده CORE (CORE چیست؟)
نویسنده مکان
مؤسسه
موضوع
درباره arXivLabs
arXivLabs: پروژههای آزمایشی با همکاران جامعه
arXivLabs چارچوبی است که به همکاران امکان میدهد ویژگیهای جدید arXiv را مستقیماً در وبسایت ما توسعه و به اشتراک بگذارند. هر دو فرد و سازمانهایی که با arXivLabs کار میکنند، ارزشهای ما در حوزه شفافیت، جامعه، برتری و حریم خصوصی دادههای کاربر را پذیرفته و درک کردهاند. arXiv به این ارزشها متعهد است و تنها با شراکتی کار میکند که به آنها پایبند باشند. آیا ایدهای برای پروژهای دارید که ارزش افزوده برای جامعه arXiv ایجاد کند؟ بیشتر درباره arXivLabs بدانید.
کدام نویسندگان این مقاله تأییدکنندگان هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)