arXiv:2608.27406ترجمه شده

کِلپ: مدل‌های جهانی ویدیویی میان‌بدنی، شبیه‌سازهای فیزیکی بدون‌نمونه هستند

Kechen Liu، Ola Shorinwa

چکیده

مدل‌های ویدیویی پیشرفته با شرط عمل، معمولاً به یک پیکربندی رباتی واحد محدود می‌شوند و این امر مانع از بهره‌گیری آن‌ها از مجموعه داده‌های ویدیویی عظیم و ناهمگون موجود در اینترنت می‌شود؛ مجموعه داده‌هایی که حاوی سیگنال‌های غنی برای یادگیری فیزیک قابل تعمیم هستند. برای پر کردن این شکاف، ما در این مقاله CLAP را معرفی می‌کنیم، چارچوبی برای تولید ویدیو با شرط عمل بین‌پیکربندی که قادر به آموزش بر روی ویدیوهای متنوع در مقیاس اینترنتی شامل عامل‌های انسانی و رباتی است. CLAP بر این بینش بنا شده است که قوانین فیزیکی جهان‌شمول، مستقل از عامل، پویایی‌های فضا-زمانی را کنترل می‌کنند. با این حال، یادگیری بین‌پیکربندی یک امر بدیهی نیست، زیرا بازنمایی‌های عمل در بسترهای رباتی مختلف به‌طور چشمگیری متفاوت هستند و معمولاً در ویدیوهای انسانی وجود ندارند. CLAP این چالش بنیادی را از طریق مشارکت‌های اصلی زیر برطرف می‌کند. نخست، CLAP فضاهای عمل متفاوت را با استفاده از وضعیت‌های اندام انتهایی، دستورالعمل‌های زبانی و عمل‌های نهفته با یکدیگر هماهنگ می‌سازد. دوم، برای رفع محدودیت‌های منحصربه‌فرد هر یک از این روش‌ها، CLAP یک دستورالعمل یادگیری بین‌پیکربندی مبتنی بر برنامه آموزشی را معرفی می‌کند که ابتدا پیش‌نیازهای بنیادین فیزیکی را در میان داده‌های ویدیویی بدون برچسب با استفاده از عمل‌های نهفته می‌آموزد و سپس آن‌ها را در فضاهای عمل اندام انتهایی برای استقرار بدون نمونه در وظایف دنیای واقعی مستقر می‌سازد. نکته مهم اینکه، CLAP در محیط‌های چالش‌برانگیزی نظیر DROID به عملکرد مدل‌های ویدیویی تک‌پیکربندی پیشرفته نزدیک می‌شود یا از آن‌ها پیشی می‌گیرد. این مزایای عملکردی از طریق سازگاری با تعداد کم نمونه تجمیع می‌شوند تا الگویی جدید برای آموزش مدل‌های جهان ویدیویی تک‌پیکربندی ایجاد کنند. در نهایت، CLAP جامع‌ترین مجموعه از مدل‌های جهان ویدیویی با شرط عمل را تا به امروز ارائه می‌دهد—مجموعه‌ای که فضاهای شرط‌گذاری عمل متنوع (اندام انتهایی، زبان و نهفته) و ریخت‌شناسی‌های رباتی (شامل بین‌پیکربندی، DROID، Bridge، ربات‌های دودستی YAM و انسان‌نماهای G1) را در بر می‌گیرد. ما تمام کدها و مدل‌ها را به‌صورت متن‌باز منتشر می‌کنیم. وب‌سایت پروژه در آدرس https://omni-clap.github.io در دسترس است.

متن کامل

علوم کامپیوتر > رباتیک arXiv:2608.27406v1 (cs) [ارسال شده در ۲۷ اوت ۲۰۲۶] **عنوان:** CLAP: مدل‌های جهانی ویدیویی میان‌بدنی، شبیه‌سازهای فیزیکی بدون‌نظارت (Zero-Shot) هستند **نویسندگان:** کچن لیو، اولا شورینوا مشاهده PDF مقاله با عنوان «CLAP: مدل‌های جهانی ویدیویی میان‌بدنی، شبیه‌سازهای فیزیکی بدون‌نظارت (Zero-Shot) هستند»، تألیف کچن لیو و ۱ نویسنده دیگر مشاهده PDF HTML (آزمایشی) **چکیده:** مدل‌های ویدیویی شرطی‌شده با عمل، که در سطح پیشرفته قرار دارند، معمولاً به یک بدنه رباتی منفرد محدود هستند و قادر نیستند از حجم وسیع داده‌های ویدیویی ناهمگون که حاوی سیگنال‌های غنی برای یادگیری فیزیک تعمیم‌پذیر هستند، بهره ببرند. برای پر کردن این شکاف، ما چارچوب CLAP را معرفی می‌کنیم؛ یک چارچوب برای تولید ویدیوی شرطی‌شده با عمل میان‌بدنی که قابلیت آموزش بر روی ویدیوهای متنوع در مقیاس اینترنت، شامل عامل‌های انسانی و رباتیک را دارد. CLAP بر این بینش استوار است که قوانین فیزیکی جهان‌شمول، دینامیک‌های مکانی-زمانی را صرف‌نظر از عامل کنترل‌کننده هدایت می‌کنند. با این حال، یادگیری میان‌بدنی ساده نیست؛ زیرا بازنمایی‌های عمل در پلتفرم‌های رباتی مختلف بسیار متفاوت بوده و معمولاً در ویدیوهای انسانی غایب هستند. CLAP این چالش بنیادی را از طریق مشارکت‌های اصلی زیر برطرف می‌کند. نخست، CLAP فضاهای عمل متفاوت را با استفاده از وضعیت‌های (پوزهای) مجری نهایی، دستورات زبانی و اعمال نهفته (latent) با یکدیگر آشتی می‌دهد. دوم، برای رفع محدودیت‌های منحصربه‌فرد هر یک از این‌ها، CLAP یک دستورالعمل یادگیری میان‌بدنی مبتنی بر برنامه درسی (curriculum) را معرفی می‌کند که ابتدا پیش‌نیازهای بنیادی فیزیکی را در میان داده‌های ویدیویی بدون برچسب با استفاده از اعمال نهفته فرا می‌گیرد و سپس آن‌ها را در فضاهای عمل مجری نهایی برای استقرار بدون‌نظارت در وظایف دنیای واقعی مستقر می‌کند. نکته مهم اینکه CLAP در محیط‌های چالش‌برانگیزی نظیر DROID به عملکرد مدل‌های ویدیویی تک‌بدنی پیشرفته نزدیک می‌شود یا از آن‌ها پیشی می‌گیرد. این مزایای عملکردی از طریق سازگاری few-shot انباشته شده و یک الگوی جدید برای آموزش مدل‌های جهانی ویدیویی تک‌بدنی بنیان می‌نهند. در نهایت، CLAP جامع‌ترین مجموعه از مدل‌های جهانی ویدیویی شرطی‌شده با عمل تا به امروز را ارائه می‌دهد — که فضاهای شرطی‌سازی عمل متنوع (مجری نهایی، زبانی و نهفته) و مورفولوژی‌های رباتی متنوع (شامل میان‌بدنی، DROID، Bridge، ربات‌های دو بازویی YAM و ربات‌های انسان‌نمای G1) را در بر می‌گیرد. ما تمامی کدها و مدل‌ها را به‌صورت متن‌باز (open-source) منتشر می‌کنیم. وب‌سایت پروژه در این نشانی https URL در دسترس است. **موضوعات:** رباتیک (cs.RO)؛ هوش مصنوعی (cs.AI)؛ بینایی کامپیوتر و تشخیص الگو (cs.CV) **استناد به صورت:** arXiv:2608.27406 [cs.RO] (یا arXiv:2608.27406v1 [cs.RO] برای این نسخه) https://doi.org/10.48550/arXiv.2608.27406 برای کسب اطلاعات بیشتر در مورد DOI صادر شده توسط arXiv از طریق DataCite کلیک کنید (در انتظار ثبت) **تاریخچه ارسال:** [v1] پنجشنبه، ۲۷ اوت ۲۰۲۶ ساعت ۱۷:۳۵:۱۰ UTC (۸,۷۲۹ KB) از: Ola Shorinova [مشاهده ایمیل] **ابزارهای کتاب‌شناختی** ابزارهای کتاب‌شناختی و استنادی کاوشگر کتاب‌شناختی (Bibliographic Explorer) نمایش/پنهان‌سازی کاوشگر کتاب‌شناختی (کاوشگر چیست؟) مقالات مرتبط (Connected Papers) نمایش/پنهان‌سازی مقالات مرتبط (مقالات مرتبط چیست؟) نقشه‌های ادبی (Litmaps) نمایش/پنهان‌سازی نقشه‌های ادبی (نقشه‌های ادبی چیست؟) scite.ai نمایش/پنهان‌سازی استنادهای هوشمند scite (استنادهای هوشمند چیست؟) **کد، داده، رسانه** کد، داده و رسانه مرتبط با این مقاله alphaXiv فعال‌سازی alphaXiv (alphaXiv چیست؟) پیوندها به کد فعال‌سازی CatalyzeX جستجوگر کد برای مقالات (CatalyzeX چیست؟) DagsHub فعال‌سازی DagsHub (DagsHub چیست؟) GotitPub فعال‌سازی Gotit.pub (GotitPub چیست؟) Huggingface فعال‌سازی Hugging Face (Huggingface چیست؟) ScienceCast فعال‌سازی ScienceCast (ScienceCast چیست؟) دموها دموها Replicate فعال‌سازی Replicate (Replicate چیست؟) Spaces فعال‌سازی Hugging Face Spaces (Spaces چیست؟) Spaces فعال‌سازی TXYZ.AI (TXYZ.AI چیست؟) مقالات مرتبط ابزارهای پیشنهاددهنده و جستجو پیوند به Influence Flower فعال‌سازی Influence Flower (Influence Flowers چیست؟) فعال‌سازی پیشنهاددهنده CORE (CORE Recommender چیست؟) نویسنده همایش سازمان موضوع درباره arXivLabs آزمایشگاه‌های arXiv: پروژه‌های آزمایشی با همکاری جامعه آزمایشگاه‌های arXiv چارچوبی است که به همکاران اجازه می‌دهد تا ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه داده و به اشتراک بگذارند. هم افراد و هم سازمان‌هایی که با آزمایشگاه‌های arXiv کار می‌کنند، ارزش‌های ما مبنی بر openness، community، excellence و حریم خصوصی داده‌های کاربر را پذیرفته‌اند. arXiv متعهد به این ارزش‌ها است و تنها با شرکایی کار می‌کند که به آنها پایبند باشند. ایده‌ای برای پروژه‌ای دارید که ارزش افزوده‌ای برای جامعه arXiv ایجاد کند؟ درباره آزمایشگاه‌های arXiv بیشتر بدانید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال‌سازی MathJax (MathJax چیست؟)