چکیده
مدلهای ویدیویی پیشرفته با شرط عمل، معمولاً به یک پیکربندی رباتی واحد محدود میشوند و این امر مانع از بهرهگیری آنها از مجموعه دادههای ویدیویی عظیم و ناهمگون موجود در اینترنت میشود؛ مجموعه دادههایی که حاوی سیگنالهای غنی برای یادگیری فیزیک قابل تعمیم هستند. برای پر کردن این شکاف، ما در این مقاله CLAP را معرفی میکنیم، چارچوبی برای تولید ویدیو با شرط عمل بینپیکربندی که قادر به آموزش بر روی ویدیوهای متنوع در مقیاس اینترنتی شامل عاملهای انسانی و رباتی است. CLAP بر این بینش بنا شده است که قوانین فیزیکی جهانشمول، مستقل از عامل، پویاییهای فضا-زمانی را کنترل میکنند. با این حال، یادگیری بینپیکربندی یک امر بدیهی نیست، زیرا بازنماییهای عمل در بسترهای رباتی مختلف بهطور چشمگیری متفاوت هستند و معمولاً در ویدیوهای انسانی وجود ندارند. CLAP این چالش بنیادی را از طریق مشارکتهای اصلی زیر برطرف میکند. نخست، CLAP فضاهای عمل متفاوت را با استفاده از وضعیتهای اندام انتهایی، دستورالعملهای زبانی و عملهای نهفته با یکدیگر هماهنگ میسازد. دوم، برای رفع محدودیتهای منحصربهفرد هر یک از این روشها، CLAP یک دستورالعمل یادگیری بینپیکربندی مبتنی بر برنامه آموزشی را معرفی میکند که ابتدا پیشنیازهای بنیادین فیزیکی را در میان دادههای ویدیویی بدون برچسب با استفاده از عملهای نهفته میآموزد و سپس آنها را در فضاهای عمل اندام انتهایی برای استقرار بدون نمونه در وظایف دنیای واقعی مستقر میسازد. نکته مهم اینکه، CLAP در محیطهای چالشبرانگیزی نظیر DROID به عملکرد مدلهای ویدیویی تکپیکربندی پیشرفته نزدیک میشود یا از آنها پیشی میگیرد. این مزایای عملکردی از طریق سازگاری با تعداد کم نمونه تجمیع میشوند تا الگویی جدید برای آموزش مدلهای جهان ویدیویی تکپیکربندی ایجاد کنند. در نهایت، CLAP جامعترین مجموعه از مدلهای جهان ویدیویی با شرط عمل را تا به امروز ارائه میدهد—مجموعهای که فضاهای شرطگذاری عمل متنوع (اندام انتهایی، زبان و نهفته) و ریختشناسیهای رباتی (شامل بینپیکربندی، DROID، Bridge، رباتهای دودستی YAM و انساننماهای G1) را در بر میگیرد. ما تمام کدها و مدلها را بهصورت متنباز منتشر میکنیم. وبسایت پروژه در آدرس https://omni-clap.github.io در دسترس است.
متن کامل
علوم کامپیوتر > رباتیک arXiv:2608.27406v1 (cs) [ارسال شده در ۲۷ اوت ۲۰۲۶]
**عنوان:** CLAP: مدلهای جهانی ویدیویی میانبدنی، شبیهسازهای فیزیکی بدوننظارت (Zero-Shot) هستند
**نویسندگان:** کچن لیو، اولا شورینوا
مشاهده PDF مقاله با عنوان «CLAP: مدلهای جهانی ویدیویی میانبدنی، شبیهسازهای فیزیکی بدوننظارت (Zero-Shot) هستند»، تألیف کچن لیو و ۱ نویسنده دیگر
مشاهده PDF HTML (آزمایشی)
**چکیده:**
مدلهای ویدیویی شرطیشده با عمل، که در سطح پیشرفته قرار دارند، معمولاً به یک بدنه رباتی منفرد محدود هستند و قادر نیستند از حجم وسیع دادههای ویدیویی ناهمگون که حاوی سیگنالهای غنی برای یادگیری فیزیک تعمیمپذیر هستند، بهره ببرند. برای پر کردن این شکاف، ما چارچوب CLAP را معرفی میکنیم؛ یک چارچوب برای تولید ویدیوی شرطیشده با عمل میانبدنی که قابلیت آموزش بر روی ویدیوهای متنوع در مقیاس اینترنت، شامل عاملهای انسانی و رباتیک را دارد. CLAP بر این بینش استوار است که قوانین فیزیکی جهانشمول، دینامیکهای مکانی-زمانی را صرفنظر از عامل کنترلکننده هدایت میکنند. با این حال، یادگیری میانبدنی ساده نیست؛ زیرا بازنماییهای عمل در پلتفرمهای رباتی مختلف بسیار متفاوت بوده و معمولاً در ویدیوهای انسانی غایب هستند. CLAP این چالش بنیادی را از طریق مشارکتهای اصلی زیر برطرف میکند. نخست، CLAP فضاهای عمل متفاوت را با استفاده از وضعیتهای (پوزهای) مجری نهایی، دستورات زبانی و اعمال نهفته (latent) با یکدیگر آشتی میدهد. دوم، برای رفع محدودیتهای منحصربهفرد هر یک از اینها، CLAP یک دستورالعمل یادگیری میانبدنی مبتنی بر برنامه درسی (curriculum) را معرفی میکند که ابتدا پیشنیازهای بنیادی فیزیکی را در میان دادههای ویدیویی بدون برچسب با استفاده از اعمال نهفته فرا میگیرد و سپس آنها را در فضاهای عمل مجری نهایی برای استقرار بدوننظارت در وظایف دنیای واقعی مستقر میکند. نکته مهم اینکه CLAP در محیطهای چالشبرانگیزی نظیر DROID به عملکرد مدلهای ویدیویی تکبدنی پیشرفته نزدیک میشود یا از آنها پیشی میگیرد. این مزایای عملکردی از طریق سازگاری few-shot انباشته شده و یک الگوی جدید برای آموزش مدلهای جهانی ویدیویی تکبدنی بنیان مینهند. در نهایت، CLAP جامعترین مجموعه از مدلهای جهانی ویدیویی شرطیشده با عمل تا به امروز را ارائه میدهد — که فضاهای شرطیسازی عمل متنوع (مجری نهایی، زبانی و نهفته) و مورفولوژیهای رباتی متنوع (شامل میانبدنی، DROID، Bridge، رباتهای دو بازویی YAM و رباتهای انساننمای G1) را در بر میگیرد. ما تمامی کدها و مدلها را بهصورت متنباز (open-source) منتشر میکنیم. وبسایت پروژه در این نشانی https URL در دسترس است.
**موضوعات:** رباتیک (cs.RO)؛ هوش مصنوعی (cs.AI)؛ بینایی کامپیوتر و تشخیص الگو (cs.CV)
**استناد به صورت:** arXiv:2608.27406 [cs.RO] (یا arXiv:2608.27406v1 [cs.RO] برای این نسخه)
https://doi.org/10.48550/arXiv.2608.27406
برای کسب اطلاعات بیشتر در مورد DOI صادر شده توسط arXiv از طریق DataCite کلیک کنید (در انتظار ثبت)
**تاریخچه ارسال:**
[v1] پنجشنبه، ۲۷ اوت ۲۰۲۶ ساعت ۱۷:۳۵:۱۰ UTC (۸,۷۲۹ KB)
از: Ola Shorinova [مشاهده ایمیل]
**ابزارهای کتابشناختی**
ابزارهای کتابشناختی و استنادی
کاوشگر کتابشناختی (Bibliographic Explorer) نمایش/پنهانسازی کاوشگر کتابشناختی (کاوشگر چیست؟)
مقالات مرتبط (Connected Papers) نمایش/پنهانسازی مقالات مرتبط (مقالات مرتبط چیست؟)
نقشههای ادبی (Litmaps) نمایش/پنهانسازی نقشههای ادبی (نقشههای ادبی چیست؟)
scite.ai نمایش/پنهانسازی استنادهای هوشمند scite (استنادهای هوشمند چیست؟)
**کد، داده، رسانه**
کد، داده و رسانه
مرتبط با این مقاله alphaXiv فعالسازی alphaXiv (alphaXiv چیست؟) پیوندها به کد فعالسازی CatalyzeX جستجوگر کد برای مقالات (CatalyzeX چیست؟) DagsHub فعالسازی DagsHub (DagsHub چیست؟) GotitPub فعالسازی Gotit.pub (GotitPub چیست؟) Huggingface فعالسازی Hugging Face (Huggingface چیست؟) ScienceCast فعالسازی ScienceCast (ScienceCast چیست؟) دموها دموها Replicate فعالسازی Replicate (Replicate چیست؟) Spaces فعالسازی Hugging Face Spaces (Spaces چیست؟) Spaces فعالسازی TXYZ.AI (TXYZ.AI چیست؟) مقالات مرتبط ابزارهای پیشنهاددهنده و جستجو پیوند به Influence Flower فعالسازی Influence Flower (Influence Flowers چیست؟) فعالسازی پیشنهاددهنده CORE (CORE Recommender چیست؟) نویسنده همایش سازمان موضوع درباره arXivLabs آزمایشگاههای arXiv: پروژههای آزمایشی با همکاری جامعه آزمایشگاههای arXiv چارچوبی است که به همکاران اجازه میدهد تا ویژگیهای جدید arXiv را مستقیماً در وبسایت ما توسعه داده و به اشتراک بگذارند. هم افراد و هم سازمانهایی که با آزمایشگاههای arXiv کار میکنند، ارزشهای ما مبنی بر openness، community، excellence و حریم خصوصی دادههای کاربر را پذیرفتهاند. arXiv متعهد به این ارزشها است و تنها با شرکایی کار میکند که به آنها پایبند باشند. ایدهای برای پروژهای دارید که ارزش افزودهای برای جامعه arXiv ایجاد کند؟ درباره آزمایشگاههای arXiv بیشتر بدانید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعالسازی MathJax (MathJax چیست؟)