arXiv:2609.20817ترجمه شده

User Safety: safe

Kevin Qu، Tao Sun، Massimiliano Viola، Liyuan Zhu، Zhizhuo Zhou، Sayan Deb Sarkar، Konrad Schindler، Iro Armeni

چکیده

مدل‌سازی اشیای مفصلی از روی مجموعه‌ای تنک از تصاویر تک‌چشمی دشوار است، زیرا هر مشاهده تنها بخش کوچکی از شواهد مربوط به هندسه و حرکت را آشکار می‌کند. بیشتر روش‌های پیش‌رو مفصل‌بندی را از روی یک مشاهده واحد استنتاج می‌کنند و، ازاین‌رو، به‌شدت به پیش‌فرض‌های شکلِ آموخته‌شده در سطح مقوله وابسته‌اند. ما FAMOS را معرفی می‌کنیم؛ مدلی پیش‌رو که بخش‌بندی اجزای متحرک و پارامترهای مفصل را از ابرنقاط جزئیِ تنک و نامرتب پیش‌بینی می‌کند. مدل ما به‌طور مشترک بر چندین مشاهده استدلال می‌کند و به‌صورت طبیعی با تعداد متغیری از ورودی‌ها، حتی تنها یک دید، سازگار است. برای ادغام سرنخ‌های مفصل‌بندی در سراسر مشاهده‌ها، ترانسفورمر مفصل‌بندی چندحالتی‌ای با الگوهای متناوب توجه محلی و سراسری معرفی می‌کنیم. همچنین، تابع هدفِ گسترهٔ مفصل‌بندیِ مشاهده‌شده را پیشنهاد می‌دهیم که بر بازهٔ حرکتی هر جزء در مشاهده‌های ورودی نظارت اعمال می‌کند و مدل را به بهره‌گیری از تمام مشاهده‌های موجود ترغیب می‌سازد. برای غلبه بر محدودیت‌های مقیاس و تنوع در مجموعه‌داده‌های موجود، مولد داده‌ای رویه‌ای معرفی می‌کنیم که در طول آموزش، دارایی‌های خود-برچسب‌گذاری‌شده را به‌صورت مصنوعی تولید می‌کند. آزمایش‌ها روی PartNet-Mobility، ACD و ArtiCraft-10K بهبودهای پایدار نسبت به خطوط مبنای پیش‌رو و نیز خطوط مبنای مبتنی بر بهینه‌سازی را نشان می‌دهند. صفحه پروژه: https://kevinqu7.github.io/famos

متن کامل

کامپیوترسازی > بینایی ماشین و تشخیص الگو arXiv:2609.20817v1 (cs) [ارائه‌شده در ۱۷ سپتامبر ۲۰۲۶] عنوان: FAMOS: مدل‌سازی پیش‌خور مفصلی سه‌بعدی از مشاهدات اسپارس نویسندگان: Kevin Qu, Tao Sun, Massimiliano Viola, Liyuan Zhu, Zhizhuo Zhou, Sayan Deb Sarkar, Konrad Schindler, Iro Armeni مشاهده PDF مقاله با عنوان FAMOS: مدل‌سازی پیش‌خور مفصلی سه‌بعدی از مشاهدات اسپارس نویسندگان: Kevin Qu و ۷ نویسنده دیگر مشاهده PDF HTML (آزمایشی) چکیده:مدل‌سازی اشیاء مفصلی از دیدگاه‌های تک‌ساختار اسپارس به دلیل آنکه هر مشاهده فقط هندسه و شواهد حرکتی جزئی را آشکار می‌کند، چالش‌برانگیز است. اکثر روش‌های پیش‌خور، مفصلی‌سازی را از یک مشاهده استنتاج می‌کنند و بنابراین به شدت به پیش‌نیازهای شکل سطحی یادگرفته‌شده وابسته‌اند. ما FAMOS را ارائه می‌دهیم، یک مدل پیش‌خور که تقسیم‌بندی اجزای متحرک و پارامترهای مفصلی را از یک مجموعه اسپارس و نامرتب از ابرنقاط جزئی پیش‌بینی می‌کند. مدل ما به‌صورت مشترک بر روی چندین مشاهده استدلال می‌کند و به‌طور طبیعی تعداد متغیری از ورودی‌ها را پشتیبانی می‌کند، از جمله یک دیدگاه تکی. برای تجمیع نشانه‌های مفصلی‌سازی در سراسر مشاهدات، ما یک ترنسفورمر مفصلی چندحالتی با توجه متناوب سطحی و کلی معرفی می‌کنیم. علاوه بر این، ما یک هدف برد مفصلی مشاهده‌شده پیشنهاد می‌دهیم که محدوده حرکتی نمایش‌داده‌شده توسط هر جزء در طول مشاهدات ورودی را نظارت می‌کند و مدل را تشویق می‌کند از کل مجموعه مشاهدات بهره‌مند شود. برای غلبه بر مقیاس و تنوع محدود مجموعه‌داده‌های موجود، ما یک تولیدکننده داده رویه‌ای معرفی می‌کنیم که در طول آموزش، دارایی‌های خود-برچسب‌گذاری‌شده را ترکیب می‌کند. آزمایش‌ها روی PartNet-Mobility، ACD و ArtiCraft-10K بهبودهای ثابتی نسبت به خطوط پایه پیش‌خور و مبتنی بر بهینه‌سازی را نشان می‌دهد. صفحه پروژه: این URL نظرها: دسته‌بندی‌ها: بینایی ماشین و تشخیص الگو (cs.CV)؛ هوش مصنوعی (cs.AI)؛ رباتیک (cs.RO) استناد به: arXiv:2609.20817 [cs.CV] (یا arXiv:2609.20817v1 [cs.CV] برای این نسخه) https://doi.org/10.48550/arXiv.2609.20817 تمرکز برای بیشتر یادگیری DOI صادرشده توسط arXiv از طریق DataCite (ثبت آن در حال انجام است) تاریخچه ارسال از: Kevin Qu [مشاهده ایمیل] [v1] پنجشنبه، ۱۷ سپتامبر ۲۰۲۶ ۱۷:۵۹:۴۰ UTC (۵,۵۹۵ کیلوبایت) ابزارهای بیبلیوگرافیک ابزارهای بیبلیوگرافیک و استنادی بیبلیوگرافیک اکسپلورر فعال‌سازی بیبلیوگرافیک اکسپلورر (بیبلیوگرافیک اکسپلورر چیست؟) Connected Papers فعال‌سازی Connected Papers (Connected Papers چیست؟) Litmaps فعال‌سازی Litmaps (Litmaps چیست؟) scite.ai فعال‌سازی scite Smart Citations (استیت‌های هوشمند چیست؟) کد، داده، رسانه کد، داده و رسانه مرتبط با این مقاله alphaXiv فعال‌سازی alphaXiv (alphaXiv چیست؟) لینک‌های کد فعال‌سازی CatalyzeX Code Finder for Papers (CatalyzeX Code Finder for Papers چیست؟) DagsHub فعال‌سازی DagsHub (DagsHub چیست؟) GotitPub فعال‌سازی Gotit.pub (Gotit.pub چیست؟) Huggingface فعال‌سازی Hugging Face (Huggingface چیست؟) ScienceCast فعال‌سازی ScienceCast (ScienceCast چیست؟) نمایش‌ها نمایش‌ها Replicate فعال‌سازی Replicate (Replicate چیست؟) Spaces فعال‌سازی Hugging Face Spaces (Spaces چیست؟) Spaces فعال‌سازی TXYZ.AI (TXYZ.AI چیست؟) ابزارهای پیشنهاد مقالات مرتبط و جستجو لینک به Influence Flower Influence Flower (تأثیرگذاری گل چیست؟) فعال/غیرفعال کننده پیشنهادگر اصلی پیشنهادگر CORE (CORE چیست؟) نویسنده | مکان | نهاد | موضوع درباره arXivLabs arXivLabs: پروژه‌های آزمایشی با همکاران جامعه arXivLabs یک چارچوب است که به همکاران اجازه می‌دهد ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه دهند و به اشتراک بگذارند. هم افراد و هم سازمان‌هایی که با arXivLabs کار می‌کنند، ارزش‌های ما شامل انفتادگی، جامعه، عالی‌بودن، و حریم خصوصی داده کاربران را پذیرفته و در بر گرفته‌اند. arXiv به این ارزش‌ها متعهد است و فقط با شرکایی کار می‌کند که از آنها پیروی می‌کنند. ایده‌ای برای پروژه‌ای دارید که ارزشی به جامعه arXiv اضافه کند؟ بیشتر درباره arXivLabs بیشتر بدانید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)