چکیده
مدلسازی اشیای مفصلی از روی مجموعهای تنک از تصاویر تکچشمی دشوار است، زیرا هر مشاهده تنها بخش کوچکی از شواهد مربوط به هندسه و حرکت را آشکار میکند. بیشتر روشهای پیشرو مفصلبندی را از روی یک مشاهده واحد استنتاج میکنند و، ازاینرو، بهشدت به پیشفرضهای شکلِ آموختهشده در سطح مقوله وابستهاند. ما FAMOS را معرفی میکنیم؛ مدلی پیشرو که بخشبندی اجزای متحرک و پارامترهای مفصل را از ابرنقاط جزئیِ تنک و نامرتب پیشبینی میکند. مدل ما بهطور مشترک بر چندین مشاهده استدلال میکند و بهصورت طبیعی با تعداد متغیری از ورودیها، حتی تنها یک دید، سازگار است. برای ادغام سرنخهای مفصلبندی در سراسر مشاهدهها، ترانسفورمر مفصلبندی چندحالتیای با الگوهای متناوب توجه محلی و سراسری معرفی میکنیم. همچنین، تابع هدفِ گسترهٔ مفصلبندیِ مشاهدهشده را پیشنهاد میدهیم که بر بازهٔ حرکتی هر جزء در مشاهدههای ورودی نظارت اعمال میکند و مدل را به بهرهگیری از تمام مشاهدههای موجود ترغیب میسازد. برای غلبه بر محدودیتهای مقیاس و تنوع در مجموعهدادههای موجود، مولد دادهای رویهای معرفی میکنیم که در طول آموزش، داراییهای خود-برچسبگذاریشده را بهصورت مصنوعی تولید میکند. آزمایشها روی PartNet-Mobility، ACD و ArtiCraft-10K بهبودهای پایدار نسبت به خطوط مبنای پیشرو و نیز خطوط مبنای مبتنی بر بهینهسازی را نشان میدهند. صفحه پروژه: https://kevinqu7.github.io/famos
متن کامل
کامپیوترسازی > بینایی ماشین و تشخیص الگو arXiv:2609.20817v1 (cs) [ارائهشده در ۱۷ سپتامبر ۲۰۲۶] عنوان: FAMOS: مدلسازی پیشخور مفصلی سهبعدی از مشاهدات اسپارس نویسندگان: Kevin Qu, Tao Sun, Massimiliano Viola, Liyuan Zhu, Zhizhuo Zhou, Sayan Deb Sarkar, Konrad Schindler, Iro Armeni مشاهده PDF مقاله با عنوان FAMOS: مدلسازی پیشخور مفصلی سهبعدی از مشاهدات اسپارس نویسندگان: Kevin Qu و ۷ نویسنده دیگر مشاهده PDF HTML (آزمایشی) چکیده:مدلسازی اشیاء مفصلی از دیدگاههای تکساختار اسپارس به دلیل آنکه هر مشاهده فقط هندسه و شواهد حرکتی جزئی را آشکار میکند، چالشبرانگیز است. اکثر روشهای پیشخور، مفصلیسازی را از یک مشاهده استنتاج میکنند و بنابراین به شدت به پیشنیازهای شکل سطحی یادگرفتهشده وابستهاند. ما FAMOS را ارائه میدهیم، یک مدل پیشخور که تقسیمبندی اجزای متحرک و پارامترهای مفصلی را از یک مجموعه اسپارس و نامرتب از ابرنقاط جزئی پیشبینی میکند. مدل ما بهصورت مشترک بر روی چندین مشاهده استدلال میکند و بهطور طبیعی تعداد متغیری از ورودیها را پشتیبانی میکند، از جمله یک دیدگاه تکی. برای تجمیع نشانههای مفصلیسازی در سراسر مشاهدات، ما یک ترنسفورمر مفصلی چندحالتی با توجه متناوب سطحی و کلی معرفی میکنیم. علاوه بر این، ما یک هدف برد مفصلی مشاهدهشده پیشنهاد میدهیم که محدوده حرکتی نمایشدادهشده توسط هر جزء در طول مشاهدات ورودی را نظارت میکند و مدل را تشویق میکند از کل مجموعه مشاهدات بهرهمند شود. برای غلبه بر مقیاس و تنوع محدود مجموعهدادههای موجود، ما یک تولیدکننده داده رویهای معرفی میکنیم که در طول آموزش، داراییهای خود-برچسبگذاریشده را ترکیب میکند. آزمایشها روی PartNet-Mobility، ACD و ArtiCraft-10K بهبودهای ثابتی نسبت به خطوط پایه پیشخور و مبتنی بر بهینهسازی را نشان میدهد. صفحه پروژه: این URL نظرها: دستهبندیها: بینایی ماشین و تشخیص الگو (cs.CV)؛ هوش مصنوعی (cs.AI)؛ رباتیک (cs.RO) استناد به: arXiv:2609.20817 [cs.CV] (یا arXiv:2609.20817v1 [cs.CV] برای این نسخه) https://doi.org/10.48550/arXiv.2609.20817 تمرکز برای بیشتر یادگیری DOI صادرشده توسط arXiv از طریق DataCite (ثبت آن در حال انجام است) تاریخچه ارسال از: Kevin Qu [مشاهده ایمیل] [v1] پنجشنبه، ۱۷ سپتامبر ۲۰۲۶ ۱۷:۵۹:۴۰ UTC (۵,۵۹۵ کیلوبایت) ابزارهای بیبلیوگرافیک ابزارهای بیبلیوگرافیک و استنادی بیبلیوگرافیک اکسپلورر فعالسازی بیبلیوگرافیک اکسپلورر (بیبلیوگرافیک اکسپلورر چیست؟) Connected Papers فعالسازی Connected Papers (Connected Papers چیست؟) Litmaps فعالسازی Litmaps (Litmaps چیست؟) scite.ai فعالسازی scite Smart Citations (استیتهای هوشمند چیست؟) کد، داده، رسانه کد، داده و رسانه مرتبط با این مقاله alphaXiv فعالسازی alphaXiv (alphaXiv چیست؟) لینکهای کد فعالسازی CatalyzeX Code Finder for Papers (CatalyzeX Code Finder for Papers چیست؟) DagsHub فعالسازی DagsHub (DagsHub چیست؟) GotitPub فعالسازی Gotit.pub (Gotit.pub چیست؟) Huggingface فعالسازی Hugging Face (Huggingface چیست؟) ScienceCast فعالسازی ScienceCast (ScienceCast چیست؟) نمایشها نمایشها Replicate فعالسازی Replicate (Replicate چیست؟) Spaces فعالسازی Hugging Face Spaces (Spaces چیست؟) Spaces فعالسازی TXYZ.AI (TXYZ.AI چیست؟)
ابزارهای پیشنهاد مقالات مرتبط و جستجو
لینک به Influence Flower
Influence Flower (تأثیرگذاری گل چیست؟)
فعال/غیرفعال کننده پیشنهادگر اصلی
پیشنهادگر CORE (CORE چیست؟)
نویسنده | مکان | نهاد | موضوع
درباره arXivLabs
arXivLabs: پروژههای آزمایشی با همکاران جامعه
arXivLabs یک چارچوب است که به همکاران اجازه میدهد ویژگیهای جدید arXiv را مستقیماً در وبسایت ما توسعه دهند و به اشتراک بگذارند. هم افراد و هم سازمانهایی که با arXivLabs کار میکنند، ارزشهای ما شامل انفتادگی، جامعه، عالیبودن، و حریم خصوصی داده کاربران را پذیرفته و در بر گرفتهاند. arXiv به این ارزشها متعهد است و فقط با شرکایی کار میکند که از آنها پیروی میکنند. ایدهای برای پروژهای دارید که ارزشی به جامعه arXiv اضافه کند؟ بیشتر درباره arXivLabs بیشتر بدانید.
کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)