arXiv:2608.28549ترجمه شده

User Safety: safe

Haosen Yang، Jifei Song، Zhensong Zhang، Xiatian Zhu، Jiankang Deng

چکیده

رویکردهای ژنراتور اخیر برای تخمین هندسه، مدل‌های دیفوزن تصویر پیش‌آموزش‌دیده را تنظیم می‌کنند و وظیفه را به‌عنوان تولید مشروط به تصویر در نظر می‌گیرند. با استفاده از مدل‌های دیفوزن تصویر آماده‌استفاده، آن‌ها یا (i) به‌صورت مستقل مدل‌های هندسه مخصوص وظیفه (برای تخمین عمق و نرمال سطح) آموزش می‌دهند، که در نتیجه امکان کاوش رابطه درونی (intrinsics) این اهداف هندسی را از دست می‌دهند، یا (ii) لایه‌های داخلی مدل‌های دیفوزن تصویر تغییر یافته (مثلاً مکانیسم خود-attention تغییر یافته) را به‌صورت مشترک fine‑tune می‌کنند، که معمولاً نیاز به داده‌های برچسب‌دار قابل توجهی دارد. برای رفع این محدودیت‌ها به‌صورت اصولی (principled)، ما مدل‌های ژنراتور ویدیویی پیش‌آموزش‌دیده را به‌عنوان یک چارچوب یکپارچه و کارآمد از نظر داده برای تخمین هندسه reuse می‌کنیم، که به‌صورت نوآورانه آن را به وظیفه پیش‌بینی فریم‌های آینده تعریف می‌کنیم. روش ما، GeoNeXt، به‌طور طبیعی دانش ساختاری و پیش‌رض‌های غنی‌تری از مدل ویدیویی به ارث می‌برد و همزمان (simultaneously) آن‌ها را برای مدل‌سازی مشترک تصویر و اهداف هندسی (تصویر ↔ هندس) تنظیم می‌کند، که یادگیری کارآمد و مؤثرتر از نظر داده برای هندسه را امکان‌پذیر می‌سازد. آزمایش‌های گستردهٔ ما روش را برای تخمین عمق مونوکولار zero-shot و نرمال سطح در دیتاست‌های متنوع تأیید می‌کند، که در مقابل رقبای پیشین مخصوص وظیفه و ژنراتورهای یکپارچه، با استفاده از داده‌های آموزشی بسیار کمتر، عملکرد بهتری نشان می‌دهد. به‌طور ملحوظ، روش ما با رویکردهای پیشرفته (state-of-the-art) که بر روی داده‌های بیش از ۱۰۰ برابر بیشتر آموزش دیده‌اند، رقابت می‌کند و در چندین بنچمارک حتی برتری نشان می‌دهد.

متن کامل

علوم کامپیوتر > بینایی ماشین و شناسایی الگو arXiv:2608.28549v1 [cs.CV] [تاریخ ارسال: ۲۸ اوت ۲۰۲۶] **عنوان:** مدل‌های تولیدی ویدیو به عنوان یادگیرنده هندسی **نویسندگان:** هاوسن یانگ، جیفه سونگ، زچنسون زهرانگ، شیاتان زهو، جانیکانگ دنگ **چکیده:** رویکردهای اخیر مبتنی بر تولید برای تخمین هندسی، از مدل‌های از پیش آموزش‌دیده انتشاری (diffusion) تصویری استفاده می‌کنند و این وظیفه را به عنوان یک کار تولید تصویری مطرح می‌سازند. با بهره‌گیری از این مدل‌های تصویری آماده، پژوهش‌های پیشین یا (۱) مدل‌های هندسی ویژه وظیفه (برای تخمین عمق و نرمال سطح) را به طور مستقل آموزش می‌دهند و در نتیجه فرصت کاوش در ارتباط ذاتی میان این اهداف هندسی را از دست می‌دهند، یا (۲) پس‌پردازشی مشترک روی مدل‌های پایه تصویری اصلاح‌شده (مانند ترانسفورمر خودتبدیل‌گر) انجام می‌دهند که معمولاً نیازمند داده‌های برچسب‌گذاری‌شده گسترده‌ای هستند. برای غلبه بر این محدودیت‌ها به شیوه‌ای بدیع، ما مدل‌های تولیدی ویدیو از پیش آموزش‌دیده را به عنوان چارچوبی یکپارچه و کارآمد برای تخمین هندسی بازاستفاده می‌کنیم. در این رویکرد، وظیفه تخمین هندسی به صورت نوآورانه‌ای به عنوان پیش‌بینی فریم‌های بعدی فرمول‌بندی شده است. روش پیشنهادی ما، GeoNeXt، از طریق برخورداری از دانش ساختاریافته و پیش‌فرض‌های غنی‌تر مدل ویدیو، امکان یادگیری هندسی کارآمدتر و مؤثرتر را فراهم می‌سازد. همچنین، با تطبیق این دانش برای مدل‌سازی یکپارچه تصاویر و اهداف هندسی (تصویر ↔ هندسه)، عملکرد بهتری حاصل می‌شود. آزمایش‌های گسترده نشان می‌دهند که روش ما برای تخمین عمق و نرمال سطح تک‌نما در مجموعه‌های داده مختلف، به صورت انتقالی (zero-shot) عملکرد برتری نسبت به رقبای پیشین، شامل مدل‌های تخصصی وظیفه و مدل‌های تولیدی یکپارچه، ارائه می‌دهد. نکته قابل توجه این است که روش ما از داده‌های آموزشی بسیار کمتری استفاده می‌کند. به‌طور شگفت‌انگیزی، روش ما با رویکردهای پیشرفته مبتنی بر طبقه‌بندی‌کننده که بیش از ۱۰۰ برابر داده بیشتری داشته‌اند، به همان سطح عملکرد دست می‌یابد و حتی در چندین معیار ارزیابی برتری قابل‌توجهی نشان می‌دهد. **موضوعات:** بینایی ماشین و شناسایی الگو (cs.CV)؛ هوش مصنوعی (cs.AI) **برای ارجاع به این مقاله:** arXiv:2608.28549 [cs.CV] (یا arXiv:2608.28549v1 [cs.CV] برای این نسخه) https://doi.org/10.48550/arXiv.2608.28549