arXiv:2609.04190ترجمه شده

یک ویرایشگر، ویرایش‌های متعدد: یک چارچوب یکپارچه بدون نیاز به آموزش برای ویرایش متنوع ویدیو

Adheesh Sunil Juvekar، Onkar Kishor Susladkar، Kiet A. Nguyen، Muntasir Wahed، Nabeel Bashir، Xiaona Zhou، Tianjiao Yu، Vedant Shah، Ismini Lourentzou

چکیده

ویرایش ویدئو شامل طیف گسترده‌ای از روش‌ها است؛ اما دستیابی به ویرایش با کیفیت بالا مبتنی بر دستورالعمل یا موضوع در یک چارچوب واحد و یکپارچه همچنان چالش‌برانگیز است. ما EditVid را معرفی می‌کنیم؛ چارچوبی بدون نیاز به آموزش که از حافظهٔ علّی پراکنده برای انسجام محلی، تزریق توکن پس از توجه مبتنی بر تطابق برای حفظ هویت در دامنه‌های طولانی و ترکیب نرم لایه‌های پنهان برای محلی‌سازی ویرایش استفاده می‌کند. این چارچوب واحد، همهٔ ویرایش‌های مبتنی بر دستورالعمل و مرجع را پشتیبانی می‌کند؛ از جمله انتقال سبک، تغییر ویژگی‌ها، درج اشیاء، ویرایش سطح قطعات و جایگزینی موضوع. در FiVE، EditVid به ۷۸.۱۶ FiVE‑Acc دست می‌یابد، در حالی که بهترین خط پایه بدون آموزش ارزیابی‌شده ۵۸.۹۵ است. همچنین، مدل نتایج رقابتی‌ای در IVEBench به‌دست می‌آورد. یک مطالعه کاربری نشان می‌دهد که ۵۱.۸ درصد از کاربران EditVid را نسبت به هفت روش رقیب ترجیح می‌دهند.