چکیده
ویرایش ویدئو شامل طیف گستردهای از روشها است؛ اما دستیابی به ویرایش با کیفیت بالا مبتنی بر دستورالعمل یا موضوع در یک چارچوب واحد و یکپارچه همچنان چالشبرانگیز است. ما EditVid را معرفی میکنیم؛ چارچوبی بدون نیاز به آموزش که از حافظهٔ علّی پراکنده برای انسجام محلی، تزریق توکن پس از توجه مبتنی بر تطابق برای حفظ هویت در دامنههای طولانی و ترکیب نرم لایههای پنهان برای محلیسازی ویرایش استفاده میکند. این چارچوب واحد، همهٔ ویرایشهای مبتنی بر دستورالعمل و مرجع را پشتیبانی میکند؛ از جمله انتقال سبک، تغییر ویژگیها، درج اشیاء، ویرایش سطح قطعات و جایگزینی موضوع. در FiVE، EditVid به ۷۸.۱۶ FiVE‑Acc دست مییابد، در حالی که بهترین خط پایه بدون آموزش ارزیابیشده ۵۸.۹۵ است. همچنین، مدل نتایج رقابتیای در IVEBench بهدست میآورد. یک مطالعه کاربری نشان میدهد که ۵۱.۸ درصد از کاربران EditVid را نسبت به هفت روش رقیب ترجیح میدهند.