arXiv:2609.17509ترجمه شده

LACE: فشرده‌سازی لایه‌به‌لایه برای کدک‌های نرخ فریم پویا

Thanapat Trachu، Samuele Cornell، William Chen، Shinji Watanabe

چکیده

کدک‌های صوتی عصبی، از اجزای کلیدی در مدل‌سازی زبان گفتار هستند. با این حال، نرخ فریم بالای آن‌ها منجر به افزایش طول دنباله‌ها و هزینه محاسباتی می‌شود. کدک‌های نرخ فریم پویا این مشکل را از طریق یک مرحله فشرده‌سازی مؤثر کاهش می‌دهند که به‌صورت مؤثر نرخ فریم را کاهش داده و چندین فریم را ادغام می‌کند. با این حال، اکثر روش‌های پیشین یا روی کدک‌های تک‌کتابچه‌ای (single-codebook codecs) کار می‌کنند یا یک مرحله فشرده‌سازی واحد را قبل از کمیت‌سازی چندلایه (multi-layer quantization) اعمال می‌کنند. این بدان معناست که تمام لایه‌های کمیت‌سازی مرزهای بخش‌بندی یکسانی را به اشتراک می‌گذارند، هرچند جاسازی‌های باقی‌مانده (residual embeddings) در لایه‌های مختلف کمیت‌سازی، نرخ‌های متفاوتی از تغییر در طول زمان را نشان می‌دهند. ما LACE (کدگذاری سازگار با لایه: Layer-Adaptive Codec Encoding) را پیشنهاد می‌کنیم؛ یک کدک نرخ فریم پویا که در هر لایه کمیت‌سازی، یک مرحله فشرده‌سازی مستقل اعمال می‌کند و مرزهای بخش‌بندی ویژه هر لایه را فراهم می‌سازد. برای استفاده از نشانه‌های LACE در وظیفه تبدیل متن به گفتار (TTS) بعدی، ما همچنین مکانیزم‌های هماهنگی اتحاد (union alignment) و تکیه‌گاه‌های مرزی (boundary anchor) را معرفی می‌کنیم تا مدت‌های زمانی را در تمام لایه‌ها هماهنگ کنیم و در عین حال مزایای فشرده‌سازی حفظ شود. آزمایشات روی LibriTTS نشان می‌دهد که LACE نسبت به روش‌های پیشین نرخ فریم پویا، بهترین تعادل بین نرخ و کیفیت (rate-quality tradeoff) را در وظیفه بازسازی ارائه می‌دهد و کارایی استنتاج TTS را بهبود می‌بخشد، در حالی که کیفیت سنتز رقابتی حفظ می‌شود. کد ما به‌عنوان بخشی از دستورالعمل کدک ESPnet3 (ESPnet3 codec recipe) منتشر شده است.

متن کامل

عنوان: LACE: فشرده‌سازی لایه‌ای برای کدک‌های نرخ فریم پویا نویسندگان: تاناتاپ تراچو، ساموئل کورنل، ویلیام چن، شینجی واتانابه مشاهده فایل PDF مقاله با عنوان "LACE: فشرده‌سازی لایه‌ای برای کدک‌های نرخ فریم پویا" نوشته تاناتاپ تراچو و سه نویسنده دیگر مشاهده فایل PDF HTML (آزمایشی) خلاصه: کدک‌های صوتی عصبی، جزء کلیدی در مدل‌سازی زبان گفتار هستند. با این حال، نرخ فریم بالای آنها باعث افزایش طول دنباله‌ها و هزینه‌های محاسباتی می‌شود. کدک‌های نرخ فریم پویا با کاهش نرخ فریم مؤثر از طریق یک مرحله فشرده‌سازی برای ادغام چندین فریم، این مشکل را برطرف می‌کنند. اما اکثر روش‌های قبلی یا روی کدک‌های تک‌کتابخانه‌ای کار می‌کنند یا یک مرحله فشرده‌سازی واحد قبل از کوانتیزه‌سازی چندلایه اعمال می‌کنند. این امر باعث می‌شود که تمام لایه‌های کوانتیزه‌سازی از یک مرز تقسیم‌بندی مشترک استفاده کنند، در حالی که فروکش‌های باقیمانده در لایه‌های مختلف کوانتیزه‌سازی، نرخ‌های تغییر متفاوتی در طول زمان نشان می‌دهند. ما LACE (کدگذاری کدک سازگار با لایه) را پیشنهاد می‌کنیم، یک کدک نرخ فریم پویا که یک مرحله فشرده‌سازی مستقل در هر لایه کوانتیزه‌سازی اعمال می‌کند و به مرزهای تقسیم‌بندی اختصاصی هر لایه امکان‌پذیر می‌سازد. برای استفاده از توکن‌های LACE در تولید گفتار از متن (TTS) در مراحل پایین‌تر، ما همچنین مکانیزم‌های ترازی اتحادیه‌ای و نقطه مرجع مرزی را معرفی می‌کنیم تا مدت‌ها در سراسر لایه‌ها یکسان‌سازی شوند، در حالی که مزایای فشرده‌سازی حفظ می‌شود. آزمایش‌ها روی LibriTTS نشان می‌دهند که LACE نسبت به روش‌های قبلی نرخ فریم پویا در وظیفه بازسازی تعادل بهتری بین نرخ و کیفیت ارائه می‌دهد و کارایی استنتاج TTS را بهبود می‌بخشد، در حالی که کیفیت سنتز رقابتی حفظ می‌شود. کد ما به عنوان بخشی از دستورالعمل کدک ESPnet3 منتشر شده است. نکات: موضوعات: صدا (cs.SD); هوش مصنوعی (cs.AI); محاسبات و زبان (cs.CL) ارجاع: arXiv:2609.17509 [cs.SD] (یا arXiv:2609.17509v1 [cs.SD] برای این نسخه) برای اطلاعات بیشتر: https://doi.org/10.48550/arXiv.2609.17509 DOI صادرشده توسط arXiv از طریق DataCite (ثبت در انتظار است) تاریخ ارسال: تاناتاپ تراچو [مشاهده ایمیل] [v1] سه‌شنبه، ۱۵ سپتامبر ۲۰۲۶ ۱۷:۴۶:۵۱ UTC (۲۹۳ کیلوبایت) ابزارهای بیبلیوگرافیک: ابزارهای بیبلیوگرافیک و ارجاع‌دهی مرورگر بیبلیوگرافیک (چیستی است مرورگر؟) مقالات مرتبط (چیستی است مقالات مرتبط؟) Litmaps (چیستی است Litmaps؟) scite.ai (چیستی است استنادهای هوشمند scite؟) کد، داده، رسانه: کد، داده و رسانه مرتبط با این مقاله alphaXiv (چیستی است alphaXiv؟) پیوندهای کد: CatalyzeX Code Finder for Papers (چیستی است CatalyzeX؟) DagsHub (چیستی است DagsHub؟) GotitPub (چیستی است Gotit.pub؟) Huggingface (چیستی است Hugging Face؟) ScienceCast (چیستی است ScienceCast؟) نمونه‌ها: Replicate (چیستی است Replicate؟) Spaces (چیستی است Hugging Face Spaces؟) Spaces TXYZ.AI (چیستی است TXYZ.AI؟) مقالات مرتبط: توصیه‌کننده‌ها و ابزارهای جستجو پیوند به گل‌های تأثیرگذار (چه هستند؟) کلید توصیه‌کننده اصلی CORE (CORE چیست؟) نویسنده مکان نهاد موضوع درباره arXivLabs arXivLabs: پروژه‌های آزمایشی با همکاری جامعه arXivLabs یک پلتفرم است که به همکاران امکان می‌دهد ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه دهند و به اشتراک بگذارند. هم افراد و هم سازمان‌هایی که با arXivLabs همکاری می‌کنند، به ارزش‌های بازبودن، جامعه‌محوری، برتری و حریم خصوصی داده‌های کاربران پایبند هستند. arXiv به این ارزش‌ها متعهد است و تنها با شرکایی همکاری می‌کند که به آنها پایبند باشند. آیا ایده‌ای برای پروژه‌ای دارید که برای جامعه arXiv ارزش افزوده ایجاد کند؟ بیشتر در مورد arXivLabs بدانید. کدام یک از نویسندگان این مقاله تأییدکننده هستند؟ | MathJax را غیرفعال کنید (MathJax چیست؟)