چکیده
کدکهای صوتی عصبی، از اجزای کلیدی در مدلسازی زبان گفتار هستند. با این حال، نرخ فریم بالای آنها منجر به افزایش طول دنبالهها و هزینه محاسباتی میشود. کدکهای نرخ فریم پویا این مشکل را از طریق یک مرحله فشردهسازی مؤثر کاهش میدهند که بهصورت مؤثر نرخ فریم را کاهش داده و چندین فریم را ادغام میکند. با این حال، اکثر روشهای پیشین یا روی کدکهای تککتابچهای (single-codebook codecs) کار میکنند یا یک مرحله فشردهسازی واحد را قبل از کمیتسازی چندلایه (multi-layer quantization) اعمال میکنند. این بدان معناست که تمام لایههای کمیتسازی مرزهای بخشبندی یکسانی را به اشتراک میگذارند، هرچند جاسازیهای باقیمانده (residual embeddings) در لایههای مختلف کمیتسازی، نرخهای متفاوتی از تغییر در طول زمان را نشان میدهند.
ما LACE (کدگذاری سازگار با لایه: Layer-Adaptive Codec Encoding) را پیشنهاد میکنیم؛ یک کدک نرخ فریم پویا که در هر لایه کمیتسازی، یک مرحله فشردهسازی مستقل اعمال میکند و مرزهای بخشبندی ویژه هر لایه را فراهم میسازد. برای استفاده از نشانههای LACE در وظیفه تبدیل متن به گفتار (TTS) بعدی، ما همچنین مکانیزمهای هماهنگی اتحاد (union alignment) و تکیهگاههای مرزی (boundary anchor) را معرفی میکنیم تا مدتهای زمانی را در تمام لایهها هماهنگ کنیم و در عین حال مزایای فشردهسازی حفظ شود. آزمایشات روی LibriTTS نشان میدهد که LACE نسبت به روشهای پیشین نرخ فریم پویا، بهترین تعادل بین نرخ و کیفیت (rate-quality tradeoff) را در وظیفه بازسازی ارائه میدهد و کارایی استنتاج TTS را بهبود میبخشد، در حالی که کیفیت سنتز رقابتی حفظ میشود. کد ما بهعنوان بخشی از دستورالعمل کدک ESPnet3 (ESPnet3 codec recipe) منتشر شده است.
متن کامل
عنوان: LACE: فشردهسازی لایهای برای کدکهای نرخ فریم پویا
نویسندگان: تاناتاپ تراچو، ساموئل کورنل، ویلیام چن، شینجی واتانابه
مشاهده فایل PDF مقاله با عنوان "LACE: فشردهسازی لایهای برای کدکهای نرخ فریم پویا" نوشته تاناتاپ تراچو و سه نویسنده دیگر
مشاهده فایل PDF HTML (آزمایشی)
خلاصه: کدکهای صوتی عصبی، جزء کلیدی در مدلسازی زبان گفتار هستند. با این حال، نرخ فریم بالای آنها باعث افزایش طول دنبالهها و هزینههای محاسباتی میشود. کدکهای نرخ فریم پویا با کاهش نرخ فریم مؤثر از طریق یک مرحله فشردهسازی برای ادغام چندین فریم، این مشکل را برطرف میکنند. اما اکثر روشهای قبلی یا روی کدکهای تککتابخانهای کار میکنند یا یک مرحله فشردهسازی واحد قبل از کوانتیزهسازی چندلایه اعمال میکنند. این امر باعث میشود که تمام لایههای کوانتیزهسازی از یک مرز تقسیمبندی مشترک استفاده کنند، در حالی که فروکشهای باقیمانده در لایههای مختلف کوانتیزهسازی، نرخهای تغییر متفاوتی در طول زمان نشان میدهند. ما LACE (کدگذاری کدک سازگار با لایه) را پیشنهاد میکنیم، یک کدک نرخ فریم پویا که یک مرحله فشردهسازی مستقل در هر لایه کوانتیزهسازی اعمال میکند و به مرزهای تقسیمبندی اختصاصی هر لایه امکانپذیر میسازد. برای استفاده از توکنهای LACE در تولید گفتار از متن (TTS) در مراحل پایینتر، ما همچنین مکانیزمهای ترازی اتحادیهای و نقطه مرجع مرزی را معرفی میکنیم تا مدتها در سراسر لایهها یکسانسازی شوند، در حالی که مزایای فشردهسازی حفظ میشود. آزمایشها روی LibriTTS نشان میدهند که LACE نسبت به روشهای قبلی نرخ فریم پویا در وظیفه بازسازی تعادل بهتری بین نرخ و کیفیت ارائه میدهد و کارایی استنتاج TTS را بهبود میبخشد، در حالی که کیفیت سنتز رقابتی حفظ میشود. کد ما به عنوان بخشی از دستورالعمل کدک ESPnet3 منتشر شده است.
نکات: موضوعات: صدا (cs.SD); هوش مصنوعی (cs.AI); محاسبات و زبان (cs.CL)
ارجاع: arXiv:2609.17509 [cs.SD] (یا arXiv:2609.17509v1 [cs.SD] برای این نسخه)
برای اطلاعات بیشتر: https://doi.org/10.48550/arXiv.2609.17509
DOI صادرشده توسط arXiv از طریق DataCite (ثبت در انتظار است)
تاریخ ارسال: تاناتاپ تراچو [مشاهده ایمیل] [v1] سهشنبه، ۱۵ سپتامبر ۲۰۲۶ ۱۷:۴۶:۵۱ UTC (۲۹۳ کیلوبایت)
ابزارهای بیبلیوگرافیک: ابزارهای بیبلیوگرافیک و ارجاعدهی مرورگر بیبلیوگرافیک (چیستی است مرورگر؟) مقالات مرتبط (چیستی است مقالات مرتبط؟) Litmaps (چیستی است Litmaps؟) scite.ai (چیستی است استنادهای هوشمند scite؟)
کد، داده، رسانه: کد، داده و رسانه مرتبط با این مقاله alphaXiv (چیستی است alphaXiv؟)
پیوندهای کد: CatalyzeX Code Finder for Papers (چیستی است CatalyzeX؟) DagsHub (چیستی است DagsHub؟) GotitPub (چیستی است Gotit.pub؟) Huggingface (چیستی است Hugging Face؟) ScienceCast (چیستی است ScienceCast؟)
نمونهها: Replicate (چیستی است Replicate؟) Spaces (چیستی است Hugging Face Spaces؟) Spaces TXYZ.AI (چیستی است TXYZ.AI؟)
مقالات مرتبط: توصیهکنندهها و ابزارهای جستجو پیوند به
گلهای تأثیرگذار (چه هستند؟) کلید توصیهکننده اصلی CORE (CORE چیست؟) نویسنده مکان نهاد موضوع درباره arXivLabs arXivLabs: پروژههای آزمایشی با همکاری جامعه arXivLabs یک پلتفرم است که به همکاران امکان میدهد ویژگیهای جدید arXiv را مستقیماً در وبسایت ما توسعه دهند و به اشتراک بگذارند. هم افراد و هم سازمانهایی که با arXivLabs همکاری میکنند، به ارزشهای بازبودن، جامعهمحوری، برتری و حریم خصوصی دادههای کاربران پایبند هستند. arXiv به این ارزشها متعهد است و تنها با شرکایی همکاری میکند که به آنها پایبند باشند. آیا ایدهای برای پروژهای دارید که برای جامعه arXiv ارزش افزوده ایجاد کند؟ بیشتر در مورد arXivLabs بدانید. کدام یک از نویسندگان این مقاله تأییدکننده هستند؟ | MathJax را غیرفعال کنید (MathJax چیست؟)