arXiv:2609.19145ترجمه شده

هدف در برابر جستجو: تجزیه و تحلیل ویژگی‌های یک توکنیزر خوب

Ahmetcan Yavuz، Clara Meister، Tiago Pimentel

چکیده

متن فارسی که می‌خواهید بهبود یابد را ارسال کنید تا آن را ویرایش کنم.

متن کامل

علوم کامپیوتر > محاسبه و زبان arXiv:2609.19145v1 [cs] [تاریخ ارسال: ۱۶ سپتامبر ۲۰۲۶] عنوان: هدف در برابر جستجو: بررسی عوامل کلیدی در طراحی یک توکنیزر مؤثر نویسندگان: احمدچمن یاووز، کلارا میستر، تیاگو پیمانتل نمایش PDF مقاله با عنوان «هدف در برابر جستجو: بررسی عوامل کلیدی در طراحی یک توکنیزر مؤثر» نوشته احمدچمن یاووز و دو نویسنده دیگر. نمایش PDF HTML (آزمایشی) چکیده: دو الگوریتم اصلی توکنیزاسیون که توسط مدل‌های زبانی مدرن استفاده می‌شوند، رمزنگاری بایت-به-بایت (BPE) و UnigramLM هستند. این الگوریتم‌ها در دو بعد متفاوت از هم متمایز می‌شوند: هدف بهینه‌سازی (فشرده‌سازی در برابر لگ-احتمال) و روش جستجو (ادغام از پایین به بالا در برابر حذف از بالا به پایین). مقایسه‌های موجود، این دو بعد را به طور همزمان در نظر می‌گیرند، که باعث می‌شود مشخص نشود که آیا تفاوت‌های مشاهده شده ناشی از هدف بهینه‌سازی یا روش آن است. ما با معرفی دو الگوریتم توکنیزاسیون جدید که این فضای طراحی ۲×۲ را تکمیل می‌کنند، این دو را از هم جدا می‌کنیم: BottomUpLL، یک توکنیزر لگ-احتمالی از پایین به بالا، و TopDownComp، یک توکنیزر فشرده‌سازی از بالا به پایین. ما مدل‌های زبانی را با توکنیزرهای تولید شده توسط هر الگوریتم آموزش می‌دهیم و متغیرهای زیر را تغییر می‌دهیم: اندازه مدل، اندازه واژگان، و حوزه (انگلیسی-تنها در برابر چندزبانه). ارزیابی مدل‌ها بر اساس بیت-در-هر-بایت نشان می‌دهد که روش جستجو — نه هدف — عامل غالب است: توکنیزرهای از پایین به بالا در اکثر تنظیمات، بیت-در-هر-بایت پایین‌تری دارند. با این حال، ارزیابی مدل‌ها بر روی وظیفه BLiMP هیچ رابطه سازگاری بین انتخاب طراحی و عملکرد نشان نمی‌دهد. به طور کلی، نتایج ما تأثیر انتخاب‌های طراحی توکنیزر بر عملکرد مدل‌های زبانی را از هم جدا می‌کنند و راهنمایی‌های عملی برای طراحی اصولی آن‌ها ارائه می‌دهند. نظرات: موضوعات: محاسبه و زبان (cs.CL); هوش مصنوعی (cs.AI) ارجاع به عنوان: arXiv:2609.19145 [cs.CL] (یا arXiv:2609.19145v1 [cs.CL] برای این نسخه) https://doi.org/10.48550/arXiv.2609.19145 برای کسب اطلاعات بیشتر در مورد DOI منتشر شده توسط arXiv از طریق DataCite (ثبت در حال انجام) تاریخچه ارسال: از: احمدچمن یاووز [نمایش ایمیل] [v1] چهارشنبه، ۱۶ سپتامبر ۲۰۲۶ ۱۷:۵۹:۴۵ UTC (۱۳۲ کیلوبایت) ابزارهای کتاب‌شناسی ابزارهای کتاب‌شناسی و ارجاع کاوشگر کتاب‌شناسی فعال/غیرفعال کردن کاوشگر کتاب‌شناسی (کاوشگر چیست؟) مقالات مرتبط فعال/غیرفعال کردن مقالات مرتبط (مقالات مرتبط چیست؟) Litmaps فعال/غیرفعال کردن Litmaps (Litmaps چیست؟) scite.ai فعال/غیرفعال کردن استنادها هوشمند scite (استنادها هوشمند چیست؟) کد، داده، رسانه کد، داده و رسانه مرتبط با این مقاله alphaXiv فعال/غیرفعال کردن alphaXiv (alphaXiv چیست؟) لینک به کد فعال/غیرفعال کردن یابنده کد CatalyzeX برای مقالات (CatalyzeX چیست؟) DagsHub فعال/غیرفعال کردن DagsHub (DagsHub چیست؟) GotitPub فعال/غیرفعال کردن Gotit.pub (GotitPub چیست؟) Huggingface فعال/غیرفعال کردن Hugging Face (Huggingface چیست؟) ScienceCast فعال/غیرفعال کردن ScienceCast (ScienceCast چیست؟) دموها Demos Replicate فعال/غیرفعال کردن Replicate (Replicate چیست؟) Spaces فعال/غیرفعال کردن فضاهای Hugging Face (Spaces چیست؟) فضاهای TXYZ.AI فعال/غیرفعال کردن فضاهای TXYZ.AI (TXYZ.AI چیست؟) مقالات مرتبط پیشنهاددهندگان و ابزارهای جستجو لینک به تأثیرگذاری Flower Influence Flowe ر (تأثیر گل‌ها چیست؟) | کلید تغییر وضعیت توصیه‌گر اصلی | توصیه‌گر CORE (CORE چیست؟) | نویسنده | محل انتشار | مؤسسه | موضوع | درباره arXivLabs arXivLabs: پروژه‌های آزمایشی با مشارکت جامعه arXivLabs یک چارچوب است که به مشارکت‌کنندگان اجازه می‌دهد ویژگی‌های جدید arXiv را مستقیماً روی وب‌سایت ما توسعه دهند و به اشتراک بگذارند. با این حال، افرادی و سازمان‌هایی که با arXivLabs کار می‌کنند، به ارزش‌های باز بودن، جامعه، عالی بودن و حریم خصوصی داده‌های کاربر پایبند هستند. arXiv به این ارزش‌ها متعهد است و تنها با شرکت‌هایی که به آن‌ها پایبند هستند همکاری می‌کند. آیا ایده‌ای برای پروژه‌ای دارید که به جامعه arXiv ارزش اضافه کند؟ بیشتر درباره arXivLabs بیاموزید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)