چکیده
بهینهسازی شبکههای عصبی در سالهای ۲۰۲۵-۲۰۲۶ دیگر بهعنوان یک دنباله از ورژنهای جدید Adam توصیفشده نیست. فضای طراحی از مختصات به ماتریسها و لایهها، از افقهای آموزشی ثابت به سیاستهای زمانی، و از قواعد بهروزرسانی ریاضی به نمایشهای وضعیتی که باید در شاردینگ و محاسبات کمدرجه مقاومت کنند، گسترش یافته است. این مرور، بهروزرسانیهای اخیر را بهصورت چهار محور بهصورت تقریباً مستقل، بر اساس: تخمین زمانی، ژئومتپو بهروزرسانی، مدیریت افق، و نمایش و سیستمها، سازماندهی میکند. این مرور، نرمالیزه طیفپذیری Muon، آمارهای ماتریسی تاریخی Shampoo و SOAP، روشهای ماتریسی سازهدار و ترکیبی، بهینهسازهای کارآمد حافظه، آموزش بدون برنامهریزی زمانی، اصلاحات بستهدار، و حالتهای بهروزرسانی بهصورت کمدرجه را به هم میچسباند. نتیجه کلیدی تجربی بهطور عمدی غیر پیروزمندانه است: روشهای آگاه از ماتریس یک پیشرفت واقعی را نشان میدهند، اما جایگزینی مستقل از زمینه برای AdamW وجود ندارد. درستترین رتبهها با مقیاس مدل، نسبت داده به پارامتر، اندازه بسته، زمانبندی، تقسیم پارامترها، بودجه تنظیم، و اینکه آیا معیار هدف توکن، FLOPs، زمان دیوار-ساعت یا حافظه است، تغییر میکند. پیامد عملی این است که طراحی بهصورت ترکیبی به بهینهسازها نگاه میشود و پروتکل سختتری برای ارزیابی ادعای بهینهسازها وجود دارد.
متن کامل
علوم کامپیوتر > یادگیری ماشین arXiv:2608.28557v1 [cs] [ارائه شده در ۲۸ اوت ۲۰۲۶]
**عنوان:** وبلاگ: بررسی بهینهسازها
**نویسنده:** رووران شو
فایل PDF مقاله با عنوان «وبلاگ: بررسی بهینهسازها» نوشته رووران شو را مشاهده کنید | فایل PDF | HTML (آزمایشی)
**چکیده:**
بهینهسازی شبکههای عصبی در سالهای ۲۰۲۵ تا ۲۰۲۶ دیگر نمیتواند بهسادگی بهعنوان توسعهٔ تدریجی انواع جدید آدام توصیف شود. فضای طراحی از روشهای مختصاتی به ماتریسها و لایهها، از افقهای آموزشی ثابت به سیاستهای زمانی، و از قواعد بهروزرسانی ریاضی محض به نمایشهای حالتمند گسترش یافته است؛ نمایشهایی که باید در برابر شاردینگ و محاسبات کمدقت مقاوم باشند. این بررسی، بهینهسازهای نوین و روشهای بهینهسازی آموزش را در چهار محور عمدتاً مستقل سازماندهی میکند: برآورد زمانی، هندسهٔ بهروزرسانی، مدیریت افق، و نمایش و سیستمها. این مرور، نرمالسازی طیفی Muon، آماریک ماتریسی Shampoo و SOAP، روشهای ماتریسی تطبیقی و ترکیبی، بهینهسازهای کمحافظه، آموزش بدون برنامهریزی، تصحیح دستههای کوچک، و حالتهای بهینهساز کوانتیزهشده را به یکدیگر پیوند میدهد. نتیجهگیری تجربی اصلی بهگونهای آگاهانه فروتنانه است: روشهای آگاه از ساختار ماتریسی پیشرفتهای واقعی نشان میدهند، اما جایگزینی عمومی و بدون وابستگی به زمینه برای AdamW وجود ندارد. رتبهبندیها بر اساس مقیاس مدل، نسبت داده به پارامتر، اندازهٔ دسته، برنامهریزی، تقسیم پارامتر، بودجهٔ تنظیم، و نوع معیار هدف (توکنها، FLOPs، زمان دیواری، یا حافظه) تغییر میکنند. نتیجهٔ عملی آن، اتخاذ دیدگاهی ترکیبی در طراحی بهینهساز و پروتکلی سختگیرانهتر برای ارزیابی ادعاهای مربوط به بهینهسازها است.
**موضوعات:** یادگیری ماشین (cs.LG)؛ هوش مصنوعی (cs.AI)
**استناد:** arXiv:2608.28557 [cs.LG] (یا arXiv:2608.28557v1 [cs.LG] برای این نسخه) https://doi.org/10.48550/arXiv.2608.28557
**تاریخچه:** ارسال از: رووران شو [مشاهده ایمیل] | [v1] جمعه، ۲۸ اوت ۲۰۲۶، ۱۷:۳۵:۱۱ UTC (۴۳ کیلوبایت)