arXiv:2609.04197ترجمه شده

ESPO: بهینه‌سازی پرس‌وجوی ساختارمند مبتنی بر خطا از طریق تشخیص، تنوع‌بخشی و پایدارسازی

Lihao Liu، Peng Tang، Kunwar Yashraj Singh، Shabnam Ghadar

چکیده

توسعه‌دهندگان تکاملی پرامپت، مانند GEPA، با مشکل «تورم پرامپت» مواجه هستند: در هر تکرار، قوانین و ملاحظات جدیدی اضافه می‌شوند و پرامپت‌ها تا سه برابر طولانی‌تر می‌شوند، اما دقت بیشتری ارائه نمی‌دهند. ما این مشکل را به سه کمبود اصلی نسبت می‌دهیم: مشاهده ناقص خطاها، تنوع جستجوی محدود و انتخاب نامعتبر. به همین دلیل، ما **ESPO** (بهینه‌سازی پرامپت ساختارشده خطا) را پیشنهاد می‌کنیم که فرآیند بهینه‌سازی پرامپت را به سه مرحله تقسیم می‌کند: **تشخیص** تمام خطاهای آموزشی را در یک دور به الگوهای ساختاری خوشه‌بندی می‌کند؛ **پیشنهاد** نامزدهای پرامپت را از طریق چهار استراتژی مکمل با سوگیری‌های مستقل تولید می‌کند؛ و **انتخاب** از روش انتخاب پایداری بوت‌استرپ استفاده می‌کند. در هفت معیار عمومی NLP، از جمله Tweet، MMLU، GSM8K، HotpotQA، ScoNe، HoVer و PUPA، ESPO میانگین دقت را **3.76 درصد** نسبت به بهترین روش موجود بهبود می‌بخشد (74.67% در مقابل 70.91% برای GEPA). این روش در هر مجموعه داده‌ای به GEPA می‌رسد یا از آن پیشی می‌گیرد، در حالی که پرامپت‌ها 47% کوتاه‌تر (1,004 در مقابل 1,878 کاراکتر) هستند و سریع‌تر در استنتاج تولید می‌کنند. آزمایش‌های بین‌مدلی روی چهار مدل دانشجوی دیگر (Gemma 3 12B، Mistral 14B، Qwen3 32B، Claude Haiku 4.5) نشان می‌دهد که ESPO بهترین میانگین دقت را در هر مدل آزمایش‌شده ارائه می‌دهد، با بزرگ‌ترین شکاف در GSM8K کیون‌3 (15.00% به 91.40%). یک کران تعمیم (در پیوست) هر مرحله را در یک عبارت متناظر از شکاف زمان آزمون ریشه‌دار می‌کند، و حذف‌آزمایی یک پیش‌بینی کلیدی را تأیید می‌کند: افزودن تنوع بدون انتخاب پایداری بوت‌استرپ در واقع عملکرد را کاهش می‌دهد (-1.20%).

متن کامل

رشته: علوم کامپیوتر > پردازش زبان و محاسبات arXiv:2609.04197v1 (cs) [ارسال شده در ۳ سپتامبر ۲۰۲۶] **عنوان:** ESPO: بهینه‌سازی پرامپت ساختارمند خطا از طریق تشخیص، تنوع‌بخشی و پایدارسازی **نویسندگان:** لیهاو لیو، پنگ تانگ، کونوار یاش راج سینگ، شبنام قدردار چکیده: بهینه‌سازهای تکاملی پرامپت مانند GEPA از تورم پرامپت رنج می‌برند: هر تکرار قوانین و نکات احتیاطی را اضافه می‌کند و پرامپت‌هایی تا ۳ برابر طولانی‌تر تولید می‌کند اما دقت بیشتری ندارد. ما این مسئله را به سه کاستی ردیابی می‌کنیم - مشاهده ناقص خطا، تنوع محدود جستجو، و انتخاب غیرقابل اعتماد - و ESPO (بهینه‌سازی پرامپت ساختارمند خطا) را پیشنهاد می‌کنیم که بهینه‌سازی پرامپت را به سه مرحله تجزیه می‌کند: تشخیص، همه خطاهای آموزشی را در یک دور به الگوهای ساختاری خوشه‌بندی می‌کند؛ پیشنهاد، نامزدها را از طریق چهار استراتژی مکمل با سوگیری‌های مستقل تولید می‌کند؛ انتخاب، انتخاب پایداری بوت‌استرپ را اعمال می‌کند. در هفت معیار عمومی NLP - Tweet، MMLU، GSM8K، HotpotQA، ScoNe، HoVer و PUPA - عملکرد ESPO در میانگین دقت به میزان ۳.۷۶ درصد نسبت به روش‌های پیشرفته بهبود می‌یابد (۷۴.۶۷٪ در مقابل ۷۰.۹۱٪ برای GEPA)، و در هر مجموعه داده به GEPA می‌رسد یا از آن فراتر می‌رود، ضمن اینکه پرامپت‌های ۴۷٪ کوتاه‌تر (۱۰۰۴ در مقابل ۱۸۷۸ کاراکتر) و سریع‌تر در استنتاج تولید می‌کند. آزمایشات بین‌مدلی روی چهار مدل دانشجویی دیگر (Gemma 3 12B، Mistral 14B، Qwen3 32B، Claude Haiku 4.5) نشان می‌دهد که ESPO بهترین میانگین دقت را در هر مدل آزمایش‌شده به دست می‌آورد، با بزرگ‌ترین شکاف در GSM8K مبتنی بر Qwen3 (۱۵.۰۰٪ به ۹۱.۴۰٪). یک کران تعمیم‌پذیری (پیوست) هر مرحله را در یک جمله متناظر از شکاف زمان آزمون ریشه‌دار می‌کند، و تحلیل حذفی یک پیش‌بینی کلیدی را تأیید می‌کند: افزودن تنوع بدون انتخاب بوت‌استرپ در واقع به عملکرد آسیب می‌رساند (−۱.۲۰٪). **موضوعات:** پردازش زبان طبیعی (cs.CL)؛ هوش مصنوعی (cs.AI) **استناد:** arXiv:2609.04197 [cs.CL] (یا arXiv:2609.04197v1 [cs.CL] برای این نسخه) (فضاها چیستند؟) فضاها فعال/غیرفعال TXYZ.AI (TXYZ.AI چیست؟) مقالات مرتبط سیستم‌های توصیه‌گر و ابزارهای جستجو پیوند به Influence Flower Influence Flower (Influence Flower چیست؟) فعال/غیرفعال توصیه‌گر اصلی CORE Recommender (CORE چیست؟) نویسنده محل برگزاری مؤسسه موضوع درباره arXivLabs arXivLabs: پروژه‌های آزمایشی با مشارکت جامعه arXivLabs چارچوبی است که به مشارکت‌کنندگان اجازه می‌دهد تا ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه داده و به اشتراک بگذارند. افراد و سازمان‌هایی که با arXivLabs کار می‌کنند، ارزش‌های ما در زمینه‌های شفافیت، جامعه، برتری و حریم خصوصی داده‌های کاربران را پذیرفته‌اند. arXiv متعهد به این ارزش‌ها است و تنها با شرکایی که به آنها پایبند باشند، همکاری می‌کند. ایده‌ای برای پروژه‌ای دارید که برای جامعه arXiv ارزش‌افزایی کند؟ درباره arXivLabs بیشتر بدانید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال‌سازی MathJax (MathJax چیست؟)