چکیده
توسعهدهندگان تکاملی پرامپت، مانند GEPA، با مشکل «تورم پرامپت» مواجه هستند: در هر تکرار، قوانین و ملاحظات جدیدی اضافه میشوند و پرامپتها تا سه برابر طولانیتر میشوند، اما دقت بیشتری ارائه نمیدهند. ما این مشکل را به سه کمبود اصلی نسبت میدهیم: مشاهده ناقص خطاها، تنوع جستجوی محدود و انتخاب نامعتبر. به همین دلیل، ما **ESPO** (بهینهسازی پرامپت ساختارشده خطا) را پیشنهاد میکنیم که فرآیند بهینهسازی پرامپت را به سه مرحله تقسیم میکند: **تشخیص** تمام خطاهای آموزشی را در یک دور به الگوهای ساختاری خوشهبندی میکند؛ **پیشنهاد** نامزدهای پرامپت را از طریق چهار استراتژی مکمل با سوگیریهای مستقل تولید میکند؛ و **انتخاب** از روش انتخاب پایداری بوتاسترپ استفاده میکند. در هفت معیار عمومی NLP، از جمله Tweet، MMLU، GSM8K، HotpotQA، ScoNe، HoVer و PUPA، ESPO میانگین دقت را **3.76 درصد** نسبت به بهترین روش موجود بهبود میبخشد (74.67% در مقابل 70.91% برای GEPA). این روش در هر مجموعه دادهای به GEPA میرسد یا از آن پیشی میگیرد، در حالی که پرامپتها 47% کوتاهتر (1,004 در مقابل 1,878 کاراکتر) هستند و سریعتر در استنتاج تولید میکنند. آزمایشهای بینمدلی روی چهار مدل دانشجوی دیگر (Gemma 3 12B، Mistral 14B، Qwen3 32B، Claude Haiku 4.5) نشان میدهد که ESPO بهترین میانگین دقت را در هر مدل آزمایششده ارائه میدهد، با بزرگترین شکاف در GSM8K کیون3 (15.00% به 91.40%). یک کران تعمیم (در پیوست) هر مرحله را در یک عبارت متناظر از شکاف زمان آزمون ریشهدار میکند، و حذفآزمایی یک پیشبینی کلیدی را تأیید میکند: افزودن تنوع بدون انتخاب پایداری بوتاسترپ در واقع عملکرد را کاهش میدهد (-1.20%).
متن کامل
رشته: علوم کامپیوتر > پردازش زبان و محاسبات
arXiv:2609.04197v1 (cs) [ارسال شده در ۳ سپتامبر ۲۰۲۶]
**عنوان:** ESPO: بهینهسازی پرامپت ساختارمند خطا از طریق تشخیص، تنوعبخشی و پایدارسازی
**نویسندگان:** لیهاو لیو، پنگ تانگ، کونوار یاش راج سینگ، شبنام قدردار
چکیده: بهینهسازهای تکاملی پرامپت مانند GEPA از تورم پرامپت رنج میبرند: هر تکرار قوانین و نکات احتیاطی را اضافه میکند و پرامپتهایی تا ۳ برابر طولانیتر تولید میکند اما دقت بیشتری ندارد. ما این مسئله را به سه کاستی ردیابی میکنیم - مشاهده ناقص خطا، تنوع محدود جستجو، و انتخاب غیرقابل اعتماد - و ESPO (بهینهسازی پرامپت ساختارمند خطا) را پیشنهاد میکنیم که بهینهسازی پرامپت را به سه مرحله تجزیه میکند: تشخیص، همه خطاهای آموزشی را در یک دور به الگوهای ساختاری خوشهبندی میکند؛ پیشنهاد، نامزدها را از طریق چهار استراتژی مکمل با سوگیریهای مستقل تولید میکند؛ انتخاب، انتخاب پایداری بوتاسترپ را اعمال میکند. در هفت معیار عمومی NLP - Tweet، MMLU، GSM8K، HotpotQA، ScoNe، HoVer و PUPA - عملکرد ESPO در میانگین دقت به میزان ۳.۷۶ درصد نسبت به روشهای پیشرفته بهبود مییابد (۷۴.۶۷٪ در مقابل ۷۰.۹۱٪ برای GEPA)، و در هر مجموعه داده به GEPA میرسد یا از آن فراتر میرود، ضمن اینکه پرامپتهای ۴۷٪ کوتاهتر (۱۰۰۴ در مقابل ۱۸۷۸ کاراکتر) و سریعتر در استنتاج تولید میکند. آزمایشات بینمدلی روی چهار مدل دانشجویی دیگر (Gemma 3 12B، Mistral 14B، Qwen3 32B، Claude Haiku 4.5) نشان میدهد که ESPO بهترین میانگین دقت را در هر مدل آزمایششده به دست میآورد، با بزرگترین شکاف در GSM8K مبتنی بر Qwen3 (۱۵.۰۰٪ به ۹۱.۴۰٪). یک کران تعمیمپذیری (پیوست) هر مرحله را در یک جمله متناظر از شکاف زمان آزمون ریشهدار میکند، و تحلیل حذفی یک پیشبینی کلیدی را تأیید میکند: افزودن تنوع بدون انتخاب بوتاسترپ در واقع به عملکرد آسیب میرساند (−۱.۲۰٪).
**موضوعات:** پردازش زبان طبیعی (cs.CL)؛ هوش مصنوعی (cs.AI)
**استناد:** arXiv:2609.04197 [cs.CL] (یا arXiv:2609.04197v1 [cs.CL] برای این نسخه)
(فضاها چیستند؟) فضاها فعال/غیرفعال TXYZ.AI (TXYZ.AI چیست؟) مقالات مرتبط سیستمهای توصیهگر و ابزارهای جستجو پیوند به Influence Flower Influence Flower (Influence Flower چیست؟) فعال/غیرفعال توصیهگر اصلی CORE Recommender (CORE چیست؟) نویسنده محل برگزاری مؤسسه موضوع درباره arXivLabs arXivLabs: پروژههای آزمایشی با مشارکت جامعه arXivLabs چارچوبی است که به مشارکتکنندگان اجازه میدهد تا ویژگیهای جدید arXiv را مستقیماً در وبسایت ما توسعه داده و به اشتراک بگذارند. افراد و سازمانهایی که با arXivLabs کار میکنند، ارزشهای ما در زمینههای شفافیت، جامعه، برتری و حریم خصوصی دادههای کاربران را پذیرفتهاند. arXiv متعهد به این ارزشها است و تنها با شرکایی که به آنها پایبند باشند، همکاری میکند. ایدهای برای پروژهای دارید که برای جامعه arXiv ارزشافزایی کند؟ درباره arXivLabs بیشتر بدانید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعالسازی MathJax (MathJax چیست؟)