arXiv:2609.02885ترجمه شده

مدل‌های جهانی تمایزی برای نمایندگان وب

Kelvin Li، Dhruv Pendharkar، Anish Pahilajani، Chuyi Shang، Leon Oks، Leonid Karlinsky، Rogerio Feris، Trevor Darrell، Roei Herzig

چکیده

وب‌سایت‌های اخیر برای انتخاب عمل در زمان تست با نمونه‌برداری از اقدامات نامزد، پیش‌بینی وضعیت‌های وب حاصل و رتبه‌بندی آن‌ها از طریق مدل‌های رتبه‌بند یا مدل پاداش فرآیندی (PRM) استفاده می‌کنند. این مدل‌های جهانی معمولاً از طریق یادگیری نظارت‌شده برای پیش‌بینی وضعیت بعدی آموزش داده می‌شوند تا نمای‌های ثابتی مانند اسنپ‌شات‌های HTML یا AXTree تولید کنند. با این حال، دستیابی به رتبه‌بندی نهایی با وضعیت‌های پیش‌بینی‌شده هم‌راستا نیست؛ زیرا به نمای‌های متمایز بین اقدامات مختلف برای ارزیابی دقیق وضعیت واقعی نیاز داریم. برای حل این مشکل، ما مفهوم هماهنگی وضعیت پیش‌بینی‌شده را تعریف می‌کنیم، که یک هدف آموزشی است که در آن نمایشگر پیش‌بینی‌شده باید وضعیت واقعی را با وضعیت‌های حاصل از اقدامات جایگزین مقایسه کند. ما این مدل‌ها را با استفاده از یک مجموعه داده شاخه‌دار وب‌سایتی آموزش می‌دهیم که از مسیرهای WebArena Go-Browse استخراج شده است، و در هر نقطه تصمیم، اقدامات جایگزین متعدد و وضعیت‌های حاصل از آنها وجود دارد. نتایج آزمایش‌های ما بر روی بنچمارک هماهنگی وضعیت پیش‌بینی‌شده نشان می‌دهد که رویکرد ما عملکرد بهتری نسبت به مدل‌های جهانی آموزش‌دیده با پیش‌بینی وضعیت بعدی نظارت‌شده دارد. همچنین، نشان می‌دهیم که رویکرد ما رتبه‌بندی اقدامات سبک PRM را در WebPRMBench نسبت به PRM‌های صرفاً اقدامی و PRM‌های تقویت‌شده با مدل‌های جهانی پیش‌بینی وضعیت نظارت‌شده بهبود می‌بخشد. در نهایت، در WebArena-Lite، با بهره‌گیری از مدل جهانی ما برای انتخاب عمل در زمان تست، بهبود کلی در عملکرد وظیفه بهبود دست یافته است. صفحه پروژه ما در دسترس است: https://dhruvpendharkar.github.io/dwm/

متن کامل

عنوان: مدل‌های جهانی تمایزدهنده (WM) برای عوامل وب نویسندگان: Kelvin Li, Dhruv Pendharkar, Anish Pahilajani, Chuyi Shang, Leon Oks, Leonid Karlinsky, Rogerio Feris, Trevor Darrell, Roei Herzig چکیده: عوامل وب اخیراً از مدل‌های جهانی برای انتخاب عمل در زمان آزمون استفاده می‌کنند؛ بدین صورت که اقدامات کاندیدا را نمونه‌برداری کرده، وضعیت‌های وب حاصل را پیش‌بینی می‌کنند و سپس آن‌ها را با استفاده از یک مدل رتبه‌بندی یا یک مدل پاداش فرآیندی (PRM) ارزیابی می‌نمایند. این مدل‌های جهانی عموماً از طریق پیش‌بینی نظارت‌شده‌ی حالت بعدی بر روی نمایش‌های ثابت مانند اسنپ‌شات‌های HTML یا AXTree آموزش می‌بینند. با این حال، این تابع هدف با رتبه‌بندی downstream ناهمخوان است، زیرا آنچه برای امتیازدهی دقیق به آن‌ها نیاز است این است که وضعیت‌های پیش‌بینی‌شده بین کاندیداها تمایزپذیر باشند. برای رفع این مشکل، ما تابع هدف پیش‌بینی حالت تطبیقی را معرفی می‌کنیم؛ در این تابع هدف، نمایش پیش‌بینی‌شده باید حالت واقعی حاصل را از حالت‌هایی که توسط اقدامات جایگزین ایجاد می‌شوند، متمایز کند. ما این مدل‌ها را با استفاده از یک مجموعه داده عامل وب شاخه‌ای که از مسیرهای Go-Browse وب‌آرنا استخراج شده، آموزش می‌دهیم؛ در این مجموعه داده، هر نقطه تصمیم شامل چندین اقدام جایگزین و وضعیت‌های حاصل آن‌ها است. آزمایش‌ها بر روی معیار تطبیقی پیش‌بینی حالت ما نشان می‌دهد که رویکرد ما نسبت به مدل‌های جهانی که با پیش‌بینی نظارت‌شده‌ی حالت بعدی آموزش دیده‌اند، برتری دارد. همچنین نشان می‌دهیم که رویکرد ما رتبه‌بندی عمل به سبک PRM را بر روی WebPRMBench بهبود می‌بخشد، در مقایسه با PRMهای صرفاً عمل‌محور و PRMهایی که با مدل‌های جهانی پیش‌بینی نظارت‌شده‌ی حالت بعدی تقویت شده‌اند. در نهایت، در WebArena-Lite، استفاده از مدل جهانی ما برای انتخاب عمل در زمان آزمون، موفقیت سراسری وظیفه را افزایش می‌دهد. صفحه پروژه ما در دسترس است: this https URL موضوعات: هوش مصنوعی (cs.AI); یادگیری ماشین (cs.LG) نحوه استناد: arXiv:2609.02885 [cs.AI] (یا arXiv:2609.02885v1 [cs.AI] برای این نسخه) https://doi.org/10.48550/arXiv.2609.02885