判别式世界模型让 Web Agent 更会挑动作,训练目标开始贴近真实决策
研究者提出面向 Web Agent 的判别式世界模型,用预测状态匹配区分候选动作,并在 WebArena-Lite 上改善测试时行动选择。

Agent 的关键能力不只在生成下一步操作,还在于比较不同动作的后果;更贴近排序目标的世界模型可能降低试错成本,但仍需跨网站和任务验证。
世界模型开始为排序服务
传统世界模型通常学习预测执行动作后的下一个页面状态,例如 HTML 或无障碍树快照。但 Web Agent 最终要解决的是在多个候选动作中选出更好的一个,单纯追求状态复原并不一定能帮助排序。新方法把训练目标改成比较真实结果与替代结果,让预测表示直接服务于决策筛选。
这条思路把 Agent 的规划环节拆得更清楚:模型先估计动作会带来什么页面,再判断哪些结果更接近任务目标。对需要填写表单、跨页面检索或连续操作的任务来说,候选动作之间的差异比复述当前页面更重要。
分支轨迹提供了可比较的反事实
研究数据不是一条单线操作记录,而是在每个决策点保留多个动作及其后续状态。这样模型可以学习同一页面下不同选择的后果,避免只从成功轨迹中记住表面步骤。对训练排序器而言,这种成对或成组的反事实样本更接近线上真正遇到的选择题。
论文还将世界模型接入过程奖励模型,用预测状态辅助评估候选动作。它的价值不在于替 Agent 执行所有步骤,而在于提前淘汰明显会把任务带偏的路径,减少真实浏览器中的无效尝试。
泛化与成本仍是上线门槛
Web 页面结构、权限状态和交互组件变化很快。一个在基准网站上有效的状态表示,换到新站点或登录后的复杂流程,可能出现分布偏移。部署时仍需要实时页面校验、失败恢复和人工接管,不能把测试集成功率直接当作通用能力。
中转查认为,判别式世界模型适合与动作日志、回放测试和可观测性结合使用。团队应同时记录候选动作、预测状态和最终结果,持续检查模型是否真的减少了试错,而不是只增加一层推理调用。
