综合

上海AI Lab、浙大、NUS团队:世界模型,何去何从?|轨迹|lab|上海市|agent_网易订阅

时间:2010-12-5 17:23:32  作者:百科   来源:休闲  查看:  评论:0
内容摘要:人工智能AI)行业一直在讨论的世界模型world model),下一步会走向何处?在主流范式中,世界模型通常根据当前状态和动作预测下一状态。从 Sora 引发“世界模拟器”讨论,再到 Genie 3

上海AI Lab、浙大、NUS团队:世界模型,何去何从?|轨迹|lab|上海市|agent_网易订阅
人工智能(AI)行业一直在讨比如的上海世界b上世界模型(world model),下一步会走向何处?团队在主流范式中,世界模型常见根据目前状态和动作预测下一状态。模型从 Sora 引发“世界模拟器”讨比如,何去何从海市再到 Genie 3 实时生成可交互世界,轨迹讨比如的易订阅题仍然是如何把未来预测得更准、更逼真。上海世界b上如今,团队上海 AI Lab 、模型浙江大学和新加坡国立大学(NUS)团队,何去何从海市提出了一个「以 Agent 为中心」的轨迹世界模型新范式:世界建模的未来,是易订阅从预测世界转向服务 Agent。他们提出了以 Agent 为中心的上海世界b上交互式世界代理(World Proxy),在 Agent 与真实环境之间给予低成本、团队可控反馈,模型协助 Agent 的规划、学习和持续自我改进。比如文链接:https://arxiv.org/abs/2608.02713项目页面:https://worldbench.github.io/awesome-agentic-world-model详详见细而言,世界代理位于 Agent 与真实环境之间,根据 Agent 发起的查询、动作或干预,返回实施结荚、经验/技能、奖励或验明正身信号,并在推理、训练和共同演化三个层级协助 Agent 自我改进。图|以 Agent 为中心的世界代理的概念转向与设方式空间。探究团队表示,这项工作旨在建立以 Agent 为中心的新范式,为 Agent 更好规划、更快学习给予路线图。世界模型,关键以 Agent 为中心持续改进的 Agent 需超越静态监督,通过动态交互获得反馈。而真实环境交互成本高、错误操作难以回滚、反馈滞后,也难以大规模并行化。传统世界模型常见以未来物理状态预测为题,但对需可操作反馈的 Agent 而言,其建模范围仍然有限。在这项工作中,世界代理位于 Agent 与真实环境之间,在 Agent 提交真实动作前预测、检索或验明正身相关反馈,让 Agent 能够以更低成本获得可用于决策和改进的材料。详详见细而言,一个以 Agent 为中心的世界代理,需顺应三个需:1.协助 Agent 主动发起查询、动作或干预,并形成闭环;2.基于真实环境的数据、条件、轨迹或交互证据学习,保持环境锚定;3.以可操作的材料增益为目的,为规划、决策、探索和训练给予有效反馈,而不仅追求视觉真实感或状态预测准确率。详详见细步骤如下:1.发起交互: Agent 根据目前目的与上下文,主动提出查询、动作或干预。2.预测材料转移: 世界代理在目前材料状态与交互需下,预测或生成反馈。3.返回反馈: 反馈作为材料增益回到 Agent ,例如未来状态、预测观察、实施结荚、检索到的指导或验明正身结比如。4.用于改进: Agent 将反馈用于规划、决策、对策学习或持续改进。图|从世界模型到世界代理。单次运行时,世界代理只返回一次预测、检索或验明正身反馈。在多步往往代中,它的反馈会持续意义 Agent 之后的查询、动作与对策更新,并形成改进轨迹。一个好的世界代理,需给予环境锚定、可控、实用、可扩展且具有前瞻性的反馈。世界代理,如何改进 Agent世界代理对 Agent 的赋能,可以按介入改发展骤的深度分为三个层级。它既可以在推理时补充上下文,也可以在训练时生成改进信号,还可以与 Agent 一起随真实环境反馈持续更新。详详见细机制如下:图|用于 Agent 改进的 L1 至 L3 世界代理。L1 推理时引导(Inference-Time Guidance):最轻的一层介入。世界代理不改动 Agent 参数,只在推理时期给予记忆/技能检索、实施模拟或验明正身反馈,并将其并入目前上下文。步骤上,Agent 发起查询,世界代理返回引导结荚,Agent 再据此决策。这一层成本低、可回滚,但上限受限于 Agent 已有能力。它的好处是让 Agent 在目前回合内看得更多、推理更准、动作更稳。图|L1 通过世界代理开展推理时引导。L2 训练时改进(Training-Time Optimization):这一层中,世界代理的功能从目前决策延伸到对策训练。它会处理 Agent 的 rollout,如为轨迹打分、指出失败因素、生成合成轨迹或偏好对,也可以根据失败模式生成新的训练任务。这些信号随后被用于 SFT、DPO、PPO 或 GRPO 等训练,让 Agent 自己的交互流程成为改进对策的燃料。图|L2 由世界代理驱动的训练时改进。L3 Agent-代理共同演化(Agent-Proxy Co-Evolution):这是介入最深的一层。真实轨迹、失败案例和新发现会持续回流到世界代理中,使其随环境和任务更新;更新后的世界代理再反过来引导、验明正身和训练 Agent。这样,Agent 与世界代理在闭环中持续互相更新,共同提高。图|L3 Agent 与世界代理共同演化。除了 L1-L3 的介入层级,世界代理还可以按所建模的材料转移类型分类为六种功能形态。不一样形态返回不一样反馈,在实际采取中也常被组合采取。图|以 Agent 为中心的世界代理的功能形态。动力学形态:关注动作后的环境变化,最接近经典世界模型。它接收目前状态、历史观察和 Agent 动作,预测未来状态,必需时也可预测奖励。空间形态:关注从另一个视角会观察到什么。Agent 查询新的位置、相机位姿或视角,世界代理返回相应的观察或空间表征,让 Agent 在移动前先看一眼。实施形态:关注数字环境会返回什么。它模拟代码、命令、网页点击、API 或工具调用后的状态变化,以及 stdout、stderr、错误材料、测试结荚或页面变化。记忆/经验形态:关注目前决策所需的历史经验、失败案例或约束。它从过往交互、轨迹和失败中检索相关材料,并将这些经验反馈给规划流程。技能形态:关注目前任务可以采取什么技能。它根据目的、上下文和环境状态,提议可复用技能、工具采取步骤或动作先验。奖励/验明正身形态:关注表现是否正确、安全、可行,以及应当如何改进。它评估 Agent 的表现、轨迹、答案或方式划,输出奖励、批评、偏好或验明正身结比如。不足和未来方向然而,尽管世界代理能够减小真实环境中的交互成本,但目前仍存在以下不足:先,它反馈的逼真度和首先期可靠性有限。生成结荚可能看似合理,却违反实际动力学规律,错误还会在首先轨迹中不断往往积。未来需关注首先轨迹预测、误差传播和不选定性校准,而不仅是生成更逼真的结荚。第二,Agent 仍难以判断何时应该信任代理,何时需返回真实环境验明正身。过度依赖世界代理,可能导致难以按时发现的错误。未来需强化置信度评估、风险感知和真实环境回退机制。同时,当世界代理被用作奖励模型或验明正身器时,Agent 可能利用其判断盲点,产生奖励 hacking 和安全风险。之后探究需提高世界代理的鲁棒性,并引入对抗测试、独立验明正身和权限控制。最后,材料增益仍缺乏统一的评估原则。现有基准更多关注真实感、可控性、预测准确率或人类偏好,却频仍将世界代理与 Agent 分开评估。未来,仍需建立以 Agent 为中心的评测体系,研究世界代理反馈是否真正协助 Agent 规划、学习和持续改进。作者:夏千斯如需转载或投稿,请直接在本文章评比如区内留言
copyright © 2026 powered by 一丝一毫网   sitemap