用世界模型给VLA当教练,原力灵机发布DW0.5,把RL搬进虚拟世界
量子位 7/16 10:30
用世界模型给VLA当教练,原力灵机发布DW0.5,把RL搬进虚拟世界 衡宇 2026-07-16 10:30:46 来源:量子位 后训练中真机数据需求骤降60% 衡宇 发自 凹非寺 量子位 | 公众号 QbitAI 代码Agent这两年为何进步飞快,成为AI界的宗门大师兄? 因为这玩意儿自己个儿就超!闭!环!的! 代码Agent可以自动执行、自动验证、自动反馈。写了代码跑一下就知道对不对,奖励信号非常清晰明确。 这给后训练(Post-training)阶段的自反馈闭环提供了完美条件。 同样是AI界大热门,具身智能目前就缺少这种“神助”。 它面对的物理世界比代码Agent面对的世界复杂多了,而且很难得到即刻验证。 它接收的信号不像代码那样有一个编译器就能判定,它们模糊、昂贵,而且每一次真机试错都意味着真金白银的人力和硬件损耗。 VLA(视觉-语言-动作模型)是具身智能中最早受到关注的技术路线。 但很快,大家发现这个技术存在物理理解缺失、泛化能力极弱、长时序与规划能力不足等等问题,做不到“一家独大”包打天下。 大家有点着急。后来,世界模型又成了行业里的新宠儿。 但世界模
查看原文