会懂网AI资讯,9月5日,9月4日,具身智能企业深度跃迁发布自研世界动作模型DELE-w0.5。该模型放弃预测未来视频的技术链路,转而联合学习动作与动作完成后的未来世界表征,在640次真机实验中取得62.5%的完整任务成功率,约为最强基线的2.1倍。

当前不少具身世界模型把大量算力消耗在生成逼真视频画面上,但好看的渲染不等于机器人能完成现实作业。DELE-w0.5的思路是:训练时联合学习机器人动作和动作完成后的未来世界表征,推理时移除该分支,机器人根据语言和当前视觉信息直接生成动作,控制链路因此更短。
在640次真机实验中(4项长程任务、8种方法、各20次测试),DELE-w0.5完整任务成功率达62.5%,最强基线XR0为30.0%;平均有序阶段进度81.3%,优于最佳基线GWP0.5的61.3%。分任务看,开门80%、冰箱取可乐65%、微波炉爆米花60%、杯中加冰45%,四项均列第一。
效率同样亮眼。模型在英伟达RTX 4090上的推理延迟中位数为87.5毫秒,快于多款视频生成类世界模型。其基座从底层自研,未二次封装开源VLA或视频生成模型,并展现出跨背景的zero-shot泛化能力——在桌面材质、光照与布局显著变化的环境里仍可稳定执行任务。
深度跃迁是一家专注从真实任务中持续进化的跨本体具身大脑平台公司,已完成由复星创富独家投资的天使轮融资。会懂网观察,DELE-w0.5给火热的”世界模型”赛道泼了一盆理性冷水:评判标准不应是画面多真实,而是机器人能否把任务真正做完。
团队也坦诚说明了现存短板:缺少可视化预测视频,调试排错对工程师不够友好;面对极度复杂的多物体强交互场景,表征表达能力仍有提升空间;当前版本距离大规模工业级落地还有距离,极端开放环境仍会出现失败,还需要更多真实世界数据持续迭代。






















暂无评论内容