两项核心指标全球第一 成都企业再登WorldArena 2.0全球前列

民风民俗 1 0

封面新闻记者 温彦博

9月16日,WorldArena 2.0全球终榜正式揭晓。World Arena是具身智能领域的一个评测榜单。该榜单由清华大学牵头,联合普林斯顿大学、新加坡国立大学、北京大学等8所学术机构共同研发。榜单以实际任务完成为导向,将视频生成质量与具身任务功能性相结合,构建从视觉真实性到任务实用性的评估框架。

本次评测汇集了来自阿里巴巴、中国科学院等顶尖科技企业、科研机构及具身智能独角兽公司的80个模型,围绕世界模型的视频生成质量、时序一致性与物理演化能力展开统一评估。封面新闻获悉,成都企业考拉悠然旗下的悠然无界世界模型在Track 1(视频质量赛道)综合得分位列全球第二,并在Background Consistency(背景一致性)和JEPA Similarity(JEPA相似度)两项指标上排名第一。

世界模型“打擂”,比拼物理世界推演能力

据介绍,WorldArena的指标体系分为视觉质量、运动质量、内容一致性、物理遵循性、3D空间准确性和可控性六大维度,另设数据引擎、策略评估器、动作规划器三类具身应用任务。它主要考察世界模型四方面的能力:感知精度、对物理规律的理解、三维空间认知,以及动作预测。

语言模型的工作是根据统计规律预测下一个词。世界模型要做的则是:给定当前场景和一组动作,推演出接下来会发生什么。在具身智能行业,这种能力被看作机器人的“预演”底座,可用于低成本生成训练数据、在虚拟环境中评估控制策略。WorldArena研究团队在论文中指出,视觉质量高并不必然意味着具身任务能力强。这也是榜单把“看起来像”和“用起来行”分开评测的原因。

这份榜单今年初上线后,成了国内外世界模型团队比拼的一个主要擂台,头部名次几个月内多次变化。5月底,智元机器人的GE 2.0登上Track 1榜首;6月,中国科学院工业人工智能研究所宣布,其自研的PAIWorld登顶该榜单。考拉悠然也不是第一次上榜:在5月底公布的WorldArena首期最终榜单中,考拉悠然联合同济大学空间智能团队等打造的悠然无界开源版本BLM在Track 1位列第一,闭源版本BWM-Fast位列第二。

这次拿到第一的两项指标都和长时推演的稳定性有关。长视频生成最常见的问题是场景漂移:推演几十帧后,背景的纹理、光照或物体摆放会悄悄改变。背景一致性排名第一,说明模型在整段生成中能稳定保持全局环境。JEPA相似度则不比对像素,而是在高层表征空间里衡量生成结果和真实世界演化过程的差距,看场景语义、物体状态和动作变化有没有被正确保留。

两处架构设计,针对误差累积和场景漂移

为此,封面新闻联系了考拉悠然相关负责人,据介绍,团队把长时推演的难题拆成两个具体挑战:一是推演过程中误差逐帧累积,二是遇到没见过的环境时出现分布漂移。针对这两点,团队做了两层架构设计。

第一层是结构化4D世界建模,相当于给生成过程装上“定位与惯性导航”:同时建模首帧的3D场景几何和运动轨迹,把静态的空间结构和动态的动作过程关联起来,为后续每一帧提供持续的几何与运动约束,抑制物体位置漂移和轨迹发散。

第二层是动态场景记忆:持续保存并更新场景的纹理、外观和布局等关键特征,避免模型在长时生成中逐渐“忘记”场景原本的样子、退回到训练数据的常见形态,以此提升长程一致性和对陌生环境的泛化能力。

训练分两个阶段。第一阶段用大规模、多样化的数据学习通用的场景表征和运动规律;第二阶段筛选高质量数据做精细微调,重点加强几何一致性、时序连贯性和运动准确性。据介绍,在本次评测涉及的分布外泛化、长程多阶段操作以及双臂协同等综合任务中,该模型都能沿给定动作序列持续推演,并保持场景、物体和交互状态的物理一致性。

从榜单走向车间,巡检成为首个落地场景

考拉悠然长期做工业视觉检测、安全生产等AI应用,此前披露服务客户超过500家,2024年完成由策源资本领投的1亿元B轮融资。近年来,公司的技术路线转向“世界模型+智能体+场景复制”:底层是悠然无界世界模型,上层是Geek Mind(极客心智)具身大脑,两者之间靠跨空间、跨任务、跨本体的能力衔接。

工业巡检是这套路线最先落地的场景。据介绍,制造企业的巡检长期面临三个问题:人力成本高、危险区域难以进入、人工记录难以标准化。为此,考拉悠然把Geek Mind集成到四足机器人上,为大型央企的制造车间提供巡检方案。

方案不需要改造产线,靠预训练模型和场景自适应机制就能快速配置巡检路线、切换任务。系统除了采集温度、振动、仪表读数等数据,还会依托世界模型对异常做因果分析,给出可追溯的判定依据,以减少误报和漏报。四足平台能跨楼层、跨地形移动,可以进入人工难以到达的高空、狭窄和危险区域。

在考拉悠然看来,具身智能在工业场景的价值不在于替代某一个岗位,而在于建立一套可复制、可规模化的无人巡检模式。真正的考验是跨本体泛化能力能否在更多极端场景中保持稳定,这将决定世界模型从“能推演”走向“能干活、能复制”的速度。