随着可交互世界模型技术迈入新阶段,用户对虚拟世界的期待不再停留于被动观看生成内容,而是渴望通过实时输入动作与持续演化的环境深度互动。尽管Genie 3等前沿模型已实现从"生成视频"到"模拟交互世界"的跨越,但长时交互过程中暴露的稳定性问题仍制约着技术落地——模型能否持续响应控制指令、维持视觉一致性、遵循物理规律并保留场景记忆,尚未形成系统性评估标准。
现有评测体系普遍存在"短视化"缺陷:多数测试仅截取5-10秒交互片段进行对比,难以捕捉分钟级交互中逐渐累积的误差。例如某些模型在初期表现正常,但经过30秒以上持续交互后,画面可能出现画质崩坏、物体穿模或场景记忆丢失等问题。这种延迟暴露的缺陷,使得传统评测方法无法全面反映模型的长时稳定性。
针对这一痛点,由高德视觉技术中心联合多所高校研发的WorldRoamBench评测框架,通过构建包含1000余个长时漫游场景的测试集,从动作控制、视觉稳定、物理规律和场景记忆四大维度建立量化评估体系。该框架突破传统总分制评价模式,将长时交互能力拆解为可追溯的细分指标,为模型优化提供精准诊断依据。
在动作控制评测中,研究人员发现最终轨迹正确性可能掩盖局部操作失误。例如某模型在执行连续前进指令时,画面中途多次出现反向移动,但因整体轨迹符合预期,传统评测难以察觉这类"隐性错误"。WorldRoamBench通过逐帧分析动作响应时延与方向准确性,揭示出不同模型在控制精度上的显著差异。
视觉稳定性评估则聚焦交互过程中的画面漂移现象。测试显示,部分模型在持续生成画面时,会因误差累积导致物体形变或场景结构崩坏,即使后续画面恢复,这些中间异常也会破坏用户体验。该框架通过追踪全流程视觉质量变化,成功识别出传统评测容易忽略的"间歇性失真"问题。
物理规律验证环节设计了碰撞检测、重力响应等专项测试。在穿墙实验中,某些模型未对物体与墙壁的接触作出正确反馈,暴露出三维空间感知能力的不足。通过构建包含力学、光学和空间关系的复合测试场景,WorldRoamBench能够系统评估模型对物理规则的遵循程度。
场景记忆测试采用"死亡旋转"挑战:让模型经历复杂路径后返回原点,比较场景还原度。研究发现,位置偏差并非记忆错误的唯一原因——即使主体精准回位,部分模型仍会丢失先前生成的物体或生成不存在的内容。该框架通过分离位置误差与记忆误差,更准确地衡量模型的长时场景保持能力。
基于这套评测体系对12款主流模型的测试显示,当前技术尚未出现全能型解决方案。在第一人称场景中,Genie 3虽在记忆与物理维度表现领先,但动作控制仅排第八,视觉质量位列第九;第三人称场景里,Happy Oyster综合得分最高,却也存在特定维度的短板。这种"偏科"现象表明,长时交互稳定性仍是行业共同挑战。
为推动技术迭代,WorldRoamBench已开放评测平台,支持研究者下载测试集并上传模型推理结果进行自主评估。随着评测代码与执行脚本的逐步开源,这个动态更新的基准测试框架将持续吸纳社区贡献,与可交互世界模型技术共同进化,为构建更真实的虚拟世界提供评估标准。