在当前的大模型浪潮中,视频生成模型常常被视为通往具身智能的未来模拟器。然而,主流模型多采用像素空间的直接预测,容易在物理规律的稳定性和连贯性上出现偏差。针对这一行业痛点,研究团队近日正式推出了全新的物理世界模型image.png

在技术实现上,该系统分为分词器与推理器两大核心模块。其中,物理语言分词器利用转移级 Q-Former 捕获相邻状态变化,并结合有限标量量化机制生成紧凑的离散符号;扩散解码器则以首帧和离散符号为条件,恢复出细腻的视觉细节。而物理语言推理器则基于预训练视觉语言模型进行初始化,从首帧和文本动作意图出发,精准预测未来的物理语言序列。

image.png

多项基准测试结果表明,PhiZero在 Physics-IQ Verified、PhyGround 以及 WorldModelBench 等多个物理推理和视频生成评估中取得了领先成绩。无论是碰撞引起的物体位移、重力驱动的形变,还是复杂的连锁反应,模型均能展现出高度逼真的物理合理性。

随着具身智能与机器人技术的加速落地,PhiZero的问世为可控、可交互的世界建模开辟了全新路径,有望在长时程模拟与运动迁移等场景中发挥关键作用。

点赞(9)

评论列表共有 0 条评论

立即
投稿
返回
顶部