靠谱客7月22日消息,小米今天正式发布并向全量开源具身生成系统Xiaomi-Robotics-U0,参数规模达380亿,成为业内首个统一覆盖四类核心具身生成任务的一体化平台。

该系统打破了以往机器人场景、轨迹、视频生成方案彼此割裂的现状,可自主生成和扩充机器人训练所需的图像与视频数据,有效解决在极端、危险、长尾场景下真机采集成本高、难度大的痛点。

采用自研FlashAR处理加速方案后,其生成效率较传统自回归架构提升近83倍,大幅降低大规模具身数据生产的落地门槛。

系统统一承载具身场景生成、具身轨迹迁移、机器人交互视频生成、通用文生图与图像编辑四大能力。凭借独创的五维解耦结构化控制范式,工作台布局、操作物体、杂物、光照和背景五个维度均可通过自然语言独立调节,全程保持多视角几何一致性,修改画面元素时不会出现机械臂位姿错位或场景空间畸变。

该平台兼容方舟无限、智元多款、松灵PiPER等多种机器人本体,支持生成室内、户外、海底、赛博场景等各类开放世界仿真环境。

多项权威评测与真机实测验证了该系统的领先性能。在全球126款方案同台比拼的WorldArena具身视频评测基准中,Xiaomi-Robotics-U0夺得总分第一,指令遵循、交互流畅度、多视角一致性等指标全面领跑。

在具身迁移对比测试中,该系统在深度一致性、结构保真等关键指标上全面超越闭源方案GPT-Image-2.0,后者普遍存在跨视图物体错位缺陷,无法用于机器人训练数据扩充。

真机实操场景下,使用该系统扩增数据训练的机器人,在陌生光照、全新背景等分布外复杂工况中,任务完成进度平均提升超26%,面对反光、彩色强光等视觉干扰也可自主校正,大幅增强了环境泛化能力。

小米发布并开源xiaomi-robotics-u0:380亿参数具身生成大模型!生成效率提升83倍真机任务成功率对比

在推理层面,FlashAR加速方案搭配vLLM分页KV缓存批量调度技术,优化了图像编辑、具身迁移的全流程解码速度。1024*1024分辨率图像生成耗时从四百多秒压缩至5.44秒,在保障画面与物理交互质量的前提下,适应工业化批量生成需求。

目前,该系统全部代码、权重已在官网、GitHub、Hugging Face和魔搭社区完整开源,面向全球具身智能开发者开放使用。

小米发布并开源xiaomi-robotics-u0:380亿参数具身生成大模型!生成效率提升83倍

(举报)

点赞(14)

评论列表共有 0 条评论

立即
投稿
返回
顶部