小米发布了一款新型AI模型,只需简单的文字描述,就能生成逼真的机器人训练环境。这个名为Robotics-U0的380亿参数模型,让机器人在接触真实物体之前先在计算机生成的世界里练习——这一能力有望大幅削减训练人形和四足机器人完成实际任务所需的时间和成本。
什么是小米Robotics-U0?它为什么重要?
小米Robotics-U0是一个380亿参数的多模态基础模型,专为具身AI设计——一个能同时理解文本、图像和视频的巨型AI大脑,专门用于需要感知和操作物理世界的机器人。据TechNode报道,该模型在单一框架内统一了四项核心能力:根据文本提示生成3D环境、将现有机器人运动模式(轨迹)迁移到新环境、生成机器人执行任务的逼真视频,以及通用图像生成与编辑。
这项技术之所以重要,在于它直击当前机器人训练的一大瓶颈。目前,要让一个机器人学会在陌生的工厂车间里导航,或从杂乱的货架上抓取物品,工程师需要花费数周时间手动搭建仿真环境,调整物理参数,并运行成千上万次真实世界试验。而Robotics-U0可能将这一过程缩短到几分钟:开发者输入“左边有箱子、右边有货架、光线昏暗的仓库通道”,模型就能生成一个完整的交互环境,供机器人练习。
小米称,该模型能够“根据文本提示生成机器人可用的环境、将现有机器人轨迹适配到新场景同时保持运动模式、根据任务指令生成机器人交互视频,并利用互联网规模的视觉知识支持具身AI应用”。所谓“互联网规模”,意味着模型已经知道椅子、桌子、楼梯和箱子长什么样——无需从头学习物体几何。
该模型如何简化机器人训练流程?
传统的从代码到现实测试的流程包含四个痛苦步骤:工程师编写仿真程序、手动填充物体、配置物理参数,然后在真实硬件上运行数百或数千次试错迭代。每次迭代都消耗时间、机器人磨损和设施开销。

Robotics-U0直接攻击每个步骤。首先,具身场景生成让开发者输入类似“左边有马克杯、右边有水槽的厨房台面”的提示,就能获得一个完整的3D环境,其中物体已具备物理属性。其次,具身迁移将已记录的机器人轨迹(比如实验室中的抓取动作)自动适配到新的厨房环境——调整抓取角度、手臂高度和接近路径,无需手动重新设计。
第三,机器人交互视频生成能够产生机器人在生成环境中执行任务的逼真视频模拟。开发者可以在启动真实硬件之前查看机器人的运动。这能及早发现明显故障——比如一个轨迹可能会撞倒玻璃杯。第四,模型的通用图像生成与编辑能力允许开发者即时修改环境:“增加一个货架”、“把箱子颜色改成红色”、“把椅子向左移动2英尺”。
这些能力共同将原本数周的反馈循环缩短到几分钟。开发者只需一个上午就能迭代数十种环境和轨迹组合,然后将表现最佳的虚拟解决方案部署到真实机器人上做最终测试。
对人形和四足机器人意味着什么?
人形和四足机器人之所以训练难度大,是因为它们要在非结构化、混乱的环境中运行——今天在工厂车间,明天在医院走廊。每一个新环境都需要新的仿真资产和手动配置。Robotics-U0从文本生成多样化环境的能力,直接解决了这个泛化难题。
对于像Tesla Optimus、Figure 02或Unitree H1这样的双足人形机器人,该模型可以生成不同高度的楼梯、有腰部高度障碍物的杂乱房间以及不平坦的地形——全部来自简单的文本指令。这有助于更快地开发适应真实世界变化的运动控制器。对于Unitree Go2或Boston Dynamics Spot等四足机器人,模型可以生成草地、岩石小径以及不同地板表面的室内走廊。

考虑一下成本对比。如今,创建一个高保真仿真环境需要2–14天的工程师时间和2000–5000美元的人力成本,视复杂程度而定。而使用Robotics-U0,时间降至不到一分钟,成本仅需一次推理调用的算力——大约0.01美元的GPU时间。即使生成的仿真环境需要人工审核,节省的资金依然可观。
| 训练方法 | 创建环境所需时间 | 每个环境成本 | 真实感 |
|---|---|---|---|
| 手动3D建模 | 1–2周 | 2000–5000美元 | 高 |
| 真实物理设置 | 每天每个场景 | 500–1000美元 | 非常高 |
| Robotics-U0文本提示 | <1分钟 | ~0.01美元 | 中–高 |
真实感差距确实存在:AI生成的环境可能缺少某些影响摩擦、光照或材料属性的物理细节。但对于早期开发和快速迭代来说,这种权衡颇具吸引力。小米尚未公布独立的基准测试,但趋势很明确:创建训练环境的成本正趋近于零。
对机器人买家和开发者意味着什么?
对于开发人形或四足机器人的开发者来说,Robotics-U0降低了入门门槛。那些雇不起专职仿真工程师的小团队,现在可以用一台笔记本电脑生成训练环境。这可能加速整个人形机器人生态系统的创新步伐——更多初创公司、更快迭代,最终有更多能力更强的机器人更快投入生产。
对于在BotMarket的人形机器人销售页面评估选项的买家而言,这意味着采用此类方法训练的机器人可能在多样化环境中提供更好的开箱即用性能。买家获得的机器人可能不是在单一工厂布局中训练过的,而是在数十种场景中虚拟训练过的——仓库、医院走廊、办公大堂——全部由文本提示生成。
同样适用于四足机器人销售页面。经过AI生成地形变化训练的巡检和安全四足机器人,相较于仅在精心设计的仿真集上训练的机器人,预计能更可靠地应对真实世界障碍。
需要提醒的是:Robotics-U0是一个基础模型,而不是现成的训练流程。开发者仍需将其集成到仿真框架中(很可能是ROS 2或Gazebo),并且生成的环境在训练安全关键行为之前必须经过验证。但该模型标志着一个转变:为物理AI生成训练数据的成本正在趋近于零,这将改变机器人开发的成本结构。
常见问题解答
小米Robotics-U0模型到底是什么? Robotics-U0是一个380亿参数的多模态自回归基础模型——一个在文本、图像和视频上训练过的AI,能够生成3D环境、适配机器人运动路径、生成任务视频和编辑图像,全部服务于加速机器人开发。
Robotics-U0与其他机器人仿真方法有何不同? 现有方法需要利用CAD工具或游戏引擎手动构建3D环境。而Robotics-U0能够根据自然语言描述即时生成环境,并且可以自动将现有机器人运动数据适配到新环境。
这个模型可以用于任何机器人吗? 该模型输出环境和轨迹数据,可以导入Gazebo、Isaac Sim或MuJoCo等仿真平台。它与机器人硬件无关——任何使用标准仿真接口的机器人均可受益。
Robotics-U0是开源的吗? 小米尚未公布许可条款。考虑到其规模(380亿参数),即使开源,运行该模型也需要大量GPU资源——很可能需要一个NVIDIA A100集群或云服务等效配置。
开发者何时能用上? 小米宣布了该模型,但未提供发布日期或API访问时间表。根据公司以往模式,研究论文和可能的有限演示有望在6–12个月内推出。
这对机器人开发成本有何影响? 如果模型按描述运行,仿真环境的生成成本将从每个环境数千美元降至几乎为零。这可能将人形和四足机器人的整体研发成本降低30–50%(环境创建阶段),但现实世界验证成本不变。
结论
小米Robotics-U0本身不是一款机器人——它是一个能加速所有机器人智能化的工具。通过将数周的手动环境构建压缩成几秒钟的AI生成,它解决了具身AI开发中最昂贵的瓶颈之一。对于人形和四足机器人领域的买家和建造者来说,这预示着一个未来:机器人训练最困难的部分不再是搭建仿真环境,而是决定提出什么要求。










评论