AI 快讯
编译自 the_decoder #机器人#模型训练#数据驱动
小米机器人训练新发现:更多数据比更大模型更有效,10万小时运动数据是关键
小米发布Xiaomi-Robotics-1,用10万小时人类手持夹持器运动数据训练机器人,发现增加数据比扩大模型更能提升性能。本文解读这一发现对中文圈机器人研发、数据采集和模型选择的启示。
一句话看懂
小米用10万小时人类运动数据训练机器人,发现增加数据量比扩大模型规模更能提升性能,且效果尚未饱和。
详细发生了什么
小米近期发布了机器人模型Xiaomi-Robotics-1,其训练数据来自人类使用摄像头手持夹持器采集的超过100,000小时运动数据,而非传统机器人操作数据。研究团队发现,在机器人运动控制任务中,增加训练数据量对性能的提升远大于增加模型参数量。尽管当前绝对成功率仍然较低,但性能提升曲线尚未出现饱和迹象,意味着继续增加数据可能带来更大收益。这一结论挑战了“更大模型更好”的普遍认知,为机器人领域的数据驱动方法提供了新思路。
中文圈视角
对中文圈机器人研发者来说,这一发现意义重大。首先,数据采集成本大幅降低:使用人类手持设备而非真实机器人,可规避机器人硬件昂贵、部署困难的问题。国内机器人创业公司(如宇树科技、星动纪元)可借鉴此方法,利用低成本传感器快速积累数据。其次,这暗示国产大模型(如DeepSeek、智谱)在机器人领域的应用策略可能需要调整——与其追求参数量竞赛,不如优先构建高质量运动数据集。不过,小米未公开模型细节和数据集,中文圈需警惕“数据规模”陷阱:单纯堆量而不控制数据质量(如动作多样性、环境覆盖)可能无效。此外,监管层面:若数据涉及人体动作捕捉,需注意生物特征信息合规问题。
几条值得记住的细节
- 训练数据规模:超过100,000小时人类运动数据,使用摄像头手持夹持器采集。
- 性能对比:增加数据量对性能提升效果显著优于增加模型参数量。
- 当前限制:绝对成功率仍较低,但性能提升未出现饱和。
- 应用场景:机器人运动控制,如抓取、移动等基础操作。
一句话总结
机器人训练中,数据量比模型大小更重要——低成本数据采集可能是中文圈机器人突破的关键。