Daily Tech Briefing
AI 科技速览
每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。
爱范儿 · 2026/8/3 09:00:36
机器人刷一段「短视频」,就能学会新技能?自变量 HOST 技术「神器」来了
AI 中文解读
核心亮点:机器人现在只要刷一段几十秒的人类演示视频,就能立刻学会叠袜子、整理餐具这些新家务,速度比传统方法快了500倍,而且还不忘本,学完新技能也不会丢掉老本事。
通俗解读:过去教机器人干新活,得像给运动员特训一样,先让工程师远程遥控机械臂反复练上50遍,再把数据喂给AI“炼丹”好几个小时。现在这套叫HOST的新技术,就像给机器人配了个“刷视频”的脑子。它不硬抄人类的动作,而是边看边理解“做到哪一步了”,然后自己想象目标画面该怎么实现。更厉害的是,它全程不用改内部设置,就像看菜谱做菜一样,每道菜的做法分开放,互不干扰。
实际影响:如果这项技术成熟,未来你买回家的家务机器人,不用等工程师上门“开小灶”,你拍一段自己叠衣服、擦桌子的视频发给它,它看一遍就能上手。机器人从“个别定制”变成“看视频自学”,家里添个全能帮手的日子就真不远了。
教会一台机器人叠袜子,一共分几步?
摊平、对齐、折叠,再将袜口翻过来,这些看似简单的动作,过去机器人要学会,往往需要四五个小时的训练。但现在,只需一段数十秒的演示视频,就能快速掌握。
好家伙,这是哪来的东方神秘力量?
最近,自变量机器人发布了一套名为 HOST 的机器人学习框架。HOST 全称为 Human-to-robot One-Shot Skill AcquisiTion,也就是「人类到机器人单样本技能获取」。
有了它,机器人只要看一段 29 秒的人类演示短视频,就能当场上手干活,期间甚至完全不需要更新模型参数,也不必专门采集几十条机器人遥操作数据。
不仅技能获取速度比最快传统方案飙升了 500 倍,连成功率都实现了反超。更简单粗暴点说,高冷死板的机器人,光靠「刷视频」就能进化为全能管家。
机器人学习做家务,进入「刷短视频」时代
别看如今的具身机器人能文能武,各个都是练习时长两年半的练习生,但熟悉机器人的圈内人都知道,以前让 AI 学干一件新家务,到底有多费劲。
目前常见的模仿学习方案,仍依赖数据采集与模型微调。
怎么教?先请个专业工程师坐在遥操作台前,像玩极品飞车一样,手把手控制机械臂干上 50 遍。
这就完了?早着呢。这几十条数据还得拿去给模型做监督微调(SFT),一通离线「炼丹」下来,少说也要花上 4 个小时。
如果机器人真进了千家万户,同样是整理桌子,涉及的动作可能完全不一样。难道每碰上个新活儿,都得呼叫工程师上门服务,再等几个小时?
这笔账,怎么算怎么离谱。
但 HOST 这套方案,则对传统流程带来了明显改变。研究团队搭建了一个双臂机器人平台,测试了 50 项训练阶段从来没见过的全新任务(比如放水果、堆碗、擦盘子、插笔、叠袜子)。
不采集数据,不改通用参数,只给机器人看一段人类普通演示视频。结果它在 50 项新任务中全都有成功记录。在主要的测试任务中,仅观看一次数十秒的人类演示视频,学会技能的平均成功率达到了 62%!
AI 之间的差距有多大,直接看数据吧。
当前最强的微调基线,需要专业人员遥操作机器人完成 50 条示范,从采集数据到训练出新技能,通常要花 4 小时。HOST 让机器人只需要观看一段平均 29 秒的普通人操作的视频,不需要反复演示和微调,就能学会新技能。
相比监督微调的方案,HOST 需要的示范数量降至五十分之一,技能获取时间较最快的 SFT 基线缩短约 507 倍。
这下,机器人是真体验到了人类那种「看一遍就会」的快乐。
不再模仿人类动作,而是想象结果、反推动作
你可能会问:让机器人看视频,不就是对着人类动作照猫画虎吗?
真没那么简单。人和机器的「手速」能一样吗?视频里人类小哥 2 秒钟就把杯子拿起来了,机器人的铁胳膊可能需要 5 秒。
如果硬卡视频播放时间,视频里的人都开始倒水了,机器人还在那瞄准杯把手呢,任务步骤越多,双方的偏差也会越明显。
于是 HOST 的研究团队想了个绝招:不看时间,看进度。他们把视频画面和机器人的动作,映射到同一个叫「向量空间」里,然后用动态时间规整算法自动对齐。简单说,就是给任务打上进度条。
不管人类用了 2 秒还是机器人用了 5 秒,只要双方都进入了「杯子已经被拿起」的状态,进度就算同步。这种操作,让进度误差从 0.079 暴降到了 0.006,直接缩小了一个数量级。
这时,聪明的你可能又会想到一个问题:即便节奏对上了,人类与那些「铁疙瘩」之间仍然存在明显的身体结构差异。
比如人的手掌可以贴合杯壁,机器人的夹爪需要寻找合适的夹取位置。人可以捏住袜子的一角,机械臂还要考虑夹爪开合、运动角度和两只手臂之间的配合。
让机器人直接复制人类动作,很难得到有用的结果。
对此,HOST 想出了一套非常巧妙的解决思路:先让机器人从人类执行完任务的结果,「想象」出机器人执行完任务的画面,再根据画面反推出机器人需要动作的动作。为实现这个方案,HOST 还设计了一个核心策略模型——双专家 MoT 架构。更通俗点理解,就是它有两个分工明确的大脑,一个「视觉大脑」负责理解视频、定位进度和预测未来场景,另一个「动作大脑」负责把视觉目标变成机器人动作:
视觉大脑(Localization & Vision):先看懂机器人干到哪一步了,对应的人类视频到哪一步。然后根据人类动作结果,脑补出将这个画面转换为机器人视角应当看到的画面(比如想象出水杯被夹爪拿起的画面)。
动作大脑(Action):负责把脑补出的机器人画面变成现实,计算机械臂怎么动才能达到目标。
不强行模仿人类手臂的角度,只盯着需要实现的最终效果,然后从最终效果想象出动作。这样就绕过了「让机器人模仿人类动作」这个最难的跨越。
当然,「单样本技能获取」容易让人产生误解,以为机器人此前完全没有接受训练。
但其实这里的 one-shot 指机器人面对一项新任务时,只需要接收一段人类演示,整个任务都是在「推理过程」中完成的,无需再为这项任务更新模型参数。支撑这种能力、让机器人能从视频学习的基础模型,依然经过了大规模训练。
机器人出厂前可是见过大世面的。
第一阶段主要使用机器人数据。会团队先喂给它 193462 条机器人轨迹以及对应的机器人执行任务视频(涵盖 229 项任务),让它尝试从机器人的任务视频中想象出结果,再拆解出自己这副钢铁身躯怎么动。
第二阶段再加入人类与机器人的配对数据。比如用 5847 段人类任务视频和对应的机器人轨迹配对,让它学会把人的执行任务的画面翻译成机器的视角,好从人类视频学习。
先利用规模更大的机器人数据建立任务理解和预测动作结果的能力,再用数量相对较少的人机数据完成能力的迁移,这样的好处是可以充分利用数据、降低对人机配对数据的依赖。
而出山之后,再遇到新任务,直接把人类视频当操作指南,边看边干就行。
学会叠袜子,也没忘了洗盘子
掌握新技能只解决了一半的难题,更关键的是,机器人学会新技能后,原来的能力能否保留,同样决定了它能否长期「有用」。
这就涉及到机器人一个极其令人头痛的痛点:灾难性遗忘。比如用后训练微调教机器人,会改变模型的参数、侵蚀模型原本已经学会的技能。这会导致「狗熊掰棒子」,看似学会了叠袜子,但以前很溜的洗盘子反而退步了。
论文中也注意到了这个问题。论文选取了七项来自训练集、模型此前已经掌握的任务,包括取出瓶子、对齐袜子、堆叠杯子、整理包装材料、盖住中央物体、放置纸巾和排列花朵。
研究人员先测试 HOST 与三种监督微调基线在这些旧任务上的表现。随后,三种基线通过监督微调学习新任务,HOST 则通过一段人类视频获取新技能,再重新测试各自的旧任务表现。
在旧任务测试中,三种微调基线几乎被「灾难性遗忘」打回原形。学完新任务后,π0.5+SFT 只保留了原有表现的 17%,就连旧技能保留率最高的 Wall-OSS+SFT,也只保住了 40%。
但 HOST 因为全程没改模型的脑回路(参数),旧任务表现基本没受影响,比最好的微调基线高出了整整 59 个百分点!
在 HOST 眼里,那段人类视频就像一份可以保存和再次读取的「菜谱」。今天叠袜子,翻开第一页;明天理餐具,读第二页。技能随时调取,互不干涉。
而且,这种机器人的学习方式极其「抗造」。
研究团队设置了光线变化、替换同类物体、更换操作场景和执行过程中移动物品等干扰。
HOST 在标准环境中的平均成功率为 62%。改变光照后下降 1 个百分点,替换物体后下降 4 个百分点,更换场景后下降 6 个百分点,执行中人为移动物品后下降 9 个百分点。最后一种情况下,平均成功率仍达到 53%。
这还有个冷知识,物品被临时移动后,原有动作计划已经失效。但 HOST 会根据新的观察结果重新判断任务进度,再生成对应动作。这说明它真正理解了任务,在动态规划每一步,而不是在「背」动作序列。
全面开源「技术家底」,普通人也能教机器人干活儿
老实说,62% 的成功率,距离进工厂干活儿还有提升空间。反而是在家庭场景,不太关心单次成功率,更关心泛化性,也就是「多摸索几次没关系,最后做成了就行」。 HOST 的出现,让行业看到了一条具身智能极其性感的落地路线。
2023 年底成立的自变量机器人,算是国内死磕「完全端到端路线」的具身智能硬核玩家,至今发布并开源的各种技术,已经「多如牛毛」。
研发范围已经覆盖具身智能的 VLA 基础模型、世界模型、用来拆分动作的「动作分词器」、训练模型的底层「神经网络优化器」、数据采集系统和机器人本体。自变量不仅发布基础模型,还延伸到用来训练模型的底层基础设施。
今年 4 月,他们发布了从零联合训练的具身大模型 WALL-B,采用独特的「世界统一模型」架构,已经部署在机器人里,在大量用户家庭做起家政服务。后来又发布了世界模型 WALL-WM,还开源了 VLA 模型 WALL-OSS-0.5,后者已经被很多科研机构用起来了。
在机器人本体上,自变量已经自研并量产量子一号、量子二号。机械臂、关节模组、动力驱动器和主控制器等核心部件均为自主研发,并与算法深度适配,为机器人进入家庭和工业产线提供了载体。
今年 3 月起,自变量又与 58 到家合作,让机器人与保洁人员共同进入普通家庭提供服务。5 月推出的「X 家庭成员计划」,还让机器人在用户家中连续驻留一个月,接受真实、随机家庭需求的检验。
「从零开始」训练具身模型,在具身智能领域有相当高的门槛。真正能在国内从零预训练出好的具身模型,还搭建起从数据采集到模型训练的整套管线的,更是廖廖无几。
购买现成模型、拼接几个模块,可以更快做出演示 Demo。真正从基础架构起步,意味着团队需要自己解决模型设计、数据生产、分布式训练
分享
阅读原文 ↗