Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
雷锋网 · 2026/7/24 15:03:00

对话星炽动力CTO李达——PULSE架构:如何让具身智能更像人?

AI 中文解读
核心亮点:星炽动力的PULSE架构让家庭机器人不再只是冷冰冰的工具,而是能像个懂事伙伴那样,主动理解人的“小心思”和习惯,做出更贴心的反馈。 通俗解读:传统机器人只关注物理环境,比如识别桌子上的杯子和微波炉里的牛奶。但PULSE架构搞了个“双轨推演”——一条轨道看环境变化,另一条专门推演用户在想什么、打算做什么。比如,当男主人误以为牛奶还在微波炉里,机器人就能主动提醒“牛奶已经被拿出来了”。这种“读心”能力,其实是通过建立用户的意图、信念和偏好模型实现的。简单说,机器人不再等着你下命令,而是靠观察和积累,逐渐摸透你的日常习惯和情绪,在合适的时机主动帮忙。 实际影响:对普通家庭来说,这意味着未来家里的机器人不再是“智商低下”的摆设。它能在老人忘记关火时主动确认,在孩子玩耍时默默避开,甚至在你说“有点冷”之前就把空调调高。更重要的是,这种系统不需要云端随时介入,每台机器人都能根据自家生活习惯在本地“成长”,越用越懂你。这样一来,机器人被买回家后吃灰的几率会大大降低,真正成为家庭里一个察言观色的贴心伙伴。
端云协同 + 原生隐私设计,家庭机器人兼顾智能与安全 编辑丨李希 今年关于具身智能的讨论里,有一个问题始终绕不开:机器人进了家门,到底靠什么让人愿意留着它?工厂的逻辑很简单:干得准、跑得稳,得能运行,还能创收。但家庭场景不一样:一个动作失误、一次对意图的理解偏差,用户的心理容错率几乎为零——错一次,机器人就可能就被退货,或者放在角落吃灰。这个现实,让行业分出了两条路。一条路上的公司,继续死磕物理智能,让机器人能够无限接近理解物理世界;另一条开始往回退一步,先想清楚一件事——机器人要怎么理解人,才能在人身边待得住。星炽动力显然是后者。为了了解他们的想法,AI 科技评论和公司的 CTO 李达聊了聊。李达的履历并不神秘。中科院自动化所博士,师从谭铁牛院士,长期做视觉导航和连续学习,成果多次在领域顶级期刊发表,上过 IEEE TIP。进入星炽动力之前,李博士曾在自动化所工作学习十余年,学术底子算得上扎实,但他现在做的,是把这些积累倒进一个家庭场景里,重新审视一个被忽视很久的问题:机器人如果不懂人,凭什么跟人一起生活?“今天的具身大脑讲的更多的是‘环境动力学’——但我们不光要考虑物理环境的变化,也要把用户的状态推演出来。”讨论中,李达常常强调这一点。为此,星炽动力推出的 PULSE 架构,是把具身大脑拆成了“双轨”:一条轨跑物理环境的感知和推演,另一条轨跑用户状态的感知和推演。两条轨不是孤立运行,而是在特征层面做交叉验证。物理信息告诉机器人“环境怎么了”,用户状态信息告诉机器人“人怎么了”,两者合并,才能输出一个更靠谱的决策。家庭场景里,人不是环境里的一件物体,而是交互的中心。如果机器人的认知模型里只有桌子、杯子、沙发,却没有坐沙发的人的状态,那它永远只能做一个被动的命令行工具——人发指令,机器执行,像在用 CLI(命令行)操作一台机器。但在家里,如果老人、小孩没法很明确地提出指令,那么机器人是否就没法在家庭场景好好工作?怎么让机器人理解人?PULSE 的答案落在三个关键词上:意图、信念、偏好。意图是用户说了什么、做了什么,机器人能不能读懂。信念更有意思——李达举了一个例子:男主人认为牛奶还在微波炉里,但女主人已经拿出来了。男主人持有的是一个“错误信念”。如果机器人只盯着物理世界,它看到的是微波炉里没有牛奶,它不会理解男主人接下来要去做的动作是基于一个错误的前提。但如果机器人有能力表征人的信念状态,它就能主动提醒:“牛奶已经被拿出来了。”这种纠偏能力,才是家庭场景里真正有用的智能。偏好则更长期,涉及用户的习惯、边界、隐私,需要靠持续的交互来积累。这三者构成的理解模型,不是挂在系统外的一个附加模块,而是被李达团队直接嵌入世界模型的条件化输入里。用户状态被表征为隐空间的特征向量,以类似 token 的形式参与跨注意力计算,和环境特征做对齐。这个技术选择透露了一个清晰的价值判断:理解人和理解物理世界,在认知架构上应该是平权的,甚至人的优先级更高。为什么?因为落地节奏不同。物理世界太复杂,泛化太难。一个在80公分高的桌子上训练好的抓取模型,换到75公分的桌子上就可能失效。要在所有家庭、所有物品、所有光照条件下做到物理智能的通用,李达认为短期内难以实现。但人的理解模型不一样。虽然人也复杂,但人的行为在单个家庭里是有规律的。一个人每天喝水的杯子、回家的时间、说话的语气,都有迹可循。如果机器人能先在一个具体的家庭里把“这个人”理解清楚,它的可用性就会迅速提升。可用性上去了,用户的使用频率也就能够提升,拿着这些基于用户实际反馈的数据,星炽的机器人也可以借由这些和自家本体强耦合的真机数据,去进一步提升具身大脑的能力。不追求一个模型解决全宇宙的问题,先让机器人在一户人家里不出错、不惹人烦、偶尔让人觉得贴心。这个目标比通用物理智能近得多。PULSE 端云结合的落地策略也印证了这一点,云端负责全局迭代,端侧跑测试时适应——机器人在使用中遇到新分布的数据,直接在本地做调优,不用等云端回传。这种设计天然适配家庭场景:每个家庭都不一样,每个家庭的机器人都应该长出自己的理解模型。说到底,物理智能解决的是“能不能做到”,而人的理解模型解决的是“该不该做、什么时候做、怎么做才合适”。在家庭这个容错率极低的环境里,后者的优先级恐怕还要再往前排一排。这可能也是李达想表达的最核心的一句话:具身智能在家庭落地的关键,不是让机器人更像一个万能工具,而是让它更像一个懂得察言观色的伙伴。以下是 AI 科技评论和李达的对谈实录,AI 科技评论做了不变原意的编撰。▎AI 科技评论:能为我们讲讲 PULSE 架构的特点吗?李达:PULSE这个名字我们其实是有些寓意的。一方面,我们希望它是一个永续的、能够和人的价值对齐,并能够持续演进的系统。另一方面,"PULSE"这个词本身也有脉搏的意思。我们觉得机器人有了PULSE之后,就有了生命,也就能够真正地伴随用户一起成长。如果用几个词介绍 PULSE 的核心闭环,就是:看懂环境,理解用户,双轨推演,接受反馈,持续进化。当前行业内具身世界模型更关注环境动力学,也就是关注周围物理环境的演变。但是星炽动力主打 C 端家庭场景,就离不开和人的交互。所以我们希望能够让机器人具备“社会属性”。因此,我们在构建PULSE世界动作模型时,跨出了行业的第一步:不仅推演物理环境的变化,更要把“用户状态的变化”也推演出来。机器人在采取行动前,不仅要算清“杯子会不会掉”,还要推演出“这个举动会不会打扰到主人”。我们最终的目的,是赋予机器人真正的“心智”,但什么是心智呢?人的心智,是他在一个团体当中,我应该知道怎么去做才能更好的融入团体。所以我们也希望机器人不仅可以执行命令,还要懂得主动预判你的需求,贴合你的偏好,并且极其克制地尊重你的家庭边界等等。▎AI 科技评论:这可能和做情感还不太一样。李达:纯粹的“情感交互”往往停留在语言层面,通过聊天提供情绪价值和陪伴;而我们在星炽动力要做的是通过“心智理论(ToM)”,将家庭场景中高度复杂的“个性化”,转化为一个可计算、可训练、可验证的数学模型。这种基于心智的个性化模型,核心锚定在三个维度:信念(Belief)、意图(Intention)和偏好(Preference)。偏好依赖于机器人的长期情境记忆,而“信念”则是机器人理解人类认知偏差的关键。我举个非常经典的家庭场景:男主人把牛奶放进微波炉加热后离开,女主人随后将其取出。此时,不知情的男主人脑海中就产生了一个“牛奶还在微波炉里”的虚假信念(False Belief)。当他再次走向微波炉时,具备心智模型的机器人就能精准识别出这种“信息差”,主动出声提示甚至直接递上牛奶,完成认知纠偏。而在“意图”层面,我们不再满足于机器人只能听懂直接指令,而是要求它具备两项核心能力:一是“主动预判”,即通过用户的行为动作提前推断其潜在需求,做到“眼里有活”;二是结合“偏好对齐”,评估机器人的执行动作和分寸,是否真正符合该用户的心理期望。为了支撑这套复杂的认知中枢,在前期构建用户状态表征时,我们引入了基于自解释增强的多模态大模型来进行底层建模。▎AI 科技评论:要做个性化,记忆肯定是很重要的。李达:是的,记忆是个性化的基石。为了兼顾机器人响应的低延迟与理解的深度,我们在PULSE的记忆模块上,设计了一套自适应任务复杂度的“三层记忆架构”:结构化规则层、RAG(检索增强生成)语义层,以及底层的参数化模型层。比如最直观的结构化规则层,负责处理高确定性的物理时空检索。当用户问“我的剪刀呢?”,这是一个精准匹配的寻物指令,系统无需去激活庞大的底层模型做深层表征挖掘,直接在规则记忆库中调用即可。但如果用户的指令是模糊或高度意图化的,比如只说了一句“帮我倒杯水”,这就触及了“RAG语义层”。光靠规则是无法匹配这句指令的,系统需要通过 RAG 从过往的历史交互切片(Episodic Memory)中,检索出与“倒水”相关的语境与习惯(比如用什么杯子、常喝的温度),以此对齐当前意图。当面对更为复杂的长尾场景、深层的情感共鸣,甚至遇到毫无历史规则可循的突发状况(Zero-shot)时,就需要“底层模型层”的重度介入。通过大模型的认知推理与泛化能力,对长期沉淀的用户行为进行深度的因果归因与价值挖掘。这种层层递进的设计,确保了我们的机器人既能做到“极速响应”,又能做到“深思熟虑”。▎AI 科技评论:不仅有记忆,还得有更好的上下文语境理解。李达:对的,在家庭真实交互中,一句看似简单的“给我倒杯水”,本质上是一个“高维且高度模糊”的指令。它隐含了海量的决策分支:水温多少?什么杯子?纯净水还是电解质水?这些信息无法单纯靠死记硬背来提取,机器人必须具备基于时空上下文的意图消歧能力。这种能力的底层支撑,是我们PULSE架构中的“室内态势协同感知”模块。比如,当用户大汗淋漓地推开家门说“倒杯水”,机器人不应该只是机械地去接一杯温水,它需要瞬间完成两个维度的态势融合:第一是物理环境感知,通过物联网或环境传感器,获取当前的极热天气与室内高温状态;第二是用户状态感知,通过第一视角的视觉模型捕捉“满身是汗”的特征,甚至结合毫米波雷达提取呼吸心率等生理信号。获取这些多源异构数据在硬件层面并不难,真正的技术壁垒在于后端的多模态融合与跨域决策。基于这套感知,机器人不仅会决定递上一杯补充电解质的运动饮料,还会联动全屋智能生态——比如我们目前已经与海尔智家、涂鸦智能
分享
阅读原文