Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
InfoQ AI · 2026/7/22 12:10:35
Jiuwen Symbiosis深度解析:从数字世界走向物理世界,为Physical AI打造Symbiosis (共生)

Jiuwen Symbiosis深度解析:从数字世界走向物理世界,为Physical AI打造Symbiosis (共生)

AI 中文解读
九文共生给AI装上了“手脚”,让它能从屏幕里走出来,听懂人话、看懂世界、自己动手干活。 以前让机器人干活,得像教小孩一样一步步写程序、调动作,环境一变就得重新教。现在这项技术完全颠覆了:你只需说“把左边那个黑色盒子放到右边架子上”,它就能自己看、自己琢磨、自己动手,还能边干边调整。遇到抓偏了或者放歪了的情况,它会自动修正,不用你操心。就像指挥一个经验丰富的工人,只说“做什么”,不用教“怎么做”。 这套系统把感知、规划和执行拆成了独立模块,比把所有能力塞进一个黑盒子更稳定、更安全。它通过持续观察环境、实时调整动作的闭环机制,在真实世界里干活就像人类一样眼手协调。 对普通人来说,这意味着未来家居、工厂甚至医疗场景会发生质变。家里有老人行动不便,跟AI说“帮我把药拿到床头”,它就能执行;工厂里工人不再需要编程知识,用自然语言就能控制生产线。技术门槛大幅降低,AI真正从“聊天工具”变成“干活助手”,将深刻改变我们的工作效率和生活方式。
Jiuwen Symbiosis 是一个能懂人话、看得见物理世界、控制四肢执行的 Physical AI Agent。用户不需要示教,只需像指挥一个经验丰富的工人一样,用自然语言下任务,它就能自己完成感知、理解、规划、执行。同时,对昇腾、鲲鹏算力具备天然亲和性,保障推理性能高效稳定。本文将对其技术进行详解。GitHub: https://github.com/openJiuwen-ai/jiuwensymbiosisGitCode: https://gitcode.com/openJiuwen/jiuwensymbiosisAI Agent 已经能够在数字环境中展现出不错的能力,比如写代码、查资料、调用工具、整理内容等。不过,这些能力大多仍停留软件与屏幕之内,还没有真正走进物理世界。 下一步的重要方向,是让智能体从“数字助手”走向“物理世界的执行者”。用户只需通过自然语言下达指令,智能体就能够结合对真实环境的感知与理解,自主完成相应的物理操作,并把任务在现实场景中真正落地执行。 OpenJiuwen 社区近期开源的 Jiuwen Symbiosis,正是围绕这一方向展开的一套面向 Physical AI 的 Agent 框架。它的目标不是简单地让 AI"动手",而是让 AI 真正读懂物理世界、自主操控现实环境,像一个熟练工人那样听懂任务、直接上手。这背后是一个看似简单、却很关键的转变——只告诉它做什么(What),不必教它怎么做(How)。在传统机器人系统中,要让机器真正完成一个任务,往往需要把流程拆解得非常细:通过示教器一点点记录轨迹、把动作顺序写成固定脚本,一旦任务或环境发生变化,就必须重新配置甚至重新编排整个流程。这种方式虽然可控,但泛化能力有限。 而在 Jiuwen Symbiosis 的设计中,这一模式正在发生变化。用户只需给出一个自然语言层面的任务指令,系统就可以在实际场景中自主完成理解与执行:它会识别环境状态、定位目标对象、进行任务分解与规划,并在执行过程中根据反馈动态调整。如果出现抓取偏移、放置不准确等情况,也能够进行纠正和再尝试,而不是严格依赖预先写死的步骤。 从使用体验上看,用户不再需要关心中间的执行细节,只需要表达最终目标,其余的理解、规划与控制过程由 Agent 自主完成。这种从“单向指令执行”到“任务协同完成”的变化,也正是 “Symbiosis(共生)”这一命名所表达的核心含义——人类与智能体在同一目标下分工协作,而不是简单的控制与被控制关系。 “人说一句,机器就把活干完”——要让这件事在真实世界里既稳定又安全地落地,究竟该如何实现?直接训练一个足够强的大模型,将感知理解、任务规划与动作执行全部交由单一模型来完成,是否就足以解决问题?为什么不把所有能力交给单一端到端大模型 先说结论:并不足以解决问题。将“感知理解 → 任务规划 → 动作执行”完整压缩进一个 Transformer,并通过端到端方式直接输出关节位姿,看起来是一条足够优雅的路线,但在真实机器人系统中仍然面临几个绕不开的关键挑战: · 跨本体、跨环境与跨任务的泛化能力有限。 当前主流端到端具身模型(如 VLA)通常与特定机器人形态和训练场景强耦合。一旦更换硬件平台或部署环境,甚至面对分布外的任务变体,往往需要重新采集数据并重新训练,导致整体成本高、迁移效率低,难以支撑规模化落地。· 长程复合任务能力不足。 在多步骤、长时序任务中,单一端到端模型往往缺乏显式的任务分解与子任务编排能力,也难以进行中途纠错与策略回退。本质上更多是在学习“轨迹模仿”,而不是具备在线规划与决策能力。· 成功率低、稳定性差。 当前具身端到端基础模型为典型的黑盒结构,直接输出关节位姿,大模型兼顾认知决策与运动控制,整体训练难度大,在真实物理系统中往往表现为稳定性不足、任务成功率低。 针对上述三大核心痛点,Jiuwen Symbiosis 提出以端到端智能体(Agent)系统替代传统单一端到端模型。两者的核心区别在于:该方案不再依赖一个黑盒模型统一完成感知、规划与动作执行,而是转向一种分层解耦的系统设计范式,具体而言:· 一是解耦本体、环境与动作执行模块,使系统在硬件形态或场景环境发生变化时,仍能稳定泛化迁移。· 搭建原子化工具库(Tool Library),通过工具组合完成复杂任务,依托组合泛化能力适配各类长时序复合作业;· 将感知、规划、执行拆分为独立可解释显式模块,统一运行于具备态势感知(Situation Awareness)的智能体循环链路中,内置实时视觉反馈与动态任务重规划机制。模块解耦使得端到端优化难度降低,显著提升系统稳定性与任务成功率。技术核心:态势感知循环(Situation Awareness Loop) 物理 AI 与数字 AI 之间存在本质差异。在数字世界中,即便对话或决策出现偏差,也可以通过撤回、追问或重新生成来修正结果;但在真实物理环境中,机器人一旦执行错误,轻则导致操作失败或路径偏移,重则可能造成设备损坏、生产中断,甚至引发安全事故。 更关键的是,物理世界本身是持续变化且不可完全回放的:物体可能被意外扰动,场景状态随时发生变化,机械臂也可能因为累积误差而无法精确到位……这些不确定性是常态,而非例外。 因此,Physical Agent 不能依赖“预先规划完整流程并一次性执行”的开环模式,而必须构建一个持续运行的闭环系统。在这一框架下,系统需要不断在“感知—执行”之间循环迭代:实时获取环境状态、推理并生成下一步动作、执行物理交互、再对执行结果进行校验与修正,并基于反馈持续更新后续决策。 这一闭环机制,正是 Jiuwen Symbiosis 的核心设计之一——态势感知循环(Situation Awareness Loop,简称 SA Loop)。整套系统通过多个关键环节首尾衔接、持续迭代,使智能体能够在物理世界中保持稳定运行与自适应能力,其完整流程如下: 九问物理感知→ 安全规划 → 物理执行 → 状态观察 → 观测反馈 →(回到感知) 下文将依次拆解各环节的核心功能与运行逻辑。 一、九问物理感知(Jiuwen Physical Perception):先看懂现场,听懂指令,输出结构化场景状态 本环节是 Agent 的感知器官,接收视觉、文本、语音等多模态输入,负责将非结构化的物理现场转化为结构化的世界状态,为规划层意图推理、任务编排与技能构建提供标准环境依据。除了进行场景理解、目标检测,感知模块还需要承担所有空间解算工作,输出可直接复用的标准化技能参数,使规划层无需开展任何空间推算与数值解算,仅负责逻辑决策与技能组装,实现感知与规划的彻底解耦。 在感知流程上,系统并行处理两个关键问题:看什么,与怎么看。相机同步获取 RGB 与深度信息,为空间解算提供高精度数据基础。与此同时,物体检测摒弃了传统的硬编码类别清单,转而采用开放词汇范式:只需将目标描述(如“黑色盒子”)以纯文本形式输入感知模型,即可完成定位与识别,检测对象完全由用户指令动态指定。 面向机器人实操场景,本模块统一将目标坐标投影至机械臂基座坐标系,自动解算抓取高度、接近位置、放置点位等核心参数,最终整合形成包含目标语义、位姿、置信度与可执行参数的结构化状态。感知层仅负责环境感知与参数输出,为规划层动态组装技能、校验方案可行性提供完备的前置输入。 二、安全规划(Safe Planning):大脑任务规划,安全校验 该模块定位为 Agent 的规划大脑,专注高层语义决策与任务编排,不参与任何空间解算。模块统一读取:用户自然语言指令、感知模块输出的结构化场景参数,以及系统内置的标准化 Skill 技能模板。首先在意图解析与任务拆解阶段,模块精准理解用户高层指令,将复杂任务目标拆解为逻辑闭环、时序有序的子任务技能序列。  然后进行动态技能构建:以通用 Skill 模板为基础,直接复用感知已解算完毕的位姿、抓取高度、放置点位等精确执行参数,将静态技能模板与当前环境、任务需求动态绑定,自动组装生成完整、带参的可执行技能指令,完成从 “通用技能模板” 到 “场景专属可执行技能” 的转化。 在此基础上,规划层同时内置物理约束与安全边界校检,对组装后的技能方案做可行性筛查,从源头过滤越界、碰撞、不合物理逻辑的无效动作。 这也是 Jiuwen Symbiosis 架构“扬长避短”的关键落点。若缺少感知模块的前置解算,规划层将被迫直接处理视觉空间信息,只能依赖通用视觉语言模型——而 VLM 在空间计算精度上存在天然短板,且鲁棒性弱于纯大语言模型。为此,架构采取了彻底的前置分离策略:将高精度几何测算工作完全剥离并交予感知模块,规划层由此从底层坐标运算中彻底解放,只需复用既定空间参数进行纯逻辑推演。这不仅从源头规避了大模型空间幻觉导致的误操作,更让规划层得以采用更为鲁棒的纯 LLM,而非受限于 VLM,进一步提升了决策稳定性。 三、物理执行(Physical Action):把规划平稳落地 该模块定位为 Agent 的“执行小脑”。规划通过了安全检查,就进入执行 —— 按 Skill 调用一个个 Action Tool 原子能力(位移、抓取、放置),把规划变成连续可控的物理运动:运动到位、闭合夹爪、抓起、放下。 其中 Action Tool 所有动作均以原子化函数形式封装(如 move_to_xyzr()、gripper_open()),每个动作独立、与环境解耦、与本体解耦,可自由组合为任意操作序列。相比端到端的小脑模型,原子化函数在执行层面具备更高的确定性、稳定性与成功率。 执行层的稳定性还来自两项设计约束。其一,能力与动作严格
分享
阅读原文