01/ 01
章节
封面

OrchTech
协律科技

基于 JEPA 世界模型的开放世界具身 Agent

Orchestrating  Perception · Prediction · Action

协律感知、预测与执行 —— 让机器人与环境、与人协律而行

The Thesis

具身机器人的核心命题,正从固定场景下的桌面级操作,迈向开放世界中的长程移动操作

而以 VLA、WAM 为代表的模仿学习端到端动作生成范式,正逐渐触及泛化性与长程富接触交互的瓶颈

长时程任务要求常识推理、几何理解、物理可行性判断、失败恢复与低延迟控制同时在线。把这些能力压进一次前向推理,往往导致失败原因不可辨识、推理与控制频率冲突、误差沿时程累积。

两条逐步清晰的技术主线

主线一 · AGENTIC

系统架构从更大的端到端动作模型,转向显式的分层分工

  • 2022
    SayCan · Code as Policies

    语言模型进入机器人决策栈

  • 2025
    Hi Robot · GR00T N1

    双系统成型:慢速语义推理 + 快速动作专家

  • 2026
    Pigey 提出 orchestration gap

    同一冻结 VLA 加入编排器,LIBERO-PRO 12.8% → 53.3%

  • 2026.07
    Gemini Robotics 2

    ER2 语义规划与进度跟踪,VLA 负责执行

主线二 · JEPA

世界模型从预测像素,转向预测世界更本质的变化,并与 motion planning 解耦。

  • 2022
    LeCun 提出 JEPA

    2018 年图灵奖得主提出:预测表征而非像素

  • 2024.02
    V-JEPA

    把「预测未来像素」替换为「预测未来表征」

  • 2024.11
    DINO-WM

    冻结视觉基座 + latent dynamics,验证 zero-shot planning

  • 2025.06
    V-JEPA 2-AC · 首次真机闭环

    百万小时视频预训练 + 62h 机器人数据

  • 2026.03
    LeWM · 端到端稳定训练

    仅两项 Loss、约 1500 万参数,规划降至 1 秒内

两条主线的完整技术 review 见 Data Room

协律科技首个提出以「关系 / Relation」作为核心世界表征,由 JEPA 世界模型担任独立预测层,构建从场景理解到长程富接触交互执行的 Agentic System

核心团队

HKUST Robotics 核心班底,整建制 PhD 团队。具备感知、理解、规划、控制系统级全栈能力,在开放场景交互式移动操作方面的积累处于业内领先水平

李玉麟
创始人 · CEO

李玉麟

战略 · 产品路线 · 预测器与规划器

哈佛访问学者 · 新国立博后 · 港科大博士 · UCSD 硕士

  • 移动操作 · 交互式接触与导航 · 物理仿真器 · 隐空间推理世界模型
  • 20+ 顶刊顶会,一作 7 篇
  • IROS 2025 移动操作最佳论文 · 最佳学生论文提名
陈凯
联合创始人 · CTO

陈凯

机器人总负责 · 技术架构与系统闭环

港科大博士后 & 博士 · 中科院大学硕士 · 戴盟联创 · 小鹏

  • 开放场景定位导航 · 复杂环境感知 · 全身运控 · 整机部署
  • 15+ 顶刊顶会,一作 5 篇
  • 李泽湘教授团队博士后 · 工具使用与灵巧手操作
曹嘉航
联合创始人 · 具身与生成式模型负责人

曹嘉航

具身模型总负责 · JEPA 预测器训练

港大博士 · 港科大硕士 · 上海 AI Lab

  • 世界模型 · 视觉语言操作 · 开放词汇导航 · 强化学习
  • 50+ 顶刊顶会(ICLR / NeurIPS / ICML / CVPR / ICRA),Google Scholar 900+ 引用
  • 2026 腾讯混元大模型专项博士生科研激励计划(全国 44 人)
马骏
首席科学家

马 骏

香港科技大学(广州)机器人与自主系统学域主任 · 长聘副教授

智能自动驾驶技术中心主任 · 国家级人才计划 · 90 后 4 年 Early Tenure

200+顶刊顶会
2700+Scholar 引用
70+组内成员
数千万项目经费

公司是马骏教授唯一绑定的产业转化平台,创始人为其第一位学生。核心团队同门并肩多年,决策与执行同频

组织架构

按三层 Agent 分工,各方向均有负责人牵头,层间以统一的动作意图对接

LAYER 1

场景

关系表征与场景结构化

于靖文负责人

港科大 ECE 博士(谭平教授 / 张宏院士)· 华为 2012 实验室 · 深圳市机器人视觉与导航重点实验室

11+ 顶刊顶会(IJRR / T-ASE / RA-L)· IROS 2025 OWN Workshop 最佳论文

LAYER 2

模型

JEPA 预测器 + 规划器

曹嘉航负责人 · 预测器

港大博士 · 上海 AI Lab · 腾讯混元专项(全国 44 人)

50+ 顶刊顶会 · Scholar 900+ 引用

黄稹敏规划器

港科大博后 & 博士(马骏 / 沈劭劼)· UCB 访问学者 · 广汽研究院 L4 自动驾驶

15+ 顶刊顶会,一作 5 篇(T-RO / T-ITS / T-VT / ICRA)

LAYER 3

动作

技能调度与跨本体执行

宋志城负责人 · 整机运控

港科大博士 · 哥大硕士 · 逐际动力 · 戴盟硬件负责人

轮腿机器人 · 可重构底盘 · 移动操作整机

毕志海移动操作

港科大博士 · 复旦硕士

19 篇顶刊顶会,一作 4 篇 · ALORE 一作

徐天遨灵巧手

ETH 硕士(Marco Hutter · RSL 实验室)· 新国立在读博士

足式强化学习控制 · 灵巧手遥操作与控制

产品 · 市场 · 运营刘映南曾任上市集团产品部负责人(五十余人团队)· 国内外双市场交付 · 超亿元销售额

三类动作生成范式与玩家分布

海外三类均有顶级机构推进;国内创业公司高度集中在前两类

视频规划

像素 / 图形渲染

01

作为视频规划器与逆动力学模型(IDM)联合使用,由渲染预测的未来视觉状态反推可行动作,常用于灵巧手操作。

WM 作为视频规划器与 IDM 联合生成动作

端到端规划

直接作为规划器

02

依靠大量专家数据覆盖任务分布,端到端生成动作,跳过机器人"感知-预测-规划-执行"闭环系统的中间环节,适用于固定场景固定任务。

WAM/VLA 端到端直接输出动作

预测 + 规划

作为可交互的预测器

03

基于 JEPA 的隐空间状态预测器 + 规划架构,预测器层理解不同动作下交互状态如何演化,规划层基于预测结果规划最优动作并完成闭环执行。

WM 预测器与 Planner 闭环规划

第三类将预测器与规划控制器解耦,兼顾 Model 作为预测器的跨场景推演能力与系统级高频鲁棒闭环执行能力。国内以 JEPA 走这条路线的,目前仅协律科技

基于 JEPA 世界模型的开放世界具身 Agent

分层不是单一架构,而是三类不同维度问题的叠加

三层 Agent 系统架构

场景

LAYER 1

世界是什么样,机器人应该做什么

基于 relation 的表征:从视觉、语言与 3D 信息中提取空间、拓扑、因果、通行与交互关系,过滤与决策无关的细节,只保留规划真正需要的信息。

模型

LAYER 2

做了之后会发生什么,据此该走哪条路径

基于 JEPA 的 planning:Predictor 学习「动作如何改变世界」而非「专家会怎么做」,天然覆盖开放世界的长尾交互;Planner 结合预测演化 optimize 最优动作意图。

动作

LAYER 3

如何以高频、稳定、安全的方式执行

动作意图驱动的技能调度:按意图调度技能库,结合全身控制完成跨 embodiment 闭环执行,执行结果回传上层继续判断与重规划。

差异化 01

Relation Driven 的表征积累

以 Relation 作为核心世界表征

学什么 · Relation 表征

世界最本质的表征不是像素,也不是把视觉、语言和物理属性全部塞进模型,而是机器人、物体与环境之间的关系。系统从视觉、语言和 3D 信息中提取空间、拓扑、因果、通行和交互关系。

怎么学 · JEPA

让 JEPA 学习这些关系在机器人动作作用下如何变化,再结合预测和规划产生动作。不以专家数据为前提,因此更容易迁移到新的任务、物体和场景。

场景关系表征

以椅子为例

不需要预测椅子移动后的每一个像素,只需要判断

01

椅子是否更靠近桌子

02

移开后通道是否打开

03

当前动作是否让任务更接近完成

既过滤了与决策无关的细节,又保留了规划真正需要的信息,使同一套模型可以跨物体、跨任务和跨场景复用。布料操作中的 topology,就是关系表征已经跑通的一个特例。

差异化 02

面向不同层级的分层协同系统

让不同尺度的问题,在合适的层解决

单体端到端模型

一个网络 · 包办所有尺度
场景理解关系推理几何细节力控制

协律 · 分层协同系统

上层 · 粗颗粒

跨任务迁移

任务目标场景关系交互顺序
底层 · 细颗粒

本体相关 · 高频闭环

抓取力度摩擦实时纠偏

尺度冲突

长程推理与接触控制,压进一个网络互相拖累

按尺度分工

上层泛化关系,底层泛化控制

误差无缓冲

仿真与现实的接触差异,直接传导为执行失败

底层吸收 gap

高频闭环解决真实接触差异

牵一发动全身

加技能、换本体,任何改动都要整套重训

各层独立迭代

升级单层即可,无需从头重训

壁垒 01

数据体系

面对开放世界无法穷举的任务空间,仿真交互数据是更低成本、更能泛化的路线

数据资产金字塔 仿真交互数据的规模化生成 覆盖广 · 通用性高(低特异性) 场景特异性强 · 专有价值高(高特异性) Tier 1 通用先验 Tier 2 仿真数据 Tier 3 真实场景 通用先验 Prior knowledge 网络场景数据 · 开放具身数据 场景分布与任务模式参考 先验辅助 仿真交互数据 Simulated interaction data 规模化 · 自有 · 可控 自动生成状态转移样本 部署校准 真实场景增量 Real-world increment 部署反馈 · 持续校准 仿真设定 Simulation setup 仿真 Rollout Simulation 结构化数据 Structured data 多样场景 办公室 · 零售 · 医院 布局与物理参数随机化 任务目标 初始状态 · 目标状态 任务约束与难度配置 候选动作 动作类型 · 连续参数 位移 / 旋转 / 接触点 虚线 = 时间推进 · 仿真器直接读取对象状态与接触关系 当前场景 + 执行动作 未来场景 Gt 结构化场景表征 对象状态与位姿 接触与交互关系 at 动作类型与参数 交互对象 时间步 Gt+n 演化后场景表征 对象状态真值 接触关系真值 JEPA 训练样本:(Gt, at) 条件预测未来隐状态 z,Gt+n 由仿真器提供监督真值。

模仿学习积累的是示教轨迹,会随任务与本体变更而贬值;关系表征与数据管线可跨物体、跨任务、跨场景复用,是真正随时间复利的资产。

壁垒 02

模型 × 机器人工程的复合 know-how

模型团队往往缺少运动规划、复杂接触、高频控制的经验;传统机器人团队能完成单点动作,却难以用模型实现跨任务泛化。

长程连续移动操作

真机连续搬运 32 把椅子、近 40 分钟不中断,全程实时纠偏

模型 · 抓取偏差自适应 / 控制实时调整工程 · 高频闭环 / 长时稳定运行

真实有人环境作业

办公场景边移动边操作,处理多重接触与扰动

模型 · 复杂环境感知工程 · 复杂多任务

灵巧手精细操作

物体旋转等接触丰富的精细操作

模型 · 接触自适应工程 · 灵巧手闭环控制

跨本体执行

同一策略直接驱动腿式整机完成同类任务

模型 · 跨本体策略工程 · 整机控制

单策略跨物体泛化

同一 policy 推形状、材质、重量各异的物体

模型 · 多物体泛化工程 · 鲁棒接触控制

模型泛化与机器人工程的深度耦合:既能应对变化与扰动,也能在复杂接触和长程任务中稳定运行。

里程碑

能力已分项验证完毕,下一步合并为最小系统闭环,并逐步走向场景落地

已实现 · 能力验证

长程移动操作

真机连续搬运 32 把椅子,稳定运行近 40 分钟

长时稳定性

跨物体与抗干扰

换任务、换本体、现场加重干扰,均鲁棒闭环

跨域鲁棒性

全身协同与灵巧操作

移动全身协同、接触丰富的精细操作、灵巧手技能库

复杂接触控制

JEPA + Planning 复杂操作

布料操作跨状态、材质、拓扑泛化,已实机部署

世界模型泛化

四项能力合并为最小系统闭环

规划中 · 落地路线

M1下一步

最小系统验证

轮式双臂真实场景 demo:推开门、台面清理、桌椅复位——模仿学习做不到的泛化与抗干扰

M2

商业场景落地

会议室整理、货架理货、订单拣选

办公 · 商超 · 零售

M3

跨场景泛化

泛 To C,开放式任务泛化

家庭 · 康养 · 办公

OrchTech
协律科技

附加: 为交互理解而生的全视轮臂系统

全视方案适配高交互场景

整机产品形态
全视轮臂系统整机产品形态
硬件模块爆炸图
全视轮臂系统硬件模块爆炸图

🤖 轮臂集成本体

紧凑本体 · 适配近人空间

轮式底盘与双臂紧凑集成,统一调度移动与操作,支持双臂协作。机身适配商超、家居、柜口等受限空间,单体完成完整交互任务。

📡 全视多模态感知

全视冗余 · 消除交互盲区 · 多模态融合 · 鲁棒于环境变化

传感器围绕操作半径布局,360° 覆盖机器人、目标、人与关联物。多视角视觉 + 点云 + 本体状态交叉验证,消除贴身盲区。

⚡ 交互监督生成器

完整观测 · 结构化监督数据

从完整交互观测自动产出高质量监督数据,反哺交互世界模型,形成感知—动作—结果全链路数据。