TAO Framework

安克创新创始人阳萌提出的、阐释智能体与物理/数字世界进行循环交互的系统框架,同时隐喻中国哲学中的“道”(TAO)。

核心结构

TAO 框架将智能体的任何智能行为拆解为三个连续交互的维度:

  • T (Task,任务):智能体所需要完成的目标与方向,贯穿始终。
  • A (Action,动作):智能体在某一时刻采取的具体行动。在语言模型中是输出下一个 Token;在具身智能中是执行机构的物理动作。
  • O (Observation,观察):行动作用于环境后,智能体对环境所发生改变和新状态的感知。

VLA 模型与世界模型的双向映射

在具身智能(Embodied AI)的技术闭环中,TAO 框架揭示了两大底层模型的本质关系:

  1. VLA 模型 (Visual-Language-Action Model):
    • 机制:实现 O ➔ A 的映射。
    • 职责:在当前的 Task 指引下,根据目前的感知状态(Observation),推导智能体应该采取的下一步行动(Action)。
  2. 世界模型 (World Model):
    • 机制:实现 A ➔ O 的映射。
    • 职责:预测并推演在特定状态下采取了某种动作(Action)后,物理世界将会如何反应,演进出什么样的新状态(Observation)。

语言与机器人的数据差异

  • 语言的天然合一:文本和语言数据天生就融合了 Task、Action(下一个 Token)和 Observation(前文状态对当前 Token 的影响)的双向关系,因此语言模型容易学得极具泛化性。
  • 机器人数据瓶颈:物理机器人领域目前极度缺乏这种将 Action 与真实物理环境变化 Observation 双向结合的闭环 TAO 交互数据,这制约了端到端具身大脑的发展。具身智能的终极理想是训练出高度符合闭环 TAO 循环的物理基础模型。

Source: 2026-06-22-youtube-youtu-be-kBsqirnWTpI-si-Pf8YGH4F4Pu81o7S(来源未公开)