师否
返回博客

从可编程到表现力:下一代 Agent 运行时如何重塑交互

2026年9月9日7 分钟

最近,我重新回顾了 Remio 在 PPT DSL 上的探索,也注意到 OpenAI 的 Artifact Tool(产物工具)正逐渐演进成一套专业的文档运行时。这些动向让我开始思考一个核心问题:下一代 Agent 系统的基础架构,应当更关注底层的“可编程性”(Programmability),还是更上层的“表现力”(Expressiveness)?

目前许多 Agent 系统的运行时(Runtime)设计,依然偏向为开发者服务。它们提供了丰富的 API、函数调用与脚本能力,这在灵活性和控制力上无可指摘。然而,这种“可编程优先”的思路,往往意味着用户(尤其是非技术背景的创作者)必须理解复杂的逻辑与数据结构,才能高效地使用 Agent。交互过程容易陷入反复的调试与指令澄清,体验并不理想。

相比之下,“表现力”则将关注点提升到了意图表达与结果呈现的层面。以 Artifact Tool 为例,它允许用户与 AI 协作,直接生成并迭代一份结构完整、样式丰富的文档(例如研究报告、数据看板或教学材料)。用户无需关心文档在后台是 JSON 对象还是 Markdown 文本,他们操作的是标题、段落、图表和引用这些直观的“表现元素”。

这种范式的转变,本质上是抽象层级的上移。Remio 的 PPT DSL 尝试,正是定义了一套描述“幻灯片”这一特定表现形式的领域特定语言(DSL)。DSL 的价值在于,它将复杂的底层操作封装成了与领域概念(如“幻灯片”、“版式”、“动画”)直接对应的简洁指令,极大提升了创建与编辑的效率。

要构建一个更具表现力的 Agent 运行时,我认为有几个关键点:

  1. 领域概念的原生支持:运行时需要内建对目标领域(如文档、表格、代码项目)核心实体和操作的抽象,而不是仅仅暴露通用的读写接口。
  2. 富状态与版本管理:表现力往往意味着丰富的状态(如样式、布局)。运行时需要能高效地管理、比较和回滚这些状态,支持用户轻松地进行“撤销/重做”和版本对比。
  3. 意图解析与映射:系统需要能够理解用户的高层意图(如“让这个图表更突出”),并将其准确映射为对底层状态和 DSL 的具体操作。
  4. 实时预览与流式交互:用户应能实时看到每一次修改的效果,并与 Agent 进行流畅的、多轮次的协作编辑,而非提交-等待-返回的批处理模式。

这让我联想到 SDD 文档驱动开发实战 中描述的,将需求文档直接作为 AI 理解与编码输入的工作流。其核心思想也是提升“表现力”——用结构化的自然语言文档(一种 DSL)来高效、明确地表达复杂意图,从而驱动下游自动化流程。同样,AI 画架构图总差点意思 这类工具,也正在尝试定义新的 DSL 来提升架构图生成的表现力与可控性。

未来的 Agent 竞争,很可能不再仅仅是模型智能的竞争,更是其背后运行时“用户体验层”设计的竞争。从“可编程”到“表现力”,标志着 AI 应用从“能执行”走向“易创造”的关键一步。构建更友好的 DSL、更强大的状态管理、以及更自然的意图交互,将是塑造下一代优秀用户体验的核心任务。