# AI交互的革命：从操作现有软件，到生成未来软件

> 作者：晨旭｜发布：2025-11-26｜系列：入门系列文章
> 来源：https://chenxu.xin/writing/ai-interaction-revolution-genui

从 API Agent 到 GUI Agent 再到 Generative UI 的三重境界：理论上的分歧与趋同、理想同学双脑协同的工业实践，以及 Google 让 AI 现场造软件的第三条道路。

---

如果把 AI Agent 比作一个数字世界的打工人，那么它的进化史就是一部工具使用史。

最开始，它像个程序员，通过代码接口（API）在后台默默搬砖；后来，它学会了像人一样看屏幕（GUI），点鼠标、刷手机；而现在，Google 带来了一种全新的可能——它不再满足于操作别人写好的软件，而是开始根据你的需求，现场为你生成一个软件。

最近我结合关于 API Agent 和 GUI Agent 的理论框架、理想汽车的硬核实践以及 Google 最新的 Generative UI 研究，深度复盘了这场正在发生的 AI 交互范式革命。

文章会分为三部分展开，从理论到实践再到 Google 的生成式软件新范式。

## 一、API Agent 和 GUI Agent 的分歧与趋同

### 1、API Agent：高效但高冷的程序员

这是 AI Agent 最早被工业界广泛采用的形态，也是目前大多数企业级应用的基础。

在论文《API Agents vs. GUI Agents: Divergence and Convergence》中，这种模式被称为 API-First。它的逻辑很简单：开发者预先定义好一系列标准接口（工具），AI 根据用户指令，像拼乐高一样调用这些接口。

**它的强项是极速与精准**。比如你想查天气或买股票，API Agent 不需要打开网页、等待加载，直接发送一个请求，几毫秒就能拿到结构化的数据。

**它的软肋是受限**。AI 的能力边界完全取决于开发者开放了多少接口。如果一个 App 没有开放 API（比如大部分手机应用），那个能力对 AI 来说就是隐形的。

### 2、GUI Agent：像人一样看世界的操作员

为了突破 API 的限制，AI 开始进化出视觉能力。这就是 GUI Agent，它试图模拟人类的操作逻辑。

这种 Agent 不需要软件提供后门，它是走正门的。它利用多模态大模型直接看屏幕截图，识别按钮位置，控制虚拟鼠标进行点击和滑动。

**它的突破是通用性**。理论上，只要人能用的软件，GUI Agent 都能用。这解决了长尾应用无法接入 AI 的难题。

**它的挑战是慢且脆弱**。模拟点击需要多步操作，速度慢；而且一旦软件改版，按钮换了位置，AI 可能就会点空。

## 二、工业实践验证：理想同学的双脑协同

此时，业界达成了一个共识：完美的 Agent 是混合的——用 API 保证核心任务的效率，用 GUI 兜底长尾任务的覆盖。

理想同学团队在智能体落地实践中就使用了这个非常典型的混合智能体架构。为了应对车内复杂的交互需求，理想并没有只赌一条路线，而是让 AI 长出了两个大脑。



### 场景一：MCP——此时，它是严谨的工程师

想象一下，你在高速上开车，突然觉得热，说了一句：「空调调到 23 度，打开座椅通风。」

这时候，起作用的是 API Agent（在理想架构中称为 MCP）。

- **任务特点**：涉及车辆硬件控制，要求极低延迟和绝对安全。
- **执行逻辑**：智能体不需要「看」屏幕，而是直接通过一条看不见的数据专线，向车辆底盘和空调控制器发送指令代码。
- **结果**：毫秒级响应，精准无误。这是传统车企最擅长的领域。

### 场景二：CUA——此时，它是贴心的生活助理

但如果用户说：「帮我点一杯星巴克的热美式，大杯，送到公司。」

这就触碰到了传统车机的盲区。星巴克 App 是第三方应用，界面经常改版，且未必愿意给每家车企都开放底层 API 接口。这时候，理想的 GUI Agent——CUA（Cockpit Using Agent）就登场了。

CUA 就像一个住在屏幕里的隐形人，它的操作流程和人类一模一样：

- **看见**：CUA 实时截取车机屏幕的画面。它利用多模态大模型「看」懂了当前是星巴克 App 的首页，识别出了「啡快」和「专星送」的按钮位置。
- **思考**：结合用户的指令，它决定下一步动作是点击「啡快」。
- **操作**：它生成一个虚拟的点击信号，点在屏幕坐标上。
- **多步交互**：页面跳转后，它继续「看」，找到了美式咖啡；看到杯型选项，根据用户说的「大杯」自动勾选；最后点击去支付。



为什么说这是巨大的突破？这意味着，理想汽车不需要去要求美团、抖音、微信给它开接口。只要这个 App 能在车机屏幕上显示，CUA 就能通过「看」和「点」来操作它。

### 小结：从「能用」到「好用」的最后一步

理想同学的架构给我们展示了未来 AI 终端的终极形态：

- **下限由 API 守住**：车控、导航等核心功能，用 API 保证稳、准、快。
- **上限由 GUI 突破**：拥有 72.7% ScreenSpot 能力的 AI（Gemini 3 Pro 的最新 Benchmark 分数），能搞定所有长尾的、复杂的第三方 App。

这就是双脑协同。AI 既能像程序员一样写代码调接口，也能像普通用户一样看界面点按钮。正是这种混合架构，让智能座舱真正从一个「命令执行器」进化为了「全能管家」。

## 三、Generative UI：从操作者跃升为创造者

正当人们以为 API 加 GUI 就是终局时，Google 用 Generative UI 开启了第三条道路。

这也是这场革命中最颠覆性的部分：如果现有的软件界面不适合当下的任务，为什么不让 AI 现场造一个？

在 Google 最新的研究《Generative UI: LLMs are Effective UI Generators》中，AI 不再是一个卑微的操作员，去适应那些死板的菜单和按钮；它摇身一变，成为了创造者。

### 1、场景重构：不再是找功能，而是造功能

**传统模式（操作软件）**：用户问「我想买双鞋子」，GUI Agent 会帮用户打开淘宝，输入关键词，模拟点击筛选按钮。用户依然是在逛一个通用的货架。

**GenUI 模式（生成软件）**：AI 会分析用户的需求，利用其 Agentic Coding 能力，现场写代码，生成一个专属于每个用户的选鞋网页。这上面只有用户关心的尺码、配色对比和交互式 3D 模型，没有其他干扰。

### 2、交互升维：告别枯燥的文本墙

目前的 ChatGPT 给用户的大多是 Markdown 文本。而 GenUI 生成的是活的界面。

Google 展示了一个案例：用户问「RNA 聚合酶是如何工作的」。AI 没有扔过来一堆定义，而是生成了一个交互式分形探索器。用户可以拖动滑块，实时看到几何图形的变化。这种直观的认知效率，是文字永远无法比拟的。



### 3、千人千面：流动的 UI

未来的软件界面将不再是固定的。对于同一个问题，如果是专家，AI 生成的界面可能充满数据图表；如果是小朋友，AI 生成的界面可能充满了卡通动画和游戏化元素。

UI 变成了像水一样的流体，随需而变。

## 最后：AI 交互的三重境界

回望这条进化之路，我们可以清晰地看到 AI 角色的转变：

- **API 时代**：AI 是连接器，连接人类意图与既有的程序代码。
- **GUI 时代**：AI 是模仿者，模仿人类行为，笨拙但努力地操作着复杂的软件世界。
- **GenUI 时代**：AI 是重构者，打破了软件的固有形态，让界面臣服于意图，实现了从「人适应软件」到「软件适应人」的终极反转。

这场从操作到生成的革命，才刚刚开始。

## 核心结论

- API Agent 极速精准但能力边界完全取决于开发者开放了多少接口；GUI Agent 通用性强但慢且脆弱，软件一改版就可能点空。（判断 · 把握较大）
  永久链接：https://chenxu.xin/writing/ai-interaction-revolution-genui#api-vs-gui-tradeoff
- 完美的 Agent 是混合的：用 API 保证核心任务的效率守住下限，用 GUI 兜底长尾任务的覆盖突破上限。（判断）
  永久链接：https://chenxu.xin/writing/ai-interaction-revolution-genui#hybrid-is-the-consensus
- 理想的 CUA 证明了一件事——只要 App 能在屏幕上显示，Agent 就能通过看和点来操作它，不需要要求任何第三方开放接口。（判断）
  永久链接：https://chenxu.xin/writing/ai-interaction-revolution-genui#screen-as-universal-interface
- Generative UI 实现了从「人适应软件」到「软件适应人」的反转：界面不再固定，而是根据意图现场生成。（判断）
  永久链接：https://chenxu.xin/writing/ai-interaction-revolution-genui#genui-inverts-adaptation
- AI 的角色经历了三重境界：API 时代是连接器，GUI 时代是模仿者，GenUI 时代是重构者。（判断）
  永久链接：https://chenxu.xin/writing/ai-interaction-revolution-genui#three-stages-of-ai-role

---

本文出自晨光里的AI（https://chenxu.xin），作者晨旭。
引用时请保留来源链接。文中标注「判断」「假设」的部分是作者的个人看法，不是事实。
