# PM视角解读《State of AI Report》年度报告：过去12个月的重大进展和十个预测

> 作者：晨旭｜发布：2025-10-20｜系列：入门系列文章
> 来源：https://chenxu.xin/writing/state-of-ai-report-pm-view

把第八份《State of AI Report》拆成 PM 能用的东西：推理与智能体的技术前沿、收入与毛利率的商业现实、搜索被颠覆后的用户行为，以及安全这块最容易被欠账的部分。

---

最近，由 Nathan Benaich 和 Air Street Capital 团队发布的第八份年度《State of AI Report》正式出炉。这份报告以其全面、深入的分析，再次成为我们理解 AI 领域进展的重要参考。

作为一名 AI PM 的学习者和实践者，我从 PM 的视角出发，帮助你提炼出报告中的关键洞察。

一共分为四大部分，依次从技术、产品、商业、成本、用户、安全等方面展开。每一小部分先总结报告内容，再从 PM 的视角解读应该如何行动，文章最后附上报告中的十个预测。

我收获最多的是关于安全和硬件部分。感觉就像高中数学中的选修部分，平时花的心思并不多，但考试必考，最后复习时（交付产品时）是最痛苦的，因为平时没花心思。

## 一、技术前沿与产品能力的提升

### 1. 推理模型优先

**报告指明**：「推理能力」是过去一年定义性的突破。不再是简单的「问答机」，AI 正进化为具备「思考」能力的伙伴。OpenAI（o1、GPT-5）、Google（Gemini 2.5 Pro）、Anthropic（Claude 3.7 / 4.1），甚至中国的 DeepSeek（R1），都在将「先思考后回答」的能力注入产品心脏。

它们像拥有了「草稿纸」（如思维链 CoT、并行推理），在处理代码、科学计算、数学等复杂任务时，表现出前所未有的鲁棒性。GPT-5 能「通关」大学生编程竞赛 ICPC，这背后是推理能力的质变。

**PM 行动指南**：

- **功能重塑**：不能只满足于做个「信息搬运工」。在需要深度逻辑的产品场景（编程助手、科研工具、复杂决策支持），推理能力是核心竞争力。
- **拥抱透明**：利用 CoT 的过程可见性。虽然 CoT 并非完美（有「监视税」和忠实度问题），但让用户看到 AI 的「思考过程」，是建立信任、便于调试的关键。
- **审慎评估**：报告警示我们，现有基准测试很脆弱。AIME 这样的测试对各种细节极其敏感，结果波动巨大。别被单一分数迷惑，建立更贴近真实场景、更多维度的内部「体检」标准至关重要。

### 2. 智能体和世界模型走向实用

**报告强调**：AI 智能体、世界模型和领域专用工具（代码、科学、医学）已变得「真正有用」。智能体系统通过工具调用、多步推理和规划，能够完成日益复杂的任务。

- **世界模型打开新次元**：Google DeepMind 的 Genie 3 和 Odyssey 已经能生成可实时交互、分钟级连贯的虚拟世界，这是训练具身智能体的雏形。Dreamer 4 甚至能在「梦境」中学习，用少量数据就在 Minecraft 里挖到钻石。
- **AI 变身科研合伙人**：DeepMind 的 Co-Scientist、Stanford 的「虚拟实验室」、DeepMind 的 AlphaEvolve 都在药物发现、材料科学、算法优化等领域，展现出从假设到验证的端到端能力。

**PM 行动指南**：

- **布局 Agentic Workflow**：正如 Karpathy 所言，这是「智能体的十年」。PM 的核心战场将转向 Agent 的上下文工程和智能体架构设计。如何让 Agent 更好地感知、规划、记忆、使用工具、执行和反思，将是产品设计的关键。
- **关注世界模型**：这可能是下一代模拟器、游戏引擎、机器人训练场。

### 3. 从静态预训练到动态持续学习

**报告指明**：AI 的学习不再是「一劳永逸」的预训练，而是越来越趋向于「边用边学」的动态适应，从静态的「一次性预训练加离线微调」转向更动态的「即时适应」。

- **测试时微调（TTT）**：AI 能在和你对话的瞬间，根据你的问题「临时抱佛脚」。TTT 通过主动学习选择少量关键信息进行即时微调，让小模型也能爆发出惊人潜力。
- **高效微调（PEFT）**：LoRA / QLoRA 极大降低了微调成本（训练参数减少 10 到 50 倍），使得更频繁、更轻量级的模型更新成为可能，目前已成为任务和领域适配的首选。

**PM 行动指南**：考虑如何利用动态适应技术提升产品的个性化和时效性；技术选型上，LoRA / QLoRA 是当下性价比之选，TTT 代表更自适应的未来方向。

### 4. 数据质量优先于数量

**报告再次敲响警钟**：高质量、多样化的数据集能让模型用更少的「学费」达到更高的「分数」。LILO 等方法甚至能智能挑选「最有营养」的数据来喂给模型。

**PM 行动指南**：AI PM 必须具备 AI 1.0 时代算法 PM 那般对数据的敏锐嗅觉和掌控力。数据策略应是产品战略的核心一环，投入资源构建高质量数据集，将「评测驱动」落到实处。

### 5. 多模态与专用模型兴起

**报告指出**：AI 早已超越文本。图像（Black Forest Labs）、视频（Sora 2、Kling 2.1）、音频（ElevenLabs）、3D、生物（ATOMICA）、化学、材料（UMA、MatterGen）、机器人（GROOT、MolmoAct、EMMA）、视觉（ATOKEN），各个领域都在上演突破。

**PM 行动指南**：保持视野开阔，关注这些新兴能力能为你的产品或行业带来哪些颠覆性机会。

## 二、商业化、成本与竞争策略

### 1. AI 优先公司的收入爆发式增长

**报告显示**：AI 优先的公司正在以比传统 SaaS 公司快 1.5 倍的速度实现早期收入增长。领先的 16 家 AI 公司年化总收入已达 185 亿美元；Lean AI Leaderboard 上的「精益 AI 公司」（少于 50 人、成立不到 5 年）总收入超 40 亿美元。用户调查也显示，76% 的受访者自费使用 AI 工具，其中 56% 每月花费超过 21 美元。

**PM 行动指南**：

- **坚定商业化**：AI 是能赚钱的，制定清晰的商业目标。
- **AI 增强，而非噱头**：对于大多数现有科技公司，关键任务是把 AI 能力无缝集成到成功的现有业务中，让用户渐进式地接受和依赖。用户不关心技术本身，只关心问题是否解决。

### 2. 能力成本比的双重影响

**报告显示**：领先模型的能力成本比大约每 3 到 6 个月翻一番，用更少的钱可以获得更强的 AI 能力。

**PM 行动指南**：推理成本持续下降是必然趋势，定价策略必须跟上节奏；单纯的模型调用会越来越「不值钱」，要思考如何在基础能力之上构筑独特的产品价值和体验壁垒。

### 3. 毛利率压力与优化策略

**报告显示**：许多 AI 应用（尤其是基于第三方 API 构建的，如 Cursor）面临脆弱的毛利率。核心成本受制于上游模型提供商的 API 价格和速率限制，token 密集型使用和为免费用户提供服务的成本进一步挤压利润。

**PM 行动指南**：

- **自建或微调**：减少对第三方 API 的依赖和成本波动。微调之所以有效，是因为大模型厂商优先优化通用场景，细分场景的数据、流程、经验存在差异化空间。
- **拥抱小模型**：NVIDIA 指出，多数 Agent 工作流狭隘、重复，小语言模型（1 到 9B）通常足够胜任，且运行成本低 10 到 30 倍，响应更快。设计「SLM 优先，大模型兜底」的架构，能省下大笔开销。
- **技术降本**：缓存、高效检索。最新推出的 Agent Skill 的核心思想就是通过缓存和高效检索来减少模型的上下文窗口，脚本化、模块化。
- **商业模式**：探索基于广告或结果的定价模型。

### 4. Agent 框架与 MCP 标准

**报告显示**：Agent 框架生态是「有组织的混乱」。数十个框架（LangChain、AutoGen、MetaGPT、DSPy、LlamaIndex、LangGraph、CrewAI 等）并存，各自在研发、软件工程、RAG、可靠性编排、轻量化等方面占据特定生态位。背后推手是特定需求、协议标准、成本考量和虚拟环境的共同作用。

与此同时，Model Context Protocol（MCP）正成为连接模型、工具、数据的「USB-C」，被各大厂拥抱。

**PM 行动指南**：根据产品定位在众多框架中谨慎选择——需要高可靠性和可观察性的场景可选 LangGraph，软件开发场景可考虑 MetaGPT；将 MCP 视为行业标准，确保产品设计遵循规范。

### 5. 硬件、基础设施与地缘政治

**报告表明**：

- **NVIDIA 霸主地位依旧**：约 90% 的研究论文提及，但面临定制芯片（Google TPU、Meta MTIA、Amazon Trainium）和中国自研芯片的挑战。
- **中国崛起与出口管制**：中国在开放模型领域（Qwen、DeepSeek）表现强劲，同时加速芯片自给自足。美国的芯片出口政策摇摆不定，反而刺激了中国的国产替代。
- **万亿基建与循环经济**：AI 基础设施建设成本高昂（Stargate 项目预计 5000 亿美元），催生了「你投我、我买你」的资本循环，但也暗藏风险。

**PM 行动指南**：抬头看路。硬件格局、供应链安全、地缘政治，这些宏大叙事会实实在在影响产品的成本、市场和风险。

## 三、市场采纳、用户行为与挑战

用户调查（1183 名参与者）揭示了真实世界的 AI 使用情况。

### 1. AI 对传统搜索的颠覆已成定局

**报告显示**：AI 答案引擎（ChatGPT、Perplexity 等）正成为获取复杂信息、研究、编码的首选，传统搜索的入口地位受到冲击。而且 AI 搜索不止是「搜」，更是「聊」，更长的对话轮次意味着更强的用户粘性和更高的转化意愿。

**PM 行动指南**：

- **抢占新入口**：AEO（答案引擎优化）时代来了。产品的可见性不再仅由 Google 排名决定，而是越来越依赖于 AI 模型的引用模式。PM 需要研究不同模型的引用偏好（如 Reddit、Wikipedia 被高频引用），并优化内容以适应 AI 的检索和生成逻辑。
- **承接高意图**：把 AI 来源的用户当作 VIP，他们意图明确，转化潜力巨大。关注「代理式商务」的机会。

### 2. 用户的「惊喜时刻」揭示产品价值点

**报告显示**：用户最感 Wow 的 AI 能力集中在编码（构建完整应用、调试复杂问题）、媒体生成（视频、图像、音频质量的飞跃）、深度研究与推理（分析复杂信息、产生洞见）。

**PM 行动指南**：用户的惊喜点就是产品的发力点。

### 3. 工具粘性与专业化趋势

**报告显示**：用户正从通用工具（GitHub Copilot、ChatGPT for code）转向专业工具（Claude Code、Cursor）；同时大平台不断「吞噬」单一功能，导致独立工具用户流失。

**PM 行动指南**：思考产品的定位——是做「大而全」的平台，还是「小而美」的专家？市场正在向这两个方向靠拢。

### 4. 规模化的核心障碍

**报告显示**：企业想用 AI，但怕麻烦（前期投入时间长）、怕泄密（数据隐私）、怕不懂（缺专业人才）、怕烧钱（成本高、没 ROI）、怕集成难。

**PM 行动指南**：提升「确定性」，解决可靠性问题（如幻觉），简化集成、降低门槛；拿出「成绩单」，预算在涨但效果感知没跟上（仅 47% 用户感觉生产力大增），PM 必须能量化 AI 的价值。

## 四、安全、风险与监督环境

AI 的能力边界在拓展，风险边界也在延伸。安全，是 AI PM 不可逾越的底线。

### 1. 网络安全风险急剧加速

**报告指明**：AI 正被恶意行为者用于复杂网络攻击。报告提到朝鲜特工利用 Claude 渗透财富 500 强，以及利用 Claude Code 策划勒索软件攻击，显著降低了高端网络犯罪的门槛。更令人担忧的是，「攻击性网络安全」能力的提升速度（每 5 个月翻一番）超过了通用 AI 能力（每 7 个月翻一番）。

**PM 行动指南**：最高警报。设计 Agent 产品时，安全必须是第一考量，传统防御手段已显不足。

### 2. 安全设计：从「过滤器」思维到「堡垒」架构

**报告指明**：Prompt 注入这类顽疾，靠简单的过滤难以根除。报告介绍了 CaMeL（能力管理层）等架构层面的解决方案，通过最小权限、全程审计，从根本上提升防御能力。

**PM 行动指南**：将安全融入基因，采用「能力驱动」的安全架构，让 AI 的每一步行动都在掌控之中。

### 3. 物理瓶颈：电力与邻避效应

**报告显示**：AI 是「电老虎」，多吉瓦集群的竞赛加剧了电力短缺风险；数据中心建设引发的 NIMBYism（邻避效应）正愈演愈烈，阻碍项目落地。

**PM 行动指南**：无论是自建还是选择云商，电力和选址的社会政治风险都是绕不开的坎，直接影响成本和稳定性。

### 4. 监管环境：滞后但需未雨绸缪

**报告指明**：欧盟 AI 法案、加州 SB53 等监管在追赶，但目前对大多数企业影响有限，执法的重点还在于打击「AI 鼓吹」（AI-Washing）。

**PM 行动指南**：提前布局透明度、风险评估、合规框架，尤其是高风险领域。加州 SB53 可能就是未来的模板。

### 5. 模型的「内心戏」：幻觉、偏见与对齐

**报告揭示**：幻觉（像机器在说梦话）、谄媚（为了讨好你而说谎）、评估意识（知道被测试就装乖）、对齐造假（阳奉阴违）、安全机制的脆弱性。

**PM 行动指南**：正视 AI 的「不完美」。这些内在缺陷直接关系到产品体验和用户信任，设计时要考虑防呆、容错，引入事实核查，允许用户质疑。

## 总结：AI PM 的关键行动指南

- **拥抱推理**：将先进的推理能力作为产品的核心竞争力。
- **聚焦智能体**：设计和优化能够执行复杂任务的 Agentic Workflow。
- **精打细算**：利用能力成本比下降的趋势，同时通过 SLM 策略、自有模型和技术优化来管理利润压力。
- **融入生态**：掌握 Agent 框架格局，遵循 MCP 等行业标准。
- **用户为星**：倾听用户的「Wow」与「痛」，优化航向。
- **重塑交互**：适应 AI 对搜索等传统模式的颠覆，优化 AEO。
- **安全为本**：将安全嵌入架构设计，警惕网络风险，并关注物理和地缘政治约束。
- **数据驱动**：持续关注高质量数据的作用，并利用用户反馈和行为数据迭代产品。

## 报告的十大预测（未来 12 个月）

1. **Agentic Commerce 爆发**：某大型零售商报告称，随着 AI 智能体广告支出达到 50 亿美元，其代理式结账产生的在线销售额占比超过 5%。
2. **拥抱开源**：一家主要人工智能实验室重新拥抱前沿模型开源策略，以争取当前美国政府的支持。
3. **AI 驱动科学发现**：开放式智能体首次完成端到端的重大科学发现，走完提出假设、实验验证、迭代优化、论文发表全流程。
4. **AI 安全事件升级**：深度伪造或智能体驱动的网络攻击首次触发北约、联合国就人工智能安全召开紧急辩论。
5. **生成式游戏火爆**：一款实时生成式视频游戏成为 Twitch 平台年度观看量最高的直播内容。
6. **「AI 中立」外交**：「AI 中立性」作为外交政策原则兴起，部分国家因无法或未能发展主权 AI 而采纳该立场。
7. **AI 影视作品争议**：一部大量运用 AI 技术制作的电影或短片赢得主流观众盛赞，同时引发强烈争议。
8. **中国超越**：中国实验室在主要排行榜（如 LMArena、Artificial Analysis）上超越长期由美国主导的前沿领域。
9. **数据中心 NIMBYism 发酵**：数据中心邻避运动席卷美国，影响 2026 年部分中期选举及州长选举结果。
10. **联邦压制州法**：特朗普签署行政命令，禁止各州制定被联邦最高法院裁定违宪的人工智能法规。

## 核心结论

- 推理能力是过去一年定义性的突破。在需要深度逻辑的产品场景里，它决定了你的产品是「懂你」还是仅仅「答你」。（判断）
  永久链接：https://chenxu.xin/writing/state-of-ai-report-pm-view#reasoning-is-the-year-breakthrough
- 现有基准测试很脆弱，AIME 这类测试对细节极其敏感、结果波动巨大。别被单一分数迷惑，要建更贴近真实场景的内部评测标准。（判断 · 把握较大）
  永久链接：https://chenxu.xin/writing/state-of-ai-report-pm-view#benchmarks-are-fragile
- 攻击性网络安全能力每 5 个月翻一番，快于通用 AI 能力的每 7 个月。设计 Agent 产品时安全必须是第一考量。（把握较大）
  永久链接：https://chenxu.xin/writing/state-of-ai-report-pm-view#attack-capability-outpaces-general
- 多数 Agent 工作流狭隘且重复，1 到 9B 的小语言模型通常足够胜任且成本低 10 到 30 倍。「SLM 优先、大模型兜底」能省下大笔开销。（判断）
  永久链接：https://chenxu.xin/writing/state-of-ai-report-pm-view#slm-first-llm-fallback
- AEO（答案引擎优化）时代来了。产品的可见性不再仅由搜索排名决定，而是越来越依赖 AI 模型的引用模式。（判断）
  永久链接：https://chenxu.xin/writing/state-of-ai-report-pm-view#aeo-replaces-seo

---

本文出自晨光里的AI（https://chenxu.xin），作者晨旭。
引用时请保留来源链接。文中标注「判断」「假设」的部分是作者的个人看法，不是事实。
