晨光里的AI

入门系列文章 · 第 7 篇

PM视角解读《State of AI Report》年度报告:过去12个月的重大进展和十个预测

把第八份《State of AI Report》拆成 PM 能用的东西:推理与智能体的技术前沿、收入与毛利率的商业现实、搜索被颠覆后的用户行为,以及安全这块最容易被欠账的部分。

Written by 晨旭发布于 约 13 分钟同步发布

TL;DR

Air Street Capital 团队的第八份《State of AI Report》出炉,我从 PM 视角提炼了四个部分: 技术上推理能力是过去一年的定义性突破,智能体和世界模型开始真正有用,学习范式从静态预训练转向动态适应; 商业上 AI-First 公司收入增速是传统 SaaS 的 1.5 倍,但依赖第三方 API 的应用毛利率脆弱,SLM 优先加大模型兜底能省下大笔开销; 用户侧 AI 答案引擎正在取代传统搜索,AEO 时代来了;安全侧攻击性网络安全能力每 5 个月翻一番,比通用 AI 能力还快。 每一节都是先总结报告说了什么,再写 PM 应该怎么行动。最后附报告的十个预测。

目录

最近,由 Nathan Benaich 和 Air Street Capital 团队发布的第八份年度《State of AI Report》正式出炉。这份报告以其全面、深入的分析,再次成为我们理解 AI 领域进展的重要参考。

作为一名 AI PM 的学习者和实践者,我从 PM 的视角出发,帮助你提炼出报告中的关键洞察。

一共分为四大部分,依次从技术、产品、商业、成本、用户、安全等方面展开。每一小部分先总结报告内容,再从 PM 的视角解读应该如何行动,文章最后附上报告中的十个预测。

我收获最多的是关于安全和硬件部分。感觉就像高中数学中的选修部分,平时花的心思并不多,但考试必考,最后复习时(交付产品时)是最痛苦的,因为平时没花心思。

一、技术前沿与产品能力的提升

1. 推理模型优先

报告指明:「推理能力」是过去一年定义性的突破。不再是简单的「问答机」,AI 正进化为具备「思考」能力的伙伴。OpenAI(o1、GPT-5)、Google(Gemini 2.5 Pro)、Anthropic(Claude 3.7 / 4.1),甚至中国的 DeepSeek(R1),都在将「先思考后回答」的能力注入产品心脏。

它们像拥有了「草稿纸」(如思维链 CoT、并行推理),在处理代码、科学计算、数学等复杂任务时,表现出前所未有的鲁棒性。GPT-5 能「通关」大学生编程竞赛 ICPC,这背后是推理能力的质变。

PM 行动指南

  • 功能重塑:不能只满足于做个「信息搬运工」。在需要深度逻辑的产品场景(编程助手、科研工具、复杂决策支持),推理能力是核心竞争力。
  • 拥抱透明:利用 CoT 的过程可见性。虽然 CoT 并非完美(有「监视税」和忠实度问题),但让用户看到 AI 的「思考过程」,是建立信任、便于调试的关键。
  • 审慎评估:报告警示我们,现有基准测试很脆弱。AIME 这样的测试对各种细节极其敏感,结果波动巨大。别被单一分数迷惑,建立更贴近真实场景、更多维度的内部「体检」标准至关重要。

2. 智能体和世界模型走向实用

报告强调:AI 智能体、世界模型和领域专用工具(代码、科学、医学)已变得「真正有用」。智能体系统通过工具调用、多步推理和规划,能够完成日益复杂的任务。

  • 世界模型打开新次元:Google DeepMind 的 Genie 3 和 Odyssey 已经能生成可实时交互、分钟级连贯的虚拟世界,这是训练具身智能体的雏形。Dreamer 4 甚至能在「梦境」中学习,用少量数据就在 Minecraft 里挖到钻石。
  • AI 变身科研合伙人:DeepMind 的 Co-Scientist、Stanford 的「虚拟实验室」、DeepMind 的 AlphaEvolve 都在药物发现、材料科学、算法优化等领域,展现出从假设到验证的端到端能力。

PM 行动指南

  • 布局 Agentic Workflow:正如 Karpathy 所言,这是「智能体的十年」。PM 的核心战场将转向 Agent 的上下文工程和智能体架构设计。如何让 Agent 更好地感知、规划、记忆、使用工具、执行和反思,将是产品设计的关键。
  • 关注世界模型:这可能是下一代模拟器、游戏引擎、机器人训练场。

3. 从静态预训练到动态持续学习

报告指明:AI 的学习不再是「一劳永逸」的预训练,而是越来越趋向于「边用边学」的动态适应,从静态的「一次性预训练加离线微调」转向更动态的「即时适应」。

  • 测试时微调(TTT):AI 能在和你对话的瞬间,根据你的问题「临时抱佛脚」。TTT 通过主动学习选择少量关键信息进行即时微调,让小模型也能爆发出惊人潜力。
  • 高效微调(PEFT):LoRA / QLoRA 极大降低了微调成本(训练参数减少 10 到 50 倍),使得更频繁、更轻量级的模型更新成为可能,目前已成为任务和领域适配的首选。

PM 行动指南:考虑如何利用动态适应技术提升产品的个性化和时效性;技术选型上,LoRA / QLoRA 是当下性价比之选,TTT 代表更自适应的未来方向。

4. 数据质量优先于数量

报告再次敲响警钟:高质量、多样化的数据集能让模型用更少的「学费」达到更高的「分数」。LILO 等方法甚至能智能挑选「最有营养」的数据来喂给模型。

PM 行动指南:AI PM 必须具备 AI 1.0 时代算法 PM 那般对数据的敏锐嗅觉和掌控力。数据策略应是产品战略的核心一环,投入资源构建高质量数据集,将「评测驱动」落到实处。

5. 多模态与专用模型兴起

报告指出:AI 早已超越文本。图像(Black Forest Labs)、视频(Sora 2、Kling 2.1)、音频(ElevenLabs)、3D、生物(ATOMICA)、化学、材料(UMA、MatterGen)、机器人(GROOT、MolmoAct、EMMA)、视觉(ATOKEN),各个领域都在上演突破。

PM 行动指南:保持视野开阔,关注这些新兴能力能为你的产品或行业带来哪些颠覆性机会。

二、商业化、成本与竞争策略

1. AI 优先公司的收入爆发式增长

报告显示:AI 优先的公司正在以比传统 SaaS 公司快 1.5 倍的速度实现早期收入增长。领先的 16 家 AI 公司年化总收入已达 185 亿美元;Lean AI Leaderboard 上的「精益 AI 公司」(少于 50 人、成立不到 5 年)总收入超 40 亿美元。用户调查也显示,76% 的受访者自费使用 AI 工具,其中 56% 每月花费超过 21 美元。

PM 行动指南

  • 坚定商业化:AI 是能赚钱的,制定清晰的商业目标。
  • AI 增强,而非噱头:对于大多数现有科技公司,关键任务是把 AI 能力无缝集成到成功的现有业务中,让用户渐进式地接受和依赖。用户不关心技术本身,只关心问题是否解决。

2. 能力成本比的双重影响

报告显示:领先模型的能力成本比大约每 3 到 6 个月翻一番,用更少的钱可以获得更强的 AI 能力。

PM 行动指南:推理成本持续下降是必然趋势,定价策略必须跟上节奏;单纯的模型调用会越来越「不值钱」,要思考如何在基础能力之上构筑独特的产品价值和体验壁垒。

3. 毛利率压力与优化策略

报告显示:许多 AI 应用(尤其是基于第三方 API 构建的,如 Cursor)面临脆弱的毛利率。核心成本受制于上游模型提供商的 API 价格和速率限制,token 密集型使用和为免费用户提供服务的成本进一步挤压利润。

PM 行动指南

  • 自建或微调:减少对第三方 API 的依赖和成本波动。微调之所以有效,是因为大模型厂商优先优化通用场景,细分场景的数据、流程、经验存在差异化空间。
  • 拥抱小模型:NVIDIA 指出,多数 Agent 工作流狭隘、重复,小语言模型(1 到 9B)通常足够胜任,且运行成本低 10 到 30 倍,响应更快。设计「SLM 优先,大模型兜底」的架构,能省下大笔开销。
  • 技术降本:缓存、高效检索。最新推出的 Agent Skill 的核心思想就是通过缓存和高效检索来减少模型的上下文窗口,脚本化、模块化。
  • 商业模式:探索基于广告或结果的定价模型。

4. Agent 框架与 MCP 标准

报告显示:Agent 框架生态是「有组织的混乱」。数十个框架(LangChain、AutoGen、MetaGPT、DSPy、LlamaIndex、LangGraph、CrewAI 等)并存,各自在研发、软件工程、RAG、可靠性编排、轻量化等方面占据特定生态位。背后推手是特定需求、协议标准、成本考量和虚拟环境的共同作用。

与此同时,Model Context Protocol(MCP)正成为连接模型、工具、数据的「USB-C」,被各大厂拥抱。

PM 行动指南:根据产品定位在众多框架中谨慎选择——需要高可靠性和可观察性的场景可选 LangGraph,软件开发场景可考虑 MetaGPT;将 MCP 视为行业标准,确保产品设计遵循规范。

5. 硬件、基础设施与地缘政治

报告表明

  • NVIDIA 霸主地位依旧:约 90% 的研究论文提及,但面临定制芯片(Google TPU、Meta MTIA、Amazon Trainium)和中国自研芯片的挑战。
  • 中国崛起与出口管制:中国在开放模型领域(Qwen、DeepSeek)表现强劲,同时加速芯片自给自足。美国的芯片出口政策摇摆不定,反而刺激了中国的国产替代。
  • 万亿基建与循环经济:AI 基础设施建设成本高昂(Stargate 项目预计 5000 亿美元),催生了「你投我、我买你」的资本循环,但也暗藏风险。

PM 行动指南:抬头看路。硬件格局、供应链安全、地缘政治,这些宏大叙事会实实在在影响产品的成本、市场和风险。

三、市场采纳、用户行为与挑战

用户调查(1183 名参与者)揭示了真实世界的 AI 使用情况。

1. AI 对传统搜索的颠覆已成定局

报告显示:AI 答案引擎(ChatGPT、Perplexity 等)正成为获取复杂信息、研究、编码的首选,传统搜索的入口地位受到冲击。而且 AI 搜索不止是「搜」,更是「聊」,更长的对话轮次意味着更强的用户粘性和更高的转化意愿。

PM 行动指南

  • 抢占新入口:AEO(答案引擎优化)时代来了。产品的可见性不再仅由 Google 排名决定,而是越来越依赖于 AI 模型的引用模式。PM 需要研究不同模型的引用偏好(如 Reddit、Wikipedia 被高频引用),并优化内容以适应 AI 的检索和生成逻辑。
  • 承接高意图:把 AI 来源的用户当作 VIP,他们意图明确,转化潜力巨大。关注「代理式商务」的机会。

2. 用户的「惊喜时刻」揭示产品价值点

报告显示:用户最感 Wow 的 AI 能力集中在编码(构建完整应用、调试复杂问题)、媒体生成(视频、图像、音频质量的飞跃)、深度研究与推理(分析复杂信息、产生洞见)。

PM 行动指南:用户的惊喜点就是产品的发力点。

3. 工具粘性与专业化趋势

报告显示:用户正从通用工具(GitHub Copilot、ChatGPT for code)转向专业工具(Claude Code、Cursor);同时大平台不断「吞噬」单一功能,导致独立工具用户流失。

PM 行动指南:思考产品的定位——是做「大而全」的平台,还是「小而美」的专家?市场正在向这两个方向靠拢。

4. 规模化的核心障碍

报告显示:企业想用 AI,但怕麻烦(前期投入时间长)、怕泄密(数据隐私)、怕不懂(缺专业人才)、怕烧钱(成本高、没 ROI)、怕集成难。

PM 行动指南:提升「确定性」,解决可靠性问题(如幻觉),简化集成、降低门槛;拿出「成绩单」,预算在涨但效果感知没跟上(仅 47% 用户感觉生产力大增),PM 必须能量化 AI 的价值。

四、安全、风险与监督环境

AI 的能力边界在拓展,风险边界也在延伸。安全,是 AI PM 不可逾越的底线。

1. 网络安全风险急剧加速

报告指明:AI 正被恶意行为者用于复杂网络攻击。报告提到朝鲜特工利用 Claude 渗透财富 500 强,以及利用 Claude Code 策划勒索软件攻击,显著降低了高端网络犯罪的门槛。更令人担忧的是,「攻击性网络安全」能力的提升速度(每 5 个月翻一番)超过了通用 AI 能力(每 7 个月翻一番)。

PM 行动指南:最高警报。设计 Agent 产品时,安全必须是第一考量,传统防御手段已显不足。

2. 安全设计:从「过滤器」思维到「堡垒」架构

报告指明:Prompt 注入这类顽疾,靠简单的过滤难以根除。报告介绍了 CaMeL(能力管理层)等架构层面的解决方案,通过最小权限、全程审计,从根本上提升防御能力。

PM 行动指南:将安全融入基因,采用「能力驱动」的安全架构,让 AI 的每一步行动都在掌控之中。

3. 物理瓶颈:电力与邻避效应

报告显示:AI 是「电老虎」,多吉瓦集群的竞赛加剧了电力短缺风险;数据中心建设引发的 NIMBYism(邻避效应)正愈演愈烈,阻碍项目落地。

PM 行动指南:无论是自建还是选择云商,电力和选址的社会政治风险都是绕不开的坎,直接影响成本和稳定性。

4. 监管环境:滞后但需未雨绸缪

报告指明:欧盟 AI 法案、加州 SB53 等监管在追赶,但目前对大多数企业影响有限,执法的重点还在于打击「AI 鼓吹」(AI-Washing)。

PM 行动指南:提前布局透明度、风险评估、合规框架,尤其是高风险领域。加州 SB53 可能就是未来的模板。

5. 模型的「内心戏」:幻觉、偏见与对齐

报告揭示:幻觉(像机器在说梦话)、谄媚(为了讨好你而说谎)、评估意识(知道被测试就装乖)、对齐造假(阳奉阴违)、安全机制的脆弱性。

PM 行动指南:正视 AI 的「不完美」。这些内在缺陷直接关系到产品体验和用户信任,设计时要考虑防呆、容错,引入事实核查,允许用户质疑。

总结:AI PM 的关键行动指南

  • 拥抱推理:将先进的推理能力作为产品的核心竞争力。
  • 聚焦智能体:设计和优化能够执行复杂任务的 Agentic Workflow。
  • 精打细算:利用能力成本比下降的趋势,同时通过 SLM 策略、自有模型和技术优化来管理利润压力。
  • 融入生态:掌握 Agent 框架格局,遵循 MCP 等行业标准。
  • 用户为星:倾听用户的「Wow」与「痛」,优化航向。
  • 重塑交互:适应 AI 对搜索等传统模式的颠覆,优化 AEO。
  • 安全为本:将安全嵌入架构设计,警惕网络风险,并关注物理和地缘政治约束。
  • 数据驱动:持续关注高质量数据的作用,并利用用户反馈和行为数据迭代产品。

报告的十大预测(未来 12 个月)

  1. Agentic Commerce 爆发:某大型零售商报告称,随着 AI 智能体广告支出达到 50 亿美元,其代理式结账产生的在线销售额占比超过 5%。
  2. 拥抱开源:一家主要人工智能实验室重新拥抱前沿模型开源策略,以争取当前美国政府的支持。
  3. AI 驱动科学发现:开放式智能体首次完成端到端的重大科学发现,走完提出假设、实验验证、迭代优化、论文发表全流程。
  4. AI 安全事件升级:深度伪造或智能体驱动的网络攻击首次触发北约、联合国就人工智能安全召开紧急辩论。
  5. 生成式游戏火爆:一款实时生成式视频游戏成为 Twitch 平台年度观看量最高的直播内容。
  6. 「AI 中立」外交:「AI 中立性」作为外交政策原则兴起,部分国家因无法或未能发展主权 AI 而采纳该立场。
  7. AI 影视作品争议:一部大量运用 AI 技术制作的电影或短片赢得主流观众盛赞,同时引发强烈争议。
  8. 中国超越:中国实验室在主要排行榜(如 LMArena、Artificial Analysis)上超越长期由美国主导的前沿领域。
  9. 数据中心 NIMBYism 发酵:数据中心邻避运动席卷美国,影响 2026 年部分中期选举及州长选举结果。
  10. 联邦压制州法:特朗普签署行政命令,禁止各州制定被联邦最高法院裁定违宪的人工智能法规。

核心结论

标注「判断」「假设」的是我的看法而非事实;标注「已推翻」的保留在这里,不删除。

  • 推理能力是过去一年定义性的突破。在需要深度逻辑的产品场景里,它决定了你的产品是「懂你」还是仅仅「答你」。#

    判断

  • 现有基准测试很脆弱,AIME 这类测试对细节极其敏感、结果波动巨大。别被单一分数迷惑,要建更贴近真实场景的内部评测标准。#

    判断 · 把握较大

  • 攻击性网络安全能力每 5 个月翻一番,快于通用 AI 能力的每 7 个月。设计 Agent 产品时安全必须是第一考量。#

    把握较大

  • 多数 Agent 工作流狭隘且重复,1 到 9B 的小语言模型通常足够胜任且成本低 10 到 30 倍。「SLM 优先、大模型兜底」能省下大笔开销。#

    判断

  • AEO(答案引擎优化)时代来了。产品的可见性不再仅由搜索排名决定,而是越来越依赖 AI 模型的引用模式。#

    判断

引用本文

晨旭,《PM视角解读《State of AI Report》年度报告:过去12个月的重大进展和十个预测》,晨光里的AI,2025-10-20

[晨旭:《PM视角解读《State of AI Report》年度报告:过去12个月的重大进展和十个预测》](https://chenxu.xin/writing/state-of-ai-report-pm-view)

带进你的 AI 继续追问

这篇文章有一份干净的 Markdown 原文,可以直接交给任何模型读,不用复制粘贴。