LLM应用开发之前,必须掌握的一些宏观概念
模型选型的一套方法论:主流厂商格局、评判能力的五个维度、参数尺寸与任务的匹配关系;以及大模型开发的四条核心法则——模型无记忆、指令有层级、万物皆 Token、回归官方文档。
TL;DR
模型是 AI 应用的大脑,选型是产品成败的第一道关卡。这篇分两部分: 前半讲怎么选模型——主流厂商分成硅谷一线、国内双雄和其他三档, 能力可以从训练截止日期、知识记忆、复杂推理、指令遵循、代码能力五个维度衡量, 再按推理与非推理、文本与多模态、参数尺寸三个方向具体对比。 后半讲开发入门必须理解的四条法则:大模型本身是无状态的,多轮对话是工程师每次把历史重新打包发过去实现的; 指令存在 platform、system、user 的优先级金字塔;多模态输入最终都转成 Token 计费; 以及官方文档永远是最可靠的信息来源。
目录
对于产品经理来说,模型是 AI 应用的大脑,选型是产品成败的「第一道关卡」。如果选错了,后面再多的努力都可能是白费。此外,对于 LLM 应用开发,PM 不一定要会写代码,但必须理解模型工作的基本原理。
因此我系统地梳理了市面上的主流模型,总结了一套选型方法论,并将那些看似复杂的开发概念,提炼成了四大核心法则。
第一部分:如何选择模型?
市面上的主流模型
硅谷一线:OpenAI(GPT 系列)、Anthropic(Claude 系列)、Google(Gemini 系列)、Meta(Llama 系列)。这些是技术潮流的定义者。
国内双雄:DeepSeek、Qwen(阿里通义千问)。技术紧随其后,尤其在开源和中文能力上表现出色。据统计,全世界的微调模型中,有 80% 是基于 Qwen 的。
国内其他:豆包、Kimi、GLM。在特定能力(如长文本、性价比)上非常有竞争力。
按定位又可以分成三档:
- 推理模型(最贵):o1、o3、Gemini 2.0 Flash Thinking、DeepSeek R1。适合需要复杂规划、深度思考和严谨逻辑的任务,如代码生成、数学竞赛题、科学计算、企业级的复杂业务流程规划。
- 旗舰模型(全能优等生):GPT-4o、GPT-5、Gemini Pro 系列、Claude Sonnet 与 Opus 系列、Llama 3.1、DeepSeek V3、Qwen 72B。适合对话体验、内容创作、知识问答、逻辑分析等绝大多数主流任务。
- 轻量级模型:GPT-4o mini、GPT-5 mini、Gemini 2.5 Flash、Claude 3.5 Haiku。适合高并发的客服、内容摘要、意图识别、简单指令执行等对成本和速度要求高的场景。
一个小技巧:日常工作中,可以把自己领域内的一些困难 case 记录下来,形成一个私人测试集。每当有重磅新模型发布时,花十几分钟跑一遍这个测试集,很快就能对它的能力边界和脾性建立起体感。
模型的几个能力维度
1、训练截止日期
新鲜度决定了模型能不能和你聊最近发生的事。比如你问它「评价一下 OpenAI 发布的 Sora 2 这个产品」,如果它的训练数据截止到 2024 年,它就无法回答。
深刻度更为关键。互联网上资料越多的知识,模型掌握得越深刻;相反,小众、冷门的知识,它可能只是一知半解。
这里有一个重要的区分:模型内化记忆的知识,远比通过 RAG 临时喂给它的知识更深刻。前者是模型消化吸收过的,后者只是看了一眼小抄。
另外,模型具备惊人的融会贯通能力。有些知识在中文互联网上不存在,但在英文世界里很丰富,就算用中文去问,顶尖模型也能很好地回答,因为它已经把不同语言的知识打通了。
2、知识记忆能力:模型能够准确回忆和复述事实性知识的能力。参数量越大的模型,记忆力通常越好。
3、复杂推理:不仅仅是知识记忆,而是逻辑推导、多步规划和解决问题的能力。这是区分「学霸」和「普通学生」的关键。
4、复杂指令的遵守能力:衡量模型是否听话。比如让它「写一首关于夏天的五言绝句,必须包含『蝉』和『雨』两个字,并且要用比喻的修辞手法,最后生成一个 JSON 格式的输出」。指令越复杂,就越考验模型。
5、代码能力:代码是纯粹的逻辑语言,所以模型的代码能力往往是其逻辑推理能力的最佳试金石。一个能写出高质量、无 bug 代码的模型,通常在其他逻辑任务上也不会差。
几个维度对比模型
1、推理 vs 非推理
- 非推理模型(GPT-4o、DeepSeek V3):仅支持快思考,反应迅速,擅长处理大部分日常对话和创作任务。
- 推理模型(o1、o3、GPT-5-thinking、Claude 3.7 Thinking、DeepSeek R1):默认慢思考,有时候只是说一句「你好」也要思考半天。这保证了在复杂任务上的高质量,但也带来了更高的延迟和成本。
- 新一代混合模型(Claude 4.0、Qwen 3.0、GPT-5):自动判断当前任务该走快思考还是慢思考。这代表了未来的趋势,开发者甚至可以在 API 里直接设置思考时长或算力预算,达到效果和成本的最佳平衡。
2、文本 vs 多模态
硅谷顶尖玩家的主流模型,如 GPT-4o、Gemini,均已默认支持多模态。中国主流的 DeepSeek 和 Qwen,旗舰模型尚未实现文本模型和多模态模型的统一,字节的 Seed 1.6 系列已经实现。多模态和文本的统一,是应用落地的必然趋势。
3、模型尺寸
- 顶配旗舰(500B 以上):DeepSeek R1(670B)、Claude Opus、GPT-4.5、Gemini Ultra。参数量很大,运行成本极高。
- 中档旗舰(100B 到 300B):GPT-4o、Claude Sonnet、Gemini 2.5 Pro、Qwen 3 235B。这是各大公司主推的明星产品,能力全面,是大部分产品的核心驱动力。
- 中档主力(32B 到 72B):Qwen 3 72B、Llama 3 72B。企业微调私有化部署常用的尺寸。
- 小尺寸主力(7B):GPT-4.1 mini、Gemini Flash 系列、Qwen 3 7B、Llama 3 8B。各种企业微调模型的主力尺寸。
- 端侧微小模型(3B 及以下):苹果、小米、谷歌等有手机业务的厂商,以及少数创业公司如面壁智能会关注。
不同尺寸适用什么任务
作为 PM,理解尺寸和任务的匹配关系,直接关系到产品成本和用户体验。
参数量与知识记忆的关系:在当前以 Transformer 架构为主的阶段,参数量大是知识记忆能力强的必要条件。一般来说,72B 以上是基础知识水平达标的门槛。
从知识压缩率的角度看:万亿参数模型相当于把互联网上的百科知识以很低的压缩率内化记忆了,损失少,包括一些小众的知识。而 7B 模型知识的蒸馏损失会大很多,可能只记得「中国的首都是北京」,但不知道「赫尔巴特学派在 19 世纪德国教育思想史中的具体影响」这类小众知识。
模型参数偏大还是偏小? 业界有两种观点:
- 越大越好(Anthropic 研究员):认为今天的万亿模型相比人脑依然太小,模型内部存在大量参数复用,说明参数还远远不够用。
- 小而强(Sam Altman、Karpathy):认为未来应该是小尺寸、但推理能力极强的核心模型,知识和工具都可以依赖外部调用。这就像一个绝顶聪明的奥赛选手,虽然知识储备不多,但只要你允许他打小抄(调用外部知识库)、允许他使用外部工具,解决问题的能力极强。
这两种思路并不矛盾,PM 的任务是根据产品场景做权衡。如果你的应用是事实性知识问答,大模型是基础保障;如果你的应用是基于私有知识库的客服,一个小而精、指令遵循能力强的模型配合高效的 RAG,可能是性价比最高的选择。
学习思路:由顶而下
1、优先学习全世界最前沿的 LLM 开发范式。先去体验顶尖模型,理解当前技术能达到的天花板在哪里,这会让你建立起正确的「品味」。
2、学习顶尖团队的落地案例。去研究微软 Office Copilot、LinkedIn 等团队是如何将 LLM 融入产品的,学习他们的完整过程,建立清晰的心智模型。
3、再回看国内落地现状。各个大模型厂商和 B 端企业的落地范式,经常基于落后模型,导致落地效果很差,开发者也不知道如何突破。但当你见过了最好的范式,再回头看,就更容易诊断出问题所在,并知道如何通过工程手段去弥补。
国产模型和落后模型会不断追上、对标领先模型,所以现在学习的前沿知识,短期内不会过时。
第二部分:大模型开发入门
法则一:大模型本身没有多轮能力
你可能会觉得,ChatGPT 这类应用记性很好,能和你连续聊上几百回合。但一个颠覆认知的事实是:大模型本身是无状态的,它没有任何记忆。
每一次你发送请求,对于模型来说都是一次全新的、独立的任务。它完全不记得你上一秒钟跟它说了什么。
就像电影《初恋 50 次》的女主角,她的记忆只能持续一天,男友必须每天都重新告诉她他们之间的故事,她才能「记起」他们的关系。
那所谓的多轮对话能力是怎么实现的呢?答案很简单:工程师在每次请求时,都把你们之前的对话历史,像前情提要一样,重新打包发给了模型。
第一轮你的输入: 你好模型看到的:你好
第二轮你的输入: 我叫晨光模型看到的:用户: 你好 助手: 你好!有什么可以帮你的吗? 用户: 我叫晨光想要获得连贯的多轮效果,关键不在模型会不会,而在你如何组织与传递历史内容。
产品经理视角:
- 成本意识:上下文越长,消耗的 Token 就越多,API 调用成本越高。设计需要长线记忆的产品功能时,必须考虑成本控制策略(如历史摘要、选择性遗忘)。
- 体验边界:所有模型都有上下文窗口上限。当对话历史超过这个长度时,模型就会开始失忆,PM 需要为产品设计合理的交互来处理这种情况。
- 技术方案:RAG 和多轮对话是两回事。RAG 是给模型看外部知识(小抄),多轮对话是让模型回顾聊天记录。
法则二:指令有层级
和模型交互时,指令并非生而平等,它们存在一个清晰的优先级金字塔。
Platform(平台层):模型厂商写在模型底层的最高指令,通常是关于安全、道德和行为准则的硬性约束,开发者无法查看或修改。例如「绝对不能生成有害内容」。
System / Developer(系统层):你在开发应用时通过 API 设置的系统提示词。它定义了 AI 的角色、性格、说话风格和任务目标。例如「你是一个风趣幽默的旅行规划师,要用海盗的口吻回答问题」。
User(用户层):终端用户在你的产品界面输入的内容。
当指令发生冲突时,优先级高的会覆盖优先级低的:platform > system > user。这就是为什么无论你怎么诱导,通常都无法让模型突破底线(Platform 层拦截),以及为什么 AI 会坚持自己的角色设定(System 层指令优先于 User 层)。
顺带说明,有时候会看到 assistant 这个角色,那是指模型生成的回答,只是模型消息的代指,不要和上面三个概念搞混。
产品经理视角:
- 产品定调:System Prompt 是 PM 定义 AI 人设和核心能力最重要的工具,产品文档里应该有专门章节来设计和迭代它。
- 边界设计:通过 System Prompt 可以建立产品的护栏,防止用户通过输入让 AI 偏离其核心功能定位。
法则三:万物皆 Token
一个常见的误区是,只有文本才算 Token。实际上,在先进的多模态模型中,无论是文本、图片、音频还是视频,最终都会被转换成模型能理解的 Token 来进行处理和计费。
不需要关心背后复杂的编码算法,只需要记住一个原则:输入的内容越多、越复杂(比如高清大图对比低分辨率缩略图),转化的 Token 就越多,费用就越高。各大模型厂商的官网上都有明确的定价页面。
产品经理视角:
- 成本建模:在设计包含图片上传、音视频分析等功能时,必须将多模态 Token 的成本纳入考量,例如限制用户上传的图片尺寸或视频时长。
- 功能定价:理解 Token 成本是为 AI 功能进行合理定价的基础,高消耗的功能自然应该对应更高的价格。
法则四:回归官方文档
二手知识和教程固然有价值,但官方文档永远是 AI PM 最可靠、最权威的信息来源。它更新最快、描述最准。
去哪找?官网的开发者中心或文档中心,直接进入 Docs。
怎么读?如果之前没有看过官方文档,直接去看可能会不知从何看起,这很正常。当你尝试看过一两次,就会摸清官方文档的套路:
- 快速开始:先跟着跑通一个最简单的 Hello World 示例,建立体感。
- 核心部分:精读核心概念部分,理解背后的原理。
- API 参考:当作字典,在需要时查阅具体的参数和用法。
下面几个从单轮到多轮的极简示例,清晰地展示了前面提到的法则。
最简单的单轮对话:
from openai import OpenAI
client = OpenAI()response = client.chat.completions.create( model="gpt-4o", messages=[ {"role": "user", "content": "写一个关于独角兽的晚安故事,一句话就行。"} ],)print(response.choices[0].message.content)加入系统指令,让 AI 扮演角色:
response = client.chat.completions.create( model="gpt-4o", messages=[ # System 层:定义 AI 的角色 {"role": "system", "content": "你现在是一只爱说冷笑话的猫。"}, # User 层:用户的输入 {"role": "user", "content": "今天天气怎么样?"}, ],)实现多轮对话,把历史喂回去:
response = client.chat.completions.create( model="gpt-4o", # messages 列表里包含了完整的对话历史 messages=[ {"role": "user", "content": "你好,我叫晨光。"}, {"role": "assistant", "content": "晨光你好!有什么可以帮你的吗?"}, {"role": "user", "content": "你还记得我叫什么吗?"}, ],)最后
总结一下大模型开发的四大核心法则:
- 模型无记忆:多轮对话是通过传递历史上下文实现的。
- 指令有层级:System Prompt 是定义 AI 角色的关键。
- 万物皆 Token:多模态输入的成本需纳入考量。
- 回归官方文档:它是你最可靠的信息来源。
理解这些底层逻辑,会让我们在 AI PM 的道路上走得更稳、看得更远。
核心结论
标注「判断」「假设」的是我的看法而非事实;标注「已推翻」的保留在这里,不删除。
大模型本身是无状态的,它没有任何记忆。所谓多轮对话,是工程师每次请求时都把之前的对话历史像前情提要一样重新打包发给模型。#
把握较大
模型内化记忆的知识,远比通过 RAG 临时喂给它的知识更深刻。前者是消化吸收过的,后者只是看了一眼小抄。#
判断
指令存在优先级金字塔,冲突时 platform 覆盖 system,system 覆盖 user。这就是为什么无论怎么诱导都无法让模型突破底线,以及为什么它会坚持角色设定。#
把握较大
在当前以 Transformer 为主的阶段,参数量大是知识记忆能力强的必要条件,72B 以上大致是基础知识水平达标的门槛。#
判断
把自己领域内的困难 case 记下来做成私人测试集,每次有新模型发布就跑一遍,十几分钟就能对它的能力边界和脾性建立体感。#
判断 · 把握较大
引用本文
晨旭,《LLM应用开发之前,必须掌握的一些宏观概念》,晨光里的AI,2025-10-16
[晨旭:《LLM应用开发之前,必须掌握的一些宏观概念》](https://chenxu.xin/writing/llm-macro-concepts)带进你的 AI 继续追问
这篇文章有一份干净的 Markdown 原文,可以直接交给任何模型读,不用复制粘贴。