# 产品经理视角学AI——CV领域（二）

> 作者：晨旭｜发布：2025-09-29｜系列：AI技术理解
> 来源：https://chenxu.xin/writing/pm-learning-cv-2

大模型如何重写计算机视觉：从 CNN 到 Transformer 与扩散模型，Prompt 与零样本新范式，VLM 对分类检测分割的冲击，以及 CLIP、LLaVA、GPT-4V 与工程落地的真实门槛。

---

在上一篇[产品经理视角学AI——CV领域（一）](/writing/pm-learning-cv-1)中，我们已经打下了坚实的 CV 基础，从图像数字化、经典卷积操作，到理解图像分类、目标检测、图像分割及图像生成这些核心任务的演进，再到 AlexNet、ResNet、ViT 等里程碑式技术的变迁。并且，作为产品经理，我们不仅要知其然，更要理解其背后的业务价值、输入输出、性能边界和落地成本。

本系列文章的第二部分，我们将承接第一部分的扎实基础，深入探讨：

- **大模型时代**：算法架构如何从 CNN 演进到 Transformer 与扩散模型？
- **新范式**：Prompt 学习、零样本学习如何引领 CV 任务走向「开放世界」？
- **VLM 冲击**：视觉-语言模型如何颠覆传统 CV 任务的定义？
- **研究变革**：多模态大模型如何引领 CV 走向跨模态融合与更宏大的智能体？
- **角色转变**：无监督、弱监督、少样本学习在大模型时代的新价值。
- **未来版图**：数据集、评估方式如何迭代，以及生成式 AI 如何与 CV 深度融合。
- **落地挑战**：将大模型应用于实际产品面临的技术与工程难题。

这一篇将从大模型对传统 CV 领域的冲击出发，以产品经理的视角，洞察 CV 技术在这一波 AI 浪潮中如何进化，以及产品经理该如何抓住机遇、应对挑战。

## 四、大模型时代

### 1、算法架构演变：从 CNN 到 Transformer 与扩散模型

Vision Transformer（ViT）的提出标志着视觉领域从卷积神经网络（CNN）向 Transformer 架构迁移的开始。Dosovitskiy 等人在 2020 年 NeurIPS 提出 ViT，将纯 Transformer 应用于图像分类，证明在大规模数据下 Transformer 可达到与 CNN 媲美的性能。此后，Swin Transformer 引入分层移窗自注意力，实现多尺度表示。Swin 作为通用视觉主干，在分类、检测、分割等任务上取得当时最优结果，展示了 Transformer 作为视觉骨干网络的巨大潜力。与之相呼应，Facebook 团队提出 ConvNeXt（Zhuang Liu et al., CVPR 2022），通过现代设计改进 CNN，也达到与 ViT 相当的性能。ConvNeXt 证明了卷积网络在融合 Transformer 的一些优势后依然具有竞争力，是对 CNN 架构的一次成功重构。

与此同时，扩散模型（Diffusion Models）在图像生成领域崛起，取代了 GAN 成为新范式。早期 Ho 等人（NeurIPS 2020）提出 DDPM 扩散模型后，OpenAI 的 DALL·E 2（Ramesh et al., 2022）和 Google 的 Imagen（Saharia et al., 2022）展示了基于扩散的文本生成图像惊人效果。最具代表性的是 Latent Diffusion Models（Stable Diffusion）（Robin Rombach et al., CVPR 2022）：通过在低维潜空间执行扩散，极大降低了计算开销，同时在图像生成和图像编辑等多任务上取得最新 SOTA 性能。Rombach 等人贡献了高效的扩散模型训练策略，使得扩散模型不仅生成质量高，而且在推理速度上相较像素空间扩散显著提升。

总的来说，从 2022 年以来 CV 架构的主流正在从纯 CNN 走向 Transformer 主导，并在生成任务中由扩散模型取代 GAN，架构革新为大模型提供了基础。

**代表性论文**

- **Dosovitskiy et al., 2020 – Vision Transformer (ViT)**：首次将 Transformer 用于图像分类，在大数据集下取得与 CNN 相当的性能，开启视觉 Transformer 时代。
- **Liu et al., 2021 – Swin Transformer**：提出分层移窗 Transformer，实现多尺度高效建模，在分类（ImageNet 87.3%）、检测（COCO 58.7 AP）和分割（ADE20K 53.5 mIoU）上超越当时 SOTA。
- **Liu et al., 2022 – ConvNeXt**：对标 Transformer 优化卷积架构，在 ImageNet 等上达到与 ViT 相当表现，证明 CNN 在大模型时代依然具生命力。
- **Rombach et al., 2022 – Latent Diffusion (Stable Diffusion)**：将扩散过程移入潜空间，大幅降低计算成本，实现高分辨率图像合成，在无条件生成、图像修复、超分辨率等多任务上取得当时最佳性能。

### 2、大模型引领的 CV 任务新范式：Prompt 学习与零样本学习

大模型使得计算机视觉任务涌现出 Prompt 学习、零样本 / 少样本等新范式。OpenAI 的 CLIP 模型（Radford et al., 2021）是里程碑式工作：它通过对 4 亿图文对进行对比学习，训练出图像编码器和文本编码器的统一嵌入空间。CLIP 的一个重大突破在于零样本学习能力——给定新的分类任务，无需额外训练，只需提供类别名称文本提示，即可实现可与有监督模型相媲美的准确率。例如，在 ImageNet 上，CLIP 通过提示模板（如「a photo of a {label}」）进行零样本分类，达到与 ResNet-50 相当的精度而无需使用任何训练样本。这一成果震撼了传统 CV，展示了利用自然语言提示在视觉领域进行任务泛化的可能。

在此基础上，研究者提出了可学习的提示（Learnable Prompt）技术，以进一步适配下游任务。Zhou 等人（NTU，新加坡）在 CVPR 2022 提出 CoOp（Context Optimization）方法。CoOp 将 CLIP 文本提示中的上下文词替换为可训练向量，只需极少数标注图像就能自动学习出比人工设计提示效果更好的词串。其改进版 CoCoOp（Zhou et al., ECCV 2022）更进一步，引入一个轻量网络根据每张图像动态生成条件化提示，实现了对未见类别更强的泛化。这些工作表明，在大模型时代，针对具体视觉任务不一定需要微调整个模型，而是可以冻结大模型参数，通过学习少量提示向量来高效地调整模型行为。这种参数高效微调范式在视觉领域正日趋流行。

另外，大模型还带来了视觉中的「in-context」学习。DeepMind 的 Flamingo 模型（Jean-Baptiste Alayrac et al., NeurIPS 2022）将几十亿参数的语言模型与强大的图像编码器融合，能够通过在输入中提供少量图像-文本示例来「在上下文中」学习新任务。Flamingo 在多模态 few-shot 学习基准上取得新高度：只需每个任务 4 个示例，无需梯度更新，就超越以往针对每个任务单独微调的大模型。它的接口非常简单——输入由交替的图像和文本组成 prompt，模型读入后直接生成回答。Flamingo 的成功表明，多模态大模型也具备类似 GPT-3 那样的 Few-Shot 能力，能仅通过上下文示例来适配新视觉任务，这在传统 CV 中是不可想象的。

**代表性论文**

- **Radford et al., 2021 – CLIP**：开创图文对比学习，实现图文统一表示，首次在超过 30 个数据集上展示零样本视觉分类能力，ImageNet 零样本精度接近有监督。
- **Zhou et al., 2022 – CoOp**：将 Prompt 上下文参数化，仅用少量样本即可学习任务相关提示词，比手工 Prompt 显著提升分类性能，开启视觉 Prompt 学习新范式。
- **Alayrac et al., 2022 – Flamingo**：提出 80 亿参数的视觉语言模型，通过提供图文示例实现 few-shot 多模态推理，在 16 项开放式任务上零样本 / 小样本性能创纪录，证明视觉模型的上下文学习能力。

### 3、Vision-Language 模型对传统 CV 任务的冲击

大模型尤其是视觉-语言模型（VLM）正在重塑传统的图像分类、检测、分割等任务范式，引发巨大冲击。

首先，在图像分类上，过去需要大量带标签数据训练专门分类器，而有了 CLIP 这类模型后，实现分类只需给定类别名称作为文本提示即可。CLIP 等模型显著提升了模型对开放集类别的泛化能力。例如，CLIP 的零样本分类器在 ImageNet 上达到 76.2% 的 Top-1 精度，与一个有监督 ResNet-101 相当。这表明固定的大模型加文本提示已能解决传统封闭集分类问题，削弱了过去针对小型数据集反复训练模型的必要性。一些工作更进一步，如 Tip-Adapter 系列利用 CLIP 的特征做快速适配，几乎无需训练即可在少样本情况下取得优异表现。可以说，VLM 使零样本 / 开放集分类成为新常态，迫使传统分类方法转型。

在目标检测领域，视觉大模型引入了开放词汇检测的新范式。微软提出的 GLIP 模型（CVPR 2022）将目标检测和短语定位统一预训练，使模型学会用文本描述来定位对象。GLIP 在无需针对 COCO 进行专门训练的情况下，零样本直接在 COCO 上取得 52.1% mAP，远超此前最佳零样本方法。谷歌的 OWL-ViT（ICLR 2022）等也实现了类似的开放词汇检测。与传统检测只能识别固定类别不同，这类模型通过文本嵌入表示类别，因此可检测任意语义概念。它对经典检测方法形成冲击：过去的检测器需要为每个新类别重新标注训练，而现在有了大模型，检测器变得「开箱即用」，可通过一句文本描述来检出对应物体。这极大拓展了检测的应用边界，也减少了人为标注需求。

在图像分割方面，Meta AI 发布的 Segment Anything Model（SAM）（Kirillov et al., 2023）被誉为图像分割的基础模型。SAM 通过在庞大数据集（SA-1B，包括 11 亿掩膜标注）上训练，获得了通用分割能力。用户只需提供简单提示（点选、框选甚至文本）即可让 SAM 在任何图像上分割出所需目标。令人瞩目的是，SAM 在无需针对下游数据集微调的情况下，对许多图像实现了零样本分割，其输出质量在很多情况下甚至超过了以往有监督方法。例如，在没有针对医疗图像训练的前提下，SAM 对医疗影像的分割效果已接近专门模型。这对传统语义 / 实例分割研究是重大冲击——过去每个分割任务都要收集像素级标注训练模型，而现在一个泛化能力极强的 SAM 模型就能「一键分割任何东西」。这可能削弱对专门分割算法改进的兴趣，促使研究重心转向如何更好地利用和细化这类基础分割模型。

**产品经理视角**

Vision-Language 大模型通过统一视觉与语言信息，赋予模型开放世界识别能力。模型可以输入图像加任意文本提示，输出对应的结构化结果（如标出检测框或分割掩膜）。这让一个单一模型即可胜任多个传统任务，模糊了分类、检测、分割之间的界限。例如，Google 研究者提出的 PaLI 系列模型能通过文本提示执行分类、检测甚至 OCR 等任务。Hugging Face 的报告指出：「VLM 能够通过多样化 Prompt，将输入图像转化为文本、坐标等不同格式输出，实现对传统视觉任务的泛化。」这预示未来许多视觉任务将被融合到多模态对话或 Prompt 接口中完成，传统 CV 算法范式正被重新定义。

**代表性论文**

- **Radford et al., 2021 – CLIP**：图文预训练模型，首次实现大规模零样本图像识别；作者证明 CLIP 可通过提示完成各种分类任务，灵活度远超传统模型。
- **Li et al., 2022 – GLIP**：将检测与语言结合预训练，实现开放词汇检测。零样本情况下在 COCO 上达 52.1% mAP，展示大模型在检测领域的强大泛化能力。
- **Kirillov et al., 2023 – Segment Anything (SAM)**：提出面向分割的基础模型和数据集，实现了「万物可分割」。无需训练即可对任意图像生成高质量分割掩膜，零样本性能甚至超过专门模型。

### 4、多模态大模型引导的 CV 研究方向变革

多模态基础模型的兴起也引领 CV 研究范式从单一模态拓展到多模态融合，加速了视觉和语言、语音、3D 等的交叉研究。大型多模态模型具备综合理解和推理能力，正重构计算机视觉的应用版图。

**视觉描述与问答**：以往图像描述（Captioning）和视觉问答（VQA）是 CV 与 NLP 结合的典型任务，需设计专用模型。而如今诸如 BLIP-2（Junnan Li et al., 2023）等模型将冻结的视觉编码器与大型语言模型无缝衔接，仅训练一个小型桥接 Transformer（Q-Former），即可实现开箱即用的图像描述、生成人机对话答案等能力。BLIP-2 的创新在于将视觉信息转化为 LLM 可理解的 Query 向量，从而让一个冻结的 11B 参数语言模型具备看图对话能力。这表明，通过连接视觉与语言模态，可以轻松构建功能丰富的多模态 AI 系统。2023 年涌现了大量类似模型（如 LLaVA、MiniGPT-4 等），CV 研究由关注图像本身延伸到如何与语言模型结合以完成复杂任务。

**跨模态检索与理解**：多模态模型还拓展了信息检索和文档理解的新方向。例如 Meta 的 ImageBind（Girdhar et al., 2023）一次性联合了图像、文本、音频、深度等 6 种模态的表示学习，实现不同模态间的直接对齐与检索。又如跨模态文档问答中，传统方法需 OCR + NLP pipeline，而现在有研究利用视觉语言模型直接输入文档图像和问题，在嵌入空间检索相关页面并生成答案。多模态模型可以端到端地处理复杂文档的视觉和文本信息，极大简化了流程。这些进展引领 CV 走向更广义的「感知-理解」问题，例如从网页或视频界面直接通过视觉反馈与环境交互。这预示未来 CV 算法将更多地被集成到多模态智能体（Agents）中，用于人机交互、机器人感知等场景。

**决策与机器人视觉**：多模态模型还开始与强化学习、机器人相结合，催生视觉-语言-行动模型（Vision-Language-Action, VLA）。例如 Stanford 2022 年的 VLA 模型和近期的 π0 机器人模型，将图像观察与文本指令输入大模型，直接输出机器人动作序列。虽然这些系统仍在早期，但趋势是让 CV 不再孤立地做感知，而是与语言和决策模块协同，构建具备理解和操作能力的综合 AI。这改变了 CV 研究的目标：从提升单一感知准确率，转向提升跨模态推理和决策的整体表现。

**产品经理视角**

多模态大模型打破了 CV 的边界，使视觉任务成为更大 AI 系统的一部分。研究者越来越关注如何将视觉模型与 LLM 等结合来完成复杂任务，例如对话式分析图像、根据视觉输入执行操作等。这引导 CV 社区涌现出大量跨领域课题，传统 CV 会议中多模态、生成式对话类论文比例上升。计算机视觉不再仅是研究图像本身，而是走向视觉感知-语言描述-决策执行的一体化，这将深刻影响未来 CV 应用的形态。

**代表性论文**

- **Li et al., 2023 – BLIP-2**：提出冻结视觉和语言大模型，仅训练 Q-Former 桥接，实现零样本图像描述与问答。比起端到端训练大模型，BLIP-2 仅需训练 2% 参数，却达到了接近 GPT-4 的看图对话能力。
- **Girdhar et al., 2023 – ImageBind**：首个将 6 模态（图像 / 文本 / 音频 / 深度 / IMU 等）统一到同一表示空间的模型，实现跨模态搜索和对齐，拓展了 CV 与其他模态结合的新维度。
- **Alayrac et al., 2022 – Flamingo**：（前文已述）视觉语言 few-shot 模型，实现通过图文交互 prompt 完成多模态任务，表明 CV 模型可与 LLM 结合进行通用推理。

### 5、小样本、无监督、弱监督学习在大模型时代的新角色

无监督 / 自监督学习成为大模型时代视觉特征学习的核心。在有监督数据有限的情况下，大模型往往借助大规模无标签数据进行预训练，然后迁移至下游任务。2022 年以来，自监督预训练方法不断刷新性能纪录。Meta 的 DINOv2 模型（Oquab et al., 2023）是一个里程碑——它在 1.42 亿张多样化无标注图像上训练 ViT 模型，证明纯自监督方法也能学到通用且强大的视觉特征。DINOv2 提取的特征可直接用于各种任务，仅训练线性分类器就可在分类、检测、分割等众多基准上媲美甚至超过有监督预训练。这表明只要数据足够多且多样，自监督大模型完全可以取代有监督模型，成为视觉特征的通用支撑。这一发现令研究者重新审视无监督学习的重要性——自监督不再只是辅助，而是构建 foundation model 的关键途径。

与此同时，弱监督（利用噪声标签或元数据）和半监督也发挥着作用。大模型训练常常结合弱标签的数据，例如 Instagram 标签、Alt 文本等。这些弱标注为模型提供了基本的语义对齐。如 CLIP 利用网页 Alt 文本作为监督取得成功，Facebook 的 SEER 模型（Goyal et al., 2021）利用十亿张 Instagram 图像的标签预训练 CNN 亦取得强表现。这暗示在大模型时代，大规模弱标注数据可以弥补人工标注不足，弱监督是实现模型「量变」的重要手段。

少样本学习在大模型时代的角色也发生转变。过去 CV 领域针对少样本数据集（如 few-shot 分类）发展了度量学习、数据增广等方法。而现在有了大模型预训练，few-shot 任务通常通过两种方式解决：其一，预训练大模型的零样本或 Prompt 能力——如 CLIP 本身就能通过提示完成少样本任务，无需再专门设计复杂小样本算法；其二，高效微调大模型——即只调节模型的极少部分参数（如提示向量、LoRA 等）即可在极少数据上达到好结果。后者例如 Google 的 Tune-A-Video 方法将文本-视频大模型在几帧新视频上调整，很快生成指定内容新视频。这类方法显示与其针对每个小数据集造新模型，不如利用大模型的知识通过小幅调节来迁移。

可以看到，大模型弱化了专门小数据学习算法的必要性：因为大模型本身蕴含了丰富的通识，在小数据场景下直接调用即可。例如，少样本图像分类曾是研究热点，但有了 CLIP / ALIGN 后，只需一条文本提示即解决；又如 few-shot 检测，GLIP 等大模型已经很接近零样本性能，使开发复杂元学习算法的收益变小。由此，研究重点转向参数高效的模型适配（PEFT），如只训练几个卷积核或添加适配层就能让大模型习得新类知识，而不再热衷于针对小数据从零设计网络。

总之，无监督学习已跃升为训练基础视觉模型的主要范式，弱监督海量数据为其提供燃料；少样本学习从独立课题变成如何巧用大模型的问题。未来我们会看到更多如「模型即数据」的趋势——预训练好一个通用模型，再让它去高效吸收各种小数据任务，而不是每次从头开始训练新模型。

**代表性论文**

- **Oquab et al., 2023 – DINOv2**：Meta 提出的自监督 ViT 模型，在无需微调下直接提供高质量视觉特征，在多个任务上表现超越有监督 SOTA，标志自监督学习性能质变。
- **He et al., 2022 – MAE (Masked Autoencoder)**：Facebook 提出的自监督 ViT 训练方法，通过遮挡重建训练视觉 Transformer，在下游检测分割中超过有监督模型性能。
- **Zhou et al., 2022 – CoCoOp**：一种参数高效少样本适配方法，仅训练一个生成网络为每张图像产生条件 Prompt，实现跨类别的少样本泛化，代表大模型 few-shot 迁移的新思路。

### 6、数据集与评估方式的变化

大模型时代的数据集构建和模型评估也发生了转变。

首先，训练数据集规模空前扩大，来源从人工标注转向互联网抓取。以往 CV 基准（如 ImageNet 的 100 万张标注图像）在大模型面前显得「过小」。诸多基础模型使用亿级别未标注数据：CLIP 用 4 亿对图文，JFT-3B 包含 30 亿图像，LAION-5B 包含 50 亿图文对，Segment Anything 用 1100 万图像加 11 亿掩膜等。为了保证数据质量和多样性，研究者倾向于构建专门的过滤管线而非全网爬取。例如 DINOv2 团队从 12 亿候选图像中筛选出高质量、有多样性的 1.42 亿张作为预训练数据。数据层面的工作（如数据平衡、去噪）变得至关重要。这一趋势使 CV 研究从过去着重模型设计，拓展到大规模数据工程：如何自动收集具覆盖面和准确性的海量数据以训练 foundation model，成为评价模型实力的重要因素。

在评估方面，传统单一基准已经不足以衡量大模型。以前一个模型在 ImageNet 上 Top-1 提高 1% 就是显著进展，而现在基础模型往往在 ImageNet 上早已饱和（如 ViT L/16 已超 90% 精度）。因此，社区开始设计更广泛、更综合的评测方案。例如 Stanford 提出 ELEVATER 基准，评估模型在 20 多个细分分类任务的迁移表现；还有人倡议重新审视 ImageNet 的单标签假设，改为多标签评测以更贴近真实世界。模型的跨数据集泛化能力受到重视。CLIP 论文中测了 30 多个数据集，以验证模型对分布外数据的鲁棒性。这一趋势延续到新模型，如 Segment Anything 需要在各行各业图像上测试零样本分割效果，才能证明其通用性。可以预见，未来评估将趋向「万事万物」：即在尽可能多的任务和数据上检验模型，以评估其真正的广泛适用能力和鲁棒性，而非只盯某一指标。对此，一些研究提出了「终身评测集」概念，不断扩充评测任务集合，让模型性能随时间推移接受新挑战。

评测方式的另一变化是注重开放世界和交互。如评估分割模型，不再只看像素 IoU，而增加了交互式评估（例如 SAM 通过用户点选得到的结果质量）。多模态对话模型则需要用人为对话评分等方法衡量。这些都促使评测从静态向动态、人类参与的方式发展，评价模型在真实交互场景中的表现。

最后，大模型时代也促使社区反思现有 Benchmark 的公平性和完整性。一些工作指出 ImageNet 标注的局限，倡导构建更复杂的综合基准。例如 Facebook 提出 LVIS 作为更大类别集合的检测评测，或 Google 提出零样本开放世界检测测试等。数据集本身也在迭代：从 ImageNet 到 ImageNet-V2，再到 ObjectNet，用于检验模型在偏差和真实分布下的表现。可以说，大模型逼着我们升级评测标准，因为它们在旧基准上可能早已达到或超越人类水平，需要更高标准来区分优劣和发现不足。

**代表性变化**

- **超大规模数据集**：从 ImageNet-1K（100 万标注）到 JFT-3B（30 亿弱标注）再到 LAION-5B（50 亿网页图文）。数据获取从人工众包走向自动爬取和滤波管线。
- **综合评测集**：ImageNet 已经不足够，增加跨任务、多标签、多分布评测。Holistic Evaluation of Language Models（HELM）类似理念在视觉中出现，多维度衡量模型性能。
- **开放世界评测**：评估模型在未见类别或开放场景下表现（零样本分类检测性能等），衡量模型泛化能力而非封闭集精度。
- **交互式评测**：针对多模态对话、交互分割等，引入人工反馈和应用场景测试，以检验模型实际可用性。

### 7、CV 与生成式 AI 融合：跨模态生成的新进展

生成式人工智能在图像领域的突破，使计算机视觉与生成任务深度融合，形成诸多新趋势。

**文本生成图像（Text-to-Image）**：2022 年是这一方向的爆发年。OpenAI 的 DALL·E 2（Ramesh et al., 2022）和 Stability AI 的 Stable Diffusion（Rombach et al., 2022）展示了根据文本描述生成高分辨率图像的惊人能力。特别是 Stable Diffusion 作为开源模型，凭借出色效果迅速催生了大量应用（艺术创作、商业设计等）。文本生成图像任务本属多模态范畴，但其成功对 CV 产生了回馈影响：首先，扩散模型需要理解文本含义并关联到视觉概念，这本身提升了模型的视觉语义表示能力；其次，这些模型生成的海量图像也可反过来作为训练数据，缓解 CV 数据匮乏问题。例如一些研究利用生成模型合成数据增强下游检测和分割，从而提高精度。因此，文本生成图像不仅是一个新应用，也为 CV 提供了新的数据源和训练手段。

**图像生成文本（Image-to-Text）**：计算机视觉传统任务如图像描述、视觉问答在大模型时代取得突破。过去这些任务需要卷积网络加 RNN / Transformer 联合训练，而现在可以通过预训练视觉骨干加预训练语言模型的方式实现。例如 BLIP 系列模型结合 ViT 和 GPT 样的模型，实现对图片内容的流畅描述和问答。OpenAI 的 GPT-4 模型（2023）更是直接接受图像输入，展示了统一模型理解图文并生成回答的能力。这标志 CV 与 NLP 的进一步融合——图像理解的结果可以用自然语言完整表达出来。相应地，评测这类任务也从纯客观指标转向语言质量评价（如 BLEU、CIDEr 等），视觉模型需要在语义和叙述层面与人类对齐。

**生成辅助视觉任务**：新近的研究探索利用生成模型来辅助传统 CV 任务或者实现新功能。一个典型是 ControlNet（Lvmin Zhang et al., ICCV 2023），它在预训练扩散模型基础上添加可控分支，使之能够依据额外输入（如草图、边缘图、人体姿态等）来引导图像生成。ControlNet 本质上将传统 CV 产生的中间产物（如边缘检测、姿态估计结果）与生成模型结合，使用户精细控制生成图像内容。这相当于把 CV 解析能力融入生成流程，开启了「由分析辅助合成」的新模式。在反方向，生成模型也可用于辅助分析：如通过生成来做数据增强、或者用扩散模型的隐变量表示来进行图像聚类分割等。一些工作（如 Segment Anything 与 Stable Diffusion 结合，实现以文字指定分割要求）表明 CV 任务和生成任务之间的界限日趋模糊，未来可能出现分析-生成一体化的模型，一边理解世界一边生成内容来协助理解或交互。

计算机视觉正与生成式 AI 深度融合，带来了双向的创新：

- CV 提供检测、分割等结果作为生成模型的条件输入，提升了生成内容的可控性；
- 生成模型提供逼真的合成数据和新的网络结构（如扩散模型 U-Net）反哺 CV 应用。

这种融合催生新的研究热点，例如图文双向检索与生成（输入图像查询相关文本或反之）、跨模态编辑（根据文字修改图像内容，如 InstructPix2Pix）、视觉内容创造（文本生成 3D、生成视频）等等。可以预见，未来 CV 系统将不再仅仅是被动感知，还可以主动「想象」与合成，从而以更智能的方式理解和重建我们所处的视觉世界。

**代表性成果**

- **Ramesh et al., 2022 – DALL·E 2**：基于 CLIP 嵌入和扩散模型，实现高保真度的文本生成图像，被评价为「生成式视觉模型的里程碑」，引领了一系列后续工作。
- **Rombach et al., 2022 – Stable Diffusion (LDM)**：开创潜空间扩散，高效生成高分辨图像，开源释放极大生产力；论文强调了高效扩散在保持质量同时将推理计算降低一个数量级。
- **Zhang et al., 2023 – ControlNet**：提出在扩散模型中加入可学习分支来执行视觉条件控制，使用户能够通过提供边缘、分割等额外信息精确地引导图像生成，融合了传统 CV 输出与生成模型。

### 8、传统 CV 子领域热度与价值的变化——视觉任务的统一

> CV 终极目标：构建一个能够执行所有视觉任务的通用模型。

大模型的全面崛起，对某些传统计算机视觉子领域的研究热度和实用价值产生了影响。一些过去热门的方向在「大模型 = 通用方案」的背景下受到了降温，而另一些方向则被赋予新定位。

**图像分类和识别**：作为 CV 老牌任务，分类在大模型时代已经相对成熟。ImageNet 分类精度经大模型预训练已非常高（ViT、Noisy Student 等都超过 88%），再提高的空间有限。而且有了 CLIP 这类开放词汇模型，研究者不再满足于封闭标签分类，而是转向开放集识别和细粒度识别。因此传统针对 ImageNet 提升几个点性能的工作明显减少。相反，更开放、更具挑战的识别场景（零样本分类、跨域分类）获得更多关注。一句话，大模型使普通分类成为「已解决问题」，学界将目光移向尚未解决的开放世界识别难题。

**目标检测与分割**：这些领域也出现类似趋势。过去小幅提升 COCO AP 或 Pascal mIoU 是论文卖点，但现在 GLIP、SAM 等基础模型一次性提升幅度巨大。尤其 SAM 的出现，使得通用物体分割有了现成工具。一些公司和开发者直接用 SAM 处理实际问题，而不再训练特定分割模型。这可能减少学术界对新分割算法的投入。不过，需要强调的是，并非这些领域就此停滞——而是研究重点转向了新问题：例如如何高效地微调大模型用于特定检测 / 分割任务、如何结合领域先验提升大模型输出等。此外，在应用端，对实时性、更小模型的需求依然存在，这些也都是新的增长点。总体而言，大模型弱化了在标准数据集上挖空心思提点指标的意义，促使研究者去探索更具广度和泛化性的问题。

**低级视觉和特定任务**：诸如图像去噪、超分辨、风格迁移等传统领域也受到生成模型的冲击。过去这些任务依靠专门卷积网络，如今扩散模型和 Transformer 也可胜任，并且经常作为大模型的子模块出现（例如 Stable Diffusion 本身就可用于图像去噪重建）。因此这些子领域的研究热度相对降低，一部分并入了生成式模型研究（如把超分辨看作条件生成）。再如光流估计、3D 重建等方向，以前各自为政，现在则考虑如何将其输出融入大模型（例如 ControlNet 用姿态 / 深度辅助生成）。大模型提供了统一的框架，一些以往独立的问题变成了这个框架中的一个功能模块，研究范式随之改变。

**专用模型 vs 通用模型**：大模型横扫千军之势，是否意味着「小模型」不再需要？目前来看，并不会完全取代。一些高要求场景（实时、移动端）仍需要轻量模型，大模型难以部署。因此 TinyML、模型蒸馏等依然活跃。英伟达等提出「小模型大智慧」理念，探索小模型结合大模型先验以达到高效推理。大模型确实弱化了纯粹改进小模型性能的价值，但也让「小模型如何利用大模型」成为新课题。例如在边缘设备上，通过提取大模型的知识（蒸馏）或在云端协助，达到比过去独立训练小模型更好的效果。这方面的研究近来也在兴起。

大模型时代逼着 CV 领域「去卷 Benchmark」，一些在封闭环境内卷性能的方向退居次要。但这不等于这些方向毫无价值，而是促使它们融合进新的图景：要么成为大模型的一部分，要么针对特定应用进行差异化发展。研究者更倾向于提出通用方法而非局限于单任务专用网络。这种转变体现了 CV 研究范式从「纵向深挖」（在固定任务上极致优化）转向「横向打通」（跨任务的统一建模）。例如，近年顶会可以看到，同一个 Transformer 架构在检测、分割、姿态估计上通吃的论文增多。这正是大模型思想的体现：一个模型解决多类问题，比起一个问题做多个模型，更有吸引力。未来某些传统子领域可能淡出主流视野，但新的更宏大的研究方向已经形成。

**产品经理视角梳理**

基础模型推动着计算机视觉领域朝着一个终极目标迈进：构建一个能够执行所有视觉任务的通用模型。这个模型不仅能「看懂」图像（如分类、检测），还能「创造」视觉内容（如生成、编辑）。

当前的一个重要研究趋势是统一生成式与判别式模型。其背后的逻辑是，一个能够生成逼真物体图像的模型，必然对其结构、纹理和上下文有深刻的理解，而这种深刻的理解反过来可以用于判别任务，反之亦然。自回归模型是实现这一统一的有力候选方案，它借鉴了 LLM 中「预测下一个词元」的成功范式，试图将所有视觉任务统一为「预测下一个视觉词元（Visual Token）」的任务，无论是生成缺失的图像块，还是生成描述性文本或边界框坐标。

这种范式的转变也重新定义了人与 AI 的协作关系。在传统模式下，人类扮演着「教师」的角色，通过提供大量精细标注的数据，手把手地教会模型一项特定技能。而在基础模型时代，模型已经通过海量数据自学成才，具备了广泛的通用知识。此时，人类的角色转变为「导演」，在推理阶段通过高级指令（即提示）来引导模型完成具体任务。这种转变使得 AI 技术更加普及，但也对使用者提出了新的要求——掌握提示工程的艺术。模型的输出质量现在高度依赖于提示的质量，这已成为与大模型交互的核心挑战。

## 五、前沿技术——多模态

### 1、多模态的力量：视觉-语言模型（VLM）

VLM 是视觉基础模型（VFM）的基石，通过联合训练视觉和文本数据，在两个模态中架起桥梁。

- **架构演进**：从共同训练图像加文本，到以 LLM 作为大脑，研究重点是将视觉特征与 LLM 已有的丰富语义空间对齐。
- **零样本推理**：狗的图片和「一条狗的照片」这个图像与文本的强关联，可以直接作为分类器使用——计算图片与描述文本的相似度，相似度最高的文本提示所对应的类别即为预测结果。这就是「语言指导视觉」。

| 模型 | 发布年份 | 核心技术 | 主要创新 / 范式转变 |
| --- | --- | --- | --- |
| ViT (Dosovitskiy et al.) | 2020 | 纯 Transformer 图像编码器 | 首次证明 Transformer 架构在视觉任务上可以超越 CNN，奠定了 VFM 的架构基础。 |
| CLIP (Radford et al.) | 2021 | 对比式语言-图像预训练 | 通过自然语言监督实现了强大的零样本分类能力，建立了视觉与语义的桥梁。 |
| DALL·E 2 (Ramesh et al.) | 2022 | 扩散模型 + CLIP 先验 | 实现了高质量的文本到图像生成，展示了 VLM 在生成任务中的巨大潜力。 |
| DETR (Carion et al.) | 2020 | 端到端 Transformer 检测器 | 将物体检测重塑为集合预测问题，消除了对 Anchor 和 NMS 等手工组件的依赖。 |
| SAM (Kirillov et al.) | 2023 | 可提示的分割模型 | 提出了通用的、可交互的分割任务，创建了一个可被「指令」分割任何物体的工具。 |

### 2、CLIP：跨模态对齐的基石

**背景**：CLIP（Contrastive Language-Image Pretraining）是 OpenAI 在 2021 年发布的图文多模态模型。它通过对比学习同时训练一个文本编码器和一个图像编码器，将描述同一事物的图片与文字映射到同一个向量空间中。简单说，CLIP 可以计算任意图片和文字描述之间的相似度。如果一段文字很好地描述了图片内容，那么在 CLIP 的嵌入空间里两者的向量会很接近。

**核心贡献**：CLIP 利用了互联网海量的图文对（约 4 亿对数据）进行训练，不需要人为给每张图像打单独的标签。这种大规模跨模态对比学习使模型学会了「视觉概念」和「语言描述」之间的对应关系。例如，CLIP 学会了图片中某种动物的视觉特征与文本标签「猫」是匹配的。这种训练方式摆脱了传统有监督分类对单一标签的依赖，让模型具备了零样本学习能力——即使没见过某个新类别，也能通过文本描述来识别图片中的新类别。

**应用**：CLIP 真正让 AI 第一次达到「理解」图文关联的境界，许多神奇的应用由此成为可能。例如零样本图像分类（不用针对目标任务专门训练模型，只需提供类别名称，CLIP 就能在开放类别集合中选出图片属于哪类）；以文搜图（输入一段文字，从图片库里找出最符合描述的图）；以及作为生成模型的辅助（如 DALL·E 模型用 CLIP 来评价生成图像与文本的匹配度，从而挑选最合适的输出）。CLIP 已经成为现代多模态应用的底层模块。

**产品经理视角**

CLIP 对于产品的意义在于通用性。有了 CLIP，你可以在几乎不额外标注数据的情况下实现很多功能：比如让用户用一句话搜索图库；对内容审核，输入一串敏感词，模型就能检测相关图像。一句话，CLIP 提供了一个强大的「图文通用语义空间」。当然，作为 PM 也要注意 CLIP 的局限：训练数据来自网络，可能有偏见；对非常抽象或复杂场景，CLIP 的理解仍有限。实际应用中可能需要结合专用数据做一些微调或后处理。

**学习资源**

推荐阅读 OpenAI 的 CLIP 论文（Radford 等人，2021）的简介或中文版解读。重点理解 CLIP 的训练方式和它能实现的功能。你可以尝试使用开源的 CLIP 模型，输入图片和几种文本标签算相似度，从直观实验中体会 CLIP 的识别能力。这部分内容涉及新颖概念，但结合实例理解会更容易。

### 3、LLaVA：让大模型看见世界

**背景**：LLaVA（Large Language-and-Vision Assistant）是 2023 年出现的一种开放源代码多模态大模型。它将一个预训练的视觉编码器（如 CLIP 的 ViT 模型）与一个大型语言模型（如 Vicuna，一个开源对话模型）衔接起来，再经过特别构造的「视觉指令微调」，使模型能够对图像内容进行对话式的描述和推理。简单来说，LLaVA 就是类 GPT-4 的多模态版本，输入一张图和问题，模型会看图后用自然语言回答。

**核心贡献**：LLaVA 团队采用了一个巧妙而高效的训练流程：先用 GPT-4 自动生成了大量带图像描述的指令数据（如让 GPT-4 编造人问图的问题及答案），然后用这些合成数据来微调视觉-语言模型。这样，无需人工标注对话数据，模型就学会了看图对话。LLaVA 在公开的多种视觉问答基准上性能出色，甚至在一些复杂推理上接近 GPT-4V 的水平。

**模型特点**：LLaVA 使用了现成的 CLIP ViT-L/14 图像编码器和 Vicuna 语言模型，中间通过一个投影层融合。由于开源且训练成本相对低，社区很快推出了改进版如 LLaVA-1.5 等，进一步提升了效果。LLaVA 能做的不仅是简单的图像描述，还包括推理和对话（multi-turn 对图讨论）。例如给它一幅搞笑漫画，让它解释梗在哪，它往往能给出近似人类的理解。这对 CV 应用是革命性的拓展。

**产品经理视角**

有了 LLaVA 这样的技术，产品中可以实现复杂视觉问答功能，比如「让 AI 看用户上传的截图并指出问题」「看医疗影像回答诊断性问题」等。这意味着很多原本需要人工检查的场景可以由 AI 初步处理。当然，目前这些开源视觉大模型可能在准确性和可靠性上还不完美，需要在人命关天的领域谨慎评估。但不可否认，这代表了 AI 助手从「语言对答」拓展到「视觉对答」的趋势。作为 PM，应关注多模态大模型的演进，如用户体验如何设计（上传图片提问的交互），以及潜在的风险（例如视觉内容中的偏见识别、隐私保护等）。

**学习资源**

可以浏览 LLaVA 的 GitHub 主页和论文《Visual Instruction Tuning》了解其总体思路和性能摘要。由于模型和 Demo 已开源，不妨亲自试用：给 LLaVA 一些图片（风景照、网页截图等）提问，看看它的回答如何。这将帮助你评估这类技术现阶段的能力和局限。

### 4、GPT-4V：迈向通用多模态智能

**背景**：GPT-4V 通常指 GPT-4 的视觉多模态版本。OpenAI 的 GPT-4 本身是 2023 年发布的大型语言模型，而后来开放的视觉功能让它可以处理图像输入，生成相应的文字输出。GPT-4V 能够理解并描述任意图片内容、分析复杂图表，甚至基于图像进行推理。这被视为 AI 往「通用人工智能」迈出的重要一步。

**能力表现**：根据 OpenAI 发布的信息，视觉版 GPT-4 可以描述图片，例如给一张冰箱内部的照片，它能列出看到的食物；可以分析图表 / 示意图，从中提炼关键信息；还能理解笑话梗（如给它一张搞笑的 MEME 图，它往往能解释幽默所在）。更复杂的，如多张图片对比、跨模态推理，它都有很强的表现。在一些评测中，GPT-4V 在医学影像问答等专业领域展现出接近人类专家的理解力。当然，这些能力都是基于其强大的闭源模型和海量训练所得。

**获取方式**：GPT-4 的图像输入目前通过 ChatGPT Plus 提供（需要订阅）。用户可以上传图片并提问，得到模型回答。由于 GPT-4 底层细节未公布，我们并不知道它是否使用了类似 CLIP 的视觉编码器或者特殊训练，但从结果看，它的表现非常全面和强大。

**产品经理视角**

拥有 GPT-4V 这样的能力，产品上几乎可以实现科幻般的功能：任意领域的看图说话。例如辅助盲人用户「看」图片、智能审核复杂的图片内容（识别合规与否）、分析用户上传的图表文档等等。可以把它看作一个通用视觉大脑，能应对各种视觉任务的自然语言提问。当然，其局限在于模型是黑盒，可能出现错误（虽较少但仍有），而且需要互联网连接 OpenAI 服务（国内使用有延迟和合规问题）。成本上，调用 GPT-4 也较昂贵。因此在选型时，要权衡直接调用 OpenAI 多模态 API 还是使用开源方案定制。

**学习资源**

建议阅读 OpenAI 发布的 GPT-4 技术报告中关于多模态的章节。知乎等平台上有测试 GPT-4 看图能力的帖子，可以让你直观了解它能做什么。如果有条件，也可以试用 ChatGPT 的图像输入功能，亲身体验其强大之处。在学习过程中，思考如何将如此强大的通用能力应用到你的产品领域，以及有哪些风险点需要规避。

### 5、战略展望：未来的产品版图

**市场轨迹**：在医疗、汽车和零售等行业的推动下，多模态 AI 市场预计将实现爆炸性增长，到 2030 年代初将达到数百亿美元的规模。

**关键趋势**

- **从工具到智能体（Agents）**：范式正在从响应提示词的被动模型，转变为能够使用视觉作为关键传感器来规划和执行多步骤任务的主动智能体系统。产品经理应该思考如何使其 CV 功能成为更大 AI 智能体的一个工具。
- **自然的人机协作**：视觉是创建更无缝、更直观界面的关键模态。未来的产品将依赖于多模态输入（语音、文本、手势、视觉）来创造人与 AI 之间更自然的协作体验。
- **边缘计算与效率**：虽然大型模型在云端训练，但同时存在一股推动专业化和效率的浪潮，以便在手机、汽车和工业传感器等边缘设备上运行视觉模型。这为需要低延迟、保护隐私和离线功能的产品开辟了新天地。

**产品经理视角**

CV 产品的未来不在于构建最好的孤立分类或检测模型，而在于将视觉能力集成到更大、更具智能体特性、多模态的系统中，以解决复杂的、端到端的业务问题。竞争优势将从模型在基准测试上的性能，转向整体产品体验的无缝性和实用性。

CLIP 所创造的共享语义空间是当前整个生成式和多模态 AI 浪潮的根本推动者。它是连接之前相互独立的视觉和语言世界的、不那么显眼的「中间件」。理解了这一点，产品经理就能更好地评估新兴多模态技术的基本组成部分。同样，对于多模态大模型的「自建 vs 购买」决策，是 AI 产品公司更大战略选择的一个缩影：是通过在狭窄任务上构建更好、更专业的模型来竞争，还是通过在强大的通用平台之上构建更好的用户体验来竞争？这是一个产品经理必须有意识地去回答的问题，因为它决定了公司将在哪个层面上展开竞争。

给产品经理的四条原则：

- **始终以业务问题为起点**：在评估任何一项 CV 技术时，首先问它解决了什么具体问题，以及它在成本、速度和精度上的边界在哪里。
- **将技术权衡转化为产品决策**：理解并利用不同架构间的固有权衡，使其服务于你的产品定位和用户价值主张。
- **拥抱数据作为核心资产**：认识到在深度学习时代，高质量、大规模、合规的数据是构建护城河的关键，数据策略应与产品策略并行。
- **放眼多模态的未来**：思考如何将视觉能力与语言、声音等其他模态结合，创造出更智能、更自然的交互体验和更强大的智能体应用。

计算机视觉领域日新月异，但其发展的底层逻辑和商业应用的根本原则是相对稳定的。

## 六、技术挑战与工程落地

尽管基础大模型展示了强大能力，但在将其融入实际应用和持续改进过程中，还面临诸多技术挑战和工程难题。

**计算资源与效率**：大模型通常参数庞大（动辄数亿至数十亿），训练和推理成本高昂。例如 Stable Diffusion 作者指出，生成 5 万张图像需单张 A100 GPU 运行 5 天；Flamingo 模型有 80 亿参数，训练使用海量 TPU 算力。如此算力壁垒令普通研究团队和企业难以从头训练大模型。即使使用预训练模型，部署时的显存与算力需求也远超传统小模型，给线上服务带来压力。为此，出现了模型量化、剪枝、蒸馏等一系列工作，旨在压缩大模型以降低推理成本。社区也探索混合精度、稀疏激活等提升效率的方法。在大模型落地时，如何在精度与效率间取得平衡，是首要挑战。

**数据和隐私**：大模型依赖海量数据，但获取和使用这些数据涉及版权、隐私等问题。例如 Stable Diffusion 训练用的 LAION 数据包含受版权保护的图像，引发版权争议；医疗等领域的数据敏感，训练基础模型面临合规困难。未来需要开发隐私保护训练、数据合成等技术，以缓解数据获取瓶颈。同时，大模型常对训练数据分布外的情况缺乏保障，存在数据偏差和公平性问题，需要在评测和优化时特别关注。因此，工程落地时一方面要筹措大规模高质量数据，另一方面也要审慎处理法律伦理问题。

**评估与可靠性**：大模型功能强大但也较黑箱，其错误行为不易察觉。传统 CV 模型可以用准确率等简单指标评估，而大模型往往需要更复杂的测试。如何定义标准来衡量一个基础模型「足够好」是难题。同时，大模型易受对抗攻击、会产生不期望输出（如聊天跑偏或图像不恰当内容）。在安全关键领域（如自动驾驶、医疗诊断），必须证明模型输出可靠。这可能需要结合可解释性技术，让模型决策过程透明。当前一些工作在尝试通过监控注意力、可视化嵌入等方法解释大模型，但仍处早期。另外，构建持续评测管线，在模型更新时自动验证各项性能和安全指标，也是工程上需要解决的问题。

**微调与知识迁移**：虽然大模型具备零样本能力，但在很多专门场景下仍需微调。然而全量微调大模型存在灾难性遗忘风险，且计算开销大。如何以参数高效方式让模型掌握新知识而不遗忘旧知识，是一大挑战。为此出现了增量微调、参数隔离等算法，以及 LoRA、Adapter 等轻量模块插入技术，取得一定效果。但随着模型规模增长，这方面工作需要进一步创新。此外，多模态模型在整合新模态（如加入深度传感或加入新语言）时，如何复用已有模型也是开放问题。

**部署与集成**：工程上，将大模型嵌入现有系统也有难度。一方面是推理速度和延迟，如实时应用难以承受 GPT-4 几秒钟的反应时间。为此需要模型剪裁和加速推理库支持。另一方面是系统架构调整，大模型往往需要特殊硬件（GPU / TPU）及配套库，传统仅 CPU 的后端需大改造。许多公司投入将大模型服务化，如 OpenAI 提供云 API，使得应用不必本地部署模型。如何在云端高效服务也是工程课题，比如模型并发、弹性伸缩、缓存等优化。此外跨组件协同也是问题：不少应用需要 CV 模型、LLM、知识库共同工作，怎样设计接口和协议让它们高效协同，是软件工程挑战。

## 最后

「产品经理视角学AI——CV领域」的上下两篇到此就结束啦。我们不仅回顾了 CV 的基石（如图像数字化、卷积、经典任务与里程碑），更审视了大模型如何通过 Transformer、扩散模型等新架构，以及 Prompt 学习、零样本能力等新范式，彻底重塑了视觉任务的定义与解决方式。作为 AI 产品经理，理解这种演进至关重要：

**（1）底层逻辑**

AI 1.0 时代对算法原理、特征工程的理解，是构建「技术-业务」思维模型的地基。只有深入理解这些传统技术，才能更精准地评估大模型的价值与局限。

**（2）PM 角色的变迁**

在大模型时代，产品经理的重心从算法细节设计，转向了更宏观的数据策略、提示工程、模型评估与可靠性、跨模态体验设计，以及如何将 CV 能力融入更广阔的 AI 智能体系统。

**（3）持续的学习与实践**

文中提到的技术挑战与工程落地（如计算效率、数据隐私、评估体系等），正是当前 AI 产品化过程中最真实的痛点。这需要我们深入结合具体业务场景，通过实践与理论的结合，不断提升解决实际问题的能力。选择感兴趣或与工作关联度高的细分领域，深入钻研，将理论知识转化为产品洞察。

另外，作为 AI 时代的产品经理，应告别繁琐的文档工作，培养自己的综合素质能力：具备理性的 AI 技术分析能力，以及提升自身的人文素养去洞察用户需求、平衡伦理风险，创造真正有价值的 AI 产品。

希望这两篇文章能为正在迷茫中的你指引一个方向。对于大模型时代的 AI 产品落地，需要学习的远不止于此，我将继续结合实践，输出更多关于 AI 产品经理的思考与学习心得。

## 核心结论

- CLIP 用 4 亿图文对训练，仅靠一句文本提示做零样本分类，在 ImageNet 上达到 76.2% Top-1，与有监督 ResNet-101 相当。（把握较大）
  永久链接：https://chenxu.xin/writing/pm-learning-cv-2#clip-zero-shot-matches-supervised
- 视觉语言模型让一个模型同时胜任分类、检测、分割，模糊了这些传统任务之间的界限，传统 CV 算法范式正被重新定义。（判断）
  永久链接：https://chenxu.xin/writing/pm-learning-cv-2#vlm-blurs-task-boundaries
- 人与 AI 的协作关系在改变：过去人类是提供标注、手把手教模型的「教师」，现在是在推理阶段用提示引导模型的「导演」。（判断 · 把握较大）
  永久链接：https://chenxu.xin/writing/pm-learning-cv-2#human-role-teacher-to-director
- CV 产品的未来不在于构建最好的孤立分类或检测模型，而在于把视觉能力集成进更大的、具智能体特性的多模态系统。（判断）
  永久链接：https://chenxu.xin/writing/pm-learning-cv-2#cv-product-moat-is-integration
- 大模型不会完全取代小模型。实时、移动端、边缘设备等场景仍需要轻量模型，命题从「改进小模型」变成了「小模型如何利用大模型」。（判断）
  永久链接：https://chenxu.xin/writing/pm-learning-cv-2#small-models-still-needed

---

本文出自晨光里的AI（https://chenxu.xin），作者晨旭。
引用时请保留来源链接。文中标注「判断」「假设」的部分是作者的个人看法，不是事实。
