中文精炼导读

核心观点

  • Jay Alammar 的这篇索引页汇集了他在 Cohere 博客分享的"关于生成式 AI 与 AI 产品护城河的八个观察",并指向两篇长文:其一讨论"生成式 AI 是未来还是现在",其二讨论"AI 正在吃掉世界"。
  • 前四个观察的核心立场是"谨慎而务实":AI 进展令人敬畏但要注意时间线,必须区分"惊艳的 cherry-picked 演示"与"可靠、可上市"的用例;要把模型当成智能系统的组件而不是"心智";生成式 AI 只是冰山一角,嵌入(embedding)与神经搜索等更成熟的能力同样值得关注。
  • 后四个观察转向价值与护城河:从技术栈(应用层/模型层/数据与 MLOps 层)而非数据模态(文本/图像)来拆解 AI 行业;企业不应只规划一两个模型触点,而要规划数千个(谷歌内部 2017 年就有约 7,000 个使用深度学习模型的项目,后来更要求把生成式 AI 塞进所有最大产品);要算上基础模型的大量"后代"——微调模型是重要的价值来源;模型的公开使用画廊(如 Midjourney、Lexica.art)正在成为图像生成生态的经济价值组成部分。
  • 一个贯穿全文的提醒:商业护城河往往比技术护城河更重要——护城河不一定在模型里,也可能在数据、分发、品牌与使用反馈闭环中。
生成式 AI 与 AI 产品护城河
生成式 AI 与 AI 产品护城河

内容精讲

"Generative AI and AI Product Moats"本质上是一篇带索引性质的文章:它列出八个观察,每个观察对应 Cohere 博客系列《Generative AI is... Not Enough?》中的一篇。整个系列的出发点是在 2023 年初这个时间点上,给被生成式 AI 热潮裹挟的从业者一套冷静的思考框架。

观察一与二关于"时间线"与"可靠性"。观察一:最近的 AI 发展令人惊叹、承诺改变世界,但"何时兑现"要打问号——文本生成让软件第一次能产出连贯的人类语言,图像生成(DALL-E、MidJourney、Stable Diffusion)让"说出一个东西它就在眼前显形"成为现实,但正因为潜力巨大,才更需要谨慎。观察二则给出方法论:必须区分 cherry-picked 的惊艳演示(模型只有 40% 概率能复现的能力)与已经可靠、能进客户产品的能力。Stack Overflow 因"ChatGPT 给出正确答案的平均率太低"而禁止机器生成回答,就是"演示很惊艳、可靠性不达标"的典型;而神经搜索、文本自动分类、写作建议与头脑风暴,则是当时已经可靠的用例。

观察三与四是认知框架。观察三:把模型当作"智能系统的组件"而非"心智"——语言模型是语言理解与语言生成的组件,一旦这样想,就能开始组合更复杂的、使用多步骤或多模型的系统。观察四:生成式 AI 只是冰山一角——从技术上讲,文本/图像"生成"模型与用于分类、检索的模型没有本质区别,同一个模型可以稍加调整用于多种用途;生成能力之所以可能,正是因为更大更好的模型学会了更好的数字表示(embedding),而这些表示还支撑着神经搜索(按"含义"而非关键词搜索)和分类等成熟可靠的能力。Alammar 担心的是,如果把"生成"单独划成一个领域,会让人忽略掉那些已经在稳定驱动大量系统的更成熟 AI 能力。

观察五至八转向价值地图。观察五:用技术栈而不是数据模态来拆解 AI 行业——把公司分成直接卖给用户的应用层、它们依赖的模型层、以及支撑模型的数据与 MLOps 层;模型层还要区分专有与开源(并考虑 Midjourney 没有给开发者开放 API 这个事实),数据与 MLOps 层则把 Scale、Surge、Snorkel、Shutterstock 这类数据供给者纳入图景。同时他强调别忘了"商业护城河":Lensa AI 靠已有分发基础与网红营销在 2022 年 12 月做到约 800 万美元收入,Jasper 靠增长引擎做到 2022 年约 7,500 万美元收入,Writer 则强调自己在风格指南与品牌语气上的领域专长。观察六:企业别只规划一两个模型触点,要按"软件用在哪、AI 就能改进到哪"来规划数千个——谷歌 2017 年底内部已有约 7,000 个用深度学习模型的项目,2023 年 Bloomberg 又报道谷歌内部指令要求几个月内把"生成式 AI"塞进所有最大产品;注意"AI 触点"不等于"模型",一个文本生成模型改改 prompt 就能服务多个用例,一个嵌入模型能同时支撑神经搜索与分类。

观察七:把基础模型的"后代"算进价值方程。微调让公司即使基座模型是公开甚至开源的,也能打造专有的自定义模型——Lensa AI 很可能为每位付费用户微调一个 Stable Diffusion 基座模型;为《星际之门》写剧本的实验用了 12 个微调模型来分别捕捉每个角色的口吻风格。更关键的是"生成、使用与反馈数据"对模型未来版本的价值:部署只是开始,收集用户反馈(Grammarly 式的反馈按钮、RLHF 的人类偏好数据)、用"发布原型→观察使用→挑出高质量生成→扩充数据集→训新版模型"的迭代循环,能积累起差异化专有数据。观察八:模型的公开使用画廊正在成为价值的一部分——Midjourney 的免费试用生成大量公开图、连付费计划都默认公开(只有 Pro 的 Stealth Mode 例外),这种大规模多样化画廊极大改善了用户体验,让你能快速聚焦想要的结果、甚至看到比原想法更好的灵感;Lexica.art 也迅速成为 Stable Diffusion 生成图与提示词的领先画廊。

文章最后把应用层玩家可能存在的护城河"口袋"汇成一张图,但特意提醒:商业护城河往往是比技术护城河更大的因素。这个系列的总体态度可以概括为——生成式 AI 正在真实地改变软件与行业,但模型只是系统的一部分、演示不是产品、技术优势不等于商业优势,真正的护城河往往藏在数据、分发、反馈循环与执行力里。

阅读价值

适合产品经理、创业者、企业 AI 战略负责人以及对"生成式 AI 商业价值"感兴趣的技术人:这篇文章(及指向的两篇长文)给出了一个系统化的价值分析框架——技术栈分层看地图、按千级触点规划、把微调与反馈数据算进护城河;虽然写作于 2023 年,但"区分演示与可靠用例、商业护城河大于技术护城河"的判断至今仍有参考价值。

阅读英文原文 → 返回 AI 技术文档

本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: http://jalammar.github.io/generative-ai-and-ai-product-moats/