从 AI 能力到业务结果:To B 客户的商业化实战

本文整理自 AI Live House 第六期分享《从 AI 能力到业务结果:To B 客户的商业化实战(第二期)》。分享嘉宾张帆,曾任智谱 AI 首席运营官,是 AI 领域连续创业者,现任元理智能(Yoolee AI)创始人兼 CEO。

元理智能专注商业强化学习(RL for Business),围绕企业业务流程和核心 KPI,提供垂直场景模型与智能体解决方案,探索能在真实商业场景中持续学习的“数字员工”。据分享介绍,团队已在多个健康服务品牌开展商业化落地。相关公司介绍可见这篇报道。

本次分享聚焦张帆在智谱和元理智能积累的 To B 商业化经验:怎样从单点能力验证,走向复杂业务中的实际交付。下文保留分享者的第一人称、观点、案例和问答;行业判断与案例数据沿用分享时的口径,不改写为本站的亲历或实测结论。新增插图为统一风格的 AI 生成示意图,仅用于帮助理解,不替代原文内容。

一、模型在进步,自己的能力留下了什么?

其实大家可能都有一个感觉:我们每个人都在辛苦地追赶 AI,但感觉总像是驴前面挂着的胡萝卜,总也追不上。

你看,我记得到 2023 年的时候,几乎全民都在学怎么写提示词,大家都觉得 Prompt Engineer 会是一个非常有价值的工作。

到后来,凡是企业都在搞知识库,讲怎么构建自己的数据库、怎么做 RAG,向量数据库等等跟着火了一阵。

再到后面,大家开始搭自己的工作流,说 Workflow 才是关键,Dify、Coze 各种各样的东西大家都在搭。

再到后面,随着 OpenAI 等公司的产品不断发展,大家又说要搞智能体(Agent),这样 AI 才能真正动起来,于是又都开始学 Agent。

直到后来又开始讲“养龙虾”,出现所谓的“万虾大战”,一批新概念接连冒出来。

但如果我们站在今天往回看:过去两三年我们所做的这些事,真对我们有帮助吗?

无论是一个企业还是个人,我们拼命在追、在学的这些东西,有什么被沉淀下来了?什么东西是真正有价值的?还是说,我们只是在那个时候用这种方式缓解了自己的焦虑,让我们觉得好像没有被 AI 抛下?

咱们都是专业同学,感觉还好很多。其实往往在真正的企业家层面,我们看到的焦虑会更严重,因为他们更不了解底层的这几层逻辑。

所以我经常开玩笑讲:AI 真正的幻觉,不是 AI 自己产生的幻觉;AI 最大的幻觉,是它给使用者带来的幻觉,让使用者感觉“我的能力好像变强了”。

但如果你仔细想想,其实只是 AI 的能力变强了,你只是在应用它而已。

你看现在抖音上,大量的人只用一句提示词生成一个东西,然后就能在上面分享半个小时。但你想想,他只用了一句提示词,这东西跟他究竟有啥关系?其实根本没关系。

在这样一种混沌的状态下,我们会发现:越努力、越勤奋、越追,反而越追不到结果。

所以像类似的问题还有很多,我们真的得仔细想想:

  1. 我们的精力到底该投入在哪儿?
  2. 怎么判断这个投入是有效的?
  3. 什么东西是真正长在我们自己身上的,什么东西只是浮在表面工具层面的?
  4. 随着 AI 能力的继续扩张,我们今天做的哪些东西其实是白费功夫?

我觉得这才是我们每个同学真正需要思考的问题。

模型升级,留下的是补丁还是业务理解?

OpenAI 官方发过一篇文章,提醒大家基于新模型重建自己的 System Prompt 和 Skill。从逻辑上看,这是一致的:如果你做的东西随着模型升级就被抹平了,它可能只是在给模型打补丁;模型一升级,原来的壁垒就没了。模型改善之后,复杂度和维度会变化,但真正不变的是业务的定义、口径,以及对自身业务的深刻理解和独特 know-how,也就是业务经验与诀窍。

这里面还引申出另一个核心问题:我们到底该不该训自己的基模,或者该不该训垂模?

从底层逻辑来看,市场在这件事上极其反复,处在两个极端:

  1. 2023 年的时候,彭博(Bloomberg)号称用一半金融数据、一半通用数据训练出了 BloombergGPT,要做行业的金融基座模型,当时闹得沸沸扬扬。但后来 GPT-4 一出,在任何公开的金融 benchmark 上全被超越了。大家就开始怀疑自研基模没用,2023 年无数在训基模的公司现在几乎都没了。
  2. 既然没用,为什么现在又开始反复?前两天 Cursor 又在训自己的 Composer,Harvey 也在训自己的基模,它们甚至都没有用 OpenAI 联合生成的模型,反而都转向用自己的模型。

以前试过走不通的路,为什么现在大家又开始走?红杉美国的合伙人在大会上讲过一句话,我非常认可:“Not your weight, not your product”(不是你的权重,就不是你的产品)。大家似乎又回归到了权重导向。1

与此同时,英伟达、Palantir 等公司又在要求内部不要使用外部的闭源模型。在这样的背景下,为什么以前不行现在又行了?或者说现在是不是真的行?这值得大家深思。

Token 消耗与组织提效,不是一回事

另一个很有意思的极端转变在于 Token 消耗:

半年前,几乎所有行业活动都在比拼一个人能用多少 Token,鼓励使劲用,号称有人一天消耗 20 亿 Token,大家都在点赞。

但今天风向完全变了,大家不仅不再鼓励,反而在严格限制。比如 Uber 几个月就把一年的预算花光了,根本刹不住;甚至连微软这样有钱的公司也开始限制。大家开始意识到:最大化 Token 绝不是目标,我们应该优化的是每个 Token 带来的实际影响。

这本质上是回归理性。如果想浪费 Token 太容易了:随便跑个死循环任务,定一个无法达到的 goal,或者算一个复杂的优化算法来解决 NP 问题,让它算上两年也算不出来,这没有任何意义。很多企业发现,大量消耗本质上只是给个人创造了一种“自己在高效产出”的错觉。冷静下来看,过去一到三个月采购的 AI 工具,真正产生价值的到底有多少?

这就引出了行业里最大的问题:个人提效等不等于组织提效?

从管理学和软件工程的角度来看,管理本质上是通过限制个体效率来换取整体和集体的效率:

  • 工程师发现 bug,最快的方式是直接改代码,但流程要求先提交需求说明、工单,再走系统。
  • 销售最快的方式是直接私聊,但流程要求必须录入 CRM。

我们总假设个体提效就等于组织提效,但现实中我们看到大量“薅羊毛”现象:一个人挂 20 个智能体、一天刷几十亿 Token;Dario 等人提到代码提交量增加了 9 倍,但业务层面并没有带来对应比例甚至对应趋势的收益增长。

这里的深刻反思在于:过去我们最稀缺的是“生产代码”,因此用代码产出量来衡量工作;现在代码生成已经完全不稀缺了,一秒钟生成上百万行代码毫无门槛,组织的瓶颈彻底从“生成”转向了“验证”。

驾驭 AI 是极难的。如果有人号称能轻松指挥多个 Agent 并行开发,这个人必须极其聪明、抽象能力极强、大脑高度并行且注意力极度专注。如果只是喝着咖啡随便跑几个智能体拿结果,那绝不可能解决真正的复杂问题。启动的代码越多、Agent 跑得越远,就越需要强大的驾驭和管控能力。

这好比在一个空旷的房间里:

  • 所有人都在步行时,不需要规则,碰上了让一让就能过去。
  • 但如果每个人都开着一辆时速超快的摩托车在里面横冲直撞,而且没有任何交通规则,效率不仅不会变高,反而会带来灾难性的混乱。

AI 带来了巨大的生产力,但如果没有对应的验证能力和辨别能力,它带来的只会是成倍放大的差错。

不要跟模型赛跑,要找到自己的“船”

再往下看,当模型真正进入产业,会引发怎样的连锁反应?

之前 Anthropic 发布 Claude 3.7 Sonnet 等新能力时,全球软件和金融科技板块瞬间蒸发了数千亿美元;随后发布安全相关能力时,网络安全板块又应声大跌。市场一度恐慌,担心软件行业是否会被彻底颠覆。

但最近风向又变了:Salesforce 和 Adobe 联合推出了 Cloud Force,Adobe 不再单纯自己搞,而是选择与 Salesforce 深度合作;汤森路透(Thomson Reuters)也从最初的抵触,转变为将大模型能力全面接入到自己的法律内容体系中。

原分享还提到“豆包和 work 合并”这一观察。把这些变化放在一起,最根本的问题仍然是:到底什么东西是我们要掌握的,什么东西该留给模型?

如果分不清这一点,我们可能在某一代模型上投入了大量精力,最后却发现:模型一升级,自己的价值就消失了。

我在 2023 年就经常举一个例子:把基础模型的能力想成不断上涨的海平面。

海平面原来可能每年上涨 100 米,现在可能每个月就涨 100 米。你如果去构筑一座灯塔,很快就会被淹没,你的价值也就没了。

所以,我给企业家的核心建议是:不要总想着造灯塔,最好造一艘船。让自己跟海平面绑定,海平面上涨,你也跟着上涨;海平面下降,你也跟着下降。你不是去跟大海、跟趋势赛跑。

这件事说起来容易,做起来难。它要求我们从底层理解:基础模型、垂直模型与应用场景之间的差距,到底是什么。

固定灯塔逐渐被上涨的水位追上,而浮在水面的船随之升高,类比补丁式能力与随模型进步增值的应用。

图 1 · 灯塔与船:与其追赶模型的水位,不如找到能随它一起上升的能力。

办公提效与竞争壁垒,要分开看

关于办公软件的商业化,其实取决于你的视角:

  • 如果站在企业办公软件公司自身的角度,这是很有价值的。比如飞书、钉钉做 AI 化改造,我相信都能卖得很好。
  • 但如果站在使用者的角度,没有哪家公司的核心价值在于“会议纪要提得更快”或“周报写得更清楚”。这些工具只是企业竞争力的下限(保证你不比别人差,但绝不会让你比别人更好)。

很多人有个误区,觉得用了飞书或钉钉的 AI 功能,自己就变成一家 AI 化企业了。这就好比我公司里的人都在用 iPhone,手机里装了很多 iOS 应用,难道我就是一家移动互联网公司了吗?逻辑显然不是这样的。人人都能买到的模型能力,永远构不成你的竞争壁垒。

另一个误区是把消耗当成了成果:只看过程、看调用量,用 Token 消耗多不多来衡量自己是不是一个 AI-native 的组织。这就像认为组织人多就代表公司大、人贵就代表产能高一样,完全脱离了本质。

在 AI 带来的焦虑之下,很容易产生这些认知偏差。真正关键的能力在于:在 AI 时代,你的那条“船”到底是什么?什么是留在你手里别人拿不走、而且能持续增长的?不管是企业还是个人,都必须分清楚:你手里拿出来的成果,哪些是属于模型的,哪些才真正是属于你的。

面试中的两个例子

我在面试中经常遇到两个典型例子。

产品经理:做出了东西,不等于积累了能力

有些完全不会开发的产品经理刚接触 AI,面试时总会兴奋地展示成果,说自己做了一堆软件(比如一个播放器或某个小功能)。但仔细一看,核心其实就是写了几句或十几句 prompt。他觉得“自己说句话就能造出以前造不出来的东西”很爽,但这完全暴露了他分不清什么是“模型的价值”,什么是“模型之上的价值”。这就像你坐进了汽车,感觉自己能跑得更快了,但跑得快是汽车的能力,不是你的能力。

技术人员:代码生成快,不等于交付快

很多技术人员会说:“我们现在 90% 都在用 AI 写代码。”但我一问具体怎么做、最佳实践是什么、有没有踩坑形成反共识,就会发现真正把 AI Coding 做深的人凤毛麟角。大部分人只是浮在表面上跑一跑:代码可能 10 分钟就生成完了,后续验证、测试、改 bug 却要花整整三天,验证代价极高。

说到底,核心就一句话:大家一定要彻底搞清楚,什么东西是模型的,什么东西才是你自己的。这是我们探讨所有能力与壁垒的根本前提。

二、通用与垂直的分界,不是行业标签

前面这些现象看起来很混沌:大家一会儿这样试,一会儿那样做。市场上的共识从来不缺,但共识迭代的速度非常快。几个月前才发布的工具,可能已经更新了很多轮;几个月前的新模型,如今看起来又像上个时代的产物。

在模型、共识和观点都快速变化的时候,我们需要保持冷静,找到底层不变的逻辑,不被情绪左右。

回到核心问题:AI 很强,到底等不等于我很强?

如果竞争对手也能轻易获得相近的智能,刚毕业的应届生也能拿到一模一样的模型输出,那我们的价值究竟在哪里?这是每个人都要思考的。

基础模型为什么不能解决所有差异化问题?

即使基模拥有无上限的聪明度,它也绝不可能通杀一切。世界上没有完美通杀的东西,有一面长就必有一面短。从辩证逻辑来看,有勇敢就必然有保守,找到它短的那一面,就会发现它的不完备性。

从达特茅斯会议至今几十年来,人脸识别、搜推等专用模型一直做得很好。而这次 AI 之所以带来如此巨大的变革,核心就在于 AGI 中的通用性(General),也就是泛化。我们第一次看到不需要特化、仅靠泛化就能解决几乎所有问题的 AI,这非常符合人类的智能逻辑,因此所有公司都在追求 AGI。

但通用智能的核心第一性是泛化,泛化是有巨大代价和极高成本的。

从最初几百兆的模型,到现在几万亿甚至十万亿参数的规模,为了追求通用,行业在无底线地推高算力和参数量。这导致成本高昂,甚至已经开始带来反噬:很多企业在大多数场景下根本用不起,有的项目一天就能烧掉上千美金;顶级模型卖得贵,但整体营收占比并不高;很多大厂也都在限制大家的 Token 使用量。追求无限泛化所带来的成本负担,在企业端已经有些难以承受。

通用的反面就是垂直。我们是否真的需要无限泛化?

极度追求通用,很多时候其实是巨大的浪费。企业为什么要建 SOP?就是因为我们在通用范围内找到了一个最优解,然后把它固化到垂直流程中,不用每次重新探索。这是一种典型的提效手段。

买一个通用的 AI 销售,相当于同时买了一个数学家和哲学家。但实际在销售场景中,根本不需要它去做微积分或哲学思考,那些能力是冗余的。垂直的第一性就是效率:我们招一个销售,只要他在特定环境内能达成最好的销售指标就足够了。

这就带来了两种不同的哲学:一种是通用定义,一种是应用场景定义。

走垂直路线并不等于倒退回以前传统的 NLP 时代。今天的垂直,是用通用智能来打造垂直能力,底层逻辑完全不同。如果只看效率,在很多特定场景中,小参数模型定向优化后,完全可以匹敌大几倍的上一代大模型水平;哪怕只针对数学题去刷榜、单任务定向突破,小模型也完全能打平大模型。

核心业务与通用事务,采用不同的方式

在未来的真实世界里,通用智能与垂直智能一定是并行的。企业到底该怎么用 AI?到底是选垂直还是通用?

答案是两者都用,但要做好分类:

  1. 涉及企业独有的、差异化的核心竞争力,以及带有独特认知的高频核心业务,必须走垂直路线,把自己的私有信息和独特逻辑沉淀进去。
  2. 做会议纪要、排日程、写周报这类通用事务,直接调用通用基础模型即可。

我们既需要通用软件,也需要专用软件和专用工具,做好分层就行,底层是一样的逻辑。

同一行业,也可能有完全不同的评价标准

大家常说通用模型是不是什么都能干,其实不太可能。同样是卖咖啡:

  • 星巴克讲究的是咖啡的体验与人与人的连接,财报里给自己定义为"第三空间",所以每家店的座位都很舒服、很漂亮。
  • 瑞幸则是完全不同的哲学,靠高密度门店带来极致的便捷和成本结构,99% 的门店没有座位,全是自提。

不可能存在一个人,既能干好星巴克,又能干好瑞幸。这是两种截然不同的结构,底层逻辑完全相反。这各自代表了一个垂直方向,市场上不可能存在一个通用的模型,既能帮星巴克选址,又能帮瑞幸选址,而且还能都达到最好效果。

回到这个逻辑:到底什么叫垂直,什么叫通用?这是今天市场上最容易搞混、很反共识的一点。

金融算垂直吗?教育算垂直吗?医疗算垂直吗?

我的答案是:垂直智能不等于垂直领域,这是两个完全不同的概念。金融、教育、医疗这些都不叫垂直,它们都在基模(基础模型)的射程范围内。

只有当两者的评价标准不同时,它们才是两个独立的垂直维度;如果评价标准是一样的,它就属于通用。

什么是优秀的金融毕业生?怎么算企业的市盈率、财务健康状况和基本面?这些事情是有标准答案的。只要存在标准答案,一定会被基模通杀,创业公司没有任何机会,甚至连头部机构也毫无壁垒。那些曾经当红的套壳企业,从诞生那一刻起就注定要失效,因为它们做的全是通用的事,根本没有壁垒。

如果整个金融领域不算垂直,那什么才算?

在金融领域内部,索罗斯算,巴菲特算。巴菲特对自己业务的定义是价值投资,在他的脑内权重和参数下,价值投资能算出最优解;但如果让他去搞量化对冲,可能很快就挂了。反过来,把索罗斯放到价值投资体系里,他也一样不行。

他们两位各自是特定环境内的"垂直最优解"。这种最优解外部不可观测,并且与你给自己划定的战略范围高度相关。这才是博弈论,这才是企业本该具备的独特价值。

就像星巴克与瑞幸,在各自的模型与环境下,都找到了适合自身经营的最优解。即使今天把麦当劳的管理系统直接给另一家餐饮企业,对方也未必能用,因为系统无法脱离它特定的环境而成立。

这就是一条分界线。人人都可以获取的能力,即使有人花更多钱、买到更强一点的版本,也不等于它成了自己的能力。仅仅调用基模,难以形成独特价值;真正有价值的,是建立在基模之上的独特思路。

“独特分布”,是企业自己的判断与取舍

这个概念有点抽象,我们再展开讲一讲:所谓“独特分布”,可以先理解为面对同一问题时,企业自己的判断与取舍。

模型可以被理解为一个计算维度很高的隐空间。每问一个问题(query),我们就从中得到一个回答。分享中借用“投影”和“正态分布”来解释:越靠中间,越接近共识;越靠两边,越接近非共识。模型训练追求损失(loss)降低,容易给出符合公共共识的解。

用这个比喻说,公共解的另一个名字就是“很有道理的废话”。这里的分布是帮助理解的比喻,不是说所有模型回答在数学上都服从正态分布。

比如你做了一个软件,去问基模该怎么改、哪里做得好不好,它给你的回答一定都很有道理。但这种中央解虽然有意义,却没有价值,因为它给出的方案里没有属于你的独特价值。

无论创业、做技术还是做企业,所有的价值都来自于非共识:你坚信,但别人不认同。就像早期大家觉得某个人是骗子、觉得这种技术纯属扯淡的时候,他坚定地相信了,这就是他自己的边缘解。如果大家都靠共识去建构,是没有价值的,对个人来说也是一样。

同样是一个软件,如果你拿去问乔布斯或马斯克,他们会怎么回答?

  • 乔布斯可能会说:你这做得像狗屎一样,没有人文与科技的结合,不够简洁。
  • 马斯克可能会说:你这不够激进,效率不够高,缺乏颠覆性创新。

你看,乔布斯和马斯克给出的都是边缘解,是非共识的解,所以他们才如此厉害、有极高的价值加成。而大家直接去问模型,得到的全都是中央解。

那我们怎么借助于模型去得到边缘解?模型就像水,我们是船,该怎么借这个水?我们要通过自己的方式(比如 prompt),让原来的边缘解变成中央解,让原来的中央解变成边缘解,这就是我们的价值。模型本身是一个公共分布,而我们每个人或每个企业的价值,是基于基模之上的“独特分布”。

这是核心。只有拿到这个独特分布,你才有意义,这是基模怎么演进都改变不了的。就像不管是智商 120 还是 160 的乔布斯,他骨子里依然是乔布斯。

独特还不够,必须是经过验证的差异

如果不看好坏、只管有没有差异,这太容易了。就像那个笑话:有人吹嘘自己算术极快,别人问“75 乘 80 等于多少”,他张口就说“300”;别人说“你算错了”,他说“你就说快不快吧”。如果不考虑价值,只考虑分布就没有意义。你的独特分布,必须是在某些特定场景下被验证过的最优解。

以开咖啡店为例:

如果问模型的中央解“怎样开一家好咖啡店”,它大概会说:一定要选好喝的咖啡豆,服务人员态度要好、专业技能要高,座位要舒服,氛围要温馨,价格还得便宜,还要开在市中心方便大家购买。

这完全是一句很有道理的废话,现实中不可能照着做成一门生意。但在垂直的独特分布里,有两种完全不同的解法:

  • 星巴克的思路:不要便宜,也不强调外送快;就要最好的地段、最好的体验,卖高价来赚取品牌溢价。
  • 瑞幸的思路:人流多不多不重要,因为全靠外送自提;就要价格便宜,把门店和各环节的成本做到极致。

面对“开一家咖啡店需要哪些要素”这同一个问题,这就是两种截然不同、却各自成立的解答,也是垂直能力的价值所在。缺少上层的业务逻辑,仅靠基础模型的通用回答,很难给出适合这家企业的答案。

同一颗咖啡豆分出两条路线:一边是强调体验与空间的咖啡馆,另一边是强调便捷与效率的自提柜台。

图 2 · 行业相同,最优解未必相同;评价标准来自具体的业务选择。

三、学习如何发生:从写规则到构建环境

就拿美团来说,我说了一句话,东西送到我们家,我吃了,这就是价值。如果只是提供情绪价值,比如我说“点个星巴克怎么样”,你说挺好的,我说不错,或者瑞幸也行,但如果不送,就没有意义嘛。所以一定要跟物理世界连接,你才能得到一个有意义的反馈。

这里面我们要明白一个核心:如果大家要记住一个词,我觉得就是记住“场景”。无论是我们、企业还是个人都一样,你所有的独特分布基线,一定是因为具备了场景;脱离了场景,分布就没有逻辑(甚至就变成均匀分布了)。你一定是在某个场景内,才存在独特的独立分布,所以场景非常重要。

星巴克有星巴克的场景,瑞幸有瑞幸的场景。我们需要靠场景来训练自己的认知,这也是学习、理解独特分布的核心手段。

从深蓝、AlphaGo,到在环境中学习

把前面的内容串起来,接下来要问的就是:人到底怎样学习这种分布?有哪些学习手段?学习的本质是什么?

要理解机器学习,可以先找一个便于观察和研究的样本。生物学经常用果蝇作为模式生物;在人工智能研究中,棋类也长期承担着类似“果蝇”的角色。

从图灵等人的早期探索开始,研究者就尝试让机器下棋,以此研究人的智能。网上仍能看到早期机械化计算设备的照片。从那些早期尝试开始,人们一直想让机器下赢人类。

第一次广为人知的突破,是 1997 年 IBM 的“深蓝”在国际象棋比赛中击败世界冠军。当时这条路线可以简化为:

  1. 专家出方案、出规则。
  2. 机器把专家的规则存下来,配合先手棋和后手棋。
  3. 往后利用宽度优先、深度优先等算法去搜索,做一些剪枝。
  4. 通过搜索未来十五步可能是个什么结局,来判断当下怎么走。

这种方式虽然下赢了,但它很难扩展。那时候大家觉得下赢象棋了,围棋应该也很快能搞定,但为什么到了 20 年后才搞定?

围棋和国际象棋的搜索空间完全不同。分享中用约 $10^{40}$ 与 $10^{170}$ 这两个量级来作对照。围棋有 $19 \times 19$、共 361 个交叉点,每处可以是黑、白、空三种状态;如果不考虑合法性约束,粗略组合数是 $3^{361}$,约为 $10^{172}$,而常见的合法局面数量估计在 $10^{170}$ 量级。

大家对 $10^{170}$ 可能没有直观概念。整个可观测宇宙的原子总数,常被粗略估计在 $10^{80}$ 量级,即 1 后面跟 80 个零。即使把其中每个原子都替换成一个拥有同样数量原子的宇宙,总数也只有 $10^{160}$,仍比 $10^{170}$ 少 $10^{10}$ 倍。这个比喻是为了说明围棋局面空间有多大。

所以,单靠原来的搜索思路很难处理围棋。即使今天算力比 1997 年提高了 1 万倍、1 亿倍,甚至 100 亿倍,面对这样的组合空间,也无法靠穷举解决问题。

于是,研究者换了一种思路:既然规则难以穷举、向后搜索的空间又太大,能不能让 AI 从人类棋谱中学习,自己提取关键信息?AlphaGo 使用过约 3000 万个人类落子局面来学习,这里是“局面”,不是 3000 万局完整对局。通过学习形成模型,再结合搜索和强化学习,最终下赢人类,这就是大家熟悉的 AlphaGo。

紧接着,AlphaGo Zero 出来了。它不再依赖人类棋谱,而是直接自己跟自己下。原分享用“三天自行对弈 100 万局,最终以 100 比 0 战胜此前版本”来说明这种变化;具体训练局数仍需以原论文为准。这里的关键是:学习可以来自与环境的交互,而不只来自人类整理好的例子。

分享还对比了“AlphaGo 训练时用了上千块 GPU,而 AlphaGo Zero 只用了 4 块 TPU”这一说法,并据此提出:人类棋谱在某些情况下也可能带来限制或噪声。不过,这组说法混用了训练资源与对弈运行配置,不能据此直接比较整体计算成本;这里要强调的仍是学习方式的改变。

又过了大半年,DeepMind 打造了 AlphaZero。它不再局限于围棋,而是把这种能力变成了一种通用能力,直接用于国际象棋和将棋,发现每个棋种都能用同样的方法下赢。

从“被知识建模”到“为学习建模”

从这段演进中,可以看到两种建模思路的变化:

  • 被知识建模:先由人总结知识、采集样本,再交给机器学习。
  • 为学习建模:人构建一个可以探索的环境,机器在其中行动、观察反馈,再改进策略。这里说的是基于自博弈的强化学习(RL);原文口述中的 RLHF 指“人类反馈强化学习”,不应与自博弈混为一谈。

为什么强化学习到了真实业务里会变得很难,后面再展开。但首先要看到,这代表了一种重要变化:不只是把已有答案交给机器,而是让机器在环境里学习。

这种方式,让机器有机会在更大的范围内学习和描述问题。

也就是说,人主要指定棋盘和规则,不再把每一种走法和判断都提前写好;机器自己在环境里观察、尝试和学习。

从写规则,到学习已有样本,再到与环境交互,这三种方式也对应着计算机获取知识与能力的演进。今天,我们已经走到第三种方式的早期。

早在之前的讨论中,我就认为这种变化会发生,因为顺着底层逻辑推演,它是一条自然的发展方向,差别只是走到哪一个阶段。

三个相连的手绘场景,分别表示写规则、学习示例,以及在环境中行动并获取反馈。

图 3 · 从把答案教给机器,到为机器构建可以学习的环境。

所以,大家问我 Workflow 时,我会说:Workflow 主要解决的是第一个阶段的问题,不能独自解决后面的学习问题。我们讨论第一性原理,就是为了看见后面还有哪些可能性。

沿着这个方向,把自己的算法和程序结合起来,节省机器资源,并把实际反馈纳入系统,也能带来价值;这类能力的溢价正在提高。

商业场景的难点:采样昂贵,反馈难归因

但为什么很难做?可以先看强化学习怎样从规则明确的环境走向复杂任务:

  1. 第一个阶段是围棋(AlphaGo),规则与反馈极其明确。
  2. 第二个阶段是编程(Coding)。为什么以前模型一年才有一个大版本,现在一个月就能迭代多个版本?分享中以 Grok 4.5、4.6、4.7,乃至 4.8 等版本说法举例,强调的判断是:编程这类可验证环境,帮助加快了模型迭代。

大家如果留意会发现,2024 年年底到 2025 年年初,市面上曾蔓延着一种说法,认为“人类的数据不够了”,连 Ilya 在公开大会上也讲“人类数据是化石燃料,总有用尽的一天”。但现在为什么没人提数据枯竭了?底层原因就是通过强化学习在环境里自我迭代的路径跑通了。

围棋是最早跑通的,比它更复杂的是 Coding。今天编程能力之所以有质的跃升,核心在于它的环境极其容易拿到 reward 和信号。强化学习历来有三大支柱:算法、环境、奖励。过去大家把精力都聚焦在算法上,但今天最核心的能力其实是“环境的构建”与“奖励的设计”。

回到商业场景,为什么在商业里做这件事极难?

  1. 很难无限采样。围棋或编程可以在算力允许的范围内反复运行,但商业线索要花钱,样本分布也很不均匀。即使愿意花钱,也不可能随时在一周内买到 200 万条高质量线索。
  2. 反馈难以归因。围棋有明确的规则、终局胜负和 $19 \times 19$、共 361 个落点,便于通过大量对局评估行动。它并不意味着每一步都天然有稠密奖励,也不能把反馈简单理解成 $1/361$。商业场景更复杂:为了卖一个产品,和客户聊了一小时、说了 8000 字,最后客户没买,很难知道究竟是哪几句话出了问题,又该怎样改。

因此企业构建数据目前有三种方式:

  1. 第一种:企业内部找人标注数据、做 Workflow。
  2. 第二种:合成/造数据。
  3. 第三种:自学习、自进化。

目前大部分企业还停留在第一种,效率注定极低,至少要做到第二种。

规则、文档与权重,承载着不同层次的知识

如果从底层逻辑进一步拆解知识的载体,环境中的认知知识是一个无法穷举的隐空间。当人或机器从中采样时,维度越高,信息密度和信息量越大,不确定性也越强;维度越低,确定性越高,但信息损耗极大。知识的原材料基本上有三种载体:

  1. 规则:比如在 CRM 里标记客户,规则系统只有“成交”与“非成交”两个离散状态。认知完全一致、没有歧义,但信息量极少。
  2. 上下文/文档:上升一个维度,通过拜访记录、客户描述去刻画。信息量变大,包含了场景与判断,但不同人看会有不同认知,理解出现了增益与歧义。
  3. 直觉/权重:再往上一层是直觉。比如老销售凭感觉判断客户肯定能成,这种直觉本质上是脑神经的自然推理,只是没有被翻译成语言。一旦强行翻译成语言就会降维、丢失信息,并非所有知识都能被语言表达。

这三层载体对应到企业与模型中:

  • 规则层面:对应企业里的 Workflow / SOP,好控制、好标注,但泛化能力极弱;对应到模型中就是纯 Rule / Workflow。
  • 文档层面:对应企业的工作手册、案例库、上下文;对应到模型中就是 Harness / Prompt。
  • 直觉层面:对应企业文化、长年培训带来的团队心智;对应到模型中就是模型底层的权重(Weights)。

归根结底,我们希望在通用模型的分布之上,构建自己的独特分布。影响它的手段主要有三种:加规则、加 Harness(上下文与运行支撑)、改权重(例如微调)。按照这个思路,越深入到底层,对信息的表达能力越强,但从环境中获取有效信息的要求也越高。

这也呼应了前面红杉合伙人的观点。以前大家强调自己的 Prompt 或外挂数据,但如果这些结构只是在弥补某一代模型的不足,就容易变成基座模型的附庸。我的判断是,要构建很强、很有壁垒的 AI 应用,需要进一步深入到权重层面。

流程与规则对应 Rule 和 Workflow,文档与案例对应 Harness 和 Prompt,经验与心智类比模型权重。

图 4 · 三种知识载体与实现方式的对应关系,不是简单的高低排名。

四、企业该自研什么,边界又在哪里?

大家会发现,2023 年的时候人人都在谈大模型,2024 年人人都在搭平台。这就好像刚发明电力的时候,人人都自己建发电厂、自己挖煤,好像自己挖的煤就显得更高级一点。但今天去看,早就有了极其明确的分工。

今天企业如果要划定自己的能力边界,这个圈该怎么画?我觉得可以用商科和经济学的逻辑来看。

用企业边界的逻辑,判断自建还是外采

科斯在 1937 年就讲过一个我非常认同的观点:到底为什么要有企业?

本质上来讲,市场就是一只“看不见的手”。如果每个人都是一个独立主体,直接在市场里博弈,交易效率往往是最高的。那为什么还要组建企业,把某些生产要素内化?科斯的逻辑是:如果企业在某些领域内化的生产效率高于市场交易效率,你就应该内化;如果低于市场效率,你就应该交给市场(外化)。

所以企业的边界绝不是越大越好。如果你把低效的事情全都内化进来,其实是在拖累自身价值。

这个经济学逻辑在 AI 时代依然完全适用:到底什么能力应该自建,什么应该直接外采?

本质上,要看哪些东西由你自建之后效率最高,也就是企业真正具有竞争力和独特性的核心资产是什么。比如红杉应该把投资相关的核心逻辑变成自己的;埃森哲应该把咨询能力变成自己的。这些独特、排他、高频的核心场景,在企业自己的环境里积累了大量专有数据,能够抽象出独特价值。

但如果是通用的办公软件,或者用 ChatGPT 生成一份活动方案、起草一份合同,这些直接采购现成的通用能力就完全没问题。

企业内部的边界始终在于:哪些能力自己做效率更高,哪些直接利用外部市场效率更高。这是我们做技术选型和架构布局时最根本的权衡标准。

主权的核心,是选择权

划清这条边界之后,我们还可以换一个角度,去找新的切入点和可能性。

所以我觉得,今天咱们平台团队也谈了很多关于如何去做业务价值,本质上其实是一件事:

做业务价值,不是因为能多做一个自己的基座;把什么都转成自建,代价往往很高。真正重要的是基于别人的技术,快速提炼出自己的独特部分,并让它形成自己的壁垒。

外部技术怎样变化,可以保持开放:今天用这个模型,明天换一种方案,都没有关系。背后需要想清楚的是主权问题。像国家一样,企业主权的核心不是拥有全部资源,而是拥有选择的权利,也包括不选择某个方案的权利。

数据依附于场景,能力来自业务循环

也希望今天的分享能给大家带来一些业务上的启发。AI 时代企业最大的价值到底在哪里?

我觉得大家一定要明白:数据本身没有价值,场景才有价值。打个比方,我今天就算把牛顿的全量笔记都给你,你也得不出爱因斯坦的结论。所以真正有意义的是场景,而不是数据本身。

对企业来说,最根本的问题是:怎样打造有价值、可持续运行的场景,再通过学习机制,把场景中产生的认知和客户经验沉淀到自己的能力体系中。

这就是每家企业最根本需要解决的问题。关于这点,我也可以给大家分享一个小的例子:

到底什么是好的 AI 企业?

刚到 2023 年的时候,很多做投资的人都在讲:幸亏有 AI,不然感觉 TMT 都干不下去了,已经没有新企业出来;因为有 AI,感觉还能再干十年。

但大家同时又非常慌张,不知道边界到底在哪里。经常是 AI 一升级,就有好几家公司死掉。之前大家开玩笑说,很多创业者跑去参加 OpenAI 开发者大会,去的时候很高兴,结果人家现场发布新模型,回来就很沮丧,发现自己的业务全被 AI 干掉了。

如果问我这条边界在哪里,站在业务导向型公司的角度,我会说:要控制好“含模量”,也就是 AI 能力与传统业务能力之间的配比。

  1. 含模量既不能太高,也不能太低。
  2. 可以用“50% 的传统业务,加上 50% 的 AI 能力”来理解这种平衡。这里是讲配比思路,不是要求所有企业机械地按一半一半配置。

在这种架构下,50% 的传统能力能帮你防守住大模型对你的进攻。大模型永远不可能真正伤害到美团或携程,因为它没有那么强大的线下供应链和代理履约能力;它顶多影响一下渠道,根本做不了那些苦活累活,硬做的话效率也不会高。

按这个逻辑,我们应该找到一个恰当的制衡比例:一方面让 AI 与业务深度结合;另一方面,从业务场景中产生自己的数据环境,不断沉淀认知与独特维度的信号,再反哺到上层的模型中。这样一个闭环,才是一个业务最完美、且能够持续增长的状态。

说完企业能力的底层逻辑,下面再把视野拉大,看看 AI 会怎样进入产业。

五、为什么 AI 更像电力,而不是互联网?

AI 到底应该对标什么?要理解它怎样产生业务价值,可以先找一个合适的历史参照。

其实很多早期阶段大家对这个事并没有共识。市场上普遍认为,讲历史大家会把 AI 当作下一个互联网,觉得 AI 也是一项科技技术。

在 2023 年,投资 AI 的人普遍关注技术公司;到了 2024 年,又集中关注 To C 公司。经历 2024、2025 年之后,很多人开始困惑,不知道还能投什么,只能继续追逐少数已经很贵的标的。我觉得这里面有跟风的成分,未必真正想清楚了 AI 的特性。

但如果我们的目标是从投资角度做出真正的业务价值,我们就必须把这事想清楚:到底怎么看待 AI 的特性?如果我们要借鉴,到底借鉴谁的发展历程?

我个人认为,AI 最好的对标样本其实并不是互联网。

你看互联网本质上解决的是连接效率,它把原有的链接重新连接,从而带来了整个网络效率的提升。但 AI 不负责连接,AI 负责的是生产,它解决的是生产效率。在这样的背景下,一个负责连接效率,一个负责生产效率,两者完全没办法对等。

如果你按照互联网的逻辑来看,它一定会产生连接效应,从而诞生新巨头,这也是大家押宝的方向。但现实情况是,当时 C 端做得很好的产品(比如 Kimi 等),今天依然是原有巨头的体量最大,巨头很快就追上来了。这依然是巨头的生意,因为这件事已经形成共识了,你没有非共识的红利;而且它极度消耗资源,本身又没有网络效应,这就导致它并不像互联网。

电力的价值,靠与具体产业结合来兑现

如果不像互联网,它像什么?我个人认为它更像电力。

电力本质上也是解决生产效率的。电力到底是怎么发挥作用的?按我的视角来看,电力有一个最大的特性:电力的价值兑现不完全靠自己,而是靠嵌入物理世界,跟真正的物理世界中的企业相结合,产生新的化学反应,从而间接带来价值。

举个简单的例子,比如沃尔玛这样的卖场,大家可能觉得它跟电力没啥关系。但你想想,如果没有电力,根本就不会有这种大卖场的机会:

  1. 没有电力就没有电梯,没有电梯就不会有高楼,人就不会从平面走向立体;如果不走向立体,单位面积内就不会有这么高的人流密度,也就不具备开大卖场的条件。
  2. 没有电灯,就不会有人晚上来逛。
  3. 没有空调,夏天就不会有人来逛。
  4. 没有冷链,就没办法配送更多的生鲜品类,更别提后来的电商和即时配送了。

这一切都与电力环环相扣,但从来没听说过沃尔玛宣称自己是一家电力公司。

所以如果 AI 要产生价值,它不仅是改造生产环节,更一定会嵌入到一个又一个的物理环境中,以这些物理环境作为杠杆去撬动真实的业务价值,这也是今天市场最应该关注的。

否则,今天所有的投入和 CapEx 都集中在模型、芯片、算力中心这些基础设施上,但真正从算力转移到业务价值,还有很大的距离没有兑现。这是我认为今天非常重要的一个机会趋势。我们可以把电力的发展过程拉出来深入看一下。

电气化的启发:换工具之后,还要重构流程

爱迪生与特斯拉当年的“电流之争”,一方推动直流电,另一方推动交流电。交流电便于变压和远距离传输,直流系统当时在输电距离上受限;争论也涉及电压、安全与部署成本。两种路线长期竞争。

这就像我们今天 AI 早期的时候,大家纠结是不是要买 DeepSeek 一体机、到底该不该用 API、数据泄露了怎么办。但最后谁胜出了?大家都知道是交流电。当时爱迪生甚至在报纸上宣传,还找了猫被交流电电死做演示,说交流电多危险、小孩被电到怎么办。但竞争再惨烈,在实际的业务应用价值面前,这些非核心考量都得让步。

新技术发展通常会经历几个阶段:

第一阶段:业务价值成为关键判断

在我看来,业务价值最终能否兑现,是判断新技术的重要依据。

第二阶段:原样替换,然后经历效能幻灭

以前的工厂怎么生产?中间是一个巨大的蒸汽机,连着一根巨大的传动轴,轴上挂着一堆纺织机。烧煤带动蒸汽机转,轴跟着转,纺织机就都跟着转。电力出来后,大家觉得这技术好,就把蒸汽机关掉,换成电动机。

结果用了一段时间发现没啥效果:换成电也没省钱,甚至花得更多,生产方式一点都没变。大家就开始质疑这东西没用、电不靠谱、是不是泡沫、是不是忽悠骗人的。有研究表明,从最初尝试到真正大规模应用,中间经历了将近 40 年,周期极长。

今天相当大比例的公司其实还处于这个阶段:原来干啥现在还干啥,只是把工具替换成 AI,看看效果。发现好像也就那样,没有显著提升,觉得没啥用,干脆就关掉算了。

第三阶段:用新技术的特点重塑流程

原分享接着以福特和流水线的发展为例,说明为什么不能只做简单替代。关键在于:蒸汽机与电力的底层使用方式不同。蒸汽动力通常要求动力源与设备紧密相连,而电力可以把发电和用电环节分开。

这就注定了电动机可以做得很小。既然能做小,为什么还需要中间那根长长的传动轴?为什么不直接把小电机装在每一台纺织机上?这样每台机器就可以异步调用。

把中央动力系统拆解掉,就能从集中驱动走向分布式驱动。每个业务模块按需布局,有不同的节奏、速度和数量。工厂布局可以重新组织,员工的分工也随之改变,每个人站在机器前专注一个动作。这些变化为现代流水线生产创造了条件。

到了这一步,才是真正用新技术的第一性原理重塑了原有的产业链,而不是简单的降本增效或形式上的替换。这才是技术真正迎来爆发的节点。

左侧用一个电机驱动原有传动轴,右侧让各台设备独立驱动并重新组织生产流程。

图 5 · 只换动力与重构流程,是两种不同层次的技术应用。

再往后发展,技术就会走向泛在化:

今天的电力无处不在,但已经没有人会特意强调自己是一家“电力公司”了。当一项技术成熟到像水和空气一样,被大家当成理所当然时,它的高科技光环反而褪去了。就像今天很少有人特意宣传自己是“移动互联网公司”一样,不是它的属性消失了,而是因为人人都在用。

AI 也在经历类似的过程,大家不必只剩下灰心和焦虑。经济学家罗伯特·索洛在 1987 年曾说过:“我们在哪里都能看到计算机的身影,唯独在生产率统计中看不到。”这就是常被引用的“索洛生产率悖论”。

这和今天的情况何其相似:大家觉得到处都是 AI,唯独在企业的财务报表里看不到收益,只看到在花钱,还没看到赚钱。但出现这种发问,恰恰证明它已经接近真正落地的转折期了。

顺着这个历史规律,我们再来看看今天的 AI 时代:产业化进程会怎样演进?哪些东西会变,哪些东西具有确定性?从 AI 的底层能力到产业逻辑,核心链路依然在于生产力和价值创造。

六、脑力可以规模化之后,产业会怎样变化?

农耕时代,土地、人、牛马等动物都是重要的生产资料。生产要素的线性增加,会带来相应的产出和价值增长。

第一次工业革命在生产价值和价值创造的逻辑上带来了一个根本变革:体力的无限扩张,体力的成本趋近于零。

我们不需要牛和马了,有了汽车和挖掘机,生产效率大幅提高。当体力无限扩张、成本趋于零的时候,就会产生一套与它相适应的组织形式、管理方法和社会结构。

但这里有一个核心矛盾:体力涨了,脑力没涨。脑力依然是有限的。当体力可以无限扩张而脑力有限时,为了适配有限的脑力,就只能向脑力妥协。

当创造力有限、生产力无限时,这个妥协的结果就是工业化最核心的特征:标准化。

标准化的本质是节省脑力:把某一个东西定义成标准,然后去无限复制生产。制定标准让脑力变得节约,而生产可以进一步放大。无论从生产侧还是消费侧看,逻辑都一样:

  • 消费侧的典型代表:福特 T 型车只有黑色,没有别的颜色。不是造不出来,而是浪费脑力、划不来,所以只造一种车型去拼命生产。
  • 生产流程与分工:像卓别林的《摩登时代》展示的那样,在分工上做到极致的标准化。一个人站在流水线上只拧一颗螺丝,因为这样最省脑子、最能保证标准化,你只要会拧螺丝就够了。

那个时代都是为了向智力妥协而放大整个生产,从而造就了工业化的一致性。用这个逻辑看今天,很多东西依然由工业化思维主导。比如携程:本质上旅游是非常重体验、非标的,但体验太丰富多样会增加选择的摩擦、降低交易效率。工业时代追求效率第一,就必须压制个性需求。所以你在平台上只能展示面积、房型、含不含早和价格,别的个性化服务很难呈现。

从“行业最佳实践”,到“个体最佳实践”

但站在工业的角度再看今天的 AI 大模型,它带来的是智力的无限扩张。在 AI 时代,不止体力可以无限扩张,智力也能无限扩张,智力与体力重新回归对称。

所以很多人问 AI 时代是不是下一次工业革命?我觉得其实不是。某种程度来说,AI 是在“反工业革命”,因为它把原有的标准化彻底打破了。

当脑力和体力都可以被无限扩张时,标准化的逻辑就被颠覆了。举个最简单的例子:

  • 以前的杂志是标准的工业化产物:甭管你喜欢什么,只要想看体育,编辑就给你一套“行业最佳实践”,规定看这 20 篇文章就够了。背后的假设是你不懂,编辑懂。
  • 今日头条和抖音打破了这一点:不再需要统一的“行业最佳实践”,而是每个人都能得到自己的“个体最佳实践”和专属的信息流(Feed 流)。每个人想要的不是全局最优,而是属于自己的最优解。

当年今日头条和抖音能做到,是因为它们完全数字化。今天随着 AI 逐步成熟,所有需要智力定义的事物(包括 3D 打印、软件的自动化生成等)都在发生同样的变化。

这个时代的本质是一场“颗粒度革命”:从原来粗放的大颗粒度,迅速细化到极其微小的颗粒度,让每个人都能享受到更高质量的服务。

ChatGPT 就体现了这种颗粒度变化:以前在搜索引擎里查找别人已经生成好的内容,现在可以针对你的需求实时生成。使用 Claude 的 Artifacts、ChatGPT 的 Canvas 等功能时,很多页面变成了“即用即抛”:为当前某个具体需求临时生成,用完就可以放下。

软件开始变得像液体,组织和服务也开始变得像液体。它不再是一个需要你去迁就的坚硬固体,而是动态配合你的需求。不是人在迁就标准化,而是标准化在迁就人。

统一的一份内容分给所有人,与按不同需求组织地图、阅读页和日程等个体服务的对照。

图 6 · 颗粒度变化:让供给适应个人,而不总是让个人迁就标准。

再往下推演,产业结构可能出现三种变化

顺着这个逻辑做一个思想实验:如果我们自己的行业,或者我们服务的客户所在的行业,这件事情一旦发生,究竟会带来什么样的变革?我们可以把这个问题简化来推演一下。

如果发生这样的结果,在产业里面会有什么样的逻辑变化?我自己总结了三个:

变化一:“平庸的灭绝”

第一种推演,是能力价值从较分散的分布转向更集中的幂律分布。以前,90 分的产品卖得贵,80 分的便宜一点,70 分的再打个折也有人买。由于优质产能不足,差一些的产能也有市场,可能 60 分以下才没人买,所以中间这部分一直有价值空间。

但你想想,如果今天 90 分一旦跑通,借助于 AI 无限扩张和无限复制,结果是什么?89 分跟 60 分没啥区别,价值归零,没有任何意义。

在这种情况下,整个产业的分布就会从正态分布变成幂律分布,也就是第一名通杀、高度集中,中间状态完全没有存活空间了。我们不去评价它好不好,但逻辑上肯定会发生,马太效应会更加明显。

变化二:价值从生产过程转向验证结果

生产能力很稀缺时,咨询、律师等服务往往按投入的劳动量或时间收费,而不是完全按结果收费。以麦肯锡为例,想买服务的人很多,但能提供服务的人和时间有限,于是大家竞价,稀缺资源形成了价格。

但随着时代发展,大家发现出现了一个巨大的逆转:生产信息这件事本身的成本无限趋近于零。然而稀缺并没有消失,而是转移了,价值在于“验证”这件事变得更加稀缺。

今天的价值不在于谁能生产。比如你在公司让下属写个规划,按原来的逻辑,他能不能写出来、能写得多好,你看个大概就知道他靠不靠谱;今天你发现十个下属每个人都能给你写个两万字的规划,你根本看不出来是人写的还是机器写的。去验证谁真正有价值,这件事本身变得更加稀缺了。内容实在太多,大家开始愿意为验证付费,而不是为生产付费。在这个过程中,所有原来人为创造复杂度、按过程收费的逻辑,都开始消失了。

往更极限一点说,组织的雇佣方式甚至都会发生变化。以前因为存在稀缺,企业只能先把人锁定,你能不能干好我其实不知道,但你在我这儿干,大概率有产出好结果的可能性。可如果连这个前提都变得不重要了,未来组织的形态会不会发生更大的变革?我觉得完全有可能。

变化三:规模不经济可能发生逆转

我管 50 个人跟我管 5000 个人,中层规模不一样,中间的折损和损耗就完全不一样,这是很明显的。

在这样的背景下,原来的企业随着业务规模发展,当收入和收益的增长已经抵消不了组织效率的下降时,那就是企业的天花板。

而且原来依赖人还有一个很大的问题:人都会出去单干。干到一定规模,你的效率一低,三五个人出去单干效率反而更高,又反过来赚你的钱。大家永远是这么一个态势,所以企业做不到超级大,它总有边界。

但是今天在 AI 背景下,所有企业的认知和能力沉淀不在人身上,而是在模型身上,这就意味着它本身没有任何损耗。它可能会从规模不经济,变成一个超级规模经济。

它一旦形成了正向闭环:我构造了环境,在环境内拿到反馈来训练我的独特分布,独特分布带来更好的体验,再反哺回环境,你会发现它会变成一个非常良性的闭环。

所以未来看起来,我觉得整个企业高度集中化的概率还挺高的。

七、软件的护城河,为什么要回到场景?

一种业务被别的方式替代时,原来的护城河可能就不再重要。比如方便面受到其他供给方式冲击时,即使生产线更强、口味更好,也未必能挡住变化,因为对方根本不在同一个维度竞争。

如果 AI 在第一性原理上发生了这样的变化,整体来看就会产生巨大的变革。举个我自己设想的案例:

视频制作软件:原来的四道护城河

比如一款传统的视频制作软件,它过去的路径逻辑非常清晰:我的城就是这款视频制作软件,制作视频必须经过四个步骤,而这四个步骤本身都能带来壁垒。在这个逻辑下,它会在中间的每一个环节构造自己的护城河,越挖越深:

  1. 脚本库:提供各种各样成千上万的脚本,解决创作起点。
  2. 模板与动效:除了脚本,还提供动画、特定片段的制作方案,直接打包生成。
  3. 强大的编辑器:支持快速编辑、有效更改、实时查看反馈。
  4. 庞大的素材与版权库:把所有可能用到的素材与版权资源都内置在里面。

在当时的软件体系里,这样的护城河看起来完美无缺。但到了今天 AI 时代,用户压根就不从原有的路径走了:

  • 脚本库:原来的库是预设内容,AI 可以按具体需求生成个性化脚本,而且会随模型能力进步。即便原来的脚本功能也用了 AI,如果价值只停留在这一层,模型升级后仍可能被抹平。
  • 模板动效库:AI 可以全自动生成动效,效果比人工特效还好。
  • 强大的编辑器:受冲击最大的就是各种编辑器,今天任何编辑器都可以一口气重新生成一个,这个问题被彻底解构了。
  • 版权素材:端到端生成改变了取得素材的方式,传统素材库的优势可能被重新定义。不过,生成内容不等于自动免除版权、商标或肖像权等合规要求。

很多传统的、old-fashioned 的企业现在的做法是:继续用 AI 帮自己把原有的护城河挖得更深。但 AI 带来的颠覆根本不是“更深的护城河”,而是地壳变动:城已经被挪走了,你在原地挖得再深也是白挖。

大家可能觉得这个例子夸张,但今天绝大多数企业都在原有的护城河上继续往下挖。这不是假设,看看 Adobe 就知道:Adobe 的 Firefly 虽然实现了部分功能,但面对新一代模型依然被卷得很厉害。比如最近 Astra 发布后,做动效可以直接先在 Blender 里做结构、做运镜,直接出动效,连 Adobe 都不需要用了。

这就是我所说的通用智能冲击:处在通用能力射程内的单点工具,会面临激烈竞争。垂直设计软件和平台如果不调整,就可能被卷入规模与范式竞争,面临淘汰或并购。

从操作界面,到意图与场景

AI 已经能直接生成界面,生成完还能做反馈、做沟通。用户不再用 Figma 从零开始建东西,很多信息沉淀随之失效:虽然还在用它,但它已经沦为一块底层的基板,过去引以为傲的用户粘性与上下文都不复存在。现在我们公司的设计师都是直接用 Claude 或 ChatGPT 在 Figma 里跑图出方案,一个人效率能提升十倍。

这种逻辑一旦铺开,整个软件的价值链就彻底变了。跟它一样陷入这种尴尬境地的还有一大批软件:比如现在连 MCP 都有了,直接在界面上操作 DaVinci 调色都能搞定;游戏行业也是,从 Unity、各种 UGC 架构到多模态生成,都在快速更新演化;再到 Blender,所有模型发布都在用它,但大家根本不会自己点开界面,只是把它当成一个免费调用的后台跳板。它们跟用户之间已经完全断联,沦为了纯粹的背景板。包括 Word、Excel,今天很多生成式能力和 Artifacts 直接内置,以后还会有多少人按传统方式打开它们?只会越来越少。

软件行业正在经历的核心变化,是与用户的连接触点变了,收集到的信息内容也跟着变了。过去软件界面收集的是操作链路;如果今天做一个新软件,哪怕拿到过去的所有操作数据,也毫无用处,因为那些数据是基于既有软件流程构造的,而今天的 Agent 是基于意图驱动的,只有基于场景的数据才有价值。传统专业功能完全被绕开,即使像 Blender 这样复杂的工具,未来某一天 AI 也可能用极低成本复刻出来。如果意识不到这一点,很多软件公司正在经历缓慢的安乐死。

如果这类软件今天想自救,就绝对不能再把自己当成一个简单的“流程梳理工具”,这种定位在今天已经毫无价值。必须要把自己独特的环境与 Know-how 转变为服务,做到端到端的交付,才具有核心壁垒。

三个关键词:场景定义、场景飞轮、场景价值

面对这种趋势,企业新的工作模式应该回归到三个关于场景的关键词:场景定义、场景飞轮、场景价值。

场景定义:不要只下棋,也要重新定义棋盘

不要把自己当成下棋的,要把自己当成出题的,切忌在原有框架内靠 AI 去卷效率。用 AI 这种地壳运动级别的底层变革去重新定义棋盘,才能带来真正的竞争力。

不要跟随被动升级。就像开场提到的,今天试用一下这个、明天跟风玩一下那个,本质上都是被动跟风,毫无意义。真正重要的是理解 AI 体系后,思考如何把 AI 放进一个具体产业中重塑它,去找到重新定义棋盘的机会。

场景飞轮:让每一次服务留下能力

有了场景之后,要通过它构建起持续运转的飞轮:源源不断地把场景定义内产生的信息与真实世界的物理信号连接起来,这些反哺的数据变成我们独特的专有能力,用于持续训练自身。

过去很多企业觉得每做一次服务就是一次折旧、一次成本或组织消耗;但站在 AI 视角,每一次服务都是一次训练、一次增值、一次高价值数据的获取。这两个逻辑截然不同,让定义的棋盘转起来才是关键。

场景价值:交付结果,而不只是提供信息

AI 带来的关键变化是让纯粹“信息”的边际价值变得极低,即便能生成极高质量的信息,信息本身也不值钱。一家好企业依然需要有扎实的物理业务或落地场景。

必须把能力与场景紧密连接:不要只提供信息,还要提供最终结果。单卖信息很容易陷入竞争;把信息与结果结合,完成最终交付,才有难以替代的价值。

场景定义、实际服务、真实反馈与能力更新四个环节顺时针相连,形成围绕同一场景的循环。

图 7 · 场景飞轮:每次服务能否留下有效反馈,决定闭环能不能真正运转。

八、从数据资产,走向可以增值的智能

有些人会说:“数据放在我这里,肯定有价值,别人都想拿走我的数据。”但追问这些数据到底有什么用,自己又说不清,只是认定它一定有用。我觉得这个逻辑需要重新检查:如果数据不能转化为智能,它的价值到底体现在哪里?

大家完全被以往“大数据”的概念给影响了,觉得数据一定得大、越大越好。但你要从场景来看:大数据为什么要越大越好?因为大数据本质上是为了看 insight、看洞察。要看洞察就得看分布统计,而统计的逻辑是样本越大,信号越可信、越稳定,所以它当然是越大越好。

今天讨论 AI,我们更关心数据能否改善决策,而不只是用来做统计。分享中用“信息熵更高”来表达这件事:某条信息如果不告诉你,你原本就不知道,它才可能带来新的认知。这里强调的是与决策有关的有效信息,不是说越随机、噪声越大的数据越好。

举个例子大家比较好理解:如果我今天想去学经济学,我是应该把经济学的经典书籍看三遍,还是应该把一个书店里 1000 本讲经济学的书都看一遍,亦或是把 20 万学经济学的学生的课堂笔记都看一遍?

你就会发现:数据质量远大于数据数量。数量本身没有意义,过多的数量也都是噪音。我们要的不是中位数的平均值,我们要的是边缘值,而边缘值一定在少量高信息量的数据内部。也就是说,如果你的数据不能转化为边缘值的信息智能,这个数据就毫无意义。这是我们衡量数据资产的关键。

在这个过程中,我们在做应用时,自身的价值到底在哪?可以分几个层面来看:

租用智能:消费层

我们今天调用 API,某种程度上用的是公共服务,是所有人都能拿到的东西。你在用它的时候只是在做正常消费,无非是在里面加了一个 prompt 或类似的东西。这是非常薄的一层,你跟公共模型高度耦合。我不是说它不好,对于不需要构建特有模型能力的部分,直接租用模型效率很高。

拥有智能:资产层

如果你想更进一步,就得变成拥有者。我们需要把一定的智能和专家经验固化下来,解耦于基础模型。这时我们往往需要基于自身业务环境,有人做观测、抽取信息,搭建 harness 等上层结构,而这个结构可以复用在不同的模型上。到这一步,智能才真正变成了你自己的资产。

增值智能:闭环层

更极致的一步是让它产生增值。我不光要存钱,还得让钱增值,也就是要把每一次服务都当成一次训练。我们要在真实业务环境中形成一个有效的闭环,在闭环里持续训练:每一次服务都是一次反馈,每一次反馈都是一次优化。形成这样的循环后,哪怕你在不管的情况下,业务指标也会越来越好。这就像 AlphaGo 自我博弈,而你供给的是那个棋盘,把它跟棋盘连接起来,自然就会有这样的结果。

从租用,到拥有,再到持续增值,我认为这是理解应用自身价值的几个关键层次。

九、把 AI 当作劳动力,而不只是新工具

做 AI 落地时,大家经常会问:AI 对企业来说,本质上究竟是什么?

大家很容易觉得,自己做了一个智能助手,就算是一个 AI 应用了。但这对企业的价值到底是什么?好像有了 AI 应用,企业也没有发生太大的改变。

要回答这个问题,我们得先回到企业的本质。如果今天探讨的主题是“企业 AI”,那企业的价值该如何定义?

我先给一个粗浅的工作定义,不把它当成严谨的经济学公式:一个企业创造的价值,可以先看作其中所有劳动力创造价值的总和。这里暂时不把资本增值等因素算进来,只以劳动力为切入点。

基于这个逻辑,如果要改造企业创造价值的逻辑,要么替代劳动力,要么升级劳动力。

“人加软件”与“AI 加软件”

我们可以看看传统的劳动力是如何创造价值的。传统模式是“人 + 软件”。为什么人要加上 SOP、软件和规则来做事?

因为人是一个“概率实体”。对于同一个任务,同一个人执行两次,可能因为心情不同,执行的过程和结果就完全不同。人是有“幻觉”和不确定性的。而软件的目的,就是为了让人保留好的发挥,避免坏的偏差。从这个角度理解,软件其实是人的 harness(约束与支柱)。

如果按这个逻辑去对等,你会发现 AI 模型本质上就是“那个人”。因为模型也是基于概率的,它同样有好的发挥和坏的“幻觉”。而此时的“AI + 软件”(比如 AlphaGo 这样的系统),就是通过原有的软件、流程和制度,在里面去限定模型的边缘。

因此:

  • 传统模式下,“人 + 软件”是一个劳动力单元;
  • AI 时代下,“AI + 软件”也是一个劳动力单元。

一个企业内部的总价值,在于所有劳动力单元创造价值的总和。那么本质上来讲,在一个组织内部,面对今天这么多人做的这么多事,我们是不是应该把这些节点都进行 AI 化?从而让能力变得更强、价值变得更大、成本变得更低。这才是 AI 为企业创造价值的本质。

当然,随着这个过程的改变,企业的组织边界、结构,甚至商业模式都可能发生变化。

从降本增效,到商业模式变化

从这个逻辑出发,我们可以看到很多场景中的演进结果。

最简单的初级逻辑,大家想的都是“降本增效”,看能不能把效率提高一点。但一旦 AI 真正用起来,你会发现它带来了劳动力的无限供给和规模化供给。

这个方向可以借助“杰文斯悖论”(Jevons paradox)来理解:当资源利用效率提高、使用成本降低时,需求可能随之扩大,总消耗不一定减少,甚至可能增加。

今天在人类社会中,软件在整个全球 GDP 里的占比只有 1% 左右,而劳动力成本大概占了 60%。如果今天劳动力的成本能够下降一个数量级,我们对劳动力的消费需求就会呈指数级增长。今天有太多该干、想干,但因为人太贵、人手不够而没干的事。

所以,只要能解决效率问题,AI 就能带来近乎无限的规模化供给。

而这种“信息化的供给”,又能从真实世界中带回更多、更大规模的数据回流,从而让算法和模型带来更高质量的品质。

当规模化供给与高质量回流这两条链路都跑通,企业就有机会触达原来触达不了的资源,解决原来解决不了的问题,并进一步改变商业模式:

  • 要么从 To B 走向 To C;
  • 要么从单纯的商业变现,走向直接“卖结果”。

这就是从“工业化与标准化”走向“客户革命”的底层逻辑。

十、企业 AI 怎样找到合适的切入点?

关于在企业内部如何具体落地,我们在服务很多终端业务部门时,也积累和抽象出了一套方法论。

如果我们今天要给企业内部去做 AI 落地,到底怎么能够快速推进?怎么能够快速找到那种跟业务紧密契合、能产生直接业务价值转化的切入点?

帮助企业内部部门解决问题,逻辑是一样的:不是交给伙伴一个更炫的工具,而是通过引入 AI,解决业务价值和业务战略问题,带来额外竞争力。

所以这件事的锚点一定是业务本身,一定要基于业务来设计。

面对一家企业,特别是大型企业,我通常先做诊断,结合咨询的方法把整条业务链路拉出来,而不是想当然地上工具:

  1. 深入了解并做业务建模
  2. 算账,分析成本结构里哪些地方影响大
  3. 评估 AI 切入的可能性
  4. 叠加之后,选择切入点、制定实施路径,然后再逐步扩大

具体展开来讲:

第一步:调研体检与业务建模

我们一般先做访谈,相当于给企业做体检。把每个人都访谈完之后,整理出企业的业务流程,理清角色分工:任务 A、任务 B、任务 C 到底是谁在干、哪个角色在干,这些任务到底有多复杂、有什么特性。不管企业有两三个还是更多业务组合,我们都要画下来,串成业务流。这是后续所有讨论的基底。

第二步:盘点替代与协作的可能性

在这张图的基础上,我们先不管行不行、先看可能性:哪些环节可能被 AI 替代,哪些环节适合 AI 协作,必须梳理出来。通常我们在一家企业里能找到二三十个潜在的切入点(PoC)。

第三步:算财务账,找高杠杆点

梳理出这么多点之后,就得在财务上算账,看哪些对企业成本结构的影响最大。如果做完一件事只有 1% 的影响,那就没有意义,我们必须挑杠杆最高的点。去看财务报表里哪些是固定成本、哪些是可变成本,再映射到前面的业务结构里。

第四步:用业务价值与技术成熟度筛选

横纵轴分别看业务价值与技术成熟度,理论上我们要找的是业务价值高、技术成熟度也高、最容易落地的点。找到这些切入点之后,再以人工为标准去衡量,考虑如何做替代或协同。

横轴为技术成熟度,纵轴为业务价值,高价值且技术较成熟的右上区域标注优先验证。

图 8 · 先找业务价值高、技术较成熟的切入点,再用实际结果验证。

一个预约与增购的例子

举一个我们在美年大健康场景中做过的例子。我去他们年会分享时,也讲了这个案例,现场的人觉得很惊讶。

他们原本人工做起来非常麻烦:销售前要做大量的客户预约沟通和增购裂变。我们把它改成了 AI 化:

一位有孕产相关需求的妈妈来做体检,整个跟进链路持续了 5 天,沟通了 200 多句。期间客户爽约了 4 次、改约了 4 次,到第 5 次才排好。在这个过程中,AI 完成了 8 个专项的增购,整条流程顺畅跑完,没有人工介入。

这个例子让他们觉得惊奇。但真正切进去会发现,选对技术成熟度高、业务价值明确的点,未必像想象中那么难。先让大家看见效果、建立信心,后续才有条件一个阶段一个阶段地往前推进。

三个月看到信号,不要憋大招

业务指标不一定马上出现巨大变化,但至少要能看到正向的趋势和倾向。这种可观察的信号,比长期憋一个大方案更重要。

这里强调的 Measure,就是把前面拆出的任务和目标,一项项转成可以衡量的东西,持续观察变化。

对个人和企业都一样,要把对业务的理解转化为自己的“预测分布”。通俗地说,就是形成对不同结果出现可能性的判断,再用实际结果不断检验和校正,而不只是停留在一句笼统的“应该有效”。

十一、大健康案例:从一次体检,到持续服务

下面用一个具体案例再讲几分钟,也给大家一个更直观的感受。

先快速讲一个微观的案例,给大家一点直观的感受。我为什么有时候不太愿意讲硅谷的例子?2024、2025 年那会儿大家都热衷于分享创新产品的交互,但当时我们跟踪过 a16z 每半年发布的 AI Top 50 软件,发现榜单每半年就有 40% 的产品死掉了。很多例子只呈现了表象,并不能真正帮到我们。我更愿意讲底层的逻辑,因为底层逻辑是不变的。

一个企业里的 AI 一定只是降本增效吗?还是能给整个业务战略带来质的改变?我现在作为美年的董事,也在推动他们内部的 AI 化改造和升级。

美年是一个传统的重资产、重服务企业:全国有 600 多家体检中心,每年服务 3000 多万到店用户。在原有模式下,他们面临两大挑战:

  1. 资本市场觉得模式太重,每开一家店就是一次折旧。
  2. 规模不经济:开 100 家店还行,开到 600 家店边际成本更高,越来越不经济。

我和他们聊的时候提出要换一个思路:AI 的核心不是告诉他们每个门店提效 10%,而是换一个视角看大健康产业的变化。如果不把这 600 家门店看作成本载体,而是看成“真实世界用户对健康的付费连接器”,企业的性质就变了:前者是重资产公司,后者则是一家半科技公司,能源源不断地从线下获取真实信息。

我们要帮他们做的是把物理世界的连接信息转化为数字资产,而且这个数字资产的边际成本几乎为零,从而去服务更大的客群、更长的生命周期,并提供更丰富的内容。

美年过去的商业模式主要是做 B 端团检:搞定企业 HR,HR 带 500 名员工过来检测。对体检中心来说这 500 个人甚至不算真正的“客户”,彼此之间不需要深入交流:发个短信约时间来体检,检完发个报告,双方就断联了。

但如果你每年与 3000 万高密度的用户产生连接,把线下门店当作连接器,就应该转为以 C 端为中心来梳理用户数据地图:

  • 从一个体检订单开始做建联、预约和信息收集
  • 接着做现场服务、体检报告解读
  • 再延展到保健品增购、裂变、用药指南以及医院挂号等服务

从预约、到店、报告解读、跟进到持续服务的五个节点,展示一次体检怎样延伸为长期服务关系。

图 9 · 从一次体检订单,延展到持续的服务关系;图示不代表所有环节都已实现。

服务成本变化之后,用户关系也能改变

顺着这个设想,用户关系就有机会从一年见一次,变成一年见二十次;从一年只卖一次体检,变成持续提供健康服务。这是在延长客户生命周期、提升 LTV(生命周期价值),不是说联系次数本身就等于 LTV。

这个道理以前大家也懂,为什么过去做不成?关键是算不过账。可以这样理解这笔账:如果一次重度服务要投入 100 元,却只能收回 50 元,商业模式就不成立;如果 AI 把单次履约成本降到 5 元,原本做不成的服务就有机会成立。这里是在说明成本结构变化怎样影响商业模式。

AI 带来的不只是降本增效,而是在某个单点带来极致的改变后,倒逼上游业务模式乃至整个商业结构发生变革。

按分享时的进展,我们已经从 C 端链路切入,用 AI 跑通了前半段核心流程,基本达到人工服务的水平;后半段仍计划继续连接,把医疗、抗衰等深度服务接进来。

按照这个方向推演,企业的净利率有可能从 5% 提升到 20%、30%。这不是已经实现的结果,而是对商业模式变化的预期。表面上只是做了一个单点智能体,背后可能驱动的却是整个企业的科技化改造。

以上是这个案例背后的整体逻辑。接下来,再回答两个落地过程中绕不开的问题。

十二、两个落地难题:组织协作与学习反馈

问答一:组织与流程,怎样跟上 AI 的变化?

问:商业模式变化之后,组织架构、组织模式、流程,以及软件开发生命周期(SDLC)应该怎样配合,才能更好落地,并长期运转?

答:从我个人的理解看,企业变革天然很难,尤其大厂的体系很大。历史上许多案例都说明,如果不是一号位亲自关注、亲自花时间,这件事非常难做。

变革通常有两种:一种是颠覆性变革,一种是渐进性变革。只有老板高度关注,才有可能做颠覆性变革;如果老板没有关注,往往只能做渐进性的尝试。

在今天这个场景下,我结合原来做软件的经历提两点建议:

转变思维:把 AI 当作劳动力,而不只是软件

过去做软件的逻辑,是把业务梳理出十到二十个节点的流程,然后想办法加一个工具,让每个节点提效 20%。但这种方式会带来极大的摩擦,也是所有软件公司面临的客户成功痛点,要派人去改变员工原有的习惯,成本和阻力极高。

如果换一种思路:AI 不是软件,AI 是劳动力。与其让每个人都用一个提效 20% 的工具,不如在十个节点的流程里,找出两个节点实现 100% 自动化,直接把事情接管过来,从而彻底避开与人的摩擦。

比如传统的做法是做一个 Copilot,让销售沟通时系统自动出提示,这仍然是软件辅助的逻辑。但如果是 AI 劳动力逻辑,即使 90% 的环节仍由人工完成,只要找出 10% 能完全替代的环节直接闭环即可。比如把所有客户前期的初筛沟通直接中台化、AI 化,从打电话、加微信到日常维护全部自动解决,只有到了物理世界的履约环节才由真人介入。这样既不需要给线下的人做复杂培训,也不会给他们增加工作负担。

找准与原有体系摩擦较小的切入点

除了高层关注,切入点的选择同样至关重要。核心在于找到与原有体系摩擦力较小的方式先做切入,等跑出效果、大家建立起信心之后,再逐步向外扩展。

问答二:经验不可靠、试错又昂贵,怎样学习?

问:前面谈到了不少困难,我想进一步了解解法。

沉淀经验,无非是利用已有的人类经验,或者自己在环境中试错。但商业应用有两个问题:

  1. 试错成本非常高。
  2. 人类经验尤其从算法视角来看并不靠谱,它既不是 A/B 测试跑出来的,也不是来自海量数据;业务部门自身其实也不自信,甚至还期待 AI 进来后能替代原来专家的经验或机制。

这就带来了困境:人的经验无法直接复用,AI 也没有下棋那样理想的环境。即便我们捕获了 trajectory(轨迹数据),它也不是从企业最底层的动机一路干净地推导下来的,中途受到了太多嘈杂因素的影响和变化。在这种情况下,如何有效沉淀经验并给 AI 赋能?

答:这个问题确实是当前最难的一环,我们也在做尝试,核心逻辑是要解决两件事:采样问题和奖励信号(Reward Signal)问题。

我其实不太迷信人类经验,人类经验的核心价值是用来做冷启动的,主要是为了提高未来的学习效率,而不是把它当成决定性关键。人的经验都是切片,市场在变,不能拿两年前的经验来应对今天的市场。我们目前主力在探索的两种方法:

第一,构建商业世界模型与模拟环境

与其让标注人员去穷举 100 个销售面临的场景,不如构建出 100 个真实可能存在的客户,让 AI 与这些虚拟客户博弈。大家对这套逻辑可能存在分歧,包括像使用 GPT 跑出来的结果也不一定全对,只是实验产物;但只要分布合理,理论上就能学到东西。就像学开汽车,模拟器哪怕不够精准,也比没有强。我们不追求完全精准的模拟,而是追求结构性合理、高度可控的商业环境模型。毕竟像比亚迪面临的商业环境跟其他企业完全不同,必须因地制宜去构造。

第二,进一步学习怎样识别有效信号

商业场景中的信号极其混沌。销售跟客户聊了大半天,最后客户没买,问题到底出在哪里?是因为介绍不清楚、没顾及对方情绪、说话太啰嗦,还是因为品牌力太差、价格太贵?

我们不是单纯训练奖励(Reward),而是训练信号本身。在不同的业务目标和模拟博弈中,动态挖掘并识别出哪些信号是真正有效的。面对不同的客户、环境、目标和对话过程,起作用的信号截然不同,因此不能做静态配置,而必须是一个动态选择机制。

左侧在模拟客户环境中练习,右侧从混杂的对话反馈中识别有效信号;模拟不等于现实。

图 10 · 两条探索路径:构建可练习的环境,学习识别真正有用的反馈。

目前,这两个探索方向初步看到了一些成效,但距离把问题解决好,还差得很远。


  1. 原分享引用 Sonya Huang 于 2026 年 8 月 19 日发布的材料:Own Your Intelligence: Opening Remarks;Own Your Intelligence: A How-To Guide。原文将其概括为“产品要真正属于你,就需要能够控制并保管自己的模型权重”。 ↩︎