判断经济学
Economics of Judgment
当判断的生产成本趋零,而验收与担责不能——价值如何产生、定价、分配、积累
邱懿武
v3.0 · 2026 · https://je.qiuyiwu.com

目录

序言 · 那一页缺失的合同
如何阅读本书
卷一 · 地基
00 序章 · 一门缺失的经济学
01 三条公理
02 判断作为商品:四个反常性质
卷二 · 定价
03 价值基本式
04 责任阶梯:判断的价格首先是责任的价格
卷三 · 资产与市场
05 判断资产负债表
06 市场结构:Agent 劳动力市场
卷四 · 分配与制度
07 分配:平权悖论与哑铃社会
08 制度:产权、公共品、保险与认证
卷五 · 检验
09 算例集:四个行业与一桩真实交易
10 术语表与速查
11 可检验主张 · 边界 · 死法
参考与对话 · 这本书站在哪里
版本 · 致谢 · 许可
前言

序言 · 那一页缺失的合同

一份五十万的合同摆在桌上。

买方是一家年营收六亿的装备制造企业,在自己的细分行业里是国内第一。卖方是一家做企业 AI 落地的服务商。双方谈了三个小时,谈得很好——谈了行业趋势,谈了技术路线,谈了分几个阶段推进,谈了首年三十到五十万、三到五年长期合作可以做到多少。价格谈得相当细。

合同里没有一页写验收。

什么算做成了?谁来判断做成了?用什么指标判断?这三个问题,从头到尾没有人问出口。不是双方不专业——他们都是各自领域里很能干的人;也不是疏忽——三个小时里他们把能想到的都想了。真正的原因是:在这个市场上,还没有人知道验收应该怎么写。

这本书就是从这一页空白开始的。


我做过制造业,做过软件,现在做企业 AI 落地。这些年我坐在这张桌子的两边——有时候是买方,有时候是卖方。我看到的最反常的一件事是:所有人都在谈 AI 能做什么,几乎没有人在谈做错了算谁的

而后者才是价格的来源。

这个判断可以说得更精确一点。人工智能正在把一件事的成本推向零:生成一个判断。写一份分析、给一个诊断、出一个方案、挑一个候选——这些过去需要专业人员花几小时甚至几天的事,现在几秒钟就有输出,而且第二次、第一万次的边际成本几乎为零。

但另外两件事的成本没有降:验收——确认这个判断是对的,仍然要消耗一个懂行的人的注意力;担责——万一它是错的,仍然要有一个具体的法律主体拿出真金白银来赔。

判断可以复制,验收与担责不可以。

这条不对称是这本书唯一的发动机。全书十二章,每一章都是从它推出来的一个后果:如果生产免费而验收昂贵,价值从哪里来(第三章);如果责任不能复制,价格该按什么排序(第四章);如果判断一被交付就开始扩散,卖方还剩下什么存货(第五、六章);如果能力平权而担责资格没有平权,收入会怎么分(第七章);这样一个市场需要哪些还不存在的制度才能长起来(第八章)。


我想说清楚这本书不是什么。

它不是 AI 应用指南——怎么选模型、怎么写提示词、怎么搭系统,这本书一个字都不谈。它不是趋势预测报告——除了第八章里几条明确标注了置信度和验证方式的推测,我尽量不预言。它也不是一份管理咨询方案——组织该怎么变革,是我另一套体系(智能体管理学)的题目,这本书只负责指出:组织内部有没有人肯担责,是判断能不能被定价的前置条件(第四章)。

它是一门尚不存在的经济学的第一稿:判断的定价学。


还有一件事必须在开头讲,因为它关系到你该怎么信任这本书。

这本书里的核心公式,我在真实的交易里从来没见过有人用。

我复盘了八场真实的商业谈判与内部讨论——采购的、销售的、合作的、给员工定岗的。没有一个人用"失误后果 × 错误率差 × 频次"算过价。他们用的是对标(同行收多少)、成本加成(我的成本乘一个倍数)、预算锚定(你们有多少预算)、场景锚点(换个场景就能卖更贵)。

我没有把这个发现藏起来,而是把它写进了第三章。因为这正是我要说的:这套公式是应然,不是实然。它描述的不是市场正在做什么,而是市场迟早要学会做什么。 落差本身就是主张——今天谁先学会给判断算账,谁就先拿到定价权。

如果五年后市场仍然停留在按投入付费、按人头付费、按调用量付费,独立的评测与认证始终没有出现,P-4 与 P-3 的价差始终不足两倍,那么这本书就是错的。不是部分错,是地基错。我在第十一章写了七条可以证伪它的主张,以及三种它可能的死法,并且承诺每年公开对一次账。

一本谈定价的书,如果自己不肯标出置信度、不肯写下死法,它就没有资格谈定价。


这本书很薄。薄是有意的——我宁愿它每一章都能被一个具体的人在一个具体的谈判桌上用上,也不愿意它厚到只能被引用。

如果你正准备买一个 AI 判断服务,请直接翻到第三章和第四章,算一笔账,再看一遍你的合同里有没有那一页。

如果你正在卖,请先回答第四章的四个问题:合同里做错了谁赔,客户实际怎么用,你有没有三指标,钱在什么时候收。四个答案凑不到一起的时候,你的报价单和你的责任是两张皮。

如果你在研究这件事,第十一章是给你的。那里有五个虚位以待的研究招题,和一份公开的对账协议。

邱懿武
二〇二六年八月

前言

如何阅读本书

这本书有十二章,分五卷。你不必从头读到尾。

四条阅读路径

如果你要花钱买判断(采购负责人、技术负责人、总经理)
第三章 → 第四章 → 第六章 → 第九章。
先学会算一笔账,再学会看清对方站在责任的哪一档,然后看懂这个市场的结构和陷阱,最后对着算例把自己的场景过一遍。配套工具:判断点估值器、责任阶梯定位器。
最短路径:如果你只有二十分钟,读第四章,然后回去翻你手上那份合同的验收条款。

如果你要卖判断(AI 服务商、产品负责人、定价负责人)
第四章 → 第三章 → 第五章 → 第六章 → 第八章。
先弄清你实际站在第几档(多数人会发现自己宣称的和事实的不是一档),再算你为客户消化了多少失误后果,然后看清你真正的存货是什么、为什么这门生意有自毁性、以及往上爬需要哪些还不存在的制度。

如果你要研究这件事(研究者、政策制定者、投资人)
第一章 → 第二章 → 第十一章 → 第八章 → 第九章。
先看地基和商品性质,直接跳到可检验主张与死法——先看它怎么可能是错的,再决定要不要读中间。第十一章末尾有五个研究招题和一份公开对账协议。

如果你在想自己的位置(判断类岗位从业者)
第七章 → 第四章 → 第五章。
先看分配结构和你所在的位置,再看责任阶梯——它同时是岗位的阶梯,最后看你这些年的经验怎样才能变成资产而不是随退休归零。

五卷各是什么

在回答什么
卷一 · 地基00 序章、01 三条公理、02 判断作为商品为什么需要一门新的经济学
卷二 · 定价03 价值基本式、04 责任阶梯一个判断值多少钱
卷三 · 资产与市场05 判断资产负债表、06 市场结构这门生意积累什么、结构长什么样
卷四 · 分配与制度07 分配、08 制度钱最后落到谁手里、缺哪些制度
卷五 · 检验09 算例集、10 术语表、11 可检验主张怎么算、怎么查、怎么反驳

第四章是全书重心。如果只能读一章,读它。

书里的几个约定

置信三分法。 全书每一个判断都尽量标注了它的证据强度:

看到没有标注的强断言,请当作我的疏忽,并按〔推断〕对待。

序数不是基数。 本书的所有排序(哪个场景更值得做、哪一档更贵)是可靠的;所有绝对数字(具体值多少钱、准确率多少)是示例假设。第九章所有算例中的数字都是为了演示算法而设的假设值,不是统计结果,我在每一处都做了声明。

编号体系。 公理 E1–E3;责任阶梯 P-1 至 P-5;可检验主张 J1–J7。引用时写编号即可,第十章末尾有一页总表。

跨体系术语。 这本书属于一个更大的知识体系。凡是别处已经定义过的概念,本书直接引用、不重新定义,并注明归属:智能密度、判断点、L1–L5 判断让渡刻度来自智能密度体系;三指标(判断一致率、复现率、边界失效率)来自认知工程派;委托契约来自《智能体的社会科学》;组织变革与治理属于智能体管理学。

有一组概念特别容易混,请在开始前记住:L 刻度是"让渡深度",P 档是"责任深度",两者不是一回事。 一个组织完全可能在 L4(把大量判断交给了系统)却停在 P-2(没有任何人对结果负责)——这是最危险的组合,本书称之为负密度。第十章有专门一节辨析。

工具

书里的四件工具是理论的可执行形态,都在线、零依赖、不收集任何数据:

还有一个定价师会客室,把全书装进一个可以直接对话的 Agent。

关于错误

这本书一定有错的地方。我更希望它错得明确——错得能被指出来、能被数据推翻,而不是错得含混、怎么解释都对。

第十一章写了它可能怎么死。如果你手上有能推翻其中任何一条的证据,那正是这本书想要的东西。

第 00 章

序章 · 一门缺失的经济学

本章要点

序章 · 一门缺失的经济学

一家德资装备企业与一家 AI 服务商谈了几个月。方案谈到了报价:首年五十万。双方都满意,合作方案里写着"六个月出成效"。

然后有人问了三个问题:什么算成效?谁来判断?用什么指标?

三栏全是空的。〔已知:来自一次真实的企业采购讨论记录〕

这不是疏忽,也不是哪一方不专业。五十万的合同里,最贵的一项——判断本身值不值这个价——之所以没有被写下来,是因为双方都没有语言可以写它。价格谈得下来,验收写不出来。谈判桌上两个人都清楚这一栏空着不对,但谁都不知道该往里填什么。

同一段时间,一家做跨境电商的公司把这件事的另一半演到了尽头。它上了一整套系统,数据都在,看板都在。可是一款抽屉箱卖了两千个,没有人跟进为什么;一处跨境财务的漏洞,一年半之后才被发现。这家公司的经营者自己给出的诊断是:完成了巨额的数字化,但并没有把数字资产转移为公司的经营资产。〔已知:来自一次真实的企业内部讨论〕

两家公司隔着一整条产业链,卡在同一处:没有人给"判断"这件事定过价,于是也没有人知道怎么验收它、怎么记账、怎么问责。

当判断的生产成本趋零,而判断的验收与担责不能趋零——价值如何产生、定价、分配、积累?

判断的价格一直藏在工资里

经济学从未给"判断"单独定过价。一百多年来,判断的价格藏在工资里:你付给医生、律师、买手、审校、经理的钱,混合支付了他们的时间、知识、执行和判断,从来不需要拆开。智能体把这四样拆开了——时间不要钱,知识不要钱,执行不要钱,只剩判断需要标价,而我们没有它的价格理论

不需要拆开,是因为过去拆不开。你雇一位资深买手,买的是"这个人一年的判断力",但你没法只买其中的三百次判断;你请一家咨询公司,买的是一份报告,但报告里哪几页是判断、哪几页是资料整理,账单不区分。捆绑销售不是行业陋习,是技术约束的结果:判断附着在人身上,人不可分割,于是判断也不可分割。

这个约束在最近三年被解除了。判断第一次可以脱离具体的人被交付:一份评审标准、一套定价规则、一条放行判据,可以被封装、被调用、被计次。一旦一件东西可以被单独交付,它就必然要被单独定价——市场不会容忍一个可分割的商品长期没有价格。

问题在于,可以定价不等于会定价。今天绝大多数关于 AI 的价格谈判,用的还是执行时代的语言:按人头省了几个、按调用量收多少、按项目包干多少钱。这些语言都能报出一个数,但没有一个在给判断定价。

判断经济学的任务:把"判断"从工资、软件 license 和 Token 账单里剥离出来,作为独立商品,给它公理、给它定价、给它市场结构和分配理论。

三处已经显形的错价

这门缺失的经济学,后果已经显形:企业按"省了几个人"给 AI 项目估值,把判断当执行来核算(于是系统性选中最没价值的场景);供应商按 Token 计费,把判断当流量来卖(于是把最贵的东西按最便宜的单位出售);法庭找不到给"错误判断"定损的框架(于是责任缺口越积越大)。定价错误不是会计问题,它让整个市场把资源持续配置到错误的地方。

这三处值得各说一句,因为它们是三种不同的错法。

买方按人头估值,选中的必然是最不值钱的场景。"省了几个人"这个指标,天然偏向高频、低后果、大批量的工作——客服话术、素材生成、报表整理。这些恰恰是失误后果最小的地方,也就是判断价值最低的地方(第三章会给出算式)。而失误后果最大的判断往往低频:一年一次的供应商准入、一季度一次的定价调整、一次就能让公司元气大伤的授信放行。按人头算,这些场景一个都进不了立项名单,因为它们"省不了人"。于是企业投入最多的地方,恰好是回报最薄的地方。这不是决策者短视,是他手上的尺子只有一把。

卖方按 Token 计费,等于把最贵的东西按最便宜的单位卖。Token 是算力的计量单位,不是判断的计量单位。同样一万个 Token,可能是生成一篇不痛不痒的文案,也可能是给一笔两千万的授信出结论。用同一个单位给这两件事开票,价格必然向低价值那一端塌陷。更麻烦的是,Token 计费把卖方的收入锚定在"用得多"而不是"判得准",两者在长期是背离的——判得准的服务,往往调用次数更少。

司法与保险没有定损框架,责任只能悬着。一个判断出错,损失是真实的,但赔偿链条断在中间:使用者说我是照系统说的做的,供应商说合同里写了仅供参考,模型厂商说我只提供通用能力。三方都有理,损失落在第三方身上。法学把这称为责任缺口(社会科学 S05 的既有术语)。经济学的说法更直接:一项没有人为之定价的风险,最终由整个市场以更高的不信任成本共同支付。

〔推断〕这三处错价互相加固:买方用错尺子选场景,卖方用错单位报价,制度没有兜底,于是市场停留在低价值区间自我循环。要打破它,需要先有一把新尺子。

为什么是现在

一门新的经济学要成立,光有需求不够,还要有三个条件同时到位。我认为这三个条件是在最近这段时间才凑齐的。

第一,供给侧的成本结构变了。判断的边际生产成本趋于零,这是第一章的 E1。在此之前,判断的稀缺由生物学保证——一个人一天只能认真做那么多判断——所以判断的价格由人的产能决定,属于劳动经济学的辖区。这道天然闸门拆掉之后,价格由什么决定,成了一个空白问题。

第二,交易侧的单位可分割了。判断第一次可以脱离人被交付。这一条前面说过,这里补一句它的经济学含义:可分割是市场化的前提。土地在可分割之前不是商品,频谱在可分割之前不是商品。判断刚刚跨过这道门槛。

第三,制度侧还是空的。没有判断服务的认证机构,没有判断责任的保险产品,没有判断资产的会计科目,没有可援引的判例。理论在制度成型之前写出来,还有机会影响制度;成型之后再写,就只能做注释。〔推断〕这是我认为这本书现在写比五年后写更有价值的唯一理由——不是因为它更正确,而是因为它还来得及被用来反驳。

为什么现有经济学接不住这件事

不是因为经济学家没想过,是因为标准工具箱里的三件主力工具,每一件都在这里失去了前提。

价格理论的前提是供给受成本约束。标准的供给曲线建立在边际成本递增之上。当边际成本趋零,供给曲线塌成零位上的一条水平线,价格无法再由成本决定。信息品经济学处理过一次类似情形,它的解法是差别定价与版本化,而这套解法有一个隐含前提:消费者能自己判断这个版本值多少钱。判断商品的买方恰恰不能——他要是能判断,就不需要买判断了。

质量信号机制的前提是供给受产能约束。声誉、担保、口碑之所以有效,是因为一个卖坏了名声的供应商,重建产能需要时间和资本。判断服务的产能不受这个约束:换一个主体、换一个品牌、换一套封装,明天就能重新供货。惩罚力度被稀释,声誉机制的自我执行力随之下降。这就是为什么第八章要论证认证与保险不是可选项。

契约理论把责任放在法学里,价格理论里没有责任这个变量。而判断商品的价格,主要由责任落在谁身上决定——同一份分析报告,写成"供你参考"和写成"如出错我方赔付",是两个价格量级(第四章)。责任在标准价格模型里根本不是一个自变量,这是最大的缺口。

深入 · 与四种既有理论的分界

一门新学科最容易犯的错,是把邻居的地盘说成自己的发现。所以要先划界。

与信息经济学的分界:信息经济学处理"知道与不知道"的不对称;判断经济学处理"能验与不能验"的不对称。信息可以披露,验收能力披露不了。这个分界不是文字游戏:信息不对称的标准解法是强制披露与信号传递,而验收不对称对披露免疫——供应商把全部推理过程、全部训练数据、全部中间步骤都交给你,你还是验不了,因为你缺的不是材料,是"在你这门生意上判断对错"的能力。披露解决不了能力问题。

与劳动经济学的分界:劳动经济学以人为供给单位;判断经济学的供给单位是判断点,人只是它的载体之一——载体第一次出现了非人竞争者。这条分界带来一个具体后果:劳动经济学问"这个岗位值多少钱",判断经济学问"这个判断点值多少钱,以及由谁承载最划算"。同一个判断点,可以由人承载、由系统承载、或者拆成"系统出候选、人拍板"两段承载。岗位是这些承载方案的一个历史快照,不是分析的起点。

与交易成本经济学的分界:科斯问"为什么用组织不用市场";判断经济学问"判断在组织与市场之外出现第三种承载(智能体)后,前一个问题的答案如何改写"。科斯的二分建立在一个假设上:交易的两端都是能承担责任的主体。智能体打破了这个假设——它可以承载判断,但不能承担责任。于是出现一种新的混合形态:判断在市场上采购,责任仍留在组织内部。这种形态在原有二分法里没有位置。

与平台经济学的分界:平台经济学处理双边市场、网络外部性与跨边补贴,它的核心资产是匹配。判断经济学的核心资产是担责。这个差别决定了两者的商业模式方向相反:平台的法律设计是把责任推给交易两端,平台自己不为交易结果负责;判断经济学问的恰恰是责任向谁收敛。所以平台理论解释不了本书第四章 P-4 与 P-5 之间的价差——在纯平台框架里,那个价差不存在,因为平台永远停在阶梯的最下两档。

〔推断〕这四条分界如果有一条站不住,本书的独立性就要打折扣。其中我最没把握的是第一条:如果有人能论证"验收能力"本身可以被完整地信号化并交易,那么判断经济学就可以还原为信息经济学的一个特例。我认为做不到,理由在第一章的 E2 与第二章的性质一,但这是一条值得攻击的缝。

这本书打算怎么被证伪

一套理论如果没有死法,它就只是一种说法。本书的死法写在第十一章,这里先说清检验的逻辑。

全书从三条公理推出六条可检验主张(J1–J6)。这六条不是预测未来的口号,每一条都指定了检验方式与观测窗口:责任溢价是否跃迁、验收岗与执行岗的薪资是否走阔、不披露质量指标的市场价格是否向下收敛、判断保险与判断认证是否在五年内出现、判断资产的折旧是否分层。

整套理论的死法是这样一句话:如果市场长期停在 P-1 与 P-2 两档,且认证与保险始终不出现,那么 E2 的市场化通道不成立,本书退化为一份定价备忘录。它的公理可能仍然为真,但它不再是一门经济学,因为它推不出可观察的市场结构。

我认为这个概率不高,但它必须被写出来。作者不给自己的理论写死法,就是把可证伪性的成本转嫁给读者。

全书地图与阅读路径

十二章分五卷,各回答一个问题。

回答什么
一 · 地基00 序章 · 01 三条公理 · 02 判断作为商品这门经济学的对象是什么,凭什么成立
二 · 定价03 价值基本式 · 04 责任阶梯一次判断值多少钱,为什么责任深度决定价格量级
三 · 积累05 判断资产负债表 · 06 市场结构判断如何沉淀为资产,市场会长成什么形状
四 · 分配与制度07 分配 · 08 制度收益归谁,缺失的制度从哪里补
五 · 验证09 算例集 · 10 术语表 · 11 可检验主张与死法怎么算,怎么用词,怎么被证伪

这张表也是分工表:任何一章越出自己那一格,就是越界。第四章是本书最核心的原创,如果只读一章,读它。

谁该从哪一章读起:

反驳与回应

反驳一:这不是一门新经济学,是应用微观经济学的一个新题材。委托代理理论与不完全合同理论已经完整覆盖了"剩余风险由谁承担",责任阶梯不过是剩余控制权的分档表述。用既有工具就能推完,何必另起炉灶。

回应:这条反驳的前半段我接受,工具确实是既有的,本书没有发明新的分析技术。但不完全合同理论有一个贯穿性的假设:缔约各方都是能承担责任的法律主体,所以剩余控制权配给谁,剩余风险就跟到谁那里。判断经济学的核心情形恰恰打破了这个绑定——控制权可以配置给智能体,风险不能。智能体不是法律主体,它不会疼。控制权与风险的这次分离,是既有框架没有处理过的情形,而它正是本书全部结论的来源。另外一点分工上的差别:契约理论关心的是激励与投资,本书关心的是价格。同一个现象可以从两边看。〔推断〕如果有人用不完全合同的工具把责任阶梯重新推导一遍,并得到比本书更强的结果,我认为那是这本书最好的下场。

反驳二:判断的边际生产成本并没有趋零。推理是要花钱的,长上下文很贵,多步推理的单位成本在上升而不是下降。E1 建立在一个正在被推翻的技术快照上,整本书的地基是流沙。

回应:这条比上一条更难接。先把话说准:E1 说的是相对于失误后果与判断经济价值的趋零,不是绝对零。一次授信判断的失误后果如果是两百万,那么哪怕单次推理成本是二十元,相对量级仍然是趋零的。真正的威胁不在绝对成本,而在成本曲线的方向——如果高阶推理的单位成本长期稳定在与人类专家可比的量级,E1 就弱化,本书由"生产成本压力"推出的部分论证要重写(责任阶梯本身不受影响,因为它由 E2 推出,不由 E1 推出)。〔需确认〕这条我目前没有可靠的长期成本数据,只能标出验证方式:跟踪同一质量水平的判断任务,其单位成本随模型代际的变化。这一条已写入第十一章的死法条款。

与兄弟体系的接口

本书属于一个更大的体系,边界要说清楚。

智能密度体系提供计量单位:判断点(做错了有人担责的事)、验证时点、验收带宽、L1–L5 判断让渡刻度。本书直接引用,不改定义。这里做一次贯穿全书的声明:L 刻度度量的是让渡深度(人把多少判断交出去),本书第四章的 P 档度量的是责任深度(做错了谁赔)。两者相关,但不可换算,也不可互相替代——一个组织完全可能在很深的让渡下仍然只买到最低档的责任承诺,这正是当前市场的常态。全书不混用这两把尺子。

认知工程派提供质量度量(判断一致率、复现率、边界失效率)与折旧判据(抗吞噬四问)。本书把三指标当作"质量计价的前提"引用。

智能体的社会科学提供责任不变量:责任只能由人承担(A2)。这是第一章 E2 后半句的地基,本书不重新论证它,只做经济学翻译。

智能体管理学(AMS)负责组织内的治理、岗位与变革。凡是涉及"公司内部该怎么改"的问题,本书点到为止并路由过去,不展开。

本书只负责一件事:价格。

本章小结

  1. 判断的价格从来藏在工资、license 与 Token 账单里,智能体第一次让它可以被单独交付,因而必须被单独定价。
  2. 现有经济学接不住这件事,不是因为没想过,而是因为它的三件主力工具在此处同时失去前提:成本约束、产能约束、责任主体假设。
  3. 三处错价已经显形——买方按人头估值、卖方按 Token 计费、制度没有定损框架——它们互相加固,把市场锁在低价值区间。
  4. 本书的死法已经写好:若市场长期停在最低两档且认证与保险不出现,它退化为一份备忘录。
  5. 如果你今天只做一件事:把手头正在谈的那份 AI 合同翻到验收那一栏,看看是不是空的。是空的,就从第三章开始读。
第 01 章

三条公理

本章要点

三条公理

一家做跨境电商的公司要把 AI 推进到运营部门。技术不是问题,系统跑得很好,建议一条一条生成出来,要多少有多少。推不动的是人。业务部门负责人的原话是:

"业务部门是最难推进,因为他说,我店铺业绩掉了,谁来负责?你给我负责还是谁负责?"

〔已知:来自一次真实的企业内部讨论记录〕

这句话把这本书的两条主干同时摆上了桌面。建议的产量已经不受限制——这是 E1。但没有人肯站到建议的后面去——这是 E2。系统一秒钟能生成一百条选品建议,而"这一百条里哪一条适合我们这家店"要有人看,"看错了谁扣钱"要有人认。前一件事的成本塌到了零,后两件事的成本一分没少。

这不是一家公司的特殊情况。同一句话,在不同规模、不同行业的企业里被不同的人说出来,措辞几乎一样。〔推断:至少在三家不同行业的企业里出现过同构的抵制,跨行业一致意味着它更像结构性现象而非管理水平问题〕组织内部为什么会卡在这里、怎么解,是第四章的题目。这一章只做一件事:把这个现象背后的三条公理写清楚,并且写清楚它们各自在什么条件下会失效。

三条公理的分工是这样的。E1 是事实陈述,它说明了为什么问题在今天出现。E2 是结构判断,它是全书的发动机,后面每一章的推论都从它出来。E3 是锚,它不产生推论,只负责拦住一类论证。

E1 · 驱动公理:判断的边际生产成本趋零

这是被反复亲历过的事实:把一套评审标准封装进智能体,第 1 次调用与第 100 万次调用的成本几乎没有差别。高一次性固定成本、近零边际成本——这条成本曲线在软件与内容行业出现过,但这一次它第一次发生在判断这个品类上:选择、评估、诊断、定价、放行。人类经济史上,判断的稀缺性从来由生物学保证(一个人一天只能认真做那么多判断),现在这道天然闸门拆掉了。

为什么它成立。判断在被封装之前,附着在人身上。人的判断产能有三重硬约束:清醒时间、注意力衰减、以及最要命的一条——不可复制。一位做了二十年的资深审校,他的判断能力不能拷贝给第二个人,只能通过带徒弟的方式以年为单位传递,且必然失真。封装改变的正是最后这一条:判断一旦被写成可执行的形式,复制成本就归零了。前两条约束还在,但它们约束的对象从"做判断"变成了"验判断"——这就是 E2 要处理的事。

它的边界在哪。三条,必须说明白。

第一,E1 说的是边际,不是总成本。把一个判断点真正封装好,前期成本很高:整理判例、写清偏好、建评测集、划定边界。这部分是固定成本,而且它恰恰不趋零,还随着判断的复杂度上升。所以 E1 描述的是一条高固定成本、低边际成本的曲线,不是一条全程廉价的曲线。这个结构在第五章会重新出现,作为判断资产的形成机制。

第二,E1 说的是相对趋零,不是绝对零。多步推理是要花钱的,长上下文更贵。准确的表述是:单次判断的生产成本,相对于这个判断的失误后果,趋于可忽略。一次授信放行的失误后果是两百万,那么二十元的推理成本在量级上就是零。反过来,如果一个判断的失误后果本来就只有几十元,E1 对它不成立,但那种判断本来也不值得进入本书的讨论范围(第三章会说明为什么)。

第三,也是最需要盯住的一条:成本曲线的方向可能反转。〔需确认〕当前高阶推理的单位成本是升是降,我没有可靠的长期数据。验证方式是跟踪同一质量水平的判断任务,其单位成本随模型代际的变化。这条已写入第十一章。

如果 E1 错了会怎样。如果判断的边际生产成本长期与人类专家可比,本书大部分的紧迫性消失。市场会像过去处理专业服务那样处理判断——按人天计费,按资历分级,跟律师和会计师一个模式。第四章的责任阶梯依然成立,因为它是从 E2 推出来的,但它会从"定价压力的解药"降格为"一张分类表"。整本书不会全错,会变薄。

E2 · 不对称公理:判断可复制,验收与担责不可复制

发动机在这里。判断的生产可以无限复制,但两样东西复制不了:

这两句话看上去像是断言,其实各有可以拆开的机制。E2 是全书的发动机,值得把发动机拆开看。

验收为什么不可复制

三个理由,一个比一个深。

第一,验收消耗注意力,注意力不可复制。这是最表层但最硬的一条。一份判断要被验收,必须有人真的把它读进去。读的速度有生理上限,且这个上限不随模型变强而提高。更糟的是它反向变化:模型越强,输出越像对的,看出问题所需的注意力单价越高。二十年前一份漏洞百出的方案,三十秒就能看出不对;今天一份九成正确的方案,要一个小时才能找出那关键的一成。验收是整个链条里唯一随着 AI 变强而变难的环节(智能密度体系的观察)。

第二,验收需要立场,立场不可外购。验收不是问"这段话逻辑通不通",是问"这个判断在我们这门生意上对不对"。后者要求验收者对结果有利害关系。一个没有利害的评审者,会倾向于接受一切看起来合理的东西——因为拒绝要付出成本,接受不用。模型没有利害关系,外部专家有专业能力但没有你的利害。所以验收的稀缺不是能力稀缺,是立场稀缺。这一点决定了验收不能通过采购获得:你可以买到一个更懂技术的人,买不到一个"这件事搞砸了他也会疼"的人。

第三,验收消耗责任额度,而责任额度是有限且不可转让的。这是最容易被忽略的一条,也是我认为最关键的一条。在验收上签字的人,花的不是时间,是自己的信用。一个人在一个组织里能签的字是有限的——不是体力上限,是信用上限。签错三次,这个人以后签的字就不值钱了,他的意见会被自动打折。所以验收带宽的真实分母不是人天,是可动用的责任额度

这条推论有一个可以立刻观察的后果:多招人来做验收,通常无效。〔推断〕新招的人有时间,有专业能力,但没有额度——他签的字在组织内不产生效力,最后还是要送到那两三个人面前。这解释了一个反复出现的现象:企业同时开五个 AI 场景,比只开一个更慢,因为分母是同一批人的同一份额度。第七章会把这条推到分配层面。

担责为什么不可复制

也是三条,但性质完全不同——前一组是认知约束,这一组是制度与统计约束。

第一,担责需要法律主体。智能体不是法律主体。它不能被起诉,不能被罚,不能被吊销执照,不会因为判错而失去任何它在乎的东西——因为它不在乎任何东西。法律的整套惩罚机制建立在"可以被剥夺某样东西"之上,而智能体没有可被剥夺物。这不是技术不成熟,是法律主体资格的构造问题。责任必须最终落在一个自然人或法人身上,中间可以有多少层安排,链条的末端只有这两种东西。

第二,担责需要资本金。承诺赔付的前提是有钱赔。赔付能力受资产负债表约束,而资产负债表不能靠复制扩张。这是一个量级问题:一家公司可以在一天之内把判断产能扩大一千倍,不可能在一天之内把赔付能力扩大一千倍。这条是第四章 P-5 档几乎不存在的直接原因——爬到那一档需要的不是更强的模型,是更厚的资本金和一份保单。

第三,判断错误是相关的,而相关风险不能靠池化消化。这一条值得单独强调。传统责任险之所以可行,是因为损失近似独立:一百个医生不会在同一天对同一类病人犯同一个错。判断服务反过来——同一个模型,在同一天,对同一类输入,会犯同一个错。一百个客户的损失同时发生。相关风险不能靠大数定律摊平,只能靠资本金硬扛或者向再保险层层转出,而再保险市场的容量是有限的。〔推断〕这使得"把担责做成一个可无限扩张的金融产品"的难度,远高于传统责任险。它也是我对 J4(五年内出现判断保险)持中等而非高置信度的原因。

稀缺性的第三次迁移

于是稀缺性完成第三次迁移:执行稀缺(工业时代)→ 信息稀缺(互联网时代)→ 判断稀缺(AI 早期)→ 终局稀缺 = 验收与担责。生成越丰沛,验收越昂贵——这是互补品升值的标准逻辑:一种要素的价格趋零,其不可替代的互补品价格上升。

把这条迁移展开成一张表,因为它是全书的时间轴。

阶段变得丰沛的于是稀缺的利润迁移到哪
工业时代原料、标准件执行(产能、工时)产能与规模
互联网时代执行(渠道、复制)信息(匹配、注意力)流量与匹配
AI 早期信息判断(选择、评估、放行)判断本身
终局判断验收带宽与责任承载谁能验、谁敢赔

这张表在说什么。每一行的逻辑是同一条:一种要素的价格趋零,利润就迁移到它的不可替代互补品上。这不是新机制,是经济学里反复出现的老机制——马鞍的价格随汽车普及而崩,不是因为马鞍变差了,是因为它的互补品换了。这一轮的特殊之处只在于,最后一行的互补品是"人的一种特定注意力"和"人的赔付能力",这两样东西第一次成为整个经济体的瓶颈要素。

怎么用这张表。它的用途是定位:找出你所在的行业当前处在哪一行,然后把资源投到下一行的那一列。判断已经在被商品化的行业里,把钱投在"更强的生成"上,是在给已经趋零的东西加码。

它什么时候会失效。最后一行有一个明确的失效条件:如果法律体系承认某种非人主体可以独立承担责任(历史上曾经出现过法人这种制度发明),那么"担责不可复制"就要重写,整张表的最后一行要换。〔需确认〕我不认为这会在短期发生,但这不是一个可以排除的可能性,它是本书最大的单点风险。

E2 的边界

三条。

一,E2 不适用于失误后果为零的产出。没有后果就没有验收需求,也没有担责需求。生成一万张配图不产生 E2 意义上的不对称——它可能产生注意力价值,但那属于另一门经济学(第十一章的边界条款)。

二,E2 在"验证时点极短且金标准客观存在"的领域最弱。代码能不能编译,单元测试过不过,影像有没有病理金标准——这些领域的验收可以大幅自动化,不对称收窄。这不是 E2 的反例,是 E2 的强度分布。它还解释了第八章的一个预测:认证与保险最先出现在这些行业不是巧合,不对称越窄,越容易制度化。

三,E2 说的是"不可复制",不是"不可增长"。验收能力可以培养,只是周期以年计,且不能通过一次采购瞬时获得。这个区别很重要:E2 不是一条悲观的话,它是一条关于时间尺度的话——生产端以月为单位改进,验收端以年为单位改进,两条曲线的斜率差就是全书讨论的那个缺口。

如果 E2 错了会怎样

E2 是全书唯一一条错了就全盘作废的公理。

如果验收可以被复制——出现一种系统,能对"在你这门生意上对不对"给出等价判断,并且对这个判断承担后果——那么:判断服务的价格会向边际生产成本收敛;责任阶梯的档间价差会消失;第三章到第八章全部作废;本书只剩第一章,作为一个被证伪的假设保留。

检验信号在第十一章,最直接的一个是 J1:如果同一领域内,"给建议"与"做决定"两类服务的合同价差在三年内收敛到两倍以内,E2 的市场化通道就出了问题。价差消失比任何论证都有力。

E3 · 不变量公理:价值的底层结构不变

"某人、在某场景、付出某成本、换取某结果"是跨时代常量(引认知工程派公理③)。判断经济学不发明新的价值定义,它做的只是:当"结果"里的判断成分第一次可以被单独剥出来交易时,为这个成分建立定价——变的是可交易的单元,不变的是交易的语法

为什么它成立。坦白说,E3 接近一个定义性的陈述,因此它几乎不可证伪。我把它写成公理而不是结论,就是承认这一点。它成立是因为这四个槽位穷尽了交易的构成:拿掉"某人",没有主体;拿掉"某场景",价值无法比较;拿掉"某成本",不构成交换;拿掉"某结果",没有支付理由。五千年里,从以物易物到注意力经济,填进这四个槽位的东西换了无数轮,槽位本身没有增减。

它的边界。E3 是三条里最弱的一条,因为它不承担推论。它只承担一个功能:约束前两条。任何从 E1 或 E2 推出的结论,如果需要否定"某人在某场景为某结果付出某成本",那个结论就是错的,要退回去重推。它是一道防护栏,不是一台发动机。

如果 E3 错了会怎样。如果出现一种非交易的价值产生方式,本书的整个定价框架不适用——注意,是不适用,不是被证伪。理论会退到一个更小的适用域里继续成立,就像牛顿力学在低速下继续成立一样。这是三条公理里唯一一条失效后不导致全盘作废的。

深入 · 四个常见反驳与回应

四条都按最强版本写。第二条我只接得住一半,会说明接不住的是哪一半。

反驳一(能力论):模型很快也能验收。把最强的模型当裁判,配上评测集与规则,裁判结论与人类专家的一致率在多个基准上已经很高,而且裁判成本随模型代际下降。你说的验收不可复制,只是当前工程水平的一张快照,三年后这条公理会显得很奇怪。

回应:要把两件事分开。裁判可以验一致性——同一输入多次输出是否稳定、是否符合已经写下来的规则——这部分确实可复制,而且应该复制,这正是三指标(认知工程派的判断一致率、复现率、边界失效率)能被测量的原因。裁判不能验的是:这条规则在我们这门生意上是不是对的。因为规则本身来自判例,判例来自真实结果,真实结果来自现实世界。裁判只能在给定判据下工作,判据从哪来是外生的。还有一个更技术性的问题:裁判与被裁判者共享同一先验,误差是相关的——同一个盲区两边都有,一致率高恰恰可能是盲区一致的表现。最后一层,也是最根本的:即使裁判判对了,它也不承担判错的后果。验收的产物不只是一个结论,还是一次签字,签字必须有人签。这条我接得住。但要承认它的强度分布:在金标准客观存在的领域,验收确实可以大幅自动化,E2 在那里最弱。

反驳二(制度论):责任可以保险化,所以也能复制。有限责任公司这个制度发明,本身就是把责任规模化的结果;巨灾债券把地震风险卖给了资本市场;职业责任险已经给医生和律师的判断风险定价几十年了。没有理由认为 AI 判断风险不能走同一条路。一旦承保,担责就变成了一个可以扩张的金融产品,E2 的后半句就垮了。

回应:先说接得住的一半。保险转移的是赔付,不是担责。保险公司恰恰要求被保方先证明验收在跑——这是免赔条款、共保比例、事故率浮动费率的全部内容。换句话说,保险化的前提是验收在跑,它加固而不是削弱了 E2 的前半句。

接不住的一半在这里,我直说。如果判断风险能被证券化,担责的资本约束确实会松动,E2 的后半句要修正。我在上文给出了我认为它做不到的理由——错误相关性使风险不可池化——但这个理由是一条推断,不是一条已被检验的结论。〔需确认〕如果有人做出了能处理相关风险的判断保险产品(比如按模型版本切分风险池、按边界条件设计触发器),那么"担责不可复制"就要降格为"担责的复制成本很高"。这不是全盘作废,但会显著改变第四章 P-5 档的可达性和第八章的时间表。这条写在第十一章的死法条款里,也是 J4 的检验点。

反驳三(历史论):AI 时代价值结构会变。每一次通用技术革命,都有人说旧结构不变,结果都变了。农业社会的价值锚是土地,工业社会是资本,信息社会是注意力——每一次都有人讲"交易的本质从来没变",每一次那句话在事后都显得很浅。凭什么这一次不变。

回应:锚在变,语法没变。土地、资本、注意力,都是在"成本"和"结果"这两个槽位里换过的填充物,而不是槽位本身的增减。五千年里从"以物易物"到"注意力经济",交易的语法(谁、场景、成本、结果)从未变过,变的都是词汇。我不排除它会变,但主张它变的人负举证责任:请给出一个价值产生过程,其中至少一个槽位是空的。到目前为止我没有见过。这条公理的作用是防守性的,它不产生新结论,只拒绝一类论证——那类以"一切都不一样了"开头、然后跳过论证直接下结论的论证。

反驳四(逻辑论):E2 是同义反复。你把不可复制的那部分命名为"验收与担责",然后宣称验收与担责不可复制。这是循环定义。任何反例出现时,你都可以说"那部分被复制的不算真正的验收"。一个不可能错的命题不是公理,是话术。

回应:这是四条里最该被接住的一条,因为它攻击的是资格问题。E2 要不是同义反复,就必须给出独立于定义的、可观测的后果。它给出了四个:

  1. 价格结构:责任深度相同、判断质量相同的两个服务,价格应当接近;责任深度差一档,价格应当出现非线性跃迁。检验方式是同领域合同抽样,看"给建议"与"做决定"两类的价差是否达到五倍量级(J1)。
  2. 工资结构:验收密集型岗位的薪资增速,应当持续高于执行密集型岗位。检验方式是招聘数据的三年面板(J2)。
  3. 市场收敛:不披露质量指标的判断服务市场,价格应当向最低档收敛而不是分层。检验方式是价格的纵向追踪(J3)。
  4. 成本结构:企业 AI 部署中,验收与复核的人力成本占比,应当随部署规模扩大而上升,而不是被摊薄。〔需确认〕这一条目前没有面板数据,是我最想看到有人去测的一条。

四条里任何一条被证伪,E2 就要改;四条全被证伪,本书作废。定义可以任意写,可观测后果不能。这就是同义反复与公理的区别。

与兄弟体系的接口

智能密度体系是本章计量概念的真相源。按智能密度体系的定义,判断点是"做错了有人担责的事";验证时点、验收带宽、L1–L5 判断让渡刻度同样归属于该体系。本书直接引用,不改定义,也不在本书里重新论证它们。

这里重复一次全书纪律:L 刻度度量让渡深度(人把多少判断交出去),P 档度量责任深度(做错了谁赔)。两者相关但不可换算。本章的 E2 是 P 档的来源,不是 L 刻度的来源——把 E2 读成"不要让渡"是误读,E2 说的是让渡之后价格该怎么定。

智能体的社会科学提供 A2:责任只能由人承担。这是 E2 后半句的地基。本书不重新论证 A2,只做经济学翻译:责任是唯一无法规模化的生产要素。

认知工程派提供三指标。三指标是 E2 前半句里"可被测量"的那一部分——它测的是一致性,不是正确性。这个区分是反驳一的核心,也是第四章"没有评测就没有溢价"的依据。

智能体管理学(AMS)负责组织内部谁来验收、谁来担责的治理设计。本章引子里那句"业绩掉了谁负责",其组织解法不在本书,路由至 AMS 与本书第四章的责任分配部分。

本章小结

  1. E1 说明了问题为什么在今天出现:判断的边际生产成本趋零,判断稀缺性的生物学闸门被拆掉了。
  2. E2 是全书发动机,它的可拆解机制是五条:验收受限于注意力、立场、责任额度;担责受限于法律主体、资本金,并且判断错误的相关性使它难以池化。
  3. 稀缺性完成第三次迁移,终局稀缺是验收带宽与责任承载——利润会迁移到"谁能验、谁敢赔"这两个位置。
  4. E3 不产生推论,只拦住一类论证:凡是需要否定"某人在某场景为某结果付出某成本"的结论,都要退回重推。
  5. E2 若要不是同义反复,就必须靠四条可观测后果活着——价格跃迁、工资走阔、市场收敛、验收成本占比上升。现在就可以去测第四条,它是四条里最容易做、也最没人做的一条。
第 02 章

判断作为商品:四个反常性质

一家公司买了一套 AI 合同审查服务,用了七个月。

续约会上,采购负责人问了一个很自然的问题:这七个月它帮我们避免了多少风险?

没有人答得上来。

法务说,它标出来的问题条款我们大部分都同意,但那些条款以前也会被人看出来;至于它漏掉的——我们不知道它漏了什么,因为没漏掉的那部分才是我们看到的。有人提议抽查一批合同人工复核一遍做对照,被否了:复核一份重要合同要两个小时,抽三十份就是六十个工时,这笔钱比一年的服务费还贵。

最后续约的理由是:大家用着觉得还行,而且不续显得倒退。

这不是一次糟糕的采购决策,这是一次典型的采购决策。它之所以典型,是因为判断这种商品有四个反常性质,每一个都推翻一条标准的市场假设。上面这一幕里,四个性质全都出场了。

性质一 · 信任品:买的时候验不了,用了之后也未必验得了

经济学把商品按可验性分三类。搜索品买前就能验——一个苹果新不新鲜,看一眼摸一下就知道。经验品用后能验——一家餐馆好不好吃,吃过就有判断。信任品用后也难验——一台手术做得好不好,多数病人一辈子都不会真正知道,因为没有对照组。

判断天然是信任品。

它的可验性由一个变量决定,智能密度体系称之为验证时点:这个判断的对错,多久之后、通过什么渠道能知道?

验证时点例子接近哪类商品
秒到分钟生成的代码能不能跑通接近经验品
天到周投放素材的点击率高不高弱经验品
月到年这批货选得对不对重度信任品
数年或永不这个战略方向对不对;那份合同的风险条款有没有用不可验

上面那家公司的困境全在这张表里:合同审查的验证时点是"出事的时候",而没出事既可能是审查有效,也可能是本来就不会出事。没有反事实,就没有验收。

这条性质有一个直接的市场后果〔推断〕信任品市场不装认证和保险就会柠檬化。 买方无法分辨好坏时,只愿意按平均质量付钱;高质量的供应商拿不到应有的溢价,于是退出或降质;平均质量下滑,买方进一步压价。这个下行螺旋不是道德问题,是结构宿命。经典的解法是第三方认证与责任担保——这也正是第八章要处理的题目。

性质二 · 验收不对称:生产免费,验收昂贵

普通商品的质检成本远低于生产成本。造一台发动机要几万元,检验它要几百元。

判断商品刚好倒过来。

生成一百个方案是免费的;从中挑出适合你处境的那一个,需要一位资深者的注意力——而资深者的注意力是这本书里唯一没有变便宜的东西。上面那家公司算过账:复核三十份合同要六十个工时,比一年的服务费还贵。他们没算错。

更麻烦的是,AI 越强,验收越难。这一点反直觉,但机制很清楚:早期的模型出错时错得很明显,一眼能看出来;今天的模型出错时错得非常合理——引用格式完整、逻辑通顺、术语准确,只是结论是错的。验收从"找出明显的破绽"变成了"独立地把这件事再想一遍",成本因此接近于自己做一遍。

智能密度体系有一句话说得更狠:验收是唯一随 AI 变强而变难的环节〔推断——机制清楚,但缺乏跨行业的量化证据〕。

价格的下限由此从生产成本切换到验收成本。
一个无人能验收的判断,无论生产多么便宜,它的真实成本都是无穷大——因为你无法知道它什么时候会毁掉你。

这条性质推出第三章的净价值式:V 减去验收成本,才是这笔交易真正剩下的东西。它也解释了为什么很多"看起来划算"的 AI 采购算下来是负的。

性质三 · 外部性内生:错误落在交易之外

错误判断的后果,经常不落在买卖双方身上。

AI 信贷模型拒绝了一笔贷款,受损的是申请人;AI 诊断给出错误结论,受损的是病人;AI 内容审核误删了一条内容,受损的是发布者。而合同只约束签约的两方。

传统商品当然也有外部性——工厂排污、汽车尾气——但那些外部性通常是生产过程的副产品,可以通过治理生产环节来内部化。判断商品的外部性不一样:它是产品本身的功能所在。判断服务的用途就是对第三方做出处置,外部性不是副作用,是主作用。

法学上把这称为责任缺口(这个题目属于《智能体的社会科学》,本书不展开)。经济学的表述是:判断交易天然产生第三方外部性,而市场自身不会为它定价。

结论是:判断市场比一般市场更早、更必然地需要制度介入。这不是一个价值判断,是一个结构判断——即使所有参与者都完全善意、完全理性,这个外部性也不会自己消失,因为承受后果的人不在谈判桌上。

性质四 · 使用即生产:买方用得越多,卖方资产越厚

你每次使用判断服务,你的使用行为都在改进它。哪些建议被采纳、哪些被否决、否决之后人改成了什么——这些都是极有价值的信息,而它们产生于买方的消费过程。

买方的消费行为同时是卖方的生产行为。

传统商品里不存在这件事:你吃苹果不会让果园变好。判断商品里它是默认配置,通常被称作数据飞轮。

它带来一个悬而未决的产权问题:这部分增值归谁?

今天的默认答案是"全部归卖方,且写在几十页服务条款的某一段里"。这个答案有一个明显的不稳定之处:买方支付了服务费,同时无偿提供了让服务变好的生产资料,而变好之后的服务将以更高的价格卖给包括他的竞争对手在内的所有人。第八章会论证这个默认答案不可持续,第五章会先说清这份增值在账面上到底叫什么(判例料与偏好料)。

一件更反常的事:验收根本没被写进合同

四个性质摆在一起,会推出一个很自然的预期:既然验收这么关键、这么昂贵、这么难,那么真实合同里一定会有一整套关于验收的条款——什么算合格、谁来判定、用什么指标、不合格怎么办。

真实情况是没有。

我复盘过一桩谈到报价阶段的采购:买方是一家年营收六亿的装备制造企业,卖方是一家做企业 AI 落地的服务商,首年金额三十到五十万,双方谈了行业趋势、技术路线、推进阶段、长期合作规模,价格谈得相当细。整份方案里没有任何一条写明什么算成效、谁来判断、用什么指标〔已知〕

另一场硬件合作洽谈进行了一个半小时,从场景聊到愿景,事后复盘时发现"连样品怎么收费都没定"〔转述〕。

这不是个别的疏漏。它说明了一件比疏漏严重得多的事:

验收不仅"不可复制",在今天的市场上它甚至不被定价、不被书写。
定价谈得越细、验收越空白,说明这个市场还停留在"按投入付费",而不是"按判断付费"。

这个空白是本书识别出的最大制度缺口。它同时是三件事的来源:第八章关于评测集为何迟迟没有形成市场的分析;第十一章新增的主张 J7;以及第九章那桩真实交易的完整拆解——那一章的标题就叫"一桩真实的判断交易,以及它缺失的那一页"。

深入 · 判断商品与四种传统商品对照

商品买前可验?边际成本外部性使用是否生产
苹果(搜索品)
餐馆(经验品)否 / 用后可
软件(信息品)部分趋零弱(反馈)
手术(信任品)
判断(本书)否,且用后未必可验趋零内生第三方是(飞轮)

把这张表读一遍就会发现:判断把四类商品各自最难处理的那一面全部集齐了。可验性最差的一面来自信任品,边际成本结构最极端的一面来自信息品,外部性最深的一面是它自己独有的,而"使用即生产"在其他四类里几乎不存在。

这就是为什么判断市场不装认证与保险就必然柠檬化——也是为什么装上之后,利润会比任何一类都厚。四个最坏的性质集于一身,意味着谁能把它们逐个制度化,谁就同时拥有了四道别人跨不过去的门槛。

反驳与回应

反驳一:手术、法律咨询、审计——信任品市场早就存在,也运转得不错。判断有什么特别的?为什么需要一门新经济学,而不是把现成的专业服务经济学搬过来用?

这条反驳很强,我承认现成的框架能解释一大半。差别在两个地方。

第一是边际成本。外科医生做第二台手术要花和第一台一样的时间,这个约束限制了供给,也因此支撑了价格。判断的第二次交付成本接近零,这意味着供给可以瞬间放大到无限,价格无法再靠稀缺性支撑——只能靠责任支撑。传统专业服务经济学里,稀缺与责任是捆在一起的(能担责的人本来就少);在这里它们被拆开了。

第二是责任主体。医生、律师、会计师有执业资格、有强制保险、有行业惩戒、有可被吊销的东西。一个 AI 系统什么都没有,它不能被吊销执照,不能被追究,不能破产。当代理人无法承担责任时,责任不会消失,它会回流到某个具体的人身上或者悬空——第四章的 L3 陷阱处理的就是这个回流与悬空。

所以准确的说法是:本书不是要取代专业服务经济学,是要处理它的两个前提被拆掉之后剩下的问题。

反驳二:这四条性质有拼凑感。它们来自不同传统,被硬放在一起是为了让理论看起来完整。

如果它们只是并列,这条反驳成立。但它们不是并列,是有结构的:性质一决定了这是个什么市场,性质二决定了价格的下限,性质三决定了必须有制度介入,性质四决定了资产在谁手里积累。 分别对应本书的第八章、第三章、第八章与第五章。

更重要的是,四条共享同一个源头。它们都是 E2 的推论:判断可复制、验收与担责不可复制。可复制推出边际成本趋零(性质四的飞轮由此可能);不可复制推出验收昂贵(性质二)与责任无法随判断一起转移(性质三);而两者的落差正是验证时点被拉长的原因(性质一)。如果 E2 是错的,四条会一起垮,而不是垮掉其中一两条。 这种连带性正是可证伪性的表现,不是拼凑的表现。

与兄弟体系的接口

验证时点这个概念来自智能密度体系,本书直接引用,用它给信任品的严重程度分级。

三指标(判断一致率、复现率、边界失效率)来自认知工程派,是"如何降低验收成本"这个问题的工程答案,本书在第四章把它当作定价资格的判据。

责任缺口的制度与伦理后果属于《智能体的社会科学》;本章只到"市场不会自己为外部性定价"为止,再往前一步就越界了。

本章小结

  1. 判断是信任品,且其可验性由验证时点决定。验证时点越远,市场越依赖制度而非价格来运转。
  2. 价格的下限由验收成本决定,不由生产成本决定。AI 越强,验收越难——这是唯一逆向变化的成本项。
  3. 错误落在第三方,且这是产品的主功能而非副作用。所以制度介入是结构必然,不是政策偏好。
  4. 使用即生产,买方在无偿供给卖方的核心资产。产权归属问题悬而未决。
  5. 四个性质集于一身,是判断市场今天混乱的根源,也是它一旦被制度化后利润极厚的原因。而在今天,最该被写进合同的验收条款,恰恰是被写得最少的那一页。
第 03 章

价值基本式

本章要点

价值基本式

一家德资背景的机械装备企业,年营收六亿,在细分品类里排前三,内部的 AI 能力接近于零。它要买一套判断服务:让智能体接手一部分技术方案的初筛与报价校验。双方谈了两场,四个多小时。场景聊透了,愿景聊透了,气氛很好。

价格是这样定下来的。卖方问:你们今年这一块的预算大概多少。买方报了一个区间。卖方回去把方案拆成三段——三万元的入门培训,首年三十到五十万的平台加陪跑,往后三到五年每年五十到三百万的深度合作。正式报价发过去,五十万。

整个过程里,没有人问过这三个问题:这套系统接手的判断,做错一次损失多少钱;现在人做这件事的错误率是多少,系统是多少;一年做多少次。

这不是一次草率的交易。双方都很专业,谈判也充分。真实的情况是:市场目前没有一条给判断定价的算式,于是它借用了别的算式——借用软件的算式(按人头、按模块)、借用咨询的算式(按人天)、借用流量的算式(按 Token)。这一章给出那条缺失的算式,同时坦率地说明:写下它的时候,它还没有被任何一场真实交易用过。

公式本体:它测的是差值,不是能力

一个判断点("做错了有人担责的事",计量单位引自智能密度体系)被委托给智能体,其经济价值的上限是:

V = 失误后果 × (人的错误率 − 系统的错误率) × 频次 净价值 = V − 验收成本 − 责任承载成本

先说这条式子在做什么。它不测量判断"有多聪明",它测量判断被替换之后,这门生意一年少赔了多少钱。这是差值定价,不是能力定价。市面上大部分 AI 定价的错误都发生在这一步:把能力当价值卖。能力再强,如果原来的人做这件事本来就不怎么出错,或者出了错也没人赔钱,替换它就不产生一分钱的判断价值。

三条直接推论:

  1. 后果为零的判断没有价值。它是"动作"不是"判断"(做错了没人担责),进不了智能密度的分母,也进不了价格。生成一万张配图不产生判断价值——它可能产生注意力价值,但那是另一门经济学,本书不管(见第十一章的边界声明)。
  2. 错误率之差不可知时,V 不可计算,该判断不可市场化交易。验证时点为"不可知"的判断(品牌定位、组织文化取舍),只能以信任品制度承载:声誉、关系、长约。这类判断按次计价的报价都是伪定价——不是因为它不值钱,是因为它的值钱程度无法在交易时被双方确认。
  3. 验收成本是价格的地板。当 V 低于买方自建验收的成本,交易不如不发生。这解释了大量"AI 项目账面省钱、实际更忙"的负密度现象:省下的生产成本是显性的,多出的核对成本是隐性的,而财务报表只记显性的那一半。

公式里四个因子,三个属于买方(后果、频次、人的错误率),只有一个属于卖方(系统的错误率)。这解释了一件让很多供应商困惑的事:判断服务的价值主要由买方的处境决定,不由卖方的技术水平决定。同一套系统卖给两家公司,V 可以差两个数量级。定价谈判的第一步不是介绍技术,是把买方的这三个数问出来。

因子一 · 失误后果:怎么测、测不到怎么办、最容易错在哪

怎么测。三种可用的测法,按可靠性排序。

测不到怎么办。用序数法:不问"值多少钱",只问"这几个判断里最不能错的是哪个"。把二十个判断点排一个序,把 V 公式当排序工具而不是估值工具。它照样能回答最要紧的那个问题——先动哪一个。这一步降级是本书允许的:一个只在数据齐全时才成立的公式,在现实里等于不成立。

最容易错在哪。三个位置。

第一,把平均后果当期望后果。一类错误九十九次都只损失几百元,第一百次损失两百万,用均值算出来的 V 会低估到没法看。判断错误的损失分布是重尾的,尾巴决定价值。

第二,把声誉损失记为零。因为它开不出发票,所以在多数企业的估算里它等于不存在。它不等于不存在,只是暂时不可计量——正确的处理是标注为"未计入",而不是默认为零。这两者在谈判桌上的差别很大。

第三,把后果算在错误的主体身上。判断错误的后果常常落在交易之外的第三方(第二章的性质三)。买方算 V 的时候只会算落在自己身上的那部分,于是系统性低估。这不是买方不老实,是外部性本来就不进他的账本。制度补这个缺口的方式见第八章。

〔已知〕后果的可计量性差异极大:金融风控与合同审查的失误后果有现成的账,营销创意与组织决策的失误后果几乎没有账。这不是估算精度问题,是可归因性问题。

因子二 · 错误率差:整条公式最容易被算反的地方

这是四个因子里最危险的一个。危险在于它是个差值,而人们习惯只看被减数的那一半。

很多人误以为"系统错误率低"就等于有价值。不对。有价值的前提是差值为正,而且正得足够多。这里有三种常见情形,其中两种不该做。

情形一,差值为负:系统比人还差。这在实践中比想象的常见,尤其在依赖隐性上下文的判断上。一家做跨境电商的公司上过一套退货原因归类系统:客服凭经验分类的错误率约百分之二,模型在长尾品类上超过百分之八。差值是负六个百分点。这个判断点不该买,V 是负的——买回去等于花钱增加损失。这种情况下正确的动作不是换更强的模型,是先问这个判断点里到底藏着什么人知道而系统不知道的东西,那个东西就是偏好料或判例料(见第五章)。

情形二,差值约等于零:系统和人一样准。这时 V 约等于零,判断价值为零。但要注意——这不等于这笔采购没有价值,只是它的价值不在判断上,而在成本、速度或产能上。它应该按执行类产品定价(按人力替代量),不该按判断类产品定价。把执行价值当判断价值卖,是当下最普遍的定价错误;把执行价值当判断价值买,是当下最普遍的采购错误。

情形三,差值为正。才进入本书讨论的范围。

人的错误率通常没有基线。这是差值不可算的首要原因,而且原因不在技术,在制度:几乎没有企业系统性记录过自己人的判断错误率。它记录销售额、记录工时、记录良品率,唯独不记录"我们的人在这个判断点上一年错了几次"。所以谈判桌上买方往往报不出这个数,只能凭感觉说"我们的人挺准的"——这句话的实际含义通常是"我们从没数过"。

系统的错误率不能用演示时的数。演示是在挑好的样本上跑的。有意义的数只有一个:在这家公司的真实历史样本上、由这家公司的资深者判定对错、跑出来的错误率。这就是认知工程派三指标(判断一致率、复现率、边界失效率)在定价上的作用——没有三指标,差值就是双方各自的猜测,而猜测不能定价。

〔需确认〕一个重要的补充,本书目前给不出定论:人与系统的错误在分布上不同。人在疲劳、赶工、有利益冲突的时候出错;系统在边界之外、样本稀疏、语境隐晦的时候出错。如果两类错误相关性低,那么"人复核系统"的组合错误率可以低于其中任何一方单独的错误率——差值不是两个标量相减那么简单。这会让 V 变大。但组合模式要求人始终在回路里,验收成本随之上升。V 变大而净价值未必变大,这是本节最反直觉的一点。这个组合效应有多大,本书没有实测数据,标为需确认。

因子三 · 频次:唯一一个能查到真实数的因子

频次是四个因子里唯一可以直接查系统查出来的。所以规则很简单:去查,不要回忆。人对频次的记忆有系统性偏差——印象深的判断被高估,日常重复的判断被严重低估。

两个陷阱。

第一,把任务次数当判断次数。一年处理四万张工单,不等于有四万个判断点。其中三万八千张走标准流程,没有判断成分,做错了也不会有人担责。真正的判断点可能只有两千个——那些需要人拿主意、且拿错了要担责的。V 应该只算这两千个。把四万张全算进去,得到的 V 会虚高二十倍,而这正是很多 AI 项目商业计划书的做法。

第二,频次与后果的负相关。判断点通常呈现这样的分布:高频的判断单次后果小,低频的判断单次后果大。年度战略决策一年一次,单次后果可能是全公司的存亡;退款审批一天三百次,单次后果几百元。两端的 V 可能相当,但可交易性完全不同——高频低后果的判断可以被统计验证,因而可以市场化;低频高后果的判断无法被统计验证,只能走信任品制度。这条分界线比行业分界线更能预测一个判断点能不能被做成产品。

减项一 · 验收成本:它不随 AI 变强而下降

验收成本的构成,写成可算的形式:

验收成本 = 抽检率 × 单次验收耗时 × 验收者时薪 × 频次 + 争议处理成本 + 验收体系的一次性建设成本(评测集、基线、流程)

三点需要说明。

第一,抽检率不是自由变量。它由失误后果决定。后果越重,抽检率越接近百分之百,验收成本越接近于重做。当抽检率必须是百分之百时,判断服务的净价值几乎必然为负——除非它省下的不是判断而是别的东西(检索、排版、初稿)。

第二,验收成本随 AI 变强而上升,不是下降。这一点在第二章已经给出:AI 越强,错误看起来越合理,越难被验收者发现。一个明显胡说的输出,验收只要三秒;一个论证严密但前提错了的输出,验收要三十分钟。这是判断商品与所有传统商品最刺眼的区别——它是唯一一种质检成本随生产能力提升而提升的商品。

第三,验收体系的建设成本在现实中不被定价。〔已知〕在一场已经谈到五十万报价的真实交易里,合同中的验收标准一栏是空的:什么算成效、谁来判断、用什么指标,三个问题全部未决。这不是疏忽,是整个行业还没有验收的计价惯例。评测集作为一项应当被单独交易的资产,目前几乎没有市场——这是第八章的题目,也是本书认为最被低估的空位之一。

减项二 · 责任承载成本:它从 P-4 才开始变正

责任承载成本 = 保险费或自留准备金 + 赔付的期望支出 + 为承担赔付而占用的资本成本。

关键在于它的分布是台阶形的,不是连续的。交付"信息""初稿""候选加理由"这三种形态时,责任仍在买方,卖方的责任承载成本近乎为零。只有当交付物是"直接生效的决定"或"决定加赔付承诺"时,它才突然变正,而且变得很大。这个台阶就是第四章责任阶梯的经济学来源——净价值公式里那个看起来不起眼的减项,是整本书最重要的分档依据。

对买方而言,这一项的含义是对称的:卖方不承担的责任,全部由买方承担。买方在算净价值时如果把责任承载成本记为零,等于默认自己免费接下了这份责任。多数采购决策就是这么做的。

四档判定:每一档对应一个具体处境

判定条件含义该做的动作
无判断价值差 ≤ 0系统不比人准,甚至更差不买;已买的停掉,改查缺失的偏好料与判例料
负密度净 ≈ 0 或为负省下的生产成本被验收成本吃光先建验收体系,再谈采购;顺序反了必然失败
薄利边缘0 < 净 < 20% V有价值,但八成被验收与责任成本吃掉只做一次性项目,不做多年绑定;重点压验收成本
值得谈净 ≥ 20% V剩余足够两边分进入责任定档与议价(见第四章)

四个具体场景,一档一个。

无判断价值。上一节那家跨境电商的退货归类:差值为负六个百分点。它的问题不在模型,在那些只有老客服知道的品类惯例从没被写下来过。这一档的正确解读是:这不是采购问题,是资产问题。

负密度。同一家公司的客服工单初判:上线后减了两名客服,但新增一名资深主管每天两小时复核,加每周一次的争议复盘会。人力账面上省了钱,团队的实际负荷上升了。负密度不是失败的项目,是账算错了的项目——它省下的是便宜的时间,多出的是昂贵的时间。

薄利边缘。内容平台的违规内容初筛:V 确实存在(漏放一条的后果很实在),但因为后果重,抽检率被合规要求压在高位,验收吃掉八成以上的 V。这一档可以做,但不能签三年——因为剩下的两成经不起任何一次涨价或模型退步。

值得谈。下面这个案例。

合同付款条款的风险放行

某公司法务每年审四百份采购合同,其中"付款条款风险放行"是一个判断点:单次失误后果约五十万元(按历史纠纷均值),资深法务漏检率约百分之三,某合同 AI 系统在该公司自有历史合同上实测百分之一点二。

V = 50 万 × (3% − 1.2%) × 400 = 360 万元/年(上限)

验收成本:每份合同资深法务抽检二十分钟 × 百分之三十抽检率 × 四百份 ≈ 四十人时/年 ≈ 四万元。责任承载成本:系统只出"标注加理由",由人拍板,责任仍在法务,这一项计零——但相应地,按第四章的阶梯,这个产品只能卖 P-3 的价格。

净价值 ≈ 356 万元,落在"值得谈"。

〔注:数字为示例结构,不是实测。要点在于 V 的每一个因子都可采集,而这份算式本身就是采购谈判的语言——它把"这套系统好不好"这个无法收敛的问题,换成了四个各自可查的问题。〕

这张表什么时候失效:当失误后果无法归因时(营销创意、组织文化),四档判定全部退化,只剩排序法可用;当买方组织内部没有人愿意为这个判断点担责时,第四档的"值得谈"是假的——因为谈成之后没有人验收,服务会迅速退化。后一种情况是第四章的主题。

一个必须写出来的落差:没有人用这条公式报过价

现在说本章最重要、也最容易被写作者回避的一件事。

在八场真实的定价讨论——包括企业采购、平台拆账、硬件合作、服务续约——没有一场用"失误后果 × 错误率差 × 频次"算过价。一次都没有。〔已知:这八场讨论均有逐字记录。〕

实际被使用的定价法有四种。

对标定价。同类的一门课收五千一人,我们也收五千一人。这是最省事的定价法,也是最脆弱的:它把定价权外包给了同行,而同行同样没算过。当整个品类都在对标时,价格锚定在最早那个拍脑袋的数上,之后所有人围着它做小幅调整。

成本加成。上游 API 一美金,我们收一人民币,毛利五成。这是把判断按流量卖——用最便宜的单位(Token)去定价最贵的东西(判断)。它的失效方式是确定的:上游降价,毛利被挤,而毛利被挤的时候你会发现自己从来没有向客户解释过你的价值在哪,于是没有任何理由维持原价。这是第六章的主题。

预算锚定。先问"你们预算多少",再按预算报价。它的天花板不是价值,是买方的想象力。买方想象力小,卖方就少赚;买方想象力大,卖方赚到的钱与交付的价值无关,续约时会被打回原形。

场景锚点。一个课堂上讲过的例子:一把剃须刀从一百九十九元提到三百九十九元,反而卖得更好。变的不是产品,是场景——从"个人日用工具"变成了"情人节礼物"。这个例子值得多说一句,因为它其实不是 V 公式的反例,而是 V 公式的一个特例:送错礼物的失误后果,远大于胡子刮得不够干净的失误后果。场景切换真正切换的是"失误后果"这一项。懂定价的人在直觉上做对了这件事,只是没有写成算式。

那么,一条从未被使用过的公式,凭什么写进一本理论书。

因为 V 公式是规范性工具(应然),不是描述性事实(实然)。它不宣称"市场是这样定价的",它宣称"市场应该这样定价,而现在没有"。一个只描述现实的公式没有用处——现实自己会运行,不需要公式。V 公式的全部用处恰恰在于它和现实不一致。

这句话必须配一个诚实的代价声明:规范性工具的检验方式和描述性理论不同。它不能靠"看看市场是不是这样"来验证(答案已知,不是)。它只能靠两件事来验证:第一,用它算过的交易,事后表现是否好于没算过的(见第十一章 J1 的检验设计);第二,它是否能提前预测出那些注定失败的交易——负密度项目、差值为负的采购、验收条款空白的合同。目前本书只能给出算式和判据,给不出对照实验。〔需确认〕

而这个落差本身就是本书的主张:市场还没有学会给判断定价,谁先学会算,谁就拿到定价权。这不是一句励志话,它有具体的经济含义——在一个所有人都用对标和成本加成定价的市场里,第一个能说清楚"我为你避免了多少损失"的卖方,可以合法地把价格从成本加成的锚上摘下来;第一个能算出净价值为负的买方,可以避开一整类看起来很美的采购。定价权在这里的定义就是:你的报价依据别人反驳不了。

价格发现三段论:为什么判断服务的报价这么不透明

买方常有的一个抱怨:这些 AI 服务商为什么都不公开报价,问一次报一个数。这不完全是不诚实,它符合一个新品类的正常轨迹。

判断类商品的定价要经历三段。

第一段,一单一议。没有价目表,每一单的价格都是谈出来的。卖方靠预算锚定,买方靠多方比价。信息不对称在这一段最大,成交价的离散度也最大——同样的交付内容,两个客户付的钱可以差三倍。

第二段,内部价格体系稳定。卖方内部有了一张表:按责任档位、按频次、按行业分层,报价开始可复现,同类客户拿到相近的数。这张表不对外。这一段是从手艺到产品的分界线——之前每一单靠人,之后每一单靠体系。

第三段,公开报价。价格上墙,买方自助比价。进入这一段需要两个前提同时成立:品类标准化(大家卖的确实是同一种东西)和质量可核验(买方能验证你说的错误率)。判断服务离这一步还远,因为第二个前提在多数领域不成立。〔推断〕

一次真实的平台定价讨论里,负责人这样描述自己所处的位置:

"前期不展示价格,我们以对人的形式先跑一段时间,等价格体系稳定下来以后再展示。"

这是第一段向第二段过渡的标准动作,讲得很清楚。

值得补一句的是:在信任品市场,第一段不公开报价往往是理性的,甚至是保护性的。公开一个买方无法验证质量的价格,只会引来纯比价,而纯比价在质量不可验的品类里会把价格推向最低者,把高质量供给逐出市场——柠檬化的标准剧本(见第六章)。所以不透明的解药不是强制公开价格,是让质量可验:三指标披露、第三方评测、认证机构。这三样是第八章的内容。

买方在第一段有一个立即可用的对策:不要求对方公开报价,要求对方公开计价口径。你可以不知道别人付了多少,但你有权知道这个数是按什么算出来的——按人头、按调用量、按判断点数量、还是按避免的损失。一个说不清计价口径的报价,本身就是一个应当降档处理的信号。

深入 · 五分钟自测:给你的一个判断点估值

拿一张纸,按顺序做完,不许跳步。

  1. 选一个"做错了有人担责"的具体判断,不是一个任务。检验方法:如果这件事做错了,你说得出具体是谁会被问责吗。说不出,换一个。
  2. 写下单次失误的钱数或等价损失。拿不准就用序数法:把你手上五到二十个判断点排个序,只回答"这几个里最不能错的是哪个"。排序也是估值。
  3. 估人与系统的错误率之差。先分别写两个数,再相减,不要直接写差值——直接写差值的人会不自觉地写成一个好看的数。人的那一侧如果没有基线,先承认没有基线,然后设差值为百分之一做保守起算,另做一次敏感性测算(差值减半、翻倍,各算一遍 V)。
  4. 数一年发生几次。查系统,不要回忆。查出来之后再筛一遍:其中真正需要人拿主意的有几次。
  5. 减去验收成本。谁来验、每次几分钟、抽检比例多少、时薪多少。加上争议处理的时间。若结果为负,先别谈采购,要谈的是验收体系。
  6. 再减责任承载成本。如果你打算让系统的输出默认生效(不复核就执行),这一项不为零,去第四章定档再回来。

做完这六步,你会得到三样东西:一个数、四个你原来答不上来的问题、以及一份可以摆在谈判桌上的语言。第三样比第一样值钱。

→ 用「判断点估值器」直接算(自动判定负密度与薄利边缘)

反驳与回应

反驳一:失误后果根本没法量化。绝大多数真实判断的错误后果既不可归因也不可计价,把它写成算式的第一个因子,等于把不可知包装成了可算——这比不算更危险,因为它给了一个假的精确感。

回应:这条反驳的前半段我全部接受,不做辩解。对一大类判断,失误后果确实不可量化。

但要把"不可量化"拆成三种,因为它们的处理方式完全不同。可量化的——合同风险、信贷违约、生产排程、退款判定——有账可查,直接算。可排序不可量化的——占大多数——用序数法,V 退化成排序工具,仍然回答那个最要紧的问题:先动哪一个。连排序都做不到的——比如"这次品牌调性该往哪个方向走"——本书第二章推论二已经写明:这类判断不可市场化交易,只能以信任品制度承载。一个能说清自己什么时候不成立的算式,恰恰是包装的反面。

更实质的一点是:反对者的隐含主张是"既然算不准就不该算"。但现状不是"不算",现状是"用别的算式算"——按人头、按人天、按 Token、按对标价。这些算式同样不准,而且系统性地偏向错误的方向:它们奖励产量,惩罚谨慎;它们让"输出更多"值钱,让"少犯一次错"不值钱。在两个都不精确的算式之间,应该选那个至少指向正确变量的。

最后一个类比不是修辞,是路径证据:在人身保险出现之前,一条人命也"没法量化"。精算的起点不是先有精确的数,是先有一个愿意为自己的估计赔钱的人。判断的失误后果会沿同一条路径变得可计量,前提是有人开始为它赔钱——那是第八章和第四章 P-5 档的内容。

反驳二:错误率差被当成了静态参数,但两边都在动。系统在变好(每一代模型都提升),人在变差(长期依赖系统会导致技能退化)。一个两边都在漂移的差值,算出来的 V 保质期可能只有几个月。

回应:接住,这条是对的,公式确实缺时间维度。

系统侧的漂移方向明确:按基础模型代际提升,同时对应的判断资产按代际折旧(见第五章)。人侧的漂移更隐蔽,也更贵:验收者的技能退化会让"人的错误率"上升,账面上 V 变大,实际上是验收能力在流失。V 上升而净价值下降,因为验收成本里那个"验收者时薪"背后的东西正在消失。这是负密度最难被发现的一种形态——它在报表上表现为价值提升。

因此正确的用法是:V 是一个每年重估的量,不是一次算出的常数。重估时至少要检查两件事:系统错误率是否重测过(用当期样本,不是当初的),以及验收者是否还在真的验收。第二件事的检测方法在第四章的 L3 陷阱一节。〔推断〕

反驳三:这条公式假设人和系统是替换关系,但真实的高价值场景几乎都是互补关系——人和系统一起做,比谁单独做都好。用替换差值定价,会系统性低估互补场景。

回应:接住。差值定价确实预设了替换。

互补情形下的正确写法是:把"人加系统"当作一个新的生产单元,用这个单元的错误率去减人单独作业的错误率。这样算出来的差值通常更大,V 也更大。但同一动作会推高减项——互补要求人始终在回路里,验收成本必然上升,而且这个上升不是抽检式的,是全量式的。V 更高,净价值未必更高,这是本节前面已经标为需确认的那个问题的另一面。

互补还有一个更麻烦的后果,它不在本章:人和系统共同做出的判断,做错了责任落在谁身上。合同通常回答不了这个问题,而回答不了就意味着责任落进缝里。这直接通向第四章要处理的 L3 陷阱。

反驳四:V 是价值上限,但没有买方会按上限付钱。一个算不出成交价的公式,对定价谈判没有实际用处。

回应:对,V 是上限不是价格。价格落在「卖方成本」到「买方净价值」之间的某一点,具体位置由议价能力、替代方案和转换成本决定,公式不预测这个点在哪。

但今天谈判桌上的问题不是剩余怎么分,是双方都不知道剩余有多大。买方不知道自己少赔了多少,卖方不知道自己创造了多少,于是谈判退化成预算锚定和对标砍价。先把区间算出来,再谈分配,这是顺序问题不是精度问题。附带一个可立即使用的推论:当算出的净价值低于卖方的交付成本时,这笔交易在任何价格上都不该发生——公式在这一点上给的是确定答案,不是区间。

与兄弟体系的接口

判断点、验证时点、L1–L5 判断让渡刻度的定义都来自智能密度体系,本书直接引用不做改动——V 公式的输入端(哪些事算判断点、多久能验证对错)依赖那套定义。三指标(判断一致率、复现率、边界失效率)来自认知工程派,本书把它当作"错误率差可计算"的技术前提:没有三指标,公式里的第二个因子就只是双方各自的猜测。责任承载成本这一项的分档标准定义在第四章(本书自有)。至于"公司内部谁负责建立人的错误率基线、谁负责验收",那是组织与岗位的问题,归智能体管理学(AMS),本书不展开,只指出它是 V 可计算的前置条件。

本章小结

  1. V 测的是差值不是能力:系统再强,若人本来就不出错、或出错无人担责,判断价值为零。
  2. 四个因子里三个属于买方,判断服务的价值主要由买方处境决定,不由卖方技术水平决定。
  3. 错误率差为零或为负时不该做这笔交易——差为零的采购可能仍有执行价值,但不能按判断定价。
  4. 验收成本是价格地板,且它随 AI 变强而上升;净价值为负时该谈的是验收体系,不是采购。
  5. 现实中没有人用这条公式报过价。V 是规范性工具,这个落差是本书的主张而非缺陷:市场还没学会给判断定价,先会算的人拿定价权。
第 04 章

责任阶梯:判断的价格首先是责任的价格

两家公司卖同一件东西。

第一家的产品页写着「智能风控助手,秒级识别可疑交易,准确率 99.2%」,一年十二万。第二家的产品页写着「智能风控,秒级识别可疑交易」,一年三百八十万。两家用的基础模型是同一个,准确率在同一个数量级上,演示视频看起来几乎一样。

差三十倍。

差的不是模型。第二家的合同里有一条第一家没有的条款:因系统误判导致的直接资金损失,供应商在年度服务费两倍以内赔付,且赔付不以客户放弃追偿其他损失为前提。

这一条大约值三百六十六万。

这就是本书的核心命题,也是全书最实用的一章:判断的价格首先是责任的价格。 同一个判断可以按五种深度交付,每一档的价格不是线性递增,是台阶式跳跃——而跳跃发生在责任转移的地方,不发生在能力提升的地方。

市场其实已经在模糊地这样做了,只是没有人把这个阶梯画出来。画出来之后,判断定价的大部分谜团会直接消失。

五个档位

交付物责任位置价格量级今天的对应物
P-1信息(相关资料、数据)全在买方基准 ×1搜索、数据库订阅
P-2初稿(需全面复核)全在买方×2–5Copilot 类、通用大模型订阅
P-3候选+理由(买方拍板)买方×5–20垂直 AI 工具、分析报告
P-4决定(默认生效)名义在卖方、实际悬空×20–100自动风控、程序化投放
P-5决定 + 赔付承诺契约化在卖方×100+,且需保险几乎不存在——这就是机会

价格量级是数量级的示意,不是报价表〔推断〕。它来自对公开报价与若干次真实谈判的粗略归纳,样本远远不够,第十一章的 J1 主张正是为了把这一列变成有数据支撑的东西。可靠的是排序,不可靠的是数字——这是本书反复申明的纪律:序数不是基数。

P-1 · 信息

交付的是原料:相关条款、可比案例、历史数据、检索结果。买方拿到之后所有的解读、取舍、决定都由自己做。

这一档的定价逻辑与判断无关,它本质上是数据订阅。价格由稀缺性和获取成本决定,与"用了之后决策变好了多少"没有关系。

典型陷阱:把 P-1 包装成 P-3 卖。做法是给信息加上一层看起来像结论的措辞——"综合来看,A 方案更具优势"——但既不给出可核验的依据,也不承担判断错误的任何后果。买方为语气付了钱。

P-2 · 初稿

交付的是一份需要全面复核的成品:一版文案、一段代码、一份分析、一个方案。它看起来已经完成了,但买方必须逐行检查才敢用。

这是今天绝大多数 AI 产品所在的位置,也是价格战最惨烈的位置。原因很简单:P-2 的能力正在被基础模型免费提供。 一个只做 P-2 的产品,它真正的竞争对手不是同行,是下一次模型更新。

典型陷阱:用"效率提升 80%"来论证价格。效率是省下的工时,工时有明确的市场价,因此 P-2 的价格天花板等于被替代人力的成本,任你演示得多惊艳都突破不了。要突破,只能往上走。

P-3 · 候选加理由

交付的是若干个候选方案,每个附带可核验的理由,买方在其中拍板。

这一档的关键词是理由。理由的作用不是让方案更好看,是让买方的验收成本降下来——买方不必重做一遍分析,只需检查理由是否成立。谁能把验收成本压得更低,谁就能在同样的能力上卖出更高的价。这条直通第三章的净价值式:V 里减掉的验收成本,正是 P-3 卖方在替买方节省的东西。

典型陷阱:理由不可核验。「基于多维度综合评估」不是理由;「这三个客户与你的场景在退货率、客单价、复购周期三项上接近,他们采用后的结果是……」才是理由。前者是修辞,后者是可以被证伪的陈述。

P-4 · 决定

交付的是一个默认生效的决定。系统直接放行或拦截,直接派单或拒单,人不再逐条介入。

这一档的价格跳跃很大,因为买方买走的是"不必再看"这件事。但也正是在这一档上,责任第一次出现悬空:合同里往往写着卖方对结果负责,实际发生损失时,卖方的赔付上限通常是服务费本身——也就是说,真正的损失仍然落在买方账上。名义上责任转移了,事实上没有。

这是整个阶梯上最危险的一档,危险到需要一个专门的名字。

L3 陷阱:名义 P-3、事实 P-4。合同写着「AI 提供建议,由人工复核后执行」,实际运行中复核者面对每天几千条建议,只能全部点通过。这时候买方以为自己买的是 P-3(我还在把关),实际处在 P-4(无人把关)的风险敞口里,却只享受了 P-3 的价格折扣与卖方的 P-3 级责任承诺。
识别方法只有一个:看复核者的实际工作量。每天需要复核的条数,除以复核者人数,再除以有效工作秒数——如果平均每条不到三秒,那就是没有复核。

这里要格外小心一组容易混淆的概念。智能密度体系用 L1–L5 刻度描述判断让渡的深度,本书用 P-1–P-5 描述责任的深度。两者相关,但不是一回事。一个组织完全可能处在 L4——把大量判断交给了系统——同时停在 P-2,即没有任何人对结果负责。这个组合就是本书所说的负密度(见第三章)。上面沿用的"L3 陷阱"是密度体系对该现象的既有命名,它描述的正是让渡与担责脱节的状态。

P-5 · 决定加赔付

交付的是决定,外加一份在结果出错时真实赔付的承诺。

这一档在今天的市场上几乎不存在。不存在的原因不是没有需求——需求非常明确;是卖方拿不出赔付能力:需要历史损失分布来给风险定价、需要资本金或保险来兜底、需要一套能界定"这次损失是不是我造成的"的归因机制。三样都缺。第八章会专门讨论这三样各自缺在哪里、可能怎么补上。

我认为这是判断经济学里最大的一块空地〔推断〕。谁先站上去,谁就把自己从"和免费模型竞争"换到了"和保险公司竞争"的赛道上——后者的日子好过得多。

三问定档,第四问定风险

要判断一个服务实际站在哪一档,不看它怎么宣传,问四个问题。

第一问:合同里做错了谁赔?
翻到责任限制条款。四种典型答案对应四种档位区间:买方全赔(P-1 至 P-2);未写明或表述模糊(事实上等于买方全赔,但双方常常都以为不是);卖方赔但以服务费为上限(P-3 到 P-4 之间,这是今天最常见的位置);卖方赔且可超出服务费(P-5)。

第二问:客户实际怎么用?
不是问怎么设计的,是问怎么用的。只作参考(P-1);当初稿改写(P-2);从候选里挑,且真的看理由(P-3);直接执行,事实上无人逐条复核(P-4)。第二问与第一问打架的地方,就是 L3 陷阱所在。

第三问:有没有三指标?
判断一致率、复现率、边界失效率——这三项指标来自认知工程派,本书直接引用,不重新定义。没有评测,就没有溢价:三指标未测的服务,买方理性上只应支付 P-2 的价格,无论演示多惊艳。这是"Demo 即巅峰"现象的定价学表述,也是第十一章 J3 主张的来源。

第四问:钱在什么时候收?
这一问是本版新增的。它不定档位,定的是风险落在谁身上

我旁听过一场真实的内部争论。一方主张服务费与调用额度必须预付;另一方坚持费用应当后置——用了才收〔转述其立场〕。表面上这是现金流之争,实质上是责任之争:前置收费意味着买方承担效果风险(钱已经付了,没做成也拿不回来);后置收费意味着卖方承担效果风险(没做成就收不到钱)。

由此得到一条自洽性检验:付费时点必须与档位匹配。 一家宣称站在 P-4、承诺"结果负责"的供应商,如果坚持全额前置收费且无退款条款,那么它的责任承诺是一句话,不是一个条款。反过来,一家愿意按结果后置收费的供应商,即使合同里没写赔付,事实上已经承担了相当一部分 P-4 的风险。

合同里最诚实的一页,往往是付款方式那一页。

在卖给别人之前,先看组织内部

前面四问都在处理买卖双方之间的责任。但在真实世界里,卡住的地方往往还没走到那一步。

我记录过多次企业内部推动 AI 落地的讨论。让推进停下来的,几乎从来不是价格谈不拢,而是内部有人问出了一句话。在一次真实的企业内部讨论中,一位负责人转述业务部门的反应,原话是:

「业务部门是最难推进,因为他说,我店铺业绩掉了,谁来负责?你给我负责还是谁负责?」

这句话我在不同企业听到过至少三次〔已知〕,其中一家的推进由最高负责人亲自督办,仍然在一个月内停摆〔转述〕。

这个现象值得被单独命名,因为它推翻了一个常见的因果顺序。人们默认的顺序是:先谈妥价格,买回来,然后组织去适应。真实的顺序是反过来的——

判断让渡的第一道闸不是价格,是组织内部有没有人肯站到担责位上。 如果内部无人担责,买回来的 P-4 服务事实上无人验收,会立刻退化成 L3 陷阱:钱按 P-4 付了,风险按 P-4 敞着,但组织内没有任何人的名字写在这个决定旁边。

组织内部同样存在一个责任阶梯,它与市场上那个是同构的:

组织内档位表现对应市场档
谁都可以看,但没人必须用AI 输出作为参考资料存在P-1
用了,但每个人自己判断要不要采纳无统一标准,责任分散到个人P-2
有人负责审核,且审核意见留痕出现了具名的验收者P-3
系统默认生效,出事按流程追责到岗有名字,有流程P-4
出事有明确的问责与补偿机制责任被制度化P-5

采购之前先做一次内部定档,比谈价格重要。方法很简单:问一句"这个决定如果错了,明天早上谁会被叫去办公室"。如果答不出一个具体的名字,那么无论买什么档位的服务,你实际都停在 P-2。

这里必须划清边界:组织内部怎么让这个名字出现——怎么设计权责、怎么改考核、怎么处理业务部门的抵触——不是本书的题目,是智能体管理学的题目。本书只负责指出一件事:它是定价的前置条件,不是采购之后的实施细节。 顺序错了,钱会白花。

抗吞噬推论

现在把这一章和第一章的公理接起来。

E1 说判断的生产成本趋于零。这意味着下一代基础模型会免费内置 P-1 到 P-3 的大部分能力——检索、初稿、带理由的候选,这些正在以肉眼可见的速度变成模型的默认功能。

E2 说验收与担责不可复制。这意味着模型厂商永远不会替你赔钱。它可以把生成做到无限便宜,但它不会在你的合同上签字,不会为你的误判赔付,不会成为被追责的法律主体。

两条合起来是一个很干净的战略结论:

愿意承担责任,是模型厂商最不愿替你做的事,因此是唯一不会被吞噬的定价位置。
一个判断服务商的战略问题因此简单得有点残酷:你打算停在阶梯的第几档?停在 P-2,你在跟免费竞争;爬到 P-5,你在跟保险公司竞争。

爬档不是营销动作,是三件套的建设:评测集(证明你的错误率是多少)、赔付能力(资本金或保险)、可归因的责任边界(出事时能分清哪部分是你造成的)。缺哪件补哪件,一件都不能靠话术替代。缺评测集而宣称 P-4 的服务,市场早晚会用一次事故完成定价修正〔推断〕

反驳与回应

反驳一:这个阶梯是事后归纳,不是理论。你只是把市场上已有的价格差异贴了五个标签,没有解释力。

部分成立。阶梯本身确实是归纳的产物。但它不只是标签,因为它做了一件归纳不做的事:给出了跨档预测。它预测同一判断点上 P-4 与 P-3 的价差会显著大于 P-3 与 P-2 的价差(因为前者跨越了责任转移,后者只是能力提升);预测无三指标的服务会向 P-2 收敛;预测付费时点与档位不匹配的合同会在第一次事故后被重新谈判。这些预测可以被数据推翻,J1 和 J3 就是为此而写。一套只能解释过去、不能预测未来的分类,我同意不值钱;但这一套敢下注。

反驳二:P-5 根本不存在,说明这个阶梯的顶端是虚构的。用一个从未出现的档位当作理论顶点,是循环论证。

这条最难接。回应分三步。

第一,P-5 并非从未出现,只是不叫这个名字。产品责任险、职业责任险、承运人的赔偿责任、审计机构的连带责任——这些都是成熟的"为判断错误赔付"的制度,只不过它们生长在传统行业里,还没长进 AI 服务的合同里。所以问题不是"这一档在人类经济中不存在",而是"它在这个新市场里还没长出来"。

第二,为什么还没长出来,是可以说清楚的:缺损失分布数据、缺归因机制、缺资本金。这三条都是可观察、可验证的条件,第八章逐条讨论。如果五年后这三条都具备了而 P-5 仍未出现,那么这个反驳成立,本书需要重写——我把它写成了 J4,附了时间与判据。

第三,退一步说,即使 P-5 永远不出现,前四档仍然有用。L3 陷阱识别、三问定档、付费时点自洽性检验,这些都不依赖顶端存在。塌掉的是"担责是最厚利润区"这个战略判断,不是整个工具。

反驳三:把复杂的服务定价简化成五档会误导人。真实合同里的责任是连续谱,不是台阶。

责任确实是连续的,价格却不是。这正是本章要指出的现象:连续的责任被离散的合同语言切成了台阶——赔或不赔、有上限或无上限、复核或不复核,这些条款只有有限几种写法,而每一种写法都对应一个可辨识的价格区间。五档是对合同语言可能性的归纳,不是对责任本身的量化。真实合同当然会落在档位之间(第九章的信贷算例就是一个 P-3.5 的例子),阶梯给的是坐标系,不是格子。

与兄弟体系的接口

本章处在几个体系的交界处,边界必须清楚。

智能密度体系提供判断点的识别方法与 L1–L5 让渡刻度,是本章的输入——先有"哪些是判断点、让渡到什么深度",才谈得上"这个判断点的责任在谁身上、值多少钱"。L 与 P 的区别本章已反复申明,第十章有专门辨析。

认知工程派提供三指标,是本章第三问的判据来源。本书只引用,不重新定义。

智能体管理学处理组织如何形成担责机制——权责设计、考核改造、变革推进。本章新增的"组织内责任阶梯"只是把它标定为定价的前置条件,具体怎么做属于 AMS。

智能体的社会科学处理责任缺口的制度与伦理后果。本章谈的是责任如何被定价,它谈的是责任应当如何被分配——前者是价格问题,后者是正当性问题,不能互相替代。

本章小结

  1. 判断的价格首先是责任的价格。五个档位的跳跃发生在责任转移处,不发生在能力提升处。
  2. 三问定档:合同谁赔、客户实际怎么用、有没有三指标。第二问与第一问打架的地方,就是 L3 陷阱。
  3. 第四问定风险落点:付费时点是责任分配的代理变量,前置=买方担效果风险,后置=卖方担。合同里最诚实的一页往往是付款方式。
  4. 采购之前先做组织内定档。问不出"错了谁被叫去办公室"的具体名字,买什么档都等于停在 P-2。
  5. 基础模型会吞掉 P-1 到 P-3,永远不会替你赔钱。担责是唯一不被吞噬的定价位置——但爬上去要三件套:评测集、赔付能力、可归因的责任边界。
第 05 章

判断资产负债表

一位制造业经营者在一次内部会上说了一句让在座所有人安静下来的话。原话是:

「我们现在完成了巨额的数字化,但并没有把数字资产转移为公司的经营资产。」

他不是在讲概念。他手上有两笔账。一款抽屉收纳箱卖了两千个,数据系统里全都有记录,但没有任何人跟进过这个信号——为什么是它卖起来了、要不要追单、能不能扩品。另一笔更重:一块跨境业务亏了一年半才被发现,账面数据一直都在,但没有人把它读成一个需要决策的信号。

他们不缺数据。他们缺的是数据与判断之间那一层:谁看了、看出了什么、据此做了什么决定、后来结果怎样。

这一层如果没有被记录下来,那么无论积累了多少 TB 的数据,公司的判断能力都不会因为时间而增长。人走了,判断就跟着走了。系统换了,经验就归零了。

企业的判断能力第一次可以被当作资产来管理——但会计制度还没跟上,多数公司连科目都还没有。本章给出判断资产的三张表:科目表、折旧表、增值表。

一 · 资产科目:四类

判断资产 = 判例料 + 偏好料 + 评测集 + 封装结构。

前两项来自智能密度体系的四类料。那套分类里,事实料(这个客户买过什么)和规则料(退款流程怎么走)几乎人人都有,判例料和偏好料几乎人人为零——正因为稀缺,它们才是资产。

判例料

一条判例料的字段大致是这样:

字段内容为什么必须有
情境当时面对的具体情况与可得信息没有情境的结论无法迁移
判断做出的决定本身——
依据为什么这么判,尤其是排除了哪些选项及原因这是判例料区别于数据的唯一字段
判定人谁做的这个判断追溯与权重
时间何时判断有保质期
结果后来发生了什么没有结果的判例是死账
复盘事后看,当初的依据是否成立校准

七个字段里,「依据」和「结果」最常缺失,而它们恰恰是全部价值所在。缺依据,判例无法迁移到新情境;缺结果,判例无法校准,只是把过去的错误固化下来。

偏好料

组织的"什么算好"与"我们不做什么"。它比判例料更隐蔽,因为它通常从不被写下来——它活在创始人的直觉里、活在"这个不行,你懂的"这句话里、活在一次次被否决的方案里。

判断偏好料存量的方法很简单:问三个人同一个问题,看答案是否一致。 比如"我们接不接这种客户",如果三个中层给出三种答案,说明偏好料存量为零,AI 系统只会把这种不一致原样放大。

评测集

一组带标准答案的样本,用来回答"这个判断服务现在的错误率是多少"。

评测集是唯一能给其他三项资产估值的东西。没有它,判例料的质量无法评估,封装结构的改进无法验证,偏好料是否被正确表达无从检验。第八章会论证:它同时也是这个市场上最稀缺、最没有人愿意先出钱建的东西。

封装结构

判断的可执行形态——提示词体系、Skill 文件、工作流、审批规则。它是把前三项装进机器的容器(AMS 的 F21 把它作为治理对象)。

四类里它最容易被误当成核心资产,实际上它折旧最快,原因见下一节。

二 · 折旧:抗吞噬四问

判断资产的折旧率不由时间决定,由它依赖什么决定。判据是抗吞噬四问:

  1. 这部分能力,下一代通用模型会不会自带?
  2. 它依赖的是通用推理,还是我们的私域数据?
  3. 它依赖的是公开规则,还是行业里说不清但真实存在的默契?
  4. 它有没有绑定一个真实的责任承担者?

四问的答案决定折旧速度:

资产成分依赖折旧速度〔推断〕
通用推理型提示词模型能力快:按基础模型换代周期,当前约 6–12 个月,且在缩短
通用流程封装公开规则中:一旦成为行业标准即失去溢价
判例料私域历史与依据慢:几乎不随模型换代折旧
偏好料组织的价值排序慢:但随战略转向而失效
评测集私域标注与判定标准慢:需随业务变化增补
责任绑定(谁签字)制度与人不折旧,但会随人事变动断裂

这条规则直接改写 AI 公司的估值逻辑:两家收入完全相同的 AI 公司,判断资产的折旧结构可以让真实价值差一个数量级。 一家的收入建立在一套很好的提示词上,另一家建立在三年积累的判例料与自持评测集上——前者的护城河宽度等于下一次模型更新的间隔。这条写成了可检验主张 J6。

三 · 增值:唯一越用越值钱的资产,前提是回流在转

判断资产是少见的可以越用越厚的资产类别,机制是认知复利:真实结果回来校准判断,校准后的判断回填为系统的上下文,下一次判断因此更准。

但这台复利引擎有一个必需的发动机:验收

没有验收就没有结果记录,没有结果记录就没有判例料,没有判例料就没有校准。密度体系有一句话说得很干脆:好供料的唯一来源是验收在跑。

由此得到判断资产的第一定律:

验收停转之日,就是资产开始净折旧之时。
一项持续折旧、且维护费为正的"资产",在资产负债表上应当计入负债。这就是负密度(核对成本超过节省)在财务上的样子——它伪装成资产,实际是负债。

这里必须补一条同样重要的警告,它来自那家制造企业的教训:只记判断不比对结果,判例料就是死账。

很多公司在推"决策留痕"时只做了前半程——要求员工写下自己的判断并提交。这确实产生了记录,但如果没有第二步(把记录与后来的真实结果比对),这些记录既不能校准 AI,也不能评估人,堆积几年之后只是一个没人看的文档库。留痕机制必须自带验证与审计环节,否则它生产的是纸,不是资产。

四 · 一个反直觉的推论:开会是判例料的生产现场

在同一批讨论里,有人问了一个看起来跑题的问题:

「我们为什么开会?其实我们开会是为了要那上下文的。」

顺着这句话往下推,会得到一个对判断资产很有用的结论。

人与人开会,本质上是在对齐彼此脑子里的上下文——你知道的我不知道,我判断的依据你没听过。会议之所以低效,是因为这个对齐过程无法沉淀,散会之后上下文又回到各自脑子里。

如果存在一个共享的判断记录,很大一部分同步性会议就可以取消。而剩下的会议,价值会从"传递信息"转向另一件事:生产新的、高强度的判断记录——把几个人脑子里说不清的默契,逼成可以写下来的依据。

这个推论的置信度我标为〔推断〕,它依赖一个尚未成熟的前提:共享上下文的工具好用到可以替代口头对齐。在这个前提成熟之前,会议的传统功能仍然不可替代。但方向值得记下:判例料最密集的生产现场不是系统日志,是那些原本就在发生的争论。

深入 · 判断资产盘点清单(CFO 版)

科目盘点三问
判例料过去一年的关键判断加结果,被结构化记录了几条?在谁手里?离职带得走吗?
偏好料"我们不做什么/什么算好"被写下来过吗?还是只在老板脑子里?问三个中层,答案一致吗?
评测集每个在用的 AI 判断服务,有基线错误率吗?上次重测是什么时候?评测集在你手上还是在供应商手上?
封装结构提示词与 Skill 有版本管理吗?依赖通用推理的比例多高(等于折旧率多高)?

盘点结论只需要回答一句话:模型换代明天发生,你的账面上还剩什么?

如果答案是"我们的提示词写得很好",那么账面上剩下的接近于零。如果答案是"三年的判定记录、一套自持的评测集、以及几个知道为什么这么判的人",那么你有一张真正的资产负债表。

反驳与回应

反驳一:判例料就是换个名字的训练数据。模型厂商迟早会把这类数据吞掉——就像他们吞掉了所有公开语料一样。

这条反驳的前半句是错的,后半句值得认真对待。

前半句错在字段。训练数据的典型形态是输入与输出的配对:这个客户的情况是这样,最终决定是拒绝。判例料多了一个字段:为什么——排除了哪些选项、基于哪条没写在任何文档里的默契、当时最担心的风险是什么。这个字段无法从输入输出对里反推出来,因为同一个决定可以由完全不同的理由做出,而理由决定了它能不能迁移到新情境。

后半句的担心是真的:如果这些判断记录存放在供应商的系统里,它们确实会成为供应商的资产而不是你的。这不是技术问题,是合同问题——第六章的防绑定五条第一条就是"导出格式写进合同",第三条是"评测集自持"。判例料的产权归属,取决于你在签合同那一天有没有想到这件事。

反驳二:这套东西的记录成本极高。要求每个人写下判断依据,等于给所有人增加工作量,而收益要几年后才出现。多数组织不会做,做了也会流于形式。

我同意大部分组织不会做,也同意形式化是最可能的结局。但反驳的落点应该是"怎么让成本降下来",而不是"所以不该做"。

三条可行的降本路径〔推断〕:第一,只记高价值判断点——用第三章的 V 公式排序,前百分之十的判断点贡献了绝大部分价值,其余不记;第二,让记录发生在原本就要发生的场合(会议、审批、复盘),而不是新增一道流程;第三,用系统承担格式化工作,人只提供"为什么"这一句话。

至于形式化的风险,只有一个解药,而且它恰好也是本书的主题:让记录与后果挂钩。 一条无人验证的判断记录必然流于形式;一条会被拿来与真实结果比对的判断记录不会。这又回到了第一定律——验收是唯一的发动机。

与兄弟体系的接口

智能密度体系提供四类料的分类与"好供料来自验收"的机制判断,本章的判例料与偏好料直接沿用其定义。

认知工程派提供三指标,是评测集这一科目的度量方法。

智能体管理学的 F21 把封装结构作为治理对象——版本、权限、生命周期怎么管是它的题目;本章只负责给它记账。

智能体时代的教育学关心这些资产如何在人身上生长(判断力、让渡力、验收力),本章关心它们如何在组织账面上积累。两者是同一件事的两个视角。

本章小结

  1. 判断资产有四个科目:判例料、偏好料、评测集、封装结构。前两项稀缺,第三项决定其余三项能否估值,第四项折旧最快。
  2. 折旧率由依赖决定,不由时间决定。依赖通用推理的部分按模型代际折旧,依赖私域数据、行业默契、责任绑定的部分几乎不折旧。
  3. 判断资产是唯一可以越用越厚的资产,但复利引擎的发动机是验收。验收停转之日,就是资产开始净折旧之时。
  4. 只记判断不比对结果,判例料就是死账。留痕机制必须自带验证环节。
  5. 盘点只回答一句话:模型换代明天发生,你的账面上还剩什么。
第 06 章

市场结构:Agent 劳动力市场

一家做企业 AI 服务的公司,商业模式的核心是转售算力额度:从上游按批发价拿,加价卖给企业客户,毛利大约五成。

这个模式在账面上很漂亮,直到你问一个问题:这五成毛利凭什么是你的?

上游模型的价格在持续下降,降价的速度快到今年的报价单撑不到明年。大厂正在直接推出面向企业的版本,中间这一层随时可能被跳过。转售者能守住的东西,只有客户不知道批发价这一件事——而这件事的保质期,等于客户第一次去查价格的时间。

同一家公司还在做另一件事:帮客户把业务流程梳理清楚、把判断记录建立起来、把评测跑起来。这件事很累、不好规模化、报价也说不清。

第一件事看起来是生意,第二件事才是生意。

原因在第一章就写好了:E1 说判断的生产成本趋于零。生产成本趋零意味着任何靠"我这里生产更便宜"建立的位置都会被抹平。利润不会消失,它会迁移——从执行层迁移到判断层,从算力迁移到上下文、评测与担责。这一章要讲的就是迁移之后的市场长什么样。

一 · 两种商品形态:卖 Skill 与租 Agent

Skill 是能力点,Agent 是岗位化实体(这组区分的真相源是认知工程派,本书直接引用)。

在经济学上它们是两种完全不同的商品:

SkillAgent
计价逻辑按调用(商品逻辑)按岗位租用(劳务逻辑)
可比价强,同类可直接比单价弱,与你的业务耦合
可替换低,有真实切换成本
记忆与积累有,越用越贴合
能爬责任阶梯吗难,锁死在 P-2能,可承担 P-3 及以上
利润趋势趋薄可维持

市场正在从卖 Skill 走向租 Agent,动力不是技术偏好,是定价的必然:Skill 无法承载责任,因此无法离开 P-2。一次调用出错了,你找谁?调用方按次付费,供应商按次收钱,谁都没有承诺什么。而一个被"雇"进你业务里的 Agent 不同——它有岗位、有绩效、有可以被追溯的工作记录,因此可以谈责任,也就可以谈价格。

这条推论有一个实用的推广:如果你现在卖的是 Skill 而想涨价,第一步不是优化模型,是把交付形态从"接口"改成"岗位"。 岗位化不是包装,它要求你真的接住一部分结果责任。

二 · 三个结构特征

黑洞护城河

三股力量叠加,使 Agent 市场天然趋向"一岗一供应商"的深度绑定:越用越准(判例料在它那里积累)、数据沉淀(历史全在它的上下文里)、切换成本(换一家等于重新训一个新员工)。

这不是某家公司的策略,是这类商品的结构。买方的对策不能是"不要绑定"——不绑定就没有积累,等于永远停在 P-2——只能是有准备地绑定:见下文的防绑定五条。

采购权与使用权的合一

传统企业软件有一个长期存在的错配:买它的人(IT、采购)不用它,用它的人(一线)不买它。于是采购决策可以长期与实际价值脱节,虚荣采购能存活很多年。

按用量计费的 Agent 改变了这件事:账单直接反映使用量,老板第一次能一眼看出哪个系统真的在被用。用量成为价值信号,虚荣采购难以为继。

这是本书少数几个对买方无条件有利的结构变化〔推断〕

密度差贸易:卖回路,不卖答案

组织之间可以交易的,是密度增长的能力,不是密度存量(这条推论来自智能密度体系)。

这定义了咨询与陪跑这门生意的本质:答案有保质期,装一台会自己转的回路才是可以收年费的东西。一份诊断报告交付之后就开始贬值;一套跑起来的验收—回流机制会自己产生新的判例料,价值随时间上升。

卖答案的咨询公司在和免费模型竞争。卖回路的公司在卖一种买方自己装不起来的能力。

三 · 判断服务的自毁性

这门生意有一个内生矛盾,做得越好,它越明显。

一位经营者在讨论深度陪跑模式时,用了一句老话:教会徒弟饿死师傅。这句话的完整表述是:

所有陪跑型判断服务的根本悖论是:成功等于客户不再需要你。

这不是服务商不够精明,是 E2 的直接后果。判断可复制——你交付的判断一旦进入客户的组织,就开始扩散:客户学会了你的分析框架,积累了你帮他建的判例料,慢慢地他自己也能做这件事了。你越尽责,扩散越快。

而你唯一不可复制的存货是什么?担责能力。 客户可以学会你的方法,但他学不走"出事时你赔"这件事——那需要你的资本金、你的保险、你的法律主体。

由此得到判断服务商仅有的三条可持续策略,以及各自的代价:

策略一:向上爬到 P-5——卖担责,不卖判断。
把商业模式从"我告诉你怎么做"改成"做错了我赔"。代价是需要资本金或保险、需要历史损失分布、需要归因机制(三样都缺,见第八章)。这是最难走但最稳的一条路,因为客户学得走方法,学不走赔付能力。

策略二:自持评测集——卖验收,不卖生产。
客户可以自己生成判断,但他很难自己判断这些判断对不对。把自己变成那个"说什么算对"的角色,是一个不会被自己的成功摧毁的位置。代价是评测集的建设周期长、见效慢、而且今天几乎没有客户愿意单独为它付费(这正是第八章的 J7 缺口)。

策略三:把关系资本化——股权、长期绑定、深度共生。
用契约结构把双方利益绑在一起,让客户的成长变成你的收益而不是你的损失。代价最微妙,也最需要讲清楚。

关于第三条,有一个必须正面回答的问题:用锁定手段延长客户的依赖,正当吗?

我的答案是要分两种。一种是建设性绑定:因为你持续提供了客户自己做不到的东西(担责、评测、跨行业视角),所以他继续买。这种绑定是价值的结果,正当。另一种是摩擦性绑定:靠数据不可导出、格式不开放、退出成本高来留住客户。这种绑定与你提供的价值无关,它只是把客户的迁移成本变成你的收入。

判断这两者的方法很简单:如果明天所有的迁移障碍都消失,客户还会不会续约? 答案是"会",你在做建设性绑定;答案是"不会,但他走不了",你在做摩擦性绑定。

摩擦性绑定在短期内确实有效,我不打算假装它无效。但它有两个代价:它会让你停止改进(反正客户走不了),并且它在第一次事故后会以极高的成本一次性清算。更根本的是,一个靠摩擦留存的市场无法向 P-5 演化——没有人会把赔付责任交给一个连数据都不肯给的供应商。

这一节所依据的现象是真实的,对策的有效性是〔推断〕:目前还没有足够多的样本证明三条策略哪一条更优,只能说清各自的代价结构。

四 · 买方视角:防绑定五条

黑洞护城河对卖方是好消息,对买方是需要管理的风险。核心原则只有一句:

你的议价权,等于你迁移成本的倒数。

五条可以照着谈合同的清单:

  1. 导出格式写进合同。 不是"数据可导出"这种表述,而是"以何种格式、在多长时间内、是否包含判断依据字段"。判例料如果导不出依据,导出的只是数据不是资产(见第五章)。
  2. 第二供应商实测可用。 每年至少做一次真实的切换演练,不是评估一下可行性,是真的切一部分流量过去。没演练过的备选方案在真正需要时不可用。
  3. 评测集自持。 错误率基线是你的资产,不是供应商的营销材料。评测集在谁手里,"这个服务到底好不好"的解释权就在谁手里。
  4. 飞轮增值的分成条款。 你的使用数据在改进它,续约时这是筹码,不该是默认赠品(第二章的性质四,第八章的产权讨论)。
  5. 退租条款先谈。 Agent 在你业务里长出的能力,你不用它了怎么处理?今天几乎无人约定,我判断五年内会成为标准条款〔推断〕。先谈的人得利,因为这是唯一一个在关系最好的时候谈成本最低的条款。

这五条与智能体管理学的主权模型(G03)联动:那边关心的是治理结构,这边关心的是议价权。

反驳与回应

反驳一:市场会自己解决这些问题,不需要一套新理论。竞争充分之后,价格自然会反映价值,绑定自然会被开放标准打破。

在多数市场里我同意。在这里有一个具体的障碍:买方无法验证质量(第二章的性质一)。竞争压低价格的前提是买方能分辨谁好谁坏,而判断的验证时点常常在数月甚至数年之后。在买方无法分辨的市场里,竞争压低的不是价格,是质量——这是柠檬市场的经典结论。

至于开放标准,它需要有人先出钱建设,而建设者的收益会被所有人分享。这是标准的公共品困境,第八章会说明为什么这类基础设施在判断市场里迟迟没有出现。

所以准确的说法是:市场最终大概会解决,但"最终"的长度取决于制度什么时候到位,而制度不会自动到位。这本书的作用不是替代市场,是把已经在发生的事情命名,让参与者少交几年学费。

反驳二:自毁性被夸大了。真实世界里咨询公司活得很好,服务合同一签很多年——客户根本没有你说的那种"学会了就不需要你"的能力。

这条反驳有力,我承认自毁性在今天还不是主要矛盾。但两个变化正在加速它。

第一,判断的封装形态变了。过去顾问的知识装在人脑里,交付物是报告,客户很难复制。今天交付物越来越多地是可执行的形态——提示词、工作流、评测标准。可执行的东西天然可复制,客户的学习成本大幅下降。

第二,客户身边多了一个免费的翻译器。过去客户看不懂顾问的方法,现在他可以把交付物丢给一个通用模型问"这是什么意思、我能不能自己做"。这件事在三年前不存在。

所以我的判断是:自毁性今天还不致命,但它在变强,而三条对策都需要提前建设(保险要资本、评测集要时间、股权结构要谈判)。等到它致命的时候再开始建,已经来不及了〔推断〕。这是一条时间性的判断,可以被证伪——如果五年后陪跑型服务的平均合同年限没有缩短,我错了。

与兄弟体系的接口

认知工程派提供 Skill 与 Agent 的区分,本章只做经济学解释,不重新定义。

智能密度体系提供"密度差贸易"推论,是本章"卖回路不卖答案"的直接来源。

智能体管理学的 G03 主权模型处理买方治理结构,本章的防绑定五条是其经济学侧翼——一个谈权力,一个谈议价权。

保险与认证如何使 P-5 成为可能,属于第八章;本章只讲到市场结构层面为止。

本章小结

  1. Skill 按调用计价被锁死在 P-2,Agent 按岗位租用才能爬责任阶梯。想涨价,先把交付形态从接口改成岗位。
  2. 黑洞护城河使市场趋向一岗一供应商。买方的对策不是不绑定,是有准备地绑定。
  3. 咨询与陪跑的本质是卖回路,不卖答案。答案会贬值,回路会增值。
  4. 判断服务有自毁性:判断可复制,成功等于客户不再需要你。仅有的三条出路是向上担责、自持评测、关系资本化——其中锁定手段要区分建设性绑定与摩擦性绑定,后者短期有效,长期挡住了自己通往 P-5 的路。
  5. 买方的议价权等于迁移成本的倒数。五条防绑定条款里,退租条款是唯一一个在关系最好时谈成本最低的条款。
第 07 章

分配:平权悖论与哑铃社会

本章要点

分配:平权悖论与哑铃社会

一家做跨境电商的公司,每月处理三千单退款判定。小林(化名)是退款组的专员,工作是读工单、比对凭证、写一段判定说明;他的主管负责抽检、定阈值、在争议单上签字。

去年这家公司上了一套判定辅助系统。系统给出建议判定和理由,小林的工作变成把系统的输出核一遍、复制进工单。产能上去了,退款组从六个人减到两个人。同一个季度,主管那边多了一项职责:定义"什么样的判定算合格",每周抽三十单复核,把系统判错的类型登记下来。年底调薪,主管的职级往上走了一格,调整理由写的是"AI 运营质量"。

同一家公司,同一套工具,同一个季度,两个方向。

分岔发生的位置值得看清楚。小林和主管的领域知识差距,其实没有"六个人减到两个人"这么大——退款规则小林知道的不比主管少,某些冷门品类他还更熟。分岔发生在别处:主管有权说"这一条我认了",小林没有。工具把两人的生产能力拉到了同一条线上,而这条线以上剩下的那点差别,被放大成了两种命运。

这一章讲的就是这件事。当判断的生产成本趋零,分配的决定项从"谁能做出判断"移到了"谁有资格验收、谁有资格担责"。宏观生产函数(真相源:智能密度体系)是有效生产力 = 算力 × 智能转化率 × 智能密度;判断经济学补上它的分配面。

平权悖论:分子平权,乘数分化

"AI 会拉平差距"这个流行判断,方向是反的〔推断——这是本书最需要 J2 数据检验的一条〕。准确的表述是:智能平权,密度分化(密度推论六)。

P-1 到 P-3 档的判断服务人人可得,这是真实的平权(分子平权)〔已知〕——一个县城的会计师和一家四大所的经理,今天调用同一个模型,拿到的初稿质量差不了太多。但把这些服务转化为高密度产出的能力——验收力、编排力、定题力——集中在少数人和少数组织手里,且有复利(乘数分化)。平权的部分压低了中间档判断劳动的价格,分化的部分抬高了顶端验收者的溢价,收入分布于是向两端走。哑铃不是意外,是这两个力的合成结果。

把这句话拆开,机制有三层,一层比一层更难平权。

环节AI 之前AI 之后平权了吗
生成一份说得过去的方案需要训练三年需要三分钟平权了
判断这份方案在此处成不成立需要经验仍需要经验,且更难——错的东西看起来更像对的没有,而且变难了
为这份方案的后果签字需要职位与可承受的损失仍需要职位与可承受的损失完全没有

这张表怎么用:把你自己的一项工作放进第一列,逐行问"这一行对我变容易了吗"。第一行变容易的人很多,第二行变容易的人几乎没有,第三行只取决于你在组织里的位置,与 AI 无关。它失效的场合是那些第二行本来就极便宜的领域——比如判断对错立刻可知、且判错了只需重做一次的工作(代码能不能编译通过)。在那些领域三行会一起变容易,分化不明显。

第二行为什么不能平权,第二章已经给出了理由:验收是唯一随 AI 变强而变难的一环(性质二)。系统越强,它给出的错误答案越合理、越难被外行看穿。这意味着验收能力的门槛不是被抹平,而是被抬高了——AI 拉平了产出的外观,没有拉平识别产出的能力,而后者的价值恰恰由前者的外观质量决定。

第三行为什么不能平权,理由更硬:担责资格不是一种能力,是一种存量。它由三样东西构成——可承受的损失(钱)、被授予的签字权(职位)、可抵押的声誉(历史)。这三样都是存量,都需要时间积累,都无法由工具赋予。判断的边际生产成本趋于零(E1),担责的边际成本一点也没降——赔一次还是赔一次。这就是 E2 在分配面的直接表现:判断可复制,验收与担责不可复制。

于是有了本章的第一条判断:分配的决定项是第三行,不是第一行。价格追随责任(见第四章),责任追随签字权。一个人在第一行进步再多,只要他没有跨到第三行,他的议价能力增长有一个明确的天花板——那个天花板就是 P-3 的价格。

三个可观察的分配现象

第三条最容易被误读为管理问题。它不是。它是一个真正的要素约束:过去扩张的瓶颈是资本,资本可以借;现在扩张的瓶颈是"能说这一条可以的人"的小时数,这个东西借不到、买不到,也没法用钱加速培养。一家公司能同时跑几个 AI 场景,上限由它的验收人周决定,与它的预算规模无关。这条约束在分配上的后果是:验收者的时间成为准租金的来源,凡是稀缺且不可复制的要素,最终都会把剩余收益吸过去。

哑铃社会:被挤压的中间层到底是什么

哑铃的两端不对称,需要分别说清楚,否则会滑进"上层赢家、下层输家"的粗暴叙事——那不是本章的判断。

上端:定义标准与承担后果的人。具体是三类。第一类是定题的人——决定"我们该判断什么",也就是把一个模糊的经营处境切成若干个判断点。第二类是定标准的人——回答"什么样的产出算合格",写出别人拿着能独立判定通过与否的判据。第三类是签字的人——出事之后被问责的那个。三类经常是同一个人,但不必然。

下端:被判断服务的人。这是需求端,不是"低端劳动者"。一个独立开业的牙医、一个五人的外贸小老板、一个自由职业设计师,他们是判断服务的消费者,判断价格趋零对他们是净利好——过去请不起的法律意见、财务分析、市场调研,现在按次可得。下端里有大量高收入者。

所以本书讲的哑铃有两个坐标:位置哑铃(在判断链上的位置)和收入哑铃(位置的价格投影)。两者不完全重合,但趋于重合。误把它们当成一回事,会得出"哑铃下端都是穷人"的错误推论。

中间:三类正在被挤压的成分。这一层要具体到岗位类型,抽象地说"中层"没有用。

中间层成分典型岗位被挤压的经济学理由对应档位
执行判断客服工单分类、内容审核一审、退款初判、按 SOP 的资料归档判定有明确规则,系统错误率可低于人,且验收极便宜P-2/P-3 直接替代
传达判断把上级结论翻译成下级任务的中层、把专家意见整理成报告的分析员、把客户需求转述给技术的对接岗这类岗位不生产新判断,只降低判断的传输成本;而传输成本趋零岗位的存在理由消失
有标准答案的判断标准合同条款审查、基础影像阳性初筛、一审信贷、简历初筛、基础财务稽核、翻译、初级代码审查事后能查到唯一正确答案,因此错误率差可测、验收成本低,净价值最高P-3 的主战场

这张表在说什么:三类成分被挤压的共同原因不是它们简单,是它们好验。把价值基本式写全就看清楚了——

净价值 = 失误后果 × (人的错误率 − 系统错误率) × 频次 − 验收成本 − 责任承载成本

替代一个岗位成分的经济性,由这个净值决定。验收成本越低,净值越高,替代越划算。而"有标准答案"恰恰意味着验收极便宜(对答案一查就知道)。于是得到本章最反直觉的一条:

一个岗位会不会先被替代,主要不看它多难,看它多好验〔推断〕。难而好验的岗位(放射科初筛、合同条款比对)比简单而难验的岗位(判断一个客户投诉背后是不是有更大的关系风险)更早被挤压。技能难度与替代顺序之间没有稳定关系,验收成本与替代顺序之间有。

这张表什么时候失效:当验收本身被自动化到足够可信时,"验收成本低"就不再是替代的必要条件,第三类的边界会往上移,一部分现在被划为"无标准答案"的判断会掉进贬值区。这不是假设,这是本章第三节那张五成分表最可能失效的方向,反驳三会正面处理它。

岗位的成分拆解:五成分自测法

岗位不是原子,是混合物。同一个职位名称下,不同的人做着完全不同的成分配比——这就是为什么"某某岗位会不会消失"这个问题永远没有答案,而"我这个岗位里有多少比例在贬值区"这个问题有答案。

成分判据(一句话自问)价格方向
执行做错了不需要人担责,只需要重做一遍贬值
传达我不改变结论,只改变它到达谁、以什么格式到达贬值最快
有标准答案的判断事后能查到唯一正确答案,且争议会终止贬值
无标准答案的判断事后仍有分歧,答案取决于处境与偏好升值
验收与担责我说"可以",出事我被问升值最快

判据的分界线沿用本书的判断点定义(真相源:智能密度体系):做错了有人担责的才是判断,其余是动作。第一格与后四格的分界在这里;第三格与第四格的分界在"事后争议会不会终止"。

可自测的拆解方法,五步,一小时之内能做完:

  1. 取证据,不取回忆。打开过去两周的日历、工单系统、聊天记录、提交记录。人对自己工作成分的回忆系统性地偏向高价值那一端,这一步是为了绕开它。
  2. 切时间块。以三十分钟为最小粒度,给每一块标一个成分。一块只能标一个——如果觉得"两个都是",标那个"如果做错了会被问责"的那个。
  3. 算比例。把五个成分的时间占比算出来。前三格加总就是你的贬值区占比。
  4. 做替换测试。对占比最大的两格分别问:如果这一块的产出换成模型的产出,谁会发现差别?多久发现?没人会发现,或者要三个月才发现——这一格无论你标的是什么,实际上都在贬值区。
  5. 找升值区的入口。在第四格和第五格里,找出你已经在做但没被计价的部分。多数人在第五格上有隐性投入(同事私下问你"这样行不行"),但这部分从没写进职责说明,也从没进过调薪理由。

关于比例的一个诚实说明:我没有大样本数据能告诉你"多少比例算危险"。凭我看过的几十个岗位拆解,贬值区占七成以上的岗位在三年内会被重新设计——但这是一个从小样本得到的印象,不是统计结论〔推断,验证方式:对同一批岗位做三年跟踪,看贬值区占比与岗位存续的相关性〕。

最后一句提醒,它比上面所有步骤都重要:这张表拆的是岗位,不是人。同一个人在不同判断点上的成分完全不同,把个人当成一个固定的成分配比,是下一节要专门处理的错误。

现场:当经营者用"AI 的判断"给岗位定价

上面这套算式听起来像理论。它不是。市场上已经有人在这样算,而且算得比本书直白。

在一次真实的企业内部讨论里,一位经营者谈到 AI 落地之后的岗位评估,说法是这样的——【原文】"今天我判断这个员工是不是还够格在这个岗位……企业的能力、AI 的能力,是一个乘法公式,这个能力我们以 1 为标准,结果他的能力只有 0.6。"

这段话要两面写。只写一面的人,要么在做理论的鼓吹,要么在做道德的表态,两者都不诚实。

一面:理论被现场独立印证。

这位经营者做的事,正是价值基本式在人事上的投影。把 V 式换个符号方向,就是一个岗位的判断溢价:

岗位判断溢价 = 失误后果 × (系统错误率 − 该岗位持有者的错误率) × 频次

注意括号里的减法反过来了。对采购判断服务的买方来说,值钱的是系统比人更准的部分;对一个在岗的人来说,值钱的是他比系统更准的部分。同一个差值,两个方向,是同一件事。

那个"0.6"是什么?它是这个差值的一次粗糙度量。它说的是:在这个判断点上,人相对系统的剩余优势已经收窄。经营者没有用本书的语言,但他量的正是本书说的那一项。这是一条值得记下的证据——市场已经在用"人的判断与系统判断的差距"给岗位定价,只是还没有人把这件事写成算式〔已知:这一说法来自一次真实的企业内部讨论的逐字记录〕。

另一面:三条必须写出来的警告。

警告一,这种评估的权力极不对称。谁定义那个"1"?定义标准的人同时是评估者,也是评估结果的受益者。没有第三方评测,没有申诉通道,没有对评估者本身的评估。这不是这位经营者的问题——他手上根本没有可用的工具,市场没有提供。第八章会从另一个方向说同一件事:服务商自称达到某个能力档位,客户同样无法核实。评估权力在两个方向上都是不对称的,缺的是同一样东西——独立的度量衡。

警告二,把人压缩成一个系数是范畴错误。0.6 是某一个判断点上的相对差值,不是一个人的能力。同一个人在不同判断点上的系数可以差很远:一个在标准工单判定上只有 0.6 的人,在处理不讲道理的老客户时可能是 1.5。用单一系数给人排序,是把一个多维向量压成标量,而压缩过程中丢掉的,往往正是这个人不可替代的那几维。一旦这个系数进了人事系统,它会开始自己生长——被写进考核表、被用来排序、被用来解释决定,而没有人再回头问它当初测的是哪一个判断点。

警告三,差值小不等于这个人没价值。差值收窄有三种成因,处方完全不同:

成因实际含义正确处方常被误当成
a. 这个人退化了长期不做裸判断,能力真的下滑换人,或先给恢复期——
b. 这个判断本来就有标准答案判断被标准化,系统学会了换岗位设计:把人移到尚未标准化的判断点a
c. 评测只测得到标准化的部分度量工具的局限,不是人的局限换评测a

以我看到的情况,现实里最常见的是 b 和 c,最常被认定的是 a〔推断,验证方式:对已执行的岗位合并做回溯,看被合并岗位的实际差值收窄成因分布〕。

收束:这一节评估的是岗位,不是人。合并一个岗位是结构判断——它说的是这个判断点上的人机差值已经收窄,不是说坐在这个位置上的人不好,更不是说这个人在别的判断点上也是 0.6。把两者混同的后果不止是道德上的,也是经济上的:

一家把 b、c 两种成因误判为 a 的公司,会在裁掉执行成分的同时,把自己剩余的验收能力一起裁掉。三个月后模型出错,公司里已经没有人认得出那是错的。验收能力是组织里最难重建的一项资产(见第五章:验收停转之日,就是判断资产开始净折旧之时)——它不在岗位说明书上,通常也不在被保留的人手里。

所以,用人机差值评估岗位是一个正确的方向;用它评估人是一个范畴错误;在没有独立度量衡的情况下用它做不可逆的人事决定,是把一个未经校准的测量工具接到了一个高后果的执行器上。

验收位的门票:三样,都可以在现岗位上先练

往验收位移动,不是换一份工作,是在现在这份工作里先长出三样东西。三样有顺序,跳过前两样直接要签字权,是拿职业生涯做敞口。

门票一 · 能定义合格标准。

练法:挑你手上最常做的一类产出,写一份三条以内的合格判据。硬要求是——别人拿着它,能在不问你的情况下独立判定通过或不通过。写不出来,说明你一直在凭感觉验收,而凭感觉的验收无法被计价。

第二步是校准:找一位同事,用你的判据独立判十份,然后比对结论。一致率低于八成的判据不是判据,是形容词("逻辑清晰""表达专业"这类词全都是形容词)。判断一致率是认知工程派三指标之一,这里只是它的私人用法,定义不改。

门票二 · 能读懂失败模式。

练法:建一份自己的失败清单。每周记三条"系统给的东西看起来对、其实不对"的例子,每条标一个类型——编造出的事实、忽略了某个约束条件、把特例当通例、在自己不该说话的边界外仍给出了自信的答案。

三个月后,你手上会有一份属于你这个领域的边界失效清单。这就是评测集的私人版本(判断资产四科目之一,见第五章)。它的价值不在于让你不用 AI,在于让你在三十秒内看出这一次能不能用——而这正是验收位每天在做的事。

门票三 · 能签字担责。

这一样最难,因为它不完全由你决定:签字权是被授予的,不是被练出来的。

练法是从可撤回的签字开始。在现有职责范围内找一个后果可控的判断点,向上级申请:"这一类我直接定,出问题我报,你每月抽检。"三个条件缺一不可——范围小、后果可控、有回收机制。上级同意的概率比多数人以为的高,因为你在替他省的正是最稀缺的那样东西(他的验收人周)。

你累积的不是权力,是担责记录:我签过多少次、错过几次、错了之后怎么处理的。这一栏是简历上唯一无法由模型代笔的内容——模型可以写出你做过什么,写不出谁在你签字之后没有被问责。〔推断:担责记录会成为一种可携带的凭证,验证方式是观察三到五年内招聘环节是否出现对"独立决策范围与差错处理记录"的结构化提问〕

三样的顺序是一到二到三。先能定义合格,才谈得上认出不合格;先能认出不合格,签字才不是赌博。

深入 · 给个人的三条职业含义

一、往验收位移动。同样的领域知识,站在"生产判断"的位置贬值,站在"验收判断"的位置升值——简历上最值钱的一行正在从"做过什么"变成"验得动什么"。

具体到动作:把你现在写在简历上的动词换一遍。"负责撰写""参与制定""协助完成"是生产端的动词;"定义了……的合格标准""建立了……的复核机制""独立签署……范围内的决定"是验收端的动词。换不动,说明不是表述问题,是位置问题——回到五成分表,再看一遍你的第五格占比。

二、积累可携带的判断资产。你的判例记录、你的评测直觉、你对边界的敏感——这些随人走;执行技能不随人走(它随模型走)。

区分的判据只有一条:这件东西在你换一家公司之后还成立吗。对某个具体系统的操作熟练度不成立;"这一类客户在这一类情况下通常会这样反应,我记录了四十条"成立。前者是执行技能,模型换代它就归零;后者是偏好料与判例料的私人版本,它跟着你走。多数人从没有意识到自己每天都在丢弃后者——判断做完了,结果回来了,没有人把两者对上。对上一次的成本是十分钟,不对上的代价是这一年的经验等于零。

三、警惕高让渡的舒适期。让渡越顺手,退化越无声——每周留几个"裸判断",像健身一样。

这里必须把术语用准:让渡深度是智能密度体系的 L 刻度,责任深度是本书的 P 档,两者相关但不是一回事,不能互换(见本章末尾的接口说明)。一个人可以让渡得很深而完全不承担责任,那是最舒服也最危险的组合——判断由系统做,责任在别处,个人的判断肌肉在无痛中萎缩,而萎缩这件事没有任何指标会报警。裸判断的做法很简单:一周挑两三个不大不小的判断,先自己写下结论和理由,再去看系统怎么说,然后比对。比对本身就是练验收,而且这是唯一能让你知道自己退化到哪一步的方式。

反驳与回应

反驳一:这套说法本质上是在告诉普通人认命。中间层被挤压是资本与技术的结构性后果,把它翻译成"你要往验收位移动""你要积累可携带资产",等于把结构问题包装成个人努力问题——最后所有没能挤上验收位的人,都会被解释成自己不够上进。这是最省事、也最不负责任的一种写法。

回应:这条反驳的前半段是对的,本书接受。

哑铃是结构生成的,不是个人选择生成的。本章第二节整段论证说的正是这件事:中间层被挤压的原因是那个净值算式,不是中层不努力。价值基本式里没有一项叫"努力程度"——这个算式恰恰是反驳"你没跟上时代"的工具,不是它的帮凶。任何把结构性挤压说成个人品质问题的说法,本书不接受。

但承认结构性,不解除个人的处境。经济学的通常做法是把这两件事分开处理,本书也这样做:结构问题要结构解法,个人建议只解决"在结构改变之前的这几年怎么办"。把两者混为一谈,无论朝哪个方向混,都是在骗人——用个人努力掩盖结构问题是一种骗法,用结构必然性劝人不必行动是另一种。

然后是本书必须承认的边界。判断经济学能说清价格如何形成、验收位为什么稀缺、哪一类岗位成分先贬值。它说不清、也不打算假装能说清的是:当一个经济体的中间层判断岗位在十年内大幅缩减,应该由什么样的财政、社保与教育安排来承接。那是公共经济学与劳动经济学的题目,本书没有工具,越界写出来的东西也不会有人信〔已知边界,见第十一章的适用范围声明〕。本书只承诺一件事:不用"个人成长"的语言掩盖结构问题的存在。第八章讨论的制度供给(评测、认证、保险、公共判例库)是本书能给出的结构解法,它不完整,但它是真的结构解法,不是心理建设。

最后一句是给读者的:如果读完本章你得到的结论是"我要更努力",那么你读错了。本章的结论是——努力的方向由岗位成分决定,而成分不是你选的;但成分表是可以查的,查完再选,是唯一比听天由命更好的动作。

反驳二:哑铃只是过渡形态。历史上每一次技术革命都消灭旧岗位、创造新岗位,蒸汽机没有让人失业,计算机也没有。二三十年后中间层会以新的形态重建,现在为它写讣告为时过早。

回应:这条不能简单否定,历史确实如此。要认真回应,只能指出这次的差别在哪,以及在什么条件下这条反驳会赢。

差别在于新岗位落在哪一层。过去几次技术革命消灭的主要是执行岗,而新创造的岗位大量落在"协调与传达"层——现代管理层、办公室职员、中层职能部门,基本都是工业革命之后被创造出来的,中间层是那几轮技术革命的产物。这一次被直接命中的,正是那一层。

要重建中间层,需要出现一类新的判断点,它得同时满足:验收成本低(否则供给不起人手)、后果不重(否则要求担责资格)、但仍然需要人(否则直接自动化)。这三条同时成立的空间存不存在,本书不知道。本书不认为它一定不出现,但也找不到理由认为它一定会出现得足够快、足够多〔需确认〕

验证方式说清楚:观察未来五到十年新增岗位在"验收密集度"上的分布,是双峰还是单峰。如果新增岗位重新在中位验收密集度上聚集,这条反驳赢,本章的哑铃判断降级为过渡期描述。J2 的招聘面板研究可以顺带回答这个问题(见第十一章)。

这是本章最容易被推翻的一条,写在这里就是为了让它可被推翻。

反驳三:验收位也会被 AI 占领。用模型评审模型已经在做,而且比人做得稳定。把"验收"说成不可替代的护城河,是这本书自己的一厢情愿。

回应:技术判断上,这条反驳基本正确,本书不辩。模型评审模型在有标准答案的判断上已经有效,并且会继续变好。

分歧在于"验收位"这个词包了两件事:判定担责。模型可以做判定,不能做被告。当一个判断错了、后果落到了第三方身上(第二章性质三),需要有一个可被起诉、可被罚款、可被解雇、可被追偿的主体,而这个主体只能是自然人或法人。判定可以外包给系统,被告席不能。

诚实地说,本章第三节的五成分表把"验收与担责"合并成一格,是一次简化,而且这个简化会随着自动评测成熟而失效。届时这一格要拆成两格:验收(判定)会滑向贬值区,担责(签字)留在升值区,而且因为总量更少,它会更值钱。到那时哑铃会变得更极端,不是更平缓——这不是好消息,但它是这条反驳推到底之后的结论。

〔推断,验证方式:观察企业内部是否出现独立于业务线的"AI 评测岗",以及该岗位与签字权是否分离。若评测岗大量出现且不带签字权,说明拆分正在发生。〕

与兄弟体系的接口

智能密度体系是判断点、L1–L5 判断让渡刻度、智能密度与宏观生产函数的真相源,本章直接引用,不改定义,只补它的分配面。需要显式区分的是:L 刻度描述让渡深度(人把多少判断交出去),P 档描述责任深度(做错了谁赔),两者相关但不是一回事,任何场合都不可互换。一个岗位完全可以处在很深的让渡状态而责任仍停在 P-2——大量让渡、无人担责,这是风险最高的组合,也是本章第三条职业含义针对的情形。

认知工程派是三指标(判断一致率 / 复现率 / 边界失效率)的真相源。本章在"门票一"里把判断一致率用作个人校准工具,是应用不是重定义。

智能体的社会科学处理委托与委托契约,也就是"担责资格如何被授予、被授予者与授予者之间是什么关系"。本章只把签字权当作一个既定的稀缺要素来分析价格后果,不处理它的授予机制。

智能体管理学(AMS)处理岗位体系、职级设计、组织内的责任分配与岗位重构的具体做法。本章只给价格机制的解释,不给组织改造方案——一旦读者的问题变成"我们公司该怎么改岗位说明书",那已经越界,应路由到 AMS。

本书自己是责任阶梯 P-1–P-5、价值基本式、判断资产四科目的真相源,兄弟体系反过来引用。

本章小结

  1. AI 拉平了判断的生产能力,没有拉平验收能力,完全没有拉平担责资格——而分配由后两者决定。
  2. 哑铃有两个坐标:判断链上的位置哑铃,与它的价格投影收入哑铃;两者趋于重合但不等同,下端是需求端,不是穷人。
  3. 中间层先被挤压的原因不是它简单,是它好验——验收成本低使替代的净值最高。技能难度与替代顺序之间没有稳定关系。
  4. 岗位可拆成五种成分,拆解要用日历和工单,不用回忆;拆的是岗位,不是人。用人机差值评估岗位是对的,用它评估人是范畴错误。
  5. 验收位的门票是三样:能写出别人能独立执行的合格判据、能列出自己领域的失败模式、能拿到一块可撤回的签字权。三样有顺序,都可以从这个月开始在现岗位上练。
第 08 章

制度:产权、公共品、保险与认证

一个平台在设计分账规则时卡住了。

它把一笔收入拆成两部分:一部分叫授权费,付给提供形象的艺人;另一部分叫平台服务费,归平台。技术上,这两笔钱来自同一个客户的同一次付款。会计上,怎么拆都是拆。真正的难点在别处——负责人是这样解释的:

「防止他觉得好像我的这个人脸是我授权的,那凭什么你平台可以获得分成呢。」

同样一笔钱,写成"从你的授权费里分走三成",对方会觉得被拿走了东西;写成"平台服务费另计",对方觉得那本来就不是他的。

这件事表面上是话术,实际上是产权。在权属边界还没有被公认的地方,账目的命名方式就是分配本身。 一个新市场早期的所有分配争议,都发生在这种命名还没有固定下来的缝隙里。

判断市场现在整个就处在这种缝隙里。这一章讲四件事:三桩没人说得清归属的产权悬案;一类正在变成基础设施却还按商品定价的服务;两根信任品市场必需但还没立起来的柱子;以及一个明明有明确价值、明确买家,却始终没有形成市场的资产。

一 · 产权三悬案

悬案一:飞轮增值归谁?

买方的使用在改进卖方的服务(第二章性质四)。当前的默认答案是全部归卖方,写在服务条款里。

这个默认答案的不稳定之处在于:买方付了钱,同时无偿提供了让服务变好的生产资料,而改进之后的服务将以更高的价格卖给包括其竞争对手在内的所有人。

可预见的均衡是"数据分红"类条款——大买方将率先谈判拿回一部分增值分成〔推断〕。理由是议价权分布:占供应商收入较大比例的客户有条件提出这类要求,而一旦有一份合同这样签了,它会成为后来者的谈判锚点。小买方拿不到这条,但会因为大买方的先例而获得更明确的表述。

悬案二:被萃取的专家判断归谁?

要把一位资深者的判断封装成可执行的形态,必须由他本人把说不清的默契讲清楚。而讲清楚的那一刻,他就开始贬值——这是"封装即替代"的阻力,也是所有 AI 落地项目里最常见的软性抵抗。

认知工程派用"认知供给协议"给了合同框架:校准者角色、署名权、收益分成。判断经济学补上定价基础:

专家判断的萃取对价 = 该判断点的年价值 V × 预期封装存续年限 × 分成率

三个因子都可估:V 用第三章的公式算;存续年限用第五章的折旧规则估(依赖私域默契的部分折旧慢,存续长);分成率是谈判结果。

没有这个算式,"你越配合越贬值"的阻力无法用价格化解,只能靠行政压力推进——而行政压力推不出高质量的偏好料,因为一个人可以配合地讲,也可以配合地讲一半。

悬案三:Agent 积累的能力归谁?

租来的 Agent 在你的业务里跑了三年,长出了一批只在你这里成立的判例料。退租时,这批东西归谁?

今天几乎无人约定。我判断五年内它会成为标准合同条款〔推断〕,类比是明确的:离职员工的竞业限制与职务发明条款,处理的是同一类问题——受雇期间产生的能力,归属如何切分。人力资源领域花了几十年才把这套条款写清楚,判断服务市场大概率会走一条更快但同样曲折的路。

第六章的防绑定五条第五条已经给了买方的行动建议:退租条款先谈,因为这是唯一一个在关系最好的时候谈、成本最低的条款。

二 · 公共判断品:一个被当成商品定价的俱乐部品

基础判断服务——导航、搜索、基础诊断、通用问答——正在逼近公共品的社会地位:数十亿人依赖,缺了它日常生活会明显受损。

但严格说它不是公共品。公共品的定义要求非竞争性与非排他性,而推理算力有竞争性(算力有限,用的人多了会排队或涨价),接口有排他性(可以随时切断某个账号)。它是俱乐部品:在俱乐部内部近似公共品,进不来的人完全用不到。

一个由三五家公司供给、数十亿人依赖的俱乐部品,其定价与准入必然成为公用事业式的监管问题。历史上电力和电信走过这条路:先是商业创新,然后是自然垄断,然后是普遍服务义务与价格管制。判断基础设施大概率会再走一遍〔推断〕

《智能革命史》给了一条时间性的观察可以配合使用:规则在扩散早期是软的。这意味着现在这个阶段的定价自由度是暂时的,市场参与者应当预期到规则会变硬,而不是把当前的自由度写进五年财务模型。

三 · 保险与认证:信任品市场的两根柱子

第二章说过,信任品市场不装制度就会柠檬化。历史上的解法从来是两件套。

第三方认证压缩信息不对称。放到判断服务上,认证就是:由独立第三方测三指标(判断一致率、复现率、边界失效率)并公示结果。

保险承载残余风险。放到判断服务上,就是为 P-5 档的赔付承诺承保——让卖方敢于签下"做错了我赔",因为背后有精算和资本金撑着。

这两个行业出现之日,就是判断市场从早期集市变成正规市场之时。做成认证与保险的人,将同时拥有这个市场的度量衡清算所——我认为这是判断经济里最被低估的两个位置〔推断〕

但两根柱子今天都还没立起来,原因各不相同,值得分开说。

保险缺三样。 缺损失分布数据(没有历史赔付记录,精算无从下手);缺归因机制(一次损失里,多少是模型的错、多少是数据的错、多少是使用方式的错,目前无法切分);缺资本金(愿意承接的主体规模太小)。三者互为因果:没有数据不敢承保,不承保就产生不了数据。打破这个死循环通常需要一个外部推动——监管要求、龙头买方的强制条款、或者一次足够大的事故。

认证缺的是第一推动力。 技术上今天就能做(三指标的测法是清楚的),缺的是"谁来认证认证者"以及"第一批被认证者凭什么愿意花钱"。

四 · 那个明明有价值有买家却没有市场的资产

这一节是本书这一版新增的,它来自一个让我意外的观察。

前面的分析预期:既然验收如此关键、如此昂贵、如此难,那么真实的采购合同里一定会有一整套验收条款,评测服务也应当形成一个热闹的市场。

真实情况是两头都空。

我复盘的那桩谈到报价阶段的采购,价格谈得很细,验收条款完全空白——什么算成效、谁来判断、用什么指标,三问都没有出现在方案里〔已知〕。而在整个市场层面,我至今没有找到一家以"独立评测判断服务质量"为主营业务、且规模化运转的机构〔已知,指本人观察范围内〕。

这构成一个奇怪的组合:

评测集是一种尚未被交易的资产。
它有明确的价值(决定了服务能不能卖出 P-3 以上的价格)、有明确的买家(每一个想涨价的卖方、每一个怕买错的买方)、有清楚的技术方法(三指标),却没有市场。

为什么?我能想到四条原因,都标〔推断〕

第一,谁来认证认证者。 一份评测报告的可信度取决于评测方的公信力,而公信力需要时间积累。第一家评测机构面对的问题是:凭什么信你?

第二,初期无基准。 评测的价值来自比较——知道行业平均错误率是 3%,才知道 5% 是差的。第一批评测数据没有可比对象,因此单份报告的价值很低,价值要等样本量起来之后才出现。这是典型的网络效应冷启动问题。

第三,买方不知道该要。 采购方多数还不知道"我应该要求供应商提供第三方评测报告"这件事。需求还没有被表达出来,供给自然不会出现。这一条是本书试图直接改变的——第四章的第三问就是把这个要求变成一句话。

第四,卖方不想要。 对多数今天的卖方来说,独立评测是纯粹的风险:测出来好,客户觉得本该如此;测出来不好,价格立刻掉一档。只有那些确实做得好、且想以此拉开与同行差距的卖方,才有动力主动送检。这个群体今天还太小。

四条原因里,第三条和第四条会随时间自行缓解——买方会学会要,头部卖方会发现送检是差异化手段。第一条和第二条需要一个协调机制:行业联盟、监管强制、或者一个足够大的买方单方面要求所有供应商送检。

这个缺口重要到值得写成一条独立的可检验主张。第十一章的 J7 评测集市场主张由此而来:五年内会出现独立的第三方判断评测与审计服务,且其定价与被评测服务的责任档位正相关。如果五年后它仍未出现,说明"验收可以被定价"这个假设不成立,本书的第五章与第八章需要重写。

五 · 一个连带缺口:档位自评没有验证市场

同一个缺口还有第二种表现形式。

我记录过一家服务商在洽谈中自称已经达到某个很高的 AI 化等级〔转述〕,这个等级是它自己定义、自己评定的,没有任何第三方背书,客户也没有任何办法核实。

这不是个别现象,而是当前市场的默认状态:能力等级的自评没有验证市场。 每家公司都可以定义自己的分级体系并把自己放在高位,因为没有人有权、也没有人有能力说不。

这与第四章的核心结论直接呼应:没有评测就没有溢价。买方面对一个无法核实的等级声明时,理性的做法是按最低可验证的档位(通常是 P-2)出价。卖方自评越高、越无法核实,买方的理性折价就越深——这是一个会自我惩罚的均衡,也是头部卖方最终会主动要求被评测的原因。

深入 · 认证与保险最先出现的三个行业(预测)

三个预测,全部标注置信与验证方式。

医疗辅助诊断。 验证时点短(影像有金标准,对错很快揭晓)、失误后果极高、且已有成熟的认证文化(医疗器械审批本来就是一套认证体系)。三指标认证最容易嫁接到既有审批流程上。
置信〔推断〕。验证方式:观察是否出现将三指标类质量数据纳入审批或上市后监测要求的规定。

金融风控。 错误可直接计价(损失就是钱)、监管本来就要求模型验证(模型风险管理已是成熟职业)。判断保险在这里只需要在既有框架上更换标的,不需要重建方法论。
置信〔推断〕。验证方式:观察是否出现以"AI 模型误判导致的直接损失"为承保标的的保险产品。

法律文书审查。 职业责任险成熟、错误归因相对清晰(哪一条没审出来是可指认的)。律所把 AI 辅助纳入既有承保范围,只是条款升级而非新建险种。
置信〔推断〕。验证方式:观察职业责任险条款中是否出现针对 AI 辅助工作的明确表述。

三者的共同点:验证时点短 + 后果可计价 + 已有责任文化。

反过来,营销创意类判断将最晚被认证——不是因为它不重要,是因为它归不了因。一次投放效果不好,可能是创意问题、时机问题、产品问题、竞品动作,无法切分。归因不能,则认证不能,则保险不能,则 P-5 不能。 这条推论适用于任何行业:想知道你所在的领域什么时候会出现认证与保险,先问"一次失误能不能被清楚地归因"。

反驳与回应

反驳一:这些制度不会出现,因为没有人有动力先出钱。你自己列的四条原因已经说明了这是死局。

四条原因确实构成协调难题,但死局的说法太强。历史上同类的死局都被打破过,打破的方式只有三种,而这三种在这里都有可能。

监管强制:某个高风险领域出现足够严重的事故,监管要求所有同类服务提供第三方质量证明。这是最常见的路径,也是最不需要市场自觉的路径。

龙头买方单方面要求:一个占供应商收入相当比例的大买方,把"提供独立评测报告"写进采购标准。它一家的要求就能催生第一批评测机构,因为供应商为了这笔生意会去送检。

头部卖方主动送检:做得确实好的卖方发现,主动接受评测是把自己与同行拉开的最便宜手段。这一条的动力随着市场里滥竽充数者增多而增强。

三条路径至少有一条会走通〔推断〕,问题只是时间。我把时间写进了 J4、J5、J7——五年。如果五年后三条都没走通,这个反驳成立。

反驳二:判断保险在技术上不可能。判断错误的损失无法界定,因果关系无法证明,任何精算模型都建不起来。

这条反驳误把"现在难"当成了"原理上不可能"。

对照一下网络安全保险:二十年前人们也说数据泄露的损失无法界定、因果无法证明、精算无从下手。今天它是一个成熟的险种。它是怎么解决的?不是解决了归因难题,而是换了赔付触发条件——不赔"因为你的疏忽导致的全部后果",而赔"发生了某个可客观观测的事件之后的特定成本",比如通知成本、取证成本、监管罚款、业务中断天数。

判断保险大概率会走同一条路〔推断〕:不承保"这个判断错了造成的全部损失",而承保"当评测集上的错误率超过约定阈值时的特定赔付"或者"因误判导致的直接可计量资金损失,以服务费的某个倍数为限"。第一档的产品甚至可以简单到只是把服务费退回并覆盖客户的复核成本。

这样一来,精算所需的就不是"判断对错的完整因果链",而是"错误率的分布"——而错误率的分布,正是评测集能提供的东西。保险的前置条件是认证,认证的前置条件是评测集市场。 三者是一条链,不是三个独立的难题。这也是为什么 J7 是这一版新增主张里最靠前的那一条。

与兄弟体系的接口

《智能体的社会科学》处理责任缺口的规范性问题——责任应当如何分配、意义与担责为何不可让渡。本章处理的是价格问题:责任如何被定价、缺失的制度如何被建立。两者共享地基(E2 与该体系的 A2 是同一条不对称),但不能互相替代:制度的正当性不能由价格论证,价格的形成也不能由正当性替代。

认知工程派的认知供给协议是悬案二的合同框架,本书补的是定价基础。

智能革命史提供"规则在扩散早期是软的"这条时间性观察,用于判断当前定价自由度的持续时间。

智能密度体系的验证时点概念是本章"归因能力决定认证顺序"这条推论的直接依据。

本章小结

  1. 产权三悬案:飞轮增值、专家萃取对价、Agent 积累能力的归属。在权属命名固定之前,账目怎么写就是分配本身。
  2. 基础判断服务是俱乐部品不是公共品,公用事业式监管在路上。当前的定价自由度是暂时的。
  3. 认证与保险是信任品市场的两根柱子。保险缺数据、缺归因、缺资本金;认证缺第一推动力。
  4. 评测集是一种尚未被交易的资产——有价值、有买家、有方法,却没有市场。这是本书识别出的最大制度缺口,写成了 J7。
  5. 归因不能,则认证不能,则保险不能,则 P-5 不能。想知道你所在的领域什么时候会长出这些制度,先问一次失误能不能被清楚地归因。
第 09 章

算例集:四个行业与一桩真实交易

理论的试金石是算得动真实场景。

本章用价值基本式与责任阶梯走四个行业,每个算例回答同样三个问题:判断点是什么、V 怎么算、卡在阶梯第几档以及为什么。最后再拆一桩真实发生过的交易——它谈到了报价,却没有验收页。

关于数字的一次性声明:以下四个算例中的所有数字都是示例假设,用来演示算法而不是报告统计。它们的量级参照了公开信息与作者的实务经验,但没有一个来自可引用的统计源〔推断〕。要点不在数字本身,在于每一个数字都指向一个可采集的字段——你可以把自己的真实数字填进同样的位置。第五个案例不同,那里的事实来自作者亲历的洽谈记录〔已知〕,已做化名处理。


算例一 · 电商退款判定

小额高频:把大后果切成小后果,P-4 就提前到来

判断点:异常退款申请的放行或拒绝。错放导致资损,错拒导致客诉与客户流失。做错了有人担责——风控负责人,因此这是一个判断点。

要素假设〔推断〕

字段怎么采
错放均损300 元/单财务的坏账台账
年异常件量5 万单风控系统计数
人工漏检率4%抽检复核得出
系统漏检率2.5%上线前评测集实测
抽检比例5%现行流程
单件复核耗时3 分钟实测
资深客服时薪75 元人力成本表

算 V

V = 失误后果 × (人的错误率 − 系统错误率) × 频次 = 300 × (4% − 2.5%) × 50,000 = 300 × 1.5% × 50,000 = 225,000 元/年

算净价值

验收成本 = 50,000 × 5% × (3 ÷ 60) × 75 = 9,375 元/年 (另计监控与异常处理的固定投入,按 1 万元/年估) 净价值 ≈ 225,000 − 9,375 − 10,000 ≈ 205,600 元/年

净价值是 V 的九成以上,远高于 20% 的薄利边缘线。这是一个明确"值得谈"的判断点。

阶梯定位:阈值内自动生效,无人逐条复核——事实上的 P-4。

这个算例真正的价值不在数字,在于它揭示的机制:合规的做法不是把它退回 P-3(那会吃掉全部时间价值,5 万单逐单人工复核意味着 2500 个工时),而是给 P-4 配齐三件套:三指标监控、错放兜底基金、灰区升级路由。

小额高频判断是 P-4 最早的合法落地区——单笔后果低到平台可以自保险。那个"错放兜底基金"就是一份内嵌的判断保险,只不过承保人是平台自己。
由此得到一条通用手法:责任阶梯不是只能爬,也可以用后果切分来绕。 把大后果切成小后果,P-4 就提前到来。

什么时候这个算例会失效:当异常件的后果分布出现长尾时(比如某一类退款背后是团伙欺诈,单件损失可达数万),平均值 300 元就不再能代表风险,兜底基金会被一次事件击穿。此时必须按后果分层,回到算例四的分层路由。


算例二 · 医疗影像初筛

法定锁死:有些行业的阶梯上限是外生给定的

判断点:初筛阴性排除。假阴性等于漏诊,后果极高且不可逆。

关键结构:假阴性的后果远大于假阳性。定价必须按假阴性单独计算,混合错误率是一个危险的平均数——一个整体准确率 98% 的系统,如果它的错误全部集中在假阴性上,它的实际价值可能是负的。

这一点值得单独强调,因为它是本书的公式最容易被误用的地方:V 式里的"失误后果"必须按错误类型分开算,然后相加,而不是用一个平均后果乘一个平均错误率。

V = Σ (该类错误的后果 × 该类错误率的差值) × 频次

验证时点短(复查有金标准,对错很快揭晓),因此三指标可测、可认证。这正是第八章预测认证最先出现在医疗领域的原因。

阶梯定位:卡在 P-3——候选加理由,医生拍板。

为什么卡在这里:不是技术不够,是法定的。诊断权与处方权的立法把担责锁在执业医师身上,任何技术进步都不能改变这个约束。

洞察:有些行业的阶梯上限是法律外生给定的。此时供应商的正确策略不是硬爬 P-4(爬不上去,而且尝试爬会带来合规风险),而是把 P-3 做到极致:理由的质量、边界的自知披露("这张片子超出我的可靠范围")、以及与医师工作流的贴合度。同时可以做一件更长期的事——积累精算数据,因为保险精算数据是立法变革的原料。

什么时候这个算例会失效:若立法改变担责主体(例如允许特定场景下的自动初筛并由机构而非个人担责),P-3 的天花板会被掀开,整个定价结构重来一遍。


算例三 · 信贷授信额度

验收职业化:哪个行业先有验收职业,哪个行业先吃到 P-4 红利

判断点:授信额度的决定。后果是双向的——额度过高导致坏账,额度过低导致错失优质客户。

历史特殊性:这是少数在 AI 出现之前就完成了 P-4 让渡的判断。评分卡时代,额度就已经默认生效了。

结构差异:可解释性监管强制要求理由输出,这事实上把它从 P-4 拉回到 P-3.5——决定默认生效,但理由必须可查、可申诉。这是一个落在档位之间的真实例子,也说明五档是坐标系不是格子(见第四章反驳三)。

更重要的一点:金融是唯一把验收职业化了的行业。模型风险管理是一个成熟岗位,在 AI 之前就存在,有方法论、有从业者、有监管要求。

哪个行业先有验收职业,哪个行业就先吃到 P-4 红利。
行业渗透顺序的第一变量是验证时点(这条来自智能密度体系),第二变量就是它——验收基础设施的存量
想预判下一个被 AI 深度渗透的行业?找那些已经养着一批职业验收者的行业:审计、质检、合规、临床试验监查。

什么时候这个算例会失效:如果可解释性要求被放宽或被形式化(理由输出变成一句模板话),P-3.5 会滑回 P-4,而且是那种最危险的、名义上有理由实际无人看的 P-4——也就是 L3 陷阱的监管版本。


算例四 · 内容审核

同一判断点内部的分层:路由表就是一张微缩的责任定价表

判断点:边界内容的下架或放行。

结构:巨量高频、单件后果低,但存在极长尾的高后果事件(法律风险与舆论危机)。单一判断点内部就有后果的幂律分布——这与算例一形成对照:那里的后果分布还算集中,这里不是。

阶梯定位:分层路由。高置信度的常规件走 P-4 自动执行;灰区按升级触发器转人工,即 P-3;敏感类别锁死在 P-2,必须人工全量处理。

分层路由就是分层定价:按置信度路由,本质上是按责任定价。

洞察:责任阶梯不仅在产品之间分档,也在同一判断点内部分档。一个成熟的判断系统,它的内部路由表就是一张微缩的责任定价表。

这给采购方一个非常实用的审计手段:让供应商交出路由阈值表。这张表比任何宣传材料都诚实——它显示了供应商真实的责任结构,包括他自己认为哪些情况不敢自动处理。如果一家供应商宣称 P-4 却拿不出路由阈值表,说明它要么没有分层(风险敞口比它承认的大),要么不愿意让你看见灰区有多宽。

什么时候这个算例会失效:当置信度本身不可靠时。分层路由的全部有效性建立在"系统知道自己什么时候不确定"之上,而这恰恰是当前模型最薄弱的能力之一〔推断〕。路由阈值需要用评测集持续校准,否则它会慢慢退化成一个心理安慰。


四个算例的合并结论

行业阶梯形态决定因素
电商退款P-4 + 内嵌自保险单件后果小到可自保
医疗影像P-3 法定锁死担责被立法外生固定
信贷审批P-3.5(生效但可申诉)监管强制理由 + 验收已职业化
内容审核分层路由(P-2/3/4 并存)后果呈幂律分布

同一把尺子量出四种形态。这正是理论有用的标志:它不给所有行业同一个答案,它给所有行业同一套算法。

把决定因素这一列单独拎出来,会得到一张预判新行业的检查表:单件后果的大小与分布、担责主体是否被法律固定、是否有监管强制的理由要求、以及这个行业有没有现成的职业验收者。四个问题问完,一个行业会长成什么形态基本就定了。


算例五 · 一桩真实的判断交易,以及它缺失的那一页

前四个算例的数字是假设的。这一个不是——它来自一次真实的洽谈记录〔已知〕,企业已化名。

场景

买方是一家德资装备企业:年营收六亿,两百余人,在自己的细分行业里是国内第一(最大竞争对手体量约为其五分之一),德方股东不参与日常经营,国内团队有完全决策权。它的处境是:主打产品的市场接近见顶,团队认可 AI 的方向但"不知道怎么搞"。

卖方是一家做企业 AI 落地的服务商:二十人左右的团队,有若干知名消费品牌的服务案例,有高校背景。

报价结构

三阶递进:

阶段价格内容
入门3 万/次认知培训,一天
首年30–50 万平台 + 用量 + 六个月陪跑
长期50–300 万/年三到五年深度合作

同一场对话中,卖方还说过一句关键的话〔转述〕:年合作额低于一百万基本无盈利。

用本书的工具拆这桩交易

第一步,判断点在哪?

方案里没有明确的判断点。培训、陪跑、平台部署——这些是动作不是判断点。按第一章的担责闸门,它们做得不好也不会有具体的人赔钱。真正的判断点藏在后面:"我们该在哪个业务上先用 AI""这个场景值不值得投入"——但这些在方案里没有被单独识别,也就没有被单独定价。

第二步,卖方实际站在哪一档?

按第四章的四问:合同里做错了谁赔——未写明;客户实际怎么用——培训与建议,人来决定;有没有三指标——没有;钱什么时候收——首年前置。

四个答案指向同一个位置:事实上的 P-2 到 P-3 之间

但整场对话的语言是 P-4 的语言——"帮你完成 AI 转型""让你的经营决策智能化"。价值主张站在 P-4,责任结构站在 P-2。 这不是欺骗,这是整个市场的常态:双方都在用能力的语言谈判,而没有人在用责任的语言谈判。

第三步,V 能不能算?

不能。因为判断点没有被识别,四个因子一个都填不上。这不是卖方的疏忽,是这类交易的通行做法——先卖一个方向,再在过程中找具体场景。

代价是:买方无法判断这三十到五十万值不值。 他只能凭对人的信任、对趋势的焦虑、以及"六亿营收里这点钱不算什么"来决策。这三条都是真实的决策依据,但都不是价值判断。

第四步,首年亏损定价怎么解释?

卖方自己说低于一百万无盈利,却报了三十到五十万。这不是善意,也不是失误,是信任品属性逼出来的价格路径

买前无法验货(第二章性质一),所以买方不可能一上来就签一百万的合同;卖方必须用一个亏损的价格换取试用的机会。真正的博弈在第二年——那时买方已经把流程、数据、判断记录嵌进了对方的平台,迁移成本大幅上升(第六章的黑洞护城河),议价天平会向卖方倾斜。

这个结构本身没有原罪,它是这类市场的必然形态。但买方应当知道自己正在进入什么:第一年买的是试用权,第二年谈的才是真价格。 对应的行动是在第一年就把防绑定五条谈进合同(第六章)。

缺失的那一页

这桩交易谈了行业趋势、技术路线、推进阶段、长期规模,价格谈得相当细。整份方案里没有任何一条写明:什么算成效、谁来判断、用什么指标〔已知〕

同一批记录里还有一场硬件合作洽谈,进行了一个半小时,从场景聊到愿景,事后复盘时发现连样品怎么收费都没定〔转述〕。

这桩交易缺的那一页不是价格页,是验收页
而且这不是偶然:定价谈得越细、验收越空白,恰恰说明这个市场还停留在"按投入付费"而不是"按判断付费"。 按投入付费不需要验收标准——你付的是人天、是部署、是培训场次;只有按判断付费才需要,因为你付的是"这个判断值多少",那就必须回答"怎么知道它对不对"。

这正是第八章 J7(评测集市场)的现实依据,也是第二章"验收不被定价、不成文"的原始出处。

给双方的建议

给买方三条:

  1. 先做组织内定档(第四章)。在签字之前问一句:这套东西如果没做出效果,明天早上谁会被叫去办公室?答不出名字,先别买,因为买回来也没人验收。
  2. 要求把三问写进方案:什么算成效(至少三个可观测指标)、谁来判断(具体的人或角色)、什么时候判断(时间点)。写不出来的供应商,不是不专业,是它自己也不知道——这本身就是重要信息。
  3. 第一年就谈退出:数据与判断记录的导出格式、评测集归属、终止合作时的交接方式。这是关系最好的时候,谈成本最低。

给卖方三条:

  1. 把判断点从动作里摘出来单独定价。 培训与部署按成本加成卖,判断按价值卖。混在一起,你只能拿到成本加成的价格。
  2. 主动提出验收标准。 这看起来是给自己上枷锁,实际上是唯一能让你离开 P-2 价格带的方式——没有验收标准的服务,买方理性上只应支付 P-2 的价格。
  3. 付费时点要与你的承诺自洽(第四章第四问)。如果你说"我对结果负责",就不要坚持全额前置;如果你必须前置,就不要在方案里使用 P-4 的语言。不自洽的地方,就是第一次事故时合同会崩的地方。

尾声 · 四种形态与渗透序

把五个案例横向放在一起,会看到一件事:同一套算法,在不同行业长成了完全不同的商业形态。

决定形态的不是技术水平——五个场景用的模型能力是同一代的。决定形态的是两件事:责任的法定归属(医疗被立法锁死,电商没有)与验收基础设施的存量(信贷有职业验收者,装备制造业没有)。

由此得到一条渗透序的判断规则:

渗透速度 ≈ f(验证时点的长短, 验收基础设施的存量, 责任归属是否被法律固定)

三个因子里,前两个是可改善的,第三个是外生的。这意味着一个行业如果想加快 AI 的深度落地,能做的事很具体:缩短验证时点(建立更快的反馈机制)、培养职业验收者(这也是第七章说的升值区)。而如果卡点在第三个因子上,那就不是企业能解决的问题,只能等制度变化,或者参与推动制度变化。

第五个案例给的是另一种教训,而且更普遍:在验收还没有被写进合同的市场里,前四个算例的精确计算全都无处安放。 你可以把 V 算到小数点后两位,但如果合同里没有人承诺什么算成功,这个数字就没有对手方。

所以本章的最后一句话是给两边说的:先把那一页补上,再谈价格。

本章小结

  1. 四个算例用的是同一套算法,长出了四种完全不同的形态。决定形态的不是技术水平,是责任的法定归属与验收基础设施的存量。
  2. 多类错误必须分开算再相加。用平均后果乘平均错误率,是本书公式最常见的误用(见医疗算例)。
  3. 责任阶梯可以爬,也可以绕——把大后果切成小后果,P-4 就提前到来(电商算例);也可以在同一判断点内部分层,路由表就是一张微缩的责任定价表(内容审核算例)。
  4. 想预判一个行业的形态,问四个问题:单件后果多大、分布如何、担责主体是否被法律固定、有没有现成的职业验收者。
  5. 第五个案例的教训最普遍:在验收还没被写进合同的市场里,前四个算例的精确计算全都无处安放。先把那一页补上,再谈价格。
第 10 章

术语表与速查

这一章是工具,不是论述。它有三个用途:查一个术语的定版定义、弄清某个概念归谁所有、以及在谈判桌上快速调出四件速查工具。

引用本书概念时,以本页为准。

一句关于"真相源"的说明:本书属于一个共享同一原子(判断)的体系群,很多概念在别的体系里先被定义过。凡是这类概念,本书直接引用、不重新定义,并在下表的第三列标明归属。这条纪律的意义在于:当你在两本书里看到同一个词,它应当是同一个意思。


一 · 术语定版

计量与地基

术语定义展开常见误用真相源
判断点做错了有人担责的事判断经济学的计量单位。判据只有一条,不看复杂度、不看是否需要"智能"把所有需要动脑的事都算成判断点智能密度体系01
动作做错了没人担责的事不进密度分母,也不进价格。它的价值上限是省下的工时用判断的定价方式卖动作智能密度体系01
失误后果判断点的权重量化协议是问排序不问金额——先排出哪个更严重,再估量级追求精确的金额估计,反而不敢动手智能密度体系03
验证时点判断的对错多久之后、通过什么渠道能知道信任品严重程度的决定变量。秒级可验接近经验品,永不可验是重度信任品与"响应速度"混为一谈智能密度体系02
验收带宽能判断"AI 在这门生意上说得对不对"的人 × 可投入小时终局稀缺资源。它不随算力增长,只随人的培养增长以为加人就能扩带宽——不懂业务的人不构成带宽智能密度体系02 · 07

定价

术语定义展开常见误用真相源
价值基本式V = 失误后果 ×(人的错误率 − 系统错误率)× 频次规范性工具,不是描述性事实——市场目前普遍不这样算当作市场定价的解释模型,然后发现"不准"本书03
净价值V − 验收成本 − 责任承载成本决定这笔交易是否值得的真实数字只算 V 不减验收成本本书03
负密度核对与返工的成本超过了节省伪装成资产的负债。表现为净价值≈0 甚至为负因为"用起来了"就认为有价值智能密度体系03 · 05
薄利边缘净价值低于 V 的 20%值得做但经不起任何估计误差,应先做小范围实测按 V 谈价,忽略净值已经很薄本书03
责任阶梯 P-1~P-5同一判断按责任深度的五档交付与定价结构全书核心。跳跃发生在责任转移处,不在能力提升处与能力等级混用本书04
名义档 / 事实档宣称的档位 / 按三问定出的实际档位两者不一致处,就是风险或利润所在只看产品页不看合同与实际用法本书04
L3 陷阱名义 P-3、事实 P-4宣称人工复核,实际无人真看。识别法:看复核者的实际工作量以为写了"人工复核"就安全智能密度体系(命名)04
付费时点费用在效果之前还是之后收责任分配的代理变量:前置=买方担效果风险,后置=卖方担只当作现金流问题本书(本版新增)04
组织内责任阶梯组织内部对同一判断的担责深度分档判断让渡的第一道闸。问"错了谁被叫去办公室"以为组织问题是采购之后的实施细节本书(本版新增)04
价格发现三段论一单一议 → 内部价格体系 → 公开报价解释了判断服务市场报价为何普遍不透明把第一阶段的不透明当作不专业本书(本版新增)03

资产与市场

术语定义展开常见误用真相源
判断资产判例料 + 偏好料 + 评测集 + 封装结构四科目。前两项稀缺,第三项决定其余能否估值把算力支出与订阅费当作判断资产本书(四类料归密度体系)05
判例料带依据与结果的判断记录七字段:情境/判断/依据/判定人/时间/结果/复盘缺"依据"与"结果"两字段——那就只是数据智能密度体系05
偏好料组织的"什么算好"与"我们不做什么"检验存量的方法:问三个中层同一个问题,看答案是否一致以为写在价值观海报上就算有智能密度体系05
评测集带标准答案、用于测错误率的样本集唯一能给其他三项资产估值的东西;也是最没人愿意先建的用供应商提供的演示数据当评测集认知工程派(方法)05 · 08
抗吞噬四问判断资产不被下一代基础模型免费内置的能力判据依赖通用推理的部分快速折旧,依赖私域数据与责任的部分几乎不折旧以为提示词写得好就是护城河认知工程派05
回流转速真实结果回来校准判断的频率判断资产唯一的增值机制。发动机是验收只记录判断不比对结果——那是死账认知工程派(复利引擎)05
判断三指标判断一致率 / 复现率 / 边界失效率P-3 以上定价的质量资格。没有评测就没有溢价用"准确率 99%"这类单一数字代替认知工程派04 · 08
黑洞护城河越用越准 + 数据沉淀 + 切换成本三力叠加使 Agent 市场趋向一岗一供应商以为对策是不绑定——不绑定就没有积累本书06
判断服务的自毁性成功等于客户不再需要你E2 在服务市场的表现形态。出路只有三条用摩擦性绑定替代建设性绑定本书(本版新增)06
密度差贸易组织间交易密度增长能力而非存量"卖回路,不卖答案"——答案会贬值,回路会增值把一次性诊断报告当作可续费产品密度推论五 + 本书06

分配与制度

术语定义展开常见误用真相源
平权悖论智能平权,但密度分化能力平权了,验收能力与担责资格没有平权由此推出"所以个人无能为力"密度推论六 + 本书机制化07
验收位定义合格标准 / 签字确认 / 对结果担责的岗位门票是三件事,三件都能在现岗位上先练以为是管理岗的同义词本书07
验收工资溢价验收岗相对执行岗的持续薪资走阔写成了 J2,尚待数据当作已被证实的事实引用本书07 · 11
责任缺口真实损害找不到可被要求充分赔偿的主体P-4 与 P-5 价差的制度成因与"免责条款"混为一谈社会科学 S05(法学既有术语)02 · 08
公共判断品被亿级人口依赖的基础判断服务严格说是俱乐部品(算力有竞争性、接口有排他性)直接称其为公共品本书(修正旧说)08
判断保险 / 判断认证信任品市场的两根柱子J4 / J5 预言的两个新行业以为它们已经存在本书08
评测集市场独立第三方判断评测与审计服务有价值、有买家、有方法,却没有市场——本书识别的最大制度缺口与内部评测团队混为一谈——独立性是关键本书(本版新增,J7)08 · 11

二 · 最容易混淆的三组概念

这三组每一组都被混用过,而每一次混用都会导致具体的判断错误。

第一组 · L 刻度 vs P 档(最重要)

L1–L5P-1–P-5
测的是判断让渡的深度——多少判断交给了系统责任的深度——谁为结果负责
真相源智能密度体系本书
高值意味着人介入得少卖方担责多
谁在用组织评估自身智能化程度买卖双方定价

两者相关,但不是一回事。关键在于它们可以脱节

一个组织完全可能处在 L4(把大量判断交给了系统)同时停在 P-2(没有任何人对结果负责)。
这个组合就是负密度——让渡很深,担责为零。它在报表上看起来像是"AI 化程度高",实际上是风险敞口大。
反过来的组合(L2 + P-4)几乎不存在,因为没人会为一件自己还在人工做的事付出高额的担责溢价。

实用推论:评估一家公司的 AI 成熟度,两个刻度必须一起看。只报 L 不报 P 的成熟度评估,是在报告风险而不是报告能力。

第二组 · 判断点 vs 动作

判据只有一条:做错了有人担责吗?

不是看复杂度(写一份复杂的报告可能只是动作),不是看是否需要"智能"(一个简单的放行决定可能是判断点),不是看耗时。

实用判据:这件事做错了,明天早上谁会被叫去办公室? 答得出一个具体的名字,是判断点;答不出,是动作。

误判的代价是双向的:把动作当判断点买,你在为不存在的责任付钱;把判断点当动作做,你在无人担责的情况下承担风险。

第三组 · 判例料 vs 训练数据

训练数据判例料
典型字段输入 → 输出情境 / 判断 / 依据 / 判定人 / 时间 / 结果 / 复盘
能否反推——依据无法从输入输出对里反推
迁移能力依赖分布相似依据可迁移到新情境
折旧随模型代际几乎不折旧

核心差别是「依据」这一个字段。同一个决定可以由完全不同的理由做出,而理由决定了它能不能迁移。没有依据的判断记录,是数据不是资产。


三 · 四件速查

速查一 · 价值基本式

V = 失误后果 × (人的错误率 − 系统错误率) × 频次 净价值 = V − 验收成本 − 责任承载成本 四档判定: 差 ≤ 0 → 无判断价值(系统不比人强,别做) 净 ≈ 0 → 负密度(核对成本吃掉全部收益) 净 < 20% × V → 薄利边缘(先小范围实测再扩大) 其余 → 值得谈

多类错误时按类分算再相加,不要用平均后果乘平均错误率(见第九章医疗算例)。

速查二 · 责任阶梯

交付物责任位置价格量级
P-1信息全在买方×1
P-2初稿全在买方×2–5
P-3候选+理由买方拍板×5–20
P-4决定(默认生效)名义卖方、实际悬空×20–100
P-5决定+赔付承诺契约化在卖方×100+,需保险

定档四问:① 合同里做错了谁赔?② 客户实际怎么用?③ 有没有三指标?④ 钱在什么时候收?
第②问与第①问打架的地方 = L3 陷阱。第④问不定档,定风险落在谁身上。

速查三 · 判断资产四科目

科目一句话盘点
判例料过去一年的关键判断+依据+结果,记录了几条?离职带得走吗?
偏好料"什么算好/不做什么"写下来了吗?问三个人答案一致吗?
评测集有基线错误率吗?上次重测什么时候?在你手上还是供应商手上?
封装结构有版本管理吗?依赖通用推理的比例多高(=折旧率多高)?

一句话结论:模型换代明天发生,你的账面上还剩什么?

速查四 · 组织内担责自查(本版新增)

采购之前先过一遍,五个问题:

  1. 这类决定如果错了,明天早上谁会被叫去办公室?(答不出具体名字 → 你实际停在 P-2)
  2. 这个人知道自己承担这个责任吗?
  3. 他有拒绝的权力吗?(只能签字不能否决的,不叫担责,叫背锅)
  4. 他有验收所需的信息与时间吗?(每条不到三秒 → L3 陷阱)
  5. 出事之后有明确的复盘与改进流程吗?(没有 → 判例料不会积累)

五问全"是",你的组织有能力承接 P-4 服务。任何一问为"否",先补组织再谈采购。


四 · 一页纸总表

公理
E1 生产趋零 · E2 判断可复制、验收与担责不可复制(全书发动机)· E3 价值结构不变

单元
一次判断的交易 = 一个判断点的让渡 + 价格
四个反常性质:信任品 · 验收不对称 · 外部性内生 · 使用即生产

定价
V = 失误后果 ×(人错误率 − 系统错误率)× 频次
净价值 = V − 验收成本 − 责任承载成本
责任阶梯 P-1 → P-5 | 定档四问 | L3 陷阱

资产
判例料 · 偏好料 · 评测集 · 封装结构
第一定律:验收停转之日 = 资产净折旧之始

市场
Skill(商品逻辑,锁在 P-2)vs Agent(劳务逻辑,可爬档)
黑洞护城河 | 自毁性 | 卖回路不卖答案 | 防绑定五条

分配
平权悖论 | 哑铃结构 | 贬值区(执行/传达/有标准答案的判断)vs 升值区(验收与担责)

制度
产权三悬案 | 俱乐部品 | 两根柱子:认证与保险 | 最大缺口:评测集市场

检验
J1 责任溢价跃迁(≥5倍)· J2 验收工资溢价 · J3 无三指标向 P-2 收敛 · J4 判断保险(五年)· J5 判断认证(五年)· J6 折旧分层 · J7 评测集市场(五年)
三种死法:责任被技术完全解决 | J1 长期证伪 | 市场永停 P-1/P-2 且认证保险不出现


用法 三问定位法见第四章末;五分钟估值步骤见第三章末;CFO 盘点清单见第五章末;买方防绑定五条见第六章末。本页只放最高频引用的部分,完整操作件留在各章现场。四件在线工具(估值器、定位器、盘点表、J 数据采集包)是这些速查的可执行形态。

第 11 章

可检验主张 · 边界 · 死法

一本书说自己"可检验"是很便宜的。真正的检验要求作者先做三件不太舒服的事:把主张写到能被具体数据推翻的精度;写清什么结果算自己错了;然后承诺定期回来对账。

这一章做这三件事。

它也是全书最容易过期的一章——如果一切顺利,五年之后它应该有一半被划掉,标注上"已证伪"或"已成立"。一本理论书最好的结局不是被反复引用,是被数据结算。

一 · 七条主张

每条包含五项:精确表述、它在证伪什么、怎么测、什么结果算证伪、当前置信。

J1 · 责任溢价跃迁

表述:在同一判断点上,事实档为 P-4 的服务,其单次判断价格的中位数至少是事实档 P-3 的 5 倍。

它在证伪什么:全书的核心命题——判断的价格首先是责任的价格(第四章)。如果责任转移不带来显著溢价,那么价格就是由能力而非责任决定的,第四章整章需要重写。

怎么测:合同与公开报价抽样。抽样框、纳入排除标准、编码规则见配套的 J 数据采集包。档位按事实编码不按宣称,用三问定档。样本量下限:每档不少于 15 条,覆盖不少于 3 个行业。价格需折算为可比的单次价,无法折算的样本剔除而非估计。

什么结果算证伪:在样本充足的前提下,两档单次价中位数之比小于 2 倍。落在 2 到 5 倍之间为灰区,需扩大样本或检查是否把 L3 陷阱误编为 P-3。

当前置信〔推断〕。依据是若干次真实谈判中的观察与公开报价的粗略比较,样本远不足以支撑。这是本书最需要数据的一条。

J2 · 验收工资溢价

表述:承担验收职责(定义合格标准/签字确认他人或系统的输出/对结果被追责)的岗位,其薪资中位数显著高于同职级、同城市、不承担验收职责的岗位,且这一差距在三年窗口内扩大。

它在证伪什么:第七章的分配结论——验收位是升值区。

怎么测:岗位薪资面板。用招聘数据与内部薪资表构建"验收密集度"指数(三问打分),控制职级与城市后比较。每组样本不少于 20 条。

什么结果算证伪:控制职级与城市后,比值小于等于 1.0;或三年内差距缩小。

当前置信〔推断〕

J3 · 无三指标市场向 P-2 收敛

表述:在不披露三指标(判断一致率、复现率、边界失效率)的服务品类中,价格的纵向趋势向 P-2 区间收敛。

它在证伪什么:第二章的柠檬化推论与第四章"没有评测就没有溢价"。

怎么测:选定若干品类,纵向追踪其公开报价的中位数与分布,同时记录该品类是否出现三指标披露。比较披露组与未披露组的价格轨迹。

什么结果算证伪:未披露三指标的品类,其价格中位数长期稳定在 P-3 区间及以上而不下滑。

当前置信〔推断〕

J4 · 五年内出现判断责任专营保险

表述:至二〇三一年,市场上出现以"AI 判断误判导致的直接损失"为承保标的的商业保险产品,且可公开查询。

它在证伪什么:第四章 P-5 档的可实现性,第八章关于保险前置条件的分析。

怎么测:保险产品目录检索与监管备案查询。判据从宽——只要出现一款以此为主要标的、面向市场销售的产品即算成立,不要求规模。

什么结果算证伪:至二〇三一年仍无此类产品。

当前置信〔推断〕。若证伪,第四章的阶梯顶端塌陷,"担责是最厚利润区"这一战略判断需要撤回。

J5 · 五年内出现独立判断质量认证

表述:至二〇三一年,出现以判断服务质量认证为主营业务的独立第三方机构,且其认证结果被至少一个采购方在公开的采购要求中引用。

它在证伪什么:第八章关于信任品市场两根柱子的判断。

怎么测:市场观察与采购文件检索。

什么结果算证伪:至二〇三一年无此类机构,或有机构但无任何采购方引用其结论(后者说明认证未被市场承认,与不存在等价)。

当前置信〔推断〕

J6 · 判断资产的折旧分层

表述:依赖通用推理的 AI 产品,其毛利率随基础模型代际更新而下降;依赖判例料与偏好料的产品,毛利率不随之下降。

它在证伪什么:第五章的折旧规则,以及由此推出的估值逻辑。

怎么测:事件研究。以基础模型的重大发布为事件窗,比较两类公司在事件前后的毛利变化。样本需要可获得的财务数据,因此优先选择上市公司或有公开披露的企业。

什么结果算证伪:两类公司的毛利变化无显著差异;或依赖判例料的一类同样显著下滑。

当前置信〔需确认〕——这是七条里证据最弱的一条,因为分类本身需要对每家公司的资产结构做判断,而这个判断可能引入偏误。方法上需要先解决分类的可复现性。

J7 · 评测集市场(本版新增)

表述:至二〇三一年,出现独立的第三方判断评测与审计服务,且其收费与被评测服务的责任档位正相关——即为 P-4 及以上服务做的评测,收费显著高于为 P-2 服务做的评测。

它在证伪什么:本书最基础的一个假设——验收可以被定价。第五章把评测集列为四大资产科目之一,第八章把它称为最大的制度缺口,两者都建立在"这东西迟早值钱"之上。如果五年后评测服务始终无法作为独立生意存在,那么验收的价值可能根本无法从服务本身剥离出来单独交易,第五章的资产科目要删掉一项,第八章的整个制度路径要重画。

它从哪来:一个现实观察。真实交易中验收条款普遍空白(第二章、第九章);评测集有明确价值、明确买家、清楚的技术方法,却没有市场(第八章)。这个反常本身要么说明市场没成熟,要么说明我的假设错了。J7 就是用来分辨这两者的。

怎么测:市场观察 + 定价结构分析。成立需同时满足:存在以此为主营的机构、有付费客户、且收费与档位正相关。

什么结果算证伪:至二〇三一年无此类服务;或有服务但收费与档位无关(说明它被当作一次性的技术检测在卖,而不是责任定价的基础设施)。

当前置信〔推断〕,且是七条里我个人主观概率最低的一条——因为它同时依赖需求侧的认知觉醒与供给侧的冷启动。正因为最可能错,它最值得写出来。

二 · 本书的死法

上面七条是零件的检验。下面三条是地基的检验——任何一条成立,本书不是需要修补,是需要推倒。

死法一 · 责任被技术手段完全解决。
如果归因问题被真正解决——出现某种机制能够自动、可验证、无争议地把一次判断失误的责任分配到各参与方——那么"担责不可复制"就不成立了。担责会变成一件可以被复制、被自动执行、边际成本趋零的事,于是它和判断本身一样廉价。E2 塌了,全书跟着塌。
我认为短期内不会发生,因为归因的难点不在技术在语义("这次损失有多少是因为你的模型"这个问题在很多情况下没有客观答案)。但这是一条真实的地基风险,不是修辞上的谦虚。

死法二 · J1 长期被证伪。
如果多轮、跨行业、样本充足的测量都显示 P-4 与 P-3 的价差始终不足两倍,那么"责任决定价格"就只是一句修辞。责任阶梯还可以作为风险识别工具存在(L3 陷阱仍然有用),但它不再是一个定价理论。本书降级为一份采购风险清单。

死法三 · 市场长期停在 P-1 与 P-2,且认证与保险始终不出现。
即 J3、J4、J5 全部落空。这说明 E2 虽然在逻辑上成立,却没有市场化的通道——担责确实不可复制,但市场就是不为它定价,宁可让责任永远悬空。那么本书退化为一份定价备忘录:观察都对,但没有一条能变成交易。

我认为三条同时发生的概率不高,但它们必须被写出来。可证伪是理论对自己的最低尊重——一本教人给判断定价的书,如果不肯给自己的正确性标一个置信度,它就没有资格教这件事。

三 · 边界:本书不管什么

划清边界与给出主张同样重要。以下问题本书不适用,误用会得到错误结论。

无失误后果的产出。 纯内容生成、创意发散、陪伴类交互——这些没有"做错了有人担责"的判断点,价值来自注意力而非判断,定价逻辑归注意力经济学。第一章的担责闸门就是为了把这类场景挡在门外。

基础模型层的定价。 算力、参数、推理成本的定价属于算力经济学,与本书的责任定价是两套逻辑。本书处理的是模型之上的那一层。

金融资产定价。 判断资产虽然可以估值(第五章),但它不是可交易的金融资产,本书没有给出贴现率、风险溢价、流动性折价的处理。谁要拿第五章去做一级市场估值,需要自己补上这些。

劳动经济学的残余问题。 第七章讨论的是分配结构的方向,不是就业总量预测。本书不预测会消失多少岗位,因为那需要宏观模型,而我没有。

伦理规范的正当性论证。 责任应当如何分配,是《智能体的社会科学》的题目。本书只处理责任如何被定价。价格不能论证正当性,正当性也不能替代价格。

接口 密度(判断点/L/验证时点=原材料)· 认知工程(三指标=质量计价、抗吞噬=折旧)· 社会科学(A2=E2 地基、责任缺口=P-4/P-5 价差成因)· AMS(F05/F06/F30/F31=企业应用层)· 蓝皮书(J1–J7 年度跟踪)

四 · 年度对账协议

作者承诺每年对 J1–J7 做一次公开对账,与本书同址发布。对账格式固定为四栏:

主张本年新增证据置信变化处置

处置只有四种取值:维持修正(调整表述或阈值,需说明理由)、证伪撤回

三条纪律:

  1. 被证伪的主张保留在正文中,标注证伪、说明影响范围,不删除。修订记录(见附录)同样保留全部历史版本。一本谈可检验性的书,不应该悄悄修改自己的历史。
  2. 阈值不得在对账时放宽。 J1 的 5 倍、J4 与 J5 的五年期限、J7 的正相关要求,都在此刻写死。事后调低标准来保住主张,是这类承诺最常见的失败方式。
  3. 证据需可追溯。 每条新增证据必须写清来源与获取方式,允许他人复核。

对账的落地形态是证据引擎证据库与对账表):那里放着八份一手记录的证据索引、2026 年的首批基线读数、九条主张的状态表,以及一份《判断交易记录》采集协议——主张要能被检验,先得有地方放证据。

读者可以参与的三种方式:用配套的 J 数据采集包采集并回流数据;提交一次用本书方法算过的真实复盘(算对算错都有价值,算错的更有);直接指出某条主张的表述漏洞。

五 · 深入 · 五个研究招题(虚位以待合作者)

招题一 · 责任溢价的首次实测(J1)。
问题:同一判断点上,"给建议"与"做决定"两类服务的价差是多少?
所需数据:同领域两类 AI 服务合同或正式报价各 30 份以上,跨 3 个行业。
难点:合同不公开。可行路径是与采购方合作做脱敏抽样,或从公开招标文件入手。
合作方式:数据由采集方自持,本书方只做方法与编码规则的贡献,结果共同署名。

招题二 · 验收工资溢价面板(J2)。
问题:验收职责是否带来可观测的薪资溢价?
所需数据:招聘平台岗位描述与薪资区间,三年窗口。
难点:验收密集度的编码可复现性。需要先做编码者一致性检验(同一批样本由两人独立编码,不一致率超过三成则修订问法)。
合作方式:适合有数据获取能力的研究团队独立完成,本书方提供编码协议。

招题三 · 判断资产折旧的事件研究(J6)。
问题:基础模型的重大更新,是否对两类 AI 公司的毛利产生不同影响?
所需数据:有公开财务披露的 AI 公司面板,基础模型发布时间序列。
难点:公司分类的客观性。建议用可公开验证的代理变量(如是否自持行业数据集、是否有专有标注体系)而非主观判断。

招题四 · 组织内责任阶梯的实证(第四章新增内容)。
问题:内部担责机制的成熟度,是否预测 AI 采购的实际使用率与续约率?
所需数据:若干企业的内部权责设计 + 采购后 12 个月的使用数据与续约结果。
这条题目最贴近实践,也最难拿到数据,但一旦做出来,它同时检验第四章的新增部分与"L3 陷阱导致钱白花"这个判断。

招题五 · 评测集市场的冷启动实验(J7)。
问题:如果有人真的开一家评测机构,卡在哪一步?
方法:这不是观察性研究,是一次真实的尝试——选定一个验证时点短的垂直领域,建立评测集,向该领域的服务商提供付费评测,记录每一步的阻力。
价值:无论成败都能回答第八章的四条原因哪一条是真正的瓶颈。失败的记录与成功的记录同样有用。

五个招题的共同点:它们都不需要先相信这本书。 任何一个做出来的结果,都可能是推翻它的那一个。

附录

参考与对话 · 这本书站在哪里

先说一件应该说清楚的事:这不是一份文献综述。

这本书是从实践里长出来的——从谈判桌、从企业内部的推进会、从一次次算不清的账里长出来的。写作过程中我没有做系统的文献检索,因此这一节不列参考书目,也不给页码级引证。它做的是另一件事:说明本书与哪些既有传统在对话,我从它们那里借了什么,又在哪里离开了它们。

把这一节当作一份诚实的欠条。哪一条对话经不起推敲,欢迎指出来。


一 · 信息经济学:柠檬市场与信任品

借了什么。 信息不对称会摧毁市场——买方无法分辨好坏时,好东西退出,市场向次品收敛。这个洞见是本书第二章的直接来源。经济学里对商品的经典三分——搜寻品(买前可验)、经验品(用后可验)、信任品(用后也难验)——本书原样借用,并把判断归入信任品。

在哪里离开。 经典处理里,信任品问题的解法是信号与声誉:卖方通过资质、品牌、保证来传递质量信号。本书认为,在判断交易里这套解法不够用,因为验收本身有成本,而且这个成本往往落在买方身上(第二章的"验收不对称")。声誉能解决"他是不是骗子",解决不了"这一次他对不对"。本书给出的替代解法不是信号,是责任的契约化分档(第四章)与验收的资产化(第五章、第八章)。

二 · 委托—代理:激励相容与责任归属

借了什么。 委托方与代理方目标不一致、信息不对称、行为不可完全观测——这套框架是本书"委托"概念的底子,也是《智能体的社会科学》那一册的主干(本书只在制度层引用,不展开)。

在哪里离开。 经典委托—代理里,代理人是有意志、会偷懒、可被激励的人。而判断的代理人现在多了一类:不会偷懒、也无法被激励、更重要的是没有可供追索的法律人格的系统。当代理人不能承担责任时,责任不会消失,它会回流——回到组织内部某个具体的人身上,或者悬空。本书第四章的"名义档与事实档"、"L3 陷阱"处理的正是这个回流与悬空。

三 · 交易成本与企业边界

借了什么。 企业的边界由交易成本决定——什么该自己做、什么该买,取决于市场交易的摩擦有多大。本书第六章讨论买与自建、防绑定、迁移成本时,用的是这套语言。

在哪里离开。 传统讨论里的交易成本主要是搜寻、谈判、履约监督的成本。本书要加进去一项被长期忽略的:验收成本。在判断交易里,验收成本经常是交易成本的最大项,甚至可能超过判断本身的生产成本。一旦把它计入,很多"看起来划算"的外购会变成负值——这就是第三章的净价值判定式与"负密度"概念。

四 · 技术变迁与岗位分化

借了什么。 技术进步不是均匀地抬升所有岗位,而是替代一部分、增强另一部分,从而改变收入分布。中间技能岗位被挤压、两端扩张的"极化"观察,是第七章"哑铃社会"的出发点。

在哪里离开。 既有讨论多以"任务是否可被程式化"为替代与否的判据。本书主张判据要换一个:这项任务的结果由谁承担。有些高度非程式化的任务(比如创意策划)反而快速贬值,因为做错了没有明确后果;有些看起来很程式化的任务(比如放款审批的最后一签)反而升值,因为签字的人要担责。贬值与升值的分界线不在任务的复杂度上,在责任的落点上——这是本书对这一支传统最主要的分歧。

五 · 保险与风险定价

借了什么。 把不确定的损失转化为确定的成本,需要可估计的损失分布、可界定的赔付触发条件、以及防范道德风险与逆向选择的设计。第八章讨论"判断保险"时完全依赖这套成熟的机器。

在哪里离开。 本书不打算发明新的保险理论,只指出一个空白:判断服务的损失分布目前无人有数据,赔付触发条件目前无人能界定,因此 P-5 这一档在市场上几乎不存在。第八章的工作是列出它出现需要哪些前置条件,第十一章的 J4 则把它写成了一条可以被证伪的时间性主张。

六 · 质量管理与验收工程

借了什么。 没有测量就没有质量。抽样、检验、判据、返工——制造业花了一个世纪把这套东西做熟。

在哪里离开。 制造业的检验对象是物,判断的检验对象是判断本身。物的合格判据可以写进规格书,判断的合格判据往往要先被定义出来——"什么算对"本身就是一个判断。这个自指结构是判断验收最难的地方,也是本书把"能定义合格标准"列为验收位第一门票的原因(第七章)。三指标(判断一致率、复现率、边界失效率)来自认知工程派,本书作为质量计价的前提直接引用,不重新定义。


兄弟体系(本书的近邻)

这本书不是孤立的。它属于一个共享同一个原子——判断——的体系群。分工如下:

体系管什么与本书的接口
智能密度体系测量:一个组织把多少判断让渡了出去提供判断点、L1–L5 让渡刻度、失误后果权重——本书定价的原材料
认知工程派生产:怎么把认知封装成可交付的产品提供三指标——本书质量计价的前提
智能体管理学(AMS)组织:企业如何变革、如何治理本书是其能力获取决策的定价环节;组织怎么推是它的事
智能体的社会科学制度:委托的社会与制度后果与本书第八章共享地基,它管意义与规范,本书管价格
智能体时代的教育学人:判断力、让渡力、验收力如何生长本书第七章的"验收位门票"是它的培养目标
智能革命史时间:把这一切放进六次大规模委托的历史序列提供长时段坐标

跨体系概念遵守单一真相源:谁先定义谁说了算,本书引用不改写。


数据与素材来源

本书的一手素材来自作者本人参与的真实商业谈判、企业内部推进会与授课记录(二〇二五至二〇二六年),共八场、约三十一万字的完整转写。这些材料提供了第九章的真实交易案例、第四章"组织内责任阶梯"的现场证据、第五章"判例料"被一线经营者独立说出的三段原话。

使用纪律:所有企业与个人均已化名;标注为原文的引用逐字核对过转写;标注为观察的内容不加引号。这批材料是私人记录,不能公开,因此书中每一处引用都尽量给出足以判断其分量的上下文,供读者自行折价。

至于本书主张所需的系统性数据——合同抽样、岗位薪资面板——目前还不存在。这是第十一章 J1 与 J2 至今只能标注〔推断〕的原因,也是配套的 J 数据采集包存在的理由。谁先把这批数据采出来,谁就有资格判这本书的生死。

附录

版本 · 致谢 · 许可

修订记录

版本日期变更
v1.02026-08-02体系总纲成文:三公理、单元四性质、价值基本式、责任阶梯 P-1–P-5、判断资产四科目、J1–J6 六条可检验主张
v1.22026-08-02新增算例集(四行业四形态)与术语表;改为浅色阅读排版
v1.32026-08-02配套工具上线:判断点估值器、责任阶梯定位器
v2.02026-08-03理论 + 工具双支柱项目站;新增判断资产盘点表;八个可执行 Skill 与定价师内核
v2.12026-08-04分诊向导、定价师会客室、J 数据采集包上线
v3.02026-08-04全书重写为完整书稿(约十万字)。新增:组织内责任阶梯(第四章)、付费时点第四问(第四章)、判断服务的自毁性(第六章)、评测集市场缺口(第八章)、真实交易案例(第九章)、可检验主张 J7(第十一章);补齐序言、阅读指南、参考与对话;提供网页版、单页全本、EPUB 与打印版
v3.12026-08-04证据引擎上线(证据库 EV-01~08、2026 基线读数、J 对账表、《判断交易记录》采集协议 v1);Skill 层扩至十个(新增 E09 组织内定档诊断、E10 判断交易记录采集),定价师内核升 v2.0(新增 LINK-E 落地救火、LINK-F 证据回流);站点首次真正上线 je.qiuyiwu.com

每一次修订都保留在版本记录里,包括被推翻的部分。一本谈可检验性的书,不应该悄悄修改自己的历史。

对账承诺

作者承诺每年对 J1–J7 七条主张做一次公开对账,说明每条的最新证据、置信变化,以及是否需要修正或撤回。对账结果与本书同址发布。

若某条主张被证伪,处理方式是在正文中保留原主张、标注证伪、说明影响范围,而不是删除它。

致谢

感谢那些坐在谈判桌另一边、把真实困境讲出来的经营者。这本书里最硬的几段——业务部门那句"业绩掉了谁来负责"、"数据归数据,判断归判断"、以及那份谈到了价格却没有验收页的合同——都不是我想出来的,是他们说出来的。理论的功劳在于把它们放到了一起。

感谢愿意在效果尚未验证时先付第一笔钱的客户。信任品市场的第一批买家承担了本不该由他们承担的风险,这本书试图解释的正是这件事。

感谢在各自方向上把兄弟体系推进下去的合作者。一个体系群的价值在于互相约束——是他们让我不能随便改一个术语的定义。

许可

本书内容采用 知识共享 署名—非商业性使用 4.0 国际(CC BY-NC 4.0) 许可。

你可以自由地:复制、分发、摘录、翻译、在内部培训中使用;条件是署名(注明作者与出处)且不用于商业销售

配套的十个 Skill 文件(定价师内核与 E01–E10)以同一许可发布,可下载后装进你自己的 Agent。

四件在线工具零依赖、零存储:不收集、不上传、不保存任何输入数据,所有计算在你的浏览器本地完成,关掉页面即消失。

联系

理论体系、工具与配套 Skill:je.qiuyiwu.com
兄弟体系星座总图:qiuyiwu.com/ams/constellation.html

三类来信优先回复:

  1. 能推翻 J1–J7 中任何一条的数据
  2. 用本书方法算过一笔真实账后的复盘(无论算对算错);
  3. 愿意参与第十一章五个研究招题的合作意向

判断经济学 · Economics of Judgment · 邱懿武 · 二〇二六