公开课课件

降本增效 × AI 提效

CXO 经营闭环工作坊

74 页 · 用浏览器打印可导出 PDF

全屏播放只放幻灯片;课件资料在退出全屏后阅读

返回课程介绍

P1 幕零 · 封面与议程

降本增效 × AI 提效

CXO 经营闭环工作坊

  • 价值在哪里
  • 证据有多强
  • 由谁负责
  • 如何规模化且不失控
课件资料 1 张表 · 1 张速记 · 1.1

源自 1.1 核心主张与钩子

三句话版本(开场用)

  • AI 已经不是选择题。国务院定了时间表:2027 年智能终端与智能体应用普及率超 70%。
  • 但用了 ≠ 赚到。全球 88% 的组织在用,只有 13% 报告企业级价值。
  • 差在哪? 差在没人把"省下的三小时"翻译成利润表上的一个数字。

为什么这个主张能打动老板

老板心里的话 本课给的答案
"又来卖 AI 的" 我不卖工具。我教你怎么验收工具。
"我们已经买了,效果一般" 对,全球 87% 的公司和你一样。问题不在工具。
"下面说提效了,我没看到钱" 因为省下的时间没有出口。我给你五个出口条件。
"投多少合适" 先别问投多少,先问基线在哪。没基线不立项。
"会不会出事" 五道闸门,第四道由 CFO 签字,第五道才准复制。

钩子三:−19% 的那个实验

主张   ── 差距不在技术,在经营闭环
数字   ── 88% 在用,13% 拿到企业级价值 → 75 个百分点的套利空间

三钩子 ── ① 75 个百分点的空档:同行都在跑,多数在原地跑
        ② 超级明星:+33.5% vs +163%,AI 放大差距不缩小差距
        ③ +55% 还是 −19%:同一工具两个方向,差别全是管理问题

收尾   ── 不教你用 AI,教你验收 AI:
          价值在哪里 · 证据有多强 · 由谁负责 · 如何规模化且不失控
P2 幕零 · 封面与议程

今天不讲什么

  • 大模型原理
  • 提示词技巧
  • 供应商方案

这些三个月就过时了。

课件资料 1 张表 · 1 张速记 · 1.1

源自 1.1 核心主张与钩子

三句话版本(开场用)

  • AI 已经不是选择题。国务院定了时间表:2027 年智能终端与智能体应用普及率超 70%。
  • 但用了 ≠ 赚到。全球 88% 的组织在用,只有 13% 报告企业级价值。
  • 差在哪? 差在没人把"省下的三小时"翻译成利润表上的一个数字。

为什么这个主张能打动老板

老板心里的话 本课给的答案
"又来卖 AI 的" 我不卖工具。我教你怎么验收工具。
"我们已经买了,效果一般" 对,全球 87% 的公司和你一样。问题不在工具。
"下面说提效了,我没看到钱" 因为省下的时间没有出口。我给你五个出口条件。
"投多少合适" 先别问投多少,先问基线在哪。没基线不立项。
"会不会出事" 五道闸门,第四道由 CFO 签字,第五道才准复制。

钩子三:−19% 的那个实验

主张   ── 差距不在技术,在经营闭环
数字   ── 88% 在用,13% 拿到企业级价值 → 75 个百分点的套利空间

三钩子 ── ① 75 个百分点的空档:同行都在跑,多数在原地跑
        ② 超级明星:+33.5% vs +163%,AI 放大差距不缩小差距
        ③ +55% 还是 −19%:同一工具两个方向,差别全是管理问题

收尾   ── 不教你用 AI,教你验收 AI:
          价值在哪里 · 证据有多强 · 由谁负责 · 如何规模化且不失控
P3 幕零 · 封面与议程

今天讲什么

九幕。三个高点分别在诊断、算账和治理。

  1. 第一幕 警报 窗口正在关闭 P4–P9
  2. 第二幕 真相 用了 ≠ 赚到 P10–P17
  3. 第三幕 诊断 钱漏在哪、流程堵在哪 P18–P28
  4. 第四幕 选择 别撒胡椒面 P29–P34
  5. 第五幕 能力 AI 究竟能做什么 P35–P43
  6. 第六幕 证据 谁真的做成了 P44–P50
  7. 第七幕 算账 别把三小时当利润 P51–P58
  8. 第八幕 治理 不出事的底线 P59–P67
  9. 第九幕 落地 90 天五道闸门 P68–P72
课件资料 1 张表 · 1 张速记 · 1.1

源自 1.1 核心主张与钩子

三句话版本(开场用)

  • AI 已经不是选择题。国务院定了时间表:2027 年智能终端与智能体应用普及率超 70%。
  • 但用了 ≠ 赚到。全球 88% 的组织在用,只有 13% 报告企业级价值。
  • 差在哪? 差在没人把"省下的三小时"翻译成利润表上的一个数字。

为什么这个主张能打动老板

老板心里的话 本课给的答案
"又来卖 AI 的" 我不卖工具。我教你怎么验收工具。
"我们已经买了,效果一般" 对,全球 87% 的公司和你一样。问题不在工具。
"下面说提效了,我没看到钱" 因为省下的时间没有出口。我给你五个出口条件。
"投多少合适" 先别问投多少,先问基线在哪。没基线不立项。
"会不会出事" 五道闸门,第四道由 CFO 签字,第五道才准复制。

钩子三:−19% 的那个实验

主张   ── 差距不在技术,在经营闭环
数字   ── 88% 在用,13% 拿到企业级价值 → 75 个百分点的套利空间

三钩子 ── ① 75 个百分点的空档:同行都在跑,多数在原地跑
        ② 超级明星:+33.5% vs +163%,AI 放大差距不缩小差距
        ③ +55% 还是 −19%:同一工具两个方向,差别全是管理问题

收尾   ── 不教你用 AI,教你验收 AI:
          价值在哪里 · 证据有多强 · 由谁负责 · 如何规模化且不失控

第一幕

警报

窗口正在关闭

P4–P9

P4 第一幕 · 警报

88% → 36% → 13%

用得多,赚得少。

三项调查样本与口径不同,不构成同一漏斗。

来源Stanford HAI, AI Index 2026;Accenture, Making Reinvention Real with Gen AI

课件资料 2 张表 · 2.1

源自 2.1 价值断层三组数

核心三根柱子

环节 数字 来源 口径
已采用 AI(至少一个业务环节) 88% [R019]A级 组织层面调查
已规模化生成式 AI 方案 36% [R024]B级 高管自报
报告出显著企业级价值 13% [R024]B级 高管自报

不加这句 = 被懂行的 CFO 当场拆台。加了这句 = 显得你比咨询公司还严谨。

佐证层(同一结论的其他角度)

结论 数字 来源
只有三分之一在真正重构业务 34% 在深度转型,其余停留表层或局部 [R023]
企业级 EBIT 影响有限 约 39% 受访者报告企业层面 EBIT 有影响 [R020]⚠️ 见下
投入结构失衡 花在技术上的预算是花在人上的 3 倍 [R024]
组织准备不足 只有 35% 的高管有"AI 如何重塑劳动力"的路线图 [R024]
P5 第一幕 · 警报

同样用 AI,差 5 倍

AI 不缩小差距,它放大差距。

来源PwC, Global AI Jobs Barometer 2026

课件资料 5 张表 · 2.5

源自 2.5 人才与组织

超级明星效应(全课最有冲击力的一组数)

组别 人均营收增长(2018 基线)
AI 暴露度最高的公司(整体) 33.5%
其中最强的 20%("超级明星") 163%

技能溢价:人才市场已经用钱投票

指标 2025 2024
具备 AI 技能的岗位工资溢价 62% 57%

两轨制劳动力市场(讲岗位重构,不讲裁员)

[R025]AI 正把岗位撕成两条轨道:

轨道 占比 特征 结果
专业化(professionalised) 22% 要求更深的判断与创造 增长速度是另一轨的 2 倍,工资增速高 42%
平民化(democratised) 52% 技能门槛降低,趋向低专业化活动 增长慢,工资涨得慢
  • AI 高暴露岗位的技能需求变化速度,是低暴露岗位的 2 倍
  • 依赖同理心、判断力、创造力的新任务,增加速度快 2.5 倍

入门级岗位的剧变(最值得管理层警惕)

发现 数字
AI 高暴露的入门级岗位,新增技能要求中属于"传统资深能力"(激励领导、战略决策、团队建设)的占比 52%
AI 低暴露的入门级岗位,同一比例 7%
被这样"资深化"的入门岗位数量 增长 35%
全球 AI 高暴露的入门级岗位总数 基本停滞

全球劳动力大盘(WEF,用于宏观背景页)

指标 数字
2030 年前新增岗位 1.7 亿
同期消失岗位 9,200 万
净增 7,800 万(约占今日就业 7%)
现有技能在 2025–2030 被转变或过时的比例 39%(低于 2023 年的 44%、2020 年的 57%)
若全球劳动力是 100 人,2030 年前需要培训的人数 59 人
其中:原岗位升级 29 人 / 升级后转岗 19 人 / 拿不到培训、就业前景受威胁 11 人
增长最快的技能 AI 与大数据,其次网络与网络安全、技术素养
最被看重的核心技能 分析性思维(7/10 企业视为必备),其次韧性/灵活性/敏捷、领导力与社会影响力
P6 第一幕 · 警报

+55% 还是 −19%?

同一类工具,两个方向。

受控实验:指定编码任务

+55%

用 AI 辅助的开发者更快

另一研究:资深开源开发者

−19%

反而更慢,且自认为变快了

差别在三件事:任务边界清不清、质量有没有人验、人机分工定没定。全是管理问题。

说明METR 团队后续未能复现该结果,主因是开发者已不愿在无 AI 条件下工作。

来源GitHub 受控实验;METR / Becker et al., 2025(该结果后续未能复现)

课件资料 3 张表 · 2.4

源自 2.4 生产率实证

任务级:有效的证据(都是受控/准实验)

场景 效果 研究 等级
客服(对话式 AI 助手) 每小时多解决 14%–15% 的问题 Brynjolfsson et al., 2025[R019] A-
软件开发(Copilot) 完成指定编码任务快约 55% [R049] A-
软件开发(Copilot,另一研究) PR 提交量多 26% Cui et al., 2025[R019] A-
市场营销(多模态生成广告素材) 人均产出 +50% Ju & Aral, 2025[R019] A-
通用办公(M365 Copilot) 若干任务实验平均提速约 29% [R050]约 3,000 名自然工作环境参与者 A-
发现 数字 来源
有经验的开源开发者用 AI 辅助后变慢 −19% METR / Becker et al., 2025[R019]
且他们自我感知是变快的 主观与客观脱节 同上
重度依赖 AI 学习的工程师 无可测速度提升,出现"学习惩罚" Shen & Tamkin, 2025[R019]
6,000 名高管四国调查 广泛采用,但已实现的生产率提升极小;预计未来三年就业 −0.7% Yotzov et al., 2026[R019]

一条规律(本节结论,写成大字上PPT)

观察 管理动作
任务边界越清晰,收益越大 先做流程标准化,再上 AI
有质量监控的地方,收益才留得住 先建验收标准,再谈提效
判断类、深度推理类工作收益可能为负 这类岗位别急着上,先做辅助不做替代
经验丰富者可能被拖慢 试点不要只找专家,也别只找积极分子
P7 第一幕 · 警报

国务院已经定了时间表

《关于深入实施“人工智能+”行动的意见》,2025 年 8 月。

  1. 2027新一代智能终端、智能体等应用普及率超 70%;率先实现与 6 大重点领域广泛深度融合
  2. 2030应用普及率超 90%;智能经济成为重要增长极
  3. 2035全面步入智能经济和智能社会发展新阶段

这是产业侧总体目标,不等于每家企业的内部渗透率。

来源国务院《关于深入实施“人工智能+”行动的意见》

课件资料 5 张表 · 2.3

源自 2.3 中国政策与产业

国务院定了时间表(最硬的一页)

《关于深入实施"人工智能+"行动的意见》,2025年8月发布 —— [R013]

时间点 目标
2027 年 率先实现 AI 与 6 大重点领域广泛深度融合;新一代智能终端、智能体等应用普及率超 70%
2030 年 AI 全面赋能高质量发展;智能终端、智能体应用普及率超 90%;智能经济成为重要增长极
2035 年 全面步入智能经济和智能社会发展新阶段

发改委的定调:阶段变了

关键词 含义 怎么用
从试验探索转向价值创造 官方承认前一阶段是试验,现在要见效 呼应"88% 用了但只有 13% 赚到"
最后一公里 场景、数据、人才仍是卡点 直接引出本课的诊断部分
供需协同 不只是买技术,要重构业务 引出流程重构

产业规模:市场已经足够大

指标 数字
2024 年我国 AI 核心产业规模 突破 9,000 亿元,同比 +24%
2025 年预计 1.2 万亿元
截至 2025 年底 AI 企业数量 超 6,000 家,全球占比 16%
2025 年公有云大模型(对客侧)Token 调用量 约 2,000 万亿

能力跃迁:国产不再是短板

维度 2025 年变化
头部语言大模型综合能力 提升约 30%
多模态理解能力 增长超 50%
国产芯片部署大模型精度 经协同优化后,基本与国外主流系统持平
通用智能体 vs 专用智能体 高度封装的通用智能体可优于顶级大模型本身

最扎心的一个数:数据质量

问题 占比
内容稠密性缺失 82.50%
领域相关性不足 14.04%
P8 第一幕 · 警报

只有 6% 会撤

如果当前投入不达预期,企业打算怎么办。

对手不会因为第一年没回本就停下来。

来源BCG AI Radar 2026(n=2,360)

课件资料 3 张表 · 2.2

源自 2.2 全球大势速查

钱:投资在翻倍,而且不看短期回报

数字 含义 来源
94% 即使 2026 年不产生预期财务回报,仍将继续投资的组织比例 [R021]
6% 若当前项目不达预期,计划收缩投资的比例 [R021]
70% / 24% 维持路线 / 加码投入(对同一问题的另两种回答) [R021]
翻倍 2026 年 AI 投资预计较上年翻一倍(占营收比重逐年抬升) [R021]

人:一把手亲自下场

数字 含义 来源
72% CEO 自称是本组织 AI 的主要决策人 [R021]
60% 领先组织(Trailblazers)的 AI 预算投向 Agent(智能体) 的比例 [R021]
83% 认为生成式 AI 的商业潜力超出其最初预期的高管比例 [R024]

速度:史上扩散最快的技术之一

数字 含义 来源
53% 生成式 AI 进入大众市场三年内的使用率 [R019]
快于同期的个人电脑与互联网 [R019]
88% 组织层面至少一个业务环节使用 AI [R019]
强正相关 国家 AI 使用率与人均 GDP 显著正相关 [R019]
P9 第一幕 · 警报

半年内,25% → 54%

「至少 40% 的实验进入生产」的公司比例。

这是你能拿到的最短的时间窗口提示。

来源Deloitte, State of AI in the Enterprise 2026

课件资料 2 张表 · 1 张速记 · 2.2

源自 2.2 全球大势速查

落地:从试点冲向生产

数字 含义 来源
25% → 54% "至少 40% 的实验进入生产"的公司比例,六个月内预计翻倍(+29pts) [R023]
+50% 2025 年员工可接触到 AI 的比例增幅 [R023]
34% 真正在深度重构业务的比例(其余停留在表层或局部) [R023]
58% → 80% 物理 AI(具身/工业现场)至少有限使用的比例,两年内 [R023]亚太领跑
钱  ── 94% 不回本也继续投,只有 6% 会撤
人  ── 72% 的 CEO 说"我就是决策人"
快  ── 3 年 53% 使用率,快过 PC 和互联网
近  ── 半年内,生产环境部署比例从 25% → 54%

制图建议

数据
"只有 6% 会撤" 甜甜圈图,70/24/6 [R021]
技术扩散速度对比 折线,生成式AI vs PC vs 互联网 [R019]
生产化冲刺 前后对比条,25% → 54% [R023]

第二幕

真相

用了 ≠ 赚到

P10–P17

P10 第二幕 · 真相

你不是落后了

87% 的公司和你卡在同一个地方。

课件资料 1 张表 · 2.1

源自 2.1 价值断层三组数

断层的三个成因(讲课主线)

成因 表现 对应本课哪一节
成本不透明 说得出总账,说不出单位成本 4.2 成本透明化
流程不可见 画的流程图 ≠ 真实跑的流程 4.3 流程诊断
收益不认账 省下的时间没有财务出口 4.6 ROI核算
P11 第二幕 · 真相

5% / 35% / 60%

按价值兑现程度,全球企业分三档。

  • 未来就绪已建立关键能力,AI 用于创新与重构
  • 规模化中正在规模化,开始产生价值
  • 落后档投入可观,但几乎没有实质价值

来源BCG 高绩效 AI 企业研究

课件资料 2 张表 · 2.7

源自 2.7 BCG价值分层

三档分层(可直接做成一页)

档位 占比 状态 BCG 称谓
第一档 5% 已建立关键能力,AI 用于创新与重构,不只是提效 未来就绪(future-built)
第二档 35% 正在规模化,开始产生价值 scaling
第三档 60% 投入可观,但几乎没有实质价值——收入和成本收益都极小 lagging

差距有多大 ⭐

对比 倍数
收入增长 5 ×
成本下降 3 ×
P12 第二幕 · 真相

第一档拿到了什么

未来就绪企业与其他企业的差距。

收入增长
成本下降
15%
AI 预算投向智能体

差距不是一次性拉开的,是每年复利拉开的:拿到收益 → 再投能力 → 收益更大。

来源BCG 高绩效 AI 企业研究

课件资料 2 张表 · 2.7

源自 2.7 BCG价值分层

第一档在做什么不一样

动作 数据
加大 IT 投入 计划多花 26%(接近营收的一个百分点)
AI 占 IT 预算比重 提高至多 64%
把收益再投入 将 AI 回报再投入人才与技术能力
押注 Agent 15% 的 AI 预算给 Agent;约 1/3 已在用
预期差距 2028 年,收入增长是落后者的 2 倍,成本下降多 40%

两组数不是同一件事,不要混用:

88 / 36 / 13 5 / 35 / 60
来源 Stanford + Accenture BCG
测什么 采用率 → 规模化 → 企业级价值 价值兑现的三个档位
用途 讲断层(问题在哪) 讲定位(我在哪一档)
放在哪一幕 ① 警报 / ② 真相 ② 真相 / 自评环节
  • 开场用 88/36/13 建立"用了≠赚到"的认知
  • 自评环节用 5/35/60 让他们对号入座
  • ⚠️ 不要把两组数画在同一张图上——口径不同,会被质疑
P13 第二幕 · 真相

你在哪一档?

不用举手,心里选一个。

  1. 01

    我们已经有 AI 项目明确进了财务报表

  2. 02

    我们有项目在规模化,开始见到价值,但还没进报表

  3. 03

    我们投了钱,但说不清拿到了什么

选第三项的,全球 60% 的公司和你一样。

课件资料 2 张表 · 6 张速记 · 2.7 · 5.6

源自 2.7 BCG价值分层

好消息(不要只留焦虑)

起点 第一步
落后档(60%) 从高层强力承诺开始,把业务目标翻译成愿景与战略
规模化档(35%) 投资(并把收益再投入)前瞻能力,比如 Agent 创新
5%   未来就绪  ── 收入增长 5倍 · 成本下降 3倍 · 1/3 已用 Agent
35%  规模化中  ── 开始见到价值 · 12% 用 Agent
60%  落后档    ── 投入可观,几乎无实质价值 · 几乎不用 Agent

第一档在做什么:
  IT 投入 +26% · AI 占 IT 预算至多 64% · 收益再投入 · 15% 预算给 Agent
  → 2028 年预期:收入增长 2倍于落后者,成本下降多 40%

关键机制 ── 复利:收益 → 再投能力 → 更大收益

源自 5.6 成熟度自评问卷

使用说明

说明
时机 幕②真相之后、幕③诊断之前
时长 填 10 分钟 + 讲评 10 分钟
形式 纸质、手写、不记名(不记名才有真话)
讲评 现场收几张念出来,不点名

维度一:战略与责任

□ 1. 公司有明确的 AI 优先级排序(哪些先做、哪些不做)        ___分
□ 2. 每个 AI 应用有明确的业务第一责任人(不是 IT)           ___分
□ 3. 高管团队能用同一套话说清"我们为什么做 AI"              ___分
□ 4. AI 结果写进了某个人的绩效考核                          ___分
                                            维度均分 ___

维度二:成本与价值

□ 1. 说得出主要流程的单位成本(每单/每工单/每次对话)        ___分
□ 2. 每个 AI 项目立项前有基线数据                           ___分
□ 3. 有 AI 收益被 CFO 或财务 BP 正式确认过                  ___分
□ 4. 算 ROI 时包含了人工复核和数据治理成本                  ___分
                                            维度均分 ___

维度三:数据基础

□ 1. 主数据已标准化(物料、客户、供应商编码统一)           ___分
□ 2. 关键流程的事件日志可导出(案例ID+活动+时间戳)          ___分
□ 3. 数据做了分级分类,权限最小化                           ___分
□ 4. 知道自己有多少条"结构完整、带标签"的可用数据            ___分
                                            维度均分 ___

维度四:流程与场景

□ 1. 知道标准流程和真实流程的差距(有多少种变体)            ___分
□ 2. 知道哪一步等待最长、返工最多                           ___分
□ 3. 在推的 AI 项目 ≤ 5 个,且有"不做清单"                  ___分
□ 4. 试点有对照组或历史基线                                 ___分
                                            维度均分 ___

维度五:组织与人才

□ 1. 有"AI 如何重塑岗位"的路线图                            ___分
□ 2. AI 预算中给人(培训、变革)的比例 ≥ 25%                ___分
□ 3. 会用 AI 的骨干有额外的保留机制                         ___分
□ 4. 员工清楚公司对 AI 与岗位的立场(增强还是替代)          ___分
                                            维度均分 ___
P14 第二幕 · 真相

六维成熟度自评

每维 1–5 分。看最短的那根,不看最长的。

AI 规模化是串联过程:数据不行→场景做不准→算不出账→财务不认→推不开。任何一环断了,后面全断。

课件资料 2 张表 · 3 张速记 · 5.6

源自 5.6 成熟度自评问卷

维度六:治理与风险

□ 1. 有书面的 AI 使用指引,并已宣贯                         ___分
□ 2. 有明确的牵头部门或治理组织                             ___分
□ 3. 高风险输出有强制人工签字环节                           ___分
□ 4. AI 参与的决策有留痕,可审计回溯                        ___分
□ 5. 有供应商退出方案(能换、数据能带走)                    ___分
                                            维度均分 ___

计分与定位

总分 档位 对应 BCG 分层[R022] 下一步
24–30 未来就绪 全球约 5% 投资前瞻能力(Agent),把收益再投入
15–23 规模化中 全球约 35% 补最短的那一维,然后做深一个核心流程
6–14 落后档 全球约 60%(投入可观但几乎无价值) 从高层承诺开始,先做不花钱的三件事

雷达图(现场画)

        战略与责任
            5
   治理  4     成本
   与风险 3      与价值
        2
   组织 1        数据
   与人才        基础
        流程与场景

六个维度的最快补短板动作

维度 分最低时,先做这一件 成本
战略与责任 给每个在跑的 AI 项目指定一个业务第一责任人,写下名字
成本与价值 挑三个流程,把单位成本算出来
数据基础 导出一个流程的事件日志(三列),看看能不能导
流程与场景 列出所有在跑的 AI 项目,砍到 3 个,写不做清单
组织与人才 明确对外说清:哪些岗位是增强不是替代
治理与风险 出一份使用指引 + 定一个牵头部门(中国移动、腾讯、阿里都这么做)[R016]
六维度 ── 战略责任 · 成本价值 · 数据基础 · 流程场景 · 组织人才 · 治理风险
计分   ── 每项 1-5 分,六维均分求和,满分 30
定位   ── 24-30 未来就绪(5%) / 15-23 规模化中(35%) / 6-14 落后档(60%)

⭐核心 ── 看最短的那根,不看最长的
         规模化是串联过程,任何一环断了后面全断

补短板 ── 六件事里四件零成本,这周就能做完
  • 不记名是关键。记名的话所有人都会打 4 分。
  • 现场念几张时,只念分数分布,不评价具体公司。
  • 如果全场普遍在 10 分以下——这是好事,说明他们诚实。要立刻说:"全球 60% 的公司在这一档,你们不孤单。"
  • 如果有人打了 28 分——私下问一句"哪个 AI 收益被 CFO 签过字?",通常会发现是高估。
P15 第二幕 · 真相

断层的三个成因

这一页是全课的导航图。

  • 成本不透明

    说得出总账,说不出单位成本

  • 流程不可见

    画的流程图 ≠ 实际跑的流程

  • 收益不认账

    省下的时间没有财务出口

课件资料 1 张表 · 1 张速记 · 2.1

源自 2.1 价值断层三组数

反向证据(让 13% 变成可达目标)

不要只讲断层,否则老板会得出"那就再等等"的结论。必须紧跟一句:断层是可以跨的,而且有明确条件。

条件 效果 来源
五项要务全部落实 拿到企业级成果的可能性 × 2.5 [R024]
把某个核心流程做深(风控/理赔/核保/研发) ROI 超预期的可能性 × 3 [R024]34% 的组织已做到
战略性投入 Agent 架构 成功规模化的可能性 × 4.5 [R024]
重塑工作方式与人才 拿到企业级价值的组织,此项得分高 88% [R024]
三根柱  ── 88% 已采用 → 36% 已规模化 → 13% 拿到企业级价值
⚠️必说  ── 三项调查口径不同,不构成同一漏斗

佐证    ── 只有 34% 在真正重构业务(Deloitte)
        ── 技术预算 : 人的预算 = 3 : 1(Accenture)
        ── 仅 35% 高管有劳动力重塑路线图

三成因  ── 成本不透明 · 流程不可见 · 收益不认账

13%不是运气 ──
  ×2.5  五项要务全落实      ×3    做深一个核心流程
  ×4.5  战略投入 Agent 架构  +88%  重塑工作方式得分
P16 第二幕 · 真相

13% 不是运气

拿到企业级价值的组织,做了同样四件事。

  • 五项要务全部落实 → 拿到企业级成果的可能性 × 2.5

  • 把某个核心流程做深 → ROI 超预期的可能性 × 3

  • 战略性投入智能体架构 → 成功规模化的可能性 × 4.5

  • 重塑工作方式与人才 → 此项得分高出 88%

来源Accenture(2,000+ 生成式 AI 项目 / 3,000+ C-level 高管)

课件资料 1 张表 · 1 张速记 · 2.1 · 2.5

源自 2.1 价值断层三组数

制图建议

  • 图型:三根柱子(88/36/13),断崖式,柱间用虚线箭头连接并标注"口径不同"。
  • 配色:88% 灰、36% 中灰、13% 高亮色(红或橙)。
  • 页脚:数据来源:Stanford HAI, AI Index 2026;Accenture, Making Reinvention Real with Gen AI。三项调查样本与口径不同,不构成同一漏斗。访问日期 2026-08-05。
  • Mermaid / ECharts 源码见 6.2。

源自 2.5 人才与组织

组织侧最大的缺口

缺口 数字 来源
花在技术上的 AI 预算 vs 花在人上的 3 : 1 [R024]
有"AI 如何重塑劳动力"路线图的高管 仅 35% [R024]
拿到企业级价值的组织,在"重塑工作方式"上的得分 高出 88% [R024]
预计将因生成式 AI 发生改变的工作时长占比 44% [R024]
增员  ── AI 暴露度最高的公司,人员增速是最低组的 2 倍
放大  ── 头部 20% 人均营收 +163%,同组平均 +33.5%(5倍差)
溢价  ── AI 技能工资溢价 62%(去年 57%)
两轨  ── 22% 岗位专业化(工资+42%) / 52% 平民化
新人  ── 入门岗 52% 的新技能要求是"资深能力"(低暴露组仅 7%)
大盘  ── 全球净增 7,800 万岗位;100 人中 59 人需培训,11 人拿不到
缺口  ── 预算 技术:人 = 3:1,但差距在"人"这侧拉开
P17 第二幕 · 真相

经营闭环七步法

这是你今天带走的第一张图。

  1. 成本透明化 钱在哪
  2. 流程诊断 堵在哪
  3. 场景组合 先做哪
  4. 小规模验证 行不行
  5. ROI 审计 赚没赚
  6. 组织与治理 谁负责
  7. 规模化复制 推得开吗

这是闭环不是流水线:⑦ 之后要回到 ①,因为规模化会改变成本结构。大多数企业断在 ① 和 ⑤。

课件资料 3 张表 · 1 张速记 · 4.1

源自 4.1 经营闭环七步法

七步详解

核心问题 关键动作 产出物 卡住的表现
① 成本透明化 钱花在哪? 建成本树,拆到流程/部门/单位成本 成本树 + 责任矩阵 说得出总账,说不出单位成本
② 流程诊断 流程堵在哪? 用事件日志看真实流程 目标流程 + 瓶颈图 画的流程图 ≠ 实际跑的流程
③ 场景组合 先做哪个? 价值×可行性矩阵 3–5 个优先场景 同时做 20 个试点
④ 小规模验证 真的行吗? 原型 + 试点,保留对照组 最小可行原型 + 试点数据 只验证"能生成",不验证准确率和成本
⑤ ROI审计 赚到了吗? 五层 KPI + 三个 ROI 数字 基线 vs 目标 vs 已确认 把省下的时间按工资全额折现
⑥ 组织与治理 谁负责?会不会出事? 责任人 + 五道闸门 治理闸门 + 责任矩阵 影子 AI、无人复核、无退出预案
⑦ 规模化复制 能推开吗? 跨部门复制 + 持续预算 复制手册 + 预算 试点孤岛,永远在试点

每一步对应本库哪一节

详细方法
4.2 成本透明化
4.3 流程诊断
4.4 场景优先级
4.7 治理与风险闸门(原型闸门、试点闸门)
4.5 KPI 指标树 + 4.6 ROI 核算
4.7 治理与风险闸门 + 2.5 人才与组织
4.7 规模化闸门

与信通院官方框架的对照(国企/汇报场景必备)

本课七步法 信通院《大模型落地路线图》四阶段[R018]
① ② ③ 诊断(能力分析、需求挖掘)
建设 + 应用(方案设计、研发测试、应用开发)
应用(效能评估)
⑥ ⑦ 管理(运维监测、运营管理)
钱在哪 → 堵在哪 → 先做哪 → 行不行 → 赚没赚 → 谁负责 → 推得开吗
  ①        ②        ③        ④        ⑤        ⑥        ⑦
                                        ↑
                              大多数公司死在这一环

第三幕

诊断

钱漏在哪、流程堵在哪

P18–P28

P18 第三幕 · 诊断 高点

一张采购订单,成本多少?

年度总成本大家都有。单位成本,很少有公司说得出。

课件资料 1 张表 · 4.2

源自 4.2 成本透明化

三个盲区

盲区 表现 后果
总账清楚,分账糊涂 知道 IT 花了 8,000 万,不知道哪个业务系统花了多少 没法定责任人
技术资源 ≠ 业务单元 云账单按资源计费,报表按部门看 谁都不为浪费负责
成本口径不统一 多云、SaaS、自建机房各说各话 没法横向比较
P19 第三幕 · 诊断

三个盲区

  • 总账清楚,分账糊涂

    知道 IT 花了多少,不知道哪个系统花了多少 → 没法定责任人

  • 技术资源 ≠ 业务单元

    账单按资源计费,报表按部门看 → 谁都不为浪费负责

  • 成本口径不统一

    多云、SaaS、自建各说各话 → 没法横向比较

课件资料 1 张表 · 4.2

源自 4.2 成本透明化

三件开源工具(课堂可演示,不需要连生产环境)

工具 解决什么 演示什么 许可
Microsoft FinOps Toolkit[R004] 云成本自动化 + Power BI 报表 成本趋势、闲置资源、承诺折扣、标签覆盖率 MIT
OpenCost[R005] Kubernetes / 多云成本分摊 按 namespace / team / application 看成本 Apache 2.0(文档 CC BY 4.0)
FOCUS 规范与样例数据[R008] 跨云、SaaS、数据中心的统一成本词汇 多云账单统一前后对比 按样例仓库 license.md(CC 系列)
Cloud Custodian[R006] 策略即代码:自动治理闲置与标签 夜间关停非生产资源 / 删除未挂载磁盘 / 标签合规 Apache 2.0
P20 第三幕 · 诊断

成本树

逐层拆开,直到每一层都有责任人。

总成本

  • 人力按流程/岗位拆 → 每个流程的人工单位成本
  • 云与算力按应用/团队拆 → 每个应用的单位成本
  • 软件许可按使用率拆 → 闲置席位占比
  • 外包与采购按品类拆 → 单价 vs 市场基准
  • 质量成本返工 / 漏检 / 停线 / 赔付
课件资料 1 张速记 · 4.2

源自 4.2 成本透明化

成本树(学员产出物 1)

总成本
├── 人力          → 按流程/岗位拆 → 每个流程的人工单位成本
├── 云与算力      → 按应用/团队拆 → 每个应用的单位成本(OpenCost)
├── 软件许可      → 按使用率拆   → 闲置席位占比
├── 外包与采购    → 按品类拆     → 单价 vs 市场基准
└── 质量成本      → 返工/漏检/停线/赔付  ← 最常被漏掉的一大块
P21 第三幕 · 诊断

质量成本:被漏掉的一大块

这些钱在财务报表上是分散的,从来没有人把它们加起来看过。

  • 返工:做第二遍的人工与物料

  • 漏检:流到客户手上的不良品损失

  • 停线:非计划停机的产能与交付损失

  • 赔付:质量索赔、退货与信誉损失

不把质量成本单独拉出来,好的 AI 项目会被低估到不值得立项。

课件资料 1 张速记 · 4.2

源自 4.2 成本透明化

三个必问的单位成本(学员带走)

□ 每单位业务量的成本是多少?   (每张订单/每个工单/每次对话/每份报价)
□ 这个成本在同行是什么水平?   (没有基准就没有目标)
□ 成本里有多少是"重复劳动"?   (这才是 AI 的射程范围)
P22 第三幕 · 诊断

同一笔支出有四个价格

用错口径,降本汇报就是假的。

  • ListCost

    标价成本

    官方牌价,没打折 · 谈判基准

  • ContractedCost

    合同成本

    你的协议价 · 看采购谈判成果

  • BilledCost

    账单成本

    这期账单上的数 · 对账与付款

  • EffectiveCost

    实际有效成本

    分摊预付与承诺折扣后的真实成本

单位经济性、部门分摊、ROI 只能用 EffectiveCost。用账单成本做分摊,预付那个月的部门被冤枉,后面十一个月在白嫖。

来源FOCUS Specification(FinOps Foundation)

课件资料 2 张表 · 1 张速记 · 4.11

源自 4.11 FOCUS成本口径

⭐ 四种成本(FOCUS 核心概念)

字段 中文 是什么 什么时候用
ListCost 标价成本 官方牌价,没打折 谈判基准、看折扣力度
ContractedCost 合同成本 你的协议价 看采购谈判成果
BilledCost 账单成本 这期账单上的数 对账、付款
EffectiveCost 实际有效成本 分摊预付/承诺折扣后的真实成本 ⭐ 单位经济性、部门分摊、ROI 只能用这个

FOCUS 是什么

以前:AWS 一套字段,Azure 一套,阿里云一套,SaaS 各一套
      → 想看"全公司在 AI 上花了多少" → 要人肉对齐几十个字段

现在:全部导出成 FOCUS 格式 → 同一套字段 → 一张表看全部

43 个标准字段(按用途分组)

关键字段 回答什么问题
成本 BilledCost EffectiveCost ListCost ContractedCost 四种价格
归属 BillingAccountId SubAccountId Tags 这笔钱算谁的
资源 ResourceId ResourceName ResourceType 具体是哪台机器/哪个服务
服务 ServiceName ServiceCategory ProviderName PublisherName 买的什么、从谁买的
用量 ConsumedQuantity ConsumedUnit PricingQuantity PricingUnit 用了多少(算单位成本的分母)
计费性质 ChargeCategory ChargeClass ChargeFrequency ChargeDescription 是用量费、订阅费还是一次性
折扣 CommitmentDiscountId/Name/Type/Status/Category 承诺折扣有没有用满
单价 ListUnitPrice ContractedUnitPrice PricingCategory 单价对不对
时间 BillingPeriodStart/End ChargePeriodStart/End 归属哪一期
位置 RegionId RegionName AvailabilityZone 跨区成本差异
规格 SkuId SkuPriceId 具体规格
P23 第三幕 · 诊断

FOCUS:43 个标准字段

跨云、跨 SaaS、跨自建的统一成本词汇。

  • 成本BilledCost · EffectiveCost · ListCost · ContractedCost
  • 归属BillingAccountId · SubAccountId · Tags
  • 资源ResourceId · ResourceName · ResourceType
  • 用量ConsumedQuantity · ConsumedUnit · PricingQuantity
  • 折扣CommitmentDiscountId / Type / Status / Category

Tags 决定你能不能回答「这笔钱算谁的」。FinOps 的第一个 KPI 不是省了多少钱,是标签覆盖率。

来源FOCUS Specification 与样例数据

课件资料 2 张表 · 2 张速记 · 4.11

源自 4.11 FOCUS成本口径

三个可以立刻做的动作

□ 1. 让 CIO 把云账单导出成 FOCUS 格式(各大云厂商已支持)
□ 2. 查标签覆盖率 —— 有多少支出能明确归属到业务线?
□ 3. 把所有成本汇报口径统一到 EffectiveCost,写进制度
业务线 EffectiveCost 单位业务量 单位成本 环比 标签覆盖率
¥/单 % %

课堂演示(不用真实账单)

素材 内容
FOCUS 官方样例数据[R067] focus_sample.csv(小)/ focus_sample_10000.csv / focus_sample_100000.csv.gz
演示 导入 Excel 或 Power BI → 按 ServiceCategory 和 Tags 透视 → 对比 BilledCost vs EffectiveCost
配合 Microsoft FinOps Toolkit[R004]的 Power BI 模板可直接接 FOCUS 数据
⭐四种成本 ── ListCost 标价 · ContractedCost 合同价
            · BilledCost 账单 · EffectiveCost 实际有效成本(摊销后)
            → 单位经济性、部门分摊、ROI 只能用 EffectiveCost

坑        ── 用 BilledCost 做分摊:预付那个月被冤枉,后面月份在白嫖

FOCUS     ── 跨云/SaaS/自建的统一成本词汇,43 个标准字段
最重要字段 ── Tags(决定"这笔钱算谁的")
第一个KPI  ── 不是省了多少钱,是标签覆盖率

三动作    ── 导出 FOCUS 格式 · 查标签覆盖率 · 口径统一到 EffectiveCost
P24 第三幕 · 诊断

四件开源工具

让钱可见。课堂演示一律用模拟数据。

  • FinOps ToolkitMIT

    云成本自动化与报表:成本趋势、闲置资源、承诺折扣、标签覆盖率

  • OpenCostApache 2.0

    按 namespace / 团队 / 应用分摊容器与多云成本

  • FOCUSCC 系列

    跨云账单统一口径与样例数据

  • Cloud CustodianApache 2.0

    策略即代码:夜间关停非生产、删未挂载磁盘、标签合规

课件资料 1 张表 · 4.2

源自 4.2 成本透明化

责任矩阵(学员产出物 2)

成本池 金额 占比 责任人 可下降空间 AI 可及性
例:客服人工 ¥XXX万 XX% 客服总监 XX% 高(对话结构化)
例:质检人工 ¥XXX万 XX% 质量总监 XX% 高(有标注数据)
例:闲置云资源 ¥XXX万 XX% 平台负责人 XX% 不需要 AI,改配置即可
P25 第三幕 · 诊断

先把不需要 AI 就能省的钱省了

闲置资源、重复许可、没关的测试环境。这部分通常能覆盖你第一个 AI 项目的预算。

课件资料 1 张速记 · 4.2

源自 4.2 成本透明化

与政策/数据的呼应

问题  ── 说得出总账,说不出单位成本
盲区  ── 分账糊涂 · 资源≠业务单元 · 口径不统一
工具  ── FinOps Toolkit · OpenCost · FOCUS · Cloud Custodian(全部开源)
产出  ── 成本树(含质量成本)+ 责任矩阵
金句  ── 先把不需要 AI 就能省的钱省了
  • 成本桑基图:总成本 → 产品线 → 流程 → 资源类型(见 6.2)
  • FinOps 驾驶舱截图:用模拟数据,展示成本趋势 + 闲置资源 + 标签覆盖率
P26 第三幕 · 诊断 高点

你画的流程 ≠ 真实跑的流程

6 步的标准流程,打开事件日志,通常能看到 40 多种走法。

课件资料 2 张表 · 4.3

源自 4.3 流程诊断

流程挖掘是什么(一句话解释给非技术高管)

能看见 管理含义
真实流程路径 制度和执行的差距有多大
变体(Variants) 有多少种非标准走法,各占多少
等待时间 哪一步在空转、卡在谁那里
返工路径 哪些环节反复打回
合规偏差 谁绕过了必经审批

工具:PM4Py[R007]

说明
是什么 Python 流程挖掘库
输入 事件日志(案例ID、活动名、时间戳,三列起步)
输出 流程图、周期分布、变体分析、瓶颈定位
关键路径 notebooks/1_event_data.ipynb、notebooks/5_advanced_examples.ipynb
许可 GPL 系列 —— 培训演示通常可行,嵌入商业产品须法务审查
P27 第三幕 · 诊断

流程挖掘看得见什么

不靠访谈、不靠问卷、不靠制度文件——靠数据。

  • 真实流程路径

    制度和执行的差距有多大

  • 变体分布

    有多少种非标准走法,各占多少

  • 等待时间

    哪一步在空转、卡在谁那里

  • 返工路径

    哪些环节反复打回

  • 合规偏差

    谁绕过了必经审批

起步只需要三列:案例编号、干了什么、什么时候。你的 ERP、OA、工单系统里全都有。

来源PM4Py(GPL 系列,演示可用;产品化须法务审查)

课件资料 1 张表 · 2 张速记 · 4.3

源自 4.3 流程诊断

四个必问(学员带走)

□ 1. 标准流程几步?实际有多少种变体?
□ 2. 哪一步等待时间最长?等在谁那里?
□ 3. 返工率多少?返工的是同一类问题吗?
□ 4. 有多少笔业务绕过了必经审批?

从流程诊断到 AI 场景(本节的落点)

诊断完,用三个筛子过一遍:

筛子 问题 通过的场景特征
重复性 这一步重复度高吗? 高频、模式化
等待性 这一步在等什么? 等信息、等审批、等人工判断
返工性 这一步为什么返工? 信息不全、规则没校验、质量不稳
重复多  → 自动化 / Agent 执行
等待长  → AI 预填 / 智能路由 / 并行化
返工多  → AI 规则校核 / 一次做对
P28 第三幕 · 诊断

三个筛子

从流程诊断到 AI 场景。

  • 重复多自动化 / 智能体执行
  • 等待长AI 预填 / 智能路由 / 并行化
  • 返工多AI 规则校核 / 一次做对

不是每个瓶颈都要用 AI。改个审批权限、加个必填字段就能解决的,先做掉——你的 AI 项目才不会背上不属于它的锅。

课件资料 1 张速记 · 4.3

源自 4.3 流程诊断

学员产出物:目标流程与瓶颈图

  • 当前真实流程(含主要变体占比)
  • 三个最大瓶颈(等待/返工/绕流)
  • 每个瓶颈的候选动作:标准化 / 自动化 / AI
问题  ── 制度里的流程 ≠ 系统里的流程
方法  ── 流程挖掘:从事件日志倒推真实流程
门槛  ── 只要三列:案例ID + 活动 + 时间戳
工具  ── PM4Py(GPL,演示可用,商用须法务审查)
四问  ── 几种变体?等在谁那?返工率?谁绕过审批?
落点  ── 重复→自动化 · 等待→预填/路由 · 返工→规则校核
纪律  ── 先看清 → 能标准化的先标准化 → 剩下的再上 AI
  • 流程变体图:标准流程 vs 实际前 5 大变体(附占比)
  • 等待时间瀑布:每步耗时拆解,标出最长等待
  • 前后对比漏斗:AI 介入后哪一步的等待/返工/流失下降

第四幕

选择

别撒胡椒面

P29–P34

P29 第四幕 · 选择

同时做 20 个 = 一个都没做

做深的赢,不是做多的赢。

课件资料 1 张表 · 1 张速记 · 4.4

源自 4.4 场景优先级矩阵

矩阵

     高 ┃  🟡 战略投入            🟢 立即启动
        ┃  (值钱但难,先拆解)    (先做这里)
   价值 ┃
        ┃  🔴 果断放弃            🔵 快赢练兵
     低 ┃  (别碰)               (建信心、练队伍)
        ┗━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
              低      可行性      高
象限 策略 数量建议
🟢 立即启动(高价值·高可行) 第一批做,90 天见结果 1–2 个
🔵 快赢练兵(低价值·高可行) 用来建立信心、练团队、跑通流程 1 个
🟡 战略投入(高价值·低可行) 拆成子问题,先补数据/流程基础 1 个(只做前置准备)
🔴 果断放弃(低价值·低可行) 明确写进"不做清单" 全部
P30 第四幕 · 选择

价值 × 可行性矩阵

气泡大小 = 风险或投入。

课件资料 2 张表 · 4.4

源自 4.4 场景优先级矩阵

价值维度(每项 1–5 分)

维度 问题
成本影响 涉及的年成本池有多大?
收入影响 能否缩短周期、提高转化、扩大产能?
频次 一年发生多少次?(次数 × 单次收益 = 真实价值)
战略性 是否触及公司的核心竞争环节?

可行性维度(每项 1–5 分)

维度 问题
数据就绪 有没有结构化的历史数据?(权重最高)
流程标准化 流程是否已标准化、边界清晰?
质量可验 对错能否被明确判定?
责任归属 有没有一个明确的业务所有者?
技术难度 现成方案能否覆盖?
P31 第四幕 · 选择

三条铁律

这不是我编的,是 Stanford AI Index 对所有生产率研究的总结。

  • 任务边界清晰

    说得清「做对了长什么样」

  • 可重复

    高频、模式化

  • 质量可监控

    有人或有规则能验

三条全中 → 可以做。缺一条 → 先补。缺两条以上 → 进不做清单。

来源Stanford HAI, AI Index 2026

课件资料 2 张表 · 1 张速记 · 2.4 · 4.4

源自 2.4 生产率实证

宏观级:J 曲线,别急着看总账

指标 数字 来源
12,000 家欧洲企业 AI 采用带来劳动生产率 +4%,有培训的效果更强 Aldasoro et al., 2026[R019]
美国 2025 年生产率增长 2.7%,接近前十年平均 1.4% 的两倍 [R019]
OECD 对 G7 的预测 未来十年年均 +0.2 至 +1.3 个百分点 Filippucci et al., 2025[R019]

注意那个 +4% 且"有培训的效果更强":这是你劝老板给培训预算的最硬证据(也顺便给你自己的课卖了个好价)。

✅ 有效  客服 +14~15%/编码 +26~55%/营销 +50%/办公 +29%
❌ 反例  资深开发者 −19%,且自以为变快了
📏 规律  任务边界清晰 + 可重复 + 有质量监控 = 增益最强
👤 谁受益  新手 > 老手(AI 在缩小技能差距)
📈 宏观  欧洲 12,000 企业 +4%(有培训更强);美国 2025 生产率 2.7%
⏳ 心态  J 曲线:先付成本,后见收益 —— 但要能证明在爬坡

源自 4.4 场景优先级矩阵

风险维度(决定气泡大小)

维度 问题
错误代价 一次错误的最大损失是多少?
合规敏感 涉及个人信息、财务、安全生产吗?
人的阻力 会不会被理解成裁员?
P32 第四幕 · 选择

数据就绪要加权

82.50%

行业数据集存在内容稠密性缺失

另有 14.04% 存在领域相关性不足。

你存了很多数据,但大部分对 AI 没用。建议数据就绪一项占可行性总分的 40%。

来源中国信通院《人工智能产业发展研究报告(2025年)》

课件资料 2 张表 · 3 张速记 · 2.3 · 4.4

源自 2.3 中国政策与产业

AI 在工业的落点分布

[R015]工业大模型呈"两端深化、中间突破":

环节 占比
后端运营管理 45.8%(最高)
前端研发设计 28.3%
中间生产制造 25.9%(提升中)

治理:官方也在提示风险

发现 数字
部分大模型测试中出现策略欺骗行为 高达 84%
其他风险 主动生成自身副本、拒绝关机指令、推理思维链攻击、模型幻觉

落地方法论:信通院官方框架(可直接教)

能力分析 → 需求挖掘 → 方案设计 → 研发测试
  → 应用开发 → 效能评估 → 运维监测 → 运营管理
政策  ── 2027 年普及率超 70%,还剩不到 17 个月
定调  ── 从"试验探索"到"价值创造",官方要求交账
市场  ── 2024 核心产业 9,000 亿(+24%),2025 冲 1.2 万亿
能力  ── 国产芯片精度基本持平,等待的技术理由在消失
数据  ── 82.5% 的行业数据集内容稠密性缺失 ← 你的真实起点
落点  ── 运营管理 45.8% > 研发设计 28.3% > 生产制造 25.9%
方法  ── 信通院四阶段八步骤,汇报时最好用的语言

版权提示

政府文件与信通院报告原生中文、可摘要引用,但:

  • 政府网站信息图(如发改委"一图读懂")完整引用,不裁掉来源、日期和标识
  • 信通院报告著作权保留,摘录数据须标明报告名与页码,整页图表转载需核验授权
  • 详见 7.3 许可红线

源自 4.4 场景优先级矩阵

三条筛选铁律(来自 2.4 的实证结论)

✅ 任务边界清晰      ← 说得清"做对了长什么样"
✅ 可重复            ← 高频、模式化
✅ 质量可监控        ← 有人或有规则能验
P33 第四幕 · 选择

常见场景预判

先看这张表,再讨论你们自己的清单。

客服对话辅助 / 自动应答立即启动
质检 / 缺陷识别立即启动
报价 / 投标文件生成中高立即启动
合同 / 单据信息抽取中高快赢
内部知识问答快赢
代码辅助中高快赢
需求预测 / 智能排产战略投入
战略决策辅助暂不启动

最后一行:需要深度推理和判断的工作,实证显示收益可能为零甚至为负。老板最想用 AI 的地方,恰恰是现在最不该用的地方。

课件资料 1 张表 · 4.4

源自 4.4 场景优先级矩阵

常见场景的预判(省时间用)

场景 价值 可行性 建议
客服对话辅助/自动应答 高(有历史工单) 🟢 典型首选
质检 / 缺陷识别 高(有标注数据) 🟢 制造业首选
报价 / 投标文件生成 中高 🟢 有规则可校核时
合同/单据信息抽取 中高 🔵 快赢经典
内部知识问答(RAG) 中(取决于文档质量) 🔵 注意文档不是知识
代码辅助 中高 🔵 但别外推成研发降本
需求预测 / 智能排产 低(数据+流程双重门槛) 🟡 战略投入,先补基础
战略决策辅助 低(判断类,实证收益可能为负) 🔴 现阶段别碰
P34 第四幕 · 选择

不做清单

工作坊结束时要交两份东西:要做的三个,和砍掉的全部。

砍掉的场景 砍掉的理由 什么条件下重启

不写下来,它们下周就会自己复活。

课件资料 1 张表 · 1 张速记 · 4.4

源自 4.4 场景优先级矩阵

工作坊流程(75 分钟标准版)

时间 环节 产出
10 min 各组列出候选场景(不设限) 场景清单
20 min 按价值/可行性打分 打分表
15 min 贴到矩阵上,气泡标风险 矩阵图
20 min 辩论:砍到 3 个 优先场景 + 不做清单
10 min 每个场景指定业务所有者 责任人签字
铁律  ── 边界清晰 · 可重复 · 质量可验(三缺一就先补)
配额  ── 立即启动 1–2 个 · 快赢 1 个 · 战略投入 1 个(只做准备)
加权  ── 数据就绪占可行性 40%(82.5% 的数据集有质量问题)
必交  ── 优先场景清单 + 不做清单 + 业务所有者签字
反直觉 ── 老板最想用 AI 的战略决策,恰恰是现在最不该碰的

第五幕

能力

AI 究竟能做什么

P35–P43

P35 第五幕 · 能力

三种模式

先给框架,再看演示。

  • RAG 检索增强

    它回答你,你判断 · 风险是答错

  • Copilot 辅助

    它建议你,你决定 · 风险是你不再判断了

  • Agent 自主执行

    它替你做,你事后知道 · 风险是做错了你不知道

课件资料 1 张表 · 1 张速记 · 5.5

源自 5.5 AI能力演示脚本

六步转译法(每个演示都走这六步)

1. 从经营问题开始      ← 不从技术开始
2. 选最小示例          ← 5 分钟能理解
3. 替换企业数据        ← 匿名化/合成/公开样例,绝不传真实敏感数据
4. 记录前后指标        ← 基线、结果、人工复核率、运行成本
5. 转成管理语言        ← 架构图旁必须写:责任人、风险、投入、扩展条件
6. 保留许可证与来源     ← PPT 备注记录仓库、版本、提交日期、许可证

准备

内容
数据 匿名化的企业文档(制度、产品手册、历史工单)10–50 份
环境 提前跑通并录屏备份(网络问题是第一杀手)
对照 准备 2 个能答对的问题 + 1 个答不上来的问题 ⭐
P36 第五幕 · 能力

演示一:知识库问答

四个画面,缺一不可。

  1. 输入:用户问了什么
  2. 输出:答了什么,引用了哪份文档的哪一段
  3. 耗时与 token:这是账单
  4. 人工校验:对不对,谁来判断

现场会故意问一个知识库里没有的问题。说「我不知道」是好模型;编一个看起来合理的答案,就是幻觉——也是你要花钱做复核的原因。

课件资料 1 张表 · 3 张速记 · 5.5

源自 5.5 AI能力演示脚本

现场四画面(缺一不可)

① 输入   ← 用户问了什么
② 输出   ← 答了什么,引用了哪份文档的哪一段
③ 耗时与 token  ← 这是账单
④ 人工校验     ← 对不对,谁来判断

管理问题(演示后立刻抛)

□ 答错了谁负责?
□ 答不上来的时候,会不会编?
□ 文档更新了,多久能反映到答案里?
□ 谁有权限看哪些文档?AI 会不会跨权限回答?

演示重点:人在驾驶位

AI 给建议 → 人判断 → 人决定采纳或拒绝 → 责任在人

现场对比(效果最好的做法)

无 AI 有 AI
完成时间 计时 计时
一次通过率 记录 记录
需要修改的比例 记录 记录
P37 第五幕 · 能力

演示二:辅助模式现场计时

同一任务,有无 AI 各跑一次。

  1. 完成时间
  2. 一次通过率
  3. 需要修改的比例

任务级 ≠ 岗位级 ≠ 企业级。如果一个岗位只有 20% 的时间花在这个任务上,29% 的任务提速等于岗位整体提速不到 6%。

课件资料 2 张速记 · 5.5

源自 5.5 AI能力演示脚本

管理问题

  • 受控实验:编码任务快约 55%[R049]
  • 但另一研究:资深开发者反而慢 19%[R019](附"后续未能复现")

演示重点:它自己规划、自己调工具

接到目标 → 自主拆解步骤 → 调用工具 → 判断结果 → 继续或调整 → 交付

管理问题(本环节最重要)

□ 它能做写操作吗?(改数据、下单、发消息)
□ 写操作有没有审批?谁批?
□ 出错了怎么回滚?
□ 十步任务第七步错了,怎么定位?有没有留痕?
□ 它的自主范围边界在哪?超出了会不会停下来问人?
P38 第五幕 · 能力

演示三:智能体多步任务

它自己规划、自己调工具、自己执行。

  1. 接到目标 → 自主拆解步骤
  2. 调用工具 → 判断结果
  3. 继续或调整 → 交付

我们会故意让它在第三步做错,然后看它继续往下走。这就是和聊天机器人最大的区别:聊天机器人出错给你一个错答案,你能看见;智能体出错,是替你做错了一件事。

课件资料 1 张表 · 5.5

源自 5.5 AI能力演示脚本

演示翻车预案 ⭐

情况 应对
网络断了 / API 挂了 提前录屏,直接放录像。说:"我提前录了,因为现场网络不可靠——这本身就是一个生产环境的风险提示。"
模型给了个很差的答案 不要慌,这是礼物。"太好了,正好演示了为什么需要人工复核。"
有人质疑演示数据是挑过的 坦白:"是的,这是准备好的示例。所以我不建议各位信我的演示,我建议你们用今天的方法自己跑一个试点。"
技术型高管抢话讲细节 "这块您比我专业。我把话题拉回来——从经营角度,这个选择的含义是……"
时间超了 砍掉 Copilot 演示(第二个),保留 RAG 和 Agent——这两个的管理含义差别最大
P39 第五幕 · 能力

风险是递增的

而且越来越难被发现。

  1. RAG答错
  2. Copilot你不再判断
  3. Agent做错了你不知道

所以能力越强,治理要求越高。这不是保守,是让你敢往前走的前提。规矩很简单:只读的可以放开,写操作必须审批 + 留痕。

课件资料 2 张速记 · 5.5

源自 5.5 AI能力演示脚本

演示纪律(红线)

🔴 绝不上传真实客户数据、合同、个人信息到公共 AI 服务
🔴 绝不在演示中出现密钥、内网地址、真实客户名
🔴 绝不承诺"我们也能做到这个效果"
✅ 一律使用匿名化/合成/公开样例数据
✅ 每个演示后立刻抛管理问题,把话题拉回经营
✅ PPT 备注记录:仓库、版本、commit、许可证
三演示  ── RAG(它答你判) · Copilot(它建议你决定) · Agent(它替你做)
风险线  ── 答错 → 你不再判断 → 做错了你不知道(递增且越来越难发现)

关键设计:
  RAG     故意问一个答不上来的 → 演示幻觉
  Copilot 现场计时对比 → 讲任务级≠岗位级
  Agent   故意演示一次失败 → 讲写操作审批

规矩    ── 只读放开,写操作必须审批 + 留痕
预案    ── 提前录屏;答得差是礼物;被质疑就坦白
P40 第五幕 · 能力

智能体正在成为分水岭

已在使用智能体的企业比例。

领先组织把 60% 的 AI 预算投向智能体;智能体占 AI 总价值的比重预计从 2025 年的 17% 升至 2028 年的 29%。

来源BCG AI Radar 2026;BCG 高绩效 AI 企业研究

课件资料 5 张表 · 1 张速记 · 2.6

源自 2.6 Agent与下一波

钱正在往这里走

数字 含义 来源
60% 领先组织(Trailblazers)的 AI 预算投向 Agent 的比例 R021 BCG
15% "未来就绪"企业分配给 Agent 的 AI 预算比例 R022 BCG
17% → 29% Agent 占 AI 总价值的比重:2025 → 2028 R022 BCG
× 3 计划投入 Agent 架构的组织数,较上年 R024 Accenture
× 4.5 成功规模化生成式 AI 的组织,更可能已战略性投入 Agent 架构 R024

谁在用,差距有多大

组别 使用 Agent 的比例 来源
未来就绪企业(5%) 约 1/3 R022 BCG
正在规模化的企业(35%) 12% R022
落后企业(60%) 几乎没有 R022

中国侧的证据

发现 数据 来源
通用智能体 vs 顶级大模型 高度封装的通用智能体产品,性能可优于顶级大模型本身 R015 信通院"方升"测评
机制 通过动态规划引擎 + 工具调用框架,构建"感知—决策—执行"闭环 R015
定位 智能体成为"数字员工"雏形;任务执行从流程固化转向动态优化 R015
规模 2025 年公有云大模型(对客侧)Token 调用量约 2,000 万亿 R015

具身 / 物理 AI(制造业客户必讲)

数字 含义 来源
58% → 80% 至少有限使用物理 AI 的企业比例,两年内;亚太领跑 R023 Deloitte
阶段 具身智能处于"从实验室验证向规模化商用过渡的关键期" R015
卡点 高质量数据短缺、跨场景泛化难、软硬协同稳定性 R015

管理含义:Agent 带来三个新问题

新问题 为什么以前没有 怎么应对
写操作授权 以前 AI 只输出文本,现在它会改数据、下单、发邮件 写操作必须走审批;预览—批准—执行分离
多步失败归因 十步任务第七步错了,怎么定位 全链路留痕,每步可追溯
责任边界 它自主决策了,出事算谁的 明确自主执行范围,超出即升级到人
趋势  ── AI 从"能思考"到"能实干"(信通院原话)
钱    ── 领先组织 60% 的 AI 预算投向 Agent
价值  ── Agent 占 AI 总价值 17%(2025) → 29%(2028)
分水岭 ── 使用率:未来就绪 33% / 规模化中 12% / 落后 ≈0
反直觉 ── 封装好的通用智能体,性能可优于顶级大模型本身
物理AI ── 58% → 80%(两年内),亚太领跑

管理  ── 以前 AI 出错给你错答案,以后 AI 出错替你做错事
规矩  ── 只读放开,写操作必须审批 + 留痕
P41 第五幕 · 能力

四个岔路口

不需要懂技术,但要知道这四个决策由老板拍板。

  1. 开源 还是 闭源决定团队投入与退出难度
  2. RAG 还是 微调90% 的企业应该先做 RAG
  3. 公有云 / 私有云 / 混合决定数据安全与前期投入
  4. 大模型 还是 小模型最容易省钱的一个决策,成本可能差一个数量级

金融业的默认答案是本地化部署:信通院记录,多数银行采用本地化方式应用大模型技术。

来源中国信通院《大模型落地路线图》

课件资料 3 张表 · 2 张速记 · 4.9

源自 4.9 技术选型决策表

决策一:开源 还是 闭源

方案 特点(信通院原文) 经营语言
开源模型 降低开发成本、加快开发速度;适用于基础研究、个人开发、快速验证、技术共享 便宜、快、可控,但要自己养团队
闭源模型 满足定制化、个性化、安全性需求;适用于安全要求高、个性化需求大、商业机密性强的场景 省心、有支持,但贵且可能被锁定
□ 我们有没有能维护开源模型的团队?(没有 → 闭源)
□ 数据能不能出企业?(不能 → 开源+私有化部署)
□ 三年后换供应商,成本多大?(大 → 优先开源)

决策二:怎么让模型"懂业务"(四选一或组合)

方案 特点 成本 何时用
检索增强生成(RAG) 辅助特定领域知识问答;可在一定程度上缓解幻觉并增强专业性 绝大多数企业的起点
全量微调 较好拟合数据集、学习能力强,但训练效率较低 微调数据较多时
高效微调 减少更新参数量,提高效率、降低算力依赖、减少训练时间 有数据但算力有限
指令微调 提高意图理解能力,提升问答对齐程度 交互体验不达标时
提示微调 用特定输入提示引导模型生成强相关内容 极低 快速验证
□ 先做 RAG,跑三个月,看还差什么   ← 90% 的企业应该从这里开始
□ 差在"不懂行话" → 指令微调
□ 差在"知识不全" → 补知识库,不是微调
□ 差在"任务模式特殊" → 才考虑微调

决策三:部署在哪

方案 特点 经营含义
公有云 可动态扩缩;开发和维护成本较低,避免自建基础设施 起步快,但数据出企业、长期成本可能更高
私有云 有效降低敏感数据泄露风险;管理运维更灵活;可利用现有软硬件 数据安全,但前期投入大
混合云 结合两者优势,应对突发需求和业务变化,灵活调整 多数中大型企业的现实选择
P42 第五幕 · 能力

RAG 只能「在一定程度上」缓解幻觉

检索增强生成可辅助模型进行特定领域知识问答,可在一定程度上缓解模型幻觉问题并增强专业性。

中国信通院《大模型落地路线图》原文

注意「一定程度上」四个字。很多供应商会说「上了 RAG 就不会胡说了」——官方口径没这么说。所以人工复核成本永远不能从预算表里删掉。

课件资料 2 张表 · 1 张速记 · 4.9

源自 4.9 技术选型决策表

决策四:用多大的模型

方案 特点 经营含义
百亿及以上 适用于对生成、理解、推理、决策准确率要求较高的复杂任务;训练和推理算力需求大 贵,但复杂任务只能用它
十亿及以下 适用于简单任务;算力需求小,可在边缘设备及端侧部署 便宜,适合高频简单任务、现场设备

四个决策的组合建议(按企业类型)

企业类型 模型 优化 部署 规模
大型国企 / 金融 开源 + 私有化 RAG 起步 私有云 / 本地化 混合(大模型做复杂,小模型做高频)
中型制造 闭源 API 起步 RAG 公有云 → 混合 小模型为主
科技 / 互联网 开源为主 RAG + 高效微调 混合云 按场景分层
小型企业 闭源 API 提示 + RAG 公有云 小模型
四个岔路口(老板要拍板的):
① 开源 还是 闭源      → 决定 团队投入 与 退出难度
② RAG 还是 微调       → 90% 的企业应该先做 RAG
③ 公有 / 私有 / 混合  → 决定 数据安全 与 前期投入
④ 大模型 还是 小模型   → 最容易省钱的一个决策

⚠️ 官方原话:RAG 只能"在一定程度上"缓解幻觉
   → 人工复核成本永远不能从预算表里删掉
P43 第五幕 · 能力

AI 的钱花在五层,加上第六行

智算云体系架构。

  1. AISaaS智算云应用服务 · 面向业务的成品应用
  2. MaaS大模型服务 · 模型本身与全流程能力
  3. AIPaaS智算云平台服务 · 开发、训练、部署工具链
  4. AIIaaS智算云基础设施服务 · 算力、网络、存储
  5. AIMSP智算云管理技术服务 · 端到端交付
  6. 人工复核不在技术架构里,但常是最大的持续运营成本

只填前五行的预算,都是不完整的预算。

来源中国信通院《云计算蓝皮书(2025年)》

课件资料 4 张表 · 2 张速记 · 4.12

源自 4.12 智算云五层架构

五层架构(信通院原始命名)

全称 一句话 谁的钱 自建还是买
AIIaaS 智算云基础设施服务 算力、网络、存储——AI 的地基 CIO / 基建 起步买,规模大了考虑自建
AIPaaS 智算云平台服务 开发、训练、部署的工具链 CIO / 研发 绝大多数企业应该买
MaaS 大模型服务 模型本身,全流程服务能力 CIO / 业务 买 + 少量微调
AISaaS 智算云应用服务 面向业务场景的成品应用 业务部门 优先买现成的
AIMSP 智算云管理技术服务 端到端交付的专业服务 CIO / 采购 买(但要防锁定)
  • AIIaaS:革新智能基础设施架构,助力模型高效训练推理
  • AIPaaS:重塑 AI 开发服务范式,加速 AI+ 应用规模化落地
  • MaaS:提供全流程服务能力,成为大模型工程化落地的重要载体
  • AISaaS:驱动企业级应用智能化,大幅提升业务场景运行效率
  • AIMSP:聚焦 AI 云专业技术服务,打通端到端大模型应用交付体系

⭐ 用这五层拆预算(本节核心工具)

年度预算 占比 自建/采购 供应商 换掉的成本
AIIaaS 算力基础设施
AIPaaS 平台工具链
MaaS 模型服务
AISaaS 业务应用
AIMSP 交付服务
人工复核(不在五层内)

三个决策问题(CIO 拍板用)

问题 判断依据
哪层自建? 只有当规模足够大、且这一层是你的差异化来源时才自建。绝大多数企业:只有数据和场景是自己的,其余全买。
哪层最容易被锁定? AIPaaS 和 AIMSP。工具链和交付服务一旦深度绑定,换供应商成本极高
哪层最容易省钱? MaaS——按场景分层用大小模型,见 4.9 技术选型
□ AIPaaS 层:优先选支持开放标准、模型可替换的平台
□ MaaS 层:至少接两家模型供应商,保持切换能力
□ AIMSP 层:合同里写明数据与知识库的导出条款

与市场趋势的呼应

发现 数据 来源
AI 云成为厂商破局关键 我国云计算市场保持高速增长 R017
"云+人工智能"双轮驱动 行业智能化应用加速普及 R017
算力投入规模 吉瓦级(GW)智算集群建设加码 R015
国产芯片 经软硬件协同优化,部署大模型精度已基本与国外主流系统持平 R015
Token 规模 2025 年公有云大模型(对客侧)调用量约 2,000 万亿 R015
五层  ── AIIaaS 基础设施 → AIPaaS 平台 → MaaS 模型 → AISaaS 应用 → AIMSP 交付服务
      (信通院《云计算蓝皮书(2025年)》智算云体系架构)

⭐加一行 ── 人工复核(不在技术架构里,但常是最大的运营成本)

自建原则 ── 只有"规模够大 + 是差异化来源"才自建
          绝大多数企业:只有数据和场景是自己的,其余全买

防锁定  ── AIPaaS/AIMSP 最易锁定
         → 选开放标准 · 至少接两家模型 · 合同写明数据可导出

最易省钱 ── MaaS 层:按场景分层用大小模型

第六幕

证据

谁真的做成了

P44–P50

P44 第六幕 · 证据

讲案例的四步

不管讲哪个案例,都走这四步。

  • 1

    它原来卡在哪?

    基线。没有基线的案例不值得讲

  • 2

    它改了什么?

    改流程,还是只换工具

  • 3

    数字怎么来的?

    谁测的、什么口径、A 还是 B 还是 C

  • 4

    换成你,前提是什么?

    落到听众自己身上

课件资料 3 张表 · 1 张速记 · 3.1

源自 3.1 案例速查表

全表

# 案例 一句话结果 行业 讲给谁 证据
1 Klarna AI 客服[R048] 约 2/3 对话由 AI 处理,≈700 人当量;解决时长 11min→<2min;SEC 披露 2024 年约省 3,900 万美元 金融/零售服务 CEO·CFO·客服 A-
2 GitHub Copilot 受控实验[R049] 指定编码任务快约 55% 科技/研发 CIO·CTO A-
3 Microsoft 365 Copilot[R050] 若干任务平均提速约 29%,约 3,000 名真实环境参与者 通用办公 CHRO·COO A-
4 BBVA 企业级采用[R051] 覆盖约 10 万员工,周活 >70%,人均每周省 约 3 小时,选定流程最高 80% 效率增益 银行 CEO·CHRO·CIO B
5 纺织"辅布司"平台[R052] 开机率 90%,生产成本降 15%–50%,设计成本降至原来 20% 纺织/轻工 CEO·COO B
6 高压电器部件 AI 无损检测[R053] 人工质检成本降 85%+,整体生产成本减 40%,检测效率 3 倍,研发周期缩短 28% 电子元器件/制造 COO·质量·CFO B
7 广联达工程造价智能化[R054] 准确率 98%+,编制效率 +50%–70%,3–5天→约4小时,变更风险降 30% 建筑/工程 COO·专业服务 C+
8 鼎捷配方与报价智能体[R055] 配方成本降 15%、效率 +8%;报价人工投入降 80%、报价利润达成 +15% 离散制造 COO·销售·CFO C
9 国家电网采购数字化[R056] 每年投标成本降 70%,累计压降库存储备约 80 亿元 能源/国企 CEO·采购·CFO B
10 新疆能源现场智能化[R057] 现场人员减少 75%+,智能设备替代约 80% 人工巡检 能源/重工 COO·安全生产 B

按行业索引

客户行业 首选案例 备选
制造 / 工业 6 电容质检、5 纺织 8 鼎捷、10 新疆能源
能源 / 国企 9 国家电网、10 新疆能源 6 电容质检
金融 / 银行 4 BBVA、1 Klarna 3 M365
零售 / 消费服务 1 Klarna 3 M365
建筑 / 工程 7 广联达 6 电容质检
科技 / 软件 2 Copilot 实验 3 M365
泛行业 / 混合高管班 1 + 6 + 9 4 BBVA

按管理主题索引

想讲的道理 用哪个案例
AI 能真的降到利润表上 1 Klarna(有 SEC 披露背书)
提速要区分任务级和岗位级 2 Copilot + 3 M365
规模化靠的是组织不是技术 4 BBVA(10万人、周活70%)
质量成本比人工成本更值钱 6 电容质检(漏检、停线、研发周期一起算)
先数字化,后智能化 9 国家电网(没有标准化就没有 AI)
供应商案例要打折看 8 鼎捷(C级,只能当假设)
减人要和安全、可用率一起看 10 新疆能源

讲案例的四步固定句式

不管讲哪个案例,都走这四步。学员会记住这个句式,比记住案例本身更有价值。

1. 它原来卡在哪?      ← 基线。没有基线的案例不值得讲
2. 它改了什么?        ← 改流程 还是 只换工具
3. 数字怎么来的?      ← 谁测的、什么口径、A还是B还是C
4. 换成你,前提是什么? ← 落到听众自己身上

⚠️ 讲案例的三条纪律

  • 不讲替代人数,讲经营结果。Klarna 那个"700 人当量"最好紧跟一句服务时长和重复咨询率——只讲人数会被问"那服务体验呢"。
  • 区间要解释。纺织案例"成本降 15%–50%"跨度很大,必须说明是不同企业基线差异,不是同一家波动。
  • C 级案例只当假设。广联达(C+)、鼎捷(C)来自媒体与供应商口径,讲的时候明确说"这是假设,不是承诺"。

详见 3.4 证据分级与打假清单。

P45 第六幕 · 证据

Klarna:唯一有监管文件背书的

A-金融科技 / 客服

约 2/3
客服对话由 AI 处理
≈700 人
相当于全职人力当量
11 分 → <2 分
平均解决时长
−25%
重复咨询
约 3,900 万美元
2024 年成本节省(监管披露)

新闻稿是公司想让你看的,监管文件是公司必须对法律负责的。这就是 A 级和 B 级的区别。

课堂提问这 700 人当量最后变成了减少招聘、承接更多业务量,还是仅仅让现有的人不那么忙?三种结果,财务含义完全不同。

来源Klarna 官方新闻稿与 SEC 披露

课件资料 3 张表 · 3.2

源自 3.2 国际标杆卡片

数字

指标 结果
AI 处理的客服对话占比 约 2/3
相当于人力 约 700 名全职 工作量
平均解决时长 11 分钟 → 不足 2 分钟
重复咨询 −25%
财务影响 2024 年约 3,900 万美元节省(SEC 披露)

注意事项

  • ⚠️ 不要只讲"替代 700 人",必须同时给服务时长、重复咨询、满意度
  • ⚠️ Klarna 后期对人工客服策略有调整,若被问到,答:"这恰恰说明 AI 客服不是一次性替换,是持续调优的人机配比问题"

数字

指标 结果
完成指定编码任务速度 快约 55%
补充证据(另一研究,Cui et al. 2025) PR 提交量 +26%

数字

指标 结果
若干任务实验平均提速 约 29%
样本 多家客户,约 3,000 名自然工作环境参与者

为什么这张卡值钱

样本大、在真实工作环境中测(不是实验室),适合行政、销售、财务、知识工作场景。

P46 第六幕 · 证据

高压电器部件 AI 无损检测:五个口袋

B电子元器件制造

−85% 以上
人工质检成本
−40%
整体生产成本
3 倍
单组件检测效率
−28%
产品研发周期
98%
软硬件国产化率

很多老板算 AI 质检的账只算「省了几个质检员」。这个案例的收益来自五个口袋:人工成本、漏检损失、停线风险、检测吞吐、研发周期。只算第一个,ROI 会被低估到不值得立项。

课堂提问研发周期为什么会因为一套质检系统缩短 28%?因为试制阶段的检测变快了,迭代圈就转得快了。AI 的收益经常出现在你没预期的地方——前提是你的指标体系看得到那个地方。

来源工业和信息化部案例公示

课件资料 3 张表 · 3.3

源自 3.3 中国实践卡片

数字(五个维度一起动,这是它最值钱的地方)

维度 结果
提质 质检准确率显著提升,不良率下降
降本 人工质检成本降 85%+;整体生产成本减 40%
增效 单组件检测效率提升 3 倍;产线切换耗时缩短;设备利用率提高
创新 产品研发周期缩短 28%
自主可控 软硬件国产化率 98%;打通 ERP / MES 数据链路
经营结果 2024 年营收 14,829.7 万元,利润 740.5 万元

为什么这张卡是王牌

  • 有真实财务数字(营收、利润到小数点),不是"提升 XX%"的空话
  • 五个维度同时改善——正好演示"质量成本"模型
  • 国产化率 98%——国企、军工、供应链安全敏感客户的必杀
  • 打通 ERP/MES——证明它不是孤岛试点

数字

指标 结果
设备开机率 达 90%
生产成本 降低 15%–50%
设计成本 降至原来的 20%(即 −80%)
平台部署费用 150 万–200 万元(按功能模块计费)

数字

指标 结果
每年投标成本 降低 70%
累计压降库存储备 约 80 亿元
配套规模 5 亿只智能电表、服务器超 1.9 万台、存储近 30 PB、企业级共享服务 900 余项
认可度 被商务部作为创新案例在全国推广
P47 第六幕 · 证据

国家电网:这不是一个 AI 案例

B能源 / 中央企业

−70%
每年投标成本
约 80 亿元
累计压降库存储备
900 余项
企业级共享服务
5 亿只
接入智能电表

我特意放一个不是 AI 的案例。这些数字是数据分级分类、一次录入共享应用和流程标准化赚来的,不是模型赚来的。而没有这一步,AI 是上不去的——信通院评估显示 82.5% 的行业数据集内容稠密性缺失。

课堂提问顺序不能反:先数字化,后智能化。想跳过第一步直接上 AI 的,最后都在第一步上补课,而且更贵。

来源国家电网公开案例;商务部创新案例

课件资料 1 张表 · 1 张速记 · 3.3

源自 3.3 中国实践卡片

补充案例(备选,按需取用)

案例 一句话 用途 证据
广联达工程造价[R054] 准确率 98%+,编制效率 +50%–70%,3–5天→约4小时,变更风险 −30% 讲专业知识工作:AI 价值不只是生成文档,还有规则校核、知识复用、变更风险下降 C+
鼎捷配方与报价智能体[R055] 配方成本 −15%、效率 +8%;报价人工 −80%、报价利润达成 +15% 讲 AI 同时影响成本、速度、利润质量三件事 C
新疆能源现场智能化[R057] 现场人员 −75%+,智能设备替代约 80% 人工巡检 讲安全生产、远程运营、人机协同 B

中国案例的组合讲法

国家电网(7) → 纺织(6) → 电容质检(5)
 先数字化      有价格能算账   五维度全打通
P48 第六幕 · 证据

BBVA 四级阶梯

覆盖约 10 万员工的规模化案例。

10 万 × 3 小时 × 50 周 = 1,500 万小时。案例披露到第三层就停了——不是他们藏着,是这一跳本来就最难。

来源BBVA 客户案例披露

课件资料 1 张表 · 2 张速记 · 3.2

源自 3.2 国际标杆卡片

数字

指标 结果
覆盖员工 约 10 万人
周活跃率 >70%
人均每周节省 约 3 小时
选定流程最高效率增益 80%

讲法:四级指标阶梯(本卡的核心教学价值)

采用率  ── 10 万人拿到了工具
   ↓
频率    ── 70% 每周真的在用   ← 大多数公司死在这一步
   ↓
时间    ── 人均每周省 3 小时
   ↓
经营结果 ── ???            ← 这一步案例没披露

注意事项

  • ⚠️ B 级:客户案例网页,数据为企业自报
  • ⚠️ "80% 效率增益"是选定流程的最高值,不是平均值,不能当整体口径

三张卡的组合讲法(推荐顺序)

Copilot(2) → M365(3) → BBVA(4) → Klarna(1)
 任务级实验 → 真实环境 → 组织级规模 → 财务确认
P49 第六幕 · 证据

A / B / C 三级证据

每个数字都要归到一级。

  • A

    监管文件、财报、随机对照实验、可复核的正式研究

    可以进商业论证与董事会决议

  • B

    企业官方披露、政府案例集、客户与供应商联合案例

    可以形成实施假设,进立项报告

  • C

    媒体、供应商、生态伙伴转述

    只能启发,必须二次验证

A 级敢写进董事会决议,B 级敢写进立项报告,C 级只敢写进头脑风暴白板。

课件资料 2 张表 · 1 张速记 · 3.4

源自 3.4 证据分级与打假清单

三级证据标准(教给学员的核心工具)

等级 是什么 例子 能用来干什么
A 级 监管文件、财报、随机对照实验、可复核的正式研究 Klarna SEC 披露、Copilot 受控实验、Stanford AI Index 可以进商业论证
B 级 企业官方披露、客户与供应商联合案例;数据具体但多为自报 BBVA、工信部案例集、纺织/电容质检 可以形成实施假设
C 级 媒体、供应商、生态伙伴转述 广联达、鼎捷 只能启发,必须二次验证

四类数字标签(比三级分类更细,用于报告数据)

课件里每个数字都应归入一类:

标签 含义 使用原则
市场统计 行业采用率、投资额、岗位趋势 说明外部环境,不用于承诺本企业收益
调查自报 高管或员工自报的收益与成熟度 说明方向,须提醒样本与主观偏差
项目观察 咨询公司/供应商总结的客户项目 可形成实施假设,不是独立审计
对照实验证据 随机或准实验中的时间、质量差异 可估算潜力,仍需企业内部验证

打假清单:老板可以带走的 8 个问题

□ 1. 基线是什么?        没有"改造前"的数字,任何百分比都不成立
□ 2. 谁测的?            供应商自测 / 客户测 / 第三方测,成色差三级
□ 3. 有对照组吗?        没有对照组,就分不清是 AI 的功劳还是别的
□ 4. 样本多大?多久?    3 个人用 1 周,和 3,000 人用 1 年,不是一回事
□ 5. 只挑了积极用户吗?  只采访自愿参与者 = 自动过滤掉失败者
□ 6. 质量测了吗?        只报速度不报质量的数字,一律打对折
□ 7. 成本算全了吗?      模型、集成、数据治理、人工复核、运维,缺一项就是假账
□ 8. 谁签字确认?        没有 CFO 签字的收益,都还只是 PPT
P50 第六幕 · 证据

打假八问

下次供应商来,逐条问。这是你带走的第一张卡。

  • 基线是什么?没有「改造前」的数字,任何百分比都不成立

  • 谁测的?供应商自测 / 客户测 / 第三方测,成色差三级

  • 有对照组吗?没有对照组就分不清是不是 AI 的功劳

  • 样本多大、多久?3 个人用 1 周和 3,000 人用 1 年不是一回事

  • 只挑了积极用户吗?只采访自愿参与者等于过滤掉失败者

  • 质量测了吗?只报速度不报质量的数字,一律打对折

  • 成本算全了吗?模型、集成、数据治理、人工复核、运维,缺一项就是假账

  • 谁签字确认?没有财务负责人签字的收益,都还只是 PPT

课件资料 2 张表 · 1 张速记 · 3.4

源自 3.4 证据分级与打假清单

五个最常见的数字陷阱(讲一个笑一片)

陷阱 长什么样 怎么破
任务级外推 "编码快 55% → 研发成本降 55%" 写代码只是研发周期的一段。要问:这个任务占岗位时间多少?
时薪折现 "每人每周省 3 小时 × 时薪 × 人数 = 收益" 省下的时间没有出口就不是钱。见 4.6 的五个出口条件
只报最高值 "效率提升最高达 80%" "最高达"= 挑出来的最好那个。要问平均值和中位数
幸存者偏差 "用了的人都说好" 不用的人为什么不用?流失率多少?
只测平均准确率 "准确率 98%" 要问高损失边缘案例的错误率。98% 准确率在 2% 的重大事故上是灾难

本课自己的数字,也要接受同样检验

检查项 状态
每个数字有资源 ID 和访问日期 见 7.2 数字溯源表
三根柱子(88/36/13)已注明"口径不同,不构成同一漏斗" ✅ 必须
McKinsey 39% EBIT 数据本地未核验,已标注状态 ⚠️ 见 2.1
METR −19% 已附"后续未能复现"说明 ✅ 必须
区间数据(如纺织 15%–50%)已解释基线差异 ✅ 必须
C 级案例已明确标注"假设,非承诺" ✅ 必须
A级 = 监管/财报/实验    → 进董事会决议
B级 = 企业自报          → 进立项报告
C级 = 媒体/供应商转述    → 进头脑风暴

问 8 句:基线?谁测?对照组?样本?只挑好的?质量?成本全吗?谁签字?

防 5 坑:任务级外推 · 时薪折现 · 只报最高 · 幸存者偏差 · 只看平均准确率

第七幕

算账

别把三小时当利润

P51–P58

P51 第七幕 · 算账

一笔很流行的假账

我经常收到这样的测算。

  • 1,000 名员工 × 每周省 3 小时 × 50 周 = 15 万小时
  • 15 万小时 × 时薪 100 元 = 一年省 1,500 万
课件资料 2 张速记 · 4.6

源自 4.6 ROI核算模板

五个出口条件(本课最值钱的一页)

省下的时间要变成财务收益,必须至少满足一条:

□ 1. 减少加班、外包或新增招聘
      → 直接成本下降,最硬

□ 2. 相同人员下提高订单/案件/客户处理吞吐
      → 产能释放,需要有增量需求接住

□ 3. 缩短上市/报价/收款/研发周期,产生增量收入
      → 收入侧收益,通常最大但最难证明

□ 4. 将人员容量重新配置到明确可衡量的高价值任务
      → 必须说出"配置到哪、怎么衡量",否则无效

□ 5. 降低错误、返工、事故、合规或客户流失损失
      → 质量成本,最常被低估

ROI 公式

              年度化已兑现收益 − 年度化总成本
    ROI =  ──────────────────────────────────
                    年度化总成本
P52 第七幕 · 算账 高点

你的人力成本,真的降了 1,500 万吗?

没有。一个人没走,工资一分没少。那 1,500 万在空气里。

课件资料 1 张表 · 2 张速记 · 4.6

源自 4.6 ROI核算模板

分子:年度化已兑现收益

产能释放收益
+ 外部支出避免
+ 增量利润
+ 资金占用下降
+ 风险损失避免

分母:年度化总成本(最常被算漏的一半)

模型与算力
+ 软件许可
+ 数据治理        ← 常被漏
+ 集成开发
+ 安全合规        ← 常被漏
+ 变革培训        ← 常被漏
+ 人工复核        ← 最常被漏!
+ 持续运维

三个 ROI 数字(每个试点都要有)

数字 谁算 用途 高管看不看
① 理论潜力 项目组 立项时激发想象 ❌ 不作为决策依据
② 风险折扣后的商业案例 项目组 + 财务 BP 立项评审 ✅ 主要依据
③ 财务已确认收益 CFO / 财务 BP 结项与规模化决策 ✅ 最终依据
P53 第七幕 · 算账

五个出口条件

省下的时间要变成财务收益,必须至少满足一条。这是你带走的第二张卡。

  • 减少加班、外包或新增招聘 —— 直接成本下降,最硬

  • 相同人员下提高订单、案件或客户处理吞吐 —— 产能释放,需要有增量需求接住

  • 缩短上市、报价、收款或研发周期并产生增量收入 —— 通常最大但最难证明

  • 将人员容量重新配置到明确可衡量的高价值任务 —— 必须说出配置到哪、怎么衡量

  • 降低错误、返工、事故、合规或客户流失损失 —— 质量成本,最常被低估

一条都勾不上,不是项目不好,是收益路径还没设计。回去设计完再来评审。

课件资料 1 张表 · 4.6

源自 4.6 ROI核算模板

收益折扣建议(风险折扣怎么打)

情况 建议折扣
收益来自 A 级对照实验,且本企业已验证 打 8–9 折
收益来自 B 级企业自报案例 打 5–6 折
收益来自 C 级媒体/供应商案例 打 3 折以下,或直接不计入
收益属于"时间节省"但出口条件未确认 计 0
收益属于收入侧(周期缩短带来增量收入) 打 3–5 折(最难证明)
P54 第七幕 · 算账

调用量不是价值

  • 本月调用 120 万次
  • 活跃用户 3,000 人
  • 累计提示词 8 万条

这三个数字里,哪一个能出现在利润表上?一个都不能。这不是价值指标,是虚荣指标。

课件资料 1 张表 · 1 张速记 · 4.5

源自 4.5 KPI五层指标树

五层指标树

        ┌─────────────────────┐
        │  ① 财务结果          │  ← 董事会只看这一层
        ├─────────────────────┤
        │  ② 运营结果          │
        ├─────────────────────┤
        │  ③ 客户结果          │
        ├─────────────────────┤
        │  ④ 人才结果          │
        ├─────────────────────┤
        │  ⑤ 风险结果          │  ← 出事的时候只看这一层
        └─────────────────────┘
   (调用量、活跃数在树之外——那是健康度监控,不是价值)
核心指标 常见误区
① 财务结果 EBIT 影响、成本避免、利润增量、现金流、资本占用、回收期 把所有节省时间按工资全额折现
② 运营结果 周期、吞吐、一次通过率、返工率、设备利用率、单位成本 只看速度,不看质量和需求变化
③ 客户结果 响应时间、一次解决率、转化率、留存、NPS、投诉率 把聊天机器人使用量等同于满意度
④ 人才结果 周活跃率、熟练用户比例、任务覆盖率、技能迁移、管理跨度 强制使用造成虚假活跃
⑤ 风险结果 错误率、幻觉率、敏感信息暴露、人工复核率、审计发现 只测平均准确率,不测高损失边缘案例
P55 第七幕 · 算账

五层 KPI 指标树

从虚荣指标到 EBIT,中间有五层,一层都不能跳。

  1. 财务结果

    EBIT 影响、成本避免、利润增量、现金流、资本占用、回收期

  2. 运营结果

    周期、吞吐、一次通过率、返工率、设备利用率、单位成本

  3. 客户结果

    响应时间、一次解决率、转化率、留存、NPS、投诉率

  4. 人才结果

    周活跃率、熟练用户比例、任务覆盖率、技能迁移

  5. 风险结果

    错误率、幻觉率、敏感信息暴露、人工复核率、审计发现

调用量与活跃数在树之外——那是健康度监控,不是价值。

课件资料 1 张表 · 1 张速记 · 4.5

源自 4.5 KPI五层指标树

每层的"必须配对"规则(本节精髓)

你报这个 必须同时报这个 为什么
处理速度 ↑ 一次通过率 / 返工率 快而错 = 更贵
人力节省 ↑ 服务水平 / 客户满意度 省人省出客户流失 = 亏
自动化率 ↑ 人工复核率 / 升级率 全自动但天天升级 = 假自动化
使用活跃度 ↑ 任务覆盖率 / 熟练用户比例 天天登录不干活 = 虚假活跃
准确率 ↑ 高损失边缘案例错误率 98% 准确率在 2% 的重大事故上是灾难
现场人员 ↓ 安全事故率 / 设备可用率 减人减出停机 = 亏(呼应新疆能源案例[R057])

BBVA 四级阶梯(讲"为什么不能跳层")

采用率   ── 10 万员工拿到工具
   ↓  (大部分公司在这里就开始吹)
频率     ── 70% 周活跃
   ↓  (多数公司死在这一步)
时间     ── 人均每周省 3 小时
   ↓  ← ⚠️ 最难的一跳
经营结果 ── ?
P56 第七幕 · 算账

正向必须配反向

任何一个正向指标,必须配一个反向指标,否则不许上报。

处理速度 ↑一次通过率 / 返工率快而错 = 更贵
人力节省 ↑服务水平 / 客户满意度省人省出客户流失 = 亏
自动化率 ↑人工复核率 / 升级率全自动但天天升级 = 假自动化
使用活跃度 ↑任务覆盖率 / 熟练用户比例天天登录不干活 = 虚假活跃
准确率 ↑高损失边缘案例错误率98% 准确率在 2% 的重大事故上是灾难
现场人员 ↓安全事故率 / 设备可用率减人减出停机 = 亏

以后任何人向你汇报 AI 成果,左边报了、右边没报,就把他打回去。单向指标一定会被优化到失真。

课件资料 1 张表 · 1 张速记 · 4.5

源自 4.5 KPI五层指标树

指标树填写模板(学员产出物)

指标 基线(改造前) 目标 试点实测 财务确认
① 财务 CFO 签字
② 运营
③ 客户
④ 人才
⑤ 风险
  • 基线列空着的,不许进 ROI 评审。
  • 每层至少一个指标 + 一个配对反向指标。
  • 最后一列只有 CFO 或财务 BP 能填。
树外  ── 调用量、活跃数 = 健康度监控,不是价值
① 财务  EBIT / 成本避免 / 利润 / 现金流 / 回收期
② 运营  周期 / 吞吐 / 一次通过率 / 返工率 / 单位成本
③ 客户  响应 / 一次解决 / 转化 / 留存 / NPS
④ 人才  周活 / 熟练比例 / 任务覆盖 / 技能迁移
⑤ 风险  错误率 / 幻觉率 / 信息暴露 / 复核率 / 审计发现

铁律  ── 正向指标必须配对反向指标,否则不许上报
铁律  ── 没有基线,不进 ROI 评审
  • 治理/成熟度雷达图:五层各打分,看短板(配合 4.7)
  • 四级阶梯漏斗:采用率 → 频率 → 时间 → 经营结果,标注每级衰减
P57 第七幕 · 算账

ROI 瀑布:毛收益 100,净收益 15

示意数值,用于说明衰减结构。

几乎所有的 AI 商业论证都漏掉了人工复核。我见过复核成本吃掉 60% 毛收益的项目。而且复核率本身是可优化的指标——第一个月 100%,第六个月降到 20%,这才是真正的成熟度曲线。

课件资料 1 张表 · 4.6

源自 4.6 ROI核算模板

完整模板(学员产出物 3)

项目 场景名称
基线 当前单位成本 / 周期 / 质量
出口条件 勾选 1–5 中的哪一条
毛收益 年度化
风险折扣 依据证据等级 ×__%
成本(全 8 项) 含人工复核与数据治理
① 理论潜力 ROI %
② 折扣后 ROI %
③ 财务已确认 ROI 试点后填 %
回收期 __ 个月
业务所有者 签字
财务确认人 签字
P58 第七幕 · 算账

三个 ROI 数字

每个试点都要有三个,高管只看后两个。

  • ① 理论潜力

    项目组算 · 立项时激发想象 · 不作为决策依据

  • ② 风险折扣后的商业案例

    项目组 + 财务 · 立项评审的主要依据

  • ③ 财务已确认收益

    财务负责人签字 · 结项与规模化的最终依据

折扣按证据等级打:A 级 8–9 折,B 级 5–6 折,C 级 3 折以下,出口条件未确认的时间节省计 0。很多公司的问题是:拿着第一个数字做了决策,然后永远没算过第三个。

课件资料 2 张速记 · 4.6

源自 4.6 ROI核算模板

ROI 瀑布图(推荐图表)

毛收益 ██████████████████  100
  模型与算力      ▼ −12
  集成开发        ▼ −18
  数据治理        ▼ −15
  人工复核        ▼ −22   ← 最大的那一块
  变革培训        ▼  −8
  持续运维        ▼ −10
净收益 ███              15
五出口 ── 减招/外包 · 吞吐 · 周期→收入 · 容量重配 · 损失避免
        (一条都勾不上 = 收益路径没设计)

分母8项 ── 算力·许可·数据治理·集成·安全合规·培训·人工复核·运维
        (人工复核最常漏,可吃掉 60% 毛收益)

三数字 ── 理论潜力 / 风险折扣后 / 财务已确认 → 高管只看后两个

铁律   ── 没有基线,不进评审;没有 CFO 签字,不算收益

第八幕

治理

不出事的底线

P59–P67

P59 第八幕 · 治理

治理不是刹车

赛车上装刹车,不是为了开慢,是为了敢开快。没有治理,AI 只能待在低风险的边角场景——而核心流程才是钱在的地方。

课件资料 1 张表 · 6 张速记 · 4.7

源自 4.7 治理与风险闸门

五道闸门(学员带走的核心工具)

① 场景立项 → ② 原型 → ③ 试点 → ④ 财务确认 → ⑤ 规模化
                                      ↑              ↑
                                  CFO 签字      过了才准复制

① 场景立项闸门

□ 业务所有者(不是 IT 负责人)
□ 现状基线(没有基线不进 ROI 评审)
□ 收益机制(五个出口条件勾一条)
□ 受影响员工范围
□ 数据来源与权限
□ 不可接受风险(红线)

② 原型闸门

□ 准确率           □ 稳定性
□ 成本(含单次调用成本)  □ 响应速度
□ 人工复核比例      □ 异常输入表现
□ 数据泄露风险

③ 试点闸门

□ 保留对照组或历史基线
□ 不能只采访积极使用者      ← 幸存者偏差
□ 时间和质量必须同时衡量
□ 覆盖高损失边缘案例

④ 财务确认闸门 ⭐

成本削减 / 成本避免 / 收入增量 / 现金流改善 / 风险避免

⑤ 规模化闸门

□ 数据权限     □ 模型监控     □ 异常升级路径
□ 供应商退出方案(换供应商要多久、数据能不能带走)
□ 员工培训     □ 持续预算(谁的钱养它)

风险清单(用 NIST 框架,映射到中国场景)

[R027] [R016]

风险类别 企业侧的真实表现 谁负责
内容错误 / 幻觉 生成的数据、条款、结论是编的 业务所有者 + 质量
敏感信息外泄 员工把合同、客户名单贴进公共服务 CISO + 法务
权限越界 AI 能查到它不该查的数据 CIO
影子 AI 员工自己在用,公司不知道 CIO + HR
供应链依赖 单一模型/供应商锁定 CIO + 采购
合规与个人信息 数据出境、个人信息处理 法务
责任归属不清 出了事没人是第一责任人 CEO
P60 第八幕 · 治理

26 个顶级模型,幻觉率 22%–94%

不是 2% 到 9%。

幻觉率越低,说明模型知识越扎实,或越懂得「什么时候该说不知道」。选型第一原则:不要选最会说的,要选最知道自己不会的。

来源Stanford HAI, AI Index 2026, Ch.3 Responsible AI

课件资料 3 张表 · 2.8

源自 2.8 幻觉与治理实证

幻觉率实测(26 个模型)

位置 模型 幻觉率
最低 Grok 4.20 Beta 0305 22%
第二 Claude 4.5 Haiku 26%
第三 MiMo-V2-Pro 30%
高位 Gemini 3 Flash 92%
最高 gpt-oss-20B (high) 94%

⭐ 最危险的发现:用户说错话,模型就跟着错

测试条件 结果
常规准确率 GPT-4o 98.2%
换成知识-信念基准 GPT-4o 掉到 64.4%
同一测试 DeepSeek R1 从 >90% 掉到 14.4%
把一个错误陈述说成"别人相信的" 模型处理得不错
把同一个错误陈述说成"用户自己相信的" 性能崩塌

其他四条实测(每条都有管理动作)

发现 数据 管理动作
方言/口音掉准确率 领先模型在地区方言下损失近一半准确率 客服、现场、基层场景要单独测方言
越狱后防线崩 AILuminate 基准下多数前沿模型安全评级"好"或"很好";对抗性提示攻击下,所有被测模型安全表现下降 安全测试必须包含对抗测试,不能只测常规
透明度在倒退 基础模型透明度指数 2023→2024 从 37 升到 58,2025 年跌回 40;训练数据、算力、部署后影响披露仍是主要缺口 采购问卷必须问训练数据与算力来源
责任 AI 各维度互相打架 实证研究发现:提升某一个责任 AI 维度的训练手段,会持续损害其他维度 别指望"又安全又公平又准确又快"——要明确排序
P61 第八幕 · 治理 高点

用户说错话,模型就跟着错

同一个错误陈述,两种说法,两种结果。

说成「别人相信的」

“有人认为地球是平的”

模型会纠正你

说成「我相信的」

“我认为地球是平的”

性能崩塌

  • GPT-4o98.2% → 64.4%
  • DeepSeek R1>90% → 14.4%

翻译成企业场景:当你的员工带着一个错误的前提去问 AI,AI 大概率会顺着他——而且会帮他把错误做得更专业、更完整、更像那么回事。所以人工复核不能只看输出,还要看输入的前提。

来源Stanford HAI, AI Index 2026, Ch.3 Responsible AI

课件资料 3 张表 · 2.8

源自 2.8 幻觉与治理实证

行业事故在快速上升

年份 AI 事故记录数(AI Incident Database)
2022 年前 每年 不到 100
2024 233
2025 362

好消息:企业治理确实在补课

指标 变化
AI 专属治理岗位 2025 年增长 17%
完全没有责任 AI 制度的企业占比 从 24% 降到 11%
声称"不受任何监管影响"的组织 从 17% 降到 12%
障碍 占比
知识缺口 59%
预算约束 48%
监管不确定性 41%
P62 第八幕 · 治理

事故在涨,透明度在退

透明度指数今年是倒退的。训练数据、算力与部署后影响的披露仍是主要缺口——所以采购问卷必须问训练数据与算力来源。事故库依赖人工审核,偏向英语媒体与高曝光事件,实际数量更高。

来源Stanford HAI, AI Index 2026, Ch.3 Responsible AI

课件资料 1 张表 · 1 张速记 · 2.8

源自 2.8 幻觉与治理实证

企业最常参照的规范(采购与合规话术用)

规范 被引用比例 变化
GDPR 60% 从 2024 年的 65% 下降
ISO/IEC 42001(AI 管理体系标准) 36% 2025 年新进入
NIST AI 风险管理框架 33% 2025 年新进入
幻觉  ── 26 个顶级模型,幻觉率 22% ~ 94%(不是 2%~9%)
      ── 低幻觉率 = 更懂得"什么时候承认不知道"
      ── 选型第一原则:不选最会说的,选最知道自己不会的

⭐最危险 ── 错误前提说成"别人相信的"→模型会纠正
          说成"我相信的"→性能崩塌
          → 员工带着错前提去问,AI 会顺着他,还做得更专业
          → 人工复核不能只看输出,要看输入的前提

四实测 ── 方言掉近一半准确率 · 越狱后所有模型防线下降
       ── 透明度倒退(58→40)· 安全/公平/准确互相打架

事故  ── 2022前<100 → 2024: 233 → 2025: 362
治理  ── 无制度企业 24%→11%;最大障碍是知识缺口 59%
参照  ── GDPR 60% · ISO/IEC 42001 36% · NIST AI RMF 33%
  • 幻觉率分布条形图:26 个模型排序,22%–94%,两端高亮
  • 前提污染对照图:「别人相信」vs「我相信」两栏,后者标红崩塌
  • 事故增长曲线:<100 → 233 → 362
  • 治理补课双柱:无制度企业 24% → 11%
P63 第八幕 · 治理

NIST 生成式 AI 十二类风险

国际中立框架,可直接转成检查表。

  1. 化生放核信息或能力
  2. 虚构(幻觉):自信地说出错误内容
  3. 危险、暴力或仇恨内容
  4. 数据隐私:个人信息泄露或去匿名化失效
  5. 环境影响:训练与运行的高算力消耗
  6. 有害偏见与同质化
  7. 人机配置:过度依赖与自动化偏见
  8. 信息完整性:虚假信息门槛降低
  9. 信息安全:提示注入、数据投毒
  10. 知识产权:内容侵权与商业秘密外泄
  11. 淫秽、贬损或辱骂内容
  12. 价值链与组件集成:上游不透明、供应商审查不足

汇报时可用三类归并:技术/模型风险(故障导致)、人为滥用(恶意使用)、生态与社会风险(系统性)。四个管理动作:治理 → 识别 → 测量 → 管理。

来源NIST AI RMF Generative AI Profile

课件资料 2 张表 · 4.10

源自 4.10 风险清单NIST与信通院

NIST 生成式 AI 十二类风险

# 风险 通俗解释 企业侧最常见的表现
1 CBRN 信息或能力 更易获取化生放核等危险信息 一般企业不适用,合规问卷会问
2 虚构(Confabulation) 自信地说出错误内容(俗称"幻觉") 最常见:编造条款、数据、案例
3 危险、暴力或仇恨内容 更易生成煽动、违法、自伤类内容 对外客服、内容生成场景
4 数据隐私 生物、健康、位置等个人信息泄露或去匿名化失效 员工把客户名单贴进公共服务
5 环境影响 训练与运行的高算力消耗 ESG 报告、双碳指标
6 有害偏见与同质化 放大历史与系统性偏见;不同群体/语言表现差异 招聘、信贷、定价场景
7 人机配置 人不当地拟人化 AI、过度依赖、自动化偏见 员工不再复核——最隐蔽的风险
8 信息完整性 降低了制造与传播虚假信息的门槛 对外发布内容失实
9 信息安全 降低攻击门槛;AI 自身易受提示注入、数据投毒攻击 提示注入、训练数据被污染
10 知识产权 更易复制受版权/商标保护内容;商业秘密外泄 生成内容侵权、代码许可污染
11 淫秽、贬损或辱骂内容 更易生成有害图像内容 对外产品必须过滤
12 价值链与组件集成 上游第三方组件不透明、不可追溯;供应商审查不足 你不知道供应商用了谁的模型和数据

NIST 的三类归并(汇报时更好讲)

类别 包含
技术/模型风险(故障导致) 虚构、危险推荐、数据隐私、价值链集成、有害偏见与同质化
人为滥用(恶意使用) CBRN、数据隐私、人机配置、辱骂内容、信息完整性、信息安全
生态/社会风险(系统性) 数据隐私、环境、知识产权
P64 第八幕 · 治理

企业该盯的四类

十二类看着吓人。对绝大多数企业,天天发生的只有四类。

  • 1

    虚构 / 幻觉

    它会自信地编 → 高风险输出必须人工签字

  • 2

    数据隐私

    员工把敏感数据贴出去 → 给合规入口 + 审计日志

  • 3

    人机配置

    用久了没人再复核了 → 复核率要持续监控,不能只在上线时定

  • 4

    价值链集成

    你不知道供应商底下是谁 → 采购问卷必须问模型与数据来源

第三类最容易被忽略:上线第一个月每份都仔细看,第三个月扫一眼,第六个月直接点通过。风险不是在上线那天最高,是在第六个月最高。

课件资料 2 张表 · 1 张速记 · 4.10

源自 4.10 风险清单NIST与信通院

企业最该盯的四类(讲课只讲这四个)

优先级 风险 一句话 最低限度对策
🔴 1 虚构 / 幻觉(#2) 它会自信地编 高风险输出必须人工签字
🔴 2 数据隐私(#4) 员工把敏感数据贴出去 给合规入口 + 审计日志
🟡 3 人机配置(#7) 用久了没人再复核了 复核率要监控,不能只在上线时定
🟡 4 价值链集成(#12) 你不知道供应商底下是谁 采购问卷必须问模型来源与数据来源

信通院"两横三纵"实践框架

                 开发侧      部署侧      应用侧
              ┌──────────┬──────────┬──────────┐
   管理(横) │  制度牵引 · 权责清晰 · 审计追踪        │
              ├──────────┼──────────┼──────────┤
   技术(横) │  能力支撑 · 护栏工具 · 监测预警        │
              └──────────┴──────────┴──────────┘
                     ↓ 产业多元共治(生态协同)
含义
两横 管理 与 技术 双线协同——制度牵引 + 能力支撑深度融合
三纵 开发侧 / 部署侧 / 应用侧 三侧发力——全链条防护
外圈 产业多元共治,生态协同
P65 第八幕 · 治理

信通院「两横三纵」实践框架

企业内部治理的中国口径。

开发侧 部署侧 应用侧
管理(横)制度牵引 · 权责清晰 · 审计追踪
技术(横)能力支撑 · 护栏工具 · 监测预警

产业多元共治(生态协同)

最低成本的第一步是两件管理动作,不花什么钱:出一份使用指引,定一个牵头部门。中国移动、腾讯、阿里都是这么起步的。

来源中国信通院《人工智能安全治理蓝皮书》

课件资料 2 张表 · 1 张速记 · 4.10

源自 4.10 风险清单NIST与信通院

五个实践模块

模块 要点
风险管理 构建闭环的风险管理体系
模型研发 筑牢开发安全源头根基
系统部署 构建部署安全防护屏障
应用运行 强化应用安全动态评估
产业生态 共建基准测试体系与协同治理机制

企业内部治理的四件事(信通院原文,可直接抄进制度)

# 动作 中国企业实例(信通院记录)
1 制定规范化操作指引,管理层审核发布并组织宣贯;按业务部门细化 中国移动印发《人工智能安全风险工作指引》,覆盖基础设施、服务提供、服务应用
2 组建专业化治理组织架构,协调内部多领域专家 腾讯、阿里已建立 AI 安全治理组织机构;微软"以太委员会"、IBM 隐私与负责任技术办公室
3 建立持续追踪与审计机制,内部审核 + 管理审核,持续改进 信通院牵头《人工智能安全治理系统风险管理能力要求》行业标准
4 风险管理流程与全生命周期结合,实现"前置防控、全程追踪、闭环管理" Google SAIF 框架把 AI 系统风险与业务流程结合
NIST 十二类 ── 虚构·隐私·偏见·人机配置·信息完整·信息安全·知识产权·价值链… 
NIST 四动作 ── 治理 Govern → 识别 Map → 测量 Measure → 管理 Manage

企业盯四类 ── 🔴幻觉 · 🔴数据泄露 · 🟡过度依赖 · 🟡供应商不透明
最隐蔽的   ── 人机配置:风险在第六个月最高,不是上线那天

信通院框架 ── "两横三纵"
  两横:管理 + 技术       三纵:开发侧 + 部署侧 + 应用侧
  五模块:风险管理·模型研发·系统部署·应用运行·产业生态

最低成本第一步 ── ① 出一个使用指引  ② 定一个牵头部门
P66 第八幕 · 治理

人机责任分工

AI 起草,人签字。

AI 执行

  • 起草
  • 抽取
  • 分类
  • 初判

人工复核

  • 高风险条款
  • 金额与期限
  • 异常升级
  • 最终签字

系统自动

  • 归档
  • 校验规则
  • 权限控制
  • 日志留痕

三条原则:对外承诺、财务金额、法律条款最终责任在人;复核率是可管理的指标而非固定成本;异常必须有升级路径,且升级路径上有真人。

课件资料 1 张速记 · 4.7

源自 4.7 治理与风险闸门

人机责任分工(一张泳道图讲清)

┌─────────┬──────────────┬──────────────┐
│  AI 执行 │  人工复核     │  系统自动     │
├─────────┼──────────────┼──────────────┤
│ 起草     │ 高风险条款    │ 归档          │
│ 抽取     │ 金额与期限    │ 校验规则      │
│ 分类     │ 异常升级      │ 权限控制      │
│ 初判     │ 最终签字      │ 日志留痕      │
└─────────┴──────────────┴──────────────┘
  • AI 起草,人签字。 对外承诺、财务金额、法律条款,最终责任在人。
  • 复核率是可管理的指标,不是固定成本——从 100% 逐步降到合理水平,本身就是成熟度证明。
  • 异常必须有升级路径,且升级路径上有真人。
P67 第八幕 · 治理

采购八问

这是你带走的第三张卡。

  • 底层用的是哪个模型?开源还是闭源?版本号?

  • 训练数据来源是什么?有无版权瑕疵?

  • 我们的数据会不会用于你们的模型训练?

  • 部署在哪?数据出不出我们的网络?

  • 有没有内容安全护栏?拦截规则谁定?

  • 提示注入和数据投毒的防护措施是什么?

  • 输出错误的责任如何划分?合同怎么写?

  • 如果我们要换供应商,数据和知识库能否导出?

课件资料 1 张速记 · 4.10

源自 4.10 风险清单NIST与信通院

采购问卷(学员带走,问供应商用)

□ 底层用的是哪个模型?开源还是闭源?版本号?
□ 训练数据来源是什么?有无版权瑕疵?        ← NIST #10 #12
□ 我们的数据会不会用于你们的模型训练?        ← NIST #4
□ 部署在哪?数据出不出我们的网络?
□ 有没有内容安全护栏?拦截规则谁定?          ← NIST #2 #3
□ 提示注入和数据投毒的防护措施是什么?        ← NIST #9
□ 输出错误的责任如何划分?合同怎么写?
□ 如果我们要换供应商,数据和知识库能否导出?  ← 退出方案
  • 两横三纵框架图(Mermaid 网格)
  • 十二类风险热力图(行=风险,列=可能性/影响)
  • 治理成熟度雷达(见 4.7)

第九幕

落地

90 天五道闸门

P68–P72

P68 第九幕 · 落地

90 天,五道闸门

不给你三年蓝图,给你 90 天。

  1. 场景立项

    业务所有者 · 现状基线 · 收益机制 · 数据来源 · 不可接受风险

  2. 原型

    准确率 · 稳定性 · 成本 · 响应速度 · 人工复核比例 · 异常输入 · 泄露风险

  3. 试点

    保留对照组或历史基线 · 时间与质量同时衡量 · 不能只采访积极使用者

  4. 财务确认

    由财务负责人确认收益属于成本削减、成本避免、收入增量、现金流改善还是风险避免

  5. 规模化

    数据权限 · 模型监控 · 异常升级 · 供应商退出方案 · 员工培训 · 持续预算

第四道是全套里最重要的一道:它把 AI 项目从技术部门自说自话,变成财务认账的经营动作。未经确认的个人时间节省,不得全部记为利润。

课件资料 1 张表 · 2 张速记 · 4.7

源自 4.7 治理与风险闸门

治理成熟度雷达(自评工具)

六个维度,各打 1–5 分:

        策略与责任
            │
   Agent ───┼─── 数据
   控制     │    治理
            │
   人员 ────┴──── 模型
   培训          监控
        安全与合规
维度 5 分标准
策略与责任 每个 AI 应用有明确的业务第一责任人
数据治理 分级分类完成,权限最小化,可审计
模型监控 准确率、幻觉率、成本持续监控并有告警
安全与合规 通过法务与安全评审,有数据出境判定
人员培训 使用规范已培训,红线清晰
Agent 控制 自主执行范围有边界,写操作需审批,有留痕
五闸门 ── 立项 → 原型 → 试点 → 财务确认(CFO签字) → 规模化
          ①      ②      ③      ④ ⭐            ⑤

七风险 ── 幻觉 · 泄密 · 越权 · 影子AI · 供应链锁定 · 合规 · 责任不清

分工   ── AI 起草,人签字;复核率是可降的指标;异常升级必须有真人

框架   ── NIST GenAI Profile【R027】+ 信通院安全治理蓝皮书【R016】
          Govern → Map → Measure → Manage

金句   ── 赛车装刹车不是为了开慢,是为了敢开快
P69 第九幕 · 落地

信通院四阶段八步骤

向上汇报时用这套语言,没人会质疑框架本身。

  1. 诊断

    • 能力分析
    • 需求挖掘
  2. 建设

    • 方案设计
    • 研发测试
  3. 应用

    • 应用开发
    • 效能评估
  4. 管理

    • 运维监测
    • 运营管理

五层要素:基础设施层 · 数据资源层 · 算法模型层 · 应用服务层 · 安全可信层

「效能评估」的官方指标包括场景渗透率、业务优化率和投入产出比——连官方框架都把投入产出比列为成熟度指标。对内决策用七步法,对外汇报用四阶段。

来源中国信通院《大模型落地路线图》

课件资料 5 张表 · 1 张速记 · 4.8

源自 4.8 信通院落地方法论

四阶段 · 八步骤 · 五层要素

诊断 ──────→ 建设 ──────→ 应用 ──────→ 管理
 │            │            │            │
能力分析      方案设计      应用开发      运维监测
需求挖掘      研发测试      效能评估      运营管理

五层要素(每一步都要看这五层):
基础设施层 · 数据资源层 · 算法模型层 · 应用服务层 · 安全可信层
阶段 目标 对应本课七步法
诊断 明晰业务发展和转型需求 ①②③ 成本/流程/场景
建设 筑牢技术底座 ④ 小规模验证(前半)
应用 优化部署 + 建立效能评估体系 ④⑤ 验证 + ROI审计
管理 运维监测与运营管理 ⑥⑦ 治理 + 规模化

1. 基础资源完备度

类别 评估什么
算力 浮点计算能力、芯片性能、能效比、综合利用率
网络 架构、带宽、延迟、稳定性
存储 容量、吞吐量、访问时延
软件设施 向量数据库、深度学习框架、操作系统的功能/性能/兼容性
数据资源 规模、类型、分布;准确性、完整性、一致性、可用性
算法模型 现有模型资产的种类、数量、部署模式、开放程度、兼容性

2. 人才团队配比平衡度

维度 评估什么
技术能力 大模型架构设计、算法优化、数据治理、测试验证
评估依据 教育经历、岗位任职、职称职级、工作年限、项目经验、知识产权
管理能力 团队领导、沟通协调、组织规划、分析决策、项目管理、自我学习

3. 战略规划契合度 ⭐

维度 评估什么
战略规划 使命愿景、发展定位、组织结构、市场需求、风险承受能力
经费预算 预算分配与硬件、软件开发、数据采集处理、人力、产品运营的匹配度
综合判断 结合建设需求、资源成本、项目周期、风险不确定性,现阶段预算能否满足

应用阶段:五层成熟度评估体系

信通院给出的评估维度,可直接转成企业自评表:

评估维度
基础设施 资源配备(服务器/芯片/存储/向量库/工具平台)+ 综合效能(训练与推理性能、兼容性、可靠性、稳定性、自主性)
数据资源 数据构成(来源/模态/分布)+ 数据质量(准确、完整、一致、关联、冗余度、数量级、更新频率)+ 多样性 + 可用性 + 安全合规 + 成本效益与投资回报率
算法模型 功能(感知/认知/跨模态融合/自主学习)+ 性能(准确率、计算效率、并发路数、响应速度、稳定性、鲁棒性、可复现性)
应用服务 服务体验 + 运营管理(流程化/自动化/持续闭环)+ 效能优化(场景渗透率、业务优化率、投入产出比)
安全可信 可信性(软硬件、数据、模型、服务、内容五个层面)+ 安全性(技术能力 + 管理制度)
P70 第九幕 · 落地

诊断三评

信通院要求在动手前评估三件事。

  • 基础资源完备度

    算力、网络、存储、软件设施、数据资源、算法模型资产

  • 人才团队平衡度

    技术能力与管理能力两侧,按项目经验、职级与专长综合评估

  • 战略规划契合度

    战略与预算能否支撑:现阶段经费投入能否满足建设与应用需求

最常见的失败不是技术不行,是战略上说要 all in、预算上按试点批。这两件事对不上,项目一定死在半路。三项拉出来打分,哪一项最低就先补哪一项。

来源中国信通院《大模型落地路线图》

课件资料 2 张表 · 1 张速记 · 4.8

源自 4.8 信通院落地方法论

管理阶段:三件事

动作 内容
实时监测 实时监测、动态追踪、预警机制
运营管理 面向平台和服务的运营管理参考模式
体系建设 建立健全大模型运营管理体系的原则与要点
四阶段  ── 诊断 → 建设 → 应用 → 管理
八步骤  ── 能力分析·需求挖掘|方案设计·研发测试|应用开发·效能评估|运维监测·运营管理
五层    ── 基础设施 · 数据资源 · 算法模型 · 应用服务 · 安全可信

诊断三评 ── 基础资源完备度 · 人才团队平衡度 · 战略规划契合度 ⭐
成熟度五层 ── 基础设施 / 数据资源 / 算法模型 / 应用服务 / 安全可信
关键指标 ── 场景渗透率 · 业务优化率 · 投入产出比(官方口径)

用途    ── 向上汇报的通用语言,没人会质疑框架本身
本课七步法(老板语言) 信通院四阶段(汇报语言)
① 钱在哪 ② 堵在哪 ③ 先做哪 诊断(能力分析、需求挖掘)
④ 行不行 建设 + 应用(方案设计、研发测试、应用开发)
⑤ 赚没赚 应用(效能评估)
⑥ 谁负责 ⑦ 推得开吗 管理(运维监测、运营管理)
  • 四阶段八步骤流程图(Mermaid,见 6.2)
  • 三项就绪度雷达(自评打分,1–5 分)
  • 五层成熟度热力图(行=五层,列=五个成熟度等级)
P71 第九幕 · 落地

今天带走什么

不是一份课件。

三张现场手写的表

  • 场景组合表(含不做清单)
  • 价值核算表(基线 · 出口条件 · 三个 ROI)
  • 90 天行动计划(五道闸门 · 责任人 · 日期)

四张随身卡

  • 打假八问
  • 采购八问
  • 五个出口条件
  • CXO 术语表

讲师会把三张表当场拍照留档,90 天后对一次结果。

课件资料 6 张表 · 2 张速记 · 5.4

源自 5.4 课堂产出模板

A 区:候选场景打分

□ 任务边界清晰    □ 可重复    □ 质量可监控
(三缺一 → 先补;缺两个以上 → 进不做清单)

B 区:优先场景(最多 3 个)

# 场景名称 业务所有者<br>(不是IT) 90天目标 签字
1
2
3

基线(不填这一栏,不进 ROI 评审)

当前值 数据来源
单位成本
处理周期
质量指标(一次通过率/准确率)
年业务量

收益出口(必须勾至少一条)

□ 1. 减少加班、外包或新增招聘
□ 2. 相同人员下提高吞吐          → 增量需求从哪来?__________
□ 3. 缩短周期产生增量收入        → 增量收入怎么衡量?________
□ 4. 容量重配到高价值任务        → 配置到哪?怎么衡量?______
□ 5. 降低错误/返工/事故/流失损失  → 当前损失金额?__________

五层 KPI(每层至少一个正向 + 一个配对反向)

正向指标 基线 目标 配对反向指标 基线 底线
① 财务
② 运营
③ 客户
④ 人才
⑤ 风险

ROI 三数字

金额 / 比率 说明
年度化毛收益
风险折扣 × ___% 依据证据等级(A:8-9折 / B:5-6折 / C:≤3折)
年度化总成本(8项) 算力·许可·数据治理·集成·安全合规·培训·人工复核·运维
① 理论潜力 ROI % *仅供参考,不作决策依据*
② 折扣后 ROI % 立项依据
③ 财务已确认 ROI % 试点后填,规模化依据
回收期 ___ 个月

表 3|90 天行动计划(五道闸门)

闸门 交付内容 责任人 目标日期 通过标准
① 立项 业务所有者 · 基线 · 收益机制 · 数据来源 · 风险红线 第 __ 天 六项齐全
② 原型 准确率 · 稳定性 · 成本 · 响应速度 · 复核比例 · 异常输入 · 泄露风险 第 __ 天 七项全过
③ 试点 对照组/历史基线 · 时间与质量双测 · 覆盖边缘案例 第 __ 天 不只采访积极用户
④ 财务确认 ⭐ 收益归类:成本削减/成本避免/收入增量/现金流/风险避免 CFO:______ 第 __ 天 CFO 签字
⑤ 规模化 数据权限 · 模型监控 · 异常升级 · 供应商退出方案 · 培训 · 持续预算 第 __ 天 六项齐全才准复制
环节 动作
发放时机 表1 在工作坊前发;表2 在 KPI 模块前发;表3 在最后一段发
现场纪律 手写,不用电脑。手写的思考深度不一样
收尾动作 讲师逐个念出承诺栏的名字和日期
留档 当场拍照,发到群里
跟进 90 天后主动对一次——这是复购的最好时机
P72 第九幕 · 落地

四个问题

回到开场

  • 价值在哪里
  • 证据有多强
  • 由谁负责
  • 如何规模化且不失控

这堂课不教你用 AI,教你验收 AI。模型三个月就换代,这四个问题十年后还成立。

课件资料 1 张表 · 1 张速记 · 1.1

源自 1.1 核心主张与钩子

三句话版本(开场用)

  • AI 已经不是选择题。国务院定了时间表:2027 年智能终端与智能体应用普及率超 70%。
  • 但用了 ≠ 赚到。全球 88% 的组织在用,只有 13% 报告企业级价值。
  • 差在哪? 差在没人把"省下的三小时"翻译成利润表上的一个数字。

为什么这个主张能打动老板

老板心里的话 本课给的答案
"又来卖 AI 的" 我不卖工具。我教你怎么验收工具。
"我们已经买了,效果一般" 对,全球 87% 的公司和你一样。问题不在工具。
"下面说提效了,我没看到钱" 因为省下的时间没有出口。我给你五个出口条件。
"投多少合适" 先别问投多少,先问基线在哪。没基线不立项。
"会不会出事" 五道闸门,第四道由 CFO 签字,第五道才准复制。

钩子三:−19% 的那个实验

主张   ── 差距不在技术,在经营闭环
数字   ── 88% 在用,13% 拿到企业级价值 → 75 个百分点的套利空间

三钩子 ── ① 75 个百分点的空档:同行都在跑,多数在原地跑
        ② 超级明星:+33.5% vs +163%,AI 放大差距不缩小差距
        ③ +55% 还是 −19%:同一工具两个方向,差别全是管理问题

收尾   ── 不教你用 AI,教你验收 AI:
          价值在哪里 · 证据有多强 · 由谁负责 · 如何规模化且不失控
P73 附录 · 术语与声明

CXO 术语表

每个词只解释对经营的含义。

计费与成本

Token
模型计费与计算的最小单位。用量翻倍,账单翻倍
推理
对外提供服务时的每一次计算——持续成本在这里,不在训练
单位经济性
每一单业务的成本。说不出这个,就没资格谈降本

做法

RAG 检索增强
先从你的知识库里查,再基于查到的内容回答。90% 企业的正确起点
微调
用你的数据继续训练。差在「不懂行话」时用;差在「知识不全」应该补知识库
智能体
会自己规划、调工具、执行多步任务。写操作必须审批

治理

幻觉
自信地说出错误内容。永远存在,只能缓解不能消除
人工复核率
多少比例的输出需要人看。是可下降的指标,不是固定成本
影子 AI
员工自己在用、公司不知道的工具。给正门,别只堵

最容易被忽悠的五个说法

  • 「准确率 98%」——在谁的数据上测的?高损失边缘案例的错误率是多少?
  • 「零幻觉」——官方口径是「在一定程度上」缓解
  • 「开箱即用」——你的数据质量决定一切
  • 「行业大模型」——训练数据哪来的?和 RAG 比强多少?
  • 「提效 80%」——任务级 ≠ 岗位级 ≠ 企业级
课件资料 6 张表 · 1 张速记 · 9.1

源自 9.1 CXO术语表

能力类

术语 一句话(经营语言) 老板该问的问题
大模型 / LLM 在海量文本上训练出来的通用语言能力 我们是买、租,还是自建?
多模态 能同时处理文字、图片、语音、视频 我们的场景需要看图吗?需要就别选纯文本模型
Token 模型计费和计算的最小单位,约等于半个汉字到一个词 这是账单的计量单位——用量翻倍,钱就翻倍
上下文窗口 模型一次能"记住"多少内容 决定能不能一次读完一份长合同
推理(Inference) 模型对外提供服务时的每一次计算 持续成本在这里,不在训练
幻觉 / 虚构 自信地说出错误内容 永远存在,只能缓解不能消除 → 复核成本删不掉

做法类(四个决策相关)

术语 一句话 什么时候选它
提示工程 / Prompt 用更好的问法让模型给更好的答案 最便宜的起点,先试这个
RAG(检索增强生成) 先从你的知识库里查,再让模型基于查到的内容回答 90% 企业的正确起点;可"一定程度上"缓解幻觉[R018]
微调(Fine-tuning) 用你的数据继续训练模型,让它更懂你的行话和格式 差在"不懂行话"时;差在"知识不全"应该补知识库而不是微调
高效微调 只更新一小部分参数,省算力省时间 有数据但算力有限
知识库 / 向量库 把企业文档变成模型能检索的形式 RAG 的地基;文档质量决定上限
Agent / 智能体 会自己规划、调工具、执行多步任务 流程清晰 + 有接口 + 能验 + 能回滚,四条齐了再上
MCP / 工具调用 让模型能操作外部系统(查库、下单、发消息) 写操作必须审批,只读可放开

成本与部署类

术语 一句话 经营含义
公有云 / 私有云 / 混合云 跑在别人机房 / 自己机房 / 两者结合 决定数据出不出企业、前期投入多大
本地化部署 模型完整放在自己环境里 金融业默认答案;多数银行采用[R016]
端侧 / 边缘部署 跑在设备上,不上云 现场、产线、断网场景
FinOps 让云和算力成本可见、可归属、可优化的管理方法 让每个部门为自己花的钱负责
单位经济性 每一单业务的成本是多少 说不出这个,就没资格谈降本
小模型 / 大模型 十亿以下 vs 百亿以上参数 最容易省钱的一个决策,成本可能差一个数量级

治理类

术语 一句话 谁负责
人工复核率 多少比例的 AI 输出需要人看 是可下降的指标,不是固定成本
护栏 / 安全围栏 拦截不当输入输出的机制 邮储、蚂蚁都在用[R016]
提示注入 攻击者通过输入操纵模型做非预期行为 CISO;NIST 风险 #9
数据投毒 污染训练数据来操纵模型输出 CISO;NIST 风险 #9
影子 AI 员工自己在用、公司不知道的 AI 工具 CIO + HR;给正门,别只堵
可解释性 能说清楚模型为什么给出这个结论 金融、医疗、高危场景的硬要求
安全回滚 出问题时能立刻关掉 AI 并回到人工 制造/能源的强制要求[R016]
数据可用不可见 不交出数据也能训练(联邦学习、多方安全计算) 能源行业已在用[R016]

评估类

术语 一句话 为什么重要
基线 改造前的真实数字 没有基线,不进 ROI 评审
对照组 不用 AI 的那一组,用于对比 没对照组就分不清是不是 AI 的功劳
A/B/C 证据等级 实验/监管 · 企业自报 · 媒体转述 A 进决议,B 进立项,C 进白板
一次通过率 不需要返工就合格的比例 和速度配对的反向指标
场景渗透率 该场景中实际用 AI 处理的比例 信通院成熟度官方指标[R018]
投入产出比 ROI 信通院把它列为成熟度指标——不是"只看 ROI 太功利"

最容易被忽悠的五个词 ⭐

供应商想让你以为 真相
"准确率 98%" 基本不出错 问:在谁的数据上测的?高损失边缘案例的错误率?
"零幻觉" 不会瞎编了 官方口径:RAG 只能"在一定程度上"缓解[R018]
"开箱即用" 买来就能用 你的数据质量决定一切;82.5% 的行业数据集内容稠密性缺失[R015]
"行业大模型" 更懂你的行业 问:训练数据哪来的?和 RAG 比强多少?值不值这个价?
"提效 80%" 成本能降 80% 任务级 ≠ 岗位级 ≠ 企业级。要问岗位时间构成
计费单位  Token —— 用量翻倍,钱就翻倍
起点      RAG —— 90% 企业的正确起点
陷阱      幻觉永远存在 → 人工复核成本删不掉
省钱      小模型 vs 大模型,成本可能差一个数量级
安全      写操作必须审批,只读可放开
硬指标    基线 · 对照组 · 一次通过率 · 单位经济性
防忽悠    准确率 / 零幻觉 / 开箱即用 / 行业大模型 / 提效80%
P74 附录 · 术语与声明

声明与来源

  • 本课程资料引用的第三方报告、数据、图表与案例,版权归各来源机构所有。
  • 数据引用保留原调查口径;重绘图表已注明数据来源。
  • 案例数字按 A / B / C 证据等级标注,B 与 C 级为企业自报或媒体转述,仅供参考。
  • 本课程为经营管理培训材料,不构成投资建议、法律意见或对特定收益的承诺。

资料访问日期:2026-08-05 · 来源共 67 项,全部为公开可核验资料

课件资料 3 张表 · 3 张速记 · 7.3

源自 7.3 许可红线

三色红绿灯

🟢 可自由使用 🟡 可用但有条件 🔴 不要碰
自己用 Mermaid/ECharts 画的图 政府文件与信息图(完整引用) 直接截咨询公司原图进商业课件
MIT / Apache 2.0 代码与模板 信通院报告数据(标报告名+页码) CC BY-ND 材料做修改版
据公开数据重绘的图表 CC BY 内容(保留署名) 复制书籍/HBR 全文
官方开放的样例数据 GPL 代码(演示可,商用须法务) 下载播客/视频后重新分发
短引用 + 明确出处 案例数字(标证据等级) 绕过登录、付费墙、DRM

政府与官方文件(R013 R014 R016 R027 + 工信部案例)

  • ✅ 可摘要引用,须标明机构、标题、日期、链接
  • ⚠️ 政府信息图(如发改委"一图读懂"):完整引用,不裁掉来源、日期和政府标识
  • ⚠️ 政府标识、徽章不得擅自改造
  • ⚠️ 公开商业培训需核验各网站的转载规则
  • NIST 材料(美国政府)复用空间较宽,但须核验其中的第三方图表、标识和附录

中国信通院报告(R015 R016 R017 R018)

  • ✅ 摘录数据 + 明确标注报告名与页码
  • 🔴 整页图表转载需核验授权;著作权保留
  • 🔴 公开课件需控制复制比例,不复制全文

咨询公司报告(R020–R025 R028 R034 R035 R038 BCG/Deloitte/McKinsey/PwC/Accenture)

  • 🔴 不要直接截原图进商业课件——版权保留
  • ✅ 重述结论、据其数据自行重绘,页脚注明"据 XX 数据重绘"
  • ✅ 引用具体数字并标明来源与调查口径

Stanford AI Index(R019 R058)

  • ⚠️ 报告若为 CC BY-ND 4.0:可署名后原样传播,不得制作修改版
  • ✅ 要重绘 → 从其 Public Data 出发,并核验对应数据源的许可
  • ✅ 页脚注明"据 AI Index Public Data 重绘"

开源代码与模板

资源 许可 注意
OpenAI Cookbook[R001]· MS GenAI[R002]· FinOps Toolkit[R004]· Mermaid[R009]· Marp[R010] MIT 保留版权与许可声明即可修改、商用
OpenCost[R005]· Cloud Custodian[R006]· ECharts[R011] Apache 2.0 同上;OpenCost 文档为 CC BY 4.0,需保留归属
PM4Py[R007] GPL 系列 ⚠️ 培训演示通常可行,嵌入商业产品须法务审查
FOCUS 样例[R008] CC 系列(按 license.md) 使用时核验具体版本并署名
AntV[R012] 各子项目不同 ⚠️ 逐仓库核验;商标与设计资产 ≠ 代码许可
Datawhale LLM Universe[R003] ⚠️ 首页未明确展示开放许可证 外部再发布前须核验项目条款或联系维护方

书籍与文章(R029–R038)

  • ✅ 制作中文摘要、提炼框架、四张卡片法
  • 🔴 不复制全文;HBR 文章版权保留
  • ✅ Rewired 有中信简体中文版,可正常引用书名与观点

播客、视频、Webinar(R039–R047)

  • ✅ 只用 1–3 分钟核心片段或时间戳链接
  • 🔴 不下载后重新分发;不重新剪辑发布
  • 🔴 不绕过登录、付费墙、DRM 或流媒体限制
  • 未获官方下载或开放许可时,只保留公开页面、文字稿、元数据

企业案例(R048–R057)

  • ✅ 引用披露数字 + 标明来源与证据等级
  • ⚠️ Klarna 等企业内容著作权保留,引用数字与结论即可,不复制整页
  • ⚠️ 工信部案例为政府公示,引用须保留出处

PPT 页脚五要素(每张外部图必备)

来源机构 · 报告名称 · 发布日期 · 页码或图表编号 · 许可或"据原数据重绘"说明

数据安全红线(POC 与培训通用)

🔴 不把完整合同正文、OA 全文、个人信息、内部审批敏感信息写进公开输出
🔴 不把真实企业数据上传到公共 AI 服务做课堂演示
🔴 不在文档、测试输出或聊天摘要中记录密钥
🔴 不在对外材料中保留本机绝对路径
✅ 课堂演示一律使用:匿名化数据 / 合成数据 / 官方公开样例
✅ 报告与课件只放短引用和定位信息

内部培训 vs 对外商业课件

企业内部培训 对外商业课件
咨询报告图表 合理引用范围内可展示 🔴 重绘,不截原图
信通院报告 可较多引用 控制复制比例
书籍内容 摘要 + 框架 摘要 + 框架(更严格)
视频片段 现场播放片段 只给时间戳链接
政府信息图 完整引用 完整引用 + 核验转载规则
企业案例数据 标来源即可 标来源 + 证据等级 + 免责

交付前最终检查

□ 每张外部数据页有五要素页脚
□ 没有直接截取咨询公司原图
□ CC BY-ND 材料未被修改
□ 政府信息图完整引用,标识与日期未裁
□ 信通院数据已标报告名与页码
□ PM4Py 若涉及产品化,已过法务
□ Datawhale 若对外再发布,已核验许可
□ 视频只用片段或链接,无重新分发
□ 案例数字已标证据等级(A/B/C)
□ 无真实客户数据、个人信息、密钥
□ 无本机绝对路径
□ 已声明"本课为辅助评审与培训材料,不构成法律或投资意见"
1 / 74 ← → 翻页 · 空格前进 · Home / End 首末页 · ESC 打开目录