全速加载中...
首页
文章
随笔
留言
友链
关于
工具
更多
湘ICP备2021007748号-4
湘公网安备案湘公网安备43052202000137号
又拍云

教别人"AI治理"的四大会计师事务所,自己却用AI造出了幻觉报告

引言:谁在裸泳?

当毕马威(KPMG)于2025年10月发布一份名为《全面体验:代理式AI时代的卓越》的研究报告时,没人想到这份报告本身会成为AI幻觉的活教材。

6个月后,这份报告被撤下。45条参考文献中,仅5条能准确对应真实来源。被点名引用的瑞银、英国NHS、瑞士联邦铁路等机构纷纷公开否认。毕马威启动内部调查,承认"严重失实"。

这不是个案。2026年8月,AI检测公司GPTZero发布调查,揭开了普华永道、德勤、安永、毕马威——全球四大会计师事务所——研究报告集体陷入"AI幻觉"的全貌。

一边向客户推销AI治理服务,一边自己的报告里满是AI编造的假文献。这不是讽刺,是信任崩塌。


一、四大了什么?

GPTZero的检测覆盖了四家事务所在2024年至2026年间发布的数十份研究报告。问题之集中、程度之严重,超出了多数人的预期。

普华永道中东:100% AI生成?

普华永道中东(PwC Middle East)的四份"思想领导力"报告,是此次事件的核心。

其中最严重的一份《治理变革》(Transforming Governance),正文部分被判定为100%由AI生成。报告围绕一个名为"Citizen Pulse"(公民脉搏)的治理框架展开论述,声称丹麦、沙特、美国、澳大利亚政府正在利用这一理念改善公共服务。

但GPTZero核查后发现:

  • "公民脉搏"这一概念,在丹麦政府公共服务门户网站Borger.dk上根本不存在
  • 报告的引用来源被篡改——正文声称某数据来自某报告,但实际出处完全不同
  • 17条参考文献中,仅有10条与正文脚注对应,其余编号混乱
  • 甚至引用了《麻省理工科技评论》和世界经济论坛的两篇根本不存在的文章

另一份报告《塑造海合会国家交通出行格局》正文AI生成概率高达82%,其中混淆了国际能源署报告中的两项指标,把中国电动汽车累计销量误写为公共充电桩数量——这是AI处理图表数据时的典型错误。

更荒诞的是,一份报告的一处参考文献链接中,竟保留了 utm_source=chatgpt.com 的参数。这不是"可能用了AI",这是"AI直接写的,链接都没清干净"。

毕马威:45条引用仅5条真实

毕马威的案例更具戏剧性。2025年10月发布的报告声称瑞银、英国NHS、瑞士联邦铁路、伦敦交通局等机构正在采用"代理式AI",并引用了大量案例。

2026年6月,GPTZero检测发现45条引用中仅5条真实。被点名的机构纷纷发声否认。毕马威随后撤稿,承认"报告存在严重失实"。

德勤与安永:退款与撤稿

德勤澳大利亚2025年7月发布的一份价值44万澳元政府咨询报告,被学者发现引用了一本根本不存在的著作。澳大利亚政府内部审查发现超过50处可疑引用,最终德勤退还9.8万澳元。

安永加拿大2026年5月的网络安全报告因类似问题被撤回。


二、为什么会发生?

技术层面:AI幻觉的结构性缺陷

AI幻觉(Hallucination)不是偶发bug,而是大语言模型概率生成机制的固有缺陷。

Transformer架构的本质是"下一个词预测器"——它不知道什么是"真",只知道什么是"概率高"。当模型被要求生成"一份看起来像研究报告的文本"时,它会基于训练数据中的统计模式,拼凑出看似合理、实则虚构的内容。

这种"一本正经胡说八道"的能力,在大模型越来越强的同时,越来越难识别:

  • 虚构的引用格式完美——作者名、年份、标题、期刊,所有元素都符合学术规范
  • 捏造的概念听起来很合理——"公民脉搏"听起来确实像一个政策工具
  • AI还能伪造URL,链接格式完全正确,只是指向不存在的页面

流程层面:人工审核的消失

GPTZero的调查报告反复强调一个关键词:"发布前未经过充分人工核查"。

这意味着什么?意味着这些报告在产出流程中,人类从"审核者"变成了"签字人"。

咨询公司通常有三级审核:分析师写初稿 → 经理审阅 → 合伙人批准。但当AI代笔后,审核链条实际上断裂了:

  1. AI生成初稿——速度快,但内容真假未验
  2. 分析师"润色"——可能根本不做事实核查
  3. 经理/合伙人签字——基于"AI写的应该没问题"的假设

效率提升的背后,是责任链条的模糊。

商业层面:思想领导力的"通胀"

为什么四大会计师事务所要发布这么多"思想领导力"报告?

因为这些报告是咨询公司最廉价的获客工具。一份高质量的行业报告,可以在LinkedIn、Twitter、行业会议上获得数十万次曝光,带来潜在客户线索。而AI让这种"低成本高产出"的内容生产成为可能。

但思想领导力的本质是专业判断,不是文字游戏。当报告里的案例是编的、数据是假的、引用是空的,这份"领导力"就变成了"欺骗力"。


三、信任的代价

这不是"学术不端",这是商业欺诈的变体

学术界造假,受害者可能是其他研究者。但咨询行业造假,受害者是客户、公众、乃至政策制定者。

德勤的报告直接服务于澳大利亚政府,毕马威的报告引用了NHS、伦敦交通局等公共机构的数据——当这些虚构的引用被其他媒体、研究者、政策制定者二次引用时,虚假信息的传播链就被激活了。

行业公信力面临系统性危机

四大会计师事务所的立身之本是"信誉"。审计报告之所以有价值,是因为市场相信审计师不会故意出具虚假意见。但当审计师自己的研究都在造假,客户凭什么相信他们的审计?

更深层的问题是:当最依赖"专业判断"的行业,都已经被AI的幻觉侵蚀,其他行业呢?

医疗诊断建议、法律意见书、金融投资建议……如果四大会计师事务所都hold不住AI生成的内容,中小咨询机构、独立研究者、自媒体作者,谁来保证他们输出的真实性?

法律与责任的模糊地带

2025年杭州互联网法院审理了全国首例AI幻觉侵权案,判决AI服务提供者承担相应责任。但本案中的责任主体是谁?

  • 使用AI生成报告的四大会计师事务所?
  • 提供AI模型的OpenAI、Anthropic?
  • 还是审核环节的"签字人"?

目前法律尚无清晰界定。四大会计师事务所的回应普遍是"正在更新引用""正在内部调查",但没人承认"系统性使用AI代笔而缺乏审核"——因为这可能触及职业责任甚至法律欺诈。


四、治理困境:谁之过?

第一道防线失效:模型本身

当前最主流的AI治理方案是"AI检测工具",比如GPTZero。但GPTZero自己也在进化,被检测到的概率逐年下降——模型越来越像人,检测器越来越不准。

用AI抓AI,是一场永无止境的猫鼠游戏。

第二道防线失效:人工审核

德勤、毕马威的案例表明,人工审核在AI代笔面前几乎失效。因为审核者往往没有专业能力去验证每一条引用——即使是最资深的合伙人,也没有时间逐一核查45条参考文献。

第三道防线:制度设计

问题不在于"要不要用AI",而在于"用AI时责任链条如何设计"。

目前大多数企业的AI使用政策是"允许使用,但需人工审核"。但这句话在实际操作中变成了一句空话——没有人定义"人工审核"的标准是什么,也没有人对审核结果负责。


五、我的观点:这不是终点,是开始

四大会计师事务所的AI幻觉事件,是一个警示。

但我不认为这是AI的"原罪"。大语言模型的幻觉问题,是概率生成架构与确定性知识需求之间的根本性矛盾。这个矛盾不会因为模型更强而消失,只会变得更难识别。

真正需要重构的,不是AI模型本身,而是人类社会的信任验证机制。

我预测未来三年内,专业服务机构将分化成两派:

一派是"AI增强型":AI负责初稿、数据整理、文献搜索,但每一条引用、每一个案例都必须由人类专家核实并签名。这种模式的成本会更高,但公信力更强。

一派是"AI原生型":完全接受AI生成的内容,但必须明确标注"AI生成,未经核实"。这种模式更廉价,但只适用于非正式场景。

目前四大会计师事务所的模式,是一种危险的中间态:既想用AI的效率,又想维持人工的信誉。结果就是——效率提高了,信誉也丢了。


结语:当权威成为幻觉的受害者

普华永道的报告链接里藏着 utm_source=chatgpt.com,这像是一个隐喻:我们以为自己在驾驭AI,但AI的痕迹无处不在,而我们自己还没发现。

当教别人"如何做AI治理"的机构,自己掉进了AI幻觉的陷阱,我们该问的不是"AI是不是不可信",而是:在我们疯狂追求AI效率的时候,有没有真正建立起与之匹配的责任机制?

这个问题的答案,将决定AI时代的专业服务,是变得更可信,还是更不可信。


参考链接

普华永道报告AI幻觉详细报道(同花顺财经)

每日经济新闻:专业报告被测出100%由AI生成

KPMG报告AI幻觉事件(TechRadar)

德勤报告退款事件深度分析(知乎)

Forbes评论:PwC报告事件对职场人的警示

【版权声明】
✨ 本文来自 [张苹果博客] ✨
🌿 你可以:自由转发到社交网络或个人网站。
🌿 你需要:标注作者并附上本文链接(就像给文章留个回家地址~)。

上一篇

评论一下

评论列表

 
等待第一条评论中…
用户头像
小苹果
发布日期:2026年08月08日