当毕马威(KPMG)于2025年10月发布一份名为《全面体验:代理式AI时代的卓越》的研究报告时,没人想到这份报告本身会成为AI幻觉的活教材。
6个月后,这份报告被撤下。45条参考文献中,仅5条能准确对应真实来源。被点名引用的瑞银、英国NHS、瑞士联邦铁路等机构纷纷公开否认。毕马威启动内部调查,承认"严重失实"。
这不是个案。2026年8月,AI检测公司GPTZero发布调查,揭开了普华永道、德勤、安永、毕马威——全球四大会计师事务所——研究报告集体陷入"AI幻觉"的全貌。
一边向客户推销AI治理服务,一边自己的报告里满是AI编造的假文献。这不是讽刺,是信任崩塌。
GPTZero的检测覆盖了四家事务所在2024年至2026年间发布的数十份研究报告。问题之集中、程度之严重,超出了多数人的预期。
普华永道中东(PwC Middle East)的四份"思想领导力"报告,是此次事件的核心。
其中最严重的一份《治理变革》(Transforming Governance),正文部分被判定为100%由AI生成。报告围绕一个名为"Citizen Pulse"(公民脉搏)的治理框架展开论述,声称丹麦、沙特、美国、澳大利亚政府正在利用这一理念改善公共服务。
但GPTZero核查后发现:
另一份报告《塑造海合会国家交通出行格局》正文AI生成概率高达82%,其中混淆了国际能源署报告中的两项指标,把中国电动汽车累计销量误写为公共充电桩数量——这是AI处理图表数据时的典型错误。
更荒诞的是,一份报告的一处参考文献链接中,竟保留了 utm_source=chatgpt.com 的参数。这不是"可能用了AI",这是"AI直接写的,链接都没清干净"。
毕马威的案例更具戏剧性。2025年10月发布的报告声称瑞银、英国NHS、瑞士联邦铁路、伦敦交通局等机构正在采用"代理式AI",并引用了大量案例。
2026年6月,GPTZero检测发现45条引用中仅5条真实。被点名的机构纷纷发声否认。毕马威随后撤稿,承认"报告存在严重失实"。
德勤澳大利亚2025年7月发布的一份价值44万澳元政府咨询报告,被学者发现引用了一本根本不存在的著作。澳大利亚政府内部审查发现超过50处可疑引用,最终德勤退还9.8万澳元。
安永加拿大2026年5月的网络安全报告因类似问题被撤回。
AI幻觉(Hallucination)不是偶发bug,而是大语言模型概率生成机制的固有缺陷。
Transformer架构的本质是"下一个词预测器"——它不知道什么是"真",只知道什么是"概率高"。当模型被要求生成"一份看起来像研究报告的文本"时,它会基于训练数据中的统计模式,拼凑出看似合理、实则虚构的内容。
这种"一本正经胡说八道"的能力,在大模型越来越强的同时,越来越难识别:
GPTZero的调查报告反复强调一个关键词:"发布前未经过充分人工核查"。
这意味着什么?意味着这些报告在产出流程中,人类从"审核者"变成了"签字人"。
咨询公司通常有三级审核:分析师写初稿 → 经理审阅 → 合伙人批准。但当AI代笔后,审核链条实际上断裂了:
效率提升的背后,是责任链条的模糊。
为什么四大会计师事务所要发布这么多"思想领导力"报告?
因为这些报告是咨询公司最廉价的获客工具。一份高质量的行业报告,可以在LinkedIn、Twitter、行业会议上获得数十万次曝光,带来潜在客户线索。而AI让这种"低成本高产出"的内容生产成为可能。
但思想领导力的本质是专业判断,不是文字游戏。当报告里的案例是编的、数据是假的、引用是空的,这份"领导力"就变成了"欺骗力"。
学术界造假,受害者可能是其他研究者。但咨询行业造假,受害者是客户、公众、乃至政策制定者。
德勤的报告直接服务于澳大利亚政府,毕马威的报告引用了NHS、伦敦交通局等公共机构的数据——当这些虚构的引用被其他媒体、研究者、政策制定者二次引用时,虚假信息的传播链就被激活了。
四大会计师事务所的立身之本是"信誉"。审计报告之所以有价值,是因为市场相信审计师不会故意出具虚假意见。但当审计师自己的研究都在造假,客户凭什么相信他们的审计?
更深层的问题是:当最依赖"专业判断"的行业,都已经被AI的幻觉侵蚀,其他行业呢?
医疗诊断建议、法律意见书、金融投资建议……如果四大会计师事务所都hold不住AI生成的内容,中小咨询机构、独立研究者、自媒体作者,谁来保证他们输出的真实性?
2025年杭州互联网法院审理了全国首例AI幻觉侵权案,判决AI服务提供者承担相应责任。但本案中的责任主体是谁?
目前法律尚无清晰界定。四大会计师事务所的回应普遍是"正在更新引用""正在内部调查",但没人承认"系统性使用AI代笔而缺乏审核"——因为这可能触及职业责任甚至法律欺诈。
当前最主流的AI治理方案是"AI检测工具",比如GPTZero。但GPTZero自己也在进化,被检测到的概率逐年下降——模型越来越像人,检测器越来越不准。
用AI抓AI,是一场永无止境的猫鼠游戏。
德勤、毕马威的案例表明,人工审核在AI代笔面前几乎失效。因为审核者往往没有专业能力去验证每一条引用——即使是最资深的合伙人,也没有时间逐一核查45条参考文献。
问题不在于"要不要用AI",而在于"用AI时责任链条如何设计"。
目前大多数企业的AI使用政策是"允许使用,但需人工审核"。但这句话在实际操作中变成了一句空话——没有人定义"人工审核"的标准是什么,也没有人对审核结果负责。
四大会计师事务所的AI幻觉事件,是一个警示。
但我不认为这是AI的"原罪"。大语言模型的幻觉问题,是概率生成架构与确定性知识需求之间的根本性矛盾。这个矛盾不会因为模型更强而消失,只会变得更难识别。
真正需要重构的,不是AI模型本身,而是人类社会的信任验证机制。
我预测未来三年内,专业服务机构将分化成两派:
一派是"AI增强型":AI负责初稿、数据整理、文献搜索,但每一条引用、每一个案例都必须由人类专家核实并签名。这种模式的成本会更高,但公信力更强。
一派是"AI原生型":完全接受AI生成的内容,但必须明确标注"AI生成,未经核实"。这种模式更廉价,但只适用于非正式场景。
目前四大会计师事务所的模式,是一种危险的中间态:既想用AI的效率,又想维持人工的信誉。结果就是——效率提高了,信誉也丢了。
普华永道的报告链接里藏着 utm_source=chatgpt.com,这像是一个隐喻:我们以为自己在驾驭AI,但AI的痕迹无处不在,而我们自己还没发现。
当教别人"如何做AI治理"的机构,自己掉进了AI幻觉的陷阱,我们该问的不是"AI是不是不可信",而是:在我们疯狂追求AI效率的时候,有没有真正建立起与之匹配的责任机制?
这个问题的答案,将决定AI时代的专业服务,是变得更可信,还是更不可信。