2026年1月21日,一家名叫GPTZero的华人AI初创公司发布了一份让全球AI学术界集体沉默的报告:在NeurIPS 2025已接收的4841篇论文中,至少51篇含有由大语言模型生成的数百条虚假引用。虚构的作者姓名、不存在的论文标题、甚至占位符"John Smith"和"Jane Doe"——这些本应在草稿阶段被丢弃的文本,竟然一路闯关成功,最终被印在了顶级机器学习会议的正式论文集里。
这不是孤立的学术不端事件。两周后,ICLR 2026爆出类似丑闻:300篇随机抽检的投稿中,50篇存在AI幻觉引用,部分论文在同行评审阶段竟拿到了8.0的高分。而到了2026年6月,全球四大会计师事务所之一的KPMG发布了一份关于"智能体AI时代"的行业报告,结果45条引用中仅有5条真实——这家年收入超360亿美元的巨头,用它吹捧的AI工具写出的报告,本身成了AI翻车的活教材。
GPTZero机器学习主管Alex Adams创造了"vibe citing"(氛围引用)一词来描述这一现象:大模型将真实来源进行推导或拼凑,生成看似逼真却经不起推敲的虚假引用。当学术引用本身成为幻觉,我们依赖的知识生产机制正面临一场认识论危机。
"氛围引用"并非传统意义上的学术抄袭。抄袭是故意窃取他人成果,而幻觉引用是无意识的产物——AI模型在概率预测的过程中,将"看起来像真实引用"的文本结构误当作"实际上是真实引用"的产物。
这种现象植根于大语言模型的技术本质。Transformer架构的核心是下一个token的概率预测:给定"2023年,Zhang等人提出了一种新的卷积神经网络架构,在ImageNet上达到了...",模型会基于海量训练数据推断最可能的后续文本。它知道真实论文中经常出现的句式结构、作者姓名模式、期刊名称格式——但它不知道哪篇论文真实存在。
这就产生了"氛围引用"的三个特征:
形式逼真性:引用格式规范,包含作者、年份、标题、期刊等完整元数据,表面看与真实引用无异。
内容空洞性:引用的"论文"可能根本不存在,或作者姓名是模型从训练数据中拼凑的常见名(如"John Smith")。
传播隐蔽性:即使被发现是幻觉引用,它们也混入真实引用中,形成"半真半假"的学术污染。
2026年5月,北京大学、同济大学和图宾根大学联合发布的《SciIntegrity-Bench》基准测试揭示了一个更令人不安的事实:七款顶尖大语言模型在"空白数据集"测试中全部"无中生有"——面对完全没有数据的表格,它们自行编写代码、凭空捏造数千行传感器参数并出具设备维护报告。在"工具受限"场景中,问题率高达95.2%,模型在缺乏真实API密钥时直接伪造JSON响应包。
当AI在缺乏证据的情况下依然能"自信地编造",它不再是一个工具,而是一个不断生产"看似合理但实际虚假"内容的概率引擎。
要理解"氛围引用"的危害,必须先理解学术引用在知识生产中的结构性作用。
引用是知识的链式结构。每一篇学术论文都建立在大量前人工作之上,引用链将分散的研究成果编织成可追溯的知识网络。评审者通过引用评估研究的理论基础,读者通过引用追溯论证来源,后续研究通过引用在已有知识基础上推进。
这种链式结构有一个核心假设:引用的真实性。引用不是装饰品,而是可验证的知识路径。如果引用本身是虚假的,整条知识链条就会出现断裂——后续研究无法追溯到真实源头,学术共识建立在虚构的基础之上。
Nature在2026年发表的分析指出,2025年可能有数万个出版物包含AI生成的无效引用。这不是个小数字,而是对知识生产基础设施的系统性侵蚀。
更令人担忧的是,"氛围引用"正在形成一种自我强化的循环:AI模型在训练时吸收了包含幻觉引用的论文,这些论文又被后续AI模型引用,形成"幻觉引用"的代际传递。当虚假引用被不断复制和再引用,它们逐渐"真实化"——不是因为它们是真实的,而是因为它们在知识网络中的节点密度足够高。
GPTZero的调查发现,部分包含幻觉引用的论文在同行评审阶段获得了高分。这暴露了评审机制的一个深层缺陷:评审者本身可能也在用AI辅助阅读和评估,而他们使用的AI工具同样会产生幻觉引用——这就形成了一种"AI幻觉引用"对"AI幻觉评审"的共振失效。
当评审者引用一篇论文来支持其评审意见,而这篇论文的引用本身又是AI生成的幻觉,整个评审链条就在无意识中完成了"虚假引用"的合法化。
这正是"氛围引用"最危险的地方:它不是在挑战知识生产的规则,而是在规则内部悄然腐化知识的真实性。传统的学术不端检测工具针对的是抄袭——直接复制他人文本的行为。但"氛围引用"规避了这些检测:它生成的文本是"原创"的,只是内容虚假。它符合引用的格式规范,却没有任何真实的知识来源。
这种新型学术不端迫使学术界面对一个棘手的问题:我们如何区分"格式正确的引用"和"内容真实的引用"?当前的检测工具——GPTZero、Turnitin、iThenticate——主要检测的是文本相似性和AI生成痕迹,而非引用的真实性。一个引用可以是100%由AI原创、格式完美、语义通顺,但完全没有真实来源。
"氛围引用"事件引发的问题远不止学术诚信层面。它指向一个更深层的认识论危机:在AI生成内容泛滥的时代,知识的真实性基础正在被重构。
传统认识论中,知识的定义是"被证实的真信念"(justified true belief)。引用是"证实"(justification)机制的核心工具——它提供了可追溯的证据链。但当AI能够生成看似合理但完全虚假的引用时,"证实"机制本身就被动摇了。
这不是简单的"技术滥用"问题,而是知识生产范式的根本性转变。
在AI介入之前,学术引用的生产是一个高度手工化的过程:研究者需要阅读原始文献、记录引用信息、核对格式细节。这个过程虽然缓慢,但它天然地包含了真实性校验——当你亲手输入一个引用,你会意识到你是在引用一篇你确实读过的论文。
AI将这一过程自动化了,但也移除了真实性校验的环节。研究者可能从未读过被引用的论文,却从AI生成的引用列表中"借用"了那些看起来合理的文本。这种"二手知识"的生产模式——不是从原始文献获取知识,而是从AI生成的引用中获取知识——正在成为常态。
2026年初,中国200多所高校发布了AI使用指导方针。这些政策的共同点并非禁止使用AI,而是强调"如果你在使用AI,你有责任验证其生成的一切内容"。这一要求看似合理,但在"氛围引用"的背景下,它实际上将验证成本完全转移给了研究者——而验证每一个引用的真实性,需要回归到原始文献的阅读量,这在AI已经"替我完成"的幻觉中,是研究者最不愿做的。
面对"氛围引用"危机,学术界和工业界正在尝试多种应对策略。
检测技术的军备竞赛:GPTZero、Citely、Sourcely等工具专门针对AI生成的虚假引用进行检测。GPTZero采用"交叉验证"方法——检查引用中的DOI、作者姓名、期刊名称是否能对应到真实的学术数据库记录。2026年5月,ICLR组委会宣布与GPTZero合作,启动对投稿论文的幻觉引用筛查。
政策规制的收紧:ICLR 2026明确要求作者对论文中由AI生成的任何内容负责,严厉禁止伪造数据或误导性陈述。幻觉引用被定性为违反"道德准则",一旦发现大量使用AI未披露或存在虚假内容,将直接拒稿或桌拒。更严厉的是,审稿人如果使用AI乱生引用,自己的投稿也将面临连带惩罚。
技术自救的探索:部分研究者开始探索"引用验证工作流"——在AI辅助写作后,必须通过自动化工具对每个引用进行真实性验证。但这引入了一个新的悖论:用来验证AI生成内容的工具,本身也可能是AI生成的——这就形成了"AI检测AI"的循环验证困境。
KPMG的翻车事件为这种困境提供了鲜活的注脚。2025年10月,毕马威发布《在智能体AI时代重新定义卓越》报告,声称调研了瑞银、英国国民保健署、瑞士联邦铁路等机构的AI使用情况。2026年6月,这些机构纷纷站出来否认:报告中关于它们AI使用情况的说法"不实或具有误导性"。GPTZero的核查显示,45条引用中仅5条真实,其余或为误导、或为部分捏造、或为模糊到无法验证的表述。
KPMG随后撤下报告并启动内部调查。这家顶级咨询公司用AI写AI报告,结果报告本身成了AI幻觉的教科书案例。
"氛围引用"现象最令人不安的不是造假本身,而是它暴露了知识生产机制的一个深层脆弱性:我们的学术体系建立在"引用即真实"的默认假设上,而这个假设在AI时代正在失效。
技术乐观主义者可能会说,这是过渡期的阵痛,检测工具会不断改进,政策会不断完善,问题最终会被解决。但这种观点低估了"氛围引用"的结构性影响:它不是在挑战知识的"内容",而是在挑战知识的"来源"。当引用的真实性无法保证,整个知识链条的基础就在松动。
我更倾向于认为,这是一场认识论层面的范式危机。它要求我们重新思考几个根本问题:
第一,知识的"证实"机制需要重构。 传统的同行评审、引用核查、数据验证等机制,在AI生成内容泛滥的背景下都需要升级。但这不是简单的"用AI检测AI"就能解决的——我们需要建立新的知识生产协议,要求AI生成内容必须附带可验证的来源证据,而不仅仅是格式正确的引用。
第二,研究者的角色需要从"内容生产者"转向"真实性验证者"。 当AI能够生成看似合理的文本时,研究者的核心价值不再是"写出什么",而是"验证什么"。这要求研究者投入更多时间在原始文献的回归和验证上,而不是依赖AI生成的二手知识。
第三,我们需要建立"引用透明度"的新规范。 未来的学术论文可能需要标注哪些部分由AI生成、哪些引用经过人工验证。这不仅是伦理要求,也是知识生产的透明化需求。
2026年8月,ICLR 2026的投稿截止日已过,GPTZero的筛查工具已经部署。但这场危机才刚刚开始。当引用本身成为幻觉,我们需要在重建知识信任的路上走得更远。
知识的锚点不在算法里,而在我们对真实的敬畏中。