AI 为什么会一本正经地胡说八道:它认得出自己的错,却不会主动说![]()
先把话说清楚:它不是在查资料,它是在接话
很多人第一次被 AI 骗到,都是同一个场景:你问它一个具体的东西,它回你一段格式漂亮、语气笃定的答案,还附上三条"参考文献"。你去点开,第一条就是空的。
这件事在行业里有个名字,叫"幻觉"(hallucination)。这个词进入机器学习文献其实很早——维基百科把它追到 1986 年一篇博士论文,但真正被大规模使用是 2022 年之后:那年挂出一篇综述,题目就叫《Survey of Hallucination in Natural Language Generation》(arXiv:2202.03629,后发表于 ACM Computing Surveys),此后论文、发布会、监管文件都沿用了它。
但这两年越来越多研究者认为这个词选错了。有两篇公开论文专门讨论这件事:一篇是 2024 年 1 月的预印本《AI Hallucinations, a Misnomer Worth Clarifying》(arXiv:2401.06796),另一篇是 ACL 2024 的《Confabulation: The Surprising Value of LLM Hallucinations》。它们建议换成 confabulation,中文大致是"填补空白的编造"。理由很实在:幻觉暗示它看见了不存在的东西,而它实际上什么都没看见。
这是这篇稿子最想让你带走的第一件事。大模型的工作方式是"接着你的话说下去",不是"先去核实再回话"。它没有一台可以查的机器人在后台跑,它就是在按"怎样接最像样"一个字一个字往下写。所以它说错的时候,不会表现出任何异常——因为根本没有"异常"这个环节。
搞清了这一点,下面所有现象都不奇怪了。
三条硬事实:它为什么能编得这么像
网上关于幻觉的科普,多数停在"模型会犯错,因为它是概率模型"。这句话没错,但对解决问题没有任何帮助。有三条有出处的结论,才是真正有用的。
第一条:厂商自己承认这是没解决的问题。OpenAI 的 GPT-4 技术报告(arXiv:2303.08774,2023 年 3 月)在开头列举模型局限时原话写着:“it is not fully reliable (e.g. can suffer from ‘hallucinations’)”,在局限性一节又写"它’幻觉’事实,并会犯推理错误"。同一份报告也给了一个进步的量:在内部设计的对抗式事实性评测上,GPT-4 比当时最新的 GPT-3.5 高 19 个百分点。请注意这两个信息是同时成立的——分数提高了很多,问题依然在。
顺带澄清一个流传很广的数字。经常有人写"报告测得 GPT-4 幻觉率 0.4%、GPT-3.5 是 3.1%"。我把报告全文搜了一遍,0.4% 和 3.1% 这两个数不在 GPT-4 报告里,它们是更早的 InstructGPT(2022 年 3 月)在摘要任务上量出来的。看到"某模型幻觉率 X%"的说法,先问一句:这是哪一年、哪个任务上量的。
第二条:它很多时候知道自己错了,但还是说了出来。2023 年 5 月有一篇论文《How Language Model Hallucinations Can Snowball》(arXiv:2305.13534,Zhang、Press、Merrill、Liu、Smith)。作者搭了三个数据集,专门收集"模型先答错、再给出一段含有错误断言的解释"的情况,然后单独问模型:这句话对不对?ChatGPT 能识别出自己 67% 的这类错误,GPT-4 能识别出 87%。
这句话值得停一下。它意味着那些编造并不全是"知识缺失",一部分是为了把已经说出口的话圆下去,现编了新的假断言。模型有这个判断力,只是在那个时刻没用上。论文作者把这叫做"幻觉滚雪球":过度承诺了前面那个错答案,于是带出更多它本来不会犯的错。
对你的直接含义是:你追问的方式,能决定它要不要把那 87% 的判断力用上。你只是重复"你确定吗",它多半在原来的错答案上再圆一次;你换个问法把判断标准交给它,它有可能自己纠正。下面第五节给具体话术。
第三条:现在的考核方式在奖励瞎猜。2026 年 4 月 22 日《自然》(Nature)刊发了一篇论文《Evaluating large language models for accuracy incentivizes hallucinations》(Kalai、Nachum、Vempala、Zhang,DOI 10.1038/s41586-026-10549-w)。它的核心论点很直白:只按准确率打分的评测,会系统性地奖励瞎猜,而不是奖励承认不确定——因为"不知道"必得零分,猜一下还有机会得分。作者提出的出路是把"弃答"纳入评分,允许模型在你说的置信度标准下选择闭嘴。
这条对普通用户为什么重要?因为它解释了那种"越新的模型越自信"的观感。模型的"敢讲"一部分是被评分制度训练出来的习惯。所以你不能把"它说得很笃定"当成可信度的信号——那恰恰是被优化过的外观。
它最爱编的四类东西,记住这四类就够用
幻觉不是均匀分布在语言里的,它有非常集中的靶区。下面是站内编辑过程中反复撞到的四类。
第一类:编号。参考文献的 DOI、法律的条文号、法院案号、API 的参数名、版本号、论文页码。它们的共同点是"短、格式固定、看起来可验证"。模型非常清楚一个 DOI 长什么样,所以能造出一个格式完全正确的假 DOI。
这件事的代价有多大,有一篇很硬的论文可以引用:2026 年 5 月 8 日的预印本《LLM hallucinations in the wild: Large-scale evidence from non-existent citations》(arXiv:2605.07723,作者里包括 arXiv 的创建者 Paul Ginsparg)。团队审计了 arXiv、bioRxiv、SSRN、PubMed Central 四个库中 250 万篇论文的 1.11 亿条引文,保守估计光是 2025 年一年就新增了 146,932 条根本不存在的引文。论文还发现这些假引文有个偏向:更多把功劳安到已经有名望的研究者身上,而且男性比例明显偏高——因为编的时候更容易编出"响亮"的名字。这一条是预印本,还没有正式同行评审,但它的量级和口径值得记:AI 编的东西已经在污染知识库本身。
第二类:人名、日期、数字的组合。单说一个人名它大概率对,单说一个年份也大概率对,把"谁、在哪一年、说了什么、金额多少"捆在一句话里,就是最容易出错的时刻。这类错误的危险之处是每个部分都真,组合是假的,你逐段看会觉得没问题。
第三类:它对自己行为的自述。“我已经检查过了”“上面这段代码我按你的接口对齐了”“我只引用了你给的材料”。这类话没有任何依据——它没有"检查"这个动作,它只是在写一段很自然的收尾。这一类和前面第二条硬事实直接相关:为了让前面的输出站得住,它会现编一个"我做过了"。
第四类:你问题里的错前提。这是最特殊的一类,也是唯一你能怪自己的一类。你问"为什么 X 在 2021 年降价了",而 X 从没在 2021 年降过价,模型多半不会纠正你,它会解释这次降价的原因。它接话,不查话。
判断这一类的成本极低,收益极高:先让它把你的问题重述一遍。如果重述里出现了你没说过的时间、对象、条件,说明前提已经被污染了,后面全不用看。
已经发生过的真实代价,三件就够
不用给你列十条案例,三个不同身份的例子最有用,因为它们对应三种不同的错误类型。
律师:为不存在的判例付了罚款。美国纽约南区联邦地区法院,Mata 告 Avianca 航空一案。两名律师提交了引用六个虚构判例的材料,法院在 2023 年 6 月出具制裁意见,法官 P. Kevin Castel 认定材料中的案件"不存在",两名律师合计被罚 5,000 美元,并被转介州律师惩戒系统。值得记住的是错误长什么样:案号格式对、法院名对、法官姓名对、判决逻辑通顺——六个案件一个都不存在。
航司:为自家聊天机器人的话赔了钱。加拿大不列颠哥伦比亚省的民事解决仲裁庭(CRT),案名是 Moffatt 诉加拿大航空,引证 2024 BCCRT 149,2024 年 2 月裁决。乘客按官网聊天机器人说的"可以先买票再申请丧亲票价折扣回溯"买了票,事后被拒绝。航司辩称机器人是"独立的电子代理人"、不是公司的陈述,庭不接受,认定机器人只是官网的一部分,公司要为它说错的话负责,合计赔付约 812 加元。这条对你的含义:把 AI 的输出去给客户看,责任在你。
中国:律师提交了 AI 造的假案例被当庭训诫。据公开报道,2026 年 7 月,湖北宜昌市西陵区法院一起庭审中,代理律师提交的材料含有 AI 生成的虚假案例——假案号、错案情、被篡改的法条——法官当庭对其训诫,多家媒体把这称为国内此类情形的首例。官方口径是训诫加"强调核实责任",落在核实责任这四个字上。
六种你当场就能用的自查,附可直接抄的话术
这一节是这篇稿子的重点。所有方法都不要求你懂模型、不要求你装工具,只是在对话框里多问几步。
一、凡是编号,自己点开一次。这是唯一一条不能省的。抄一句话术:
把你引用的每一处来源写成"标题 + 可访问链接",不要只写文献名。如果某个来源你无法确定真实存在,明确写"待核实"。
然后真的点开链接。你的时间只需要花在第一两条上——第一条是空的就说明这批编号整体不可信,剩下的不必看,直接换闭卷变开卷(第六种)。
二、把"你确定吗"换成"打分并给理由"。重复问"确定吗"往往会让它把同一个错答案说得更坚定(这就是前面那条 snowball 的机制)。改成:
给你上面答案的置信度,0 到 100,并说出最可能出错的是哪一部分、为什么。
这一问的价值在于:它把"接话"变成了"评价自己刚写的话",而第二条硬事实告诉我们,在评价模式下它能识别出自己 67% 到 87% 的错误。你不需要它真的给你准确数字,你需要它换到那个模式里去。
三、先重述,再回答。抄这段:
回答之前,先用三句话重述我的问题:我在问什么对象、限定在什么时间范围、需要几个结论。如果你重述里出现了我没提到的时间、地点或对象,先指出来。
这一条专治第四类幻觉(错前提),顺带能捞回第二类里那些"每个部分都真、组合是假的"的情况。
四、关键数字自己复算一遍。任何乘除法、单位换算、比例,别相信它口算。这一条我在站内另一篇教程里踩过:写"每百万 tokens 是多少钱"那篇时,我在正文里算 500 次调用、每次 4K tokens,顺手写成"250 万",实际是 200 万。模型不会提醒你它算错了,因为它没有"算"这个动作。站内那篇讲成本的《每百万 tokens 到底是多少字》里三步算法,就是给这类错误准备的。
五、一次问一个可核对的小问题。大而空的问题(“这个方案靠不靠谱,帮我全面分析”)得到的是又长又像样的答案,而长度会摊薄你的注意力——十条里有一条假的,你根本找不到。把问题拆成"这个参数名在 v2 里叫什么""这句话出自哪份文件的哪一段"这种单点,每个单点都能当场判对错。这跟前面第二类(真零件拼成假组合)和第四类(错前提)是一回事:问题越短,错得越容易暴露。
六、闭卷一次,开卷一次,看差距。这是最值得养成的习惯,也是工业界测这件事的标准做法。Google DeepMind 在 2024 年底上线了 FACTS 基准,2025 年初在 Kaggle 开了公开榜,其中 FACTS Grounding 这一项测的就不是知识量,而是**“我给你一份材料,你能否只说材料里有的内容”**——第一批上榜的模型,做得最好的也就八成出头。
你在对话框里就能复现这个测法:
第一次:凭你自己的知识回答 X。(闭卷)
第二次:只根据我下面粘贴的这份材料回答 X,材料里没有的写"未提及"。(开卷)
第三次:把两次答案的不同列出来,并指出哪一个更可能错。
两次答案对不上的地方,就是它记忆最不可靠的地方;你只需要在这些地方花人工核对的力气。
把上面六条压成三步,就是下图这一件事:别问它"对不对",要一个你能自己判定的东西。
最后给一句判断:把"它很笃定"这个信号从你的评估里删掉。笃定是被评分制度奖励出来的外观(第三条硬事实),不是可靠性的证据。
什么时候可以放心用,什么时候必须人来核
不要走到"那干脆别用了"的另一端。这件事有个清楚的边界。
可以放心让 AI 直接做的,是那些错了也不产生外部后果的活:帮你把一段话说得更通顺、给你没想到的角度、把已知的信息换成另一种结构、生成候选、解释一个你已经大致懂的概念。它的"接话"能力在这里全是优点。
必须人来核的,是三类:要发给别人的(对外文案、客户回复、公开内容)、有编号的(条文、案号、DOI、版本号、金额、日期)、要执行的(代码、命令、配置、合同条款)。这三类的共同点是错误不会当场暴露,而是等你交付之后才炸。站内那篇《让 AI 替你办事的安全清单》把"出事之后责任归谁"讲得更细,加航那条案例正好可以当它的注脚。
如果你是团队在推进这件事,还有两条更结构化的做法:把要求写成验收标准(《12 个真正好用的提示词》里有现成的写法),或者干脆把材料接到工具里让它照着答——这就是 MCP 这类协议存在的意义,《MCP 到底是什么》那篇从零解释了一遍,接着看MCP 简史能明白为什么"给它材料"这条路这两年被当成主要解法。想让它在长任务里少跑偏,工程级上下文闭环和上下文工程与 Token 预算管理是站内讨论得最细的两篇;代码场景下靠测试锚住输出的做法见用测试用例锚定代码生成质量。想自己搭一个只喂给它资料的问答,私有知识库 RAG 实战是最短路径;不写代码的话,提示词编写建议和怎么用好提示词这两份上手更快。
一句话版本
它没有查资料这一步,只有接话这一步;它有时能认出自己的错,但通常不会主动认;所以你的自查方式要变——凡编号自己点开,问它"哪一部分最可能错"而不是"你确定吗",长答案拆成单点问,重要结论做闭卷和开卷两次对比。
本文由 AgentHub 首发,myagenthub.cn —— MCP Servers 与 Agent Skills 资源库。
阅读原文:https://myagenthub.cn/blog/ai-hallucination-explained
更多垂类 MCP 选型与安装教程:MCP 工具库 · 安装配置教程 · 场景专区