为什么LLM会编造答案而不是承认自己不知道
本文探讨了大型语言模型为何会编造答案而非承认自己无知。作者区分了"幻觉"和"虚构"这两个概念,指出LLM本质上不具备自我认知能力,其生成错误信息的行为更接近于无意识的虚构而非有意的欺骗。理解这一区别对于正确评估和使用AI工具至关重要。
背景速读
- 大语言模型(LLM)在无法回答问题时,常会编造看似合理但错误的答案,这种现象在技术圈常被混称为“幻觉”(hallucination)。本文辨析了“幻觉”与“虚构”(confabulation)两个概念的区别——后者更准确地描述了模型的行为:它不是像人类做梦那样“看到不存在的东西”,而是在没有真实知识时,用语言概率拼凑出可信的回应。
- 关键背景:GPT、Claude、Gemini 这类模型本质上是“下一个词预测器”,它们没有对自己“知道什么/不知道什么”的内在认知。当问题超出训练数据或需事实核查时,模型不会说“我不知道”,而是会生成最可能出现的词语序列——这往往是一个似是而非的答案。
- 本文作者 Cristóbal Santana 是研究大模型行为的软件工程师。文章延续了学术界和业界对模型可靠性(grounding)的争论:能否让模型学会主动表达不确定性,而非强行答题?当前各大模型厂商正在用 RLHF(人类反馈强化学习)和系统提示词来抑制编造行为,但方法仍不成熟。
- 了解这一区别对非技术读者也很重要:如果你用 AI 助手查询事实或代码,知道它可能在“虚构”而非“犯错”,就能更理性地判断它给出的答案是否可信。