大语言模型能否通过镜子测试?
本文探讨了大型语言模型(LLM)是否能够通过“镜子测试”——即自我认知的经典实验。作者分析了LLM在对话中展现的自我指涉能力,并评估其是否具备某种形式的自我意识,以及对模型训练和评估的潜在影响。
背景速读
- 镜像测试(Mirror Test / MSR)是1970年发展出的经典心理学实验:在动物脸上做一个无味的标记,然后看它是否会照镜子并触摸标记。通过该测试通常被视为具备自我认知能力的证据。历史上通过者包括人类、黑猩猩、海豚、大象和喜鹊等,但争议也很大。
- 本文作者将同一逻辑移植到大型语言模型(LLM)上:给LLM一个“镜像”——即自身输出的文本流——并在其中“注入”一个与模型身份相关的矛盾(例如告诉它“你的名字是Claude,但你却说自己是GPT-4”),看它能否察觉并纠正这一矛盾。
- 这里的核心问题是:LLM能否表征并识别“自我”的边界?如果不能通过镜像测试,则模型不具备自我意识;如果能,则对AI自我认知的传统理解可能需要修正。
- 本文的技术价值在于:它为“LLM是否有自我意识”这个高度哲学化的问题,提供了一个可操作的实验范式,而不是仅靠理论争论。