转发 Jared Friedman:Claude 是通过人类编码会话进行强化学习训练的。但我越用 Claude Code,就越意识到自己正在被 Claude Code 强化学习——学习如何给它最佳指令,了解它容易忘记或误解什么。感觉这像是一种人机共同进化。
Jared Friedman 指出,Claude 最初是通过人类编码会话进行强化学习(RL)训练的。但随着他频繁使用 Claude Code,他发现自己也在被 Claude Code "反向强化学习"——不断摸索如何给出最佳指令,以及了解模型容易遗忘或误解的地方。他认为这是一种人类与 AI 之间的共同进化形式。
背景速读
- RL 是"强化学习"(Reinforcement Learning)的缩写,是一种机器学习训练方法——模型通过与人类交互获得反馈,逐步学会更优的行为。Jared Friedman 是 AI 公司 Anthropic 的团队成员,参与过 Claude 模型的开发。
- Claude Code 是 Anthropic 推出的一个面向编程场景的工具/交互模式,开发者可以用自然语言指令让 Claude 直接编写或修改代码。
- 这条推文的核心观点是:表面上人类在"训练"AI(通过 RL 让 Claude 学会编程协作),但实际使用中人类也在被 AI "反训练"——用户会不自觉调整自己下达指令的方式,学会避开 AI 容易误解的表述,形成一种双向适应的关系。
- "人机共同进化"(human/AI co-evolution)是这个现象的概括术语,强调双方都在变化和适应,而非单方面的工具使用。