测试 Claude Sonnet 5 的自主能力宣称
本文在 Puter.js 环境下对 Claude Sonnet 5 所宣称的自主代理能力进行了实际测试。文章通过一系列任务评估了该模型在代码生成、工具调用和自主决策方面的表现,验证其是否能够像宣传中那样高效完成复杂的编程任务。测试结果揭示了模型的优势与局限,为开发者提供了有价值的参考。
背景速读
- **Anthropic 的 Claude Sonnet 5** 是 2025 年发布的大语言模型,Anthropic 宣称它在“代理能力”(自主编程、操作电脑、完成任务)上大幅超越前代。这次测试就是对这种宣传的独立验证。
- **Puter.js** 是一个开源的前端框架(由 Puter.com 维护),允许 AI Agent 直接操控浏览器中的真实 UI 元素,而不是只输出代码。它被用作测试 Agent 能力的实验平台。
- 测试者让 Sonnet 5 在 Puter.js 环境中完成一系列真实任务(如搭建应用、操作界面),目的是检验模型在“真实环境中的自主执行”而非“理论答题”上的表现。
- 这篇文章的意义在于:AI 公司越来越多地宣传模型能“替你干活”(Agentic AI),但独立、可复现的实测很少。结果会直接影响开发者是否信任这些模型来执行实际的工作流。