我们测试了AI是否遵守架构规则。即便是Opus,也有60%的违规率
一项对AI编码行为的实测研究发现,主流AI模型在编程时普遍无视预设的架构规则。研究者测试了包括Opus在内的多个模型,发现即便是最先进的模型也有高达60%的概率违反架构约束。这表明,依赖AI进行软件开发时,架构合规性仍需人工严格把关。
背景速读
- 这篇文章做了实验:给AI大模型(如Claude Opus、GPT-4等)一个带有明确架构规范的代码库,然后让它们完成编码任务。结果发现,即使是最强的模型Opus,也有大约60%的时间**无视了架构规则**(比如项目里定义的目录结构、命名约定、依赖方向等)。
- 这对于现实软件工程意义重大:很多公司和团队希望用AI辅助或自动生成代码,但如果AI生成的代码不遵守项目的架构规范(例如“service层不能直接调用controller”、“API路由必须放在/routes目录下”),这些代码实际上不可维护、不可合并。
- 背景是:当前AI编码助手(Cursor、Copilot、Codex等)大多基于通用的大语言模型,并没有专门针对“给定代码库中已定义的架构规则”进行推理和遵守的训练。很多开发者抱怨AI“生成的代码看起来对,但不符合项目约定”——这篇实验用数据量化了这一现象(60%的违规模率)。
- 实验中所谓的“架构规则”具体包括:文件位置、导入路径限制、命名约定、代码分层约束等。研究者将规则转化为单元测试和静态检查,然后看AI生成的代码是否能通过。
- 结论不是“AI没用”,而是“AI目前无法可靠遵守架构规则”,这意味着人工审查仍然必不可少,或者需要新的技术手段(如规则注入、代码库上下文的更深入理解)来提升合规率。