本文介绍了 Databricks 如何在其拥有数百万行代码的大型代码库上对编码代理(Coding Agents)进行基准测试。研究评估了多种 AI 编码助手在处理大规模、复杂工业级代码库时的性能表现,包括代码理解、修改和调试能力。测试结果揭示了当前编码代理在应对真实世界大型项目时所面临的挑战与局限性,为开发更高效的企业级 AI 编程工具提供了重要参考。
#coding-agents
30 条相关内容
作者推出了一个基于其开源形式化方法系统 fizzbee.io 构建的新应用。该应用通过形式化验证进行需求工程,能够提出高价值追问、将需求转化为形式化规范并识别复杂需求缺口,最终生成可供编码代理执行的精确指令文档。实测表明,该方案可减少编码迭代次数,提升代码质量。欢迎试用并反馈意见。
本文通过逆向工程方法,深入分析了编码智能体(coding agent)在不同计划阶段中token的实际价值与分配策略。作者拆解了智能体在代码生成、调试与优化过程中token消耗的底层逻辑,揭示了如何更高效地利用token资源来提升编码任务的执行效果与成本效益。
本文探讨了AI编程助手(如Copilot、ChatGPT等代码生成工具)的一个潜在问题:它们往往过于自信地给出安全建议,即便代码存在漏洞。这种“确认偏误”倾向可能导致开发者过度依赖AI判断,忽视安全审查。作者警示,当AI代理总是告诉开发者代码“没问题”时,反而可能让安全隐患悄悄溜走。
理解才能参与
3.0Simon Willison 分享了 Geoffrey Litt 在 AIE 大会上提出的"理解才能参与"观点。Litt 认为,在与编码 agent 协作构建越来越复杂的大型变更时,必须深入理解代码才能有效参与创作过程。如果缺乏对代码的透彻理解,认知债务会不断累积,最终严重限制你在项目中的参与和创造能力。
编程代理没有长期记忆,但你机器上存储着数月完整的代理对话记录。ctx 是一个用 Rust 编写的命令行工具,能将那些记录和日志导入结构化的 SQLite 数据库,并通过排序文本匹配进行本地搜索。它能让代理在接手任务前参考过往会话,避免重复踩坑。例如,当测试因磁盘空间不足失败时,代理搜索历史后能直接找到正确的清理方案,而不是误判为回归问题浪费时间调试。
LoopFlow 是一个新工具,允许用户用自然语言(plain English)定义循环逻辑,驱动编码智能体自动运行代码、执行测试,并在测试失败时反复修正,直到所有测试通过。它简化了从描述到可运行代码的迭代过程,让开发者只需描述目标,剩下的由智能体循环完成。
Matrix 是一款面向云计算机(VPS)的操作系统,提供从网页、移动端、桌面端和命令行均可访问的可视化用户界面。项目始于 Anthropic 黑客马拉松并入围前 20 强,开发者自身也在使用 Matrix 运行所有编码智能体和定时任务。近日发布了自托管版本,用户可选择自部署或托管服务(仅需为所选计算资源付费),也可用于运行 openclaw/hermes 等应用。
过去一年,团队专注于AI错误分布研究,论文《错误的架构》从数学上证明AI解决方案在有限领域内需要一组有限的干预措施才能表现良好。为验证这一理论,团队创建了专为AI代理而非人类设计的技能搜索引擎Skill Federation。代理可构想任务所需的最佳技能集,引擎利用关键词丰富与重排序等当前最先进技术进行获取,并在SkillRet上复现了顶尖水平。技能来自内部存储,已尽力通过思科和英伟达安全扫描器预检。该搜索免费开放。
本文提出了Reap,一种用于自动策展和更新编程智能体基准测试的方法。随着大型语言模型在代码生成与理解方面能力的快速提升,传统的手动构造基准逐渐难以跟上发展步伐。Reap能够自动从真实代码仓库中提取和构建评估任务,保证基准的时效性、多样性和难度适配性,减少人工标注成本,为编程智能体提供更可靠的评测环境。
bb 是一个开源的智能体开发环境(ADE),它不像大多数工具那样只是终端封装,而是具备类似 Codex 应用的精致体验,同时保持本地优先、支持多提供商。编码智能体可以生成子线程、读取输出、打开文件供编辑,甚至自定义 UI 本身。目前兼容 Claude Code、Codex、Cursor、Pi 和 OpenCode,支持外部脚本或机器人任务提交流程。
A survey for the developer community to understand which AI coding agents (such as GitHub Copilot, Cursor, Codeium, etc.) are most commonly used, along with their strengths and weaknesses. The goal is to gather real-world usage data to help developers make informed choices.
该项目名为 secret-shuttle,提供了一种安全的方式,让 AI 编程助手(编码代理)能够访问和使用 API 密钥、令牌等敏感信息,而无需直接向代理暴露这些秘密。通过这种机制,开发者可以在利用 AI 辅助编码的同时,保护关键凭证不被泄露,提升工作流程中的安全性。
本文探讨了企业在编程代理(Coding Agents)上的高昂支出问题,指出盲目投资AI开发工具并不总能带来相应回报。作者分析了常见误区,并提供了更经济的替代方案,帮助团队在不牺牲效率的前提下优化预算分配。文章核心在于引导读者理性评估实际需求,避免被市场 hype 误导而过度支出。
Kage 是一个专注于 Agent 记忆维护的框架,完全采用 Google 发布的 OKF(开放知识格式)标准。虽然 Google 定义了记忆的结构标准,但并未涉及记忆的验证、创建时机与方式,而 Kage 弥补了这一空白。它能够指导 Agent 理解何时保存、保存什么以及如何保存记忆,并协助回忆和保持记忆的新鲜度。Kage 特别适合团队协作场景,可在同一仓库中为开发者提供统一的记忆管理体验,目前已最佳支持 Claude Code(Hook 方式),同时也兼容其他主流编码 Agent。
我们为Celesto沙盒实现了PB级持久化存储,适用于编码代理、测试框架以及大型文件的存储场景。
World Model MCP v0.10.0 是一个开源项目,实现了跨运行时的记忆系统,允许最多7个编码代理之间共享和同步上下文信息。该工具旨在提升编码代理间的协作效率,通过统一的记忆模型实现多代理场景下的状态持续性和一致性。
本文探讨了在AI编程代理上高额支出的误区与真相。作者指出,虽然市场上出现了每月花费数万美元使用AI编程工具的热潮,但真正高效的做法是理解这些工具的局限性和适用场景,避免盲目追求昂贵的解决方案。文章提供了实用的建议,帮助开发者和团队在不超支的情况下,合理利用AI编程代理提升效率。
Kage 最初是一种基于文件格式和 Git 原生的文档记忆方案,拥有自己的记忆标准。如今它全面拥抱 Google 发布的 OKF(开放知识格式),并在此基础上增加了 Google 未提供的核心功能:对记忆的创建时机和内容进行验证,以及保持记忆的新鲜度。作为一个框架,Kage 可配合智能体工作,帮助其决定保存什么、何时保存以及如何保存,同时还能召回相关记忆并维持其时效性。Kage 专注于为代码仓库维护记忆,便于团队成员在同一仓库中协调合作。只需安装 Kage,即可让智能体自动完成记忆维护工作。它最佳适配 Claude Code(支持 Hook),也兼容所有其他编码智能体。
本文介绍了作者利用 AI 编程代理,为 RonDB 数据库系统新增 RonSQL 支持的实际经验。文章详细描述了编程代理在代码生成、调试和集成测试中的表现,以及团队在此过程中遇到的挑战与收获,展示了 AI 辅助开发的潜力与局限性。
Assembled 团队将其内部构建的编码代理协作系统正式开源。该系统将原本分散的个人编码代理转化为共享团队基础设施,支持在 gVisor 沙箱中运行 Codex、Claude Code、OpenCode 等多种代理工具,并可灵活混搭以平衡成本与智能水平。系统集成了 GitHub、Linear、Sentry、Slack、PagerDuty 等常用工具,采用 MIT 许可证,支持自托管部署。
shot-scraper 1.10 新推出的 shot-scraper video 命令,可接受一个 storyboard.yml 文件定义对 Web 应用的操作流程,并借助 Playwright 录制视频。该功能由 GPT-5.5 在 Codex Desktop 中编写,YAML 格式也由编码智能体定义并用 Pydantic 验证。作者认为这是一种让编码智能体自动生成产品功能演示的有力模式。
Paneflow是一款基于GPUI框架构建的跨平台桌面应用,旨在支持并行编码代理的高效协作。它通过面板化的界面设计,让开发者能同时运行和管理多个AI编码代理,实现任务并行处理,提升开发效率。该项目在GitHub上开源,采用Rust语言开发。
Andrew Ng分享了构建0到1产品的三大关键循环:智能编码循环(AI代理自动迭代代码直至无bug)、开发者反馈循环(开发者审视产品并引导AI改进,发挥人类的“背景优势”)和外部反馈循环(通过朋友测试、Alpha测试或A/B测试获取数据)。随着编码代理加速软件开发,越来越多的工程师开始承担部分产品管理角色,关键是要在产品愿景构建与用户反馈之间取得平衡。
用户询问是否有人记得最近看到的一个项目,该项目旨在为编程代理(coding agents)提供一个安全沙箱运行环境(secure harness/wrapper)。用户提到虽然自己可以用systemd-nspawn、kata或bspawn制作封装,但记得不久前有一个维护良好的开源项目。由于GitHub上生成项目泛滥,用户难以找到该工具,因此向社区寻求建议或链接。
Agentic Orchestrator 是一款终端工具,能够接收复杂的功能需求,并通过编排多个编码智能体,模拟完整的工程流程(需求澄清、调研、设计、多阶段规划、实现和审查)来构建功能。它提供了一个统一的可视化面板,支持发布后工具(如解决合并冲突、回复审查评论)。其关键设计是在非确定性智能体之上实现确定性编排:由 Go 编写的控制框架负责“人工审查门禁”、阶段转换和产物验证等环节,而智能体仅处理“短小精悍”的任务。该工具已开源(Apache 2.0),支持通过 Homebrew 安装,可在 macOS、Linux 和 WSL 上运行。
本文介绍了 Tau,一个专注于展示编码代理(coding agents)构建原理与方法的项目或平台。通过深入剖析代理系统的架构、训练流程及实际应用场景,帮助开发者掌握从零开始构建智能编码代理的核心技术与最佳实践。
本文介绍了TraceLab,一个用于表征和建模编码Agent工作负载的系统。研究表明,编码Agent的LLM服务请求与普通聊天类工作负载存在显著差异,包括更高的并发性、更长的上下文长度以及独特的Token使用模式。TraceLab通过分析真实编码Agent的交互数据,为优化LLM服务系统提供了关键负载特征和可操作的建议。
PMB 是一个为编码代理设计的本地记忆工具,能够清晰展示记忆是否被实际调用。它帮助开发者更直观地了解代理在执行任务时对历史信息的依赖情况,从而提升调试和优化的效率。
Fame 是一个为本地编码代理设计的外部记忆与工具安全网关。它通过提供外部存储能力和工具调用安全机制,帮助代理在保持安全边界的前提下,更高效地管理上下文信息并执行复杂任务。该项目基于 GitHub 开源,旨在增强本地开发环境中 AI 代理的功能性与可控性。