Show HN: 用 grep 就够了?——一个透明的智能体代码导航基准测试
作者觉得 LSP 服务器过于复杂,而仅用 Bash 工具又太粗暴,于是想看看将 tree-sitter 作为一等工具使用效果如何。他们在 10 个大型代码库(包括比特币、Django、Rails、Redis 等)上进行了基准测试,每个库设置 5 个不同复杂度的探索任务,总共完成了 150 次上下文隔离的运行。结果已完全公开,包含所有脚本、Docker 镜像脚本和运行记录,旨在提供一个透明的对比参照。
背景速读
这篇短文来自一个开发者自己做的实验性基准测试。核心问题很简单:当AI代码代理(agent)需要在大型代码库中寻找信息时,只用 grep(Linux 下的文本搜索命令)够用吗?还是需要更复杂的工具?
— 项目对比了几种方案:传统 grep/Bash 命令、LSP(Language Server Protocol,即编辑器里用的代码智能服务,比如跳转定义、查找引用)、以及 tree-sitter(一种解析代码为语法树的工具,比 LSP 轻量)。作者把 tree-sitter 作为AI可以直接调用的“一等工具”(first-class tool)来测试。
— 测试覆盖了10个大型开源项目(Bitcoin Core、Django、Rails、Redis等),每个项目设置5个不同难度的探索任务,共150次独立运行。所有代码、Docker 镜像、运行记录都完全公开。
— 对关注AI编程助手和开发者工具的人,这个实验的价值在于:它直面一个实际工程问题——代码导航工具到底该多“聪明”?LSP 强大但依赖项目配置(很多开源项目配不好),grep 简单但识别不了代码结构,tree-sitter 在中间是否是个甜点?作者用透明可复现的基准试图给出答案。