Show HN: Caliper – Claude Code 和 Codex 技能的 pass@k 可靠性测试
Caliper 是一个轻量级本地测试工具,用于对 Claude Code、Codex 等 AI 编程助手的技能(skills)进行 pass@k 可靠性评估。它通过在隔离环境中重复运行技能 k 次,并计算通过率来量化技能的真实效果。支持 LLM 评判和 Python 断言两种验证方式,并提供基准对比功能(--baseline),帮助开发者判断技能是否真正提升了模型表现,而非模型自身就能完成。项目已在 GitHub 和 PyPI 上开源。
背景速读
- Claude Code 和 Codex 是两款流行的人工智能编程助手(分别来自 Anthropic 和 OpenAI),它们支持用户编写"技能"(Skills)——类似于可复用的提示词模板,让 AI 按特定方式完成代码任务。但这类技能缺乏标准化的可靠测试方法。
- Caliper 是一个刚发布的开源工具(作者将其发布在 Hacker News 的 Show HN 上),专门解决这个问题:它能在隔离环境中反复运行同一个技能 k 次,计算 pass@k 得分(即 k 次运行中成功多少次)。
- 作者还提供了一个"基准对比"(baseline)功能:对比有无技能时模型的通过率,以判断技能是否真的带来了改进,而非模型本身就能完成——这在非确定性的 AI 系统中尤为重要。
- 该项目的核心创新在于将软件测试的思维方式(断言、YAML 配置、重复执行)引入到原本难以量化的 AI Agent 行为评估中,填补了一个新兴但空白的工具需求。