不是又一个评测工具,而是一套评估 Claude Code / AI Coding Agent 的方法论与可复用框架。
把"AI Coding Agent 好不好用"从主观感受,变成可重复、可对比、可改进的评估实践。
我们相信:
- 没有一种工具能评测所有 Agent。
- 但一套清晰的方法论 + 可复用的维度 + 可落地的流程可以。
- CLI 只是这套方法的执行器之一,不是目的本身。
市面上的 eval 工具已经很多:
- 跑 benchmark:SWE-bench、LiveCodeBench、USACO
- 测 prompt:promptfoo、DeepEval
- 测 RAG:RAGAS、ARES
但它们大多假设你已经知道:
- 该测什么任务
- 该用什么指标
- 失败时怎么归因
- 结果怎么反馈到工程改进
这正是本仓库要补上的部分:
在写代码之前,先把"评什么、怎么评、评完怎么办"想清楚。
| 层级 | 问题 | 本仓库提供 |
|---|---|---|
| Prompt Eval | 提示词是否稳定、可迁移、抗干扰? | 评测维度、评分标准、测试模板 |
| RAG Eval | Agent 读到的上下文是否相关、完整、不产生幻觉? | 检索指标、生成指标、代码库专用评测方法 |
| Agent Eval | 给定一个真实任务,Agent 能否独立完成? | 任务分类、评测流程、失败归因框架 |
三个层级不是孤立的。Agent 任务失败,往往根因在 Prompt 或 RAG;RAG 检索失败,可能又和 Prompt 怎么描述查询有关。
claude-code-eval-cli/
├── README.md # 本文件
├── METHODOLOGY.md # 评估方法论总览
├── MANIFEST.md # 项目宣言与收录标准
├── AGENTS.md # 仓库维护指南
│
├── frameworks/ # 评估框架(核心资产)
│ ├── agent-eval/ # Agent 端到端评测框架
│ ├── prompt-eval/ # Prompt 评测框架
│ └── rag-eval/ # RAG 评测框架
│
├── benchmarks/ # 具体评测场景设计
│ ├── coding-task/ # 编码任务
│ ├── code-review/ # 代码审查
│ ├── refactoring/ # 重构任务
│ └── bugfix/ # Bug 修复
│
├── datasets/ # 数据集规范与示例
│ ├── schema.md # 统一数据格式
│ ├── examples/ # 示例数据
│ └── templates/ # 数据生成模板
│
├── workflows/ # 评估工作流
│ ├── single-turn.md # 单轮评测
│ ├── multi-turn.md # 多轮评测
│ ├── regression.md # 回归评测
│ └── ci-integration.md # CI 集成
│
├── recipes/ # 可复用配置
│ ├── prompts/ # 评测用 prompt
│ ├── judge-prompts/ # LLM-as-judge prompt
│ └── configs/ # 配置文件模板
│
├── references/ # 参考资料
│ ├── papers.md
│ └── projects.md
│
└── cli/ # 轻量执行器(可选)
└── README.md
- 读 METHODOLOGY.md
- 选择一个层级进入:
- 挑一个 benchmark 场景 试跑
- 看 workflows/ci-integration.md
- 用 datasets/schema.md 统一你们的数据格式
- 从 recipes/ 复制一份配置开始改
-
方法优先于工具
先定义"评什么",再决定"用什么跑"。 -
可复用优先于全覆盖
不追求评测所有场景,但每个场景都要能复现。 -
失败归因优先于分数
分数只是入口,知道为什么失败才有价值。 -
人工可复核
所有自动评测都要保留人工复核的接口和痕迹。
本仓库内容基于公开资料、社区实践和作者经验整理,不构成任何官方评测标准。引用第三方 benchmark 时请遵循原作者协议。
MIT