本文件供 AI Agent(包括 Claude Code)和人类维护者参考。修改仓库结构前请先读此文件。
本仓库是 Claude Code / AI Coding Agent 的评估方法论库,核心不是工具,而是:
- 评估框架:Agent / Prompt / RAG 三层的评测方法
- Benchmark 设计:具体场景的任务设计、数据集、评分标准
- 工作流模板:单轮、多轮、回归、CI 集成
- 可复用配置:Prompt 模板、Judge Prompt、配置文件
- 轻量 CLI:方法的参考执行器
不是学术论文集,也不是某个 benchmark 的复现代码。
claude-code-eval-cli/
├── README.md # GitHub 首页
├── METHODOLOGY.md # 方法论总览
├── MANIFEST.md # 项目宣言与收录标准
├── AGENTS.md # 本文件
│
├── frameworks/ # 评估框架(核心资产)
│ ├── agent-eval/ # Agent 端到端评测
│ ├── prompt-eval/ # Prompt 评测
│ └── rag-eval/ # RAG 评测
│
├── benchmarks/ # 具体评测场景设计
│ ├── coding-task/
│ ├── code-review/
│ ├── refactoring/
│ └── bugfix/
│
├── datasets/ # 数据集规范与示例
│ ├── schema.md
│ ├── examples/
│ └── templates/
│
├── workflows/ # 评估工作流
├── recipes/ # 可复用配置
├── references/ # 参考资源
└── cli/ # 轻量执行器
- 目录:
kebab-case - Markdown 文件:
kebab-case - Python 模块:
snake_case - 数据集文件:
task-name-v1.jsonl - 避免:中文文件名、空格
- 评估方法论文档(
.md) - 评测维度、指标、Rubrics(
.md) - 数据集示例与模板(
.jsonl、.yaml、.md) - Prompt 模板与 Judge Prompt(
.md) - 工作流文档(
.md) - 轻量参考代码(
.py) - 参考资源列表(
.md)
| 类型 | 原因 |
|---|---|
| 大型模型权重 | 体积过大 |
| API Key / Token | 敏感信息 |
| 完整项目代码库 | 版权/体积问题 |
| 复杂 GUI 工具 | 与定位不符 |
| 未经验证的 benchmark 结果 | 避免误导 |
- 在
frameworks/{agent-eval,prompt-eval,rag-eval}/下创建目录 - 必须包含
README.md说明框架目标、维度、流程 - 在
rubrics/下提供评分标准 - 在顶层
METHODOLOGY.md中更新引用
- 在
benchmarks/下创建场景目录 - 包含
README.md说明任务定义、成功标准、失败归因 - 可选:提供示例数据集到
datasets/examples/
- 遵循
datasets/schema.md - 文件名包含版本号,如
bugfix-django-v1.jsonl - 在
datasets/examples/中提供 3-5 条示例
□ 新文件命名符合 kebab-case / snake_case
□ 没有包含 API Key 或敏感信息
□ Markdown 中图片使用相对路径
□ 如果移动文件,更新 README 中的链接
□ 新增内容符合 MANIFEST.md 的收录标准
□ 提交信息用中文简述变更内容
- 本仓库的方法论文档为原创整理
- 引用第三方 benchmark 时需标注来源和协议
- 示例代码为教学目的编写,可自由使用
- 不收录受版权保护的完整源码
npx serve .
# 或
python -m http.server 8000修改文件路径后,全局搜索旧路径,确保 README 和目录索引中的链接已更新。
最后更新: 2026-07-07