本目录收录具体的 AI Coding Agent 评测场景设计。每个场景都包含任务定义、成功标准、失败归因方向。
| 场景 | 说明 | 对应框架 |
|---|---|---|
| coding-task | 根据需求实现新功能 | Agent Eval |
| code-review | 审查代码变更 | Agent Eval / Prompt Eval |
| refactoring | 在不改变行为的前提下重构代码 | Agent Eval |
| bugfix | 定位并修复 bug | Agent Eval / RAG Eval |
每个 benchmark 场景都需要明确:
- 任务定义:Agent 要做什么
- 输入规范:代码库、指令、环境
- 成功标准:怎么算通过
- 失败归因:失败后怎么分析
- 数据集示例:至少 3-5 条样本
- 场景要有代表性,能反映真实开发工作
- 成功标准尽可能自动判断
- 提供人工复核说明
- 标注难度和适用领域