Skip to content

Latest commit

 

History

History

Folders and files

NameName
Last commit message
Last commit date

parent directory

..
 
 

README.md

Benchmark 场景设计

本目录收录具体的 AI Coding Agent 评测场景设计。每个场景都包含任务定义、成功标准、失败归因方向。


场景列表

场景 说明 对应框架
coding-task 根据需求实现新功能 Agent Eval
code-review 审查代码变更 Agent Eval / Prompt Eval
refactoring 在不改变行为的前提下重构代码 Agent Eval
bugfix 定位并修复 bug Agent Eval / RAG Eval

设计原则

每个 benchmark 场景都需要明确:

  1. 任务定义:Agent 要做什么
  2. 输入规范:代码库、指令、环境
  3. 成功标准:怎么算通过
  4. 失败归因:失败后怎么分析
  5. 数据集示例:至少 3-5 条样本

收录标准

  • 场景要有代表性,能反映真实开发工作
  • 成功标准尽可能自动判断
  • 提供人工复核说明
  • 标注难度和适用领域