Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

1 Commit
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Claude Code Eval CLI

不是又一个评测工具,而是一套评估 Claude Code / AI Coding Agent 的方法论与可复用框架。


一句话定位

把"AI Coding Agent 好不好用"从主观感受,变成可重复、可对比、可改进的评估实践。

我们相信:

  • 没有一种工具能评测所有 Agent。
  • 但一套清晰的方法论 + 可复用的维度 + 可落地的流程可以。
  • CLI 只是这套方法的执行器之一,不是目的本身。

为什么不是"工具优先"

市面上的 eval 工具已经很多:

  • 跑 benchmark:SWE-bench、LiveCodeBench、USACO
  • 测 prompt:promptfoo、DeepEval
  • 测 RAG:RAGAS、ARES

但它们大多假设你已经知道:

  • 该测什么任务
  • 该用什么指标
  • 失败时怎么归因
  • 结果怎么反馈到工程改进

这正是本仓库要补上的部分:

在写代码之前,先把"评什么、怎么评、评完怎么办"想清楚。


三个核心层级

层级 问题 本仓库提供
Prompt Eval 提示词是否稳定、可迁移、抗干扰? 评测维度、评分标准、测试模板
RAG Eval Agent 读到的上下文是否相关、完整、不产生幻觉? 检索指标、生成指标、代码库专用评测方法
Agent Eval 给定一个真实任务,Agent 能否独立完成? 任务分类、评测流程、失败归因框架

三个层级不是孤立的。Agent 任务失败,往往根因在 Prompt 或 RAG;RAG 检索失败,可能又和 Prompt 怎么描述查询有关。


仓库结构

claude-code-eval-cli/
├── README.md                    # 本文件
├── METHODOLOGY.md               # 评估方法论总览
├── MANIFEST.md                  # 项目宣言与收录标准
├── AGENTS.md                    # 仓库维护指南
│
├── frameworks/                  # 评估框架(核心资产)
│   ├── agent-eval/              # Agent 端到端评测框架
│   ├── prompt-eval/             # Prompt 评测框架
│   └── rag-eval/                # RAG 评测框架
│
├── benchmarks/                  # 具体评测场景设计
│   ├── coding-task/             # 编码任务
│   ├── code-review/             # 代码审查
│   ├── refactoring/             # 重构任务
│   └── bugfix/                  # Bug 修复
│
├── datasets/                    # 数据集规范与示例
│   ├── schema.md                # 统一数据格式
│   ├── examples/                # 示例数据
│   └── templates/               # 数据生成模板
│
├── workflows/                   # 评估工作流
│   ├── single-turn.md           # 单轮评测
│   ├── multi-turn.md            # 多轮评测
│   ├── regression.md            # 回归评测
│   └── ci-integration.md        # CI 集成
│
├── recipes/                     # 可复用配置
│   ├── prompts/                 # 评测用 prompt
│   ├── judge-prompts/           # LLM-as-judge prompt
│   └── configs/                 # 配置文件模板
│
├── references/                  # 参考资料
│   ├── papers.md
│   └── projects.md
│
└── cli/                         # 轻量执行器(可选)
    └── README.md

快速开始

如果你是第一次接触 AI Coding Agent 评测

  1. METHODOLOGY.md
  2. 选择一个层级进入:
  3. 挑一个 benchmark 场景 试跑

如果你想直接落地到团队

  1. workflows/ci-integration.md
  2. datasets/schema.md 统一你们的数据格式
  3. recipes/ 复制一份配置开始改

设计原则

  1. 方法优先于工具
    先定义"评什么",再决定"用什么跑"。

  2. 可复用优先于全覆盖
    不追求评测所有场景,但每个场景都要能复现。

  3. 失败归因优先于分数
    分数只是入口,知道为什么失败才有价值。

  4. 人工可复核
    所有自动评测都要保留人工复核的接口和痕迹。


免责声明

本仓库内容基于公开资料、社区实践和作者经验整理,不构成任何官方评测标准。引用第三方 benchmark 时请遵循原作者协议。


许可证

MIT

About

Claude Code / AI Coding Agent 评估方法论:覆盖 Agent、Prompt、RAG 三层 eval 的可复用框架

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors