Skip to content
View weihuaguo270-ops's full-sized avatar
  • 哈尔滨工程大学
  • 哈尔滨

Highlights

  • Pro

Block or report weihuaguo270-ops

Block user

Prevent this user from interacting with your repositories and sending you notifications. Learn more about blocking users.

You must be logged in to block users.

Maximum 250 characters. Please don’t include any personal information such as legal names or email addresses. Markdown is supported. This note will only be visible to you.
Report abuse

Contact GitHub support about this user’s behavior. Learn more about reporting abuse.

Report abuse
weihuaguo270-ops/README.md

👋 郭伟华 | Guo Weihua

哈尔滨工程大学 · 计算机科学与技术 · 2027 届本科

CI CI CI CI

求职方向:大模型算法 / Agent 研发 / LLM 评测 · 2026 年 7 月起可实习
下列项目均为个人学习与实验实现,用于理解原理与工程结构,非生产交付物


推荐阅读顺序(面试向)

  1. 先看 react-agent — 主作品:ReAct 运行时 + Harness 轨迹 + capability 公开快照
  2. 再看 transformer-attention — 算法线:MHA / GQA / MLA(含 absorb 路径)手写对照
  3. 选看 llm-eval-engine — 评测线:过程级 LLM-as-Judge / 人机校准(小样本诚实报告)
  4. 了解 trace-debugger — 配套:轨迹失败分类 / 回放(非独立主项目)

核心项目与职责边界

项目 负责什么 不声称什么 CI
react-agent 手写 ReAct + LangGraph 对照;Harness 轨迹 Schema;capability 规则评测;跨仓一键闭环 生产级安全沙箱 / 不可信代码隔离
llm-eval-engine 过程级 LLM-as-Judge、Eval Loop、人机校准 训练型 PRM / 替代 react-agent 的 capability 主评测集
transformer-attention Attention 教学实现与微基准(NumPy / 小规模 PyTorch) 大规模预训练效果
trace-debugger 轨迹启发式复盘(工具失败 / 跑偏 / 溢出等) Agent 可观测「平台」

跨仓闭环(可复现 demo)

Agent 执行 → Harness 轨迹 (Format B, 1-based step)
          → trace-debugger 失败分类
          → llm-eval-engine 过程级 Judge 评分
  • Schema:react-agent/schemas/harness_trajectory.schema.json
  • 一键脚本:python examples/harness_closed_loop.py --fixture(react-agent CI integration 会跑)
  • MCP / 本机路径:不入库;用 mcp_servers.example.json → 本地 mcp_servers.json
  • 核心依赖轻量;语义检索 / RAG:pip install -e ".[rag]"

P0 证据地图(四层一张表)

面试时建议从 react-agent P0_EVIDENCE_MAP 起讲,四层指标刻意分开

数字(2026-07) 公开页
Execution offline 12/12;agent 36/36 agent v3
Reliability live flaky n=20:error_obs 0 vs 3.1 live v2
Failure 同批 100 条:llm_offtrack 6→1 飞轮闭环
Judge held_out live κ≈0.69(n=20,CI[0.46,0.92]);offline held_out=1.0(n=20,冻结) live · 怎么读

近期可验证点(2026-07)

方向 证据
Agent ↔ 评测闭环 Format B Schema + 离线 fixture + CI 安装 tdebug / eval-engine
P0 四层证据 见上表 + P0_EVIDENCE_MAP
公开评测诚实性 capability / execution + Wilson CI;Judge held_out live κ≈0.69(n=20);第二标注者 protocol_ready
算法线 transformer-attention MLA absorb 数值对齐 + 微基准 CSV;PyTorch 套件进 CI
工程克制 权限 / 子进程执行写明「学习级提示与超时隔离,非安全边界」

技术栈

领域 具体
语言 Python(主力)、TypeScript(基础)、C++(基础)
深度学习 PyTorch、NumPy、Transformer 架构、GQA / MLA、RoPE
Agent 手写 ReAct Loop、LangGraph 对照、MCP(配置外置)、多 Agent 编排实验
工程工具 Git / GitHub Actions、pytest、flake8、FastAPI
评测 / 轨迹 Capability 规则打分、过程级 LLM-as-Judge、人机校准、Harness Schema

联系

当前状态:寻找 2026 暑期实习 · 大模型算法 / Agent 研发 / LLM 评测方向

Pinned Loading

  1. transformer-attention transformer-attention Public

    Transformer Attention 教学实现 — MHA、GQA、MLA absorb、小规模对照

    Python

  2. react-agent react-agent Public

    ReAct Agent 学习实现 — Harness 轨迹 Schema、capability 评测、跨仓闭环 demo(非生产沙箱)

    Python 1

  3. llm-eval-engine llm-eval-engine Public

    LLM 评估实验框架 — Process Reward / 人机校准;与 react-agent 轨迹对接

    Python

  4. weihuaguo270-ops weihuaguo270-ops Public

    个人主页

  5. trace-debugger trace-debugger Public

    Agent 轨迹分析小工具 — Format B 失败分类、回放、批量扫描(配套)

    Python