← 全部项目

AI System · 2025–2026

Agent Data & Evaluation

面向真实软件任务的多 Agent 评测范式

由 Generator、Validator、Solver、Judge 组成可执行评测闭环,把静态题目升级为可生成、可验证、可求解、可评分的真实任务。

AgentEvaluationBenchmark
01Generator
02Validator
03Solver
04Judge

CHALLENGE

问题

静态问答难以衡量 Agent 是否能在真实环境中完成软件任务,也难以持续扩展题目、控制难度和解释失败原因。

APPROACH

方案

把题目生产与求解拆成四类角色,通过运行环境、测试与代码质量共同决定结果,让评测数据同时服务模型比较、错误分析与后续训练。

WHAT IT DOES

核心能力

  • Generator 生成 Issue、测试与参考修复
  • Validator 检查可执行性、可解性与难度
  • Solver 在真实代码环境完成任务
  • Judge 综合运行结果、任务完成度与代码质量评分

OUTCOMES

项目价值

  • 从一次性 Benchmark 走向持续生成的任务分布
  • 把失败结果沉淀为可解释错误归因
  • 形成训练数据、评测标准和产品反馈闭环

STACK

LLM AgentsSandboxTest HarnessLLM-as-a-JudgeData Pipeline