← 全部项目
AI System · 2025–2026
Agent Data & Evaluation
面向真实软件任务的多 Agent 评测范式
由 Generator、Validator、Solver、Judge 组成可执行评测闭环,把静态题目升级为可生成、可验证、可求解、可评分的真实任务。
AgentEvaluationBenchmark
01Generator
02Validator
03Solver
04Judge
CHALLENGE
问题
静态问答难以衡量 Agent 是否能在真实环境中完成软件任务,也难以持续扩展题目、控制难度和解释失败原因。
APPROACH
方案
把题目生产与求解拆成四类角色,通过运行环境、测试与代码质量共同决定结果,让评测数据同时服务模型比较、错误分析与后续训练。
WHAT IT DOES
核心能力
- Generator 生成 Issue、测试与参考修复
- Validator 检查可执行性、可解性与难度
- Solver 在真实代码环境完成任务
- Judge 综合运行结果、任务完成度与代码质量评分
OUTCOMES
项目价值
- 从一次性 Benchmark 走向持续生成的任务分布
- 把失败结果沉淀为可解释错误归因
- 形成训练数据、评测标准和产品反馈闭环
STACK
LLM AgentsSandboxTest HarnessLLM-as-a-JudgeData Pipeline