八周实验路线
所有实验在同一个小组仓库中连续完成。每周必须实现一个可独立调用、可留下结构化产物、可被后续模块真实消费的能力;Week 7 和 Week 8 再以端到端任务评价完整系统。
输入是一套教学组提供的良好定义的软件任务,包含自然语言需求及必要约束、资源和样例。输出是可构建、可运行的代码仓库,同时包含系统运行产生的中间产物和执行证据。
教学组不限定 Agent 数量、角色名称、编排框架或内部拓扑。单 Agent 配合工具、固定流水线、Planner–Worker、Blackboard 或其他设计均可。评分依据是系统行为和证据,而不是形式上的 Multi-Agent 数量。
- Week 1:运行时与单 Agent 基线
- Week 2:需求理解与 Requirement IR
- Week 3:架构与接口设计
- Week 4:软件实现
- Week 5:测试设计与执行
- Week 6:调试、修复与恢复
- Week 7:公开端到端任务
- Week 8:私有端到端评测
共同检查原则
Section titled “共同检查原则”- 使用候选 Git commit 在干净环境中执行,而不是检查本地未提交状态;
- 通过统一命令调用模块和完整系统;
- Schema、构建、测试和工具调用必须真实执行;
- 中间产物必须具备来源和下游使用证据;
- 失败必须显式报告,不能用模型文本声明成功;
- 最终功能由教学组独立测试判定,学生自生成测试不能自证正确。