实验总览
八周实验始终在同一个小组仓库中推进。前六周分别实现并验证软件工程能力,第七周将模块串联并完成公开任务,第八周冻结系统并接受私有任务评测。
Task Package ↓Requirement Understanding → Requirement IR / Spec ↓Architecture & Interfaces ↓Implementation ↓Test Design & Execution ↓Debugging & Repair ↓Executable Repository + Execution Evidence| 周次 | 核心模块 | 本周系统获得的能力 | 主要检查 |
|---|---|---|---|
| Week 1 | 运行时与基线 | 读取任务、调用模型、操作工作区并留下日志 | 标准 CLI 完成校准任务 |
| Week 2 | 需求理解 | 将自然语言需求转换为可校验 Requirement IR | Schema、需求样例与下游消费检查 |
| Week 3 | 架构与接口 | 生成模块、数据模型、接口契约与追踪关系 | 完整性和一致性检查 |
| Week 4 | 软件实现 | 规划任务、修改仓库、构建并运行纵向切片 | 干净环境构建与切片测试 |
| Week 5 | 测试设计 | 生成并执行具有有效判定的多层测试 | 正确项目和缺陷变体检测 |
| Week 6 | 调试修复 | 根据失败证据诊断、修复并回归 | 定额修复、回归与断点恢复 |
| Week 7 | 公开任务 | 串联全部模块,生成完整应用 | 公开端到端验收 |
| Week 8 | 私有评测 | 在未见任务上无人干预地完成交付 | 私有测试、仓库审查与人工检查 |
每周页面将进一步说明需要实现的功能、交付物和检查方法。进入八周实验路线
- 外部协议统一,内部设计自由。 教学组固定可评测边界,不指定 Agent 数量与框架。
- 中间产物必须被消费。 IR、Spec 和设计文件不是装饰,后续模块必须真实读取并使用。
- 以执行证据判断完成。 构建、测试、工具调用和修复必须真实发生并进入日志。
- 开发与评价相互独立。 学生系统生成的测试用于自我改进,教学组测试用于最终判定。
- 公开任务用于迭代,私有任务用于泛化。 最终评价冻结后的系统,而不是人工补完的应用。