跳转到内容

八周实验路线

所有实验在同一个小组仓库中连续完成。每周必须实现一个可独立调用、可留下结构化产物、可被后续模块真实消费的能力;Week 7 和 Week 8 再以端到端任务评价完整系统。

输入是一套教学组提供的良好定义的软件任务,包含自然语言需求及必要约束、资源和样例。输出是可构建、可运行的代码仓库,同时包含系统运行产生的中间产物和执行证据。

教学组不限定 Agent 数量、角色名称、编排框架或内部拓扑。单 Agent 配合工具、固定流水线、Planner–Worker、Blackboard 或其他设计均可。评分依据是系统行为和证据,而不是形式上的 Multi-Agent 数量。

  1. Week 1:运行时与单 Agent 基线
  2. Week 2:需求理解与 Requirement IR
  3. Week 3:架构与接口设计
  4. Week 4:软件实现
  5. Week 5:测试设计与执行
  6. Week 6:调试、修复与恢复
  7. Week 7:公开端到端任务
  8. Week 8:私有端到端评测
  • 使用候选 Git commit 在干净环境中执行,而不是检查本地未提交状态;
  • 通过统一命令调用模块和完整系统;
  • Schema、构建、测试和工具调用必须真实执行;
  • 中间产物必须具备来源和下游使用证据;
  • 失败必须显式报告,不能用模型文本声明成功;
  • 最终功能由教学组独立测试判定,学生自生成测试不能自证正确。