跳转到内容

Week 8:私有端到端评测

本周检验的是自主软件工程系统,而不是小组能否临时手工完成另一个应用。教学组向冻结系统提供此前未公开的同规模任务,在统一环境和资源预算下运行,并对输出仓库进行独立评价。

  1. 截止前提交并推送系统 commit,教学组记录模型、依赖和配置;
  2. 评测环境从该 commit 构建系统,注入私有任务和临时模型凭据;
  3. 按统一入口启动,保存所有规定中间产物、工具事件和资源记录;
  4. 运行期间原则上不允许人工修改生成代码或向 Agent 补充任务答案;
  5. 平台或基础设施异常按统一规则重跑,系统自身失败保留为评测结果;
  6. 生成结束后封存输出仓库和日志,再开始功能与质量评价。
  • 冻结的自主系统仓库与 commit;
  • 私有任务输出的软件仓库;
  • Requirement IR、设计、测试和修复等中间产物;
  • 完整事件日志、最终状态和资源统计;
  • 课后复盘:成功、失败传播路径、人工本可如何改进,以及下一版方案。

评测采用四层证据:

  1. 确定性运行检查:仓库结构、安装、构建、启动、健康与清理;
  2. 独立自动化测试:核心功能、业务规则、边界、异常和鲁棒性;
  3. 结构化仓库审查:架构、测试质量、硬编码、依赖、安全和可维护性风险;
  4. 定向人工检查:主要用户流程、交互完整性及自动结果中的争议项。

系统自行生成的测试用于评价其测试与修复能力,但最终功能正确性由教学组测试决定。一次优秀运行不自动证明稳定性;教学组可在预算允许时对部分任务或系统复测。

  • 需求满足程度与关键业务规则正确性;
  • 输出仓库是否可构建、可运行、可理解和可继续维护;
  • 测试是否具有真实缺陷发现能力;
  • 系统能否根据反馈修复且不制造明显回归;
  • 从任务输入到最终仓库的自主完成程度;
  • 过程是否可复现、失败是否可诊断、资源使用是否遵守限制。

私有任务细节、隐藏测试和执行凭据不会在评测前公开。