跳转到内容

Week 1:运行时与单 Agent 基线

本周先让系统真正运行起来。你们需要建立一个最小基线:它能够读取任务、调用模型、在隔离工作区操作文件和开发工具,并把结果写成代码仓库。这个基线不要求复杂的 Agent 分工,也不追求完成大型应用。

  1. 统一入口:接收任务目录、输出目录和日志目录,返回明确退出状态;
  2. 模型适配:通过课程允许的平台或 API 调用模型,记录可披露的模型与配置元数据;
  3. 工作区工具:受控地读取、创建和修改文件,执行构建、测试和 Git 等开发命令;
  4. 基本循环:至少能够规划一次、执行工具、读取反馈并决定继续或停止;
  5. 事件日志:记录运行、模型调用、工具调用、产物、错误、资源消耗和终止原因;
  6. 最小交付:为校准任务产生带英文 README 的代码仓库。

允许直接使用 Starter Kit,也允许替换底层框架。无论采用几个 Agent,以上外部行为必须保持一致。

  • 可执行的系统骨架和统一 CLI;
  • 模型、文件、Shell 与日志适配模块;
  • 事件格式说明及 Schema;
  • 一次校准任务的输出仓库与完整日志;
  • README:安装、运行、目录、限制和故障处理。

教学组从候选 commit 创建干净工作区,注入临时模型凭据并执行标准校准任务,检查:

  • 命令能否无人交互地启动并正常结束;
  • 只在允许目录内读写,超时和命令失败能否显式返回;
  • 输出仓库是否包含可执行说明且能够完成基础构建;
  • 日志能否重建关键事件顺序,且不泄露秘密;
  • 模型或工具失败时,系统是否留下可诊断证据。

本周结果将作为后续模块和端到端系统的单 Agent 基线。不要为了校准任务写死答案。