DAY 01–30
把真实经验抽象为开源 Agent Evaluation Lab
使用全新公开数据和代码,构建工具调用、结构化输出、状态持久化、失败恢复和人工审批;发布架构决策,明确哪些地方使用工作流、哪些地方需要自治。
Architecture decision recordTool contractsHuman-in-the-loopFailure recovery
90-day evidence plan
这不是课程清单,而是公开证据计划。每个阶段都要求一个可运行交付物、客观指标和失败记录。
从功能交付升级为跨组件、跨团队的结果 ownership,提前管理依赖、时间线和风险。
把质量改进转换为可复现评测集、成功率、延迟、成本和回归数据。
补齐 threat model、prompt injection 攻防、最小权限和人工审批的公开实现。
发布一套不含公司代码或数据的开源 Agent 系统与完整工程案例。
使用全新公开数据和代码,构建工具调用、结构化输出、状态持久化、失败恢复和人工审批;发布架构决策,明确哪些地方使用工作流、哪些地方需要自治。
创建至少 100 条代表性评测样本;跟踪任务成功率、工具错误、延迟、token 和成本;把线上失败转为回归用例。
实现一个 MCP server/client,执行直接与间接 prompt injection 测试;工具使用最小权限,高风险动作强制审批。最后发布一篇含失败复盘、指标和取舍的系统设计案例。