90-day evidence plan

从“会构建”到可证明的生产级 Agent 工程

这不是课程清单,而是公开证据计划。每个阶段都要求一个可运行交付物、客观指标和失败记录。

校准后的判断:近期真实工作已经覆盖端到端 LLM 评测、Agent prompt 工具、事实性与质量评分、跨端产品开发、企业连接器迁移和开发者自动化。当前短板不是“没有 Agent 经历”,而是公开仓库尚未把这些能力证明为一套可复现、可观测、可攻防测试的现代 Agent 系统;更高职级和更高市场薪酬还要求持续证明跨团队 ownership 与可量化业务/质量影响。内部薪酬记录只用于校准,本页不公开具体金额,也不承诺职位或薪酬结果。
Scope

从功能交付升级为跨组件、跨团队的结果 ownership,提前管理依赖、时间线和风险。

Evidence

把质量改进转换为可复现评测集、成功率、延迟、成本和回归数据。

Safety

补齐 threat model、prompt injection 攻防、最小权限和人工审批的公开实现。

Market signal

发布一套不含公司代码或数据的开源 Agent 系统与完整工程案例。

DAY 01–30

把真实经验抽象为开源 Agent Evaluation Lab

使用全新公开数据和代码,构建工具调用、结构化输出、状态持久化、失败恢复和人工审批;发布架构决策,明确哪些地方使用工作流、哪些地方需要自治。

Architecture decision recordTool contractsHuman-in-the-loopFailure recovery
DAY 31–60

建立评测与可观测系统

创建至少 100 条代表性评测样本;跟踪任务成功率、工具错误、延迟、token 和成本;把线上失败转为回归用例。

Offline eval setCI quality gateOpenTelemetry tracesCost dashboard
DAY 61–90

完成安全、互操作与公开案例

实现一个 MCP server/client,执行直接与间接 prompt injection 测试;工具使用最小权限,高风险动作强制审批。最后发布一篇含失败复盘、指标和取舍的系统设计案例。

MCP integrationThreat modelAdversarial testsPublic case study