Evaluation
Agent Skill 治理:别让规则漂移伪装成提示词优化
从规则漂移、重复检测、冲突检测、版本化、badcase、回归集、预算、外置参考、审批和回滚出发,建立 Agent Skill 治理框架。
把《深入理解 AI Agent》设计成工程课程:章节、实验、评估和结课项目路线图
面向团队和课程的 AI Agent 学习路线:用 10 章和 92 个实验建立上下文、工具、Coding Agent、评估与后训练能力。
CEO-Bench 真正说明的不是 AI 能不能当 CEO,而是长周期决策有多难
把 14 个顶级模型放进 500 天的订阅软件公司模拟里,最有价值的结论是:长周期、强反馈、持续校准,才是 Agent 的硬门槛。