结合 When Agents Slow Down、Reflexion、Hyperband 和 Agent 评测,说明怎样比较连续修改与独立尝试,并设计可复现的预算分配实验。
返回写作
标签 #evaluation
-
Agent 该继续跑,还是重新开一轮?读懂预算分配、记忆与评测 -
Agent 线上出过的错,怎么自动变成以后每次改动都要重跑的测试? 结合 Kitaru 的 Replay、Evaluator 和 Regression Suite,说明怎样把线上失败固定成可重放的 Agent 回归测试,并用工具策略与评测结果接入 CI。