文档 / 源码核对
agent-evals
把规则检查与 Jev 语义判断接入 Agent 测试
这个项目怎样使用 Jev
- 输入
- 测试对话、Agent 输出、工具调用和期望行为;语义裁判使用经过选择的状态
- Jev 判断
- 回答是否有据、是否符合要求等结构化问题,为语义评分器提供概率
- 代码执行
- 测试器合并同一状态的问题,结合确定性检查生成分数和 CI 退出结果,并用录制响应回放
验证边界
CI 回放已有响应不代表重新验证线上模型;录制与真实判断需要服务访问。缺失工具记录会标为未知而非安全,跳过项不计入分母,应检查测试覆盖。作者示例阈值和成本收益不能直接泛化;本站未复测。
本站未运行该项目;作者报告的能力与结果不等于本站复测结论。
原始来源
- https://github.com/marianoberton/agent-evals/blob/242ddd78864a5166b870ef43ae33ee914fd857d6/README.md ↗
- https://github.com/marianoberton/agent-evals/blob/242ddd78864a5166b870ef43ae33ee914fd857d6/src/jev/client.ts ↗
- https://github.com/marianoberton/agent-evals/blob/242ddd78864a5166b870ef43ae33ee914fd857d6/src/scorers/jevJudge.ts ↗
- https://github.com/marianoberton/agent-evals/blob/242ddd78864a5166b870ef43ae33ee914fd857d6/src/core/run.ts ↗