jev-agent-failure-benchmark
TokenTrim
用 Jev 分析多 Agent 失败记录的评测项目,预测责任 Agent、关键步骤和错误类型。
- 许可证
- Apache-2.0
- GitHub Stars
- 1
- 源码核查日期
- 2026-09-19
Jev 在哪一步做判断
把记录里的 Agent、步骤和错误分类作为选项,提交三组 choice 问题。
这个项目的用途
提供评测脚本和作者结果;部分基线生成答案而 Jev 选候选,比较条件不同。
核查范围
作者的 benchmark 中,Jev 部分任务采用候选选择,论文基线采用自由生成,不能把全部指标当作严格同条件比较。
源码与说明
同类项目
jev-review
NiazMorshed2007 · 评测与观测
供编码 Agent 使用的本地 MCP 代码质量检查器,返回多个维度的结构化评分。
jev-benchmarks
AbdelStark · 评测与观测
把 Jev 和 GLiNER 放到同一批分类题上,除了答对率,也检查概率靠不靠谱。
jev-playground
mizchi · 评测与观测
MoonBit 与 TypeScript 的 Jev 实验集,覆盖棋类、浏览器、命令风险和小型语言。
jev-lm
y0usaf · 评测与观测
把下一个词当选择题,试着用 Jev 拼出句子;也能让它挑选本地草拟的整段续写。