typesafe-ai-benchmark
iammrduncan
在共同的应用任务上对照 Jev 与其他结构化输出模型,记录错误、延迟、Token 与估算成本。
- 许可证
- MIT
- GitHub Stars
- 32
- 源码核查日期
- 2026-09-19
Jev 在哪一步做判断
把同一任务转换成 Jev 的 Choice/Noul 问题,并把答案映射到统一的结果格式。
这个项目的用途
保留对照方法与结果,方便检查模型差异。
核查范围
README 当前描述有限的合成工作负载与独立捕获结果;演示视频并非测量数据,不能推广成所有任务上的排名。本站未复现。
源码与说明
同类项目
jev-review
NiazMorshed2007 · 评测与观测
供编码 Agent 使用的本地 MCP 代码质量检查器,返回多个维度的结构化评分。
jev-benchmarks
AbdelStark · 评测与观测
把 Jev 和 GLiNER 放到同一批分类题上,除了答对率,也检查概率靠不靠谱。
jev-playground
mizchi · 评测与观测
MoonBit 与 TypeScript 的 Jev 实验集,覆盖棋类、浏览器、命令风险和小型语言。
jev-lm
y0usaf · 评测与观测
把下一个词当选择题,试着用 Jev 拼出句子;也能让它挑选本地草拟的整段续写。