jev-benchmarks
AbdelStark
把 Jev 和 GLiNER 放到同一批分类题上,除了答对率,也检查概率靠不靠谱。
- 许可证
- Apache-2.0
- GitHub Stars
- 9
- 源码核查日期
- 2026-09-19
Jev 在哪一步做判断
对固定文本和标签集合做分类,记录每个标签的概率、耗时和失败。
这个项目的用途
能看清模型在哪些任务上适合自动处理,在哪些任务上容易过度自信。
核查范围
作者报告 300 样本试验;远程 Jev 与本地 GLiNER 的延迟不能当作统一硬件比较。本站未重跑。
源码与说明
同类项目
jev-review
NiazMorshed2007 · 评测与观测
供编码 Agent 使用的本地 MCP 代码质量检查器,返回多个维度的结构化评分。
jev-playground
mizchi · 评测与观测
MoonBit 与 TypeScript 的 Jev 实验集,覆盖棋类、浏览器、命令风险和小型语言。
jev-lm
y0usaf · 评测与观测
把下一个词当选择题,试着用 Jev 拼出句子;也能让它挑选本地草拟的整段续写。
jev-chat
adhyaay-karnwal · 评测与观测
实验性聊天解码器:让 Jev 反复选择词或短语,由代码把它们拼成回答。