jev-calibration-audit
jujumilk3
通过公开 API 和数据测试 Jev 概率校准、选项措辞影响及韩文判断表现。
- 许可证
- MIT
- GitHub Stars
- 0
- 源码核查日期
- 2026-09-19
Jev 在哪一步做判断
收集 Noul 与 Choice 输出,对照标签计算误差、准确率和稳定性。
这个项目的用途
保留逐次调用数据与实验说明,便于检查结论适用范围。
核查范围
校准会随任务、标签与选项变化;作者实验不能视为全领域置信度保证。 已核对固定版本 README 与集成源码。
源码与说明
同类项目
jev-review
NiazMorshed2007 · 评测与观测
供编码 Agent 使用的本地 MCP 代码质量检查器,返回多个维度的结构化评分。
jev-benchmarks
AbdelStark · 评测与观测
把 Jev 和 GLiNER 放到同一批分类题上,除了答对率,也检查概率靠不靠谱。
jev-playground
mizchi · 评测与观测
MoonBit 与 TypeScript 的 Jev 实验集,覆盖棋类、浏览器、命令风险和小型语言。
jev-lm
y0usaf · 评测与观测
把下一个词当选择题,试着用 Jev 拼出句子;也能让它挑选本地草拟的整段续写。