评测与观测
29 · 已核对公开源码与实际接入逻辑。
jev-review
NiazMorshed2007 · 评测与观测
供编码 Agent 使用的本地 MCP 代码质量检查器,返回多个维度的结构化评分。
jev-benchmarks
AbdelStark · 评测与观测
把 Jev 和 GLiNER 放到同一批分类题上,除了答对率,也检查概率靠不靠谱。
jev-playground
mizchi · 评测与观测
MoonBit 与 TypeScript 的 Jev 实验集,覆盖棋类、浏览器、命令风险和小型语言。
jev-lm
y0usaf · 评测与观测
把下一个词当选择题,试着用 Jev 拼出句子;也能让它挑选本地草拟的整段续写。
jev-chat
adhyaay-karnwal · 评测与观测
实验性聊天解码器:让 Jev 反复选择词或短语,由代码把它们拼成回答。
jev-agent-failure-benchmark
TokenTrim · 评测与观测
用 Jev 分析多 Agent 失败记录的评测项目,预测责任 Agent、关键步骤和错误类型。
ask-jev
omni- · 评测与观测
Windows PowerShell 工具,在 Codex 中用 :jev 审视会话里已记录的执行证据。
jev-rerank-bench
anessbelbati · 评测与观测
比较 Jev、专用 reranker 和聊天模型对同一批搜索片段的排序结果。
jev-demos
Bud-ro · 评测与观测
用迷宫测试 Jev 的空间判断,比较单步选择和一次预测多步的表现。
foreman-jev
Shifty-Eye-Games · 评测与观测
给 Codex 工人配一个 Jev 监督员。它评估进展,但完成前还必须跑程序员指定的验收命令。
latitude-llm
latitude-dev · 评测与观测
Latitude 的可选 Jev 预分类器为对话检查打分,并记录检查选择的依据。
taskuary
ldbumble · 评测与观测
Taskuary 的可选 Jev 判断模块,对任务运行状态检查用户定义的条件。
jev-gomoku
XieChengYuan · 评测与观测
弈瞬:同时运行九盘 15×15 五子棋,让两位 Jev 玩家比较不同输入信息,并逐手检查请求与返回。
jevcal
abhixhek · 评测与观测
用自己的标注数据评估 Jev 概率、选择置信度阈值,并检查模型更新后的变化。
jev-benchmark
wondertwins · 评测与观测
通过国际象棋和游戏 NPC 对话对象识别,测试 Jev 的选择与判断边界。
jev-frontend-qa
Nainish-Rai · 评测与观测
用 Jev 选择浏览器操作,再通过 DOM、HTTP 和数据库状态检查前端功能是否符合约定。
hermes-jev-north-star
poponline63 · 评测与观测
Hermes 的目标验收 skill,保存要求、生成运行提示词,并检查证据是否满足要求。
jev-synergy-screening
PistachioAIHQ · 评测与观测
用 Jev 筛选 ADHD 综述的论文标题和摘要,并与 Cohen Abstract Triage 标注比较。
jev-exploration
SamuelSacco · 评测与观测
记录 Jev 能力与限制的研究仓库,包含主张审查、概率校准实验和可运行示例。
jev-flash-review
TheBous · 评测与观测
供编码 Agent 调用的 MCP 代码审查引擎,对提交的 diff 按规则给出结构化判断。
supercov
supercorp-ai · 评测与观测
编程 Agent 的代码质量与覆盖率 CLI:Jev 检查源码属性,本地覆盖率工具帮助选择补测目标。
jev-pref
doeixd · 评测与观测
把 AGENTS.md 中的项目偏好整理为规则,再用 Jev 检查 hunk、暂存文件或 PR。
typesafe-playground
kavehmz · 评测与观测
可交互的 Jev 实验集,展示客服工单分流预览和三维驾驶仿真。
goodwatch-monorepo
alp82 · 评测与观测
GoodWatch 仓库内的影视特征评分实验,比较 Jev 对情绪、情节等特征的不同问法和批量方式。
jev-calibration-audit
jujumilk3 · 评测与观测
通过公开 API 和数据测试 Jev 概率校准、选项措辞影响及韩文判断表现。
typesafe-ai-benchmark
iammrduncan · 评测与观测
在共同的应用任务上对照 Jev 与其他结构化输出模型,记录错误、延迟、Token 与估算成本。
Canny
qkal · 评测与观测
为 Claude Code 与 Codex CLI 记录执行账本,检查改动后是否有通过的验证。
jev-behavior-study
RINNECODER · 评测与观测
针对 Jev 1.13.0 的独立行为研究,记录不同问题表述、输入条件及游戏任务下的成功与失败。
jev-eval
4esv · 评测与观测
在有标签的分类任务上比较 Jev 与 OpenRouter 模型的准确率、校准、时延和成本。