評価・可観測性
29 · 公開ソースと連携ロジックを確認済み。
jev-review
NiazMorshed2007 · 評価・可観測性
コーディング Agent に複数の品質スコアを返すローカル MCP レビューサーバー。
jev-benchmarks
AbdelStark · 評価・可観測性
文章分類・確率校正・選択的自動化を Jev と GLiNER で比較するベンチマーク。
jev-playground
mizchi · 評価・可観測性
ゲーム・ブラウザー・コマンドリスク・小型言語を扱う MoonBit / TypeScript の Jev 実験集。
jev-lm
y0usaf · 評価・可観測性
Jev に単語を選ばせ、ローカルで作った続きの文章を検証する生成実験。
jev-chat
adhyaay-karnwal · 評価・可観測性
Jev に単語や句を繰り返し選ばせ、コードで回答を組み立てる研究用デコーダー。
jev-agent-failure-benchmark
TokenTrim · 評価・可観測性
複数 Agent の失敗記録から責任 Agent・重要ステップ・エラー種別を予測する評価プロジェクト。
ask-jev
omni- · 評価・可観測性
Codex で :jev を使い、記録済みの実行証拠を点検する Windows PowerShell ツール。
jev-rerank-bench
anessbelbati · 評価・可観測性
同じ検索候補で Jev、専用 reranker、チャットモデルの順位付けを比較する。
jev-demos
Bud-ro · 評価・可観測性
迷路で Jev の単一手選択と複数手の先読みを比較する実験。
foreman-jev
Shifty-Eye-Games · 評価・可観測性
プログラマー指定の受入コマンドを備えた、Codex worker 用の Jev 監督実験。
latitude-llm
latitude-dev · 評価・可観測性
Latitude の任意の Jev 事前分類器が、会話検査の判断と選択理由を記録する。
taskuary
ldbumble · 評価・可観測性
Taskuary でタスク状態がユーザー定義条件を満たすか点検する任意の Jev モジュール。
jev-gomoku
XieChengYuan · 評価・可観測性
九つの 15×15 五目並べ盤で、二人の Jev に渡す情報の違いを比較する実験台。
jevcal
abhixhek · 評価・可観測性
ラベル付きデータで Jev の確率・閾値・モデル更新の影響を調べるツール。
jev-benchmark
wondertwins · 評価・可観測性
チェスの手選びと、話し掛けられた NPC の識別で Jev を評価する。
jev-frontend-qa
Nainish-Rai · 評価・可観測性
Jev がブラウザー操作を選び、DOM・HTTP・DB の証拠で仕様を確認するフロントエンド QA。
hermes-jev-north-star
poponline63 · 評価・可観測性
要件を保存し実行プロンプトを作り、完了証拠を点検する Hermes の目標確認 skill。
jev-synergy-screening
PistachioAIHQ · 評価・可観測性
ADHD レビューの題名・抄録を Jev で選別し、Cohen Abstract Triage のラベルと比較する実験。
jev-exploration
SamuelSacco · 評価・可観測性
Jev の主張と限界を記録し、確率校正の実験や実行例を収めた研究リポジトリ。
jev-flash-review
TheBous · 評価・可観測性
Agent が渡す diff を明示ルールで評価する MCP コードレビューエンジン。
supercov
supercorp-ai · 評価・可観測性
Jev によるコード属性確認と、ローカルのカバレッジを組み合わせた Agent 向け CLI。
jev-pref
doeixd · 評価・可観測性
AGENTS.md のプロジェクト方針をルールに整理し、hunk・ステージ済みファイル・PR を Jev で点検する。
typesafe-playground
kavehmz · 評価・可観測性
問い合わせ振り分けのプレビューと3D運転シミュレーションを行う Jev 実験集。
goodwatch-monorepo
alp82 · 評価・可観測性
GoodWatch 内で、映像作品の特徴に対する Jev の質問設計とバッチ量を比較する実験。
jev-calibration-audit
jujumilk3 · 評価・可観測性
公開 API とデータで Jev の確率較正、選択肢表現の影響、韓国語判断を調べる。
typesafe-ai-benchmark
iammrduncan · 評価・可観測性
共通のタスクで Jev とほかの構造化出力モデルを比べ、誤り、遅延、Token、推定費用を記録する。
Canny
qkal · 評価・可観測性
Claude Code / Codex CLI の実行台帳から、変更後に検証が通ったか確認する。
jev-behavior-study
RINNECODER · 評価・可観測性
質問表現・入力条件・ゲーム課題における成功と失敗を記録する Jev 1.13.0 の独立研究。
jev-eval
4esv · 評価・可観測性
正解付き分類課題で Jev と OpenRouter モデルの正確さ、較正、遅延、費用を比較する。