jev-agent-failure-benchmark
TokenTrim
複数 Agent の失敗記録から責任 Agent・重要ステップ・エラー種別を予測する評価プロジェクト。
- ライセンス
- Apache-2.0
- GitHub Stars
- 1
- ソース確認日
- 2026-09-19
Jev が判断する箇所
記録から候補集合を作り、Jev に三つの choice 質問を送る。
このプロジェクトの用途
評価スクリプトと作者結果を公開。一部ベースラインの自由生成と候補選択では条件が異なる。
確認の範囲
固定バージョンの公開ソースを確認済みです。当サイトによる実行、性能測定、安全性監査は行っていません。
ソースと実装
同じカテゴリのプロジェクト
jev-review
NiazMorshed2007 · 評価・可観測性
コーディング Agent に複数の品質スコアを返すローカル MCP レビューサーバー。
jev-benchmarks
AbdelStark · 評価・可観測性
文章分類・確率校正・選択的自動化を Jev と GLiNER で比較するベンチマーク。
jev-playground
mizchi · 評価・可観測性
ゲーム・ブラウザー・コマンドリスク・小型言語を扱う MoonBit / TypeScript の Jev 実験集。
jev-lm
y0usaf · 評価・可観測性
Jev に単語を選ばせ、ローカルで作った続きの文章を検証する生成実験。