typesafe-ai-benchmark
iammrduncan
共通のタスクで Jev とほかの構造化出力モデルを比べ、誤り、遅延、Token、推定費用を記録する。
- ライセンス
- MIT
- GitHub Stars
- 32
- ソース確認日
- 2026-09-19
Jev が判断する箇所
同じタスクを Choice/Noul に変換し、回答を共通の結果形式にそろえる。
このプロジェクトの用途
比較手順と結果からモデル間の違いを確認できる。
確認の範囲
固定バージョンの公開ソースを確認済みです。当サイトによる実行、性能測定、安全性監査は行っていません。
ソースと実装
同じカテゴリのプロジェクト
jev-review
NiazMorshed2007 · 評価・可観測性
コーディング Agent に複数の品質スコアを返すローカル MCP レビューサーバー。
jev-benchmarks
AbdelStark · 評価・可観測性
文章分類・確率校正・選択的自動化を Jev と GLiNER で比較するベンチマーク。
jev-playground
mizchi · 評価・可観測性
ゲーム・ブラウザー・コマンドリスク・小型言語を扱う MoonBit / TypeScript の Jev 実験集。
jev-lm
y0usaf · 評価・可観測性
Jev に単語を選ばせ、ローカルで作った続きの文章を検証する生成実験。