jev-agent-failure-benchmark
TokenTrim
다중 Agent 실패 기록에서 책임 Agent·핵심 단계·오류 유형을 예측하는 평가 프로젝트.
- 라이선스
- Apache-2.0
- GitHub Stars
- 1
- 소스 확인일
- 2026-09-19
Jev가 판단하는 지점
기록에서 후보 집합을 만들고 Jev에 세 가지 choice 질문을 보낸다.
프로젝트의 용도
평가 코드와 저자 결과를 제공하나 일부 기준 모델의 자유 생성과 후보 선택은 조건이 다르다.
검토 범위
고정 버전의 공개 소스를 확인했습니다. 이 사이트에서 직접 실행하거나 성능을 측정하거나 보안을 감사하지는 않았습니다.
소스 및 구현
같은 분류의 프로젝트
jev-review
NiazMorshed2007 · 평가 및 관측성
코딩 Agent에 여러 품질 점수를 반환하는 로컬 MCP 코드 리뷰 서버.
jev-benchmarks
AbdelStark · 평가 및 관측성
텍스트 분류·확률 보정·선별적 자동화를 Jev와 GLiNER로 비교하는 벤치마크.
jev-playground
mizchi · 평가 및 관측성
게임·브라우저·명령 위험·소형 언어를 다루는 MoonBit·TypeScript Jev 실험 모음.
jev-lm
y0usaf · 평가 및 관측성
Jev가 단어를 선택하고 로컬에서 만든 후속 문장을 검증하는 생성 실험.