satan9394/dsh-llm-eval0

dsh-llm-eval

LLM 评估:输出质量评估、幻觉检测、基准测试、回归守护。受 wshobson/agents(38k★ MIT)启发。

AI 분석

核心用途是评估大语言模型应用的输出质量。适合需要对 LLM 应用进行幻觉检测、基准测试、构建测试集并输出评估报告的算法与工程人员。

패키지
dsh-llm-eval
버전
0.1.0
라이선스
MIT
최근 업데이트
2026. 8. 19.

설치

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:satan9394/dsh-llm-eval

使用

对 agent 说"评估这个 LLM 应用 / 检测幻觉",llm-eval 技能输出 评估报告(维度/测试集/通过率/失败模式)。