dsh-llm-eval
LLM 评估:输出质量评估、幻觉检测、基准测试、回归守护。受 wshobson/agents(38k★ MIT)启发。
AI Analysis
核心用途是评估大语言模型应用的输出质量。适合需要对 LLM 应用进行幻觉检测、基准测试、构建测试集并输出评估报告的算法与工程人员。
Install
$
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:satan9394/dsh-llm-evalREADME
Read the full README ↗使用
对 agent 说"评估这个 LLM 应用 / 检测幻觉",llm-eval 技能输出
评估报告(维度/测试集/通过率/失败模式)。