satan9394/dsh-llm-eval0

dsh-llm-eval

LLM 评估:输出质量评估、幻觉检测、基准测试、回归守护。

AI 分析

核心用途是评估大语言模型应用的输出质量。适合需要对 LLM 应用进行幻觉检测、基准测试、构建测试集并输出评估报告的算法与工程人员。

包名
dsh-llm-eval
版本
0.1.0
许可证
MIT
最近更新
2026年8月19日

安装

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:satan9394/dsh-llm-eval

使用

对 agent 说"评估这个 LLM 应用 / 检测幻觉",llm-eval 技能输出 评估报告(维度/测试集/通过率/失败模式)。