dsh-agent-eval
DSH 插件:评估智能体在定义任务上的表现,支持运行基准测试、结果评分以及跟踪提示词/模型变更后的改进。
AI 分析
核心用途是量化评估智能体任务执行能力。适合需要对智能体进行基准测试、调优提示词或对比模型效果的开发者。
安装
此插件尚未提供可验证的 bundle,或兼容性检查未通过。请先阅读仓库说明。 阅读完整 README ↗
说明文档
阅读完整 README ↗配置
- id: agent-eval
plugin: dsh-agent-eval
config:
fixturesDir: ./eval/tasks
resultsDir: ./eval/results
defaultTimeout: 120000 # 每个任务最长 2 分钟