dsh-agent-eval
DSH 插件:评估智能体在定义任务上的表现,支持运行基准测试、结果评分以及跟踪提示词/模型变更后的改进。
AI 分析
核心用途是量化评估智能体任务执行能力。适合需要对智能体进行基准测试、调优提示词或对比模型效果的开发者。
安裝
此插件尚未提供可驗證的 bundle,或相容性檢查未通過。請先閱讀倉庫說明。 閱讀完整 README ↗
說明文件
閱讀完整 README ↗配置
- id: agent-eval
plugin: dsh-agent-eval
config:
fixturesDir: ./eval/tasks
resultsDir: ./eval/results
defaultTimeout: 120000 # 每个任务最长 2 分钟