评测驱动开发

原名:eval-driven-dev

用明确样本和可重复评测推动 AI 功能或复杂逻辑迭代。

中文 Skills 技能说明

适合输出质量不能只靠单元测试判断的系统。先建立基线、数据集和评分规则,再比较版本;评测数据需要授权和脱敏,不能为了提高分数污染测试集或隐瞒退化指标。

上游能力依据

上游原始适用说明:Improve AI application with evaluation-driven development. Define eval criteria, instrument the application, build golden datasets, observe and evaluate application runs, analyze results, and produce a concrete action plan for improvements. ALWAYS USE THIS SKILL when the user asks to set up QA, add tests, add evals, evaluate, benchmark, fix wrong behaviors, improve quality, or do quality assurance for any Python project that calls an LLM model.

上游 SKILL.md 主要章节(保留原文标题):

使用边界

先复现问题并固定测试范围,再生成或执行测试。测试通过只能证明已覆盖的场景,不能代替生产环境验收。

作者、翻译与许可证

原作者
GitHub, Inc. 与 awesome-copilot contributors
中文翻译
CEOFans翻译
许可证
MIT
上游来源
https://github.com/github/awesome-copilot/tree/3f0bba475ec40b9680e1d0311b9caffeec5ad4c3/skills/eval-driven-dev

适用范围

平台:linux、macos、windows;标签:测试与质量、评测驱动开发

安全提示

基础静态扫描不等于绝对安全。技能可能调用命令、浏览器、云服务或本地文件,请在最小权限环境中使用,高风险操作必须人工确认。

如发现侵权、许可证或安全问题,可在本页前台提交投诉,管理员复核后可立即下架。