AI Agent 效果评测
原名:agentic-eval
用量化指标、评分规则和迭代样本评估智能体输出质量。
中文 Skills 技能说明
适合需要比较提示词、模型或工作流版本的场景。先定义任务、基线、通过标准和人工复核样本,再执行评测;客户数据必须脱敏并获得授权,自动评分不能代替业务验收。
上游能力依据
上游原始适用说明:Patterns and techniques for evaluating and improving AI agent outputs. Use this skill when: - Implementing self-critique and reflection loops - Building evaluator-optimizer pipelines for quality-critical generation - Creating test-driven code refinement workflows - Designing rubric-based or LLM-as-judge evaluation systems - Adding iterative improvement to agent outputs (code, reports, analysis) - Measuring and improving agent response quality
上游 SKILL.md 主要章节(保留原文标题):
- Overview
- When to Use
- Pattern 1: Basic Reflection
- Pattern 2: Evaluator-Optimizer
- Pattern 3: Code-Specific Reflection
- Evaluation Strategies
- Outcome-Based
- LLM-as-Judge
- Rubric-Based
- Best Practices
使用边界
先读取项目约定、依赖版本和现有测试,再提出最小改动。写文件、运行脚本、提交代码或发布前应检查差异并保留回退路径。
作者、翻译与许可证
- 原作者
- GitHub, Inc. 与 awesome-copilot contributors
- 中文翻译
- CEOFans翻译
- 许可证
- MIT
- 上游来源
- https://github.com/github/awesome-copilot/tree/3f0bba475ec40b9680e1d0311b9caffeec5ad4c3/skills/agentic-eval
适用范围
平台:linux、macos、windows;标签:AI 工程、AI Agent 效果评测
安全提示
基础静态扫描不等于绝对安全。技能可能调用命令、浏览器、云服务或本地文件,请在最小权限环境中使用,高风险操作必须人工确认。
如发现侵权、许可证或安全问题,可在本页前台提交投诉,管理员复核后可立即下架。