AI Agent 效果评测

原名:agentic-eval

用量化指标、评分规则和迭代样本评估智能体输出质量。

中文 Skills 技能说明

适合需要比较提示词、模型或工作流版本的场景。先定义任务、基线、通过标准和人工复核样本,再执行评测;客户数据必须脱敏并获得授权,自动评分不能代替业务验收。

上游能力依据

上游原始适用说明:Patterns and techniques for evaluating and improving AI agent outputs. Use this skill when: - Implementing self-critique and reflection loops - Building evaluator-optimizer pipelines for quality-critical generation - Creating test-driven code refinement workflows - Designing rubric-based or LLM-as-judge evaluation systems - Adding iterative improvement to agent outputs (code, reports, analysis) - Measuring and improving agent response quality

上游 SKILL.md 主要章节(保留原文标题):

使用边界

先读取项目约定、依赖版本和现有测试,再提出最小改动。写文件、运行脚本、提交代码或发布前应检查差异并保留回退路径。

作者、翻译与许可证

原作者
GitHub, Inc. 与 awesome-copilot contributors
中文翻译
CEOFans翻译
许可证
MIT
上游来源
https://github.com/github/awesome-copilot/tree/3f0bba475ec40b9680e1d0311b9caffeec5ad4c3/skills/agentic-eval

适用范围

平台:linux、macos、windows;标签:AI 工程、AI Agent 效果评测

安全提示

基础静态扫描不等于绝对安全。技能可能调用命令、浏览器、云服务或本地文件,请在最小权限环境中使用,高风险操作必须人工确认。

如发现侵权、许可证或安全问题,可在本页前台提交投诉,管理员复核后可立即下架。