Phoenix 智能应用评测
原名:phoenix-evals
使用 Phoenix 为 LLM 应用建立评测器、样本和可重复实验。
中文 Skills 技能说明
适合回答质量、检索和安全策略评估。先定义人工可解释的指标与基线,样本需要授权和脱敏;模型评审结果不能替代人工验收。
上游能力依据
上游原始适用说明:Build and run evaluators for AI/LLM applications using Phoenix.
上游 SKILL.md 主要章节(保留原文标题):
- Quick Reference
- Workflows
- Reference Categories
- Key Principles
使用边界
先读取项目约定、依赖版本和现有测试,再提出最小改动。写文件、运行脚本、提交代码或发布前应检查差异并保留回退路径。
作者、翻译与许可证
- 原作者
- GitHub, Inc. 与 awesome-copilot contributors
- 中文翻译
- CEOFans翻译
- 许可证
- MIT
- 上游来源
- https://github.com/github/awesome-copilot/tree/bbaa5872640e6cbae953beb22a71ae337398ca12/skills/phoenix-evals
适用范围
平台:linux、macos、windows;标签:AI 工程、Phoenix 智能应用评测
安全提示
基础静态扫描不等于绝对安全。技能可能调用命令、浏览器、云服务或本地文件,请在最小权限环境中使用,高风险操作必须人工确认。
如发现侵权、许可证或安全问题,可在本页前台提交投诉,管理员复核后可立即下架。