大模型基准评测
原名:evaluating-llms-harness
使用 lm-eval-harness 对本地或自建模型运行 MMLU、GSM8K 等标准评测。
中文 Skills 技能说明
作者、翻译与许可证
- 原作者
- Orchestra Research
- 中文翻译
- CEOFans翻译
- 许可证
- MIT
- 上游来源
- https://hermes-agent.nousresearch.com/docs/zh-Hans/user-guide/skills/bundled/mlops/mlops-evaluation-evaluating-llms-harness
适用范围
平台:linux、macos;标签:Evaluation、LM Evaluation Harness、Benchmarking、MMLU、HumanEval、GSM8K、EleutherAI、Model Quality、Academic Benchmarks、Industry Standard
安全提示
基础静态扫描不等于绝对安全。技能可能调用命令、浏览器、云服务或本地文件,请在最小权限环境中使用,高风险操作必须人工确认。
如发现侵权、许可证或安全问题,可在本页前台提交投诉,管理员复核后可立即下架。