大模型基准评测

原名:evaluating-llms-harness

使用 lm-eval-harness 对本地或自建模型运行 MMLU、GSM8K 等标准评测。

中文 Skills 技能说明

适合比较模型版本、量化方案和推理服务的真实表现。技能支持本地与自建端点,也可按需接入第三方接口;评测结果要注明模型版本、参数、样本和硬件条件,不能把单一分数包装成全面能力。

上游能力依据

上游原始适用说明:lm-eval-harness: benchmark LLMs (MMLU, GSM8K, etc.).

上游 SKILL.md 主要章节(保留原文标题):

使用边界

先读取项目约定、依赖版本和现有测试,再提出最小改动。写文件、运行脚本、提交代码或发布前应检查差异并保留回退路径。

作者、翻译与许可证

原作者
Orchestra Research
中文翻译
CEOFans翻译
许可证
MIT
上游来源
https://hermes-agent.nousresearch.com/docs/zh-Hans/user-guide/skills/bundled/mlops/mlops-evaluation-evaluating-llms-harness

适用范围

平台:linux、macos;标签:Evaluation、LM Evaluation Harness、Benchmarking、MMLU、HumanEval、GSM8K、EleutherAI、Model Quality、Academic Benchmarks、Industry Standard

安全提示

基础静态扫描不等于绝对安全。技能可能调用命令、浏览器、云服务或本地文件,请在最小权限环境中使用,高风险操作必须人工确认。

如发现侵权、许可证或安全问题,可在本页前台提交投诉,管理员复核后可立即下架。