evaluating-llms-harness
Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting academic results, or tracking training progress. Industry standard used by Eleu…
core - 许可证明确许可证 MIT需人工复核1356 Stars更新 2026-05-26
- A许可证宽松许可证,通常可商用
- C维护半年内更新过
- C安全命中需复核规则
- 目录
skills/vendor-ai-research/lm-evaluation-harness- 质量分
- 72.00
- 安全规则命中
- 1 项,使用前请阅读 SKILL.md
打开 Skill 目录 查看 SKILL.md 原文 在目录中搜索
安装到你的 Agent
命令默认装到 ~/.claude/skills/(Claude Code 全局目录)。Codex / Cursor 等其他 Agent 请换成它们各自的 skills 目录;只对当前项目生效时改成 .claude/skills/。运行前请先看一眼下面的安全体检。
只装 SKILL.md(最快)
mkdir -p ~/.claude/skills/evaluating-llms-harness && curl -fsSL https://raw.githubusercontent.com/OpenRaiser/NanoResearch/7144364564cc2a9fe22e49fbff94eca058b5a75b/skills/vendor-ai-research/lm-evaluation-harness/SKILL.md -o ~/.claude/skills/evaluating-llms-harness/SKILL.md连同附件一起装(推荐)
git clone --depth 1 --filter=blob:none --sparse https://github.com/OpenRaiser/NanoResearch /tmp/evaluating-llms-harness-src && git -C /tmp/evaluating-llms-harness-src sparse-checkout set skills/vendor-ai-research/lm-evaluation-harness && cp -r /tmp/evaluating-llms-harness-src/skills/vendor-ai-research/lm-evaluation-harness ~/.claude/skills/evaluating-llms-harness在本页阅读 SKILL.md
原文实时取自 GitHub(按提交哈希锁定的版本)。命中安全规则的行会被标红,并附中文解释。
安全体检报告
需人工复核 命中 1 条安全规则,许可证判定:宽松许可证。
- 执行代码会在你的机器上运行脚本或命令。
code_execution
许可证:MIT · 通常可商用,保留版权声明即可。 · 重复收录:全网发现 3 份几乎相同的副本,请优先选择原仓库。
评估基于对公开 SKILL.md 的自动扫描,不替代人工审阅,也不构成法律建议。
本站只保存元数据与外链,不转存 SKILL.md 正文。引用或商用前请自行确认上游许可证与权限边界。数据快照来自公开仓库,可能滞后于上游。