首页 / Skills 目录 / 精选索引 / evaluating-llms-harness
OpenRaiser / NanoResearch

evaluating-llms-harness

Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting academic results, or tracking training progress. Industry standard used by Eleu…

core - 许可证明确许可证 MIT需人工复核1356 Stars更新 2026-05-26
  • A许可证宽松许可证,通常可商用
  • C维护半年内更新过
  • C安全命中需复核规则
仓库
OpenRaiser/NanoResearch
目录
skills/vendor-ai-research/lm-evaluation-harness
质量分
72.00
安全规则命中
1 项,使用前请阅读 SKILL.md

打开 Skill 目录 查看 SKILL.md 原文 在目录中搜索

安装到你的 Agent

命令默认装到 ~/.claude/skills/(Claude Code 全局目录)。Codex / Cursor 等其他 Agent 请换成它们各自的 skills 目录;只对当前项目生效时改成 .claude/skills/。运行前请先看一眼下面的安全体检。

只装 SKILL.md(最快)
mkdir -p ~/.claude/skills/evaluating-llms-harness && curl -fsSL https://raw.githubusercontent.com/OpenRaiser/NanoResearch/7144364564cc2a9fe22e49fbff94eca058b5a75b/skills/vendor-ai-research/lm-evaluation-harness/SKILL.md -o ~/.claude/skills/evaluating-llms-harness/SKILL.md
连同附件一起装(推荐)
git clone --depth 1 --filter=blob:none --sparse https://github.com/OpenRaiser/NanoResearch /tmp/evaluating-llms-harness-src && git -C /tmp/evaluating-llms-harness-src sparse-checkout set skills/vendor-ai-research/lm-evaluation-harness && cp -r /tmp/evaluating-llms-harness-src/skills/vendor-ai-research/lm-evaluation-harness ~/.claude/skills/evaluating-llms-harness

在本页阅读 SKILL.md

原文实时取自 GitHub(按提交哈希锁定的版本)。命中安全规则的行会被标红,并附中文解释。

安全体检报告

需人工复核 命中 1 条安全规则,许可证判定:宽松许可证。

  • 执行代码会在你的机器上运行脚本或命令。code_execution

许可证:MIT · 通常可商用,保留版权声明即可。 · 重复收录:全网发现 3 份几乎相同的副本,请优先选择原仓库。

评估基于对公开 SKILL.md 的自动扫描,不替代人工审阅,也不构成法律建议。

本站只保存元数据与外链,不转存 SKILL.md 正文。引用或商用前请自行确认上游许可证与权限边界。数据快照来自公开仓库,可能滞后于上游。