每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

NVIDIA认证技能300余个,正确率提升41分

NVIDIA公开了在相同任务、相同模型下仅改变是否安装技能所测得的结果

화면과 다양한 역할의 캐릭터 아바타 네 개가 배치된 이미지

이미지: NVIDIA

摘要

  • NVIDIA公开了利用开源工具SkillEvaluator对自家认证的300余个技能、30余款产品进行基准测试的结果
  • 与未安装技能相比,正确率(Correctness)提升41分、目标达成率(Effectiveness)提升39分、效率(Efficiency)提升35分
  • 评估分为静态检查、冗余性分析、隔离沙箱运行三个阶段,技能通过Claude Code、Codex、Cursor插件以及Skills.sh、ClawHub、Hermes Hub进行分发
도구
NVIDIA SkillEvaluator (오픈소스, GitHub 공개)
평가 대상
NVIDIA 인증 스킬 300개 이상, 30여개 제품
Correctness 리프트
베이스라인 46점 → +41점 상승
Effectiveness 리프트
베이스라인 39점 → +39점 상승
Efficiency 리프트
베이스라인 43점 → +35점 상승
Security 베이스라인
97점(스킬 유무 상관없이 회귀 없음 확인이 목적)
실행 프레임워크
Harbor — 격리 샌드박스에서 반복 평가하는 오픈소스 프레임워크
배포 채널
Claude Code·Codex·Cursor 플러그인, Skills.sh, ClawHub, Hermes Hub

同样的问题,同样的模型,唯一不同的是有无技能

根据NVIDIA发布在自家开发者博客上的基准测试结果,让同一模型解答同样的任务两次,唯一改变的变量是是否给智能体安装了"技能"。结果十分明显。答对与否的正确率(Correctness)提升41分,真正达成用户目标的有效性(Effectiveness)提升39分,不走冗余步骤直达目标的效率(Efficiency)提升35分。这是针对300多个认证技能和30余款产品所测得的数值。

"技能"这个词可能有些陌生。NVIDIA认证技能是经过打包并签名的能力说明书,用来告诉智能体某个特定产品能做什么、该在何时调用、该如何调用,相当于一份使用说明书。再好的模型,面对陌生的库时,也容易在寻找合适工具上浪费步骤、耗费token,而技能正是为了减少这种试错而产生的构想。这种轻量级开放格式最早由Anthropic提出,8月初AWS也曾将Bedrock整个策略验证流程打包成技能公开发布。

이미지: X — 인프라·칩

分三阶段筛选

一个技能要公开发布,需要经过三个阶段。第一阶段是安全性与结构检查。确认模式(schema)和前置元数据(frontmatter)格式,扫描是否存在提示注入或数据泄露的可能性,并对密钥、个人信息、许可证、脚本质量进行静态检查。第二阶段是冗余性分析。利用嵌入相似度,筛查技能内部是否重复相同指令,以及整个目录中是否存在重叠的技能。

真正的胜负在第三阶段揭晓。利用开源框架Harbor,在隔离的沙箱中实际运行智能体两次。一次安装了技能,一次未安装。提示词、模型、任务输入、评分标准全部固定相同,仅改变是否安装技能这一项。两次结果之间的差异,就是该技能的贡献度,即"技能提升值(Skill Lift)"。这一对比在两个不同的智能体测试框架中重复进行,以提高可信度。

用数字看效果

以下数值基于2026年8月12日的benchmarks.json快照(提交号738d79e)。未安装技能时,五个评估项目的基准分数如下。

评估项目未安装技能基准分(满分100)安装技能后的提升值
Correctness(是否答对)46+41
Discoverability(需要时能否找到并使用)42未公开具体数值
Effectiveness(是否达成目标)39+39
Efficiency(是否无浪费地达成)43+35
Security(安全性是否回归)97变化甚微

NVIDIA博客还另外指出,全部项目的平均提升值为31分(含Security),若排除Security则为39分。由于推特上强调的41、39、35分与博客的汇总方式不同,这里不将两组数值合并,而是分别按各自出处标注。不过方向是一致的——加上技能后,不仅答对率提高,达成目标的整个过程本身也变好了。

怎么用——如何亲自评估技能

NVIDIA将这一整套测量流程以名为SkillEvaluator的开源工具公开。安装方法和文档都在GitHub仓库中。在发布自己制作的技能之前,可以用同样的方式提前进行检验。

  1. 首先制作用于评估的数据集。命令为skillevaluator create-eval-dataset ./my-skill --full。加上--full选项,会生成不仅包含显式案例,还包含隐式、语境相关及否定案例的evals.json文件。
  2. 检查数据集之后,进行实际对比测试。使用skillevaluator tier3 evaluate ./my-skill --agents codex --env-mode docker命令,分别在安装和未安装技能的情况下运行并评分。
  3. 根据得出的分数和Skill Lift值,确认技能在哪些方面确实起到了帮助,或者反而造成了妨碍。

若想直接使用技能,NVIDIA为Claude CodeCodexCursor提供了插件,完整目录可在github.com/nvidia/skills仓库获取。同一目录也可以从Skills.sh、ClawHub、Hermes Hub下载。原文未另外提及国家或套餐方面的限制。

编辑视角

NVIDIA并非聊天机器人竞赛的参与者,而是卖镐头的一方——这个说法在此次发布中同样适用。只不过这次卖的镐头不是GPU,而是"让智能体正确使用我方产品的说明书"。近期信号层观察到,社区项目Hermes在安装技能时会用SkillEvaluator检查PII、泄露的密钥、Unicode走私手法和许可证问题,虽然这属于未经证实的信息,但与该工具在NVIDIA生态之外也被采用的趋势相吻合。AWS在Bedrock策略验证中加入6种技能,也是同样的方向——如何让智能体掌握工具使用方法,如今已成为各家厂商各自解决的课题。

以往的做法是把整份库文档一股脑丢给智能体,让它自己去摸索使用。这次的数据表明,那种方式按正确率计算,满分100分只能维持在40分左右。这是连及格线一半都不到的成绩单。而仅仅加上一个技能,正确率就能提升到87分左右,这说明问题不在于模型本身的性能,而在于"说明得有多好"。

对于在NVIDIA技术栈之上搭建智能体的国内团队而言,现在就有可以立即着手的事情——在发布自有技能之前,先用SkillEvaluator检查Discoverability和Efficiency分数。Correctness在很大程度上取决于模型本身的能力,但这两项是可以通过技能设计直接改善的领域,投入产出比更快。反之,像已接近97分的Security这类项目再投入精力,则近乎浪费资源。

未来几周内会发生的事情是可以预见的。围绕Anthropic的Agent Skills格式,AWS、NVIDIA、社区中心(Skills.sh、ClawHub、Hermes Hub)各自搭建验证层的竞争将全面展开。一旦技能成为像代码一样被版本管理和基准测试的对象,谁能率先对其进行可信验证,很可能就会成为下一个竞争焦点。

评论