
이미지: NVIDIA
摘要
- NVIDIA公开了利用开源工具SkillEvaluator对自家认证的300余个技能、30余款产品进行基准测试的结果
- 与未安装技能相比,正确率(Correctness)提升41分、目标达成率(Effectiveness)提升39分、效率(Efficiency)提升35分
- 评估分为静态检查、冗余性分析、隔离沙箱运行三个阶段,技能通过Claude Code、Codex、Cursor插件以及Skills.sh、ClawHub、Hermes Hub进行分发
- 도구
- NVIDIA SkillEvaluator (오픈소스, GitHub 공개)
- 평가 대상
- NVIDIA 인증 스킬 300개 이상, 30여개 제품
- Correctness 리프트
- 베이스라인 46점 → +41점 상승
- Effectiveness 리프트
- 베이스라인 39점 → +39점 상승
- Efficiency 리프트
- 베이스라인 43점 → +35점 상승
- Security 베이스라인
- 97점(스킬 유무 상관없이 회귀 없음 확인이 목적)
- 실행 프레임워크
- Harbor — 격리 샌드박스에서 반복 평가하는 오픈소스 프레임워크
- 배포 채널
- Claude Code·Codex·Cursor 플러그인, Skills.sh, ClawHub, Hermes Hub
同样的问题,同样的模型,唯一不同的是有无技能
根据NVIDIA发布在自家开发者博客上的基准测试结果,让同一模型解答同样的任务两次,唯一改变的变量是是否给智能体安装了"技能"。结果十分明显。答对与否的正确率(Correctness)提升41分,真正达成用户目标的有效性(Effectiveness)提升39分,不走冗余步骤直达目标的效率(Efficiency)提升35分。这是针对300多个认证技能和30余款产品所测得的数值。
"技能"这个词可能有些陌生。NVIDIA认证技能是经过打包并签名的能力说明书,用来告诉智能体某个特定产品能做什么、该在何时调用、该如何调用,相当于一份使用说明书。再好的模型,面对陌生的库时,也容易在寻找合适工具上浪费步骤、耗费token,而技能正是为了减少这种试错而产生的构想。这种轻量级开放格式最早由Anthropic提出,8月初AWS也曾将Bedrock整个策略验证流程打包成技能公开发布。

分三阶段筛选
一个技能要公开发布,需要经过三个阶段。第一阶段是安全性与结构检查。确认模式(schema)和前置元数据(frontmatter)格式,扫描是否存在提示注入或数据泄露的可能性,并对密钥、个人信息、许可证、脚本质量进行静态检查。第二阶段是冗余性分析。利用嵌入相似度,筛查技能内部是否重复相同指令,以及整个目录中是否存在重叠的技能。
真正的胜负在第三阶段揭晓。利用开源框架Harbor,在隔离的沙箱中实际运行智能体两次。一次安装了技能,一次未安装。提示词、模型、任务输入、评分标准全部固定相同,仅改变是否安装技能这一项。两次结果之间的差异,就是该技能的贡献度,即"技能提升值(Skill Lift)"。这一对比在两个不同的智能体测试框架中重复进行,以提高可信度。
用数字看效果
以下数值基于2026年8月12日的benchmarks.json快照(提交号738d79e)。未安装技能时,五个评估项目的基准分数如下。
| 评估项目 | 未安装技能基准分(满分100) | 安装技能后的提升值 |
|---|---|---|
| Correctness(是否答对) | 46 | +41 |
| Discoverability(需要时能否找到并使用) | 42 | 未公开具体数值 |
| Effectiveness(是否达成目标) | 39 | +39 |
| Efficiency(是否无浪费地达成) | 43 | +35 |
| Security(安全性是否回归) | 97 | 变化甚微 |
NVIDIA博客还另外指出,全部项目的平均提升值为31分(含Security),若排除Security则为39分。由于推特上强调的41、39、35分与博客的汇总方式不同,这里不将两组数值合并,而是分别按各自出处标注。不过方向是一致的——加上技能后,不仅答对率提高,达成目标的整个过程本身也变好了。
怎么用——如何亲自评估技能
NVIDIA将这一整套测量流程以名为SkillEvaluator的开源工具公开。安装方法和文档都在GitHub仓库中。在发布自己制作的技能之前,可以用同样的方式提前进行检验。
- 首先制作用于评估的数据集。命令为
skillevaluator create-eval-dataset ./my-skill --full。加上--full选项,会生成不仅包含显式案例,还包含隐式、语境相关及否定案例的evals.json文件。 - 检查数据集之后,进行实际对比测试。使用
skillevaluator tier3 evaluate ./my-skill --agents codex --env-mode docker命令,分别在安装和未安装技能的情况下运行并评分。 - 根据得出的分数和Skill Lift值,确认技能在哪些方面确实起到了帮助,或者反而造成了妨碍。
若想直接使用技能,NVIDIA为Claude Code、Codex、Cursor提供了插件,完整目录可在github.com/nvidia/skills仓库获取。同一目录也可以从Skills.sh、ClawHub、Hermes Hub下载。原文未另外提及国家或套餐方面的限制。
编辑视角
NVIDIA并非聊天机器人竞赛的参与者,而是卖镐头的一方——这个说法在此次发布中同样适用。只不过这次卖的镐头不是GPU,而是"让智能体正确使用我方产品的说明书"。近期信号层观察到,社区项目Hermes在安装技能时会用SkillEvaluator检查PII、泄露的密钥、Unicode走私手法和许可证问题,虽然这属于未经证实的信息,但与该工具在NVIDIA生态之外也被采用的趋势相吻合。AWS在Bedrock策略验证中加入6种技能,也是同样的方向——如何让智能体掌握工具使用方法,如今已成为各家厂商各自解决的课题。
以往的做法是把整份库文档一股脑丢给智能体,让它自己去摸索使用。这次的数据表明,那种方式按正确率计算,满分100分只能维持在40分左右。这是连及格线一半都不到的成绩单。而仅仅加上一个技能,正确率就能提升到87分左右,这说明问题不在于模型本身的性能,而在于"说明得有多好"。
对于在NVIDIA技术栈之上搭建智能体的国内团队而言,现在就有可以立即着手的事情——在发布自有技能之前,先用SkillEvaluator检查Discoverability和Efficiency分数。Correctness在很大程度上取决于模型本身的能力,但这两项是可以通过技能设计直接改善的领域,投入产出比更快。反之,像已接近97分的Security这类项目再投入精力,则近乎浪费资源。
未来几周内会发生的事情是可以预见的。围绕Anthropic的Agent Skills格式,AWS、NVIDIA、社区中心(Skills.sh、ClawHub、Hermes Hub)各自搭建验证层的竞争将全面展开。一旦技能成为像代码一样被版本管理和基准测试的对象,谁能率先对其进行可信验证,很可能就会成为下一个竞争焦点。




评论