每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

nvidia/skillevaluator

137PythonApache-2.0

给AI智能体装的'技能文件夹'做三级安检,看它安全不安全、有没有帮助

SkillEvaluator是一个开源工具,用来检查给AI智能体扩展能力的技能包,也就是包含说明和文件的文件夹。它分三个层级:先做安全和格式校验,再检测和已有技能是否重复,最后在真实智能体上运行看这个技能是否真的有用。该项目由NVIDIA开发,采用Apache 2.0许可证发布,目前处于实验性、社区支持阶段。

它做什么

  1. 技能是遵循Agent Skills规范的文件夹,里面包含一个SKILL.md说明文件和配套资料,用来给AI智能体扩展新能力
  2. 第一层校验检查文件格式、个人隐私信息(PII)、许可证、质量和安全漏洞,其中多项检查不需要API密钥就能跑
  3. 第二层去重利用嵌入技术(把文字含义转换成数字向量)来衡量新技能和已有技能之间的重叠程度
  4. 第三层实时评测会在Docker、本地或云端沙箱里让真实智能体运行这个技能,观察它对智能体行为的实际影响,还能自动生成测试数据集
  5. 三个层级可以独立运行,并且集成了NVIDIA的安全扫描工具SkillSpector和智能体评测框架Harbor等其他开源项目

为什么重要

随意给AI智能体挂载技能文件夹可能带来隐藏的安全漏洞、个人信息泄露或重复指令拖累表现,因此在上线前需要一套标准化的检查流程。这为编写和分发技能的开发者、运营智能体流水线的团队提供了一个切实可行的质量和安全把关手段。

本仓库术语

  • 技能(Agent Skill) · 遵循规范、包含SKILL.md和配套文件的文件夹,用来给AI智能体扩展新能力
  • 质量关卡(Quality Gate) · 必须通过特定标准才能进入下一步的检查环节
  • 嵌入(Embedding) · 把文字含义转换成数字向量,以便计算相似度的技术
  • 沙箱(Sandbox) · 一个隔离的运行环境,用来安全地执行代码而不影响真实系统
  • PII扫描 · 检查文档中是否包含姓名、地址等可识别个人身份的信息

仓库简介(英文)

Multi-tier framework for evaluating AI agent skills with quality gates, semantic overlap detection, synthetic evaluation dataset generation, and live agent evaluation that measures how skills affect agent behavior.

在 GitHub 打开项目主页

相关报道

热门仓库

全部仓库 →

METAL LAB 最新报道