nvidia/skillevaluator
给AI智能体装的'技能文件夹'做三级安检,看它安全不安全、有没有帮助
SkillEvaluator是一个开源工具,用来检查给AI智能体扩展能力的技能包,也就是包含说明和文件的文件夹。它分三个层级:先做安全和格式校验,再检测和已有技能是否重复,最后在真实智能体上运行看这个技能是否真的有用。该项目由NVIDIA开发,采用Apache 2.0许可证发布,目前处于实验性、社区支持阶段。
- agent-evaluation
- agent-security
- agent-skills
- agentic-ai
- benchmark
- claude-code
- codex
- evaluate
- evaluation
- security-scanner
- skill-eval
- skill-evals
它做什么
- 技能是遵循Agent Skills规范的文件夹,里面包含一个SKILL.md说明文件和配套资料,用来给AI智能体扩展新能力
- 第一层校验检查文件格式、个人隐私信息(PII)、许可证、质量和安全漏洞,其中多项检查不需要API密钥就能跑
- 第二层去重利用嵌入技术(把文字含义转换成数字向量)来衡量新技能和已有技能之间的重叠程度
- 第三层实时评测会在Docker、本地或云端沙箱里让真实智能体运行这个技能,观察它对智能体行为的实际影响,还能自动生成测试数据集
- 三个层级可以独立运行,并且集成了NVIDIA的安全扫描工具SkillSpector和智能体评测框架Harbor等其他开源项目
为什么重要
随意给AI智能体挂载技能文件夹可能带来隐藏的安全漏洞、个人信息泄露或重复指令拖累表现,因此在上线前需要一套标准化的检查流程。这为编写和分发技能的开发者、运营智能体流水线的团队提供了一个切实可行的质量和安全把关手段。
本仓库术语
- 技能(Agent Skill) · 遵循规范、包含SKILL.md和配套文件的文件夹,用来给AI智能体扩展新能力
- 质量关卡(Quality Gate) · 必须通过特定标准才能进入下一步的检查环节
- 嵌入(Embedding) · 把文字含义转换成数字向量,以便计算相似度的技术
- 沙箱(Sandbox) · 一个隔离的运行环境,用来安全地执行代码而不影响真实系统
- PII扫描 · 检查文档中是否包含姓名、地址等可识别个人身份的信息
仓库简介(英文)
Multi-tier framework for evaluating AI agent skills with quality gates, semantic overlap detection, synthetic evaluation dataset generation, and live agent evaluation that measures how skills affect agent behavior.
在 GitHub 打开项目主页相关报道
热门仓库
- cathrynlavery/diagram-design让AI编程工具画出杂志排版质感图表,而不是千篇一律的圆角方框
- public-apis/public-apis一份由社区维护的免费API大全仓库
- semantica-agi/semantica一个让AI智能体的决策可追溯、可审计的开源图谱基础设施
- cactus-compute/needle一个14MB的AI模型,让手机和可穿戴设备无需联网就能调用工具
- unslothai/unsloth一款让你在自己电脑上运行和训练AI模型的桌面应用,无需写代码
- macro-inc/macro把邮件、聊天、文档、任务和CRM互相链接、共享同一份AI团队记忆的一体化办公平台
- harry0703/MoneyPrinterTurbo只需一个主题或关键词,就能自动生成配好文案、素材、字幕和音乐的完整短视频的开源工具
- basecamp/omarchyDHH打造的、开箱即用且风格统一的Linux发行版