每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

AI 术语词典报道中常见的技术词

分类器

Classifier

一种AI程序,能自动把输入内容归入几个预设类别中的一个。

简单来说

分类器就像一个自动分拣员,把送来的东西放进几个箱子中的一个。就像邮局工作人员看一眼信封,就分成'国内邮件'和'国际邮件'一样,分类器会看一段文字或一条指令,判断它是'人类写的'还是'AI写的',又或者是'安全指令'还是'危险指令'。

重要的是,分类器并不是确切地知道答案,而是在做概率性的猜测。它通过学习大量样本掌握了模式,遇到新的输入时,会判断'这个跟某种模式相似,所以放进这个箱子',因此有时也会判断失误。正因如此,分类器通常不会被单独依赖,而是和人工核查或其他安全机制配合使用。

如今,分类器出现在两种相反的场景中。一种是充当把关人,过滤掉AI草率生成的内容;另一种是充当刹车,在AI程序自行执行危险指令之前先加以阻止。两者本质上是同一个原理:判断'通过'还是'拦下'。

在报道中是这样出现的

在报道中,分类器以两种相反的用途出现。领英(LinkedIn)宣布将用于过滤AI生成帖子的分类器升级为'全新改进版',而Claude Code则用分类器取代了此前需要人工每次审批的流程,自动筛查并拦截危险指令。容易被误解的一点是:分类器并不像人一样做出完美判断,而是根据模式进行概率性的猜测。在Claude Code的案例中,危险指令的检测率为89%,这也意味着剩下的11%有可能被漏掉。

亲手试一试

你可以亲自让聊天机器人扮演分类器的角色试试看。

  1. 向任意一个对话式AI这样提问:'请把下面这五句话分别归类为正面、负面或中立:(列出这些句子)'。
  2. 查看AI给每句话贴上的标签。
  3. 挑一句比较模糊的句子,问它:'你为什么给它贴这个标签?'借此可以推测分类器是依据什么线索选择了这个箱子。
  4. 用几乎相同意思但措辞略有不同的句子再问一次,分类结果有时会发生变化。这能让你切身体会到分类器是在依据概率做判断。

相关词条

出现过这个词的报道

浏览全部词条