分类器
Classifier
一种能把输入内容自动归入几个预设类别之一的AI程序。
简单来说
分类器就像一个自动分拣员,把送进来的东西放进几个箱子中的一个。就像邮局工作人员看一眼信封,就能麻利地分成'国内邮件'和'国际邮件'一样,分类器会看一段文字或一条指令,判断'这是人写的'还是'这是AI写的',或者'这条指令安全'还是'这条指令危险'。
重要的是,分类器并非确切地知道答案,而是靠概率来猜测。它先看过大量例子学会规律,遇到新的输入时,就判断'这个和那个模式相似,放进这个箱子里',所以偶尔也会判断失误。因此,人们通常不会只依赖一个分类器,而是配合人工确认或其他安全机制一起使用。
如今分类器被用在两种相反的场景里。一种是把关角色,用来过滤AI草率生成的内容;另一种是刹车角色,在AI程序自行执行危险指令之前先拦下来。两者原理相同,都是在判断'放行'还是'拦停'。
在报道中是这样出现的
新闻中,分类器常以两种相反的用途出现。领英(LinkedIn)宣布将过滤AI撰写帖子的分类器升级为'全新改进版';而Claude Code则用分类器取代了原本需要人工逐次批准的流程,自动筛掉危险指令。容易被误解的一点是,分类器并不像人一样做出完美判断,而是根据模式进行概率性猜测。在Claude Code的案例中,89%的危险指令检测率也就意味着剩下的11%有可能被漏掉。
亲手试一试
你可以亲自让聊天机器人扮演一次分类器。
- 向任意一个对话式AI提出类似请求:'请把下面五个句子分别归类为正面、负面或中性:(列出句子)'
- 查看AI给每个句子贴上的标签。
- 挑一个含糊不清的句子,问它'你为什么给出这个标签?' 借此猜测分类器是依据什么线索选择了这个箱子。
- 把同一个句子稍微换一种说法再问一次,分类结果有时会不一样。这能让你切身体会到,分类器做出的是概率性判断,而不是确定无疑的答案。
