自监督基础模型
Self-supervised Foundation Model
在没有标注的原始数据中自行发现规律进行学习,之后可广泛应用于多种任务的底层模型。
简单来说
自监督基础模型指的是,不靠老师批改过的习题册,而是自己制造问题和答案来练习提升,练成之后再把这份底层能力用到其他各种考试上。
打个比方。通常学习靠的是有人事先标好「这道题的答案是这个」的习题册。但这种标注工作,也就是打标签,需要耗费大量人力和成本。自监督方式则不需要这些标签,而是反复练习去猜测数据本身前后之间的关系,或者把被遮住的部分补出来,从中培养出感觉。比如,把血糖信号一整天连续排列出来,只让模型练习填补中间空缺的部分,模型也能自行掌握体内代谢模式是如何变化的。
这样培养出来的感觉不局限于某一个问题,而是能被重复用在多种任务上,所以才被称为基础(foundation)模型。谷歌研究团队推出的GlucoFM就是一个例子。它没有使用带标注的临床数据,仅凭血糖仪的原始信号进行学习,却在糖尿病风险、胰岛素抵抗等多个不同的预测任务上表现优于现有模型。
在报道中是这样出现的
文章用「没有标注的临床数据,仅靠原始血糖信号学习」这样的表述来说明这一概念。容易被误解的一点是,自监督学习并不意味着「毫无标准地随意学习」。实际上,模型是在数据内部自行制造出相当于答案的部分(比如填补空缺)来进行学习的,因此只是缺少人工标签而已,学习过程本身依然是系统性的。
亲手试一试
可以这样问聊天机器人来找找感觉:
「用小学生也能理解的比喻,解释一下监督学习和自监督学习的区别」
「举例说明一下,为什么基础模型只需做一个,却能用于多种不同的用途」
