什么是自监督学习?
自监督学习(Self-Supervised Learning, SSL)是一种不需要人工标注数据就能训练的机器学习方法。它的核心思想是:利用数据本身的结构来生成"伪标签"——模型通过预测数据的某一部分来学习数据的深层表示。
自监督学习的工作原理
掩码语言模型:BERT 使用的方法——随机遮住句子中的一些词,让模型预测被遮住的是什么词。对比学习:让模型学会区分"相似"和"不相似"的样本对。自回归预测:GPT 使用的方法——预测序列中的下一个词。
为什么自监督学习如此重要?
互联网上存在海量的无标注数据,自监督学习让这些数据可以被利用起来。自监督学习训练出的模型学到了数据的通用特征,可以在各种下游任务上微调使用。GPT 和 BERT 的成功证明了自监督学习的巨大潜力。