实验室已经积累了许多图像、曲线或序列,真正经过专家确认类别、测量目标性质的样本却只有一部分。想用人工智能解决科研问题,标注工作常常成为起步时的一道门槛。
这些尚未标注的数据,也可以参与模型训练。曲线前后的变化、序列内部的关联、图像局部与整体的关系,都能用来设计学习任务。
一种值得尝试的路径是:先让模型从数据自身学习表示,再用有标签样本把这些表示用于具体任务。 从一条光变曲线出发,就可以理解领域基座模型背后的这一训练思路。
01曲线自身的前后关系可以提供训练目标
光变曲线记录天体亮度的变化。假如希望根据曲线判断天体类别,直接开展监督训练,就需要将每条曲线与对应类别配对。
现在换一个训练任务:给模型看曲线前面的一段,请它预测后续片段。
真实的后续数据已经存在,可以直接用来检查预测结果。模型比较预测值与实际值,计算误差,再通过训练调整参数。这个过程使用的是曲线本身提供的信息。
这就是自监督学习的一种形式。训练目标从数据内部构造,因而可以利用缺少人工类别标注的样本。
语言模型的“预测下一个 token”也提供了类似直觉。Token 是模型处理的基本单元,文本中的 token 可以对应字、词或词的一部分。通过预测接下来的内容,模型学习上下文中的关联。科学序列同样可以设计这样的预测任务。
02科学数据的表示需要保留其结构
要让模型处理曲线,需要先确定模型每一步读取什么。
一种做法是把连续数值划分成片段,再将每个片段编码为向量。模型按顺序读取这些向量,学习片段内部及片段之间的关系。这里的“表示”,就是模型用于处理数据特征的数值编码。
李瑀旸在磐石·科学智能实训营中采用的光变教学实例,将一条包含 1024 个数值的曲线切成 32 段,每段包含 32 个连续数值,再用小型因果 Transformer 学习预测后续片段。输入保留了原有顺序。光变课堂说明
片段化也是时间序列研究中的一种表示方法。PatchTST 将时间序列片段作为 Transformer 的输入单元,并研究了自监督预训练与后续任务适配。PatchTST 论文
不同科学数据需要保留的结构各有侧重。蛋白质序列具有氨基酸顺序,晶体包含几何关系,气象数据同时包含时间与空间信息。设计输入时,需要先明确哪些关系对研究问题重要,再选择相应的编码方式。
03预训练得到的表示可以继续用于分类
经过序列预测训练,模型形成了处理曲线的内部表示。下一步,可以将这些表示连接到分类输出,再用带有类别标签的曲线继续训练。
两个阶段的分工由此清晰起来:预训练利用序列关系学习表示;分类训练建立表示与类别之间的对应关系。第二阶段根据目标任务调整模型参数,属于微调。
在资源有限的情况下,可以先运行一个小模型,观察片段预测如何变化,再比较微调后的分类表现。通过实际输入、输出和训练记录,理解两个阶段怎样衔接。
课堂实例使用的是带有现成类别标签的公开数据:预训练阶段只读取曲线,分类阶段再使用标签。若要研究自己课题中的少标签问题,还需要设定可用标签数量,在相同数据划分下比较直接分类与预训练后分类。光变课堂说明
这样的对照可以回答一个具体问题:在当前数据和资源条件下,预训练学到的表示,给目标任务带来了多少帮助?
04领域基座模型的价值来自表示的重复使用
沿着这条路径继续发展,可以进一步研究:同一套预训练表示,能否服务于更多任务?
例如,一个模型从较广泛的领域数据中学习表示,随后分别适配分类、参数估计或预测。新增任务时,研究者可以利用已有表示,并根据任务特点设计输出和训练方式。
基座模型的概念,强调在广泛数据上训练、再适配多种下游任务的基础作用。基座模型研究报告
因此,从一个小规模预训练实验走向领域基座模型,还需要扩大数据覆盖范围,检验表示在不同任务中的适用性,并考察面对新样本、新条件时的表现。
这也让长期积累的科学数据有了另一种利用方式:已有数据可以参与训练,为后来出现的研究任务提供经过学习的表示。它们是否有用、适用于哪些任务,可以通过持续的实验逐步确定。
05第一个实验可以围绕自己的数据逐步展开
准备动手时,可以先明确三个问题。
手里有什么数据? 写清一条样本包含哪些字段、如何排列、测量条件是什么,以及是否存在缺失值。以课程中的 StarLightCurves 为例,横轴使用采样点序号,数据材料没有提供可直接使用的物理时间单位。
希望模型输出什么? 类别、某个连续参数或后续序列,对应不同的训练目标。先选一个能够评价的具体任务,建立基线,再研究预训练的作用。
怎样判断学到的表示有帮助? 固定数据划分,在验证集上比较方案,保留各组的训练设置和计算开销,最后用独立测试集评价。对少标签场景,还需要明确各组使用的标签数量。
配套的 nanoSciGPT 仓库提供了光变数据准备、直接分类、连续片段预训练及分类微调的教学路径。光变课堂的小配置支持使用 CPU 运行,具体环境与命令见项目说明。nanoSciGPT
从课程样例熟悉流程后,可以再带入自己的数据:确定表示,构造预训练目标,选择一个下游任务,观察每一步的结果。随着证据积累,再决定是否增加数据、扩大模型或研究更多任务。
已有科学数据能贡献什么,取决于我们为它设计了怎样的学习任务,以及怎样检验学到的表示。
课程来源:李瑀旸《如何构建领域基座模型与 AI Scientist 系统》,磐石·科学智能实训营。
参考资料
- 李瑀旸,nanoSciGPT:光变课堂说明及项目说明。
- Nie, Y., et al. A Time Series is Worth 64 Words: Long-term Forecasting with Transformers. ICLR 2023.
- Bommasani, R., et al. On the Opportunities and Risks of Foundation Models. 2021.