内容摘要

科学数据内部的顺序和结构,可以为自监督学习提供训练目标。

预训练学习可复用的表示,任务适配将这些表示用于具体科学问题。

从小规模数据和清晰的对照实验出发,可以逐步判断领域模型的研究价值。

(正文约2,200字,阅读约6分钟)

实验室里积累了大量曲线、图像或序列,经过专家确认的类别和性质却只有一部分。数据持续增加,能够直接用于监督学习的样本,仍然受制于标注和实验验证的成本。

这些尚未标注的数据,能否先参与模型训练?

一个可行的起点,是让模型学习数据内部已有的关系,再用任务标签将这些关系用于分类或预测。在磐石·科学智能实训营中,李瑀旸以光变曲线为例,将这条路径拆成了能够动手理解的预训练与微调过程。[1]

01科学数据能够为预训练提供自身的学习目标

给模型一段曲线,让它根据前面的变化预测下一段。预测完成后,将输出与实际记录比较,计算误差,再更新参数。训练所需的目标就包含在原始序列中。

这就是自监督学习的一种形式。它利用数据自身构造学习任务,例如预测后续序列,或恢复被遮住的部分。光变数据中的类别可以暂时放在一边,模型先学习不同片段之间的关联。

反复训练后,网络内部会形成描述输入的数值特征,即“表示”。这些表示能否用于具体科研问题,取决于它们保留了哪些信息,以及这些信息与目标任务有多大关联。

在较广泛的数据上预训练,再将所得表示适配到多种下游任务,是基座模型的基本思路。对于一个科学领域,值得积累的能力,是同一套表示能够支持该领域哪些预测、分类或生成任务。[2]

蛋白质研究提供了一个实例。Rives等人在2021年发表于PNAS的研究中,通过大量蛋白质序列训练语言模型,发现所得表示包含与蛋白质结构相关的信息,并将这些表示用于二级结构、残基接触和突变效应等预测任务。序列自身的统计关系由此成为学习生物学特征的入口。[3]

图1|序列预测可以从数据本身获得训练目标。不同科学数据需要相应的表示与训练任务。图片:李瑀旸课程课件第9页。[1]

02数据表示需要保留科学对象的结构关系

将科学数据送入模型之前,需要决定模型一次读取什么,以及哪些关系应当保留。

文本模型使用token作为处理单元。科学数据也可以组织成相应单元:氨基酸对应蛋白质序列中的残基,连续测量可以按片段编码,图和几何数据则需要保留连接或空间信息。领域知识在这里决定了模型能够看到什么。

以课程使用的StarLightCurves为例,每条曲线包含1,024个数值。教学实现把连续32个数值组成一个片段,整条曲线因此变成按顺序排列的32个片段。模型读取前面的片段,预测下一片段,再根据预测误差调整参数。该教学数据的横轴记录采样点序号,材料未提供对应的物理时间单位。[4]

一个片段承担一个输入单元的作用,整条曲线保留前后关联。 这种处理方式使连续数值能够进入序列模型。TimesFM研究也采用了时间序列分段及基于解码器的预测方法,说明这一表示思路可以用于时间序列预训练。[5]

具体到自己的课题,还需要检查采样是否均匀、是否存在缺失值、测量条件是否一致,以及幅度或几何关系是否具有科学意义。这些判断会影响分段、归一化和编码方式。良好的表示让模型更容易利用与任务相关的信息。

03任务适配把预训练表示连接到具体科学问题

模型学会预测下一段曲线后,可以进一步利用它已经形成的表示开展分类。输入仍然是曲线,输出改为类别;具有类别标签的样本,为这个阶段提供训练信号。

预训练与任务适配因此形成分工:前一个阶段学习数据中的关系,后一个阶段学习这些关系怎样对应研究者关心的结果。分类任务输出类别,回归任务输出某个数值;不同任务分别定义标签和评价标准。

课程中的光变示例原本带有类别标签。预训练阶段只读取曲线,随后用标签训练分类任务,展示两阶段如何衔接。实际研究若要评价“标签更少时是否受益”,需要另外设定标签数量,并比较相同条件下的训练方案。[4]

判断预训练价值,可以从同一模型的两条路径开始:一条先预训练再做任务训练,另一条直接开展任务训练。固定数据划分、标签使用方式和评价指标,再记录训练成本与结果。预训练带来的收益、额外投入和适用条件,才有明确的比较基础。

当一套表示在多个相关任务上都有用时,它便具备更充分的复用依据。领域基座模型的建设,需要把数据积累、表示学习和任务验证逐步连接起来。

图2|预训练表示可以连接分类、参数估计等下游任务。图中各领域的输入与标签分别具有相应含义。图片:李瑀旸课程课件第10页。[1]

04小规模对照实验可以检验领域模型的起步方案

开始实践时,可以先选一个范围明确的问题,例如“根据这批曲线区分类别”或“根据序列预测某项已有测量值”。把输入、输出、样本来源和评价指标写清楚,再确定能够用于训练的数据。

随后,用适合该任务的简单方法建立基线,记录当前能够达到的表现。若已有与数据形式和任务相近的预训练模型,也可以先测试适配效果;需要探索本领域数据表示时,再从小模型预训练开始。这样可以让每一轮投入对应一个具体问题。

一个最小实验需要留下三类结果:预训练损失与预测示例、任务适配后的评价结果,以及直接训练的对照结果。训练和方案选择使用训练集、验证集,测试集用于最终评价。若计划研究少标签条件,还需要记录每组使用了多少标签、如何抽取,并在一致的设置下重复比较。

李瑀旸的nanoSciGPT配套仓库提供了光变数据准备、基线分类、片段预训练和任务适配的教学入口,可以用于理解这一过程。读者可从光变课堂说明开始,按仓库要求准备环境,再运行相应练习。迁移到自己的数据时,需要重新检查格式、预处理与标签定义。[4]

对于数据量较大的课题,可以先用一小部分样本验证数据读取、训练目标和评价流程,再根据结果增加数据和模型规模。资源需求还与序列长度、图像分辨率和训练设置有关,早期实验应同时记录计算与存储成本。

科研数据中的关系,可以先成为训练目标,再通过具体任务得到检验。围绕自己的研究对象走通这一过程,就能逐步回答:哪些数据值得继续积累,哪些表示能够迁移,以及下一轮实验应当检验什么。


课程主讲|李瑀旸

课程与配图|磐石·科学智能实训营《如何构建领域基座模型与AI Scientist系统》

完整课件与教材 · nanoSciGPT配套代码

参考资料

  1. 李瑀旸. 如何构建领域基座模型与AI Scientist系统. 磐石·科学智能实训营课程课件与录音. 课程资料.
  2. Bommasani R, et al. On the Opportunities and Risks of Foundation Models. arXiv:2108.07258 (2021). 原文.
  3. Rives A, et al. Biological structure and function emerge from scaling unsupervised learning to 250 million protein sequences. PNAS 118(15), e2016239118 (2021). 原文.
  4. 李瑀旸. nanoSciGPT:用一份光变数据贯穿课堂. 教学说明.
  5. Das A, Kong W, Sen R, Zhou Y. A decoder-only foundation model for time-series forecasting. ICML (2024). 原文.