多模态持续学习综述精读

多模态 27 分钟
多模态持续学习综述精读

多模态持续学习(MMCL)综述精读

总结

这篇论文讲的是一个很现实的问题:如果一个 AI 模型要像人一样不断学习新东西,而且它面对的不是单一类型的数据,而是图片、文字、声音、视频、触觉、加速度、陀螺仪等多种信息,那么它会遇到什么困难?已有工作通常怎么解决?还有哪些地方没有解决好?

一句话概括:MMCL 研究的是多模态模型如何在连续到来的任务中学习新知识,同时尽量不忘旧知识、不过度破坏模态之间的关系,也不丢掉预训练模型原本具有的泛化能力。

这里最核心的矛盾仍然是持续学习里的老问题:模型学新任务时,很容易忘掉旧任务,也就是灾难性遗忘。但多模态场景会让这个问题变复杂,因为模型不只是在记分类边界,还在记:

  1. 每个模态自己的表示,比如图像特征、文本特征、音频特征;
  2. 不同模态之间的对应关系,比如图像和文字如何对齐;
  3. 不同模态融合后如何共同做决策;
  4. 预训练多模态模型原本学到的零样本能力,比如 CLIP 原本不用微调也能识别很多新类别。

所以 MMCL 不是把传统 CL 方法直接搬到多模态数据上就完事。论文认为 MMCL 有一个基础挑战和四个额外挑战:

  1. 多模态灾难性遗忘:学新任务后,旧任务性能下降,而且多模态输入下遗忘可能比单模态更严重。
  2. 模态不平衡:某些模态更强、更容易学,模型会偏向它,导致弱模态被忽视。
  3. 复杂模态交互:多模态不是简单拼接,关键在对齐和融合,而这些关系也会在持续学习中被破坏。
  4. 高计算成本:多模态模型往往有多个编码器和交互模块,训练和保存都更贵。
  5. 预训练零样本能力退化:大模型原本会很多东西,持续微调可能把这些泛化能力弄坏。

论文把现有方法分成四类:正则化、架构、回放、Prompt。这四类方法的直觉如下:

  1. 正则化方法:给模型参数、输出或模态关系加约束,让它学新任务时不要偏离旧模型太远。
  2. 架构方法:给不同任务或不同模态分配不同模块,减少互相干扰。
  3. 回放方法:保存或生成一部分旧任务信息,学新任务时拿出来一起训练。
  4. Prompt 方法:尽量冻结大模型,只学习少量提示参数,让模型适应新任务,同时保留预训练知识。

引言

传统机器学习大多是 single-episode paradigm:模型在一个固定数据集上训练,然后在相同分布的测试集上评估。这个设置默认训练集和测试集独立同分布,也默认模型训练完之后基本不再变化。

但真实世界不是这样。手机输入法会遇到新词,推荐系统会遇到新用户和新商品,机器人会遇到新环境,遥感模型会遇到新的地物类型和传感器条件。一个真正可用的 AI 系统不能只在出厂时训练一次,然后永远不更新。

为了解决这个问题,社区提出了 Continual Learning(CL,持续学习),也叫 lifelong learning 或 incremental learning。它希望模型按任务序列不断学习新任务,同时保留旧知识,并且不依赖完整历史数据重新训练。

持续学习最典型的问题是 catastrophic forgetting(灾难性遗忘):模型按顺序训练任务时,新任务的梯度更新会把参数推离旧任务的最优区域,导致旧任务性能明显下降。

持续学习本质上是在做一个平衡:

  • Plasticity(可塑性):模型学习新知识的能力;
  • Stability(稳定性):模型保留旧知识的能力。

可塑性太强,模型容易学新忘旧;稳定性太强,模型又学不进新东西。CL 的核心就是在二者之间找平衡。

图 1:单模态持续学习与多模态持续学习对比

单模态持续学习例子

假设我们做遥感地物分类,并且只使用 Sentinel-2 图像,或者只使用 AlphaEarth embedding,这就可以看成单模态持续学习。

Task 1:water / forest
Task 2:cropland / built-up
Task 3:wetland / bare land

每次来新类别,模型都要把新类别学进去,同时保留旧类别识别能力。这是典型的 Class-Incremental Learning(CIL,类增量学习)

多模态持续学习例子

再看一个图像 + 文本的 VQA 持续学习例子:

Task 1:回答数量问题
图片 + 问题:“How many cats?”
答案:1 / 2 / 3

Task 2:回答颜色问题
图片 + 问题:“What color is the car?”
答案:red / blue / black

Task 3:回答位置问题
图片 + 问题:“Where is the dog?”
答案:left / right / center

这里模型不仅要记住每个任务的知识,还要保持图像和语言之间的对齐关系。如果学 Task 2 时把图文对齐破坏了,那么 Task 1 的数量问答也会下降。

这就是 MMCL 比单模态 CL 更麻烦的地方:它忘的不是一个东西,而是一整套多模态知识结构。

图 2:MMCL 面临的四个核心挑战

论文强调,MMCL 的挑战不是简单的“数据类型更多”,而是多模态数据本身带来了新的困难。

挑战 0:多模态灾难性遗忘

这是从传统 CL 继承来的基础问题。模型持续学习新任务时,会忘记旧任务。更麻烦的是,多模态模型中不同模态的遗忘速度可能不同。例如视觉表示退化得更快,而语言表示还保留得比较好;或者模型越来越依赖文本,视觉分支逐渐被削弱。

论文还提到一个反直觉现象:有时多模态输入并不一定比单模态好。因为多模态融合如果学不好,反而会引入额外干扰,导致效果低于只用一个强模态。

挑战 1:模态不平衡

模态不平衡指不同模态在数据量、信息强度、学习难度、优化速度上不一致。

它可以发生在两个层面:

  • 数据层面:某些任务里某个模态缺失,或者某个模态样本更多、质量更好;
  • 参数层面:不同模态分支收敛速度不同,强模态主导优化,弱模态学不到东西。

比如在图文任务里,如果图片已经能很好回答问题,模型可能就懒得利用文本;反过来,在某些 VQA 任务里语言问题本身暗示很强,模型可能过度依赖语言先验。

挑战 2:复杂模态交互

多模态学习的关键不是“把图片向量和文本向量拼起来”,而是处理两个过程:

  1. Modality Alignment(模态对齐):让不同模态中语义相同的内容在表示空间里靠近。比如一张狗的图片和句子 “a dog” 应该对应起来。
  2. Modality Fusion(模态融合):把不同模态的信息合成一个用于预测的表示。常见方式有拼接、加权平均、注意力融合等。

持续学习会破坏这两个过程。论文中特别提到 Spatial Disorder(空间错乱):图像和文本原本在共享空间中对齐,但持续训练后,同一语义的图文表示逐渐分离,导致跨模态检索或图文匹配能力下降。

挑战 3:高计算成本

多模态模型一般更大,因为它可能包含视觉编码器、文本编码器、音频编码器、跨模态交互模块等。持续学习如果每来一个任务就全参数微调、复制模型或扩展模块,成本会很快上升。

这也是为什么近年来很多方法开始关注 PEFT(Parameter-Efficient Fine-Tuning,参数高效微调),比如只训练 Adapter、LoRA、Prompt,而不是更新整个大模型。

挑战 4:预训练零样本能力退化

像 CLIP、BLIP2、InstructBLIP 这类预训练多模态模型,原本已经从大规模图文数据中学到了很强的泛化能力,可以做零样本预测。

但如果我们在新任务上持续微调,它可能会变得更擅长当前任务,却把原来的开放世界知识弄丢。这对 foundation model 特别重要,因为模型的价值很大一部分就来自预训练阶段学到的通用知识。

三种情况定义

论文先给出一些符号定义,比如任务序列、输入分布、标签空间、模态集合等。这里保留三种最核心的设置。

单模态 CL 从头训练

这是传统 CL 最常见的设置:

  • 数据只有一种模态,比如只看图像;
  • 模型从随机初始化开始训练;
  • 模型没有预训练知识,也没有零样本能力;
  • 目标是在任务序列中不断学习,同时减少旧任务遗忘。

例子:模型先学猫狗分类,再学花分类,再学车分类。每次只来当前任务数据,不能完整访问以前所有数据。

MMCL 从头训练

这是把任务数据换成多模态数据,但模型仍然从头训练:

  • 输入可能是图文、视听、视频 + 传感器等;
  • 模型需要同时学习每个模态的表示和模态之间的交互;
  • 没有预训练骨干,所以不存在“保护零样本能力”的问题;
  • 但模态不平衡、模态对齐和融合问题已经出现。

这类设置更像是在研究 MMCL 的基本规律:多模态数据进入持续学习后,会带来什么新的遗忘模式?

使用预训练多模态骨干

这是现在更常见、也更有实际意义的设置:

  • 模型使用 CLIP、BLIP2、InstructBLIP、LXMERT、T5 等预训练模型作为骨干;
  • 预训练模型本来已经有大量图文知识,甚至有零样本能力;
  • 持续学习时,我们既想让它适应新任务,又不想破坏原来的通用能力。

这个设置里的稳定性不只是一层含义。以前的稳定性主要指“不忘旧任务”,现在还要加上“不忘预训练知识”。

MMCL 场景

MMCL 的学习过程会因输入分布、标签空间、模态集合、测试时是否给任务 ID 而变化。论文总结了五种场景。

图 3:MMCL 的五种学习场景

1. CIL:Class-Incremental Learning

CIL 是类增量学习。不同任务的输入分布不同,标签空间也不同,测试时不给任务 ID。

Task 1:cat / dog
Task 2:rose / sunflower
Task 3:car / truck

测试时模型只看到一个样本,不知道它来自哪个任务,必须在所有见过的类别里判断。这是比较难的设置,因为模型既要判断类别,也隐含地要判断任务。

2. DIL:Domain-Incremental Learning

DIL 是域增量学习。不同任务输入分布不同,但标签空间相同,测试时不需要任务 ID。

Task 1:真实照片中的 cat / dog
Task 2:卡通图像中的 cat / dog
Task 3:低光照图像中的 cat / dog

标签始终是 cat / dog,但输入域变化了。模型要学会跨域保持分类能力。

3. TIL:Task-Incremental Learning

TIL 是任务增量学习。不同任务输入分布和标签空间都不同,但测试时会提供任务 ID。

测试样本 + Task ID = Task 2
模型只需要在 Task 2 的标签空间里判断

因为测试时知道任务身份,所以模型可以调用任务特定分类头或模块。它比 CIL 容易一些,但仍然要避免旧任务模块被新任务训练破坏。

4. XDIL:Cross-Domain Incremental Learning

XDIL 是论文为 MMCL 引入的新场景。它表面上像 CIL:不同任务输入分布不同、任务标签也不同,测试时不需要任务 ID。但关键区别在于输出空间更大、更开放。

以生成式 VQA 为例:

Task 1:回答数量问题
答案可能是:1 / 2 / 3

Task 2:回答颜色问题
答案可能是:black / gray / red

模型实际输出空间:整个词表

在传统 CIL 中,模型输出通常是已见类别编号;在 XDIL 中,模型可能从一个很大的词表、类别集合或生成空间中输出答案。因此它更像“跨域任务持续适应”,也更接近 VQA、跨域分类、图文生成等真实多模态任务。

5. MDTIL:Modality-Dynamic Task-Incremental Learning

MDTIL 是模态动态的任务增量学习。它关注不同任务的模态集合发生变化的情况。

Task 1:图像 + 文本
Task 2:只有文本
Task 3:图像 + 音频
Task 4:视频 + 加速度 + 陀螺仪

单模态 CL 天然是模态静态,因为只有一种模态。但 MMCL 中任务之间可能出现模态增加、模态减少、模态切换。这非常贴近真实世界:传感器可能失效,新设备可能加入,某些任务可能没有完整模态。

评价指标

MMCL 的评价一般先继承传统 CL 的指标,再增加一些面向模态的指标。

设 $a_{t,i}$ 表示模型按顺序训练到第 $t$ 个任务后,在第 $i$ 个任务测试集上的表现。这个表现可以是分类 accuracy,也可以是生成任务的 BLEU、检索任务的 Recall 等。

任务性能

单个任务性能就是模型在某个任务上的指标。例如:

  • 分类任务:Accuracy;
  • 文本生成任务:BLEU、ROUGE;
  • 图文检索任务:Recall@K;
  • VQA:答案准确率。

这部分取决于任务类型,不是 CL 特有的。

平均表现

平均表现衡量模型训练到当前任务后,对所有已学任务的平均能力:

$$ A_t = \frac{1}{t}\sum_{i=1}^{t} a_{t,i} $$

讲人话:学到 Task t 之后,把 Task 1 到 Task t 都考一遍,算平均分。这个指标越高越好。

平均遗忘

遗忘衡量一个旧任务从历史最好成绩掉到了多少:

$$ f_i^t = \max_{s \in {1,\dots,t-1}} a_{s,i} - a_{t,i} $$

平均遗忘为:

$$ F_t = \frac{1}{t-1}\sum_{i=1}^{t-1} f_i^t $$

讲人话:一个任务曾经考过 90 分,现在只剩 70 分,那它忘了 20 分。对所有旧任务求平均,就是平均遗忘。这个指标越低越好。

后向迁移

后向迁移(Backward Transfer,BWT)衡量学习新任务对旧任务的影响:

$$ BWT_t = \frac{1}{t-1}\sum_{i=1}^{t-1}(a_{t,i} - a_{i,i}) $$

如果 BWT 是负数,说明学新任务伤害了旧任务;如果是正数,说明新任务反而帮助了旧任务。

前向迁移

前向迁移(Forward Transfer,FWT)衡量旧任务学习对未来任务有没有帮助。简单理解就是:模型在正式学习新任务之前,是否已经因为以前学过的东西而更容易适应这个新任务。

如果 FWT 高,说明模型学到的是可迁移知识;如果 FWT 低甚至为负,说明旧知识可能干扰新任务。

多模态特有指标

论文还提到一些面向模态的指标,例如:

  • Average Performance over Modalities(AM):分别只用某个模态测试,再看各模态平均表现;
  • Average Difference(AD):衡量不同模态之间表现差异,用来观察模态不平衡;
  • Average Merge Effectiveness(AME):衡量多模态融合相比单模态是否真的带来收益。

这些指标很重要,因为 MMCL 不能只看总分。模型总分高,可能只是因为某个强模态撑住了;弱模态可能已经被遗忘。因此,MMCL 的评价要看任务,也要看模态。

方法论

图 4:MMCL 方法分类体系

论文把 MMCL 方法分成四类:正则化、架构、回放、Prompt。它们分别对应四种直觉:

  • 不想让模型乱动:加正则;
  • 不想任务互相干扰:分模块;
  • 不想忘旧数据:回放旧知识;
  • 不想破坏大模型:只学提示参数。

1. 正则化方法

正则化方法认为,灾难性遗忘来自训练新任务时参数自由移动。于是它在新任务损失之外加一个约束项:

$$ L_t = L_{\text{single},t} + \lambda L_{R,t} $$

其中 $L_{\text{single},t}$ 是当前任务损失,$L_{R,t}$ 是正则项,$\lambda$ 控制学新任务和保旧知识之间的权衡。

论文把 MMCL 正则化分成两类。

模态一致性正则

目标是让每个模态自己的表示或融合表示不要变太多。

常见做法有两种:

  1. 参数层面约束:像 EWC 一样估计参数重要性,重要参数变化越大惩罚越大。
  2. 输出层面约束:让当前模型模仿旧模型的输出、中间特征或 logits,也就是知识蒸馏。

例如旧模型看到一张图片和一句文本时,输出某个融合表示;新模型学习新任务时,也尽量保持这个表示不要偏离太远。

模态关系正则

目标是保护模态之间的关系,而不仅仅是保护某个模态自己的特征。

比如图文模型里,我们不只关心图片特征有没有变,也关心“图片和文本的相似度矩阵”有没有变。如果原来一张猫图最匹配 “a cat”,持续学习后却更匹配 “a car”,说明跨模态关系被破坏了。

这类方法通常用 relation-based knowledge distillation,让新模型模仿旧模型学到的图文相似度、对比矩阵或注意力关系。

优点和缺点

正则化方法的优点是通用,通常不需要大改模型结构,只要设计损失函数就能接到不同多模态骨干上。

缺点也明显:很多方法仍然需要全参数微调,计算成本高;有些方法依赖外部参考数据集,比如用参考图文对来保持 CLIP 的零样本能力,实际场景中未必容易拿到。

2. 架构方法

架构方法的核心想法是:既然不同任务会互相干扰,那就让不同任务或不同模态使用不同参数。

论文分成两类:任务驱动架构和模态驱动架构。

任务驱动架构

任务驱动方法会为不同任务分配不同模块。例如:

  • 给每个任务一个 Adapter;
  • 给每个任务一个 LoRA expert;
  • 给不同任务不同分类头;
  • 用 router 根据输入选择对应专家模块。

这样做可以减少任务之间的参数冲突。对于大模型,一个常见策略是冻结 CLIP、BLIP2 等预训练骨干,只训练轻量模块。这能同时降低计算成本,并保护预训练零样本能力。

但它也有风险:如果每来一个任务就加模块,模型会越来越大;如果测试时没有任务 ID,还需要额外判断当前样本属于哪个任务,一旦任务识别错了,后面的模块选择也会错。

模态驱动架构

模态驱动方法关注的是模态集合变化。例如任务 1 有图文,任务 2 只有图像,任务 3 有视觉、加速度和陀螺仪。

这类方法会设计更灵活的结构,例如:

  • 给不同模态单独的 plug-in encoder;
  • 把不同模态映射到共同特征空间;
  • 为每个任务和模态设计分类器;
  • 在某个模态缺失时,用其他模态辅助训练或推断。

它更贴近真实场景,因为现实里模态经常不完整、不稳定。

优点和缺点

架构方法的优势是直观、有效,能显式减少任务干扰,也能自然处理不同任务和模态的差异。

缺点是模型结构会变复杂,参数和存储可能随任务数增长。当任务很多时,原本想省算力的持续学习反而可能变得更重。

3. 回放方法

回放方法的思路最像人复习:学新知识时,把旧知识拿出来一起看。

在持续学习中,回放方法通常维护一个 memory buffer,保存旧任务样本、特征、原型或生成信息。训练新任务时,把当前数据和回放数据混合训练:

$$ L_t = \frac{1}{|D_t \cup M_t|}\sum_{(x_i,y_i)\in(D_t\cup M_t)} \ell(f(x_i), y_i) $$

论文把 MMCL 回放分成两类。

自然多模态回放

自然回放直接保存数据中原本存在的多模态关系。

比如保存一部分图像-文本对、视频-音频对、视觉-传感器元组。学新任务时,把这些旧样本拿出来一起训练。这样模型可以重新看到旧任务里的跨模态对应关系。

有些方法不保存原始数据,而是保存特征、生成旧类别特征,或者结合知识蒸馏保持旧样本上的输出一致。这可以缓解隐私和存储压力。

交互式多模态回放

交互式回放不只是保存旧样本,而是主动保存或生成模态交互信息。

例如:

  • 用 scene graph 表示图像内容,再让语言模型生成伪样本;
  • 保存跨模态原型;
  • 根据图片生成负文本,用来帮助 CLIP 保持图文判别能力;
  • 把触觉和视觉映射到同一空间,保存类别原型。

这类方法更关注“模态之间怎么互动”,因此对复杂模态交互和模态不平衡更有帮助。

优点和缺点

回放方法通常效果稳定,直觉也清楚:旧数据见得越多,越不容易忘。

但它的缺点也很现实:

  • 保存原始样本有隐私风险;
  • buffer 太小会忘,太大又占内存;
  • 多模态样本比单模态样本更重;
  • 生成式回放依赖额外结构,比如 scene graph,并不是所有数据都有。

4. Prompt 方法

Prompt 方法是随着大模型兴起而变得重要的方向。它的核心想法是:不要大规模改动预训练模型,而是在输入或中间层加入少量可学习提示参数,让模型调用已有知识来适应新任务。

这类方法天然适合处理两个挑战:

  • 高计算成本:训练参数少;
  • 预训练零样本能力退化:主体模型冻结或少量更新,原知识更不容易被破坏。

论文分成两类:多模态 Prompt 和通用 Prompt。

多模态 Prompt

多模态 Prompt 会为不同模态设计提示参数。

比如视觉分支有视觉 prompt,语言分支有文本 prompt,并且方法会进一步设计二者之间的交互。因为如果视觉 prompt 和文本 prompt 各学各的,仍然可能破坏图文关系。

一些方法会让视觉 prompt 由语言 prompt 生成,或者设计 prompt interaction 模块,让提示本身也能对齐和融合。

通用 Prompt

通用 Prompt 不为每个模态单独设计提示,而是学习一组可跨模态或跨任务共享的提示。

这样做的好处是参数更少,也能避免不同模态 prompt 之间不一致。模型根据输入动态选择最相关的 prompt,从而适应不同任务。

优点和缺点

Prompt 方法非常适合 foundation model 时代的 MMCL,因为它参数高效,也更能保护预训练能力。

但它也有局限:

  • soft prompt 不可解释,不知道它到底学到了什么;
  • 效果强依赖预训练骨干;
  • prompt 长度有限,表达能力有限;
  • 如果每个任务都存一套 prompt,任务多了之后参数仍会线性增长。

图 5:论文总结的 MMCL 方法谱系

数据集

论文把现有 MMCL 数据集和 benchmark 的构造方式分成三类:

  1. 采集专门用于 MMCL 的新数据集;
  2. 串联多个已有数据集,把它们当作连续任务;
  3. 切分一个已有数据集,模拟任务序列。

在原始数据集上构建基准

这类数据集是专门为 MMCL 场景收集或组织的,更接近真实需求。

  1. P9D / VLCP
    P9D 是电商图文数据集,包含超过一百万个真实商品的图像-文本对。它按工业类别切成 9 个任务,用于视觉-语言持续预训练、跨模态检索和多模态检索。

  2. LILAC
    LILAC 是语言指令视觉环境 benchmark,包括 LILAC-2D 和 LILAC-3D。它关注模型如何在视觉环境中根据语言指令持续学习任务。

  3. UESTC-MMEA-CL / CEAR
    这个数据集由佩戴智能眼镜的参与者采集,包含第一视角视频和传感器数据,用于持续的第一视角活动识别。模态包括视觉、加速度和陀螺仪。论文提到,在这个 benchmark 中,多模态设置下即使用 CL 方法,效果有时仍不如只用视觉模态,说明多模态融合和遗忘问题确实没有被简单解决。

在多个数据集上构建基准

这类 benchmark 把多个原本独立的数据集串成任务序列。优点是容易构建,任务差异大;缺点是可能不完全符合真实连续环境。

  1. CLiMB
    CLiMB 包含视觉-语言任务、纯语言任务和纯视觉任务。视觉-语言任务包括 VQAv2、NLVR2、SNLI-VE、VCR;纯语言任务包括 IMDb、SST-2、HellaSwag、CommonsenseQA、PIQA;纯视觉任务包括 ImageNet-1000、iNaturalist2019、Places365 和 MS-COCO 目标检测。它用于测试模型在多种任务和模态之间持续学习的能力。

  2. CLOVE
    CLOVE 主要基于 GQA 等数据,构造不同场景和不同功能的 VQA 持续学习任务。它适合观察模型在连续 VQA 任务中如何遗忘和迁移。

  3. MTIL
    MTIL 使用多个图像分类数据集构成跨域分类任务,例如 Aircraft、Caltech101、CIFAR100、DTD、EuroSAT、Flowers、Food、MNIST、OxfordPet、StanfordCars 和 SUN397。它常用于研究基于 CLIP 等视觉语言模型的持续分类。

在划分数据集上构建基准

这是最直接的做法:拿一个已有数据集,按类别、关系或场景切成多个任务。

  1. IMNER
    使用 Twitter-2017 MNER 数据集,按类别划分,模拟多模态命名实体识别中的 CIL 场景。

  2. IMRE
    基于多模态关系抽取数据集 MEGA MRE,划分成多个任务,用于持续关系抽取。

  3. MMCL benchmark
    使用 VGGSound 构造音频 + 视觉分类任务,模拟 CIL 和 DIL 场景。

这类 benchmark 简单好用,但论文也提醒:真实世界数据往往是长尾、不均衡、动态变化的,而人工切分数据集常常过于整齐,可能低估真实 MMCL 难度。

讨论:Foundation Model 时代的 MMCL

论文在讨论部分强调了两个趋势。

趋势 1:从“只防遗忘”到“解决多模态特有问题”

早期 MMCL 方法主要还是把传统 CL 方法搬过来,核心目标是减少灾难性遗忘。后来研究者逐渐意识到,MMCL 有自己的问题:模态不平衡、模态交互、计算成本、预训练知识保护。这些问题让 MMCL 成为一个独立方向,而不是 CL 的简单扩展。

趋势 2:从小模型从头训练到预训练大模型适配

现在越来越多方法基于 CLIP、BLIP2、InstructBLIP 等 foundation model。这样做有明显好处:

  • 模型已经有强通用知识;
  • 零样本能力提供了很好的起点;
  • 对新任务的适应能力更强。

但它也带来新的问题:不同方法如果用不同 backbone,很难公平比较。论文提到,同一方法在 BLIP2 和 InstructBLIP 上的排序可能反转,说明 MMCL 方法对骨干模型有明显依赖。

稳定性-可塑性的升级版矛盾

在传统 CL 中,稳定性主要指保留旧任务知识,可塑性指学习新任务知识。

在 MMCL + foundation model 场景里,这个矛盾升级了:

  1. 模型要学新任务;
  2. 模型不能忘旧任务;
  3. 模型不能破坏模态之间的对齐和融合;
  4. 模型不能忘预训练阶段学到的通用知识;
  5. 不同模态还可能有各自不同的稳定性-可塑性平衡。

所以现代 MMCL 的一个关键思想是:把通用知识和任务特定知识解耦。

例如:

  • 架构方法把新知识放进 Adapter、LoRA、task module;
  • Prompt 方法把新知识放进 prompt;
  • 正则化方法通过损失约束旧知识不要变;
  • 回放方法通过旧样本或旧特征提醒模型不要忘。

其中架构和 Prompt 方法更适合大模型,因为它们能冻结主体参数,只在小模块里学习新知识。

未来方向

论文最后总结了两个大方向:更好的数据和评测、更好的 MMCL 技术。

1. 更多、更高质量的模态

当前 MMCL 研究主要集中在视觉-语言。音频、触觉、传感器、生物信号、基因数据等模态还研究得不够。

未来更真实的 MMCL 系统应该能处理更多模态,并且能面对模态质量不同、模态缺失、模态噪声等问题。

2. 更大规模、更真实的 benchmark

很多现有 benchmark 是拼接或切分已有学术数据集得到的,虽然方便,但不够真实。真实数据往往长尾、不均衡、任务边界不清晰,模态也可能动态变化。

因此需要更大规模、更贴近真实环境的 MMCL 数据集。

3. 更细粒度的 MMCL 指标

只看平均准确率不够。未来需要更多指标来回答:

  • 哪个模态忘得更快?
  • 多模态融合到底有没有带来收益?
  • 图文对齐是否被破坏?
  • 预训练零样本能力退化了多少?
  • 模态缺失时模型是否鲁棒?

4. 处理模态缺失

真实场景里模态经常缺失。比如机器人某个传感器坏了,医疗数据里某项检查没做,视频任务里没有音频。

未来 MMCL 方法不能假设所有样本、所有任务都有完整模态,而要能在模态不完整的情况下继续学习和推断。

5. 新的模态交互策略

当前很多方法仍然只是把不同模态通过网络结构融合起来,但没有深入分析模态之间如何互相影响。

未来可以研究更细粒度的模态交互,比如某个模态在什么时候帮助另一个模态,什么时候反而干扰它。

6. 参数高效微调

大模型时代,全参数微调成本太高。未来 MMCL 很可能会更多结合 PEFT 方法,如 Adapter、LoRA、Prefix Tuning、Prompt Tuning 等。

但不是简单把 PEFT 套上去,而是要设计适合持续学习和多模态交互的 PEFT 方法。

7. 更好地保护预训练多模态知识

很多 foundation model 的预训练数据不可见,所以想直接回放预训练数据不现实。如何在不知道原始预训练数据的情况下保护模型的通用知识,是一个重要问题。

8. 可信多模态持续学习

持续学习模型会不断吸收新数据,这会带来安全、隐私、幻觉和偏见问题。

例如,多模态大模型在单个数据集上微调就可能增加幻觉;持续学习中如果不断学习新任务,更需要控制错误信息、恶意数据和隐私泄露。

未来可以把联邦学习、安全对齐、隐私保护和 MMCL 结合起来。