独立成分分析是一种强大的用于盲源分离的计算方法,广泛应用于多个领域。它能有效分解统计上独立且呈非高斯分布的混合脑电图(EEG)信号。
什么是独立成分分析 (ICA)?
独立成分分析是一种先进的统计和计算技术,专注于从一组混合观测数据中提取隐藏的因素或成分。
在许多现实场景中,记录的数据是多个源信号在介质中同时作用的结果,造成了复杂的重叠,这在原始形式中通常是无法理解的。通过实施特定的代数变换,该方法可以作为过滤器来逆转这一混合过程。
核心概念:分离混合信号
该领域的基本前提围绕着“鸡尾酒会问题”,即多个人在房间里同时说话,而多只麦克风在记录由此产生的混乱听觉信号。
普通观察者只能听到一种混沌的声音,但 ICA 理论上可以识别每个发言者所贡献的信号。这种能力使研究人员能够从全局数据流中分离出特定的波形,为原先会被遮挡的单个数据通道提供一个清晰的视窗。
ICA 的数学基础
在数学上,其目标是进行盲源分离,找到一种使得观测变量尽可能独立的线性变换。给定一个观测到的数据向量,该算法寻求一个解混矩阵,当其与观测值相乘时,会产生具有独立统计分布的估计源信号。
实现这一点需要这些信号是非高斯的,因为高斯分布的数学特性使得它们无法被唯一分离。在现代神经科学的背景下,这种严谨性确保了细微的电信号波动不会淹没在周围干扰的背景噪声中。
独立成分分析是如何工作的?
该过程在处理高维数据时能成功运行,依赖于通过测量非高斯性将混合物转化为其组成部分。因为由于中心极限定理,混合信号往往倾向于高斯分布,所以该算法通过在数据中积极寻找距离高斯分布最远的方向来运行。
所得的成分实际上是“纯净”的信号,它能重建独立于混合过程的原始信号源。
ICA 的假设
该算法的成功执行取决于几个关键要求。最重要的假设是源信号在统计上相互独立;如果了解一个信号源的值不能提供有关另一个信号源的任何信息,则它们符合分离条件。
此外,该算法假设观测到的混合信号数量至少与独立源的数量一样大。最后,如前所述,源必须呈现出非高斯分布,因为这种独特的结构创造了该算法锚定其分离工作所需的特征点。
独立成分分析算法:关键技术
存在几种实现这种分离的算法方法,其中 FastICA 和 Infomax 是最杰出的代表。这些方法迭代调整解混矩阵,以最小化互信息或最大化输出的非高斯性。
优化过程属于计算密集型,需要仔细实现以确保在不同数据集上的稳定收敛。通过优化这些权重,系统逐步剥离干扰层,直至每个独特的信号清晰显现。
独立成分分析 vs. 主成分分析 (ICA vs. PCA)
虽然这两种技术都用于降维或信号分析,但它们的功能目标明显不同。研究人员必须根据他们是想在数据集中捕捉方差还是独立性,来在两者之间做出选择。
特征 | 主成分分析 | 独立成分分析 |
|---|---|---|
主要关注点 | 最大方差 | 最大独立性 |
正交性 | 需要 | 不需要 |
成分顺序 | 按特征值排序 | 随机排序 |
统计测量 | 相关性 | 高阶统计量 |
选择正确的工具取决于具体分析的目标。PCA 非常适合需要保留主要趋势的数据压缩,而当目标是识别对总体观测有贡献的独特、独立过程时,ICA 则更为优越。
独立成分分析如何从噪声中分离大脑信号
独立成分分析采用了比 PCA 更严格的方法。ICA 不仅仅是不去关联信号,而是寻找在统计上独立的成分,这意味着知道一个成分的值根本无法提供有关任何其他成分的任何信息。
这是一个比去关联高得多的标准,正是它使得 ICA 能够剥离和分离出共享频率内容但源自真正独立物理源的信号:这里的一次眨眼、那里的一次咬牙、以及另一处负责对刺激做出反应的视觉皮层区域。
Winkler等人的研究应用了 TDSEP,这是一种考虑了跨时间的时间相关性而不仅仅是信号即时统计的 ICA 版本。
Olaf Dimigen 的研究使用了 Infomax,这是一种被广泛使用的 ICA 算法。
Mognon 的研究在一套通用的基于 ICA 的流程之上构建了其自动检测工具。
尽管在具体实施上有所不同,但所有这些方法都基于相同的基本原理:将混合的电极信号分解为一组相互独立运动的成分,然后确定哪些成分看起来像大脑活动,哪些看起来像人工伪迹。
ICA 背后的核心假设:非高斯性和线性混合
ICA 之所以起作用,是因为对数据做出了两个特定的假设,理解这两点有助于解释其优势和失效点。
第一个假设是非高斯性。 真正的脑电图(EEG)源,无论是大脑节律、眼眨还是肌肉爆发,其振幅分布往往偏离高斯(正态)分布的钟形曲线。ICA 算法旨在寻找并最大化这种非高斯结构,因为独立信号的混合物往往比其任何单个成分看起来更接近高斯分布(这是中心极限定理的结果)。
第二个假设是线性混合。 ICA 假设电极记录的是底层源信号的瞬时线性组合,这一假设对于在中继记录条件下电活动如何通过组织和颅骨传播(称为容积传导的过程)是非常吻合的。当人静坐时,这个假设最容易满足。
为什么在 ICA 之前进行高通滤波会改变一切
ICA 分解的质量很大程度上取决于运行该算法之前信号是如何处理的,而高通滤波器截止频率(一种去除设定频率以下极慢漂移的滤波器)的选择被证明是整个流程中最为关键的决定之一。
Winkler 等人于2015年领导的一项研究直接使用了事件相关电位 (ERP) 数据(即针对特定刺激的时间同步脑电波模式)对此进行了测试,该数据来自进行听觉奇异刺激任务的 21 名参与者。在三个独立的指标上,1 至 2 Hz 之间的高通滤波均一致产出了良好的结果:信噪比、单次试次分类准确率以及看起来“近偶极子”的成分百分比(这意味着它们具有与单个定位大脑源相一致的空间模式,而不是几个源的模糊混合)。
此外,在 2020 年的一项研究中,Klug 等人在固定和移动记录设置中检查了同一个问题。对于带有 64 通道和 0.5 Hz 滤波器的标准固定实验,结果是可以接受的。但是移动实验需要更高的截止频率,高达 2 Hz,才能达到最佳分解,且通道较多的设置需要相应更高的滤波器。
Olaf Dimigen 的研究在眼动伪迹的具体情境下进一步推进了这一想法。通过系统性地改变高通滤波器、低通滤波器以及包含扫视尖峰电位的训练数据的比例,研究者发现,在这些尖峰电位被大幅过加权的训练数据上训练 ICA 能够强力地提高校正质量。
综合来看,这三项研究指出了相同的结论:默认的滤波器设置,尤其是常见的 0.5 Hz 截止频率,对于许多使用场景来说可能过于宽松,正确的选择取决于具体的伪迹和记录条件。
运行机器学习自动进行伪迹成分选择
一旦 ICA 产生了一组独立成分,仍然需要人或机器来判断哪些成分代表大脑活动,哪些代表伪迹。由训练有素的专家进行手动标注耗时较长,并且会引入主观性,因为不同的专家在边缘案例上的意见不总是一致。
为了解决这个问题,Winkler 的团队仅利用从每个成分的频率、空间和时间特征提取出的六个特征,构建了一个与受试者无关的线性分类器。该分类器在来自一项反应时研究中 12 名参与者的 640 个手动标记的 TDSEP 成分上进行了训练,在测试新数据时实现了低于 10% 的均方误差 (MSE),这一性能水平与人类专家之间的自然分歧率不相上下。
在不进行重新训练的情况下应用于完全不同的听觉 ERP 范式时,同一分类器达到了 15% 的 MSE,这是一个合理但明显变弱的结果,反映了跨范式泛化的难度。在一项运动想象脑机接口 (BCI) 任务中,研究人员表明,去除高达 60% 最具伪迹的成分仍能保留 BCI 运行所需的判别信息。
此外,Mognon 的团队引入了 ADJUST,这是一种全自动算法,它结合了专门用于检测眨眼、眼动和泛化不连续性的空间和时间特征。在独立的数据集上进行验证时,ADJUST 对成分的分类与手动专家标记在 95.2% 的数据方差上达成了一致。去除 ADJUST 标记为伪迹的成分后,产生了该研究所描述的、从严重受干扰的数据中对视觉和听觉事件相关电位进行的整洁重建。
这两种工具在减少手动 EEG 清洗负担方面都代表了真正的进展,但其报告的成果来自于特定的数据集和范式,无法保证能泛化到新条件中。
使用 ICA 清洗 EEG 数据的实用启示
独立成分分析之所以起作用,是因为它追求的是真正的统计独立性,而不是像 PCA 这样的方法所依赖的较弱的去关联特性。这种区别使它即使在频率内容重叠时也能拉开大脑信号和伪迹,而频域滤波和在直接测试中失败的基于回归的 EOG 校正则无法做到这一点。
然而,这种成效是有条件的。事实证明,在固定 ERP 研究中,1 至 2 Hz 范围内的高通滤波会一致地产生良好的分解,而移动记录则能从高达 2 Hz 的滤波器中受益,同时通道数量也起到了一定作用。对于自视观察期间尤其棘手的扫视尖峰电位等伪迹,在训练期间故意对伪迹进行过加权(而不是使用默认设置),可以将不令人满意的校正转变为几乎能去除所有污染而对大脑活动的失真微乎其微的校正。
此外,自动成分分类器(包括采用六特征的线性模型和前述研究中的 ADJUST 算法)可以显著减少手动标注所带来的时间和主观性。两者在验证数据上都与专家评判表现出高度一致。然而,在不了解不同记录范式和设备会导致性能发生何种变化的情况下,两者都不应被视为万能方案。
基于 ICA 的伪迹去除仍然是目前清洗 EEG 数据最受支持的方法之一,其背后的神经科学也建立在连贯的统计逻辑之上。但它的实际性能取决于算法运行之前很久做出的选择:滤波器设置、训练数据组成以及作为目标的特定伪迹。任何应用它的人都应该用客观的指标来验证结果,而不是假设单一的配置在任何地方都会奏效。
为什么预处理选择决定了 EEG 中 ICA 的成败
干净的大脑数据是从意念控制设备到细致的记忆研究等一切事物的基础。独立成分分析提供了一种数学上健全的方法来分离混合的神经活动和身体噪声,即使像简单滤波这样较简单的方法失效时也是如此。通过针对真正的统计独立性,它可以揭示在相同频段内发生的脑节律与眨眼的独立电特征。
然而,只有当研究人员不局限于“即开即用”的默认设置时,真正的威力才会显现出来。研究表明,根据具体的记录情况调整高通滤波器,并为伪迹检测器仔细准备训练样本,才能将 ICA 从一个满怀希望的实验转变为一个一致可靠的工具。付出这种个性化的关注,科学家才能自信地恢复大脑的信息,而不是让它们在吵闹的记录中混作一团。
参考文献
Winkler, I., Haufe, S., & Tangermann, M. (2011). Automatic classification of artifactual ICA-components for artifact removal in EEG signals. Behavioral and brain functions, 7(1), 30. https://doi.org/10.1186/1744-9081-7-30
Dimigen, O. (2020). Optimizing the ICA-based removal of ocular EEG artifacts from free viewing experiments. NeuroImage, 207, 116117. https://doi.org/10.1016/j.neuroimage.2019.116117
Mognon, A., Jovicich, J., Bruzzone, L., & Buiatti, M. (2011). ADJUST: An automatic EEG artifact detector based on the joint use of spatial and temporal features. Psychophysiology, 48(2), 229-240. https://doi.org/10.1111/j.1469-8986.2010.01061.x
Winkler, I., Debener, S., Müller, K. R., & Tangermann, M. (2015). On the influence of high-pass filtering on ICA-based artifact reduction in EEG-ERP. Annual International Conference of the IEEE Engineering in Medicine and Biology Society. IEEE Engineering in Medicine and Biology Society. Annual International Conference, 2015, 4101–4105. https://doi.org/10.1109/EMBC.2015.7319296
Klug, M., & Gramann, K. (2021). Identifying key factors for improving ICA‐based decomposition of EEG data in mobile and stationary experiments. European Journal of Neuroscience, 54(12), 8406-8420. https://doi.org/10.1111/ejn.14992
常见问题
为什么简单的频率滤波不能去除像眼眨和肌肉活动这样的 EEG 伪迹?
频率滤波之所以失效,是因为伪迹和大脑信号经常共享相同的频段(例如肌肉活动和额部的 theta 节律),因此去除其中一个也会把另一个去除。当它们的振荡重叠时,滤波器无法将它们分离。
在从噪声中分离大脑信号时,PCA 和 ICA 之间的关键区别是什么?
PCA 只是去关联信号——使它们线性不相关——但不要求统计独立性。ICA 走得更远,它寻找完全统计独立的成分,这意味着知道一个成分无法透露关于另一个成分的任何信息,这有助于更好地分离混合的脑电信号源和伪迹源。
ICA 究竟是如何把大脑信号从伪迹中分离出来的?
ICA 假设混合电极信号是独立的、非高斯源信号的线性组合。它寻找一个能最大化所得成分独立性的变换,从而将截然不同的物理源(例如一个眼眨与一个大脑节律)有效地分离开来,即使它们的频率相互重叠。
为什么非高斯性对 ICA 工作如此重要?
真实的 EEG 源倾向于具有非高斯振幅分布,而独立信号的混合物则会变得更接近高斯。ICA 算法寻找并最大化这一非高斯结构来分离原始信号源,因为找到最不属于高斯分布的投影就可以恢复独立成分。
为什么在 ICA 之前对 EEG 数据进行高通滤波如此关键?
高通滤波器可以去除可能损坏 ICA 分解的极慢漂移。研究一致发现,与 0.5 Hz 等较低的默认设置相比,1–2 Hz 附近的滤波器截止频率产生的分解成分更加纯净、更接近大脑的独立成分,尤其是在移动记录中或针对特定伪迹时。
机器学习如何帮助自动将 ICA 成分分类为大脑信号或伪迹?
自动分类器利用各成分频率、空间和时间模式中的几个特征对其进行标注,其准确性接近专家水平。这减少了挑选待去除成分时的手动、主观工作量,不过应用于全新的实验范式时性能可能会有所下降。
在受试者四处走动的移动 EEG 记录期间,ICA 的性能会发生什么变化?
身体活动并没有完全打破线性混合的假设,因此 ICA 仍能工作,但它减少了可以恢复的、可解释的洁净大脑成分的数量。相比固定记录,移动设置通常需要更高的高通滤波器截止频率,以维持最佳的分解状态。
ICA 能应用于非线性混合吗?
标准的算法假设的是线性混合,因此将其应用于复杂的非线性组合往往需要对模型进行专门的修改或扩展。
Emotiv 是一家神经技术领域的领导者,致力于通过易于获取的 EEG 和脑数据工具推动神经科学研究发展。
克里斯蒂安·布尔戈斯




