新型 AI 方法可将科学数据集压缩至原来的百分之一
SLAC 国家加速器实验室的研究人员开发了一种基于神经网络的压缩方法,在测试中可将科学数据量缩小 10 至 100 倍,具体取决于输入数据和所需的精度水平。其核心思路并非对数据的每一部分进行同等压缩,而是保留可能对科学分析至关重要的不同空间尺度上的结构。该研究发表于《Nature Machine Intelligence》。
科学仪器产生的数据已超出基础设施的承载能力
这种新方法的动机源于现代实验科学中的一个非常实际的问题。传感器分辨率和测量速率提升得如此之快,以至于下一代仪器开始生成数据流,而这些数据流完整存储、传输以及后续处理的成本正变得越来越高。
传统有损压缩可以减小文件大小,但也可能去除低振幅信号或精细结构。在普通照片中,这种损失或许无关紧要。然而在科学测量中,一个微小细节可能恰恰包含研究人员所寻找的物理信息。
SLAC 以 X 射线测量中出现的小型散斑为例。这些结构能够揭示材料内部的有序性、缺陷或动态过程。如果压缩算法将它们视为噪声,那么它不仅会减小文件大小,也会降低测量结果的科学价值。
小波分析按尺度分离信息
发表于《Nature Machine Intelligence》的方法名为 WIEN-INR。它将小波分析与隐式神经表示相结合。
首先,小波分析将数据集分离为不同空间尺度上的组成部分,区分大尺度结构与精细细节。随后,神经网络学习以紧凑方式表示不同尺度上的信息。
这种架构有助于避免通用压缩中常见的问题:广阔的背景结构和一个虽小却具有重要科学意义的特征,可能会受到大致相同的处理。
据 SLAC 研究人员 Yuan Ni 介绍,视源数据和所需质量而定,该方法通常可将文件大小缩小 10 至 100 倍。不过,这一结果不应被理解为完全无损压缩。它是在数据量与信号保真度之间进行的可控权衡,其设计目标是比通用压缩方法更好地保留对分析至关重要的精细特征。
这比称该系统“完全不会丢失任何数据”更为准确。
该系统可以仅解码所需区域
该方法的第二项主要优势体现在数据后续使用时。如果研究人员只需要大型压缩数据集中的一个小区域,就无需重建整个文件。
WIEN-INR 可以仅解码选定的感兴趣区域,并以不同尺度和分辨率进行解码。SLAC 指出,使用传统编解码器解压完整的大型文件可能需要数分钟、数小时,甚至数天。选择性解码避免了其中的大部分工作。
在大型科学计算环境中,这种能力可能与压缩比本身同样重要。问题并不仅仅是存储成本。在存储系统、计算节点和研究机构之间移动数据会消耗网络容量、能源和时间。
该方法适用于截然不同的数据类型
研究人员并未将测试局限于单一类型的 X 射线数据集。他们将该方法应用于分子和材料测量、太阳磁场数据以及普通照片。神经网络能够适应不同数据类型,并学习对每类数据重要的特征。
作者并未将 WIEN-INR 描述为现有压缩或数据缩减方法的通用替代方案。相反,在日后恢复精细尺度结构尤为重要的情况下,它可与这些方法协同工作,作为一种额外选择。
加州大学戴维斯分校和卡内基梅隆大学的研究人员也参与了这项研究。该团队使用美国能源部 NERSC 设施的 Perlmutter 超级计算机训练其神经网络。论文《Multi-resolution enhancement for full-spectrum neural representations》于 2026 年 8 月 24 日发表于《Nature Machine Intelligence》。
欧洲研究基础设施面临同样的挑战
该方法的潜力远不止于 SLAC 的某一台仪器。欧洲用于粒子物理、同步辐射科学、天文学、气候研究和卫星观测的基础设施,同样正在生成快速增长的数据量。
这里重要的是其原则,而非某一种特定算法。当仪器产生的信息量超过完整存储和移动的实际可行范围时,数据管线就必须越来越早地决定保留哪些信息,以及以何种保真度保留。
因此,AI 在科学中的角色不再仅限于在实验完成后寻找模式。下一个重要步骤可能是以一种形式表示科学数据,在保留可能对下一项发现至关重要的精细结构的同时,大幅降低存储和计算需求。
科学仪器产生的数据已超出基础设施的承载能力
这种新方法的动机源于现代实验科学中的一个非常实际的问题。传感器分辨率和测量速率提升得如此之快,以至于下一代仪器开始生成数据流,而这些数据流完整存储、传输以及后续处理的成本正变得越来越高。
传统有损压缩可以减小文件大小,但也可能去除低振幅信号或精细结构。在普通照片中,这种损失或许无关紧要。然而在科学测量中,一个微小细节可能恰恰包含研究人员所寻找的物理信息。
SLAC 以 X 射线测量中出现的小型散斑为例。这些结构能够揭示材料内部的有序性、缺陷或动态过程。如果压缩算法将它们视为噪声,那么它不仅会减小文件大小,也会降低测量结果的科学价值。
小波分析按尺度分离信息
发表于《Nature Machine Intelligence》的方法名为 WIEN-INR。它将小波分析与隐式神经表示相结合。
首先,小波分析将数据集分离为不同空间尺度上的组成部分,区分大尺度结构与精细细节。随后,神经网络学习以紧凑方式表示不同尺度上的信息。
这种架构有助于避免通用压缩中常见的问题:广阔的背景结构和一个虽小却具有重要科学意义的特征,可能会受到大致相同的处理。
据 SLAC 研究人员 Yuan Ni 介绍,视源数据和所需质量而定,该方法通常可将文件大小缩小 10 至 100 倍。不过,这一结果不应被理解为完全无损压缩。它是在数据量与信号保真度之间进行的可控权衡,其设计目标是比通用压缩方法更好地保留对分析至关重要的精细特征。
这比称该系统“完全不会丢失任何数据”更为准确。
该系统可以仅解码所需区域
该方法的第二项主要优势体现在数据后续使用时。如果研究人员只需要大型压缩数据集中的一个小区域,就无需重建整个文件。
WIEN-INR 可以仅解码选定的感兴趣区域,并以不同尺度和分辨率进行解码。SLAC 指出,使用传统编解码器解压完整的大型文件可能需要数分钟、数小时,甚至数天。选择性解码避免了其中的大部分工作。
在大型科学计算环境中,这种能力可能与压缩比本身同样重要。问题并不仅仅是存储成本。在存储系统、计算节点和研究机构之间移动数据会消耗网络容量、能源和时间。
该方法适用于截然不同的数据类型
研究人员并未将测试局限于单一类型的 X 射线数据集。他们将该方法应用于分子和材料测量、太阳磁场数据以及普通照片。神经网络能够适应不同数据类型,并学习对每类数据重要的特征。
作者并未将 WIEN-INR 描述为现有压缩或数据缩减方法的通用替代方案。相反,在日后恢复精细尺度结构尤为重要的情况下,它可与这些方法协同工作,作为一种额外选择。
加州大学戴维斯分校和卡内基梅隆大学的研究人员也参与了这项研究。该团队使用美国能源部 NERSC 设施的 Perlmutter 超级计算机训练其神经网络。论文《Multi-resolution enhancement for full-spectrum neural representations》于 2026 年 8 月 24 日发表于《Nature Machine Intelligence》。
欧洲研究基础设施面临同样的挑战
该方法的潜力远不止于 SLAC 的某一台仪器。欧洲用于粒子物理、同步辐射科学、天文学、气候研究和卫星观测的基础设施,同样正在生成快速增长的数据量。
这里重要的是其原则,而非某一种特定算法。当仪器产生的信息量超过完整存储和移动的实际可行范围时,数据管线就必须越来越早地决定保留哪些信息,以及以何种保真度保留。
因此,AI 在科学中的角色不再仅限于在实验完成后寻找模式。下一个重要步骤可能是以一种形式表示科学数据,在保留可能对下一项发现至关重要的精细结构的同时,大幅降低存储和计算需求。