Новый метод ИИ сокращает научные наборы данных до 100 раз
Исследователи из Национальной ускорительной лаборатории SLAC разработали метод сжатия на основе нейронной сети, который в тестах сокращал объёмы научных данных в 10–100 раз в зависимости от исходных данных и требуемого уровня точности. Ключевая идея заключается не в одинаковом сжатии всех частей данных, а в сохранении структур на разных пространственных масштабах, которые могут оказаться критически важными для научного анализа. Исследование опубликовано в Nature Machine Intelligence.
Научные приборы производят больше данных, чем способна принять инфраструктура
Мотивация для нового метода связана с очень практической проблемой современной экспериментальной науки. Разрешение датчиков и частота измерений растут настолько быстро, что приборы следующего поколения начинают генерировать потоки данных, которые становится всё дороже хранить полностью, передавать и обрабатывать позднее.
Обычное сжатие с потерями может уменьшить размер файлов, однако оно также способно удалить низкоамплитудные сигналы или мелкие структуры. В обычной фотографии такая потеря может не иметь значения. Однако в научном измерении крошечная деталь может содержать именно ту физическую информацию, которую ищут исследователи.
SLAC приводит в качестве одного из примеров небольшие пятна, появляющиеся в рентгеновских измерениях. Эти структуры могут раскрывать внутреннее упорядочение, дефекты или динамику материала. Если алгоритм сжатия воспринимает их как шум, он может уменьшить не только размер файла, но и научную ценность измерения.
Вейвлет-анализ разделяет информацию по масштабам
Метод, опубликованный в Nature Machine Intelligence, называется WIEN-INR. Он объединяет вейвлет-анализ с неявными нейронными представлениями.
Сначала вейвлет-анализ разделяет набор данных на компоненты разных пространственных масштабов, отличая крупномасштабные структуры от мелких деталей. Затем нейронная сеть учится компактно представлять информацию на этих различных масштабах.
Такая архитектура помогает избежать распространённой проблемы универсального сжатия, при которой широкая фоновая структура и крошечный, но научно важный элемент могут обрабатываться практически одинаково.
По словам исследователя SLAC Юаня Ни, метод обычно сокращал размеры файлов в 10–100 раз в зависимости от исходных данных и требуемого качества. Однако этот результат не следует трактовать как полностью сжатие без потерь. Это контролируемый компромисс между объёмом данных и точностью передачи сигнала, предназначенный для лучшего сохранения важных для анализа мелких деталей по сравнению с универсальным подходом к сжатию.
Это более точное описание, чем утверждение, что система «вообще не теряет никаких данных».
Система может декодировать только нужную область
Второе важное преимущество метода проявляется при последующем использовании данных. Если исследователю требуется лишь небольшая область из большого сжатого набора данных, нет необходимости восстанавливать весь файл.
WIEN-INR может декодировать только выбранную область интереса и делать это в разных масштабах и разрешениях. SLAC отмечает, что распаковка полного большого файла с использованием обычного кодека может занимать минуты, часы или даже дни. Выборочное декодирование позволяет избежать значительной части этой работы.
В крупных средах научных вычислений эта возможность может быть столь же важна, как и сам коэффициент сжатия. Проблема заключается не только в стоимости хранения. Перемещение данных между системами хранения, вычислительными узлами и исследовательскими учреждениями потребляет пропускную способность сети, энергию и время.
Метод сработал с очень разными типами данных
Исследователи не ограничили свои испытания одним типом рентгеновских наборов данных. Они применили метод к молекулярным измерениям и измерениям материалов, данным о магнитном поле Солнца и обычным фотографиям. Нейронная сеть смогла адаптироваться к различным типам данных и изучить характеристики, важные для каждого из них.
Авторы не представляют WIEN-INR как универсальную замену существующим методам сжатия или сокращения данных. Вместо этого он может работать вместе с ними как дополнительный вариант в случаях, когда особенно важно позднее восстановить мелкомасштабную структуру.
В исследовании также участвовали исследователи из Калифорнийского университета в Дейвисе и Университета Карнеги — Меллона. Команда обучала свои нейронные сети с использованием суперкомпьютера Perlmutter в центре NERSC Министерства энергетики США. Статья «Multi-resolution enhancement for full-spectrum neural representations» была опубликована в Nature Machine Intelligence 24 августа 2026 года.
Исследовательская инфраструктура Европы сталкивается с той же проблемой
Потенциал метода выходит далеко за пределы какого-либо одного прибора в SLAC. Европейская инфраструктура для физики частиц, синхротронной науки, астрономии, климатических исследований и спутниковых наблюдений также генерирует быстро растущие объёмы данных.
Здесь важен принцип, а не какой-то один конкретный алгоритм. Когда прибор производит больше информации, чем практически возможно хранить и перемещать целиком, конвейер обработки данных вынужден всё раньше решать, какую информацию сохранять и с каким уровнем точности.
Таким образом, роль ИИ в науке больше не ограничивается поиском закономерностей после проведения эксперимента. Следующим важным шагом может стать представление научных данных в форме, которая резко сокращает потребности в хранении и вычислениях, сохраняя при этом мелкие структуры, способные оказаться важными для следующего открытия.
Научные приборы производят больше данных, чем способна принять инфраструктура
Мотивация для нового метода связана с очень практической проблемой современной экспериментальной науки. Разрешение датчиков и частота измерений растут настолько быстро, что приборы следующего поколения начинают генерировать потоки данных, которые становится всё дороже хранить полностью, передавать и обрабатывать позднее.
Обычное сжатие с потерями может уменьшить размер файлов, однако оно также способно удалить низкоамплитудные сигналы или мелкие структуры. В обычной фотографии такая потеря может не иметь значения. Однако в научном измерении крошечная деталь может содержать именно ту физическую информацию, которую ищут исследователи.
SLAC приводит в качестве одного из примеров небольшие пятна, появляющиеся в рентгеновских измерениях. Эти структуры могут раскрывать внутреннее упорядочение, дефекты или динамику материала. Если алгоритм сжатия воспринимает их как шум, он может уменьшить не только размер файла, но и научную ценность измерения.
Вейвлет-анализ разделяет информацию по масштабам
Метод, опубликованный в Nature Machine Intelligence, называется WIEN-INR. Он объединяет вейвлет-анализ с неявными нейронными представлениями.
Сначала вейвлет-анализ разделяет набор данных на компоненты разных пространственных масштабов, отличая крупномасштабные структуры от мелких деталей. Затем нейронная сеть учится компактно представлять информацию на этих различных масштабах.
Такая архитектура помогает избежать распространённой проблемы универсального сжатия, при которой широкая фоновая структура и крошечный, но научно важный элемент могут обрабатываться практически одинаково.
По словам исследователя SLAC Юаня Ни, метод обычно сокращал размеры файлов в 10–100 раз в зависимости от исходных данных и требуемого качества. Однако этот результат не следует трактовать как полностью сжатие без потерь. Это контролируемый компромисс между объёмом данных и точностью передачи сигнала, предназначенный для лучшего сохранения важных для анализа мелких деталей по сравнению с универсальным подходом к сжатию.
Это более точное описание, чем утверждение, что система «вообще не теряет никаких данных».
Система может декодировать только нужную область
Второе важное преимущество метода проявляется при последующем использовании данных. Если исследователю требуется лишь небольшая область из большого сжатого набора данных, нет необходимости восстанавливать весь файл.
WIEN-INR может декодировать только выбранную область интереса и делать это в разных масштабах и разрешениях. SLAC отмечает, что распаковка полного большого файла с использованием обычного кодека может занимать минуты, часы или даже дни. Выборочное декодирование позволяет избежать значительной части этой работы.
В крупных средах научных вычислений эта возможность может быть столь же важна, как и сам коэффициент сжатия. Проблема заключается не только в стоимости хранения. Перемещение данных между системами хранения, вычислительными узлами и исследовательскими учреждениями потребляет пропускную способность сети, энергию и время.
Метод сработал с очень разными типами данных
Исследователи не ограничили свои испытания одним типом рентгеновских наборов данных. Они применили метод к молекулярным измерениям и измерениям материалов, данным о магнитном поле Солнца и обычным фотографиям. Нейронная сеть смогла адаптироваться к различным типам данных и изучить характеристики, важные для каждого из них.
Авторы не представляют WIEN-INR как универсальную замену существующим методам сжатия или сокращения данных. Вместо этого он может работать вместе с ними как дополнительный вариант в случаях, когда особенно важно позднее восстановить мелкомасштабную структуру.
В исследовании также участвовали исследователи из Калифорнийского университета в Дейвисе и Университета Карнеги — Меллона. Команда обучала свои нейронные сети с использованием суперкомпьютера Perlmutter в центре NERSC Министерства энергетики США. Статья «Multi-resolution enhancement for full-spectrum neural representations» была опубликована в Nature Machine Intelligence 24 августа 2026 года.
Исследовательская инфраструктура Европы сталкивается с той же проблемой
Потенциал метода выходит далеко за пределы какого-либо одного прибора в SLAC. Европейская инфраструктура для физики частиц, синхротронной науки, астрономии, климатических исследований и спутниковых наблюдений также генерирует быстро растущие объёмы данных.
Здесь важен принцип, а не какой-то один конкретный алгоритм. Когда прибор производит больше информации, чем практически возможно хранить и перемещать целиком, конвейер обработки данных вынужден всё раньше решать, какую информацию сохранять и с каким уровнем точности.
Таким образом, роль ИИ в науке больше не ограничивается поиском закономерностей после проведения эксперимента. Следующим важным шагом может стать представление научных данных в форме, которая резко сокращает потребности в хранении и вычислениях, сохраняя при этом мелкие структуры, способные оказаться важными для следующего открытия.