БАС как задача на данные: почему один метод не тянет
Боковой амиотрофический склероз изучают по геномике, транскриптомике и белкам порознь. Объединение этих слоёв в один конвейер меняет то, что вообще можно найти в данных о болезни.

Данные о боковом амиотрофическом склерозе (БАС) годами лежали в отдельных хранилищах: секвенирование ДНК в одном формате, экспрессия генов в другом, протеомика в третьем. Каждая группа изучала свой слой, а болезнь между тем убивает двигательные нейроны за несколько лет после диагноза, и ни один слой по отдельности не объясняет почему. Смысл «объединения биологических инструментов» простой и инженерный: собрать разнородные измерения одного пациента в общую систему, где сигнал из одного слоя можно проверить по другому.
Почему один метод не тянет
БАС — не одна болезнь, а группа состояний с разной генетикой. Есть наследственные формы, связанные с известными генами (например, мутации в SOD1, C9orf72, TARDBP, FUS), и есть спорадические случаи, где явной единичной причины не видно. Именно во второй группе один метод анализа буксует: генетика не показывает мутации, а белковые агрегаты в нейронах при этом есть.
Отсюда идея мультиомики — совместного анализа нескольких «омных» слоёв на одних и тех же образцах:
- Геномика — что записано в ДНК: варианты, мутации, повторы.
- Транскриптомика — какие гены реально работают в клетке и насколько активно.
- Протеомика — какие белки присутствуют, в каком количестве и как модифицированы.
- Эпигеномика — метки на ДНК, включающие и выключающие гены без изменения последовательности.
Каждый слой ловит то, что упускают остальные. Мутация в гене может не менять уровень его РНК, но резко менять поведение белка. Совмещение слоёв — это способ отличить шум от настоящего механизма.
Что мешает объединению технически
Проблема не в том, что данных мало. Проблема в том, что они несопоставимы по формату, шкале и качеству.
Разные форматы и шкалы
Секвенатор выдаёт риды, масс-спектрометр — спектры, микрочип — интенсивности сигнала. Прежде чем что-то объединять, всё это нужно привести к согласованным матрицам «образец × признак», а признаки разных слоёв живут в разных диапазонах значений. Наивно склеить таблицы нельзя: слой с большими числами перетянет на себя весь результат.
Batch-эффекты*
Образцы, обработанные в разных лабораториях, в разные дни и на разных приборах, несут технический след, который легко спутать с биологией. Без коррекции модель «выучит» лабораторию, а не болезнь.
Пропуски
У одного пациента есть протеомика, но нет транскриптомики. У другого наоборот. Полностью заполненная матрица по всем слоям и всем пациентам — редкость, а многие методы интеграции такую матрицу требуют.
Объединение биологических инструментов — это в первую очередь задача на данные: не «какой метод точнее», а «как заставить три несопоставимых источника говорить на одном языке, не потеряв то, ради чего их собирали».
Как это устроено на уровне конвейера
Типичный конвейер мультиомной интеграции проходит несколько стадий. Порядок важен: коррекция и нормализация должны идти до объединения, иначе интеграция закрепит артефакты.
- Приведение каждого слоя к матрице «образец × признак».
- Нормализация внутри слоя и коррекция технических batch-эффектов.
- Согласование идентификаторов образцов между слоями.
- Интеграция — снижение размерности или общая модель, находящая структуру сразу по всем слоям.
- Интерпретация: какие гены, белки и пути объясняют различия между группами.
На стадии интеграции есть развилка подходов. Ниже — упрощённое сравнение трёх семейств методов; конкретные реализации и их точность стоит сверять по документации инструмента, а не по этой таблице.
| Подход | Идея | Сильная сторона | Слабое место |
|---|---|---|---|
| Ранняя интеграция | Склеить слои в одну матрицу до анализа | Простота | Слои с большими значениями доминируют |
| Промежуточная (факторная) | Найти общие латентные факторы по всем слоям | Учитывает связи между слоями | Факторы сложно интерпретировать |
| Поздняя интеграция | Анализировать слои отдельно, объединять выводы | Терпима к пропускам | Теряет межслойные взаимодействия |
Как выглядит подготовка данных
Даже до всякой интеграции значительная часть работы — это выравнивание таблиц по образцам и приведение шкал. Схематично, на Python с pandas это выглядит так:
import pandas as pd
# каждый слой: строки — образцы, столбцы — признаки
genomics = pd.read_csv("genomics.csv", index_col="sample_id")
transcriptomics = pd.read_csv("rna.csv", index_col="sample_id")
proteomics = pd.read_csv("protein.csv", index_col="sample_id")
# оставляем только образцы, которые есть во всех слоях
common = (genomics.index
.intersection(transcriptomics.index)
.intersection(proteomics.index))
layers = {
"gen": genomics.loc[common],
"rna": transcriptomics.loc[common],
"prot": proteomics.loc[common],
}
# z-масштабирование внутри каждого слоя, чтобы шкалы не перетягивали
for name, df in layers.items():
layers[name] = (df - df.mean()) / df.std(ddof=0)
Дальше уже подключают специализированные пакеты интеграции. Ключевая мысль: intersection по образцам и масштабирование внутри слоя — не косметика, а то, без чего результат будет отражать технику сбора, а не биологию.
Что это меняет для исследования БАС
Практическая цель — не красивый график, а поиск подтипов болезни, которые видны только в пересечении слоёв. Если у части пациентов совпадает специфический профиль экспрессии и профиль белковых модификаций, это кандидат в биомаркер: то, что можно измерить и по чему группировать больных для клинических испытаний. Именно неоднородность БАС считается одной из причин, почему испытания единого лекарства проваливаются — препарат может работать на подгруппе, размытой внутри общей выборки.
Цена вопроса измеряется не в деньгах на анализ, а в годах. Диагноз ставится с задержкой, среднее время дожития короткое, и каждый провалившийся из-за смешанных подгрупп клинический тест — это упущенное окно для реальных пациентов.
* Batch-эффект — систематические искажения в данных, вызванные условиями обработки образцов (лаборатория, прибор, дата, реагенты), а не биологическими различиями. Если их не убрать, модель может принять техническую разницу за сигнал болезни.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: pandas documentation — merging and joining data
Частые вопросы
Чем мультиомика отличается от обычного секвенирования?
Существует ли одно лекарство от БАС?
Зачем масштабировать данные перед объединением слоёв?
Что делать, если у части пациентов не хватает какого-то слоя данных?
Нужен ли для мультиомики специальный софт или хватит pandas?
Можно ли применять эти подходы не только к БАС?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.