Случайный характер гидролиза линкерных областей нуклеосомной ДНК является ключевым этапом, вносящим неопределенность в определение положение диады, точное определение позиции которой возможно при длине фрагмента 147 п.н. Для оценки вероятности ошибки фермента ExoIII при гидролизе линкерных областей нуклеосомной ДНК была адаптирована статистическая модель (10.7554/eLife.16970).
В каждом MNase-Seq эксперименте анализируется популяция клеток, в которых расположение нуклеосом может варьироваться. Для определения наиболее вероятных позиций нуклеосом по набору прочтений была разработана модель смеси нуклеосом. В этой модели каждый фрагмент ДНК может быть отнесен с определенной вероятностью к каждой из позиций диад. Для оптимизации модели разработан стохастический EM-алгоритм с удалением компонент, что позволило найти наиболее вероятные параметры модели — позиции диад и вероятности их обнаружения в конкретной точке (http://www.machinelearning.ru/wiki/images/e/ed/Voron-ML-Bayes.pdf). В результате был разработан программный пакет NucDPosIT (nucleosome position identifier), реализующий основную логику смесевой модели.
Модуль содержит основную логику модели.
-
Класс EMNucModel: Этот класс реализует алгоритм EM для кластеризации позиций нуклеосом. Он инициализируется с параметрами, такими как количество нуклеосом (
n_nucs), стратегия кластеризации, максимальное количество итераций и другие гиперпараметры. Ключевые методы включают:вfit: Подгонка модели к входным данным и обновление позиций и весов.predict: Прогнозирование меток кластеров для новых данных.score: Вычисление оценки модели на основе логарифмического правдоподобия.
-
Класс EMNucViewer: Этот класс предназначен для визуализации и анализа результатов из
EMNucModel. Он включает методы для создания датафреймов для оконных данных и методы для построения графиков покрытия:plot: Визуализация предсказаний модели и сравнение их с экспериментальными данными.
-
Обработка Данных: Код обрабатывает входные данные структурированным образом, проверяя координаты и управляя весами, связанными с каждой позицией нуклеосомы.
-
Визуализация: Функции построения графиков позволяют пользователям визуализировать предсказания модели наряду с экспериментальными данными, что облегчает интерпретацию результатов.
- Гибкость в Стратегии Кластеризации: Пользователи могут выбирать между различными стратегиями на основе EM в зависимости от потребностей.
- Возможности Визуализации: Класс визуализатора предоставляет инструменты для эффективной визуализации результатов, что упрощает интерпретацию.
- Анализ геномных данных, связанных с позиционированием нуклеосом.
- Кластеризация геномных признаков на основе позиционной информации.
- Проведение исследовательского анализа данных в области геномики.