Skip to content

Latest commit

 

History

67 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

NucDPosIT - инструмент для поиска позиций диад в данных NGS

Случайный характер гидролиза линкерных областей нуклеосомной ДНК является ключевым этапом, вносящим неопределенность в определение положение диады, точное определение позиции которой возможно при длине фрагмента 147 п.н. Для оценки вероятности ошибки фермента ExoIII при гидролизе линкерных областей нуклеосомной ДНК была адаптирована статистическая модель (10.7554/eLife.16970).

В каждом MNase-Seq эксперименте анализируется популяция клеток, в которых расположение нуклеосом может варьироваться. Для определения наиболее вероятных позиций нуклеосом по набору прочтений была разработана модель смеси нуклеосом. В этой модели каждый фрагмент ДНК может быть отнесен с определенной вероятностью к каждой из позиций диад. Для оптимизации модели разработан стохастический EM-алгоритм с удалением компонент, что позволило найти наиболее вероятные параметры модели — позиции диад и вероятности их обнаружения в конкретной точке (http://www.machinelearning.ru/wiki/images/e/ed/Voron-ML-Bayes.pdf). В результате был разработан программный пакет NucDPosIT (nucleosome position identifier), реализующий основную логику смесевой модели.

Модуль em_nuc_model.

Модуль содержит основную логику модели.

  1. Класс EMNucModel: Этот класс реализует алгоритм EM для кластеризации позиций нуклеосом. Он инициализируется с параметрами, такими как количество нуклеосом (n_nucs), стратегия кластеризации, максимальное количество итераций и другие гиперпараметры. Ключевые методы включают:в

    • fit: Подгонка модели к входным данным и обновление позиций и весов.
    • predict: Прогнозирование меток кластеров для новых данных.
    • score: Вычисление оценки модели на основе логарифмического правдоподобия.
  2. Класс EMNucViewer: Этот класс предназначен для визуализации и анализа результатов из EMNucModel. Он включает методы для создания датафреймов для оконных данных и методы для построения графиков покрытия:

    • plot: Визуализация предсказаний модели и сравнение их с экспериментальными данными.
  3. Обработка Данных: Код обрабатывает входные данные структурированным образом, проверяя координаты и управляя весами, связанными с каждой позицией нуклеосомы.

  4. Визуализация: Функции построения графиков позволяют пользователям визуализировать предсказания модели наряду с экспериментальными данными, что облегчает интерпретацию результатов.

Ключевые Особенности:

  • Гибкость в Стратегии Кластеризации: Пользователи могут выбирать между различными стратегиями на основе EM в зависимости от потребностей.
  • Возможности Визуализации: Класс визуализатора предоставляет инструменты для эффективной визуализации результатов, что упрощает интерпретацию.

Потенциальные Сценарии Использования:

  • Анализ геномных данных, связанных с позиционированием нуклеосом.
  • Кластеризация геномных признаков на основе позиционной информации.
  • Проведение исследовательского анализа данных в области геномики.

About

No description, website, or topics provided.

Resources

Stars

1 star

Watchers

2 watching

Forks

Releases

Packages

Used by

Contributors

Languages