Derin Sinir Ağları ve Klasik Makine Öğrenimi Modelleri Kullanılarak Küçük İlaç Moleküllerinin Aktivite Sınıflandırması
Türkiye Klinikleri Biyoistatistik Dergisi, cilt.14, sa.2, ss.70-80, 2022 (TRDizin)
- Yayın Türü: Makale / Tam Makale
- Cilt numarası: 14 Sayı: 2
- Basım Tarihi: 2022
- Doi Numarası: 10.5336/biostatic.2022-88704
- Dergi Adı: Türkiye Klinikleri Biyoistatistik Dergisi
- Derginin Tarandığı İndeksler: TR DİZİN (ULAKBİM)
- Sayfa Sayıları: ss.70-80
- Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
- Trakya Üniversitesi Adresli: Evet
Özet
Amaç: İlaç keşif çalışmalarının erken evresindeki temel amaç, belirli bir reseptöre karşı aktivite gösteren küçük ilaç moleküllerini tespit etmektir. Bu amaçla küçük ilaç molekülleri, yüksek verimli tarama [high-throughput screening (HTS)] deneyleri gerçekleştirilerek aktif veya inaktif olarak sınıflandırılır. Bu deneylerden elde edilen veri setleri PubChem veri tabanına yüklenir. Bu veri tabanı, HTS deneyleri yoluyla elde edilen 1 milyondan fazla biyo-tahlil veri setini içerir. Alternatif olarak, PubChem veri tabanındaki veri kümeleri kullanılarak sınıflandırma modelleri de geliştirilebilir. Gereç ve Yöntemler: Bu çalışmada, PubChem veri tabanından farklı derecelerde dengesizlik yapısına sahip 5 adet veri seti elde ettik. Bu veri setlerini, küçük ilaç moleküllerinin aktif veya inaktif olarak sınıflandırılması için derin sinir ağları [deep neural networks (DNN)] kullanarak eğittik. DNN modellerinin test seti performansları, destek vektör makineleri [support vector machines (SVM)] ve rastgele orman [random forest (RF)] algoritmaları ile karşılaştırılmıştır. Bulgular: DNN modeli, dengeli doğruluk oranı (en küçük-en büyük: 0.764-0.865), duyarlılık (en küçük-en büyük: 0.630-0.823), F1-skoru (en küçüken büyük: 0.496-0.843) ve Matthews korelasyon katsayısı (en küçük-en büyük: 0.439-0.721) açısından SVM ve RF’den daha iyi performans göstermiştir. Sonuç: Sonuçlarımız DNN’nin dengesiz sınıf yapıları durumunda, klasik makine öğrenimi algoritmalarından daha iyi performans gösterdiğini, bu nedenle ilaç keşif çalışmalarının erken aşamasında iyi performans gösterebilen bir makine öğrenimi algoritması olduğunu ortaya koymuştur.
Objective: The main goal in the early phase of drug discovery studies is to detect small drug molecules that show activity against a specific receptor. For this purpose, small drug molecules are classified as actives or inactives by performing high-throughput screening (HTS) experiments. The datasets obtained from these experiments are uploaded to the PubChem database. This database contains more than one million bioassays that are obtained through HTS experiments. Alternatively, classification models can be developed using datasets in the PubChem database. Material and Methods: In this study, we obtained 5 datasets with different degrees of imbalance structure from the PubChem database. We trained these datasets using deep neural networks (DNN) for the classification of small drug molecules as actives or inactives. The test set performances of DNN models were compared with the support vector machines (SVM) and random forest (RF) algorithms. Results: The DNN achieved better balanced accuracy (minimum-maximum: 0.764-0.865), recall (minimum-maximum: 0.630-0.823), F1-score (minimum-maximum: 0.496-0.843) and Matthews correlation coefficient (minimum-maximum: 0.439- 0.721) compared to the SVM and RF. Conclusion: Our results showed that the DNN is a well-performed machine learning algorithm that can be in the early phase of drug discovery studies since it performs better than traditional machine learning algorithms in the case of imbalanced class structures.