ANALISIS KARAKTERISTIK DATASET TERJEMAHAN AL-QUR'AN BAHASA INDONESIA UNTUK KLASIFIKASI TEKS MULTI-LABEL

  • Ismail Akbar
    Program Studi S1 Sistem dan Teknologi Informasi, Universitas Widya Gama, Malang
  • Affi Nizar Suksmawati
    Program Studi S1 Sistem dan Teknologi Informasi, Universitas Widya Gama, Malang
  • Firman Nurdiyansyah
    Program Studi S1 Teknik Informatika, Universitas Widya Gama, Malang
  • Devita Putri Anggraini
    Program Studi S1 Sistem dan Teknologi Informasi, Universitas Widya Gama, Malang
DOI: https://doi.org/10.23960/jitet.v14i3.10593
Keywords Analisis dataset, Multi-label classification, Karakteristik dataset, Al-Qur'an Bahasa Indonesia, Label correlation
Abstract Views (Last 12 Months)
10 Abstract Views
9 Downloads

Abstract

Karakteristik dataset merupakan salah satu faktor yang memengaruhi keberhasilan klasifikasi teks multi-label. Meskipun berbagai penelitian telah mengembangkan model klasifikasi pada terjemahan Al-Qur'an Bahasa Indonesia, analisis terhadap karakteristik intrinsik dataset masih terbatas. Penelitian ini bertujuan menganalisis karakteristik dataset sebagai dasar pengembangan metode klasifikasi multi-label. Dataset berasal dari terjemahan resmi Al-Qur'an Kementerian Agama Republik Indonesia Tahun 2022 yang terdiri atas 6.236 ayat dari 114 surah, sedangkan analisis multi-label dilakukan pada subset berlabel sebanyak 461 ayat dengan empat label tematik, yaitu Tauhid, Ibadah, Akhlaq, dan Sejarah. Analisis meliputi profil dataset, karakteristik dokumen, distribusi label, Label Cardinality, Label Density, dan Label Correlation menggunakan matriks co-occurrence, heatmap, serta network graph. Hasil penelitian menunjukkan distribusi label yang relatif seimbang, nilai Label Cardinality sebesar 2,02, Label Density sebesar 0,506, serta hubungan antartema pada tingkat sedang hingga kuat. Selain itu, variasi panjang dokumen menunjukkan keragaman representasi teks yang memadai. Temuan ini menunjukkan bahwa dataset memiliki kompleksitas multi-label yang representatif dan layak digunakan sebagai dasar pengembangan serta evaluasi metode klasifikasi multi-label.

Downloads

Download data is not yet available.

References

K. Taha, P. D. Yoo, C. Yeun, D. Homouz, and A. Taha, “A comprehensive survey of text classification techniques and their research applications: Observational and experimental insights,” Nov. 01, 2024, Elsevier Ireland Ltd. doi: 10.1016/j.cosrev.2024.100664.

A. Palanivinayagam, C. Z. El-Bayeh, and R. Damaševičius, “Twenty Years of Machine-Learning-Based Text Classification: A Systematic Review,” Algorithms, vol. 16, no. 5, May 2023, doi: 10.3390/a16050236.

S. Huang et al., “Application of Label Correlation in Multi-Label Classification: A Survey,” Oct. 01, 2024, Multidisciplinary Digital Publishing Institute (MDPI). doi: 10.3390/app14199034.

S. Minaee, N. Kalchbrenner, E. Cambria, N. Nikzad, M. Chenaghlu, and J. Gao, “Deep Learning–based Text Classification: A Comprehensive Review,” ACM Comput. Surv., vol. 54, no. 3, Apr. 2021, doi: 10.1145/3439726.

J. Fields, K. Chovanec, and P. Madiraju, “A Survey of Text Classification With Transformers: How Wide? How Large? How Long? How Accurate? How Expensive? How Safe?,” IEEE Access, vol. 12, pp. 6518–6531, 2024, doi: 10.1109/ACCESS.2024.3349952.

D. R. Putri, E. Y. Puspaningrum, and H. Maulana, “Klasifikasi Sentimen Tentang Pemindahan Ibu Kota Negara Indonesia Dengan Convolutional Neural Network Menggunakan Glove Dan Fasttext,” Jurnal Informatika Dan Teknik Elektro Terapan, vol. 12, no. 3, 2024, doi: https://doi.org/10.23960/jitet.v12i3.4882.

M. H. Bashir et al., “Arabic natural language processing for Qur’anic research: a systematic review,” Artif. Intell. Rev., vol. 56, no. 7, pp. 6801–6854, Jul. 2023, doi: 10.1007/s10462-022-10313-2.

A. Adeleke, N. Samsudin, A. Mustapha, and S. Ahmad Khalid, “Automating quranic verses labeling using machine learning approach,” Indonesian Journal of Electrical Engineering and Computer Science, vol. 16, no. 2, pp. 925–931, 2019, doi: 10.11591/ijeecs.v16.i2.pp925-931.

A. Tubaishat, S. Razzaq, F. Maqbool, M. Ilyas, and M. S. Khan, “Quran Wordnet: A Framework for Semantic and Sentiment Search,” in 2023 7th IEEE Congress on Information Science and Technology (CiSt), 2023, pp. 24–32. doi: 10.1109/CiSt56084.2023.10409881.

I. Akbar, M. Faisal, and T. Chamidy, “Multi-Label Classification of Indonesian Qur’an Translation using Long Short-Term Memory Model,” Computer Network, Computing, Electronics, and Control Journal, vol. 4, no. 3, pp. 119–128, 2019, [Online]. Available: https://kinetik.umm.ac.id/index.php/kinetik/article/view/1901

A. Rofiqul Muslikh, I. Akbar, D. Rosal Ignatius Moses Setiadi, and H. Md Mehedul Islam, “Multi-label Classification of Indonesian Al-Quran Translation based CNN, BiLSTM, and FastText,” 2024. doi: https://doi.org/10.62411/tc.v23i1.9925.

Y. Gong, G. Liu, Y. Xue, R. Li, and L. Meng, “A survey on dataset quality in machine learning,” Inf. Softw. Technol., vol. 162, p. 107268, 2023, doi: https://doi.org/10.1016/j.infsof.2023.107268.

P. Singh, “Systematic review of data-centric approaches in artificial intelligence and machine learning,” Data Science and Management, vol. 6, no. 3, pp. 144–157, 2023, doi: https://doi.org/10.1016/j.dsm.2023.06.001.

M. Priestley, F. O’donnell, and E. Simperl, “A Survey of Data Quality Requirements That Matter in ML Development Pipelines,” J. Data and Information Quality, vol. 15, no. 2, Jun. 2023, doi: 10.1145/3592616.

A. N. Tarekegn, M. Giacobini, and K. Michalak, “A review of methods for imbalanced multi-label classification,” Pattern Recognit., vol. 118, p. 107965, 2021, doi: https://doi.org/10.1016/j.patcog.2021.107965.

N. E. García-Pedrajas, J. M. Cuevas-Muñoz, G. Cerruela-García, and A. de Haro-García, “A thorough experimental comparison of multilabel methods for classification performance,” Jul. 01, 2024, Elsevier Ltd. doi: 10.1016/j.patcog.2024.110342.

W. Hu, Q. Fan, H. Yan, X. Xu, S. Huang, and K. Zhang, “A Survey of Multi-Label Text Classification Under Few-Shot Scenarios,” Aug. 01, 2025, Multidisciplinary Digital Publishing Institute (MDPI). doi: 10.3390/app15168872.

N. Li, B. Kang, and T. De Bie, “Your Next State-of-the-Art Could Come from Another Domain: A Cross-Domain Analysis of Hierarchical Text Classification,” Mach. Learn., vol. 115, no. 4, Apr. 2026, doi: 10.1007/s10994-025-06993-w.

Y. Zou, X. Hu, P. Li, Y. Wu, and J. Hu, “Online multi-label classification under noisy and changing label distribution,” Pattern Recogn., vol. 173, no. C, Jun. 2026, doi: 10.1016/j.patcog.2025.112892.

Cover
Published
2026-08-13
How to Cite
Akbar, I., Suksmawati, A. N., Nurdiyansyah, F., & Anggraini, D. P. (2026). ANALISIS KARAKTERISTIK DATASET TERJEMAHAN AL-QUR’AN BAHASA INDONESIA UNTUK KLASIFIKASI TEKS MULTI-LABEL. Jurnal Informatika Dan Teknik Elektro Terapan, 14(3). https://doi.org/10.23960/jitet.v14i3.10593