PERBANDINGAN ALGORITMA NAÏVE BAYES DAN SUPPORT VECTOR MACHINE UNTUK DETEKSI SPAM KOMENTAR PADA PLATFORM TIKTOK
Abstract
Abstrak. Perkembangan platform media sosial TikTok yang pesat menyebabkan meningkatnya interaksi pengguna dalam bentuk komentar, namun juga memunculkan permasalahan spam berupa promosi tidak relevan, tautan mencurigakan, konten penipuan, dan pesan bot. Penelitian ini bertujuan membangun model klasifikasi komentar spam dan non-spam pada TikTok menggunakan algoritma Naïve Bayes serta membandingkan performanya dengan Support Vector Machine (SVM). Metode penelitian menggunakan kerangka kerja CRISP-DM yang meliputi Business Understanding, Data Understanding, Data Preparation, Modeling, Evaluation, dan Deployment. Dataset terdiri dari 1.300 komentar TikTok yang terbagi seimbang menjadi 650 komentar spam dan 650 komentar non-spam. Preprocessing teks meliputi case folding, cleansing, tokenizing, stopword removal, dan stemming, dilanjutkan pembobotan fitur TF-IDF (max_features=2000, ngram_range=(1,2)). Hasil pengujian menunjukkan Naïve Bayes mencapai akurasi, precision, recall, dan F1-score sebesar 98,46%, sedangkan SVM mencapai performa sempurna 100% pada seluruh metrik. Perbandingan menunjukkan SVM lebih unggul dibandingkan Naïve Bayes dalam mendeteksi komentar spam pada TikTok. Penelitian ini diharapkan menjadi referensi pengembangan sistem moderasi komentar otomatis berbasis machine learning pada media sosial.
Abstract. The rapid growth of the TikTok platform has increased user interaction through comments, but has also given rise to spam problems such as irrelevant promotions, suspicious links, fraudulent content, and bot messages. This study aims to build a classification model for spam and non-spam comments on TikTok using the Naïve Bayes algorithm and to compare its performance with Support Vector Machine (SVM). The research method refers to the CRISP-DM framework, covering Business Understanding, Data Understanding, Data Preparation, Modeling, Evaluation, and Deployment. The dataset consists of 1,300 TikTok comments evenly divided into 650 spam and 650 non-spam comments. Text preprocessing includes case folding, cleansing, tokenizing, stopword removal, and stemming, followed by TF-IDF feature weighting (max_features=2000, ngram_range=(1,2)). Results show that Naïve Bayes achieved 98.46% accuracy, precision, recall, and F1-score, while SVM achieved a perfect 100% on all metrics. The comparison shows that SVM outperforms Naïve Bayes in detecting spam comments on TikTok. This research is expected to serve as a reference for developing automated, machine-learning-based comment moderation systems on social media.
Downloads
References
We Are Social and Hootsuite, "Digital 2024: Global Overview Report," 2024. [Online]. Available: https://wearesocial.com/
A. Wahyuningtyas, I. S. Sitanggang, and H. Khotimah, "Deteksi Spam pada Twitter Menggunakan Algoritme Naïve Bayes," Jurnal Ilmu Komputer dan Agri-Informatika, vol. 7, no. 1, pp. 31-40, 2020.
R. N. Devita, H. W. Herwanto, and A. P. Wibawa, "Perbandingan Kinerja Metode Naïve Bayes dan K-Nearest Neighbor untuk Klasifikasi Artikel Berbahasa Indonesia," Jurnal Teknologi Informasi dan Ilmu Komputer, vol. 5, no. 4, pp. 427-434, 2018.
M. Edwin, A. Chairul, and R. Dewi, "Memahami Spam Terhadap Digitalisasi Masyarakat di Media Sosial," Jurnal Pengabdian Masyarakat, vol. 2, no. 1, 2023.
S. A. P. Perdana, T. B. Aji, and R. Ferdiana, "Aspect Category Classification dengan Pendekatan Machine Learning Menggunakan Dataset Bahasa Indonesia," Jurnal Nasional Teknik Elektro dan Teknologi Informasi, vol. 10, no. 3, 2021.
B. Hakim, "Analisa Sentimen Data Text Preprocessing pada Data Mining dengan Menggunakan Machine Learning," Journal of Business and Audit Information Systems, vol. 4, no. 2, pp. 16-22, 2021.
R. Tengku, "Implementasi Text Mining Terhadap Analisis Sentimen Masyarakat Dunia di Twitter Menggunakan K-Fold Cross Validation dan Naïve Bayes Classifier," KLIK: Kajian Ilmiah Informatika dan Komputer, vol. 2, no. 5, pp. 178-185, 2022.
R. Fitriansyah, "Pemanfaatan Vector Space Model Algoritma Nazief Andriani Pembobotan TF-IDF pada Prototipe Klasifikasi Teks Bahasa Indonesia," Jurnal Teknologi Informasi (JUTECH), vol. 2, no. 1, pp. 37-47, 2021.
S. Hidayat, H. Napitupulu, and N. Gusriani, "Penerapan Model Support Vector Machine pada Kasus Klasifikasi Teks Berdasarkan Tujuan SDGs Ke Tiga, Empat, dan Enam," SISINFO: Jurnal Sistem Informasi dan Informatika, vol. 6, no. 2, pp. 115-124, 2024.
M. K. Suryadewiansyah and T. E. E. Tju, "Naïve Bayes dan Confusion Matrix untuk Efisiensi Analisa Intrusion Detection System Alert," Jurnal Nasional Teknologi dan Sistem Informasi (TEKNOSI), vol. 8, no. 2, pp. 81-88, 2022.
Y. A. Singgalen, "Penerapan CRISP-DM dalam Klasifikasi Sentimen dan Analisis Perilaku Pembelian Layanan Akomodasi Hotel Berbasis Algoritma Decision Tree (DT)," Jurnal Sistem Komputer dan Informatika (JSON), vol. 5, no. 2, pp. 237-248, 2023.
M. A. Sofyan, N. Rahaningsih, and R. D. Dana, "Deteksi SMS Spam Berbahasa Indonesia Menggunakan Algoritma Support Vector Machine," Jurnal Mahasiswa Teknik Informatika, vol. 8, no. 3, 2024.
R. Lutfiyani and N. Retnowati, "Implementasi Pendeteksian Spam Email Menggunakan Metode Text Mining dengan Algoritma Naïve Bayes dan Decision Tree J48," Jurnal Komputer dan Informatika, vol. 9, no. 2, pp. 244-252, 2021.
N. Q. Fitriyah, H. Oktavianto, and H., "Deteksi Spam Pada Email Berbasis Fitur Konten Menggunakan Naïve Bayes," JUSTINDO (Jurnal Sistem & Teknologi Informasi Indonesia), vol. 5, no. 1, pp. 1-7, 2020.
M. H. S. Ajat, "Klasifikasi SMS Spam dengan Komparasi Metode SVM dan Naïve Bayes," Method: Jurnal Teknik Informatika dan Sistem Informasi, vol. 9, no. 1, pp. 31-34, 2023.
L. Ode et al., "Deteksi Komentar Spam Perjudian Online di YouTube Menggunakan K-Nearest Neighbors dan Naïve Bayes," JIPI (Jurnal Ilmiah Penelitian dan Pembelajaran Informatika), 2026.
M. G. Andriawan and T. Ernawati, "Penggunaan Algoritma Naïve Bayes dan Support Vector Machine untuk Analisis Sentimen Konflik Palestina dan Israel pada Platform X," Jurnal Informatika dan Teknik Elektro Terapan, vol. 12, no. 3, 2024, doi: 10.23960/jitet.v12i3.4943.

This work is licensed under a Creative Commons Attribution-NonCommercial 4.0 International License.



