Implementasi SMOTE dan GrideSearchCV untuk Klasifikasi Sentimen Imbalanced pada Isu Reshuffle Kabinet
Abstract
Abstract
Social media has become a rapid barometer of public response to national issues. On X (Twitter), users not only share information but also shape opinions, criticism, and support toward political events. Sentiment analysis is therefore essential for capturing public perceptions explicitly and tracing the dynamics of policy acceptance in digital spaces. This study evaluates the effectiveness of SMOTE and GridSearchCV in improving machine learning performance for imbalanced sentiment classification. It is an applied quantitative study with a comparative computational experimental design. The dataset comprises 6,115 Indonesian-language tweets about a cabinet reshuffle, with (83.5%) negative and 16.5% positive sentiment. Data are preprocessed, labeled using a lexicon-based dictionary, vectorized with TF-IDF, and split into training and test sets. Logistic Regression, Naïve Bayes, SVM, and Random Forest are compared under three scenarios: baseline (no SMOTE), SMOTE, and SMOTE with GridSearchCV for hyperparameter search. Macro F1 is the primary metric, supported by a confusion matrix for per-class evaluation, ensuring minority-class performance is not obscured by high aggregate accuracy. Results show the baseline achieves high accuracy (86.02–89.13%) but low positive recall (21.29–42.57%) and macro F1 (62.83–75.09%), indicating majority-class bias. With SMOTE, positive recall rises (58.42–66.34%) and macro F1 improves (71.50–79.11%) while accuracy remains relatively stable (81.77–88.39%). The best model is Logistic Regression with (88.23%) accuracy, (78.90%) macro F1, and (65.84%) positive recall. In conclusion, SMOTE reduces majority-class bias, GridSearchCV stabilizes performance gains, and macro F1 proves more representative than accuracy for imbalanced sentiment data.
Abstrak
Media sosial kini menjadi barometer cepat respon publik terhadap isu nasional. Melalui X/Twitter, masyarakat bukan hanya berbagi informasi, tetapi juga membentuk opini, kritik, dan dukungan atas peristiwa politik. Karena itu, analisis sentimen penting untuk menangkap persepsi publik secara eksplisit dan membaca dinamika penerimaan kebijakan di ruang digital. Penelitian ini bertujuan mengevaluasi efektivitas SMOTE dan GridSearchCV dalam meningkatkan kinerja algoritma machine learning pada klasifikasi sentimen yang tidak seimbang. Studi ini menggunakan metode kuantitatif terapan dengan desain eksperimen komputasional komparatif. Dataset penelitian 6.115 tweet berbahasa Indonesia bertopik reshuffle kabinet dengan distribusi 83,5% negatif dan 16,5% positif. Data dipra-pemrosesan, dilabeli memakai kamus lexicon-based, direpresentasikan dengan TF–IDF, lalu dipisah menjadi data latih dan uji. Klasifikasi diterapkan menggunakan Logistic Regression, Naïve Bayes, SVM, dan Random Forest pada tiga skenario: baseline tanpa SMOTE, SMOTE dengan baseline, serta SMOTE+GridSearchCV untuk pencarian hyperparameter. Macro F1 ditetapkan sebagai metrik utama, didukung confusion matrix untuk evaluasi per kelas. Hasil menunjukkan baseline memberi akurasi tinggi (86,02–89,13%), tetapi recall positif rendah (21,29–42,57%) dan macro F1 (62,83–75,09%), menandakan bias kelas mayoritas. SMOTE meningkatkan recall positif (58,42–66,34%) dan macro F1 (71,50–79,11%) dengan akurasi relatif stabil (81,77–88,39%). Kinerja terbaik dicapai Logistic Regression dengan akurasi (88,23%), macro F1 (78,90%), dan recall positif (65,84%). Simpulan penelitian menunjukkan SMOTE efektif menekan bias kelas mayoritas dan GridSearchCV menstabilkan peningkatan kinerja. Macro F1 terbukti lebih representatif daripada akurasi untuk data sentimen timpang, sehingga pendekatan ini layak diterapkan pada kasus klasifikasi teks tidak seimbang lainnya.
Keywords
Full Text:
PDFReferences
Annahdli, Z. F., & Pramudya, E. R. (2025). Evaluasi model random forest dengan teknik SMOTE dan RUS untuk klasifikasi kerusakan motor di bengkel PLAVIX. Jurnal Pendidikan Dan Teknologi Indonesia, 5(8), 2295–2310. https://doi.org/10.52436/1.jpti.880
Atsqalani, H., Hayatin, N., & Aditya, C. S. K. (2022). Sentiment analysis from indonesian Twitter data using support vector machine and query expansion ranking. Jurnal Online Informatika, 7(1), 116–122. https://doi.org/10.15575/join.v7i1.669
Badriyah, Chamidy, T., & Suhartono. (2025). Application of SMOTE in sentiment analysis of myxl user reviews on google play store. JISKA (Jurnal Informatika Sunan Kalijaga), 10(1), 74–86. https://doi.org/10.14421/jiska.2025.10.1.74-86
Belferik, R., Sinaga, F. M., Manullang, M. A. S., & Sinaga, T. (2025). Addressing class imbalance in stunting classification using SMOTE enhanced random forest. 9(4), 2108–2116.
Budiman, A. E., & Widjaja, A. (2020). Analisis pengaruh teks preprocessing terhadap deteksi plagiarisme pada dokumen tugas akhir. Jurnal Teknik Informatika Dan Sistem Informasi, 6(3), 475–488. https://doi.org/10.28932/jutisi.v6i3.2892
Chawla, N. V, Bowyer, K. W., Hall, L. O., & Philip Kegelmeyer, W. S. (2002). Synthetic minority over-sampling technique. J Artif Intell Res, 16, 16.
Denice, Oska Amanda, R., & Pradana, E. (2025). Implementasi dan deteksi tong sampah pintar menggunakan ESP8266 dengan algoritma CNN. Metik Jurnal, 9(2), 364–374. https://doi.org/10.47002/metik.v9i2.1083
Erlin, E., Desnelita, Y., Nasution, N., Suryati, L., & Zoromi, F. (2022). Dampak SMOTE terhadap kinerja random forest classifier berdasarkan data tidak seimbang. MATRIK : Jurnal Manajemen, Teknik Informatika Dan Rekayasa Komputer, 21(3), 677–690. https://doi.org/10.30812/matrik.v21i3.1726
Fajriyah, N., Lapatta, N. T., Nugraha, D. W., & Laila, R. (2025). Implementasi SVM dan SMOTE pada analisis sentimen media sosial X terhadap pelantikan Agus Harimurti Yudhoyono. JIPI (Jurnal Ilmiah Penelitian Dan Pembelajaran Informatika), 10(2), 1359–1370. https://doi.org/10.29100/jipi.v10i2.6246
Fullah, A., Septian, M. A., Rizky, M., Putra, H., Iqbal, M., Farizi, V. Al, Puspitasari, N., & Hairah, U. (2025). Analisis sentimen isu penyalahgunaan data pada layanan pinjaman online menggunakan support vector machine di platform X. (JITET) Jurnal Informatika Dan Teknik Elektro Terapan, 13(3). https://doi.org/10.23960/jitet.v13i3S1.7976
Ghanad, A. (2023). An overview of quantitative research methods. International Journal of Multidisciplinary Research and Analysis, 06(08), 3794–3803. https://doi.org/10.47191/ijmra/v6-i8-52
Imran, A. Y., Sanjaya, M. R., Putra, B. W., & Cahyadi, G. E. H. (2025). Optimization of sentiment analysis on Tokopedia user reviews using gridsearchcv and SMOTE with machine learning algorithms. Jurnal Inovtek Polbeng - Seri Informatika, 10(3), 1634–1644. https://doi.org/10.35314/5ax8km80
Jauhar Vikri, M., Wisma Dwi Prastya, I., Pradema Sanjaya, U., & Agung Barata, M. (2025). Rice quality identification built on indonesian food standards based on electronic nose using naïve bayes algorithm. INOVTEK Polbeng - Seri Informatika, 10(1), 49–60. https://doi.org/10.35314/0y0xct32
Li, Y., Yang, Y., Song, P., Duan, L., & Ren, R. (2025). An improved SMOTE algorithm for enhanced imbalanced data classification by expanding sample generation space. Scientific Reports, 15(1), 1–21. https://doi.org/10.1038/s41598-025-09506-w
Malakouti, S. M., Menhaj, M. B., & Suratgar, A. A. (2023). The usage of 10-fold cross-validation and grid search to enhance ML methods performance in solar farm power generation prediction. Cleaner Engineering and Technology, 15(February), 100664. https://doi.org/10.1016/j.clet.2023.100664
Maradona, M., Kusrini, K., & Alva Hendi Muhammad. (2023). Analisis perbandingan metode decision tree dan k-nearest neighbor untuk klasifikasi cyberbullying pada sosial media Twitter. Metik Jurnal, 7(2), 47–61. https://doi.org/10.47002/metik.v7i2.591
Muhammad Fikri, A. R., Jondri, J., & Astuti, W. (2022). Sentiment analysis against IndiHome and First Media internet providers using ensemble stacking method. Building of Informatics, Technology and Science (BITS), 4(2), 924–931. https://doi.org/10.47065/bits.v4i2.1969
Mulyono, H. S., & Saprudin, U. (2025). Efektivitas logistic regression dalam analisis sentimen berbahasa indonesia pada komentar YouTube tentang isu ketenagakerjaan. Jurnal Indonesia : Manajemen Informatika Dan Komunikasi, 6(3), 1547–1555. https://doi.org/10.63447/jimik.v6i3.1481
Nur Azizah, N., Purnamasari, I., & Prangga, S. (2024). Pengelompokan judul laporan skripsi berbasis text mining dengan metode fuzzy k-means. Metik Jurnal, 8(1), 18–23. https://doi.org/10.47002/metik.v8i1.808
Pratama, A. Y., Sanjaya, G. A., Lubis, N. K., & Aditya, M. R. (2025). Analisis sentimen publik terkait Danantara menggunakan algoritma IndoBERT pada platform media sosial. METIK Jurnal, 9(1), 2025. https://doi.org/10.47002/metik.v9i1.1055
Rafiandi Andhika, F., Witanti, W., & Sabrina, P. N. (2025). Analisis sentimen menggunakan metode IndoBERT pada ulasan aplikasi Zoom menggunakan fitur ekstrasi GloVe. 9, 2025. https://doi.org/10.47002/metik.v9i2.1098
Rahmatullah, M. R. F., Andono, P. N., Affandy, & Soeleman, M. A. (2025). Improving random forest performance for sentiment analysis on unbalanced data using SMOTE and BOW integration: PLN mobile application case study. Scientific Journal of Informatics, 12(1), 1–10. https://doi.org/10.15294/sji.v12i1.19295
Ramadhan, R., Sari, Y. A., & Adikara, P. P. (2021). Perbandingan pembobotan term frequency-inverse document frequency dan term frequency-relevance frequency terhadap fitur n-gram pada analisis sentimen. Jurnal Pengembangan Teknologi Informasi Dan Ilmu Komputer, 5(11), 5075–5079. https://j-ptiik.ub.ac.id/index.php/j-ptiik/article/view/10173
Royyan, A. R., & Setiawan, E. B. (2022). Feature expansion word2vec for sentiment analysis of public policy in Twitter. Jurnal RESTI, 6(1), 78–84. https://doi.org/10.29207/resti.v6i1.3525
Saputra, F. T., Nurhadryani, Y., Wijaya, S. H., & Defina, D. (2021). Analisis sentimen bahasa indonesia pada Twitter menggunakan struktur tree berbasis leksikon. Jurnal Teknologi Informasi Dan Ilmu Komputer, 8(1), 135. https://doi.org/10.25126/jtiik.0814133
Saputri, G. A., & Alita, D. (2024). Analisis sentimen Twitter terhadap pemindahan ibu kota negara menggunakan support vector machine. Jurnal Informatika: Jurnal Pengembangan IT, 9(3), 213–223. https://doi.org/10.30591/jpit.v9i3.6612
Sarumpaet, L. H., & Suryono, R. R. (2025). Analisis sentimen publik program PPPK di media sosial X menggunakan naïve bayes dan SVM. Edumatic: Jurnal Pendidikan Informatika, 9(2), 362–371. https://doi.org/10.29408/edumatic.v9i2.30065
Sekretariat Kabinet Republik Indonesia. (2025). Presiden Prabowo lantik empat menteri dan satu wakil menteri kabinet merah putih. https://setkab.go.id/presiden-prabowo-lantik-empat
Syaputa, M. R., Arifin, M., & Fithri, D. L. (2025). Klasifikasi sentimen ulasan e-wallet menggunakan TF-IDF dan random forest dengan penyeimbangan data SMOTE. Edumatic: Jurnal Pendidikan Informatika, 9(2), 532–541. https://doi.org/10.29408/edumatic.v9i2.31084
Yuniar, P., & Kismiantini. (2023). Analisis sentimen ulasan pada Gojek menggunakan metode naive bayes. Statistika, 23(2), 164–175. https://doi.org/10.29313/statistika.v23i2.2353
DOI: https://doi.org/10.38038/vocatech.v8i1.305
Refbacks
- There are currently no refbacks.
Vocatech : Vocational and Technology Journal
Unit Penelitian dan Pengabdian Masyarakat & Penjaminan Mutu
Akademi Komunitas Negeri Aceh Barat
Komplek STTU Alue Peunyareng, Ujong Tanoh Darat, Meureubo, Kabupaten Aceh Barat, Aceh 23615
Telp. (0655) 7110271
Email: vocatech@aknacehbarat.ac.id
Vocatech: Vocational Education and Technology Journal Published by:
Lembaga Penelitian dan Pengabdian Masyarakat & Penjaminan Mutu
Akademi Komunitas Negeri Aceh Barat
Indexed by:

Vocatech: Vocational Education and Technology Journal Creative Commons Attribution-ShareAlike 4.0 International License.
Published by: Lembaga Penelitian dan Pengabdian Masyarakat & Penjaminan Mutu Akademi Komunitas Negeri Aceh Barat










