Pemodelan Akustik HMM–GMM untuk Pengenalan Ucapan Kata Darurat Bahasa Indonesia

Penulis

  • Candra Bella Vista Politeknik Negeri Malang
  • Endah Septa Sintiya Politeknik Negeri Malang
  • Wilda Imama Sabilla Politeknik Negeri Malang
  • Adevian Fairuz Pratama Politeknik Negeri Malang

DOI:

https://doi.org/10.25077/TEKNOSI.v12i2.2026.369-376

Kata Kunci:

Sistem Pengenal Ucapan, HMM-GMM, Model Akustik, Ucapan Darurat

Abstrak

Keamanan dan keselamatan merupakan kebutuhan dasar manusia. Situasi darurat seperti pencurian, kebakaran, maupun ancaman lainnya sering kali memerlukan respons yang cepat untuk mengurangi dampak negatifnya. Seiring berkembangnya teknologi, sistem keamanan berbasis suara menjadi solusi potensial untuk meningkatkan efektivitas deteksi dini dan tanggapan terhadap keadaan darurat. Penelitian ini bertujuan untuk mengembangkan model akustik berbasis Hidden Markov Model–Gaussian Mixture Model (HMM–GMM) guna mendeteksi kata-kata darurat dalam Bahasa Indonesia, seperti tolong, jangan, maling, kebakaran, dan kecelakaan. Dataset yang digunakan terdiri atas 1.100 berkas audio yang seimbang antara kelas darurat dan non-darurat. Fitur akustik dari dataset diekstraksi menggunakan Mel-Frequency Cepstral Coefficients (MFCC) beserta fitur turunan delta dan delta-delta. Evaluasi dilakukan dengan metode 10-fold cross-validation dan model terbaik diujikan dengan data holdout test untuk memastikan kemampuan generalisasi model. Hasil penelitian menunjukkan bahwa model HMM–GMM dengan 4 state dan 16 komponen Gaussian memberikan performa terbaik dengan akurasi 94,5%, presisi 94,3%, recall 94,5%, dan F1-score 94,4% pada hold. Temuan ini membuktikan bahwa model HMM–GMM efektif dalam mengenali ucapan darurat Bahasa Indonesia secara akurat dan efisien.

Referensi

J. Kim, K. Min, M. Jung, and S. Chi, “Occupant behavior monitoring and emergency event detection in single-person households using deep learning-based sound recognition,” Build. Environ., vol. 181, p. 107092, Aug. 2020, doi: 10.1016/j.buildenv.2020.107092.

H. Chu et al., “Call For Help Detection In Emergent Situations Using Keyword Spotting And Paralinguistic Analysis,” in Companion Publication of the 2021 International Conference on Multimodal Interaction, New York, NY, USA: ACM, Oct. 2021, pp. 104–111. doi: 10.1145/3461615.3491111.

L. Rabiner and B.-H. Juang, “Fundamentals of Speech Recognition,” 1993. doi: 10.1002/ev.1647.

C. Paul and P. Bora, “Digit Speech Recognition u sing Hidden Markov Model Toolkit,” International Journal of Innovative Technology and Exploring Engineering, vol. 9, no. 5, pp. 917–921, Mar. 2020, doi: 10.35940/ijitee.E2540.039520.

S. M, S. Anusuya, and L. K. Narayanan, “Enhancing Automatic Speech Recognition Accuracy Using a Gaussian Mixture Model (GMM),” SSRN Electronic Journal, 2025, doi: 10.2139/ssrn.5089158.

P. L, P. Kumar, and D. Singh, “Speech Recognition Using Hmm and Combinations: A Review,” SSRN Electronic Journal, 2024, doi: 10.2139/ssrn.4488961.

M. Orosoo et al., “Transforming English language learning: Advanced speech recognition with MLP-LSTM for personalized education,” Alexandria Engineering Journal, vol. 111, pp. 21–32, Jan. 2025, doi: 10.1016/j.aej.2024.10.065.

E. M. Tan and F. Utaminingrum, “Analisis Kombinasi Speech Enhancement Dan Keyword Spotting Lightweight Untuk Robust Speech Command Recognition Pada Smart Wheelchair,” 2026. [Online]. Available: http://j-ptiik.ub.ac.id

X. Rong, T. Sun, X. Zhang, Y. Hu, C. Zhu, and J. Lu, “GTCRN: A Speech Enhancement Model Requiring Ultralow Computational Resources,” in ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), IEEE, Apr. 2024, pp. 971–975. doi: 10.1109/ICASSP48485.2024.10448310.

H. Kheddar, Y. Himeur, S. Al-Maadeed, A. Amira, and F. Bensaali, “Deep transfer learning for automatic speech recognition: Towards better generalization,” Knowl. Based. Syst., vol. 277, p. 110851, Oct. 2023, doi: 10.1016/j.knosys.2023.110851.

S. I. Ayuri, N. Nayla, N. Asa, S. H. Berutu, and A. Puteri, “Pentingnya Fonologi dan Peran Fonologi dalam Sistem Bahasa,” Jurnal Ilmiah Kajian Multidisipliner, vol. 8, no. 12, 2024.

A. Rouhe, A. Virkunen, J. Leinonen, and M. Kurimo, “Low Resource Comparison of Attention-based and Hybrid ASR Exploiting wav2vec 2.0,” Interspeech, 2022.

S. Bhatt, A. Jain, and A. Dev, “Acoustic Modeling in Speech Recognition A Systematic Review,” nternational Journal of Advanced Computer Science and Application (IJACSA), , vol. 11, no. 4, 2020.

C. B. Vista, C. H. Satriawan, D. P. Lestari, and D. H. Widyantoro, “Specific Acoustic Models for Spontaneous and Dictated Style in Indonesian Speech Recognition. ,” J. Phys. Conf. Ser., 2018.

A. Rista and A. Kadriu, “Automatic Speech Recognition: A Comprehensive Survey,” SEEU Review, vol. 15, no. 2, pp. 86–112, Dec. 2020, doi: 10.2478/seeur-2020-0019.

F. Alifani, T. W. Purboyo, and C. Setianingsih, “Implementation of Voice Recognition in Disaster Victim Detection Using Hidden Markov Model (HMM) Method,” in 2019 International Seminar on Intelligent Technology and Its Applications (ISITIA), IEEE, Aug. 2019, pp. 445–450. doi: 10.1109/ISITIA.2019.8937290.

H. Isyanto, W. Ibrahim, R. Samsinar, and W. Sudarwati, “Accurate Speech Recognition AI using Model of Deep Learning for Security Access,” ICEREAM, 2024.

A. U. J. Dzulqornain, N. N. P. Utami, M. J. Kusuma, D. M. A. Arsana, M. A. Adyan, and P. M. Waliyullah, “Indonesian Words Audioset. ,” https://www.kaggle.com/datasets/ahmadulfi/indonesian-words-audio-dataset.

M. Novela and T. Basaruddin, “Dataset Suara dan Teks Berbahasa Indonesia Pada Rekaman Podcast dan Talk show,” JURNAL FASILKOM, vol. 11, no. 2, pp. 61–66, Aug. 2021, doi: 10.37859/jf.v11i2.2628.

T. J. Bradshaw, Z. Huemann, J. Hu, and A. Rahmim, “A Guide to Cross-Validation for Artificial Intelligence in Medical Imaging,” Radiol. Artif. Intell., 2023.

E. N. Tamatjita and A. W. Mahastama, “Classification of Traditional and Modern Music using NCC and k-NN,” in Proceedings of the 1st International Conference on Intermedia Arts and Creative Technology, SCITEPRESS - Science and Technology Publications, 2019, pp. 112–117. doi: 10.5220/0008527301120117.

Y. K. Aini, T. B. Santoso, and T. Dutono, “Pemodelan CNN untuk deteksi emosi berbasis speech Bahasa Indonesia,” Jurnal Komputer Terapan, vol. 1, no. 7, 2021.

Z. Salsabila and A. Syarif, “Pemanfaatan media Google Drive dalam pengelolaan dokumen elektronik Komisi Aparatur Sipil Negara,” Serasi: Jurnal Sekretari dan Administrasi, vol. 2, no. 20, 2022.

D. Jurafsky and J. Martin, Speech and Language Processing: An Introduction to Natural Language Processing, Computational Linguistics, and Speech Recognition, Second Edition. Upper Saddle River, New Jersey: Prentice-Hall, 2008.

S. Santoso, R. Hartayu, C. Anam, and Dimas Abdul Aziz, “Simulasi Simulasi Ekstraksi Fitur Suara menggunakan Mel-Frequency Cepstrum Coefficient,” Jurnal Sains dan Informatika, vol. 8, no. 1, pp. 80–87, Jul. 2022, doi: 10.34128/jsi.v8i1.357.

N. Manouchehri and N. Bouguila, “Human Activity Recognition with an HMM-Based Generative Model,” Sensors, vol. 23, no. 3, p. 1390, Jan. 2023, doi: 10.3390/s23031390.

Unduhan

Telah diserahkan

17-10-2025

Diterima

11-05-2026

Diterbitkan

03-09-2026

Cara Mengutip

[1]
C. B. Vista, E. S. Sintiya, W. I. Sabilla, dan A. F. Pratama, “Pemodelan Akustik HMM–GMM untuk Pengenalan Ucapan Kata Darurat Bahasa Indonesia”, TEKNOSI, vol. 12, no. 2, hlm. 369–376, Sep 2026.

Terbitan

Bagian

Articles

Artikel Serupa

1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 > >> 

Anda juga bisa Mulai pencarian similarity tingkat lanjut untuk artikel ini.