Sistem Deteksi Emosi Manusia Menggunakan Metode Audio-Visual Berbasis MFCC, Random Forest, dan CNN

dc.contributor.advisorFitri, Feralia
dc.contributor.authorYusuf, M. Afif Fuadie
dc.date.accessioned2026-08-28T08:53:08Z
dc.date.issued2026-07-26
dc.descriptionPenelitian ini membahas pengembangan sistem Audio-Visual Emotion Recognition (AVER) untuk mendeteksi emosi manusia secara real-time dengan menggabungkan informasi suara dan citra wajah. Sistem audio menggunakan metode Mel Frequency Cepstral Coefficients (MFCC) untuk ekstraksi fitur dan algoritma Random Forest untuk klasifikasi, sedangkan sistem visual menggunakan Convolutional Neural Network (CNN) untuk mengenali ekspresi wajah. Prediksi dari kedua modalitas digabungkan menggunakan metode Weighted Late Fusion dengan bobot 75% pada modalitas visual dan 25% pada modalitas audio. Penelitian difokuskan pada empat kategori emosi, yaitu Happy, Neutral, Angry, dan Sad. Hasil pelatihan menunjukkan akurasi sebesar 75,56% pada model audio dan 87,48% pada model visual. Pengujian secara real-time dilakukan terhadap 10 responden dengan total 600 data pengujian pada setiap mode. Sistem berhasil diimplementasikan dalam bentuk aplikasi GUI berbasis Python yang menggunakan webcam dan mikrofon sebagai masukan untuk melakukan deteksi emosi secara real-time. Penelitian ini diharapkan dapat menjadi referensi dalam pengembangan sistem Human-Computer Interaction (HCI), khususnya pada penerapan teknologi pengenalan emosi manusia berbasis audio dan visual.
dc.description.abstractPerkembangan teknologi kecerdasan buatan memberikan peluang bagi sistem komputer untuk mengenali dan memahami emosi manusia secara otomatis. Namun, sebagian besar sistem deteksi emosi hanya memanfaatkan satu modalitas, seperti suara atau citra wajah, sehingga performanya masih dipengaruhi oleh kondisi lingkungan, seperti kebisingan dan pencahayaan. Penelitian ini bertujuan mengembangkan sistem Audio-Visual Emotion Recognition (AVER) yang mampu mendeteksi emosi secara real-time menggunakan kombinasi informasi suara dan citra wajah. Pada sistem audio digunakan metode Mel Frequency Cepstral Coefficients (MFCC) sebagai ekstraksi fitur dan algoritma Random Forest sebagai metode klasifikasi, sedangkan pada sistem visual digunakan Convolutional Neural Network (CNN) untuk mengenali ekspresi wajah. Hasil prediksi kedua modalitas kemudian digabungkan menggunakan metode Weighted Late Fusion dengan pembobotan 75% pada sistem visual dan 25% pada sistem audio. Penelitian difokuskan pada empat kategori emosi, yaitu Happy, Neutral, Angry, dan Sad. Hasil pelatihan menunjukkan bahwa model audio memperoleh akurasi sebesar 75,56%, sedangkan model visual memperoleh akurasi sebesar 87,48%. Selanjutnya, sistem diuji secara real-time terhadap 10 responden, dimana setiap responden melakukan 60 kali pengujian sehingga diperoleh 600 data pengujian pada setiap mode. Berdasarkan hasil pengujian, Mode Visual menunjukkan tingkat keberhasilan tertinggi pada emosi Happy sebesar 90,00% dan Neutral sebesar 86,00%. Pada Mode Audio, tingkat keberhasilan tertinggi diperoleh pada emosi Sad sebesar 88,67%. Sementara itu, Mode Fusion menunjukkan tingkat keberhasilan tertinggi pada emosi Happy sebesar 80,67% dan Neutral sebesar 68,00%. Hasil tersebut menunjukkan bahwa sistem visual memiliki performa yang lebih baik dibandingkan sistem audio, sedangkan metode Weighted Late Fusion mampu menghasilkan deteksi emosi yang lebih stabil melalui penggabungan informasi audio dan visual. Berdasarkan hasil penelitian yang telah dilakukan, sistem deteksi emosi berbasis audio-visual berhasil diimplementasikan dalam bentuk aplikasi GUI berbasis Python yang mampu melakukan deteksi emosi secara real-time menggunakan webcam dan mikrofon. Penelitian ini diharapkan dapat menjadi salah satu referensi dalam pengembangan sistem Human Computer Interaction (HCI).
dc.identifier.citationIEEE
dc.identifier.kodeprodiKODEPRODI21312#Teknik Mekatronika
dc.identifier.nimNIM4212531004
dc.identifier.urihttps://repository.polibatam.ac.id//handle/PL29/6612
dc.publisherPoliteknik Negeri Batam
dc.subjectAudio -Visual
dc.subjectCNN
dc.subjectemotion recognition
dc.subjectfacial expression
dc.subjectMFCC
dc.subjectRandom Forest
dc.titleSistem Deteksi Emosi Manusia Menggunakan Metode Audio-Visual Berbasis MFCC, Random Forest, dan CNN
dc.title.alternativeHuman Emotion Detection System Using Audio -Visual Methods Based on MFCC, Random Forest, and CNN
dc.typeBook

Files

Original bundle

Now showing 1 - 3 of 3
Loading...
Thumbnail Image
Name:
Tugas Akhir(M. Afif Fuadie Yusuf_4212531004).pdf
Size:
4.44 MB
Format:
Adobe Portable Document Format
Loading...
Thumbnail Image
Name:
Surat Pernyataan M. Afif Fuadie Yusuf_4212531004).pdf
Size:
139.27 KB
Format:
Adobe Portable Document Format
Loading...
Thumbnail Image
Name:
Lembar_Pengesahan.pdf
Size:
322.96 KB
Format:
Adobe Portable Document Format

License bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
license.txt
Size:
1.71 KB
Format:
Item-specific license agreed upon to submission
Description: