Evaluasi Kinerja Vision-Language Model dalam Studi Kasus Pendeteksian Bola pada Robot Humanoid Barelang FC

Repository Analytics

Statistic Details

Updated data
9Viewes
0Downloaded
9Accessed per month
1Countries
Loading...
Thumbnail Image

Authors

Lisfatia, Bela
Jamzuri, Eko Rudiawan

Journal Title

Journal ISSN

Volume Title

Publisher

Politeknik Negeri Batam

Abstract

Deteksi bola yang akurat merupakan elemen fundamental dalam robot sepak bola humanoid. Namun, metode konvensional seringkali terhambat oleh keterbatasan generalisasi data pelatihan. Studi ini mengevaluasi kinerja Vision-Language Model (VLM) berbasis cloud Qwen2.5-VL-72B-Instruct sebagai kandidat detektor generalis dibandingkan dengan YOLOv8 sebagai detektor spesialis pada robot Barelang FC. Melalui evaluasi komparatif pada dataset dinamis menggunakan metrik Intersection over Union (IoU), Precision, Recall, F1-Score, dan Semantic Relevance, hasil empiris mengungkapkan adanya trade-off yang kritis. YOLOv8 mendominasi akurasi spasial dengan Mean Recall 0.91 dan Mean IoU 0.62. Sebaliknya, VLM mengalami penurunan kinerja signifikan pada presisi tinggi hingga mencapai nol dan rentan terhadap halusinasi visual, meskipun unggul dalam memvalidasi konteks semantik lapangan dengan skor 0.50. Studi ini menyimpulkan bahwa kemampuan semantik VLM saat ini tidak dapat dikonversi menjadi presisi geometris yang cukup untuk aksi motorik real-time. Temuan ini merekomendasikan arsitektur persepsi hibrida dengan memposisikan VLM sebagai penalaran situasional tingkat tinggi, sementara eksekusi pelacakan bola tetap bergantung pada efisiensi detektor khusus.

Description

Citation

IEEE

Endorsement

Review

Supplemented By

Referenced By