Hybrid Quantum–Classical Convolutional Networks for Robust Multimodal Pattern Recognition

Main Article Content

👤 Li Qingmei
🏢 Master’s Program in Teacher Education, School of Postgraduate Studies, Universitas Pendidikan Indonesia, Bandung, Indonesia
👤 Siti Zayyana Ulfah
🏢 Master’s Program in Teacher Education, School of Postgraduate Studies, Universitas Pendidikan Indonesia, Bandung, Indonesia

Robust multimodal pattern recognition remains challenging under real-world conditions characterized by sensor degradation, distribution shift, and missing modalities. This study introduces a Hybrid Quantum–Classical Convolutional Network (Hybrid QC–CNN) that combines modality-specific convolutional encoders with a compact Parameterized Quantum Circuit (PQC) feature transformation and mask-aware fusion to stabilize inference under partial and corrupted evidence. Under matched-capacity baselines, the proposed model achieves 0.913 clean accuracy and 0.907 macro-F1 while delivering superior robustness across corruption severities. Averaged over severity levels 1–5, Hybrid QC–CNN attains 0.812 accuracy compared to 0.782 (multimodal transformer) and 0.771 (CNN late fusion), and improves worst-severity (level 5) accuracy to 0.701, exceeding the transformer (0.602) by +9.9 percentage points and late fusion (0.583) by +11.8 points. Robustness summarized by AURC reaches 0.823, surpassing the transformer (0.793) and late fusion (0.781). Reliability under degradation is also improved: ECE is 0.032 on clean data and 0.061 at severity 3, compared to 0.089 (transformer) and 0.094 (late fusion). Missing-modality stress tests further show stable degradation: with only one modality available, Hybrid QC–CNN achieves 0.793 (image-only), 0.742 (audio-only), and 0.764 (text-only), outperforming both transformer and late-fusion baselines across all single-modality conditions. Ablation removing the quantum layer reduces average corruption accuracy from 0.812 to 0.792 and worst-severity accuracy from 0.701 to 0.641, indicating that the PQC contributes meaningful robustness beyond mask-aware fusion and regularization. Collectively, results support hybrid quantum–classical feature transformation as a targeted mechanism for multimodal robustness and calibrated confidence.

Qingmei, L., & Ulfah, S. Z. (2026). Hybrid Quantum–Classical Convolutional Networks for Robust Multimodal Pattern Recognition. Journal of Quantum Artificial Intelligence, 1(1), 52–68. Retrieved from https://jqai.mbicore.com/index.php/jqai/article/view/4

Article Details

Section
Articles