@article{RONG2026, 
author = {Yujun RONG and Xianhai WU and Fenglin CAI and Tongxin YANG and Penghua LI},
title = {Mandarin lip recognition based on MSAF with multimodal task},
year = {2026},
journal = {Journal of Chongqing University},
volume = {49},
number = {4},
pages = {107-116},
keywords = {lip recognition, multimodal task, multimodal split-attention fusion},
url = {https://www.sciopen.com/article/10.11835/j.issn.1000-582X.2026.04.010},
doi = {10.11835/j.issn.1000-582X.2026.04.010},
abstract = {Multimodal lip recognition aims to enhance speech recognition accuracy and robustness by integrating lip movements and speech information, while also aiding specific user groups in communication. However, existing lip-speaking models predominantly focus on English datasets, leaving research on Chinese lip recognition in its nascent stage. Addressing challenges in handling data features across different modalities, integrating these features, and achieving comprehensive fusion of multimodal features, we propose a multimodal split attention fusion audio visual recognition (MSAFVR) model. Through experiments utilizing a Chinese Mandarin lip reading (CMLR) dataset, our model, MSAFVR, demonstrates significant advancements, achieving a remarkable 92.95% accuracy in Chinese lip reading, surpassing state-of-the-art Mandarin lip reading models.}
}