AI Chat Paper
Note: Please note that the following content is generated by AMiner AI. SciOpen does not take any responsibility related to this content.
{{lang === 'zh_CN' ? '文章概述' : 'Summary'}}
{{lang === 'en_US' ? '中' : 'Eng'}}
Chat more with AI
PDF (12 MB)
Collect
Submit Manuscript AI Chat Paper
Show Outline
Outline
Show full outline
Hide outline
Outline
Show full outline
Hide outline
Article | Open Access

A Fine-Grained Recognition Model based on Discriminative Region Localization and Efficient Second-Order Feature Encoding

Xiaorui Zhang1,2( )Yingying Wang2Wei Sun3Shiyu Zhou2Haoming Zhang4Pengpai Wang1
College of Computer and Information Engineering, Nanjing Tech University, Nanjing, 211816, China
School of Software, Nanjing University of Information Science and Technology, Nanjing, 210044, China
School of Automation, Nanjing University of Information Science and Technology, Nanjing, 210044, China
School of Computer Science, Nanjing University of Information Science and Technology, Nanjing, 210044, China
Show Author Information

Abstract

Discriminative region localization and efficient feature encoding are crucial for fine-grained object recognition. However, existing data augmentation methods struggle to accurately locate discriminative regions in complex backgrounds, small target objects, and limited training data, leading to poor recognition. Fine-grained images exhibit “small inter-class differences,” and while second-order feature encoding enhances discrimination, it often requires dual Convolutional Neural Networks (CNN), increasing training time and complexity. This study proposes a model integrating discriminative region localization and efficient second-order feature encoding. By ranking feature map channels via a fully connected layer, it selects high-importance channels to generate an enhanced map, accurately locating discriminative regions. Cropping and erasing augmentations further refine recognition. To improve efficiency, a novel second-order feature encoding module generates an attention map from the fourth convolutional group of Residual Network 50 layers (ResNet-50) and multiplies it with features from the fifth group, producing second-order features while reducing dimensionality and training time. Experiments on Caltech-University of California, San Diego Birds-200-2011 (CUB-200-2011), Stanford Car, and Fine-Grained Visual Classification of Aircraft (FGVC Aircraft) datasets show state-of-the-art accuracy of 88.9%, 94.7%, and 93.3%, respectively.

References

【1】
【1】
 
 
Computers, Materials & Continua
Article number: 37

{{item.num}}

Comments on this article

Go to comment

< Back to all reports

Review Status: {{reviewData.commendedNum}} Commended , {{reviewData.revisionRequiredNum}} Revision Required , {{reviewData.notCommendedNum}} Not Commended Under Peer Review

Review Comment

Close
Close
Cite this article:
Zhang X, Wang Y, Sun W, et al. A Fine-Grained Recognition Model based on Discriminative Region Localization and Efficient Second-Order Feature Encoding. Computers, Materials & Continua, 2026, 87(1): 37. https://doi.org/10.32604/cmc.2025.072626

2

Views

0

Downloads

0

Crossref

0

Web of Science

0

Scopus

Received: 31 August 2025
Accepted: 18 November 2025
Published: 10 February 2026
© The Author 2026.

This work is licensed under a Creative Commons Attribution 4.0 International License, which permits unrestricted use, distribution, and reproduction in any medium, provided the original work is properly cited.