Title: Multi-modal e-commerce data analysis system based on deep learning: visual perception and emotional computing
Authors: Chunsheng Zhang
Addresses: Logistics School, Henan College of Transportation, Zhengzhou, 451460, China
Abstract: E-commerce platforms generate vast multi-modal data (product images and user reviews), whose integrated analysis is crucial for enhancing user experience and decision making. However, existing methods often treat visual perception and text sentiment analysis separately, limiting cross-modal semantic collaboration. Therefore, a multi-modal hierarchical collaborative fusion model (MHCFM) that unifies product visual attributes, aesthetic quality, scene context, and textual emotion is proposed via cross-modal alignment and hierarchical adaptive fusion. The model integrates a hierarchical visual transformer, a dual-branch aesthetic network, a graph convolutional scene module, and a hierarchical adaptive fusion network. Experiments on public and large-scale e-commerce datasets showed the sentiment analysis accuracy exceeded 93%, the inference time was 22-23 ms, outperforming mainstream models. In cross-cultural and multi-category tests, the average accuracy was 91.5%, demonstrating robustness. The proposed model enhances visual-textual collaboration, offering an efficient solution for intelligent product analysis and user experience optimisation in e-commerce.
Keywords: multi-modal sentiment analysis; visual transformer; cross-modal alignment; hierarchical adaptive fusion; e-commerce; multi-modal hierarchical collaborative fusion model; MHCFM.
DOI: 10.1504/IJICT.2026.154114
International Journal of Information and Communication Technology, 2026 Vol.27 No.64, pp.84 - 112
Received: 04 Feb 2026
Accepted: 19 Mar 2026
Published online: 12 Jun 2026 *


