PulseExploreJournal ClubDebatesTrendingResearchersJournals
Instagram
HomeExploreJournal ClubTrending
Synapse
⌘+K
Synapse
April 23, 2026Computers, materials & continua/Computers, materials & continua (Print)4 citationsOpen Access

Group Activity Recognition in Crowded Scenes Using Multi-Stage Feature Optimization and ST-GCN-LSTM Networks

View Full Paper
MAMohammed AlnusayriTXTingting XueSKSaleha Kamal

Key Points

  • This research aims to improve group activity recognition in public environments despite challenges like occlusions and dynamic formations.
  • Developed a multi-modal framework integrating silhouette and pose information for recognition.
  • Utilized YOLOv11 for detection, SOLOv2 for segmentation, and AlphaPose for skeleton extraction.
  • Employed a three-stage feature optimization process using K-PCA, mutual information ranking, and genetic algorithms.
  • Achieved 96.80% accuracy on the Collective Activity Dataset, outperforming existing methods.
  • Successfully captured collective behavior by integrating various feature extraction techniques.
  • Demonstrated scalability and adaptability for smart city applications.

Abstract

Group activity recognition in public environments is challenging due to dynamic formations, complex inter-person interactions, and frequent occlusions. Existing methods often emphasize individual actions, overlooking collective behavioral patterns. This work introduces a multi-modal framework integrating silhouette-based appearance and skeleton-based pose information for robust recognition in surveillance scenarios. You Only Look Once v11 (YOLOv11) detects persons, Segmenting Objects by LOcations version 2 (SOLOv2) segments instances, and AlphaPose extracts skeletons, followed by hierarchical grouping to form spatially coherent clusters. A hybrid feature extraction strategy combines handcrafted descriptors (Extended GIST (ExGIST), Distance Transform, Binary Robust Independent Elementary Features (BRIEF), Ridge) with deep representations, fused via multi-head attention. Feature selection is refined through a three-stage pipeline of Kernel Principal Component Analysis (K-PCA), mutual information ranking, and genetic algorithm-based optimization. Spatio-Temporal Graph Convolution Networks (ST-GCN) models spatio-temporal dependencies, while Long Short-Term Memory (LSTM) captures long-term dynamics for activity classification. On the Collective Activity Dataset (CAD), the framework achieves 96.80% accuracy, surpassing state-of-the-art approaches. Its modular design ensures scalability and adaptability for intelligent surveillance and smart city applications.

Ask AI
Helpful
Bookmark
Share
View Full Paper

Cite This Study

Alnusayri et al. (2026) studied this question.

synapsesocial.com/papers/69e9b9a285696592c86ec342https://doi.org/10.32604/cmc.2026.074115
Ask AI
Helpful
Bookmark
Share
View Full Paper