• The proposed model integrates physical information constraints and multimodal feature fusion, achieving at least 51.09% reduction in MAE compared to unimodal baselines.
• A physics-informed loss function derived from an empirical capacity decay equation enhances interpretability and prediction accuracy.
• The cross-layer attention mechanism dynamically weights features, ensuring robustness against missing modalities and random noise.
• The model achieves an average MAE of 0.0201 in real-world battery pack applications, demonstrating high accuracy and universality.