Xiaotong Wu
Computer vision · Multimodal learning · Autonomous systems
I study LiDAR–camera fusion for 3D object detection, with an interest in robust and efficient perception for autonomous systems. I am a Research Assistant at Illinois iRisk Lab, University of Illinois Urbana-Champaign, advised by Zhiyu (Frank) Quan. I earned my M.S. in Interdisciplinary Engineering at San José State University, advised by Ahmed Hambaba. I am based in San Jose, California.
Research
LayerGate-BEV
Jul. 2026–Present
Illinois iRisk Lab · University of Illinois Urbana-Champaign
I proposed scene-conditioned gates across four encoder layers to replace fixed camera–LiDAR fusion coefficients. The proposal and architecture design are complete. The planned nuScenes evaluation studies detection, modality reliance, and robustness under LiDAR thinning, using baseline-preserving initialization.
FusionPointPillars & BEVFormerFusion
2024–2026
Master’s research · San José State University
I designed BEVFormer encoder–decoder and encoder-only fusion architectures and participated in training and validation. Compared with the camera-only baseline, encoder–decoder fusion improved nuScenes validation mAP by 5.0 points and NDS by 3.6 points, while mATE decreased from 0.949 to 0.870.
I also contributed to FusionPointPillars architecture, training, and validation. On KITTI Moderate 3D AP40, GMF improved Pedestrian AP by 3.02 points and Cyclist AP by 7.12 points; APF improved Cyclist AP by 7.38 points. RTX 3060 inference reached approximately 12 FPS with ResNet-50 fusion; a ResNet-18 configuration reached 14.10 FPS with reduced accuracy.
Multimodal Restaurant Recommendation
2025
CMPE 256 course research project · San José State University
I extracted BERT/ResNet-18 text–image features, constructed Louvain/FAISS community graphs, and trained a multimodal graph attention network recommender. The model achieved validation RMSE of 0.1493 on ratings normalized to [0, 1], with early stopping for checkpoint selection.
Publications
-
Sanghee Suh, Pavithra M. Girithimmappa, Xiaotong Wu, Le Shen, and Ahmed Hambaba.
Pillar-level Multimodal Fusion for Efficient LiDAR–Camera 3D Object Detection.
WI-IAT 2026 · Published
Manuscripts submitted for review
-
S. H. Suh, P. M. Girithimmappa, X. Wu, L. Shen, and A. Hambaba.
FusionPointPillars: Efficient pillar-wise LiDAR–camera fusion for real-time 3D object detection in autonomous vehicles.
IEEE Transactions on Intelligent Vehicles · Submitted for publication
-
S. H. Suh, P. M. Girithimmappa, X. Wu, L. Shen, and A. Hambaba.
Adaptive pillar fusion for efficient LiDAR–camera 3D object detection.
2026 IEEE 29th International Conference on Intelligent Transportation Systems (ITSC) · Under review
Education
San José State University
Aug. 2024–May 2026
M.S., Interdisciplinary Engineering
Advisor: Ahmed Hambaba
Master’s project: From Pillars to Transformers: Two Fusion Paradigms Based on PointPillars for 3D Object Detection (May 2026).
Changchun University of Technology
Sep. 2018–Jun. 2022
B.S., Computer Science and Engineering
Technical skills
Deep learning & vision: PyTorch, MMCV, MMDetection3D, CNNs, Transformer, BERT.
Graph learning & data: Graph attention networks (GAT), Louvain, FAISS, scikit-learn, NumPy, Pandas.
Programming & tools: Python, SQL, Git, Docker.