Xiaotong Wu
Xiaotong Wu outdoors at a scenic overlook

Xiaotong Wu

Computer vision · Multimodal learning · Autonomous systems

I study LiDAR–camera fusion for 3D object detection, with an interest in robust and efficient perception for autonomous systems. I am a Research Assistant at Illinois iRisk Lab, University of Illinois Urbana-Champaign, advised by Zhiyu (Frank) Quan. I earned my M.S. in Interdisciplinary Engineering at San José State University, advised by Ahmed Hambaba. I am based in San Jose, California.

Research

LayerGate-BEV

Jul. 2026–Present

Illinois iRisk Lab · University of Illinois Urbana-Champaign

I proposed scene-conditioned gates across four encoder layers to replace fixed camera–LiDAR fusion coefficients. The proposal and architecture design are complete. The planned nuScenes evaluation studies detection, modality reliance, and robustness under LiDAR thinning, using baseline-preserving initialization.

FusionPointPillars & BEVFormerFusion

2024–2026

Master’s research · San José State University

I designed BEVFormer encoder–decoder and encoder-only fusion architectures and participated in training and validation. Compared with the camera-only baseline, encoder–decoder fusion improved nuScenes validation mAP by 5.0 points and NDS by 3.6 points, while mATE decreased from 0.949 to 0.870.

I also contributed to FusionPointPillars architecture, training, and validation. On KITTI Moderate 3D AP40, GMF improved Pedestrian AP by 3.02 points and Cyclist AP by 7.12 points; APF improved Cyclist AP by 7.38 points. RTX 3060 inference reached approximately 12 FPS with ResNet-50 fusion; a ResNet-18 configuration reached 14.10 FPS with reduced accuracy.

Multimodal Restaurant Recommendation

2025

CMPE 256 course research project · San José State University

I extracted BERT/ResNet-18 text–image features, constructed Louvain/FAISS community graphs, and trained a multimodal graph attention network recommender. The model achieved validation RMSE of 0.1493 on ratings normalized to [0, 1], with early stopping for checkpoint selection.

Publications

  • Sanghee Suh, Pavithra M. Girithimmappa, Xiaotong Wu, Le Shen, and Ahmed Hambaba.

    Pillar-level Multimodal Fusion for Efficient LiDAR–Camera 3D Object Detection.

    WI-IAT 2026 · Published

Manuscripts submitted for review

  • S. H. Suh, P. M. Girithimmappa, X. Wu, L. Shen, and A. Hambaba.

    FusionPointPillars: Efficient pillar-wise LiDAR–camera fusion for real-time 3D object detection in autonomous vehicles.

    IEEE Transactions on Intelligent Vehicles · Submitted for publication

  • S. H. Suh, P. M. Girithimmappa, X. Wu, L. Shen, and A. Hambaba.

    Adaptive pillar fusion for efficient LiDAR–camera 3D object detection.

    2026 IEEE 29th International Conference on Intelligent Transportation Systems (ITSC) · Under review

Education

San José State University

Aug. 2024–May 2026

M.S., Interdisciplinary Engineering

Advisor: Ahmed Hambaba

Master’s project: From Pillars to Transformers: Two Fusion Paradigms Based on PointPillars for 3D Object Detection (May 2026).

Changchun University of Technology

Sep. 2018–Jun. 2022

B.S., Computer Science and Engineering

Technical skills

Deep learning & vision: PyTorch, MMCV, MMDetection3D, CNNs, Transformer, BERT.

Graph learning & data: Graph attention networks (GAT), Louvain, FAISS, scikit-learn, NumPy, Pandas.

Programming & tools: Python, SQL, Git, Docker.