Siwei Chen

Undergraduate researcher interested in efficient algorithms and systems for large language models.

I am currently pursuing a B.S. in Data Science and Big Data Technology at Yuanpei College, Peking University. My work focuses on algorithm-system co-design for efficient LLM post-training, reinforcement learning, and emerging model architectures that make large models more efficient, reliable, and deployable.

GPA: 3.8 / 4.0; Major Rank: 1 / 13; Overall Rank: 43 / 355

Email GitHub Beijing, China

Research Experience

Efficient Reinforcement Learning for Large Language Models

Advisors: Prof. Bin Cui and Prof. Xupeng Miao, Peking University

Studying efficiency bottlenecks in LLM reinforcement learning, including long-tail rollout lengths, straggler effects, and length explosion during training. This work includes DARTS, a distribution-aware rollout shaping system, and QLPO, a length-aware policy optimization method.

Efficient Diffusion Language Models

Advisor: Prof. Fan Lai, University of Illinois Urbana-Champaign

Exploring diffusion language models for efficient parallel generation, with attention to the quality-efficiency trade-off, scalable training, long-block generation, and practical serving efficiency.

Context Management Benchmark for Long-Horizon LLM Agents

Advisors: Prof. Bin Cui and Prof. Xupeng Miao, Peking University

Worked on MemClaw-Bench, a capability-centered benchmark for evaluating context management in compressed-context, long-horizon tool-using agents.

Publications

DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning

ICML 2026

Yujie Wang*, Siwei Chen*, Longzan Luo*, Xinyi Liu, Xupeng Miao, Fangcheng Fu, Bin Cui. Co-first author.

arxiv.org/abs/2605.30859

QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization

COLM 2026

Siwei Chen, Siqi Chen, Xupeng Miao, Bin Cui. First author.

MemClaw-Bench: A Capability-Centered Benchmark for Context Management in Long-Horizon Agents

Under Review

Siwei Chen, Xupeng Miao, Bin Cui. First author.

Beyond Sight: Towards Cognitive Alignment in LVLM via Enriched Visual Knowledge

CVPR 2025

Yaqi Zhao, Yuanyang Yin, Lin Li, Mingan Lin, Victor Shea-Jay Huang, Siwei Chen, Weipeng Chen, Baoqun Yin, Zenan Zhou, Wentao Zhang.

arxiv.org/abs/2411.16824

Projects

Usagi: ICS Course Helper

Retrieval-augmented LLM question-answering framework with source tracing, predictive question generation, and learner state diagnosis.

GitHub

MyTorch: Custom PyTorch for CNN Training

A CUDA, C++, and Python implementation covering basic kernels, Python-C bindings, a simple computational graph, and CNN training for image recognition.

GitHub

Honors and Awards

Skills

Python, C++, Rust, PyTorch, CUDA