机器学习系统工程师,WeLM

齐呈祥 Chengxiang Qi

我是齐呈祥,微信事业群 WeLM 团队的机器学习系统工程师,关注大语言模型训练与推理效率,近期主要开展长上下文稀疏 Attention 的实现与优化。

此前在微软亚洲研究院参与 FractalTensor 与 TileFusion 的研究和开发,是 FractalTensor SOSP 2024 论文的共同第一作者。

我也开发开源系统工具,并分享 GPU 编程与性能分析笔记。
齐呈祥

精选工作

TileFusion

☆ 119

核心设计者与开发者

面向 GPU Tile 计算的 C++ 模板库。我参与抽象设计、底层访存与计算原语实现,支持构建 FlashAttention、FlashDecoding 等硬件感知算法。

FractalTensor

☆ 32

SOSP 2024 · 共同第一作者

探索深度学习中的嵌套数据并行与数据复用。我使用 CUTLASS 实现并优化 GPU 计算,在 A100 上的已报告评测中,相比所评估基线平均取得 2.14 倍加速。

Light-DuoAttention

长上下文推理 · CuTeDSL / SGLang

使用 CuTeDSL 实现 DuoAttention,并集成至 SGLang,将 Attention Kernel 开发与推理服务系统连接起来。

工作经历

2026年7月 - 至今

微信事业群 · WeLM

机器学习系统工程师

稀疏 Attention 训练优化:面向下一代大语言模型的长上下文训练,参与稀疏 Attention 计算模块的研发与性能优化,推进算子库建设、数值验证与性能评测,为后续训练系统集成提供支持。

2025年6月 - 2026年6月

微信事业群 · WeLM

机器学习系统实习生

开发长上下文推理 Kernel 并集成至 SGLang,探索 GPU 通信与分布式 Attention。

展开这段经历
  • Light-DuoAttention:使用 CuTeDSL 实现了 Light-DuoAttention,实现高效长上下文推理,并在 SGLang 中运行。
  • NVSHMEM:探索了 NVSHMEM 和 DeepEP,并实现了 NVSHMEM-Tutorial,包括基于 CUDA IPC/RDMA 的混合通信,用于组内技术分享。
  • 分布式 Attention:基于 ThunderKittens 使用 LCF 模板实现了 Ring Attention Forward,在短序列上性能优于 ring-flash-attention。基于 LCF 实现了 Flash Attention Backward。对 MagiAttention、ZigZag Ring Attention 和 ZigZag Flex Attention 进行了性能分析。
  • 其他:调研了 NVIDIA Hopper 架构上的 DSL。

2024年2月 - 2025年5月

微软亚洲研究院

系统与网络组研究实习生

实现 FractalTensor 的 GPU 计算,并参与设计 TileFusion,将编程抽象与硬件感知优化结合。

展开这段经历
导师:曹莹 博士
  • 基于 FractalTensor 编程模型,使用 CUTLASS 优化了 GEMM、Back-to-Back GEMMs、Stacked/Dilated LSTM 和 FlashAttention-2 等算法的实现。在 NVIDIA A100 上进行性能评估,相比 SOTA 最高实现 5.45 倍加速,平均性能加速 2.14 倍。
  • 作为核心设计者和开发者,设计并实现了 TileFusion,一个高效的 C++ 宏内核模板库,用于提升 CUDA C 中 Tile 处理的抽象层次。

2023年5月 - 2023年8月

清华大学

操作系统实验室研究实习生

为 Arceos 开发 Rust 网卡驱动和虚拟化支持,并开展网络性能优化。

展开这段经历
导师:陈渝 教授、贾越凯 博士
  • 进行网络性能基准测试与优化。
  • 使用 Rust 编写了 Intel 82599 网卡驱动程序,参考 DPDK 进行性能优化,并集成到 Arceos 中。
  • 基于 Arceos 开发了能够启动 Linux 的 Type-2 Hypervisor。

发表论文

SOSP 2024(*共同第一作者)

Uncovering Nested Data Parallelism and Data Reuse in DNN Computation with FractalTensor

Siran Liu*, Chengxiang Qi*, Ying Cao, Chao Yang, Weifang Hu, Xuanhua Shi, Fan Yang, Mao Yang

Uncovering Nested Data Parallelism and Data Reuse in DNN Computation with FractalTensor
早期研究 · 本科毕业论文

学士学位论文,天津大学(优秀毕业论文)

基于 RISC-V 的 Type-1 Hypervisor 的设计与实现

齐呈祥

基于 RISC-V 的 Type-1 Hypervisor 的设计与实现

精选文章

全部文章 →

开源工具

ncu-cli ☆ 34

一个 Rust CLI 工具,用于从 NVIDIA Nsight Compute(NCU)的 CSV 导出结果中自动诊断 CUDA Kernel 性能问题。它结合 roofline analysis、架构感知启发式规则和 profile diff,输出可执行的优化建议,并支持 terminal、JSON、CSV 和 Markdown 多种格式。

早期项目与其他作品 6

arceos-org/arceos ☆ 781

一个用 Rust 编写的实验性模块化操作系统。我将 hypercraft 集成到 arceos 中,使其能够作为 Type-2 Hypervisor 启动。添加了中断支持,并实现了基于 virtio-net 和 virtio-blk 的 IO 中断。实现了 ixgbe 网卡驱动并进行了网络优化。

hypercraft ☆ 53

一个用 Rust 编写的 VMM(虚拟机监控器)库。目前集成在 rcore-os/arceos 中,可作为能够启动 Linux 的 Type-2 Hypervisor 运行。从 hypocaust-2 项目发展而来。

xv6-rust ☆ 347

用 Rust 语言重新实现的 xv6-riscv。一个类 Unix 操作系统,对内存分配和文件系统进行了优化。作为 OSCOMP 项目的参考实现。

hypocaust-2 ☆ 60

一个使用 H 扩展的硬件辅助虚拟化 RISC-V Hypervisor。实现了 SBI 调用处理、两阶段页表转换、中断模拟与转发。可以启动并运行 rCore-Tutorial-v3、rt-thread 和主线 Linux。

Demo

curgit ☆ 11

一个用 Rust 编写的高性能 CLI 工具,作为独立的 Git Agent 运行。它分析 git 仓库中的暂存更改,并使用 LLM 生成遵循 Conventional Commits 标准的专业、上下文感知的提交信息。

Where2Live ☆ 1

一个 Rust CLI 工具,用于发现工作地点附近可通勤的住宅小区。使用高德地图 API 搜索小区,并按公交通勤时间、评分和热度进行排名。

教育经历

2023年9月 - 2026年6月

中国科学院大学

工学硕士 · 计算机技术

研究方向为深度学习编译器和机器学习系统。

2019年9月 - 2023年6月

天津大学

工学学士 · 计算机科学与技术

获得优秀毕业论文。
论文题目:基于 RISC-V 的 Type-1 Hypervisor 的设计与实现
获奖与演讲
  • 优秀毕业论文 · 天津大学 · 2023
  • 团队赛三等奖 · 全国大学生计算机系统能力大赛 (NSCSCC) · 2022
  • 开源之夏最佳质量奖 · 开源软件供应链点亮计划(全国仅 5 名) · 2021
  • 团队赛三等奖 · 操作系统大赛 (OSCOMP) · 2021

Hypocaust:一个用 Rust 编写的 RISC-V Type-1 Hypervisor

OS2ATC 2022,北京 · 2023年3月

关于 Hypocaust 的设计与实现的演讲,这是一个用 Rust 编写的 RISC-V Type-1 Hypervisor,展示了虚拟化技术和系统级 Rust 编程。

幻灯片

工作之外

工作之外,我喜欢跑步和写作。这里也记录着我的跑步经历与个人随笔。