跳到正文

课程日历

下载课程日历 (.ics)

全部安排

日期 / 时间活动内容提要主讲课程材料 / 作业
已结束18:00–20:30
Topic 1 Kernel & ML Compiler 第一次分享Session 1.0 回放 · Session 1.1 回放 · Session 1.2 回放
Session 1.0 从 HPC 到 AI Infra:并行计算与并行编程 Session 1.1 CUDA 编程模型 Session 1.2 Triton/TileLang Tile Level 编程 介绍活动整体安排、内容设计、评测与…展开完整内容收起完整内容

Session 1.0 从 HPC 到 AI Infra:并行计算与并行编程 Session 1.1 CUDA 编程模型 Session 1.2 Triton/TileLang Tile Level 编程 介绍活动整体安排、内容设计、评测与算力资源。

陈嘉骏郑熠王艺霏
已结束19:30–21:30
Topic 1, Session 2:Memory Abstraction & Hierarchy腾讯会议 · B站直播 · LCPU Live
本讲以 CUDA Core FP32 GEMM 为主线,从计算语义出发理解 data reuse 与 memory hierarchy 的抽象;从 strawman GEMM 演进到 tiling,并使用 Roofline Model 分析…展开完整内容收起完整内容

本讲以 CUDA Core FP32 GEMM 为主线,从计算语义出发理解 data reuse 与 memory hierarchy 的抽象;从 strawman GEMM 演进到 tiling,并使用 Roofline Model 分析数据复用;再从硬件视角理解 SM、warp 执行、 coalescing、latency hiding、shared memory bank conflict、padding、 swizzle 与 per-thread microtile,最后使用 Nsight Compute 完成一个 Kernel 的编写与调优。

周宇轩林若瑜
待开始19:00–22:00
Topic 1, Session 3:Tensor Core腾讯会议 · B站直播 · LCPU Live
本讲以 Tensor Core 的硬件与编程模型为主线,贯穿 mma.sync(Ampere)、 wgmma(Hopper)和 tcgen05(Blackwell)三代指令的演进,从数据搬运与 发射带宽推导 Tensor Core 的设计逻…展开完整内容收起完整内容

本讲以 Tensor Core 的硬件与编程模型为主线,贯穿 mma.sync(Ampere)、 wgmma(Hopper)和 tcgen05(Blackwell)三代指令的演进,从数据搬运与 发射带宽推导 Tensor Core 的设计逻辑,理解 fragment 布局以及使用 layout 与 swizzle 解决 bank conflict 的方法,最后以 FP8 fine-grained scaling 介绍低精度 Tensor Core 的使用。

孙远航

日历视图

课程讲座嘉宾讲座作业 DDL
正在加载交互日历…

上方日程列表会始终保留。