使用CUDA实现并极致优化softmax
相关文章智能推荐
1
CUDA KV Cache:分页存储与长上下文 Decode 极致优化
面向大模型推理拆解 KV Cache 容量、分页寻址、向量化 append、GQA decode 与 split-KV,并用 FlashInfer 和 PyTorch 做长上下文实测。
2
从 Qwen3 数学到 CUDA Kernel:0.6B 推理运行时的完整实现与优化
从零推导 Qwen3-0.6B 每层数据流,解释 Paged KV Cache、online softmax、短长上下文 attention、CUDA Graph、Tensor Core 与 LM-head W8A16,并给出可复现 benchmark。
3
CUDA FlashAttention:从在线 Softmax 到长序列 IO 极限
以大模型因果 Attention 为背景,从二次中间矩阵、在线 Softmax、分层 tile 与 warp/MMA 数据流出发,实现并验证 FlashAttention 的 CUDA 优化。
4
CUDA LSMR 专栏(三):递推融合与 8kv/11kv 实测
把 LSMR 小向量递推融合为 CUDA kernel,并用两组真实 FP32 重建输入对齐 CuPy 的迭代、残差与性能。
5
大模型FCN算子(GEMM)CUDA实现
CUDA学习之路从标量基线到 Tensor Core、异步流水、低比特缩放和分段调度:构建一个面向大模型全连接层的工业级 GEMM 算子族。
随机文章随机推荐













