我们在海光 Z100 DCU (gfx906) 上对 vLLM 推理框架的 CUDA Graph 功能进行了完整的测试验证。本文记录开启 CUDA Graph + torch.compile 的具体配置、性能数据和关键发现。 测试环境 项目 详情 服务器 scnet GPU 1x 海光 Z100 DCU (gfx906), 16 GiB Python 3.10.12 PyTorch 2.10.0+das.opt1.dtk2604 vLLM 0.18.1+das.3266200.dtk2604 Triton 3.4.…

2026年6月15日 0条评论 162点热度 0人点赞 MuWinds 阅读全文

本文记录了我们使用自研微基准测试工具对 4× 海光 Z100 DCU 进行的一系列测试结果。 测试环境 项目 详情 GPU 4× 海光 Z100 DCU,每张 16GB,合计 64GB GPU 架构 gfx906 (Vega 20 / GCN 5.1) DTK 版本 DTK 26.04 (DCC2602-0317) PyTorch 2.10.0+das.opt1.dtk2604 测试工具 dcu_benchmark.py(基于 hy-smi 遥测采样) 采样间隔 1 秒 矩阵规模 4096 × 4096(Matmu…

2026年6月9日 0条评论 111点热度 0人点赞 MuWinds 阅读全文

环境信息 项目 详情 GPU 4× 海光 Z100 DCU,每张 16GB,合计 64GB GPU 架构 gfx906 (Vega 20 / GCN 5.1) DTK 版本 DTK 26.04 (DCC2602-0317) Python 3.10.12 PyTorch 2.10.0+das.opt1.dtk2604 vLLM 0.18.1+das.3266200.dtk2604 Triton 3.4.0(从源码编译,替换原 3.4.0+git1ef59765) transformers 5.5.0 flash_at…

2026年6月8日 0条评论 210点热度 0人点赞 MuWinds 阅读全文