一个纯静态的 GPU 硬件数字速查站点,面向 CUDA / ROCm 算子与 AI 框架工程师。无构建步骤、无依赖,克隆即可用。
当前收录 3 台单元 + 1 张机柜级速查卡 · 2 种生态:
| 单元 | 生态 | 对比基准 | 口径 |
|---|---|---|---|
| H200(Hopper GH100) | CUDA · cc 9.0 | ×A100 | SXM 700W · 141GB HBM3e |
| B200(Blackwell 双 GB100 die) | CUDA · cc 10.0 | ×H200 | HGX 单卡 1000W · 180GB HBM3e |
| MI300X(CDNA3 · 8 XCD + 4 IOD) | ROCm/HIP · gfx942 | ×H200 | OAM 750W · 192GB HBM3 |
| GB300 NVL72(Blackwell Ultra 机柜) | CUDA · 机柜级 | ×9×HGX H200 | 对齐 72 GPU · 单柜 ≤142kW 液冷 · 20TB HBM3e |
入口页 index.html(设备机架),进入三个分站与一张机柜级速查卡。每个分站同构:8 章节主页面 + 5 个特性专题页。
- 主页面 8 章节:整机 / 单 SM·CU / 架构图 / 存储层级 / 精度算力(dense vs sparse 2:4)/ 延迟 / Roofline / 特性卡片墙
- 特性专题:
- H200:TMA · wgmma · Clusters · DSMEM · FP8
- B200:tcgen05+TMEM · NVFP4 · 双 die NV-HBI · NVLink5/NVL72 · TMA 增强+Cluster16
- MI300X:Chiplet · MFMA · Wave64/占用度 · Infinity Fabric · 异步通路
- 机柜级速查卡 GB300 NVL72(单页 6 模块):整机柜总账(含 GB200 参照列)/ 单 GPU 锚点 / 互联拓扑图(9 域 → 1 域)/ 通信账本(busbw 实测)/ 机房供电 / 迁移注意
- dense 才是 roofline 基准:NVIDIA 官方峰值默认 sparse(2:4),B200 页按官方规则 dense = sparse ÷ 2 换算;AMD 官方峰值即 dense(sparse 另列)。
- 机柜对比对齐 72 GPU(GB300 页):1 × GB300 NVL72 vs 9 × HGX H200 节点(倍数只含代差、不含规模差);NVIDIA 柜级 FLOPS 默认 sparse,GB300 页 1,080 PF FP4 为官方标注 dense 值。
- 来源分级(B200 / MI300X / GB300 页):每个关键数字带编号脚注上标,页脚按 官方 / 第三方 / 推算 三级标注来源;无公开实测的行内标
估算。官方材料间的口径冲突(如 MI300X fabric 带宽 4.8 vs 6TB/s)在脚注中逐条说明。 - 延迟为量级参考值:H200 用 H800 公开微基准;B200/MI300X 用公开论文与第三方实测(arXiv / SemiAnalysis / Chips and Cheese / SC'25),方法不同、不可跨卡直接互换绝对值。
- NVIDIA:Hopper Architecture In-Depth · H200 spec · Hopper Tuning Guide · Blackwell 白皮书/HGX·GB200 页 · Blackwell Tuning Guide · PTX ISA · CUDA C++ Programming Guide · GB300 NVL72 页 · NVL72 AI Factory 参考架构
- AMD:MI300X Datasheet · CDNA3 White Paper · CDNA3 ISA · ROCm docs
- 第三方实测/分析:SemiAnalysis · Chips and Cheese · arXiv B200 微基准 · SC'25 MALL 论文 · CoreWeave nccl-tests(NVL72 busbw 实测) · SGLang on GB300 / InferenceXv2
纯静态站点,任选一种方式:
# python
python3 -m http.server 8000
# 或 node
npx serve .浏览器打开 http://localhost:8000。
双 CI 自带,推送 main 即自动发布:
- GitHub Pages:
.github/workflows/pages.yml(推送到 main 触发,部署 https://blog.coolgpu.cn/ai-gpu-specs/,也可手动 workflow_dispatch) - GitLab Pages:
.gitlab-ci.yml(默认分支触发,发布public/产物)
纯静态产物,也可用任意静态托管(Netlify / Vercel),无需构建命令。