日本 ARM 超算富岳第三次登顶 Top 500 榜单
2021-06-29 23:19 #超级电脑
Top 500 公布了 最新的榜单,日本
ARM 超算富岳第三次登顶。富岳安装在神户的日本理化所计算机科学中心,其处理器为富士通公司的 48/52 核 A64FX ARM v8.2-A,采用了可缩放矢量扩展(Scalable Vector Extension)和 512 位实现,为高性能计算进行了优化,由台积电 7 纳米工艺制造,晶体管数量 878.6 亿。A64FX 包含 48 个计算核心和 2 到 4 个辅助核心,没有 GPU 加速器,封装了 HBM2 内存。富岳的处理器核心数从今年上半年的 7,299,072 增加到了 7,630,848,运算性能达到 442 petaflops,是第二名美国橡树岭国家实验室 IBM 超算 Summit 的 3 倍。排名前十的超算只出现一个新人:富岳,Summit(148.6 petaflops),Sierra,神威太湖之光,新超算 Perlmutter(使用 AMD EPYC 处理器和英伟达 A100 GPU,性能 64.6 petaflops),英伟达超算 Selen(性能 63.4 petaflops),天河二号 A(61.4 petaflops),德国超算 JUWELS Booster Module(44.1 petaflops),HPC5(意大利),Frontera。中国依旧保持超算数量第一有 186 台(比去年的 212 台大幅下降,原因未知),美国 123 台,美国超算的总性能高于中国,以 856.8 petaflops 超过中国的 445.3 petaflops。Top 500 超算中使用 AMD CPU 的数量在大幅增加,从去年的 21
台增加到 43 台。
2021-06-29 23:19 #超级电脑
Top 500 公布了 最新的榜单,日本
ARM 超算富岳第三次登顶。富岳安装在神户的日本理化所计算机科学中心,其处理器为富士通公司的 48/52 核 A64FX ARM v8.2-A,采用了可缩放矢量扩展(Scalable Vector Extension)和 512 位实现,为高性能计算进行了优化,由台积电 7 纳米工艺制造,晶体管数量 878.6 亿。A64FX 包含 48 个计算核心和 2 到 4 个辅助核心,没有 GPU 加速器,封装了 HBM2 内存。富岳的处理器核心数从今年上半年的 7,299,072 增加到了 7,630,848,运算性能达到 442 petaflops,是第二名美国橡树岭国家实验室 IBM 超算 Summit 的 3 倍。排名前十的超算只出现一个新人:富岳,Summit(148.6 petaflops),Sierra,神威太湖之光,新超算 Perlmutter(使用 AMD EPYC 处理器和英伟达 A100 GPU,性能 64.6 petaflops),英伟达超算 Selen(性能 63.4 petaflops),天河二号 A(61.4 petaflops),德国超算 JUWELS Booster Module(44.1 petaflops),HPC5(意大利),Frontera。中国依旧保持超算数量第一有 186 台(比去年的 212 台大幅下降,原因未知),美国 123 台,美国超算的总性能高于中国,以 856.8 petaflops 超过中国的 445.3 petaflops。Top 500 超算中使用 AMD CPU 的数量在大幅增加,从去年的 21
台增加到 43 台。
特斯拉透露它的 AI 超算 Dojo
2021-08-21 23:08 #超级电脑
特斯拉举办了 AI Day 活动, 透露了它的自研超算 Dojo,使用台积电 7 纳米工艺制造,将输入来自特斯拉汽车发回的海量视频训练其神经网络。特斯拉称 Dojo 使用的芯片叫 D1,具有 GPU 级别的计算能力,同时又拥有 CPU 级别的灵活性。Dojo D1 的分布式计算架构类似硅谷创业公司 Cerebras Systems 的 超大型 AI 芯片 Wafer Scale Engine(WSE)。每个功能单元具有 1TFlop BF16/CFP8 和 64GFlops FP32 的运算能力,每个方向的带宽 512GB/s。一块完整的芯片有 354 个功能单元,运算能力 362 TFlops BF16/CFP8 和 22.6 TFlops FP32,大小 645mm^2,晶体管数量 500 亿,功率 400W TDP。它的晶体管密度高于几乎所有高性能芯片,只低于移动芯片和 Apple M1。25 个 D1 芯片封装成 1 个 training tile,每个 tile 的运算能力 9 PFlops BF16/CFP8。一个机柜共有 12 个 tile,运算能力 108 PFlops,总共超过 10 万个功能单元。特斯拉计划扩大到 10 个机柜,使得运算能力超过 1.1 Exaflops。
2021-08-21 23:08 #超级电脑
特斯拉举办了 AI Day 活动, 透露了它的自研超算 Dojo,使用台积电 7 纳米工艺制造,将输入来自特斯拉汽车发回的海量视频训练其神经网络。特斯拉称 Dojo 使用的芯片叫 D1,具有 GPU 级别的计算能力,同时又拥有 CPU 级别的灵活性。Dojo D1 的分布式计算架构类似硅谷创业公司 Cerebras Systems 的 超大型 AI 芯片 Wafer Scale Engine(WSE)。每个功能单元具有 1TFlop BF16/CFP8 和 64GFlops FP32 的运算能力,每个方向的带宽 512GB/s。一块完整的芯片有 354 个功能单元,运算能力 362 TFlops BF16/CFP8 和 22.6 TFlops FP32,大小 645mm^2,晶体管数量 500 亿,功率 400W TDP。它的晶体管密度高于几乎所有高性能芯片,只低于移动芯片和 Apple M1。25 个 D1 芯片封装成 1 个 training tile,每个 tile 的运算能力 9 PFlops BF16/CFP8。一个机柜共有 12 个 tile,运算能力 108 PFlops,总共超过 10 万个功能单元。特斯拉计划扩大到 10 个机柜,使得运算能力超过 1.1 Exaflops。