99精品伊人亚洲|最近国产中文炮友|九草在线视频支援|AV网站大全最新|美女黄片免费观看|国产精品资源视频|精彩无码视频一区|91大神在线后入|伊人终合在线播放|久草综合久久中文

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評(píng)論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會(huì)員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識(shí)你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

性能提升20倍!NVIDIA A100 GPU打破16項(xiàng)AI芯片性能記錄

Carol Li ? 來(lái)源:電子發(fā)燒友整理 ? 作者:李彎彎 ? 2020-07-31 08:03 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

2020年7月30日,MLPerf組織發(fā)布第三個(gè)版本MLPerf Trainingv0.7基準(zhǔn)測(cè)試(Benchmark)結(jié)果。結(jié)果顯示,英偉達(dá)基于今年5月最新發(fā)布的Ampere架構(gòu)A100 TensorCore GPU,和HDR InfiniBand實(shí)現(xiàn)多個(gè)DGXA100系統(tǒng)互聯(lián)的龐大集群——DGX SuperPOD系統(tǒng)在性能上開創(chuàng)了八個(gè)全新里程碑,共打破16項(xiàng)紀(jì)錄。

MLPerf是成立于2018年5月的行業(yè)基準(zhǔn)測(cè)試組織,致力于機(jī)器學(xué)習(xí)硬件、軟件和服務(wù)的訓(xùn)練和推理性能測(cè)試,囊括行業(yè)中幾乎所有知名企業(yè)和機(jī)構(gòu),比如Intel、NVIDIA、Google、微軟、阿里巴巴等。

DGX SuperPOD系統(tǒng)公布于去年6月17號(hào)。最初由96臺(tái)NVIDIA DGX-2H超級(jí)計(jì)算機(jī)和Mellanox互連技術(shù)在短短三周內(nèi)建成,提供9.4千兆次的處理能力,用于該公司在無(wú)人駕駛車輛部署計(jì)劃中的需求。

而此次創(chuàng)造紀(jì)錄的NVIDIA DGX SuperPOD系統(tǒng)主要基于Ampere架構(gòu)以及Volta架構(gòu),并且搭載了今年5月份發(fā)布的Ampere架構(gòu)GPU A100。

黃仁勛在GTC 2020大會(huì)上說(shuō)道,A100是迄今為止人類制造出的最大7納米制程芯片。A100采用目前最先進(jìn)的臺(tái)積電(TSMC)7納米工藝,擁有540億個(gè)晶體管,它是一塊3D堆疊芯片,面積高達(dá)826mm^2,GPU的最大功率達(dá)到了400W。

這塊GPU上搭載了容量40G的三星HBM2顯存(比DDR5速度還快得多,就是很貴),第三代TensorCore。同時(shí)它的并聯(lián)效率也有了巨大提升,其采用帶寬600GB/s的新版NVLink,幾乎達(dá)到了10倍PCIE互聯(lián)速度。

隨著安培架構(gòu)出現(xiàn)的三代TensorCore對(duì)稀疏張量運(yùn)算進(jìn)行了特別加速:執(zhí)行速度提高了一倍,也支持TF32、FP16、BFLOAT16、INT8和INT4等精度的加速——系統(tǒng)會(huì)自動(dòng)將數(shù)據(jù)轉(zhuǎn)為TF32格式加速運(yùn)算,現(xiàn)在你無(wú)需修改任何代碼量化了,直接自動(dòng)訓(xùn)練即可。

A100也針對(duì)云服務(wù)的虛擬化進(jìn)行了升級(jí),因?yàn)槿碌膍ulti-instanceGPU機(jī)制,在模擬實(shí)例時(shí),每塊GPU的吞吐量增加了7倍。

最終在跑AI模型時(shí),如果用PyTorch框架,相比上一代V100芯片,A100在BERT模型的訓(xùn)練上性能提升6倍,BERT推斷時(shí)性能提升7倍。

電子發(fā)燒友綜合報(bào)道,參考自鎂客網(wǎng)、機(jī)器之心,轉(zhuǎn)載請(qǐng)注明來(lái)源和出處。

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問(wèn)題,請(qǐng)聯(lián)系本站處理。 舉報(bào)投訴
  • NVIDIA
    +關(guān)注

    關(guān)注

    14

    文章

    5309

    瀏覽量

    106467
  • gpu
    gpu
    +關(guān)注

    關(guān)注

    28

    文章

    4949

    瀏覽量

    131311
收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評(píng)論

    相關(guān)推薦
    熱點(diǎn)推薦

    NVIDIA Blackwell GPU優(yōu)化DeepSeek-R1性能 打破DeepSeek-R1在最小延遲場(chǎng)景中的性能紀(jì)錄

    本文將探討 NVIDIA TensorRT-LLM 如何基于 8 個(gè) NVIDIA Blackwell GPU 的配置,打破 DeepSeek-R1 在最小延遲場(chǎng)景中的
    的頭像 發(fā)表于 07-02 19:31 ?1931次閱讀
    <b class='flag-5'>NVIDIA</b> Blackwell <b class='flag-5'>GPU</b>優(yōu)化DeepSeek-R1<b class='flag-5'>性能</b> <b class='flag-5'>打破</b>DeepSeek-R1在最小延遲場(chǎng)景中的<b class='flag-5'>性能</b>紀(jì)錄

    【「算力芯片 | 高性能 CPU/GPU/NPU 微架構(gòu)分析」閱讀體驗(yàn)】+NVlink技術(shù)從應(yīng)用到原理

    。。) 原理學(xué)習(xí) 在「算力芯片 | 高性能 CPU/GPU/NPU 微架構(gòu)分析」書中,作者詳解了從帕斯卡架構(gòu)到40系的Hopper架構(gòu)的技術(shù)演變進(jìn)化,按照出版時(shí)間算是囊括了NVIDIA
    發(fā)表于 06-18 19:31

    英偉達(dá)A100和H100比較

    英偉達(dá)A100和H100都是針對(duì)高性能計(jì)算和人工智能任務(wù)設(shè)計(jì)的GPU,但在性能和特性上存在顯著差異。以下是對(duì)這兩款
    的頭像 發(fā)表于 02-10 17:05 ?4520次閱讀
    英偉達(dá)<b class='flag-5'>A100</b>和H<b class='flag-5'>100</b>比較

    使用NVIDIA推理平臺(tái)提高AI推理性能

    NVIDIA推理平臺(tái)提高了 AI 推理性能,為零售、電信等行業(yè)節(jié)省了數(shù)百萬(wàn)美元。
    的頭像 發(fā)表于 02-08 09:59 ?725次閱讀
    使用<b class='flag-5'>NVIDIA</b>推理平臺(tái)提高<b class='flag-5'>AI</b>推理<b class='flag-5'>性能</b>

    NVIDIA和GeForce RTX GPU專為AI時(shí)代打造

    NVIDIA 和 GeForce RTX GPU 專為 AI 時(shí)代打造。
    的頭像 發(fā)表于 01-06 10:45 ?671次閱讀

    借助NVIDIA GPU提升魯班系統(tǒng)CAE軟件計(jì)算效率

    本案例中魯班系統(tǒng)高性能 CAE 軟件利用 NVIDIA性能 GPU,實(shí)現(xiàn)復(fù)雜產(chǎn)品的快速仿真,加速產(chǎn)品開發(fā)和設(shè)計(jì)迭代,縮短開發(fā)周期,提升產(chǎn)
    的頭像 發(fā)表于 12-27 16:24 ?684次閱讀

    《算力芯片性能 CPUGPUNPU 微架構(gòu)分析》第3篇閱讀心得:GPU革命:從圖形引擎到AI加速器的蛻變

    對(duì)卷積核優(yōu)化的思考。 GPU的存儲(chǔ)體系采用了獨(dú)特的倒金字塔結(jié)構(gòu),在我看來(lái)這是其計(jì)算性能的關(guān)鍵。大容量寄存器設(shè)計(jì)破解了傳統(tǒng)馮諾依曼架構(gòu)的內(nèi)存瓶頸,合并訪存機(jī)制巧妙解決了內(nèi)存帶寬限制。NVIDIA
    發(fā)表于 11-24 17:12

    NPU技術(shù)如何提升AI性能

    設(shè)計(jì)的處理器,與傳統(tǒng)的CPU和GPU相比,它在執(zhí)行深度學(xué)習(xí)任務(wù)時(shí)具有更高的效率和更低的能耗。NPU通過(guò)專門優(yōu)化的硬件結(jié)構(gòu)和指令集,能夠更快地處理神經(jīng)網(wǎng)絡(luò)中的大量并行計(jì)算任務(wù)。 1. 優(yōu)化硬件架構(gòu) NPU技術(shù)通過(guò)優(yōu)化硬件架構(gòu)來(lái)提升AI
    的頭像 發(fā)表于 11-15 09:11 ?1466次閱讀

    如何提高GPU性能

    學(xué)習(xí)和機(jī)器學(xué)習(xí)等領(lǐng)域發(fā)揮著重要作用。 1. 硬件升級(jí) a. 更換高性能GPU 最直接的提高GPU性能的方法是升級(jí)到更高
    的頭像 發(fā)表于 10-27 11:21 ?2525次閱讀

    GPU性能服務(wù)器配置

    GPU性能服務(wù)器作為提升計(jì)算速度和效率的關(guān)鍵設(shè)備,在各大應(yīng)用場(chǎng)景中發(fā)揮著越來(lái)越重要的作用。在此,petacloud.ai小編為你介紹GPU
    的頭像 發(fā)表于 10-21 10:42 ?874次閱讀

    【「算力芯片 | 高性能 CPU/GPU/NPU 微架構(gòu)分析」閱讀體驗(yàn)】--全書概覽

    1章 從TOP500和MLPerf看算力芯片格局 1.1科學(xué)算力最前沿TOP500 1.2 AI算力新標(biāo)準(zhǔn) 第2章 高性能 CPU 流水線概覽 2.1什么是指令 2.2 流水線與MIPS 2.3
    發(fā)表于 10-15 22:08

    蘋果 A18 芯片發(fā)布:CPU 提升 30%、GPU 提升 40%

    核 CPU 包括 2 個(gè)性能核心和 4 個(gè)效率核心,比 iPhone 15 的 A16 Bionic 快 30%,能耗降低 30% 。 GPU 方面,A18
    的頭像 發(fā)表于 09-11 12:19 ?1300次閱讀
    蘋果 <b class='flag-5'>A</b>18 <b class='flag-5'>芯片</b>發(fā)布:CPU <b class='flag-5'>提升</b> 30%、<b class='flag-5'>GPU</b> <b class='flag-5'>提升</b> 40%

    名單公布!【書籍評(píng)測(cè)活動(dòng)NO.43】 算力芯片 | 高性能 CPU/GPU/NPU 微架構(gòu)分析

    和像素統(tǒng)一的G80到現(xiàn)在重金難求的H100;AMD的Zen系列CPU和RDNA系列GPU兩線作戰(zhàn);中國(guó)的高性能計(jì)算芯片逐步獲得更多TOP500排名;華為Ascend 910 NPU
    發(fā)表于 09-02 10:09

    手機(jī)光追大突破!天璣9400 GPU光追性能提升20%

    近日,科技圈傳來(lái)新消息,聯(lián)發(fā)科旗下最新旗艦芯片天璣9400在圖形技術(shù)上取得重大突破。據(jù)悉,該芯片光追性能較前代產(chǎn)品提升20%,并首發(fā)一
    的頭像 發(fā)表于 08-27 13:33 ?679次閱讀
    手機(jī)光追大突破!天璣9400 <b class='flag-5'>GPU</b>光追<b class='flag-5'>性能</b><b class='flag-5'>提升</b><b class='flag-5'>20</b>%

    NEO推出3D X-AI芯片,AI性能飆升百

    近日,半導(dǎo)體行業(yè)的創(chuàng)新先鋒NEO Semiconductor震撼發(fā)布了一項(xiàng)革命性技術(shù)——3D X-AI芯片,這項(xiàng)技術(shù)旨在徹底顛覆人工智能處理領(lǐng)域的能效與性能邊界。
    的頭像 發(fā)表于 08-21 15:45 ?964次閱讀