在线观看国产一区二区_免费一级A爱片久久毛片_VA在线观看免费国产_色污无遮挡在线看WWW_国产麻豆福利在线观看_国产日韩高清三级精品人成_99久久人妻无码精品系列ai_天堂av免费在线

人工智能（AI）模型的規(guī)模和復(fù)雜度以每年大約 10 倍的速度不斷增加，AI 解決方案提供商面臨著巨大的壓力，他們必須縮短產(chǎn)品上市時間，提高性能，快速適應(yīng)不斷變化的形勢。模型復(fù)雜性日益增加，AI 優(yōu)化的硬件隨之出現(xiàn)。

例如，近年來，圖形處理單元（GPU）集成了 AI 優(yōu)化的算法單元，以提高 AI 計算吞吐量。然而，隨著 AI 算法和工作負載的演變與發(fā)展，它們會展現(xiàn)出一些屬性，讓我們難以充分利用可用的 AI 計算吞吐量，除非硬件提供廣泛的靈活性來適應(yīng)這種算法變化。近期的論文表明，許多 AI 工作負載都難以實現(xiàn) GPU 供應(yīng)商報告的全部計算能力。即使對于高度并行的計算，如一般矩陣乘法（GEMM），GPU 也只能在一定規(guī)模的矩陣下實現(xiàn)高利用率。因此，盡管 GPU 在理論上提供較高的 AI 計算吞吐量（通常稱為“峰值吞吐量”），但在運行 AI 應(yīng)用時，實際性能可能低得多。

FPGA 可提供一種不同的 AI 優(yōu)化的硬件方法。與 GPU 不同，F(xiàn)PGA 提供獨特的精細化空間可重構(gòu)性。這意味著我們可以配置 FPGA 資源，以極為準確的順序執(zhí)行精確的數(shù)學(xué)函數(shù)，從而實施所需的操作。每個函數(shù)的輸出都可以直接路由到需要它的函數(shù)的輸入之中。這種方法支持更加靈活地適應(yīng)特定的 AI 算法和應(yīng)用特性，從而提高可用 FPGA 計算能力的利用率。此外，雖然 FPGA 需要硬件專業(yè)知識才能編程（通過硬件描述語言），但專門設(shè)計的軟核處理單元（也就是重疊結(jié)構(gòu)），允許 FPGA 以類似處理器的方式編程。FPGA 編程完全通過軟件工具鏈來完成，簡化了任何特定于 FPGA 的硬件復(fù)雜性。

FPGA與GPU架構(gòu)的背景

2020 年，英特爾宣布推出首款 AI 優(yōu)化的 FPGA — 英特爾 Stratix 10 NX FPGA 器件。英特爾 Stratix 10 NX FPGA 包括 AI 張量塊，支持 FPGA 實現(xiàn)高達 143 INT8 和 286 INT4 峰值 AI 計算 TOPS 或 143 塊浮點 16（BFP16）和 286 塊浮點 12（BFP12）TFLOPS。最近的論文表明，塊浮點精度可為許多 AI 工作負載提供更高的精度和更低的消耗。NVIDIA GPU 同樣也提供張量核。但從架構(gòu)的角度來看，GPU 張量核和 FPGA AI 張量塊有很大的不同，如下圖所示。

GPU 和 FPGA 都有張量核心。FPGA 有可以在數(shù)據(jù)流內(nèi)外編織的軟邏輯

（左）GPU 數(shù)據(jù)從張量核心處理的內(nèi)存系統(tǒng)中讀取，寫回內(nèi)存系統(tǒng)。（右）FPGA 數(shù)據(jù)可以從內(nèi)存中讀取，但數(shù)據(jù)流可以并行安排到一個或多個張量核心。任意數(shù)量的張量核心都能以最小的傳輸開銷使用輸出。數(shù)據(jù)可以被寫回內(nèi)存或路由到其他任何地方

英特爾研究人員開發(fā)了一種名為神經(jīng)處理單元（NPU）的 AI 軟處理器。這種 AI 軟處理器適用于低延遲、低批量推理。它將所有模型權(quán)重保持在一個或多個連接的 FPGA 上以降低延遲，從而確保模型持久性。

NPU 重疊架構(gòu)和用于編程 NPU 軟核處理器的前端工具鏈高級概述

FPGA與GPU性能比較

本次研究的重點是計算性能。下圖比較了英特爾 Stratix 10 NX FPGA 上的 NPU 與 NVIDIA T4 和 V100 GPU 運行各種深度學(xué)習(xí)工作負載的性能，包括多層感知器（MLP）、一般矩陣向量乘法（GEMV）、遞歸神經(jīng)網(wǎng)絡(luò)（RNN）、長期短期記憶（LSTM）和門控循環(huán)單元（GRU）。GEMV 和 MLP 由矩陣大小來指定，RNN、LSTM 和 GRU 則通過大小和時間步長來指定。例如，LSTM-1024-16 工作負載表示包含 1024x1024 矩陣和 16 個時間步長的 LSTM。

NVIDIA V100 和 NVIDIA T4 與英特爾 Stratix 10 NX FPGA 上的 NPU 在不同批處理規(guī)模下的性能。虛線顯示 NPU 在批次大小可被 6 整除情況下的性能

從這些結(jié)果可以充分地看出，英特爾 Stratix 10 NX FPGA 不僅可以在低批次實時推理時實現(xiàn)比 GPU 高一個數(shù)量級的性能，還可以有效地進行高批次實時推理。

由于架構(gòu)上的差異和靈活編程模型，英特爾 Stratix 10 NX FPGA 還可實現(xiàn)更出色的端到端性能。不會產(chǎn)生與 GPU 相同的開銷。

短序列和長序列時 RNN 工作負載的系統(tǒng)級執(zhí)行時間（越低越好）

結(jié)論

英特爾 Stratix 10 NX FPGA 采用高度靈活的架構(gòu)，所實現(xiàn)的平均性能比 NVIDIA T4 GPU 和 NVIDIA V100 GPU 分別高 24 倍和 12 倍。

由于其較高的計算密度，英特爾 Stratix 10 NX FPGA 可為以實際可達到性能為重要指標的高性能、延遲敏感型 AI 系統(tǒng)提供至關(guān)重要的功能。

審核編輯：李倩

聲明：本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點僅代表作者本人，不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用，如有內(nèi)容侵權(quán)或者其他違規(guī)問題，請聯(lián)系本站處理。舉報投訴

FPGA

FPGA

+關(guān)注

關(guān)注
1626

文章
21667

瀏覽量
601856
英特爾

英特爾

+關(guān)注

關(guān)注
60

文章
9886

瀏覽量
171525
算法

算法

+關(guān)注

關(guān)注
23

文章
4599

瀏覽量
92643

原文標題：實際性能超過GPU，英特爾?Stratix?10 NX FPGA如何助您在AI加速領(lǐng)域贏得先機？

文章出處：【微信號：zhuyandz，微信公眾號：FPGA之家】歡迎添加關(guān)注！文章轉(zhuǎn)載請注明出處。

GPU服務(wù)器AI網(wǎng)絡(luò)架構(gòu)設(shè)計

眾所周知，在大型模型訓(xùn)練中，通常采用每臺服務(wù)器配備多個GPU的集群架構(gòu)。在上一篇文章《高性能GPU服務(wù)器AI網(wǎng)絡(luò)架構(gòu)（上篇）》中，我們對GPU

發(fā)表于 11-05 16:20 ?198次閱讀

【「算力芯片 | 高性能 CPU/GPU/NPU 微架構(gòu)分析」閱讀體驗】--了解算力芯片GPU

本篇閱讀學(xué)習(xí)第七、八章，了解GPU架構(gòu)演進及CPGPU存儲體系與線程管理 █從圖形到計算的GPU架構(gòu)演進 GPU圖像計算發(fā)展 ●從三角形開始

發(fā)表于 11-03 12:55

【「算力芯片 | 高性能 CPU/GPU/NPU 微架構(gòu)分析」閱讀體驗】--全書概覽

、GPU、NPU,給我們剖析了算力芯片的微架構(gòu)。書中有對芯片方案商處理器的講解，理論聯(lián)系實際，使讀者能更好理解算力芯片。全書共11章，由淺入深，較系統(tǒng)全面進行講解。下面目錄對全書內(nèi)容有一個整體了解

發(fā)表于 10-15 22:08

ALINX FPGA+GPU異架構(gòu)視頻圖像處理開發(fā)平臺介紹

Alinx 最新發(fā)布的新品 Z19-M 是一款創(chuàng)新的 FPGA+GPU 異構(gòu)架構(gòu)視頻圖像處理開發(fā)平臺，它結(jié)合了 AMD Zynq UltraScale+ MPSoC（FPGA）與 NVIDIA Jetson Orin NX（

發(fā)表于 08-29 14:43 ?981次閱讀

自動駕駛?cè)笾髁餍酒?b class='flag-5'>架構(gòu)分析

當前主流的AI芯片主要分為三類，GPU、FPGA、ASIC。GPU、FPGA均是前期較為成熟的芯片架構(gòu)，屬于通用型芯片。ASIC屬于為AI特

發(fā)表于 08-19 17:11 ?1462次閱讀

自動駕駛?cè)笾髁餍酒?b class='flag-5'>架構(gòu)</b>分析

科普：GPU和FPGA，有何異同

來源：內(nèi)容由半導(dǎo)體行業(yè)觀察（ID：icbank）編譯自techspot，謝謝。圖形處理單元(GPU)和現(xiàn)場可編程門陣列(FPGA)是用于成像和其他繁重計算的三種主要處理器類型中的兩種。中央處理器

發(fā)表于 06-15 08:27 ?610次閱讀

科普：<b class='flag-5'>GPU</b>和<b class='flag-5'>FPGA</b>，有何異同

X-Silicon發(fā)布RISC-V新架構(gòu) 實現(xiàn)CPU/GPU一體化

X-Silicon 的芯片與其他架構(gòu)不同，其設(shè)計將 CPU 和 GPU 的功能整合到單核架構(gòu)中。這與英特爾和 AMD 的典型設(shè)計不同，前者有獨立的 CPU 內(nèi)核和 GPU 內(nèi)核。

發(fā)表于 04-08 11:34 ?545次閱讀

X-Silicon發(fā)布RISC-V新<b class='flag-5'>架構(gòu)</b> 實現(xiàn)CPU/<b class='flag-5'>GPU</b>一體化

fpga和gpu的區(qū)別

FPGA（現(xiàn)場可編程門陣列）和GPU（圖形處理器）在多個方面存在顯著的區(qū)別。

發(fā)表于 03-27 14:23 ?1141次閱讀

FPGA在深度學(xué)習(xí)應(yīng)用中或?qū)⑷〈?b class='flag-5'>GPU

現(xiàn)場可編程門陣列 (FPGA) 解決了 GPU 在運行深度學(xué)習(xí)模型時面臨的許多問題在過去的十年里，人工智能的再一次興起使顯卡行業(yè)受益匪淺。英偉達 (Nvidia) 和 AMD 等公司的股價也大幅

發(fā)表于 03-21 15:19

fpga芯片架構(gòu)介紹

FPGA（現(xiàn)場可編程門陣列）芯片架構(gòu)是一種高度靈活和可編程的集成電路架構(gòu)，它以其獨特的結(jié)構(gòu)和功能，在現(xiàn)代電子系統(tǒng)中扮演著至關(guān)重要的角色。FPGA芯片

發(fā)表于 03-15 14:56 ?702次閱讀

fpga是什么架構(gòu)

FPGA（現(xiàn)場可編程門陣列）的架構(gòu)主要由可配置邏輯模塊（CLB）、輸入/輸出模塊（IOB）以及可編程互連資源組成。

發(fā)表于 03-14 17:05 ?832次閱讀

深入解讀AMD最新GPU架構(gòu)

GCN 取代了 Terascale，并強調(diào) GPGPU 和圖形應(yīng)用程序的一致性能。然后，AMD 將其 GPU 架構(gòu)開發(fā)分為單獨的 CDNA 和 RDNA 線路，分別專門用于計算和圖形。

發(fā)表于 01-08 10:12 ?1147次閱讀

FPGA、ASIC、GPU誰是最合適的AI芯片？

CPU、GPU遵循的是馮·諾依曼體系結(jié)構(gòu)，指令要經(jīng)過存儲、譯碼、執(zhí)行等步驟，共享內(nèi)存在使用時，要經(jīng)歷仲裁和緩存。而FPGA和ASIC并不是馮·諾依曼架構(gòu)（是哈佛架構(gòu)）。以

發(fā)表于 01-06 11:20 ?1407次閱讀

FPGA與GPU的區(qū)別

FPGA（現(xiàn)場可編程門陣列）和GPU（圖形處理器）是兩種常見的硬件加速器，用于提高計算和處理速度。盡管它們在很多方面都有重疊，但在架構(gòu)、設(shè)計和應(yīng)用上存在許多區(qū)別。在本文中，我們將詳細探討FPG

發(fā)表于 12-25 15:28 ?1641次閱讀

揭秘GPU：高端GPU架構(gòu)設(shè)計的挑戰(zhàn)

在計算領(lǐng)域，GPU（圖形處理單元）一直是性能飛躍的代表。眾所周知，高端GPU的設(shè)計充滿了挑戰(zhàn)。GPU的架構(gòu)創(chuàng)新，為軟件承接大模型訓(xùn)練和推理場景的人工智能計算提供了持續(xù)提升的硬件基礎(chǔ)。

發(fā)表于 12-21 08:28 ?856次閱讀

精品国产人成在线_亚洲高清无码在线观看_国产在线视频国产永久2021_国产AV综合第一页一个的一区免费影院黑人_最近中文字幕MV高清在线视频

搜索歷史

FPGA與GPU架構(gòu)的背景

評論

GPU服務(wù)器AI網(wǎng)絡(luò)架構(gòu)設(shè)計

【「算力芯片 | 高性能 CPU/GPU/NPU 微架構(gòu)分析」閱讀體驗】--了解算力芯片GPU

【「算力芯片 | 高性能 CPU/GPU/NPU 微架構(gòu)分析」閱讀體驗】--全書概覽

ALINX FPGA+GPU異架構(gòu)視頻圖像處理開發(fā)平臺介紹

自動駕駛?cè)笾髁餍酒?b class='flag-5'>架構(gòu)分析

科普：GPU和FPGA，有何異同

X-Silicon發(fā)布RISC-V新架構(gòu) 實現(xiàn)CPU/GPU一體化

fpga和gpu的區(qū)別

FPGA在深度學(xué)習(xí)應(yīng)用中或?qū)⑷〈?b class='flag-5'>GPU

fpga芯片架構(gòu)介紹

fpga是什么架構(gòu)

深入解讀AMD最新GPU架構(gòu)

FPGA、ASIC、GPU誰是最合適的AI芯片？

FPGA與GPU的區(qū)別

揭秘GPU：高端GPU架構(gòu)設(shè)計的挑戰(zhàn)