omniture

Amazon EC2 Inf2實例正式可用 助力低成本、高性能的生成式AI推理

亞馬遜云科技
2023-04-21 11:29 2819

北京2023年4月21日 /美通社/ -- 深度學(xué)習(xí)(DL)的創(chuàng)新,特別是大語言模型(LLM)的快速發(fā)展,已經(jīng)席卷了整個行業(yè)。深度學(xué)習(xí)模型的參數(shù)已從數(shù)百萬增加到數(shù)十億,為我們呈現(xiàn)了越來越多激動人心的新能力。它們正在催生新的應(yīng)用,如生成式AI或醫(yī)療保健和生命科學(xué)的高級研究。亞馬遜云科技一直在芯片、服務(wù)器、數(shù)據(jù)中心互連和軟件服務(wù)等多個方面創(chuàng)新,加速深度學(xué)習(xí)工作負(fù)載的大規(guī)模應(yīng)用。

亞馬遜云科技在2022 re:Invent 全球大會上,以其最新的自研機(jī)器學(xué)習(xí)推理芯片Amazon Inferentia2為基礎(chǔ),發(fā)布了Amazon EC2 Inf2系列實例的預(yù)覽版。Amazon EC2 Inf2類型實例專門針對全球大規(guī)模運(yùn)行高性能深度學(xué)習(xí)推理應(yīng)用程序,為部署在EC2上的生成式AI應(yīng)用提供最佳性價比,其中包含 GPT-J或開放式預(yù)訓(xùn)練Transformer(OPT)語言模型。

現(xiàn)在,亞馬遜云科技宣布Amazon EC2 Inf2實例正式可用。

Inf2實例是Amazon EC2上首個推理優(yōu)化的實例,支持可擴(kuò)展的分布式推理,可實現(xiàn)多個inferentia2芯片之間的超高速連接。用戶可以在Inf2實例中跨多個芯片高效部署具有數(shù)千億個參數(shù)的模型。與Amazon EC2 Inf1實例相比,Inf2實例的吞吐量提高4倍,延遲降低10倍。

Inf2實例的亮點(diǎn)

Inf2實例目前有四種可用實例類型,最高擴(kuò)展至12個Amazon Inferentia2芯片和192個vCPU配置。在BF16或FP16數(shù)據(jù)類型下,它們能夠提供2.3 petaFLOPS的綜合計算能力,并具有芯片間超高速NeuronLink互連的功能。NeuronLink可在多個Inferentia2芯片上擴(kuò)展大模型,避免通信瓶頸,實現(xiàn)更高性能的推理。

每個Inferentia2芯片內(nèi)有32 GB的高帶寬內(nèi)存(HBM),最高配置的 Inf2 實例可提供高達(dá)384 GB的共享加速器內(nèi)存,總內(nèi)存帶寬為9.8 TB/s。對于需要大內(nèi)存支持的的大型語言模型而言,這種帶寬對于支持模型推理尤為重要。

基于專門為深度學(xué)習(xí)工作負(fù)載而構(gòu)建的 Amazon Inferentia2芯片的 Amazon EC2 Inf2,相比同類實例,單位功率性能高出了50%。

Amazon Inferentia2的創(chuàng)新之處

與亞馬遜自研機(jī)器學(xué)習(xí)訓(xùn)練芯片 Amazon Trainium類似,每個Amazon Inferentia2芯片都配有兩個經(jīng)過優(yōu)化的NeuronCore-v2引擎、高帶寬內(nèi)存(HBM)堆棧和專用的集體計算引擎,以便在執(zhí)行多加速器推理時實現(xiàn)計算與通信的并行。

每個NeuronCore-v2都有專為深度學(xué)習(xí)算法構(gòu)建的標(biāo)量、向量和張量三種引擎,其中張量引擎針對矩陣運(yùn)算進(jìn)行了優(yōu)化;標(biāo)量引擎針對ReLU(修正線性單元)函數(shù)等元素性操作進(jìn)行了優(yōu)化;向量引擎針對批處理規(guī)范化或池化等非元素向量運(yùn)算進(jìn)行了優(yōu)化。

以下是Amazon Inferentia2芯片和服務(wù)器硬件其他創(chuàng)新總結(jié):

數(shù)據(jù)類型——Amazon Inferentia2 支持多種數(shù)據(jù)類型,包括 FP32、TF32、BF16、FP16 和 UINT8,用戶可以為工作負(fù)載選擇最合適的數(shù)據(jù)類型。它還支持新的可配置 FP8(cFP8) 數(shù)據(jù)類型,該數(shù)據(jù)類型特別適用于大模型,因為它減少了模型的內(nèi)存占用和 I/O 要求。

動態(tài)執(zhí)行和動態(tài)輸入形狀——Amazon Inferentia2 具有支持動態(tài)執(zhí)行的嵌入式通用數(shù)字信號處理器 (DSP),因此無需在主機(jī)上展開或執(zhí)行控制流運(yùn)算符。Amazon Inferentia2 還支持動態(tài)輸入形狀,這些形狀對于具有未知輸入張量大小的模型(例如處理文本的模型)至關(guān)重要。

自定義運(yùn)算符——Amazon Inferentia2支持用C++語言編寫的自定義運(yùn)算符。Neuron自定義C++運(yùn)算符使用戶能夠編寫在NeuronCore上天然運(yùn)行的C++自定義運(yùn)算符。用戶可以使用標(biāo)準(zhǔn)的 PyTorch自定義運(yùn)算符編程接口將 CPU 自定義運(yùn)算符遷移到 Neuron 并實現(xiàn)新的實驗運(yùn)算符,所有這些都無需對 NeuronCore 硬件有任何深入了解。

NeuronLink v2——Inf2實例是Amazon EC2類型中首個將 NeuronLink V2 用于推理優(yōu)化的實例,NeuronLink v2 為Inferentia2芯片間的提供超高速連接,加強(qiáng)分布式推理性能。NeuronLink v2使用all-reduce等聚合通信(CC)運(yùn)算符,將高性能推理管道擴(kuò)展到所有的推理芯片上。

Inf2實例現(xiàn)已可用

用戶可在亞馬遜云科技美東(俄亥俄州)和美東(北弗吉尼亞州)地區(qū)啟動Inf2實例,以按需、預(yù)留和競價實例或Savings Plan方式調(diào)用。用戶僅需為其實際使用的服務(wù)付費(fèi)。如需了解更多相關(guān)信息,請訪問Amazon EC2定價網(wǎng)站。

Inf2實例可使用亞馬遜云科技深度學(xué)習(xí)鏡像進(jìn)行部署,并可通過Amazon SageMaker、Amazon Elastic Kubernetes Service(Amazon EKS)、Amazon Elastic Container Service(Amazon ECS)和Amazon ParallelCluster等托管服務(wù)調(diào)用。

如需了解更多信息,請訪問Amazon EC2 Inf2實例頁面,并將相關(guān)反饋發(fā)送給Amazon re:Post for EC2;或垂詢您的Amazon Support聯(lián)系人。

消息來源:亞馬遜云科技
China-PRNewsire-300-300.png
全球TMT
微信公眾號“全球TMT”發(fā)布全球互聯(lián)網(wǎng)、科技、媒體、通訊企業(yè)的經(jīng)營動態(tài)、財報信息、企業(yè)并購消息。掃描二維碼,立即訂閱!
collection