企业邮局 联系我们 设为首页 收藏本站 繁體中文
新闻搜索
 
最新新闻
1  黄仁勋回应DeepS
2  速达进销存:数字化转
3  在企业管理软件最常用
4  财务软件通用操作指南
5  ChatGPT,你对
6  消息称OpenAI正
7  英特尔与产业打造全栈
8  速达渠道全系列产品注
9  中小企业如何实现数智
10  速达天耀A.clou
热门新闻 点击
 中小企业信息化问题多 2771777
 企业信息综合信息化服 1631033
 ERP风雨40年之痛 1417087
 ERP代理商应如何掌 1294413
 实施ERP之前需考虑 769926
 下月可预订世博会手机 745216
 “2009IT影响中 476725
 铁通介入固话业务&n 473582
 江苏泰州ISP服务商 473376
 又遇金融危机 中小企 423392
     首页 >> 
特斯拉发布D1 AI芯片:500亿晶体管、400W热设计功耗
双击自动滚屏 来源:快科技  发布者:xmkj  发布时间:2021-8-23  阅读:671次 【字体:

近日的特斯拉AI日活动上,特斯拉公布了最新的AI训练芯片“D1”,规模庞大,令人称奇。

该芯片采用台积电7nm工艺制造,核心面积达645平方毫米,仅次于NVIDIA Ampere架构的超级计算核心A100(826平方毫米)、AMD CDNA2架构的下代计算核心Arcturus(750平方毫米左右),集成了多达500亿个晶体管,相当于Intel Ponte Vecchio计算芯片的一半。

其内部走线,长度超过11英里,也就是大约18公里。


它集成了四个64位超标量CPU核心,拥有多达354个训练节点,特别用于8×8乘法,支持FP32、BFP64、CFP8、INT16、INT8等各种数据指令格式,都是AI训练相关的。

特斯拉称,D1芯片的FP32单精度浮点计算性能达22.6TFlops(每秒22.6万亿次),BF16/CFP8计算性能则可达362TFlops(每秒362万亿次)。

为了支撑AI训练的扩展性,它的互连带宽非常惊人,最高可达10TB/s,由多达576个通道组成,每个通道的带宽都有112Gbps。

而实现这一切,热设计功耗仅为400W。


特斯拉D1芯片可通过DIP(Dojo接口处理器)进行互连,25颗组成一个训练单元(Training Tile),而且多个训练单元可以继续互连,单个对外带宽高达36TB/s,每个方向都是9TB/s。

如此庞然大物,耗电量和发热都是相当可怕的,电流达18000A,覆盖一个长方体散热方案,散热能力高达15kW。




特斯拉展示了实验室内部的一个训练单元,运行频率2GHz,计算性能最高9PFlops(每秒9千万亿次)。


特斯拉还用D1芯片,打造了一台AI超级计算机“ExaPOD”,配备120个训练单元、3000颗D1芯片、1062000个训练节点,FP16/CFP8训练性能峰值1.1EFlops(每秒110亿亿次计算)。

建成后,它将是世界上最快的AI超算,对比特斯拉现在基于NVIDIA方案的超算,成本差不多,但拥有4倍的性能、1.3倍的能效比、1/5的体积。



  • 上一条新闻: 英特尔推出全新高性能显卡品牌Intel Arc,首款产品明年第一季度上市

  • 下一条新闻: 谷歌微软等承诺投入数十亿美元用于网络安全建设
  • 返回上级新闻
  •  相关评论

    暂无评论

     发表评论
     呢称:
    验证码:
     评论内容:
      

    打印本页 || 关闭窗口

    地址:北京市朝阳区管庄乡1号1幢1431号 电话:010-56142899 传真:010-82085683 热线:18701104954 邮箱:xmkj@bjxmkj.com QQ:744952589 点击这里给我发消息
    版权所有 (C) 北京信铭科技有限公司
    备案/许可证号:京ICP备09056968号-2