Token导航 LogoToken导航

人工智能大模型算力背后的数据中心硬件支撑

更新时间 2026-09-26来源 搜狐科技正文 2332字阅读约 8分钟3 张图片
人工智能大模型算力背后的数据中心硬件支撑

向人工智能(以下简称AI)大模型提出一个问题,屏幕上很快便会出现答案。表面上看,AI仿佛只用短短几秒就完成了“思考”,但实际上大模型已经完成了数据编码、模型推理、结果生成等一系列运算。AI大模型之所以能够快速处理海量信息,离不开硬件设施的支撑,这类设施被称为数据中心,其中包括芯片、服务器、网络、存储、供电和冷却等设备。通常情况下,数据中心所具备的运算能力可以称之为算力,它也被视为计算设备处理数据、执行算法并完成计算任务的能力。一套能够稳定支撑AI大模型运行的完整算力系统,离不开各模块的协同配合。其中,数据是算力运算的处理对象;算法为数据处理提供核心逻辑与规则依据;服务器承担模型部署、计算任务调度等工作;网络负责在不同设备之间传输数据;供电系统为设备运行持续提供电力;冷却系统则负责及时带走设备高负荷运行产生的热量,如图1所示。

图1 一套能够稳定支撑AI大模型运行的完整算力系统

一、1次回答,背后算了什么?

当前,我们接触的AI模型,本质上是规模庞大的神经网络模型。当文字、图像和音频输入模型,会先被转换为数值化的向量、矩阵或张量。随后,模型再执行大量矩阵乘法与加法运算,以及非线性激活等运算,逐层提取特征并生成输出。我们在屏幕上看到的只是一段文字或者一张图片,机器处理的确是一场高速的数字运算盛宴。整个计算过程有2个重要阶段:训练阶段和推理阶段。训练阶段就像长期上课学习,模型阅读大量样本,不断比较自身输出的答案与目标答案,反复调整内部网络参数,该过程耗时久,需要完成大量计算。推理阶段则类似一场开卷考试,已经训练完成的模型接收新的提问,调用已经学到的参数生成回答。每次推理的计算负担通常远小于完整训练,但如果大量用户同时访问,整体的计算量依然庞大。

二、为什么AI偏爱GPU?

计算机里最常见的CPU,就像一支由不同技能人员构成的队伍,有人负责任务控制、有人负责程序控制、有人负责数据准备等。大家紧密配合完成工作,遇到复杂步骤时,也能做出灵活反应。GPU最初主要服务于图形处理,需要同时计算屏幕上的大量像素、顶点等图形数据,内部集成了许多适合并行工作的计算单元,更像一支人数众多、多个小队各自并行工作,队内同步、队间异步的队伍,能在短时间内完成繁重的计算任务,如图 2 所示。

大模型本质上是深层神经网络,神经网络中的很多运算可以拆解成无数个结构相似的小任务。例如,在做矩阵运算时,矩阵中对应位置的数字可以同时相乘或累加。把这些任务交给GPU众多计算单元并行处理,速度远高于逐个计算,这正是GPU适合训练和运行大型模型的重要原因。当然,GPU并不是CPU的替代品,CPU负责组织流程、准备数据、协调设备;GPU则集中完成大批量数学运算,二者需要互相配合,协同工作。对于计算芯片而言,运算速度快还不够,倘若数据无法及时从存储器输送到计算单元,性能再强的芯片也会陷入“等米下锅”的窘境。因此,显存容量、显存带宽,以及芯片间的互连效率,都会影响大模型能否顺畅运行。现代算力竞争,比拼的是整个系统的综合实力,而不是单看某一块芯片的性能。

图2 CPU擅长灵活调度,GPU擅长大规模并行运算,二者共同完成AI任务

三、把许多计算机组成一支队伍

大型神经网络模型的训练任务十分繁重,只靠一台计算机通常难以完成。工程师会将任务进行拆解,分配给若干服务器与加速芯片:有的负责处理不同批次数据,有的负责承载模型的不同模块,再通过高速网络实时交换中间计算结果,这属于并行计算,跨多台机器的部分就是分布式计算。它类似多人共同拼装一幅巨型拼图,分工协作能够大幅提升效率,但如果成员之间相互沟通和信息传递耗时太久,或者有人进度滞后,整个团队的节奏也会被拖累。由此可见,算力不能简单等同于“每秒运算多少次”。设备之间能否高效协同、任务如何合理安排、数据存储的位置与访存效率、网络传输是否畅通、配套软件是否适配,都会直接影响实际有效算力。通过算力网络,分布在不同地点的数据中心还可以根据任务需求协同调度,让不同的任务匹配到合适的资源。

四、机器在计算,热量也在产生

服务器运行离不开电能,同时也会产生热量。一旦温度过高,服务器性能会降低,甚至缩短设备寿命。因此,数据中心除了服务器,还要有供电、冷却等系统。机器冷却方式有多种,其中,风冷就像给机房装上空调,液冷则是让冷却液更靠近发热部件带走热量。如何在安全运行的同时减少额外能耗,是算力基础设施建设面临的重要课题。据国际能源署估算,2024年全球数据中心用电约占全球总用电量的1.5%,预计2035年其占比将上升至约4.5%。这提醒我们,发展人工智能,不能只问“算得有多快”,也要问“每完成一次有效任务消耗了多少资源”。提高算法效率、减少重复训练、合理安排任务、提高设备利用率,更多使用低碳能源,都是建设绿色算力的重要举措。

图3 数据中心包括服务器、网络、供电系统与冷却系统,也需跨地域调度与绿色能源协同

五、算力越大,AI就一定越聪明吗?

更多算力能帮助研究者训练更大的模型、尝试更多方案,却不能保证AI给出的答案一定正确。数据质量、算法设计、任务知识和人类的判断同样重要。若问题本身定义不清,或者训练材料存在错误与偏差,再强大的计算能力也可能把错误放大。由此可见,算力更像通往智能世界的道路和电网,它能决定车辆能否通行、机器能否运转,却无法替代人类决定目的地。未来真正值得追求的,不只是更大的计算规模,而是让每一份算力都能创造出更可靠、更普惠的价值。学会提出好问题、核验AI输出的结果,并理解计算背后的资源成本,也是人工智能时代需要具备的科学素养。

作者:栗志扬 (大连海事大学信息科学技术学院 副教授 博士)

审核:齐恒(大连理工大学计算机科学与技术学院 博士生导师 教授)

文章标签算力大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多