为什么AI都跑在GPU上?别扯算力了,真相是它“笨”得刚刚好
2026-10-03 · AI · 阅读 5 · 访客 5
每次看到有人科普“GPU跑AI是因为它算得快”,我都想拦一下。
这话对了一半,但完全没说到点子上。如果单论“算得快”,顶级的CPU(比如苹果M3 Max或者AMD线程撕裂者)主频拉满,处理复杂逻辑的速度能把GPU按在地上摩擦。
那为什么AI训练和推理,还是清一色地死磕GPU?真正的答案,藏在两者截然不同的“脑回路”里。
01. 老教授 vs 流水线厂弟
打个不太严谨的比方。 CPU是个“万能老教授”。他会解微积分,会统筹全局,能处理复杂的逻辑判断和系统调度。但你让他去搬砖,他一次只能搬两三块,还得搬一块思考一下人生(频繁的指令调度和分支预测)。
GPU则是“流水线工厂”。里面塞了几万个“厂弟”(CUDA核心)。这哥几个什么都不会,连个简单的if-else逻辑都整不明白,每个人只会做一个动作:A * B + C。
但一声哨响,几万人同时弯腰,同时放下,这就是GPU的“单指令多线程(SIMT)”。
02. AI的底色,就是一场降维打击
我们天天吹的深度学习、大模型、Transformer,剥开那些华丽的壳子,底下全是矩阵乘法。
神经网络的传播,说到底就是几万个“乘加运算”在同时进行。没有复杂的逻辑分支,没有精妙的循环嵌套,只有最朴素、最暴力的数字膨胀。
而这,恰好是GPU的出厂设置。
让CPU做矩阵乘法,就像让老教授去排队搬砖,他大部分时间都在“判断怎么搬”、“调度谁去搬”,算力全浪费在了管理上。 让GPU来做,就是几万厂弟排成方阵,不需要思考,纯粹的力量碾压。
03. 反直觉:GPU其实是个“笨蛋”
这里有个极度反直觉的真相:GPU的胜利,恰恰是因为它“不聪明”。
遇到大量复杂的 if-else 语句(比如游戏AI或者复杂的图计算),GPU的线程会瞬间崩溃,这叫“线程发散”(Thread Divergence)。一部分线程在跑 if,一部分在等 else,流水线直接瘫痪。
但正因为“笨”,NVIDIA才能把几千个核心硬生生塞进一块芯片里。 如果GPU试图去学CPU搞复杂的控制流,它的面积和功耗会瞬间爆炸。GPU赢在脑容量极小,但手极多。
04. 我的判断:时势造英雄
说“GPU适合AI”,不如说:AI的计算模式,刚好长在GPU的舒适区里。
过去十年,大模型爆发,底层数学工具高度收敛——全都是密集的、静态的矩阵乘法。算法研究员用矩阵乘法搭积木,硬件工程师为矩阵乘法堆核心。这是一个历史性的巧合,GPU恰好在这个时代,接住了AI落下的这滴雨。
05. 升维:未来,GPU会被淘汰吗?
别急着喊“英伟达万岁”。GPU的统治地位,绝非坚不可摧。
现在它赢,只是因为AI还没进化到嫌它笨。
未来的AI计算正在剧变:
- 稀疏化与MoE(混合专家模型):如果计算是90%的零,用100%的算力去跑就是极大的浪费。
- 动态分支与神经符号AI:下一代AI一旦引入复杂的逻辑推理和动态图计算,GPU的流水线就会卡壳。
- 专用芯片的绞杀:别以为只有未来能打败GPU。现在,Google的TPU、各类NPU、甚至专门针对大模型推理的LPU,已经在疯狂蚕食GPU的领地。
一旦AI的底层算法从“密集静态矩阵”转向“稀疏动态图”,GPU的流水线工厂就会显得臃肿而低效。
最后,说点实在的。
下次当你看着飙升的显卡价格叹气时,不妨想一想:我们买的究竟是算力,还是这个算法尚未完全进化时,不得不向硬件妥协的过路费?
时代造就了GPU,但时代,也随时准备抛弃它。