Skip to content

4张MI50就能跑到119tok/s,3090也是望尘莫及

原文链接: 智选DIY装机

版权声明: 本文为"智选DIY装机"公众号原创,转载请联系原作者授权。


海外本地AI社区r/LocalLLaMA发起了一个挑战:一台8块AMD Instinct MI50 32GB组成的服务器,跑Qwen3.6 35B-A3B MoE模型(FP16全精度),当前记录是4张MI50做TP4跑出的119.52 tok/s。发起者申请了15000美元(约合10.8万元人民币)Reddit社区基金来搭建这台服务器,规则很简单:谁能在同一台机器上打破记录并保持30天,整台8卡服务器就归谁。

这台服务器长什么样

挑战用的硬件配置已经锁定:

组件型号
机箱GIGABYTE G292-Z20 八卡服务器
CPUAMD EPYC 7F32
内存128 GB(8根DDR4 ECC RDIMM)
GPU8 × AMD Instinct MI50 32GB
系统盘Crucial BX500 480GB SATA
模型盘KIOXIA KCD6XLUL 1.92TB NVMe

MI50是AMD Instinct系列的老型号——Vega架构(GFX906),2018年发布。单张32GB HBM2显存,8张就是256GB,装得下大模型的FP16全精度。

这台服务器不是拿来炫配置的,它是社区验证"老GPU能不能跑本地AI"这个命题的测试平台。

119.52 tok/s是什么水平

当前记录的测试条件很严格:

  • 模型:Qwen3.6 35B-A3B MoE(FP16全精度GGUF)
  • 不许量化——Q4/Q8/INT8/FP8/AWQ/GPTQ全不行
  • 不许用投机解码、MTP、EAGLE等多token预测加速
  • 单请求推理,并发数1,不允许批量拼凑速度
  • 8轮预热后跑3轮取中位数
  • 最大上下文131072 token

在这些严格条件下,4张MI50做TP4跑到了119.52 tok/s。服务器装了8张卡,挑战者可以自由决定用几张、怎么分配。

作为参考:消费级方案里,单张3090跑27B Q5量化约30 tok/s(社区实测),再加一张3060Ti做层并行能到60 tok/s。MI50用FP16全精度跑35B模型到119 tok/s,靠的是多卡合力加HBM2的带宽优势。

挑战规则怎么玩

核心规则很清晰:

  1. 硬件固定——就在这台服务器上跑,不能加卡、换卡、远程借算力
  2. 软件优化自由——运行时、内核、调度、驱动、系统调优、安全范围内的频率和功耗调整全部允许
  3. 打破记录要超过当前成绩3%以上
  4. 保持30天没人超过
  5. 赢了就拿走整台服务器

换句话说:硬件不变,纯拼软件优化能力。谁能在同样的8张MI50上通过调运行时、写更好的内核、优化调度策略跑出更高的tok/s,谁就是赢家。

发起者在帖子里特别强调:这还在申请阶段,"This is not yet a live prize offer"——尚未正式生效,需要Reddit审批通过才算数。

MI50为什么值得关注

MI50不是新卡。Vega架构在AI推理领域早就不是主力了。但它有几个有意思的特点:

32GB HBM2显存。 消费级卡到30系才有24GB GDDR6X,MI50在2018年就给了32GB HBM2。大模型推理里显存容量决定能装多大的模型,HBM带宽决定推理速度的下限。

据发起者的GitHub仓库,这套方案基于ROCm 7.2。GFX906架构属于较早期的AMD计算卡,社区已有人在上面跑通vLLM和llama.cpp,但不像新架构那样有官方长期支持承诺。MI50这类退役数据中心GPU在海外二手市场有一定供应,但国内渠道稀少、价格难判,别当捡漏首选。

更关键的是,MI50有几个劝退门槛:被动散热设计,必须装在有强制风道的服务器机箱里——塞进普通ATX机箱会过热降频;没有视频输出接口,不能当主显卡用,必须另配一张亮机卡;ROCm驱动生态远不如CUDA成熟,配环境的折腾成本不低。适合的是有服务器机箱、愿意折腾驱动、纯跑推理不需要显示输出的玩家。

这次挑战的意义不在于MI50本身有多强——而是验证"退役数据中心GPU通过软件优化能走多远"这个命题。如果社区能在MI50上把推理速度推到更高,说明软件栈还有很大的优化空间,同样的思路可以用在更新的GPU上。

固定硬件的benchmark为什么有意义

目前AI推理的性能对比有个问题:不同人用不同硬件、不同量化、不同框架跑出来的数字很难直接比较。

这次挑战的做法是把硬件变量完全锁死——同一台物理机器,同一个模型文件(锁定hash),同一套测试流程。唯一变的是软件。

3%超越门槛+30天保持期,比大多数厂商benchmark都严格。不是跑一次好数字就算赢,要可复现、可验证、持续占优。

这种思路对本地AI推理社区的发展是正向的。如果这个挑战跑起来,积累的优化经验(内核改进、调度策略、驱动调优)会变成社区的公共知识——不只是MI50受益,所有用AMD GPU跑推理的人都能参考。


参考资料