刚看到这新闻的时候,我其实有点懵。
AMD,那个做显卡的,突然掏出一个大模型?
而且参数才16B,激活的才2.8B。
这数字看着不大啊,隔壁动不动就几百B的。
但仔细一看,不对劲。
这玩意儿叫MoE,混合专家模型。
就是那种,平时只让一小部分“专家”干活,省电又高效。
2.8B激活参数,跑分却比很多4B、7B的模型还猛?
这就有意思了。
说实话,看那张对比图,我第一反应是:AMD你认真的吗?
横轴是活跃参数量,纵轴是跑分。
Qwen3.5-4B-Base像个学霸,稳稳站在上面。
AMD的那个-MoE-16B-A3B-Base情况如何, 其表现相较于Qwen是处于比之低一些的截段状态。
然而, 再去看位于其旁边的别的模型, 诸如Gemma, 还有Llama, 竟然它比它们全部都要高。
一个2.8B激活参数的模型,干翻了一堆4B、7B的?
这性价比,有点离谱。
这里有个坑,很多人不懂。
MoE模型不是所有参数都干活。
16B总参数,但每次推理只激活2.8B。
宛如一间规模庞大的企业, 具备十六个不同的部门, 然而在今日, 仅仅需要二点八个部门去执行任务。
其他部门在休息,不耗电。
所以它跑得快,内存占用小。
但跑分高,说明那2.8个部门,全是精兵强将。
AMD这次一口气发了六个版本。
我数了数,头都大了。
这是基础版,从零开始训练的。
适合那种,想自己从头调教模型的大佬。
在高质量数据上又练了练。
相当于基础版上了个补习班。
这个版本专门练了长上下文。
处理长文章、长对话,它更擅长。
监督微调版。
能听懂人话,能按指令做事了。
这个更高级,用了对比偏好优化。
就是告诉模型:这个回答好,那个回答烂,你学好的。
终极版,强化学习练出来的。
会思考,会推理,回答质量最高。
普通人用,直接选Think版就行。

AMD自己放了个对比图。
MoE - 16B, A3B, Think, 和, Gemma - 4, E4B, it。
Gemma参数更多,但AMD分数更高。
而且AMD激活参数更少。
这意味着什么?
同样的硬件,AMD能跑得更快,或者跑更大的模型。
对于开发者来说,这是真金白银的节省。
你看它用的啥?
AMD Instinct GPU,ROCm软件栈。
从头到尾,没英伟达什么事。
这在以前,想都不敢想。
大模型训练,基本被英伟达CUDA生态垄断。
AMD这次等于说:没有你,我也能行。
而且预训练速度还提升了12.7%。
靠的是专家并行通信重叠。
推理阶段更夸张,首次Token响应时间缩短了39.2%。
就是你说一句话,模型开始回答的速度,快了将近四成。
我觉得有三类人。
第一类,搞AI应用开发的。
想找个开源模型,自己部署,省钱。
第二类,研究MoE架构的。
AMD把训练流程、技术细节都公开了。
第三类,AMD硬件用户。
终于有个为自家硬件优化的顶级模型了。
跑分高,不代表实际体验就好。
就像考试分数高,不一定工作能力强。
而且开源模型,社区支持很重要。
AMD这次能搞出多大的生态,还不好说。
不过,至少是个开始。
一个让英伟达不得不正视的开始。
我其实挺期待AMD能搞出点名堂。
毕竟,垄断对消费者从来不是好事。
有竞争,才有更好的产品,更低的价格。
MoE-16B-A3B,不管最后能不能成。
至少,它让这个市场,多了一个选择。
一个来自AMD的选择。
相关标签: # AI # 开源模型 # 混合专家模型 # AMD # Instella-MoE