首页 AI实时资讯内容详情

AMD 最强开源混合专家模型:Instella-MoE 系列 AI 登场,16B 参数、自有 GPU 训练

2026-08-03 2 暗号导航联盟

刚看到这新闻的时候,我其实有点懵。

AMD,那个做显卡的,突然掏出一个大模型?

而且参数才16B,激活的才2.8B。

这数字看着不大啊,隔壁动不动就几百B的。

但仔细一看,不对劲。

这玩意儿叫MoE,混合专家模型。

就是那种,平时只让一小部分“专家”干活,省电又高效。

2.8B激活参数,跑分却比很多4B、7B的模型还猛?

这就有意思了。

AMD这模型到底什么水平?

说实话,看那张对比图,我第一反应是:AMD你认真的吗?

横轴是活跃参数量,纵轴是跑分。

Qwen3.5-4B-Base像个学霸,稳稳站在上面。

AMD的那个-MoE-16B-A3B-Base情况如何, 其表现相较于Qwen是处于比之低一些的截段状态。

然而, 再去看位于其旁边的别的模型, 诸如Gemma, 还有Llama, 竟然它比它们全部都要高。

一个2.8B激活参数的模型,干翻了一堆4B、7B的?

这性价比,有点离谱。

为什么激活参数少反而更强?

这里有个坑,很多人不懂。

MoE模型不是所有参数都干活。

16B总参数,但每次推理只激活2.8B。

宛如一间规模庞大的企业, 具备十六个不同的部门, 然而在今日, 仅仅需要二点八个部门去执行任务。

其他部门在休息,不耗电。

所以它跑得快,内存占用小。

但跑分高,说明那2.8个部门,全是精兵强将。

六个版本,到底选哪个?

AMD这次一口气发了六个版本。

我数了数,头都大了。

-MoE-16B-A3B-

这是基础版,从零开始训练的。

适合那种,想自己从头调教模型的大佬。

-MoE-16B-A3B-Mid-

在高质量数据上又练了练。

相当于基础版上了个补习班。

-MoE-16B-A3B-Base-Long-

这个版本专门练了长上下文。

处理长文章、长对话,它更擅长。

-MoE-16B-A3B-SFT

监督微调版。

能听懂人话,能按指令做事了。

-MoE-16B-A3B-DPO

这个更高级,用了对比偏好优化。

就是告诉模型:这个回答好,那个回答烂,你学好的。

-MoE-16B-A3B-Think

终极版,强化学习练出来的。

会思考,会推理,回答质量最高。

普通人用,直接选Think版就行。

AMD 最强开源混合专家模型:Instella-MoE 系列 AI 登场,16B 参数、自有 GPU 训练_AMD 最强开源混合专家模型:Instella-MoE 系列 AI 登场,16B 参数、自有 GPU 训练_

和Gemma-4-E4B-it比,谁赢了?

AMD自己放了个对比图。

MoE - 16B, A3B, Think, 和, Gemma - 4, E4B, it。

Gemma参数更多,但AMD分数更高。

而且AMD激活参数更少。

这意味着什么?

同样的硬件,AMD能跑得更快,或者跑更大的模型。

对于开发者来说,这是真金白银的节省。

训练全靠AMD自家硬件,这事有多牛?

你看它用的啥?

AMD Instinct GPU,ROCm软件栈。

从头到尾,没英伟达什么事。

这在以前,想都不敢想。

大模型训练,基本被英伟达CUDA生态垄断。

AMD这次等于说:没有你,我也能行。

而且预训练速度还提升了12.7%。

靠的是专家并行通信重叠。

推理阶段更夸张,首次Token响应时间缩短了39.2%。

就是你说一句话,模型开始回答的速度,快了将近四成。

这模型适合谁用?

我觉得有三类人。

第一类,搞AI应用开发的。

想找个开源模型,自己部署,省钱。

第二类,研究MoE架构的。

AMD把训练流程、技术细节都公开了。

第三类,AMD硬件用户。

终于有个为自家硬件优化的顶级模型了。

但别高兴太早。

跑分高,不代表实际体验就好。

就像考试分数高,不一定工作能力强。

而且开源模型,社区支持很重要。

AMD这次能搞出多大的生态,还不好说。

不过,至少是个开始。

一个让英伟达不得不正视的开始。

最后说句实话。

我其实挺期待AMD能搞出点名堂。

毕竟,垄断对消费者从来不是好事。

有竞争,才有更好的产品,更低的价格。

MoE-16B-A3B,不管最后能不能成。

至少,它让这个市场,多了一个选择。

一个来自AMD的选择。

相关标签: # AI # 开源模型 # 混合专家模型 # AMD # Instella-MoE