首页 AI实时资讯内容详情

英伟达 CUDA 的 20 年护城河一个周末崩了,Claude 独自跑通 AMD 新 GPU

2026-08-01 2 暗号导航联盟

那是一个周末时分, 径直将自家处于最前沿的模型, 运行在了一台全新的AMD机架之上。在此过程中, 人类工程师自始至终都未曾手动去修改过哪怕一行代码。然而, 谁又能够想象得到, 英伟达耗费20年时间堆砌起来的CUDA护城河, 就这样被跨越过去了。

为什么这个周末实验能引爆全场?

前段时间, 发生之事是这样的, AMD给团队送去了一台搭载新GPU的机架, 团队看过之后, 内心已然做好了打硬仗的准备, 原因在于新平台搭配新软件栈, 必定需要进行新一轮适配, 然而, 团队手中恰好有Agent, 于是团队干脆先让一名工程师去尝试, 具体做法是把Agent连接到机器上, 然后丢给它一句话, 那句话便是: “去, 把这台机器运行起来。”。

等周末过完回到工位那儿, 屏幕之上已然多了一条持续往上升的性能曲线, 其结果是不但跑起来了, 而且性能还在一轮又一轮不间断地提升。联合创始人兼首席计算官Tom Brown讲完之后, 苏姿丰立刻接过话头, 听闻Agent只有一名工程师在处理的时候, 她的第一反应是让AMD团队赶快去给予帮助。结果团队回来告知她, 对方表示不需要, 已经全都处理好了。

这场周末实验迅速地衔接上了实际性去开展的部署规划, 在最近的时候确定了要于AMD CUDA系统内去布置最高可达2GW的GPU, 其中首批1GW的计划安排在2027年上半年启动。与此同时, 双方会径直运用Agent来对AMD工作负载予以优化, 从而加快ROCm软件开发的进程。

_英伟达 CUDA 的 20 年护城河一个周末崩了,Claude 独自跑通 AMD 新 GPU_英伟达 CUDA 的 20 年护城河一个周末崩了,Claude 独自跑通 AMD 新 GPU

芯片说明书迎来一位非人类读者

能够达成对 CUDA 生态的「降维打击」, 其缘由在于 AMD 径直为 AI 研发了一套可供上手调试 GPU 的工具。于 AMD AI 2026 大会上所发布的 ROCm.AI, 乃是为 、Codex 和 筹备的一整套 GPU 工具箱。其入口称作 AMD , 其中所装载的全部是经过验证的 ROCm 知识。Agent 获取到这些知识后, 能够自行安装环境、部署模型、读取日志、排查故障, 进而借助 ROCm CLI 调用真实机器。开发者说出目标,剩下的路让 Agent 自己找。

重视要点, AMD 就连芯片说明书的撰写方式都进行了更改。公司 AI 软件与解决方案副总裁 Anush 在现场予以透露, 每一代 AMD GPU 都会将指令集公开, 并且会提供 AI 能够读懂的 ISA。Agent 在读懂手册以后, 就能够直接着手去调试性能。AMD 把这部分工作交付给它就会开启推理服务, 先运行出基线, 接着去寻找 CPU 和 GPU 的瓶颈之处, 测试不同的配置, 生成定制内核, 最后再重新运行一遍新方案。在现场演示这个环节当中, M3 的输出速度被提升了 38%。紧接着的情况时, AMD 又使得它一次性运行超过 1.4 万个模型, 并且将此次测试得到的结果转化为下一次能够直接再度使用的经验。与此同时, AMD 也正与前沿模型公司共同对此种能力展开训练。原话具备独特特点, 即让前沿模型自身具备能够直接说出「AMD 编程」这样的特质。往后再去审视查看一块芯片时, 峰值算力以及显存带宽的确是相当值得重视的, 然而, AI 能否理解认知它、调用启用它以及全面发挥出其性能表现, 届时也都会被列入并体现在同一张参数表格之中。芯片公司需要着力争取的开发者群体, 如今又额外增添了一类, 那便是 Agent。

来自 ASI 的降维打击

CUDA 自 2006 年起一路走来直至如今 , 依赖的是众多工程师逐行码出的生态。编译器 , 数学库 , 调试器 , 性能分析工具 , 开发文档 , 该具备的全都具备。更难以复制的 , 是一代代工程师积攒而成的手感。算子如何进行调整 , 通信怎样提升速度 , 显存怎样进行分配 , 分布式部署何处最容易出现问题 , 这些经验皆存储在少数专家的脑海之中。后来者即便制造出性能相近的芯片 , 也得将这条软件之路从头再走一遍。芯片流片能够按季度推进 , 生态积累却只能按年去苦苦熬制。且 Agent 所补的正是这一段内容, 它会去阅读平台文档, 会调用性能分析工具, 会找寻速度卡顿的所在之处, 然后修改代码, 而后进行编译, 接着开展测试。倘若一个方案没有成效便更换下一个。要是跑分有所改善就顺着这个方向持续优化。人类培养一名顶级 GPU 工程师是以年计数的, 而多启动一个 Agent 仅仅只需再开启一个任务即可。一名工程师放出一群 Agent 便能够并行排查报错情况, 定位性能瓶颈。一次跑通的配置, 写好的内核以及踩过的坑, 同样能够立刻成为下一批 Agent 的起始点。将以年为单位进行计算的那种追赶予以压缩, 使其转变为按任务来计算, 人工智能最具价值之处便存在于此。这同样是具备ASI样式能力针对CUDA生态所形成的降维打击, 这是毋庸置疑的。

现今, 中国的工程师已然处于这场AI对GPU软件栈进行改造的最前沿位置, 他们所积累沉淀下来的底层相关经验, 正被整理变成更多Agent能够加以调用的能力。追赶CUDA的全新起点已然出现, 即把硬件接口以及软件工具交付给AI, 让Agent直接展开工作。二十年的生态方面差距, 首次能够交由一群Agent夜以继日不间断地去 backward 追赶。

相关标签: # AI # CUDA # AMD # Anthropic # Agent