
很多朋友看到这张对比图会很疑惑:RTX 5090、4090 不是公认的顶级游戏 AI 显卡吗?怎么一张 APU 的宣传图,看起来比旗舰 N 卡还厉害?
这篇文章用大白话拆解这张图,看懂它吹的是什么优势,同时也看清它的局限,避免被宣传误导。

我们可以把跑 AI 大模型想象成在桌子上摊开一整套厚厚的工具书。
● 显存 = 桌子的桌面面积。桌面越大,你可以一次性摊开的书本、草稿纸就越多。
● 算力 = 你看书抄写的速度,决定处理任务快慢。
跑大模型训练、微调的时候,不光要放下模型本身,还要放下中间计算产生的大量临时数据。桌子太小,东西放不下,直接就干不了活,也就是业内常说的 OOM 显存溢出。

NVIDIA 的 RTX4090、RTX5090,是独立显卡,桌子大小出厂就焊死在显卡上:RTX4090 桌子 24GB,RTX5090 桌子 32GB。
而 AMD AI Max+395(代号 Strix Halo),它是高性能 APU,采用统一内存架构。没有独立的显存,CPU、显卡、AI NPU 共用一套主机内存,顶配版本给到 128GB。相当于它的桌面最大可以做到 128GB。
划重点:这张图比拼的,首先是「桌面大小」,不是抄写速度。

图表上方长长的条形图,就是三张硬件的 “桌子大小”。
1. AI Max+395:最大 128GB 统一内存
2. RTX5090:32GB 独立显存
3. RTX4090:24GB 独立显存
图中有两条虚线,代表两个 AI 任务所需要的最小桌面空间。
1. 第一条虚线67GB:12B 大模型做 BF16 精度 LoRA 微调,需要至少 67GB 的工作台。 RTX5090 只有 32GB,RTX4090 只有 24GB,两张卡的桌面都小于 67GB。
2. 第二条虚线115GB:12B 大模型做完整全参数微调,需要 115GB 工作台。 32GB 的 RTX5090 和 24GB 的 4090 和这个需求差距巨大。
AMD 的 128GB 内存,两张任务都能完整装下。

LoRA 是普通人本地最常用的大模型微调方式,简单说:给大模型做定制化小改造,让模型学会你的专属知识、风格。 BF16 代表原始高精度,不压缩,微调出来的效果最好。✅ AI Max+395:直接完整运行,零精度损失 128GB 的大桌子,完整放下 67GB 全部数据,不用删减内容,微调出来模型原汁原味。❌ RTX4090 / RTX5090:直接放不下,必须做 “缩水” 显卡本身只有 24/32GB 显存,桌面不够大,直接报错内存溢出。想要跑,只能把模型压缩到 4‑bit。通俗讲:把书本的字迹涂黑、删减一部分内容,硬塞到小桌子上。能跑,但是微调之后的模型效果会打折扣。


120B 属于百亿级别超大模型,模型能力更强,对内存要求很高。这里使用 MXFP4 量化压缩之后,依然需要 63GB 内存空间。

很多人看完会产生错觉:395 比 4090、5090 更强。这个理解是片面的。我们回到最开始的比喻:AI Max+395 赢在桌子(内存)足够大,但是 “抄写速度(GPU 算力)” 不如 RTX4090/5090。

1. 内存带宽差距 虽然它有 128GB 大内存,但这是系统内存,带宽远低于 RTX5090 的 GDDR7 高速显存。同样的 AI 任务,它能跑起来,但是部分场景运行速度不如高端 N 卡。
2. CUDA 生态的鸿沟 几乎绝大多数 AI 工具、绘图软件、AI 插件,都是优先为 NVIDIA CUDA 显卡开发。AMD 需要使用 ROCm,部分软件会出现兼容问题,很多好玩的 AI 工具直接用不了。
3. 哪些活它不占优势 AI 绘图 Stable Diffusion、游戏渲染、大规模并行计算,这些吃原始 GPU 算力的场景,RTX4090、5090 依旧更强。

这张图表,不是全盘对比显卡综合性能,而是瞄准一个细分赛道:个人单机本地大模型训练、微调、超大模型推理。
对于普通的游戏玩家、AI 绘图爱好者,RTX4090/5090 依旧是更好的选择。
但如果你是玩家、开发者,想要在家一台电脑,不搭建服务器,完成高精度 LoRA 微调、12B 模型全参数训练、本地跑百亿级大模型。 受限于显存,RTX4090、5090 单卡硬件先天就做不到,要么压缩模型牺牲效果,要么必须多卡。 这个时候,拥有 128GB 统一大内存的 AI Max+395,就体现出无可替代的独特价值。一句话概括:比算力,它不如旗舰 N 卡;比单机内存上限做本地大模型训练,它有自己的杀手锏。
两款均为极摩客旗舰桌面 AI 超算迷你主机,核心 CPU 完全一致:AMD Ryzen AI Max+ 395(Zen5,16 核 32 线程,最高 5.1GHz),集成 Radeon 8060S 核显,XDNA2 NPU,整机综合 AI 算力126TOPS,可本地跑大参数 AI 模型;内存为板载不可升级 LPDDR5X(64/128GB),双 M.2‑PCIe4.0 硬盘位,Win11 Pro,TDP 最高 140WGMK极摩...。
全球该 APU 的机型,体积约 2.76L,银黑拼接机身,带 RGB 灯效,卧式摆放。
● 网络:WiFi 6E、蓝牙 5.4、2.5G 网口 ×1
● 接口:双 USB4、HDMI2.1、DP,四屏输出最高 8K,带 SD 读卡器,USB 接口数量多;无 OCuLink,外接显卡只能走 USB4/eGPU,损耗偏大
● 散热:双风扇散热
● 定位:AI 本地推理、4K 剪辑、3D 创作,适合不打算外接独立显卡的专业用户、AI 爱好者
同 2.7L 容积,立式全金属 CNC 刀锋薄机身(厚度 41mm),更省桌面空间。
● 网络升级:WiFi7 + 蓝牙 5.4
● 最大亮点:新增原生 OCuLink(PCIe4.0×4),直连外接显卡坞,显卡性能损耗仅 5‑8%,扩展性大幅提升
● 散热升级:三风扇系统,三档功耗模式(静音 / 平衡 / 性能),高负载温控更好
● 软件:预装 GMKtec Claw 龙虾 AI 助手,开箱部署本地大模型;深度优化 ROCm 生态手机新浪网
● 接口:单 USB4、HDMI2.1,取消读卡器,支持多屏输出GMKtec
● 定位:AI 开发者、工作室,有外接独显升级需求,追求更强拓展能力的专业用户中关村在线...
1. X2:卧式、RGB、读卡器、双 USB4、WiFi6E、无 OCuLink,性价比更高
2. X3:立式全金属、WiFi7、OCuLink 外接显卡、三风扇散热、自带 AI 助手,拓展上限更高
更新时间:2026-08-19
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034903号