AMD 为Qwen3.8 提供Day 0 全线支援:Ryzen AI Max、Radeon 与Instinct 同步就绪

前几日阿里巴巴最新开源模型Qwen3.8 家族正式登场,AMD 也同步宣布提供Day 0 全线支援,涵盖消费端与资料中心两大产品线。开发者可在搭载Ryzen AI Max 处理器的系统与Radeon AI PRO R9700 显示卡上本地执行27B 密集版本,也能在Instinct MI300X、MI325X 与MI355X GPU 上通过ROCm 平台立即部署与评测完整MoE 版本。

Qwen3.8 系列是通义千问团队首次将Qwen-Max 等级能力带入开源发布的世代,在程式编写、专业工作、研究与长程代理任务上均有强化,官方也提供可调节的思考控制能力,让模型能在复杂多步骤任务中保持较高完成度。 Hugging Face 上已同步上架Qwen3.8-27B 密集模型与Qwen3.8-2.4T-A95B 大型MoE 模型,供开发者直接下载与整合。

本地端即时可用:Ryzen AI Max 与Radeon AI PRO R9700 支援Qwen3.8 27B

针对个人电脑与工作站情境,AMD 在8 月14 日发布的部落格文章中说明,已为Qwen3.8 27B 提供Day 0 支援。这个27B 版本属于密集架构,模型体积与记忆体需求落在适合本地开发的范围,开发者可直接在搭载Ryzen AI Max+ 处理器的系统或单张Radeon AI PRO R9700 32GB 显示卡上执行,无需依赖云端资源。

官方指出,Qwen3.8 27B 同样可在具备超过24GB 可变显示记忆体或VRAM 的支援硬体上执行,涵盖部分较早世代但记忆体容量足够的AMD 平台。相关支援在模型发布时即已上线,并相容于广泛使用的开源工具组合。

  • Ryzen AI Max+ 395:早期测试在Windows 环境下,通过llama.cpp 搭配Vulkan 后端、MTP=4 设置,平均生成吞吐最高可达每秒24.5 个token
  • 单张Radeon AI PRO R9700:相同测试条件下采MTP=2,最高可达每秒51.8 个token
  • 测试条件:数据为llama.cpp 在Windows 上的平均token 生成吞吐,取三次以上执行的平均值,AMD 表示随着软体与模型持续最佳化,效能仍有提升空间

作为密集模型,Qwen3.8 27B 对记忆体容量与运算能力的要求较高,也因此凸显本地硬体能力的重要性。 AMD 在文章中强调,愈来愈强大的AI 模型正在加速普及到本地PC 与工作站,能在开发者日常使用的同一台机器上完成建构、测试与实际应用,有助于缩短从模型发布到实际导入的准备时间。

一键启用的本地体验:llama.cpp、LM Studio 与Lemonade

在工具链方面,AMD 为Qwen3.8 27B 准备了多层次的本地执行路径。对于熟悉开源推理框架的开发者,可直接通过llama.cpp 在Ryzen AI Max 与Radeon 硬体上载入模型;对于希望快速体验的进阶使用者,LM Studio 提供图形化介面,可在支援的AMD 系统上完成模型探索、下载与对话测试,无需撰写程式码。

官方说明,LM Studio 已支援在Ryzen AI Max+ 系统与Radeon AI PRO R9700 32GB 上使用Qwen3.8 27B,模型约需24GB 的可变显示记忆体或VRAM 才能顺畅执行,也可在其他受支援的AMD 平台上运作。这个路径被定位为从下载到推理的最短路径,适合用于提示词与工作流程的初步验证。

对于要将本地AI 整合进应用程式的开发者,AMD 提供的Lemonade 则扮演轻量本地推理层的角色。 Lemonade 可与应用程式一同封装,让应用程式通过熟悉的API 形式与Qwen3.8 27B 沟通,由Lemonade 处理底层的AMD 平台整合,开发者无需自行维护硬体相关的推理堆叠。官方将三者的分工描述为:Ryzen AI Max 与Radeon 提供本地算力基础,LM Studio 提供快速体验入口,Lemonade 则提供通往应用程式化的整合路径。

资料中心即时部署:Instinct MI300X、MI325X、MI355X 支援完整Qwen 3.8 家族

在资料中心端,AMD 于8 月12 日发布的技术文章宣布,Instinct MI300X、MI325X 与MI355X GPU 已提供对Qwen 3.8 模型家族的Day-0 支援,开发者可通过AMD ROCm 开放软体平台,结合SGLang 与vLLM 立即部署与评测。文章列出的核心特色包含跨Instinct GPU 的Day-0 支援、经最佳化的ROCm 启用,以及对SGLang、vLLM 与ATOM 的就绪状态,并提供效能参考与快速启动指引。

在部署方式上,官方提供多种精度与框架组合。 vLLM 路径提供FP8 与MXFP4 两种检查点的部署范例,包含对应的Docker 映像档与启动参数;在SGLang 路径则区分MI355X 与MI300X 的建议配置,例如在MI355X 上使用AITER 注意力后端并启用统一注意力与FlyDSL,以发挥新硬体的推理能力。 ATOM 路径亦提供MXFP4 的部署流程。

  • FP8 检查点:Qwen/Qwen3.8-2.4T-A95B-FP8,适用于vLLM 与SGLang 的多节点部署范例
  • MXFP4 检查点:Qwen3.8-2.4T-A95B-Quark-MXFP4,由AMD Quark 量化工具链自FP8 转换而来,选择性将MoE 路由专家量化至MXFP4,其余层保持BF16,采逐分片处理流程以避免一次载入完整模型
  • 平行化配置:官方范例包含单节点TP8 与双节点TP8、PP2 等组合,并提供对应的serve 指令、主机与连接埠设置

Qwen 3.8 架构更新:512 个专家、92 层与混合注意力设计

根据AMD 技术文章对Qwen 3.8 的整理,这一代在Qwen 3.6 与Qwen 3.5 的架构基础上,引进规模明显扩大的稀疏混合专家架构,包含512 个专家模型、92 层的深层网络,以及针对长文本工作负载最佳化的混合线性注意力与全注意力设计。

功能面向的更新包含四个重点:程式编写、专业工作、研究与长程代理任务的整体能力提升;代理执行能力强化,包含更强的自主规划与对环境回馈的处理;对主流开发工具与测试框架的下游相容性扩大;以及弹性的思考控制,开发者可通过reasoning_effort 调节推理深度,并通过preserve_thinking 保留历史消息中的思考脉络。 AMD 指出,Qwen 3.8 在设计上更着重于将复杂多步骤任务完整执行到结束,而非仅回答单一难题。

总结

从本次Day 0 支援的布局来看,AMD 将Qwen 3.8 的支援明确区分为两个层次:以Ryzen AI Max 与Radeon AI PRO R9700 为核心的本地PC 与工作站,锁定27B 密集模型,搭配llama.cpp、LM Studio 与Lemonade 提供从体验到应用整合的路径;以Instinct MI300X、MI325X、MI355X 为核心的资料中心,锁定包含2.4T-A95B 在内的完整MoE 家族,通过ROCm 结合SGLang、vLLM、ATOM 与Quark 量化流程提供可直接部署的指引。

官方提供的两篇部落格文章分别涵盖效能参考数据、工具相容性与逐步部署指令,让不同规模的开发者都能在模型公开当下选择适合的硬体与框架开始评测。对于希望在本地系统上直接使用新模型的团队而言,24.5 tok/s 与51.8 tok/s 的参考数据、24GB 记忆体需求的明确说明,以及开箱可用的LM Studio 体验,已构成一套可立即验证的起点;而对于需要在生产环境中处理长文本与代理工作负载的团队,Instinct 平台上的多精度与多框架支援则提供后续扩展的基础,对于想使用AMD 平台研究或架设模型的个人与团队来说相当有用,不再只限定于比较贵的NVIDIA 平台。

(0)
麦克哥麦克哥

相关推荐

发表回复

您的电子邮箱地址不会被公开。 必填项已用 * 标注