Mac Studio跑Qwen3.6-35B:26万上下文+91%缓存效率,性能实测

最近大模型本地部署热度持续攀升,尤其是苹果M系列芯片凭借统一内存架构和MLX框架的优化,成为许多开发者关注的“平民算力”方案。今天,我们基于真实测试数据,对Qwen3.6-35B在搭载M3 Ultra芯片的Mac Studio上的部署表现进行深度拆解,看看它在长上下文、高吞吐和缓存效率等核心指标上,能否满足实际生产需求。
一、硬件与模型配置

设备:Mac Studio(Apple M3 Ultra丐版)

模型:Qwen3.6-35B-A3B-8bit

测试工具:oMLX v0.5.4(性能基准测试模块)

二、核心性能指标解读

1. 单请求性能:首字延迟与生成速度

TTFT(首字延迟):在pp1024/tg128配置下,TTFT仅为484.8ms;即使将prompt长度提升至4096,TTFT也控制在1753.5ms以内。这意味着用户输入后,模型响应几乎“秒级”启动,体验流畅。

TPOT(每Token生成时间):稳定在12ms/tok左右,对应生成速度约83 tok/s。对于35B参数量的模型而言,这一速度已接近部分云端API的水平,足以支撑日常对话、代码补全等场景。

2. 连续批处理:多并发下的吞吐能力

2x batch:吞吐量提升至151.5 tok/s,加速比达1.81x;

4x batch:吞吐量进一步跃升至379.6 tok/s,加速比高达4.54x。

这表明MLX框架在批量推理时能高效利用芯片并行计算单元,适合需要同时处理多个请求的场景(如客服机器人、批量文档摘要)。

3. 上下文窗口:突破26万Token的极限

这是本次测试最惊艳的部分:

64k上下文:预填充速度1,264.5 tok/s,耗时63.2s;

128k上下文:预填充速度838.7 tok/s,耗时168s;

256k上下文:成功跑通!测得实际上限为262,144 Token,预填充速度501.8 tok/s,耗时535.9s。

这一成绩意味着你可以在本地轻松处理整本长篇小说、海量代码库或超长会议记录,彻底告别“上下文溢出”的焦虑。

性能基准测试

128K上下文速度测试

64K上下文速度测试

64K最大上下文测试

128K最大上下文测试

256K最大上下文测试

三、缓存效率:SSD读写与内存管理

服务统计数据显示,累计预填充Token总数达4.4B,其中缓存Token数高达4.0B,缓存效率达到惊人的91.9%。这意味着绝大多数重复或相似的请求都能直接从缓存中命中,大幅减少了重复计算。

内存占用:活跃模型占用约35.2GB,说明8bit量化非常成功,完美适配Mac Studio的内存规格。

SSD缓存:SSD缓存大小已达1809.4 GB,包含18,270个文件。这得益于MLX框架对SSD的高效利用,使得超大上下文加载不再单纯依赖内存,而是通过高速SSD交换实现。

openclaw日常使用数据

四、总结与建议

M3 Ultra + MLX + Qwen3.6-35B的组合,在本地部署场景中展现出极强的竞争力:

性能强劲:单请求响应快,批量处理效率高;

上下文超长:支持26万Token,胜任复杂任务;

缓存智能:91.9%命中率,节省资源提升体验。

如果你正在考虑搭建本地大模型服务,或希望在不依赖云端的情况下获得高性能AI推理能力,这套方案值得重点关注。当然,实际部署时还需根据具体业务负载调整batch大小和上下文长度,以达到最佳性价比。

展开阅读全文

更新时间:2026-08-06

标签:数码   上下文   缓存   效率   性能   速度   测试   模型   内存   速比   首字   批量

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034903号

Top