一台Mac也能跑Kimi K3!128GB内存硬塞1.6TB权重
Kimi K3 开放完整权重后不少人都跃跃欲试。2.8 万亿参数、官方 MXFP4 权重拥有了这些你就可以自己捣鼓这个规模巨大的模型可以部署到本地。现实情况真有这么简单吗有人总结运行 Kimi K3 其实很容易只需要 1.5TB GPU 内存、大约 8 张 H100以及一座小型变电站。很快有人算了一笔账按照这张粗略的成本表如果将大容量 GPU 服务器和供电设施都算进去整套配置可能触及百万美元。这么一看好像已经和我们这些「个人玩家」没什么关系了。也有人不死心开始认真研究能不能通过量化把这个 2.8 万亿参数模型强行塞进个人设备。只不过评论区对此普遍不太乐观。但没想到还真有人在一台ac 上跑起来了。128GB 的 Mac真把 1.6TB 权重塞下了一名开发者拿出一台 128GB 统一内存的 M5 Max直接加载 Kimi K3 发布在 Hugging Face 上的官方 MXFP4 权重。这套权重足足有 1.56TB体积超过设备内存十倍显然无法一次性完整载入。他的办法是让约 97GiB 的静态权重常驻内存其余部分不一次性加载而是在推理过程中从固态硬盘持续读取。模型运行到哪一层对应的权重才被送入内存参与计算。这样一来128GB 内存不需要同时装下整个模型只需要容纳常驻权重和当前参与计算的部分。最终Kimi K3 真的开口了。开发者先问了一句「How are you」模型正常回答「I am fine, thank you」。随后他又让模型解释 Transformer 中的注意力机制Kimi K3 也开始生成回答。但输出速度相当缓慢。测试中模型处理输入的速度约为 0.98 token/s生成速度只有 0.32 token/s。换算下来每生成一个 token 大约需要三秒。一个正常长度的回答可能要等上几分钟。这至少证明了一件事一台只有 128GB 内存的 Mac确实能够以流式读取的方式运行 1.6TB 的 Kimi K3 官方权重。不过这只解决了容量问题。权重需要不断从硬盘搬进内存模型每生成一个 token都要等待大量数据完成读取和计算推理速度自然很难提高。开发者也表示这套方案目前主要用来调通推理图。下一步他准备把模型进一步压缩到 Q2再使用两台各配备 512GB 统一内存的 Mac Studio尝试把速度提升到可以正常聊天的水平。显然如果不想让 Kimi K3 的语速「快得像闪电」——《疯狂动物城》里的那只树懒只用一台 128GB 的 Mac 是不行的。80 张 5090这是真能用继续压缩是不太行了还有人选择把显卡数量提上去。Ning 团队使用 80 张 RTX 5090完整运行了 2.8 万亿参数的 Kimi K3。整套系统由 10 个节点组成每个节点安装 8 张 RTX 5090总显存达到 2.56TB。团队直接使用 Kimi 官方发布的 MXFP4 权重没有进一步量化。在首日测试中Kimi K3 的单流推理速度达到了 20 token/s。相比 Mac 上的 0.32 token/s输出速度提高了六十多倍基本进入可以正常对话的范围。这套方案使用仍然是消费级显卡。RTX 5090 搭载 GDDR7 显存不具备 HBM 和 NVLink10 个节点之间也只通过 25GbE 以太网连接。80 张 5090 提供了 2.56TB 总显存和约 143TB/s 聚合带宽高于 32 张 H100 方案的 107TB/s 和 16 张 B200 方案的 128TB/s。当然聚合带宽无法直接代表整套系统的推理性能多节点通信、算子效率和调度开销都会影响最终速度。即便如此20 token/s 的实测结果已经证明消费级 GPU 集群也能以可用速度运行完整 Kimi K3。团队表示这还只是首日、未经充分优化的结果。此前他们曾将 4090 集群运行 GLM-5.2 的速度从 30 token/s 提升至 110 token/sKimi K3 仍有继续提速的空间。相比传统的数据中心 GPU 方案这条路线降低了对 HBM 和高速互联设备的依赖但 80 张 5090、10 个节点以及配套的网络、供电和散热设施投入依然相当可观。这么看来一台 ThinkPad 确实不可能80 张游戏显卡倒是可以跑。

相关新闻

GDB高效调试:display、list、watch、x命令实战指南

GDB高效调试:display、list、watch、x命令实战指南

1. 从“手动”到“自动”:为什么我们需要更智能的调试调试,尤其是用 gdb 这种命令行工具,很多时候感觉像是在黑暗的房间里摸索。你设个断点,程序停下来了,然后呢?你得手动敲print命令去看变量a的值&#xf…

2026/8/2 10:25:21 阅读更多
OpenCV模板匹配实战:从原理到多目标检测与性能优化

OpenCV模板匹配实战:从原理到多目标检测与性能优化

1. 项目概述:从“找茬”到工业质检,模板匹配的实战价值如果你玩过“大家来找茬”这类游戏,或者用过手机上的“以图搜图”功能,那你已经对图像匹配有了最直观的感受。在工业自动化、安防监控、甚至我们日常的文档处理中&#xff0c…

2026/8/2 10:25:21 阅读更多
本地部署情感对话AI:从环境搭建到API集成的完整实践指南

本地部署情感对话AI:从环境搭建到API集成的完整实践指南

这次我们来看一个名为“我将亲自安慰你”的项目。这个名字听起来很特别,但它本质上是一个专注于情感陪伴与对话的AI应用。在技术层面,它通常意味着一个本地部署的、能够进行多轮情感化对话的语言模型或智能体。对于开发者、AI爱好者或对个性化聊天机器人…

2026/8/2 11:05:23 阅读更多
速卖通AI图片翻译API集成实战

速卖通AI图片翻译API集成实战

问题引入在速卖通平台上,跨国销售的最大挑战之一就是商品图片的多语言适配。当一位卖家准备将200款冬季外套推向西班牙、法国、德国和日本市场时,他面临的困境非常具体:每款产品需要4-6张主图,总计超过1000张图片需要翻译和调整。…

2026/8/2 11:05:23 阅读更多
图腾柱驱动电路:MOS管与三极管方案对比及设计实战

图腾柱驱动电路:MOS管与三极管方案对比及设计实战

1. 图腾柱驱动电路:从概念到实战 在开关电源、电机驱动或者任何需要快速开关大电流的场合,我们常常会遇到一个经典问题:如何让一个微弱的控制信号(比如来自单片机的3.3V/5V GPIO)去可靠、快速地驱动一个需要较大电流和…

2026/8/2 11:05:23 阅读更多
3分钟搞定!QQ空间历史说说完整备份终极指南

3分钟搞定!QQ空间历史说说完整备份终极指南

3分钟搞定!QQ空间历史说说完整备份终极指南 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory 你是否曾想过,那些年发过的QQ空间说说,那些记录青春的文字…

2026/8/2 0:04:01 阅读更多
3分钟搞定!QQ空间历史说说完整备份终极指南

3分钟搞定!QQ空间历史说说完整备份终极指南

3分钟搞定!QQ空间历史说说完整备份终极指南 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory 你是否曾想过,那些年发过的QQ空间说说,那些记录青春的文字…

2026/8/2 0:04:01 阅读更多
AMAT 0100-02186 I/O 分配 PCB

AMAT 0100-02186 I/O 分配 PCB

AMAT 0100-02186 I/O分配PCB板是应用材料(Applied Materials)公司生产的一款用于半导体设备的I/O信号分配电路板。该型号(0100-02186)的核心特点如下:专用于Endura等半导体工艺腔室。集成信号路由与分配功能。连接控制…

2026/8/2 2:51:21 阅读更多
Nissei Corp FFMN-32L-10-T0 40AX 三相异步电动机

Nissei Corp FFMN-32L-10-T0 40AX 三相异步电动机

Nissei Corp FFMN-32L-10-T0 40AX 三相异步电动机是日本日清(Nissei)品牌的一款工业用三相异步电机,适用于自动化设备及通用机械驱动。该型号(FFMN-32L-10-T0 40AX)的核心特点如下:三相交流异步电动机。额定…

2026/8/2 2:52:49 阅读更多