很多人都想在自己的电脑上跑免费的开源AI 模型,只不过现在最大的门槛是:记忆体不够,尤其是数百亿参数的大模型,即使经过量化缩小,对只有8GB、12GB RAM 或VRAM 的一般电脑来说依旧相当吃力,只能改用更小的模型,或升级记忆体与显示卡。
而最近开始有一些新玩法了。网络上出现一款RAMDeck 的工具,可以做到让多台装置共同分摊所需的记忆体容量,就有一名网友分享实测结果,成功在只有12GB 的旧笔记本运行Qwen3.8-27B 模型。当然,速度部分还是很惨,每秒只有1.92 Token,因此目前比较像技术展示。

网友Medicine_Blogscanner 近日在LocalLLM 社群分享,他表示,这已经是这个系列的第三支视频,前面曾用相同概念挑战7B 和13B 模型,这次把目标提高到约27B 参数的Qwen3.8-27B,手上的旧Windows 笔记本只有12GB 记忆体,很明显单靠这台电脑根本无法完整载入。
他藉由RAMDeck 工具,把模型拆开分配到四台装置。 Windows 旧笔记本担任主要节点,另外还有RTX 3060 迷你电脑、Mac mini 和Android 手机,下方是各装置分配的记忆体:
- Windows 旧笔记本分配到3.4GB
- 迷你电脑提供约20GB 的显示记忆体与系统记忆体
- Mac mini 负责3.7GB
- Android 手机贡献1GB
将上述数字相加,四台装置列出的分配容量合计约28.1GB,其中提供最多资源的是搭载RTX 3060 的迷你电脑。
RAMDeck 公开的Core Engine 使用llama.cpp 的RPC 协定,能在不同装置之间卸载模型张量。每一台参与的装置会启动节点程式,提供GPU 或CPU 资源,再由相容的协调端分派工作。
有一点要先知道的是,这名网友这次执行的Qwen3.8-27B,不是完全未压缩的原始模型,使用的是4-bit 量化版本,所需记忆体约为15GB 至17GB。如果使用未量化版本,模型权重本身就可能需要约55GB 至60GB。量化可以用较少的位元保存模型权重,大幅降低容量需求,但压缩得越激进,也越可能影响输出品质。
虽然能成功运行,但随后测试文字的生成速度相当惨,每秒只有1.92 Token,latency 约25ms:

会慢成这样,其实也不难理解。如果是通过单一显示卡,资料会直接通过高频宽汇流排快速存取,而RAMDeck 把模型分散到不同装置后,节点之间还需要通过区域网络交换资料,同时也会增加RPC 通讯、同步以及不同CPU、GPU 架构之间的额外开销,因此效能一定更差。
RAMDeck看起来蛮不错的,但目前也是有许多问题在,GitHub 提到「可运作但不完美」,而且这份程式库没有内置图形介面或完整仪表板,安装过程也需要建立Python 环境、启动节点代理程式,并使用相容的llama.cpp 工具或自行准备协调端,对一般用户来说门槛很高。