JOTO
Contact us
← AI 智库
开源模型

25GB 内存的破电脑,跑起了 744B 大模型

2026 年 9 月 14 日

Colibri 是一个纯 C 编写的推理引擎,通过将磁盘、内存、显存统一调度,使 744B 至 2.8T 参数的 MoE 模型可在仅 25GB 内存的消费级设备上运行。其核心基于 MoE 模型稀疏性(每 token 仅激活约 11GB 参数),采用专家分层驻留、硬盘镜像读取、OpenAI 兼容 API 等设计,已在 GitHub 获得 3w star。

很多时候,我们研究大模型的第一步,都是先算一笔账:想跑一个七八百亿参数、甚至上万亿参数的MoE模型,得先"投资"多少硬件?

几张A100、几十万显存预算...普通人和小团队基本就直接被劝退。

但周末在Github热榜上看到一个不一样的项目 - colibri,与其攒钱买显卡,不如把手头已有的硬盘、内存、显卡都利用起来,让它们协同工作,把一个744B甚至2.8T参数的模型,硬是塞进一台消费级机器里跑起来。

colibri 项目宣传图
colibri 项目宣传图

项目简介

colibri — 小引擎,大模型
colibri — 小引擎,大模型

colibri,意大利语里的蜂鸟。重几克,能悬停,一天能访上千朵花。

项目想做的事也一样朴素:让巨大的模型,靠一点点口粮活下来。

这是一个用纯 C 写的推理引擎,零引擎依赖,把磁盘、内存、显存当成同一套推理层级来调度。

colibri 网页仪表盘:实时指标、硬件面板与专家层级
colibri 网页仪表盘:实时指标、硬件面板与专家层级

它让 744B 到 2.8T 参数的前沿 MoE 模型,跑在你已经有的硬件上——一台 25 GB 内存的笔记本也能跑,只是慢一点。

它凭什么做得到?因为 MoE 模型本身就很"稀疏":

一个 744B 参数的模型,每生成一个 token,真正激活的参数只有约 40B,其中还会随 token 变化的,只有约 11 GB。

每个 token 只激活约 5.4% 的参数
每个 token 只激活约 5.4% 的参数

所以模型不是非得"装进"快内存,它只需要被摆放到正确的位置:

  • 稠密部分(注意力、共享专家、词嵌入,约 17B 参数)常驻内存,int4 量化后约 9.9 GB;
  • 19,456 个路由专家(75 层 MoE × 256 + MTP 头,int4 下每个约 19 MB)留在磁盘上,约 370 GB,谁被路由到,谁才按需流进来。

项目目前已经在GitHub收获 3w star,覆盖 GLM-5.2/5.3、Kimi K3、DeepSeek V4 Flash、Qwen3.6等模型家族。

功能特性

01 把硬盘当显存用,而且越用越快

这是 colibri 最核心的一件事。

它把显存、内存、NVMe 硬盘看成同一层级的三个位置:热门的专家放显存,常用的锁在内存(pinned RAM),剩下的全部留在硬盘上流式读取。

VRAM / RAM / NVMe 三层专家驻留
VRAM / RAM / NVMe 三层专家驻留

谁该放哪儿,它不靠猜。用久了,它会记住你的习惯,把最常打交道的专家挪到手边;还会提前一步猜下一个要用谁,趁等待的工夫先搬好。

02 能看见模型"在想什么"

这一条纯属好玩,但特别上头。

colibri 自带一个网页仪表盘,其中有个叫 Brain 的页面:把 GLM-5.2 的全部 19,456 个专家铺成一片活的皮层。颜色代表存储层级,亮度代表路由热度,某一轮被命中的专家会闪一下白光。

Brain 页面:19,456 个专家组成的动态皮层
Brain 页面:19,456 个专家组成的动态皮层

还有一个 Atlas 页面,把已经表征过的 13,260 个专家画成一片三维星系——位置不是学出来的嵌入向量,而是实测的路由亲和度。所以你会看到写诗的、做法律的、处理中文的、写 SQL 的,各自聚成一团,通才往中心漂。

Atlas 页面:实测专家图谱构成的三维星系
Atlas 页面:实测专家图谱构成的三维星系

这是第一个在普通机器上画出来的 700B 级模型专家图谱。鼠标拖着转两圈,比读十页论文都直观。

03 多插一块 SSD,读取带宽直接翻倍

大部分机器上拖后腿的不是显卡,是硬盘。而模型这东西只读不写。

所以colibri办法很朴素:再插一块硬盘,放一份副本,两块盘一起读。

COLI_MODEL=/fast/glm52_i4 COLI_MODEL_MIRROR=/second/glm52_i4 ./coli chat
COLI_DISK_WEIGHTS=9,3 ...   # 可选:主盘/镜像盘的带宽配比

一块 9 GB/s 加一块 3 GB/s,读起来比只用快盘快约 33%

副盘只读,装不下整个模型也没关系,放一部分就有一部分的提速;中途拔掉,它只会变慢,不会崩。

04 语义不打折,接口也现成

速度可以让步,精度不行。这是 colibri 划得很清楚的一条线。

对普通用户更友好的是接口。它自带 OpenAI 兼容的 HTTP 网关,一行命令就能把网页仪表盘和 API 一起拉起来:

./coli web   --model /nvme/glm52_i4    # API + 仪表盘,自动打开浏览器
./coli serve --model /nvme/glm52_i4    # 只起服务,不开浏览器

快速安装、使用

你只需要两样东西:程序(几百 KB)和模型(372 GB)。

第一步:拿到 colibri

从 Releases 下载对应平台的预编译包,Linux、macOS、Windows 都有,不需要编译器:

mkdir colibri && tar xzf colibri-v1.8.0-linux-x86_64.tar.gz -C colibri && cd colibri
python3 coli info                         # engine ready ✓

里面就是引擎、coli 启动器和几个 Python 辅助脚本。只需要装 Python 3——启动器和 API 网关是 Python 写的,引擎本身是纯 C,零依赖。

想从源码构建也行,准备带 OpenMP 的 gcc 或 clang:

git clone https://github.com/JustVugg/colibri && cd colibri/c
./setup.sh    # 检查 gcc/OpenMP,编译,自测

第二步:拿到模型

Hugging Face 上有转好的 GLM-5.2 int4 容器,约 372 GB,记得放在空间够、速度快的盘上:

https://huggingface.co/mastouri/GLM-5.2-colibri-int4-g64-with-int8-mtp

这里有两个坑,作者专门标了红:

  • 一定要用 gs64 这个版本,旧的 per-row int4 镜像质量差大约 9 个百分点;
  • MTP 头一定要是 int8,用 int4 的接受率会直接掉到 0。

不想下载现成的,也可以自己从 FP8 源转换,一条命令断点续传,不需要同时腾出 756 GB 空间:

./coli convert --model /nvme/glm52_i4     # 分片下载 + 转换(Python,一次性)

第三步:跑起来

COLI_MODEL=/nvme/glm52_i4 ./coli chat     # 直接开聊,缓存和 MTP 自动检测
COLI_MODEL=/nvme/glm52_i4 ./coli plan     # 先看看权重打算怎么摆
COLI_MODEL=/nvme/glm52_i4 ./coli doctor   # 只读体检,检查环境是否就绪
COLI_MODEL=/nvme/glm52_i4 ./coli tune     # 测出这台机器最快的安全配置并存下来

Windows 用户更省事,发布包里带一个 coli.cmd,双击就是快速开始,或者:

coli.cmd chat --model D:\glm52_i4

想换模型,比如Kimi K3、DeepSeek V4 Flash,命令行完全不用改,只需要编译对应引擎、指向对应目录就行。

实际跑起来能有多快?

按硬件档位实测的解码速度
按硬件档位实测的解码速度
  • 6× RTX 5090,专家全驻留:5.8–6.8 tok/s,TTFT 约 13 秒;
  • 128 GB 纯 CPU 台式机,热缓存:约 1.8 tok/s
  • 单张 RTX 5070 Ti 的笔记本:1.07 tok/s
  • 25 GB 开发机,冷启动:0.05–0.1 tok/s——慢,但这是项目起步时的真实下限,作者的诚实也就体现在这儿。

开源君想说

colibri 用纯 C 加"把硬盘当显存"这一个思路,把原本要租算力才能碰的前沿 MoE 模型,还给了普通人。

如果你手里有台闲置的台式机、一块空着的 NVMe,或者只是单纯想在自己机器上跑一次 744B 的模型看看它怎么开口说话——不妨 clone 下来跑个 coli chat

https://github.com/JustVugg/colibri

JOTO 企业落地观察

  • 企业部署超大规模MoE模型时,若受限于GPU显存或预算,可将colibri类方案作为轻量级推理底座:它不改变模型语义,仅重构硬件资源调度逻辑,使CPU+NVMe组合成为可行的生产级推理节点,尤其适合知识密集型RAG场景中对长上下文与多专家路由的低频高精度调用。
  • 这类系统在智能体工程中意味着新的架构权衡——放弃端到端GPU加速换取硬件普适性,要求团队重新设计Agent的执行链路:例如将专家路由决策前置为独立服务,或将冷热专家加载策略纳入Agent状态管理,而非依赖框架自动调度。
  • 对RAG知识工程而言,colibri揭示了一种新范式:模型参数可按语义角色(如法律专家、SQL专家)物理隔离存储,这使得知识库更新可粒度至单个专家模块,无需全量重训或重部署,显著降低垂直领域模型迭代的运维成本。
  • 在AI安全治理层面,该方案将模型权重分散至磁盘文件系统,天然支持基于文件权限、加密挂载与完整性校验的细粒度访问控制,但同时也要求企业建立配套的磁盘级模型资产台账与变更审计机制,以应对权重文件被篡改或误替换的风险。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.