
蚂蚁百灵前几天开源了个小模型,叫 Ling-3.0-tiny,网上说得很玄乎:总参数 7.9B,但每次处理只激活 1.3B,小内存机器也能跑得飞快。我手头正好有台 16G 内存的 Mac mini,手痒,就折腾了一整天。
先说结论:这模型真能跑,速度是同类里我见过最快的(短输出实测 90 token/秒),但弯路不少,走错方向能花一上午。
如果不想看过程,直接翻到最后的”给想动手的人”,照着做就行。
这模型什么来头
一句话:蚂蚁的 MoE 混合专家小模型,MIT 协议,8 月 11 日开源,随便商用。
| 项目 | 内容 |
|---|---|
| 总参数 | 7.9B,每 token 只激活 1.3B(128 专家取 8) |
| 架构 | KDA + MLA 混合注意力,bailingmoe3 |
| 上下文 | 131K |
| 开源协议 | MIT |
| 本机版 | MLX 4bit 量化,约 4.2GB |
1.3B 激活是什么意思?打个比方:一个公司名义上 7.9 个员工,但每次干活只派 1.3 个上场,剩下的在休息。派的人少,跑起来自然快,代价是”干活的人”脑容量有限。
第一回合:三条常规路都走不通
按老习惯,先试 ollama,结果直接报错:不认这个架构。
行,升级 llama.cpp 再试。能加载了,但一生成就卡住,光标闪半天一个字都不出。换 LM Studio,情况一样。
当时我以为模型有问题,查了一圈才明白:这个模型用的 bailingmoe3 架构太新,llama.cpp 8 月中旬才刚合入支持,Metal 上的实现还有待完善,KDA 注意力一跑就停住,上游都还有没关的问题单。
三个常规引擎都用不了,小半天就这么没了。
第二回合:MLX 才是正路
最后是条冷门路线跑通的:MLX 原生实现。mlx-lm 里早就内置了百灵 MoE 的支持,一个叫 rapid-mlx 的第三方项目把它验证过(跟官方代码逐位对比,最大偏差 1.5e-6),一条命令就把服务拉起来了。
这条路绕开了 llama.cpp 全家,用的是 Apple 自家的机器学习框架,专为 Apple 芯片优化。
实测:速度惊人,但要看场景
同一台机器、同一道题(评价袁世凯,先总体判断再分三个角度),三个模型跑出来:
| 模型 | 大小 | 短输出速度 | 长文速度 | 中文质量 |
|---|---|---|---|---|
| Ling-3.0-tiny | 4.2GB | 90 tok/s | 12 tok/s | 结构清晰,推理在线 |
| qwen3.5:9b | 6.6GB | 12.7 tok/s | ~7 tok/s | 规范,略保守 |
| gemma4:e2b | 5.1GB | 21 tok/s | ~14 tok/s | 中规中矩 |
短输出 90 tok/s 是个什么概念?每秒蹦九十来个 token,跟本地大模型聊天基本感觉不到延迟。qwen3.5:9b 是它 7 倍慢。1.3B 激活的优势,在这一项上体现得淋漓尽致。
但注意:这是短输出的爆发速度。让它写长文,回落到 12 tok/s 左右,优势缩水到两倍上下。所以别拿它当长文生成器,那是大模型的活。
长上下文我也测了:塞了 1.4 万 token 的中文材料让它干活,处理时间线性增长,没有退化。日常用完全够。
让写代码:短板就出来了
速度测试过了,让写点真东西。经典试金石:贪吃蛇,要求单文件 HTML,能直接在浏览器打开玩。
结果:674 token、7 秒、95 tok/s 一次写完,标签闭合,方向键、撞墙检测、重新开始按钮都在。看着像模像样。
但静态体检发现两个致命伤:没有食物随机生成(Math.random 一次都没出现),也没有吃食物检测。也就是说,你打开能看到界面、蛇能动,但它永远吃不到东西,分数永远是 0。
这是个”形似神不似”的贪吃蛇。
更麻烦的是长上下文续写:让它接着写,它会丢掉上文,从头开始重画蛇的眼睛。这跟我手机上测到的”重复输出同一段代码”是同一个病根:上下文一长,小模型注意力就飘,开始重复或重写。
踩坑清单
- ollama 不认 bailingmoe3 架构,直接报错,别浪费时间。
- 新版 llama.cpp 能加载但生成卡住,KDA 注意力在 Metal 上 prefill 阶段就停住。
- LM Studio 一样卡,它内置引擎和 llama.cpp 同源,换壳不换芯。
- MLX 才是 Apple 芯片的正解,rapid-mlx 一条命令起服务,绕开整个 llama.cpp 的坑。
- 写代码只能写形,写不灵逻辑,贪吃蛇缺食物生成就是证据。
- 长上下文续写会失忆,上下文一长开始重写已有内容,遇到就开新对话。
- 测试前先看系统负载:我一开始测出 5 tok/s,还以为这模型速度不行,后来发现是 Obsidian Helper 占了 670% CPU。负载清掉后同一台机器跑到 90。
结论
Ling-3.0-tiny 是台”中文对话/写作向”的小跑车:快、省内存、中文推理在同尺寸里能打,适合 16G 内存的 Mac 当本地聊天和问答小助手。但它不是全能选手,写代码会出问题,长文续写会失忆。
值不值得装?16G 内存的机器,值得。4.2GB 不占地方,一条命令起服务,体验一下”小模型跑出大模型味”不亏。指望它替你把活全干了,那还是老实上云端。
给想动手的人(看不懂命令也没关系,这活基本可以交给 AI 干):
1 | # 装运行时(装进 mlx 环境) |
我手上还有一份修好的贪吃蛇(补上了食物生成和吃食逻辑),想要的话后台说一声。