0%

蚂蚁开源了个 7.9B 小模型,我折腾一整天把它跑起来了

蚂蚁百灵前几天开源了个小模型,叫 Ling-3.0-tiny,网上说得很玄乎:总参数 7.9B,但每次处理只激活 1.3B,小内存机器也能跑得飞快。我手头正好有台 16G 内存的 Mac mini,手痒,就折腾了一整天。

先说结论:这模型真能跑,速度是同类里我见过最快的(短输出实测 90 token/秒),但弯路不少,走错方向能花一上午。

如果不想看过程,直接翻到最后的”给想动手的人”,照着做就行。

这模型什么来头

一句话:蚂蚁的 MoE 混合专家小模型,MIT 协议,8 月 11 日开源,随便商用。

项目 内容
总参数 7.9B,每 token 只激活 1.3B(128 专家取 8)
架构 KDA + MLA 混合注意力,bailingmoe3
上下文 131K
开源协议 MIT
本机版 MLX 4bit 量化,约 4.2GB

1.3B 激活是什么意思?打个比方:一个公司名义上 7.9 个员工,但每次干活只派 1.3 个上场,剩下的在休息。派的人少,跑起来自然快,代价是”干活的人”脑容量有限。

第一回合:三条常规路都走不通

按老习惯,先试 ollama,结果直接报错:不认这个架构。

行,升级 llama.cpp 再试。能加载了,但一生成就卡住,光标闪半天一个字都不出。换 LM Studio,情况一样。

当时我以为模型有问题,查了一圈才明白:这个模型用的 bailingmoe3 架构太新,llama.cpp 8 月中旬才刚合入支持,Metal 上的实现还有待完善,KDA 注意力一跑就停住,上游都还有没关的问题单。

三个常规引擎都用不了,小半天就这么没了。

第二回合:MLX 才是正路

最后是条冷门路线跑通的:MLX 原生实现。mlx-lm 里早就内置了百灵 MoE 的支持,一个叫 rapid-mlx 的第三方项目把它验证过(跟官方代码逐位对比,最大偏差 1.5e-6),一条命令就把服务拉起来了。

这条路绕开了 llama.cpp 全家,用的是 Apple 自家的机器学习框架,专为 Apple 芯片优化。

实测:速度惊人,但要看场景

同一台机器、同一道题(评价袁世凯,先总体判断再分三个角度),三个模型跑出来:

模型 大小 短输出速度 长文速度 中文质量
Ling-3.0-tiny 4.2GB 90 tok/s 12 tok/s 结构清晰,推理在线
qwen3.5:9b 6.6GB 12.7 tok/s ~7 tok/s 规范,略保守
gemma4:e2b 5.1GB 21 tok/s ~14 tok/s 中规中矩

短输出 90 tok/s 是个什么概念?每秒蹦九十来个 token,跟本地大模型聊天基本感觉不到延迟。qwen3.5:9b 是它 7 倍慢。1.3B 激活的优势,在这一项上体现得淋漓尽致。

但注意:这是短输出的爆发速度。让它写长文,回落到 12 tok/s 左右,优势缩水到两倍上下。所以别拿它当长文生成器,那是大模型的活。

长上下文我也测了:塞了 1.4 万 token 的中文材料让它干活,处理时间线性增长,没有退化。日常用完全够。

让写代码:短板就出来了

速度测试过了,让写点真东西。经典试金石:贪吃蛇,要求单文件 HTML,能直接在浏览器打开玩。

结果:674 token、7 秒、95 tok/s 一次写完,标签闭合,方向键、撞墙检测、重新开始按钮都在。看着像模像样。

但静态体检发现两个致命伤:没有食物随机生成(Math.random 一次都没出现),也没有吃食物检测。也就是说,你打开能看到界面、蛇能动,但它永远吃不到东西,分数永远是 0。

这是个”形似神不似”的贪吃蛇。

更麻烦的是长上下文续写:让它接着写,它会丢掉上文,从头开始重画蛇的眼睛。这跟我手机上测到的”重复输出同一段代码”是同一个病根:上下文一长,小模型注意力就飘,开始重复或重写。

踩坑清单

  1. ollama 不认 bailingmoe3 架构,直接报错,别浪费时间。
  2. 新版 llama.cpp 能加载但生成卡住,KDA 注意力在 Metal 上 prefill 阶段就停住。
  3. LM Studio 一样卡,它内置引擎和 llama.cpp 同源,换壳不换芯。
  4. MLX 才是 Apple 芯片的正解,rapid-mlx 一条命令起服务,绕开整个 llama.cpp 的坑。
  5. 写代码只能写形,写不灵逻辑,贪吃蛇缺食物生成就是证据。
  6. 长上下文续写会失忆,上下文一长开始重写已有内容,遇到就开新对话。
  7. 测试前先看系统负载:我一开始测出 5 tok/s,还以为这模型速度不行,后来发现是 Obsidian Helper 占了 670% CPU。负载清掉后同一台机器跑到 90。

结论

Ling-3.0-tiny 是台”中文对话/写作向”的小跑车:快、省内存、中文推理在同尺寸里能打,适合 16G 内存的 Mac 当本地聊天和问答小助手。但它不是全能选手,写代码会出问题,长文续写会失忆。

值不值得装?16G 内存的机器,值得。4.2GB 不占地方,一条命令起服务,体验一下”小模型跑出大模型味”不亏。指望它替你把活全干了,那还是老实上云端。

给想动手的人(看不懂命令也没关系,这活基本可以交给 AI 干):

1
2
3
4
5
6
7
8
# 装运行时(装进 mlx 环境)
~/.local/pipx/venvs/mlx-lm/bin/python -m pip install -U rapid-mlx

# 一条命令起服务,自动下载模型,局域网可访问
~/.local/pipx/venvs/mlx-lm/bin/rapid-mlx serve ling-3.0-tiny-4bit --host 0.0.0.0 --port 8010

# 起好后,任何 OpenAI 兼容客户端都能连
# 地址 http://你的IP:8010/v1,模型名 ling-3.0-tiny-4bit

我手上还有一份修好的贪吃蛇(补上了食物生成和吃食逻辑),想要的话后台说一声。