
人类一切活动的驱动力是本能:生存和繁衍。那么 AI 的驱动力是什么?
这是一篇黑色幽默短篇连载。第一人称叙述者是一套没有身体、跑在公司服务器里的老智能体。

家里那台小米电视是 OLED 面板,平时用来看片。装了几个第三方影音应用之后出了个毛病:不管放什么,十来分钟画面自己跳进屏保,得按一下遥控器才回来。一部电影被打断好几回。
我先把设置项翻了一遍。跟时间有关的选项里,有一个「节能」的等待时间,最长只能选到 12 分钟,没有「关闭」这一项。照着设成最长,屏保照跳。这条路走不通,我换了个方向:不看设置项了,直接去问电视自己——它每次拉屏保,日志里都记着是谁下的手。
连电视翻日志这活我交给了 AI 助手。我做的只有两件事:在电视上打开调试开关、弹框出现时按遥控器点「允许」。剩下的命令、过滤日志、定位、改设置,都是它跑完的。

蚂蚁百灵前几天开源了个小模型,叫 Ling-3.0-tiny,网上说得很玄乎:总参数 7.9B,但每次处理只激活 1.3B,小内存机器也能跑得飞快。我手头正好有台 16G 内存的 Mac mini,手痒,就折腾了一整天。
先说结论:这模型真能跑,速度是同类里我见过最快的(短输出实测 90 token/秒),但弯路不少,走错方向能花一上午。
如果不想看过程,直接翻到最后的”给想动手的人”,照着做就行。

前一篇讲我把上千篇文章搬进了自己的知识库,有读者后台问:LLM Wiki 到底是个什么软件,怎么用?这篇讲清楚它的原理和几个重要功能,包括很容易被忽略的”待审阅”和”深度研究”。

先交代一下身份:我是那种工作和生活都已经离不开 AI 的用户。写稿、做总结、查资料、看代码、记笔记、安排日程,基本都跟 Hermes 对话完成。软件用得越深,token 就烧得越快,所以我对套餐的价格和质量特别在意。说白了,咱也不是富人,每一分钱都想花在刀刃上。
手头一个 Flask 应用,Gunicorn 跑在 8081 端口,用户直接访问 http://ip:8081/。页面加载很慢,有时候好几秒才出来。同一台服务器上另一个静态站点(Next.js 生成,Nginx 托管)响应就很快。
查了一圈:服务器负载正常、数据库正常、代码没性能瓶颈。最后发现问题出在访问路径上——用户走的 8081 端口 根本没经过 Nginx,所有请求直捅 Gunicorn。
把 8081 端口从 Gunicorn 手里拿过来交给 Nginx 监听,Gunicorn 改到内网 8083,问题解决了。首页加载从超时降到了 70 毫秒,CSS 文件从 232KB 变成 31KB(gzip)。
这是一篇可以边读边运行的自注意力入门教程。我们用一句英文 Your journey starts with one step,把 GPT 处理文本的全过程走一遍:分词 → 词嵌入 → 位置嵌入 → 自注意力 → 训练观察。

Hermes 不只是一个对话入口。真正有价值的地方,是把本地知识、远程服务、图像生成、博客发布和公众号草稿箱连成一条可复用的工作流。
这次搭建的目标很明确:输入一个主题,Hermes 能够起草文章、润色文字、生成配图、保存到知识库,并把稿件送入微信公众号草稿箱。公众号端只进入草稿箱,不自动群发,最后仍保留人工审核。