
开篇寄语
事情是这样的。那天我正在愉快地摸鱼,突然收到了一条提示:API 余额不足。就像是正看得起劲的电视剧突然断电——那个难过啊。作为一个有追求的程序员,岂能被这几块钱的 API 费用难倒?于是乎,我研究了一下怎么用 Ollama 本地部署模型,让 OpenClaw 实现 Token 自由。你们猜怎么着?成功了!而且过程比想象中简单得多。今天,伯衡君就把这个"白嫖"攻略分享出来,让大家一起快乐摸鱼。
官方地址
- Ollama 官网:https://ollama.com
- OpenClaw 官网:https://openclaw.ai
内容详情
第一步:安装 Ollama
首先,你需要一个能跑得动大模型的机器。
显卡方面,NVIDIA 是首选,AMD 也能用但支持有限。显存越大越好——16GB 可以跑 7B 左右的模型,24GB 能跑 14B,32GB 及以上就比较舒服了。
安装过程?那叫一个简单。
# macOS
brew install ollama
# Linux
curl -fsSL https://ollama.com/install.sh | sh
# Windows
# 直接去官网下载安装包
就一行命令的事儿,简单到不行。
安装完成后,Ollama 自动启动,默认监听 http://localhost:11434。
第二步:选择你的模型
本地跑模型,讲究的是一个"适合"。
太大了显卡扛不住,太小了效果又不行。
伯衡君推荐几个性价比高的选择:
| 模型 | 参数量 | 最低显存 | 适用场景 |
|---|---|---|---|
| llama3.3 | 70B | 32GB+ | 性能党首选,效果接近 GPT-4 |
| qwen2.5-coder | 32B | 16GB | 写代码杠杠的 |
| glm-4.7-flash | - | 16GB | 中文能力不错 |
| mistral | 7B | 8GB | 入门级,也足够用了 |
选哪个?看你的显卡和需求。
反正我是用的 glm-4.7-flash,毕竟中文理解能力强,性价比高。
# 拉取模型
ollama pull glm-4.7-flash
# 查看已安装的模型
ollama list
第三步:配置 OpenClaw
重头戏来了!
有三种方式可以搞定配置,难度从易到难,任你选择。
方式一:向导模式(推荐新手)
openclaw onboard
然后跟着提示走:
- 选择 Ollama 作为 provider
- 选择 Local(纯本地)或 Cloud + Local(本地 + 云端)
- 等待自动发现模型
- 选一个你喜欢的模型
全程无脑操作,幼儿园小朋友都能学会。
(不是夸张,是真的简单)
方式二:环境变量(适合懒人)
一行代码搞定:
export OLLAMA_API_KEY="ollama-local"
然后 OpenClaw 会自动发现本地模型,是不是很香?
方式三:手动配置(适合老手)
如果你 Ollama 不在本地,或者想手动指定模型参数,可以这样:
{
models: {
providers: {
ollama: {
baseUrl: "http://localhost:11434",
apiKey: "ollama-local",
api: "ollama",
models: [
{
id: "glm-4.7-flash",
name: "GLM-4.7 Flash",
reasoning: false,
input: ["text"],
cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 },
contextWindow: 8192,
maxTokens: 8192
}
]
}
}
},
agents: {
defaults: {
model: { primary: "ollama/glm-4.7-flash" }
}
}
}
第四步:验证配置
配置完了一定要验证!
# 查看模型列表
openclaw models list
# 测试一下
openclaw models set ollama/glm-4.7-flash
如果能看到模型列表,说明配置成功。
如果看不到…那可能是 Ollama 没启动,或者端口不对。
检查一下:
# 检查 Ollama 是否在运行
curl http://localhost:11434/api/tags
# 如果返回了模型列表,说明 Ollama 正常
第五步:开始白嫖!
配置好之后就可以愉快地使用了。
所有通过 Ollama 调用的模型,费用都是 $0!
是的,你没看错,免费的!
这就是本地部署的快乐——显卡是自己的,电费是自己的,但是 tokens 是无限的!
进阶玩法:混合模式
如果你既想白嫖,又想在关键时刻用更强的模型,可以配置混合模式:
{
agents: {
defaults: {
model: {
primary: "ollama/glm-4.7-flash",
fallbacks: ["anthropic/claude-sonnet-4-5"]
}
}
}
}
这样日常对话用本地免费模型,遇到复杂任务自动切换到云端付费模型。
鱼与熊掌兼得,美滋滋。
结尾引导
好了,今天的分享就到这里。
Ollama + OpenClaw 这个组合,简直就是程序员的"白嫖圣经"。
不需要 API Key,不需要付费订阅,只要有显卡,就能实现 Token 自由。
当然,本地部署也是有代价的——你需要一台带显卡的机器,而且模型响应速度取决于显卡性能。
但是!
这年头,谁还没有一张显卡呢?
(没有的话,当我没说)
去试试吧,反正又不花钱。
万一打开了新世界的大门呢?
- 我的微信
- 微信扫一扫加好友
-
- 我的微信公众号
- 扫描关注公众号
-





