Ollama 本地部署模型,让 OpenClaw 实现 Token 自由

已收录   阅读次数: 322
2026-04-1714:00:26 发表评论
摘要

事情是这样的。那天我正在愉快地摸鱼,突然收到了一条提示:API 余额不足。就像是正看得起劲的电视剧突然断电——那个难过啊。作为一个有追求的程序员,岂能被这几块钱的 API 费用难倒?于是乎,我研究了一下怎么用 Ollama 本地部署模型,让 OpenClaw 实现 Token 自由。你们猜怎么着?成功了!而且过程比想象中简单得多。今天,伯衡君就把这个"白嫖"攻略分享出来,让大家一起快乐摸鱼……

分享至:
Ollama 本地部署模型,让 OpenClaw 实现 Token 自由

开篇寄语

事情是这样的。那天我正在愉快地摸鱼,突然收到了一条提示:API 余额不足。就像是正看得起劲的电视剧突然断电——那个难过啊。作为一个有追求的程序员,岂能被这几块钱的 API 费用难倒?于是乎,我研究了一下怎么用 Ollama 本地部署模型,让 OpenClaw 实现 Token 自由。你们猜怎么着?成功了!而且过程比想象中简单得多。今天,伯衡君就把这个"白嫖"攻略分享出来,让大家一起快乐摸鱼。

官方地址

  • Ollama 官网:https://ollama.com
  • OpenClaw 官网:https://openclaw.ai

内容详情

第一步:安装 Ollama

首先,你需要一个能跑得动大模型的机器。

显卡方面,NVIDIA 是首选,AMD 也能用但支持有限。显存越大越好——16GB 可以跑 7B 左右的模型,24GB 能跑 14B,32GB 及以上就比较舒服了。

安装过程?那叫一个简单。

# macOS
brew install ollama

# Linux
curl -fsSL https://ollama.com/install.sh | sh

# Windows
# 直接去官网下载安装包

就一行命令的事儿,简单到不行。

安装完成后,Ollama 自动启动,默认监听 http://localhost:11434

第二步:选择你的模型

本地跑模型,讲究的是一个"适合"。

太大了显卡扛不住,太小了效果又不行。

伯衡君推荐几个性价比高的选择:

模型 参数量 最低显存 适用场景
llama3.3 70B 32GB+ 性能党首选,效果接近 GPT-4
qwen2.5-coder 32B 16GB 写代码杠杠的
glm-4.7-flash - 16GB 中文能力不错
mistral 7B 8GB 入门级,也足够用了

选哪个?看你的显卡和需求。

反正我是用的 glm-4.7-flash,毕竟中文理解能力强,性价比高。

# 拉取模型
ollama pull glm-4.7-flash

# 查看已安装的模型
ollama list

第三步:配置 OpenClaw

重头戏来了!

有三种方式可以搞定配置,难度从易到难,任你选择。

方式一:向导模式(推荐新手)

openclaw onboard

然后跟着提示走:

  1. 选择 Ollama 作为 provider
  2. 选择 Local(纯本地)或 Cloud + Local(本地 + 云端)
  3. 等待自动发现模型
  4. 选一个你喜欢的模型

全程无脑操作,幼儿园小朋友都能学会。

(不是夸张,是真的简单)

方式二:环境变量(适合懒人)

一行代码搞定:

export OLLAMA_API_KEY="ollama-local"

然后 OpenClaw 会自动发现本地模型,是不是很香?

方式三:手动配置(适合老手)

如果你 Ollama 不在本地,或者想手动指定模型参数,可以这样:

{
  models: {
    providers: {
      ollama: {
        baseUrl: "http://localhost:11434",
        apiKey: "ollama-local",
        api: "ollama",
        models: [
          {
            id: "glm-4.7-flash",
            name: "GLM-4.7 Flash",
            reasoning: false,
            input: ["text"],
            cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 },
            contextWindow: 8192,
            maxTokens: 8192
          }
        ]
      }
    }
  },
  agents: {
    defaults: {
      model: { primary: "ollama/glm-4.7-flash" }
    }
  }
}

第四步:验证配置

配置完了一定要验证!

# 查看模型列表
openclaw models list

# 测试一下
openclaw models set ollama/glm-4.7-flash

如果能看到模型列表,说明配置成功。

如果看不到…那可能是 Ollama 没启动,或者端口不对。

检查一下:

# 检查 Ollama 是否在运行
curl http://localhost:11434/api/tags

# 如果返回了模型列表,说明 Ollama 正常

第五步:开始白嫖!

配置好之后就可以愉快地使用了。

所有通过 Ollama 调用的模型,费用都是 $0

是的,你没看错,免费的!

这就是本地部署的快乐——显卡是自己的,电费是自己的,但是 tokens 是无限的!

进阶玩法:混合模式

如果你既想白嫖,又想在关键时刻用更强的模型,可以配置混合模式:

{
  agents: {
    defaults: {
      model: {
        primary: "ollama/glm-4.7-flash",
        fallbacks: ["anthropic/claude-sonnet-4-5"]
      }
    }
  }
}

这样日常对话用本地免费模型,遇到复杂任务自动切换到云端付费模型。

鱼与熊掌兼得,美滋滋。


结尾引导

好了,今天的分享就到这里。

Ollama + OpenClaw 这个组合,简直就是程序员的"白嫖圣经"。

不需要 API Key,不需要付费订阅,只要有显卡,就能实现 Token 自由。

当然,本地部署也是有代价的——你需要一台带显卡的机器,而且模型响应速度取决于显卡性能。

但是!

这年头,谁还没有一张显卡呢?

(没有的话,当我没说)

去试试吧,反正又不花钱。

万一打开了新世界的大门呢?

  • 我的微信
  • 微信扫一扫加好友
  • weinxin
  • 我的微信公众号
  • 扫描关注公众号
  • weinxin

发表评论

:?: :razz: :sad: :evil: :!: :smile: :oops: :grin: :eek: :shock: :???: :cool: :lol: :mad: :twisted: :roll: :wink: :idea: :arrow: :neutral: :cry: :mrgreen: