谁说跑大模型必须有显卡?我在一台无GPU、8GB内存的老Windows电脑上跑通了 Ollama + Qwen2.5,本文记录从安装到推理的全过程和踩过的坑。
一、为什么是 Ollama
想在本地跑开源模型,Ollama 是目前最省心的方案:一条命令下载模型、自动量化、OpenAI 兼容 API 开箱即用。CPU 也能跑,只是慢点——对”问答、文本处理”这种非实时场景完全够用。
二、安装踩坑实录
- 下载慢/失败:官网直连经常拉不动。实测用 PowerShell 的 Invoke-WebRequest 比 curl 稳,挂上镜像环境变量后正常。
- C盘空间:模型文件默认放 C 盘,一个 1.5B 模型约 1GB。C盘紧张的建议先迁移或清理。
- 环境变量大小写:Windows 下
HTTP_PROXY和http_proxy同时存在会导致服务起不来(进程环境去重后才正常),这个坑非常隐蔽。 - 国内拉模型:设置
OLLAMA_HF_MIRROR指向国内镜像源,速度直接起飞。
三、跑通 Qwen2.5:1.5b
ollama pull qwen2.5:1.5b
ollama run qwen2.5:1.5b
实测在纯 CPU、8GB 内存上:17-20 tokens/s,回答流畅度可接受。1.5B 量化模型内存占用约 1.2GB,8GB 机器毫无压力。
四、API 调用示例
curl http://localhost:11434/api/generate -d '{
"model": "qwen2.5:1.5b",
"prompt": "用一句话介绍你自己"
}'
兼容 OpenAI 格式,现有代码改个 base_url 就能接入。
五、这类机器还能玩什么
本地跑模型只是开始。我给这台老电脑的完整规划:Ollama 跑推理 + 定时任务挂脚本 + frp 内网穿透。如果你没有闲置电脑,也可以直接上云——腾讯云 2核2G 的新客价只要 99 元/年,跑 1.5B 模型问题不大,入口:
(推广链接,价格与官网一致,走链接算支持我持续输出)
六、下一步计划
给 Ollama 接上 RAG、本地知识库,以及在 4G 内存限制下的多模型轮换策略,踩坑了继续来发。
有问题评论区见,看到必回。
