标签: 踩坑

  • 8GB内存的老电脑也能跑大模型:Ollama 本地部署完整踩坑记录

    谁说跑大模型必须有显卡?我在一台无GPU、8GB内存的老Windows电脑上跑通了 Ollama + Qwen2.5,本文记录从安装到推理的全过程和踩过的坑。

    一、为什么是 Ollama

    想在本地跑开源模型,Ollama 是目前最省心的方案:一条命令下载模型、自动量化、OpenAI 兼容 API 开箱即用。CPU 也能跑,只是慢点——对”问答、文本处理”这种非实时场景完全够用。

    二、安装踩坑实录

    1. 下载慢/失败:官网直连经常拉不动。实测用 PowerShell 的 Invoke-WebRequest 比 curl 稳,挂上镜像环境变量后正常。
    2. C盘空间:模型文件默认放 C 盘,一个 1.5B 模型约 1GB。C盘紧张的建议先迁移或清理。
    3. 环境变量大小写:Windows 下 HTTP_PROXY 和 http_proxy 同时存在会导致服务起不来(进程环境去重后才正常),这个坑非常隐蔽。
    4. 国内拉模型:设置 OLLAMA_HF_MIRROR 指向国内镜像源,速度直接起飞。

    三、跑通 Qwen2.5:1.5b

    ollama pull qwen2.5:1.5b
    ollama run qwen2.5:1.5b

    实测在纯 CPU、8GB 内存上:17-20 tokens/s,回答流畅度可接受。1.5B 量化模型内存占用约 1.2GB,8GB 机器毫无压力。

    四、API 调用示例

    curl http://localhost:11434/api/generate -d '{
      "model": "qwen2.5:1.5b",
      "prompt": "用一句话介绍你自己"
    }'

    兼容 OpenAI 格式,现有代码改个 base_url 就能接入。

    五、这类机器还能玩什么

    本地跑模型只是开始。我给这台老电脑的完整规划:Ollama 跑推理 + 定时任务挂脚本 + frp 内网穿透。如果你没有闲置电脑,也可以直接上云——腾讯云 2核2G 的新客价只要 99 元/年,跑 1.5B 模型问题不大,入口:

    (推广链接,价格与官网一致,走链接算支持我持续输出)

    六、下一步计划

    给 Ollama 接上 RAG、本地知识库,以及在 4G 内存限制下的多模型轮换策略,踩坑了继续来发。

    有问题评论区见,看到必回。