如何在VPS上使用Ollama自托管类似ChatGPT的AI
什么是Ollama?
Ollama 是一款免费的开源工具,可让您在本地计算机或服务器上运行和管理大型语言模型,例如 LLaMA、Mistral、Gemma 等。它简化了模型的下载、运行和交互过程,只需一个命令行界面即可完成。
| 资源 | 最小值(适用于小型机型) | 推荐(适用于更高级的型号) |
|---|---|---|
| 中央处理器 | 2个核心 | 4核以上 |
| 内存 | 8 GB | 16–32 GB |
| 磁盘空间 | 20 GB+ | 40 GB+ |
第一步:更新所有系统软件包
更新所有系统软件包,确保您的 Ubuntu 服务器是最新版本。
sudo apt update && sudo apt upgrade -y
步骤 2:安装 Ollama
Ollama 提供适用于 Linux 的官方安装脚本。
curl -fsSL https://ollama.com/install.sh | sh
这将下载并安装 Ollama CLI 及其依赖项。
安装完成后,您可以通过运行以下命令进行验证:
ollama --version
步骤 3:选择模型(例如,LLaMA3 或 Mistral)
您可以在这里浏览可供选择的车型:
要运行LLaMA3 8B,请使用:
ollama run llama3
或者,对于像Mistral这样更轻便的型号:
ollama run mistral
首次运行时,Ollama 会自动下载模型。
第四步:开始聊天
模型加载完成后,您将进入本地聊天窗口。只需输入您的问题,即可获得类似 ChatGPT 的答案;无需 API 密钥、等待或网络请求。
步骤 5:通过 API 使用 Ollama(可选)
Ollama 提供了一个与 OpenAI Chat API 兼容的本地 API。它非常适合与以下用户界面集成:
- Open WebUI
- 文本生成 WebUI
- LangChain代理
- 自定义 Web 应用程序
启动 Ollama 服务器(它会自动运行),然后通过以下方式访问它:
http://localhost:11434
cURL 请求示例:
curl http://localhost:11434/api/generate -d '{
"model": "llama3",
"prompt": "Explain black holes like I’m 5"
}'
优化技巧
- 使用较小的型号(例如 Mistral 或 Gemma)可以降低资源消耗。
- 如果您的VPS支持,请将工作负载转移到GPU上。
- 需要时可用于
--num-ctx增大上下文窗口。 - 使用
htop或监控内存使用情况glances。
结论
借助 Ollama 等工具,即使在配置中等的 VPS 服务器上,自行托管类似 ChatGPT 的助手也已成为现实。通过这种配置,您可以完全掌控聊天机器人、私人助手或创意工具的创建。