如何在VPS上使用Ollama自托管类似ChatGPT的AI

什么是Ollama?

Ollama 是一款免费的开源工具,可让您在本地计算机或服务器上运行和管理大型语言模型,例如 LLaMA、Mistral、Gemma 等。它简化了模型的下载、运行和交互过程,只需一个命令行界面即可完成。

资源 最小值(适用于小型机型) 推荐(适用于更高级的型号)
中央处理器 2个核心 4核以上
内存 8 GB 16–32 GB
磁盘空间 20 GB+ 40 GB+

第一步:更新所有系统软件包

更新所有系统软件包,确保您的 Ubuntu 服务器是最新版本。

sudo apt update && sudo apt upgrade -y

步骤 2:安装 Ollama

Ollama 提供适用于 Linux 的官方安装脚本。

curl -fsSL https://ollama.com/install.sh | sh

这将下载并安装 Ollama CLI 及其依赖项。

安装完成后,您可以通过运行以下命令进行验证:

ollama --version

步骤 3:选择模型(例如,LLaMA3 或 Mistral)

您可以在这里浏览可供选择的车型:

https://ollama.com/library

要运行LLaMA3 8B,请使用:

ollama run llama3

或者,对于像Mistral这样更轻便的型号:

ollama run mistral

首次运行时,Ollama 会自动下载模型。

第四步:开始聊天

模型加载完成后,您将进入本地聊天窗口。只需输入您的问题,即可获得类似 ChatGPT 的答案;无需 API 密钥、等待或网络请求。

步骤 5:通过 API 使用 Ollama(可选)

Ollama 提供了一个与 OpenAI Chat API 兼容的本地 API。它非常适合与以下用户界面集成:

  • Open WebUI
  • 文本生成 WebUI
  • LangChain代理
  • 自定义 Web 应用程序

启动 Ollama 服务器(它会自动运行),然后通过以下方式访问它:

http://localhost:11434

cURL 请求示例:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3",
  "prompt": "Explain black holes like I’m 5"
}'

优化技巧

  • 使用较小的型号(例如 Mistral 或 Gemma)可以降低资源消耗。
  • 如果您的VPS支持,请将工作负载转移到GPU上。
  • 需要时可用于--num-ctx增大上下文窗口。
  • 使用htop或监控内存使用情况glances

结论

借助 Ollama 等工具,即使在配置中等的 VPS 服务器上,自行托管类似 ChatGPT 的助手也已成为现实。通过这种配置,您可以完全掌控聊天机器人、私人助手或创意工具的创建。

此文章对您是否有帮助? 0 用户发现这个很有用

相关文章

如何选择OpenClaw vps云主机的最佳配置

penClaw 作为一款功能强大的 AI 助手,逐渐成为开发者和企业用户的首选。为了让 OpenClaw 在云服务器上顺畅运行,选择一台适合的...