聊到本地部署大模型,很多人第一反应是“门槛太高”。其实不然,只要选对工具,普通人也能轻松在自己的电脑上跑起Llama3、千问这类模型,甚至搭出一个带知识库的个人AI助手。下面就来拆解整个过程,从最基础的模型管理平台Ollama,到可视化界面的Open WebUI,再到能私有化建知识库的AnythingLLM,一步一步说清楚。
Ollama
官网:https://ollama.com/
Github:https://github.com/ollama/ollama
Ollama是一个开源平台,专门用来管理和运行各种大语言模型,像Llama3、Gemma、Qwen这些主流模型都能一键下载、加载、交互。它提供命令行界面,操作起来很直接——安装、管理模型、对话,都在终端里完成。
Windows安装
要求:win10以上操作系统
安装包下载地址:https://ollama.com/download/windows
先去官网下载对应系统的安装包,双击运行,点击Install完成安装。之后打开终端,输入下面这条命令就能拉取模型并开始聊天,这里以中文表现不错的千问为例:
ollama run qwen
首次运行会先下载模型(大概几百兆到几个G不等),下载完成后,直接在终端里输入问题,就能得到回答。
到这一步,普通人已经能跟大模型对话了,虽然只是命令行,但胜在简单直接。
Docker安装
如果喜欢用Docker,或者需要在服务器上部署,可以走容器化路线。先启动Ollama容器:
# 只有CPU用这个
docker run -itd --name ollama -v ollama:/root/.ollama -p 11434:11434 ollama/ollama
# 有GPU用这个
docker run -itd --name ollama --restart always --gpus=all -v /home/suxy/ollama:/root/.ollama -p 11434:11434 ollama/ollama
启动后,进入容器拉取模型并运行:
#千问4b
docker exec -it ollama ollama run qwen
#llama3
docker exec -it ollama ollama run llama3
#gemma
docker exec -it ollama ollama run gemma
初次拉取会下载模型,完成后就能直接在容器里对话了。
至于其他模型,可以到官方模型库(https://ollama.ai/library)查看,根据自身需求下载不同参数量级的版本。
Open WebUI
终端用起来终归不够直观,如果有一个类似ChatGPT的Web界面,体验会好很多——可以保留聊天记录,方便翻阅和查询。这里推荐Open WebUI(之前叫Ollama WebUI),专门为Ollama定制的可视化界面。
官方文档:https://docs.openwebui.com/getting-started/
Github:https://github.com/open-webui/open-webui
用Docker快速部署:
#示例使用的是ollama-webui
docker run -itd --name ollama-webui --restart always -p 3500:8080 --add-host=host.docker.internal:host-gateway ghcr.io/ollama-webui/ollama-webui:latest
#或
docker run -itd --name open-webui --restart always -p 3500:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:latest
部署成功后,浏览器访问http://127.0.0.1:3500。首次登录需要创建账号,填写邮箱和密码,之后就能看到类似ChatGPT的界面了。
需要注意的是,右边设置里需要配置Ollama服务的地址,比如http://localhost:11434/api。
另外,在WebUI上可以直接下载模型,还能看到下载进度。之后在select a model里选择当前要用的模型,就能愉快地聊天了。
AnythingLLM
以上都是基础的对话场景。如果想把企业文档、学习笔记这些私有资料喂给AI,打造一个私有知识库,那就需要RAG(检索增强生成)方案了。AnythingLLM正是为此而生——开源、高效、可定制,支持接入各种LLM和向量数据库。
官方文档:https://docs.useanything.com/
Github:https://github.com/Mintplex-Labs/anything-llm
下载安装AnythingLLM
官方安装教程:https://docs.useanything.com/anythingllm-desktop/windows-instructions
安装包下载地址:https://useanything.com/download
以Windows为例:下载安装包后直接双击安装。由于之前配置过,这里就不重复截图初始界面了,不过所有配置都能在设置里找到。
配置LLM
AnythingLLM支持多种LLM后端:OpenAI、LocalAI、Ollama等。这里选择Ollama,URL填http://127.0.0.1:11434(就是前面Ollama启动的服务端口),然后LLM模型选择llama3。
配置Embedding Model
Embedding模型用于将文档转化为向量,同样支持Ollama。URL还是http://127.0.0.1:11434,Embedding Model选择nomic-embed-text:latest。
配置Vector Database
向量数据库用于存储文档向量。AnythingLLM支持LanceDB(默认)、Astra DB、Pinecone、Chroma等,按需选择即可。
以上三个关键配置完成后,AnythingLLM就可以正式使用了。点击New Workspace新建文档库,填写名称,然后上传文档(支持PDF、Word、TXT等格式)。上传完成后,就能基于文档内容进行提问了。
到现在,整个本地部署流程就走通了——从最底层的模型运行,到美观的Web界面,再到能对接私有文档的知识库,每一步都有对应的工具。实际操作时,根据自己的硬件和需求组合使用就行,比如只想要个本地ChatGPT,Ollama+Open WebUI就够了;如果需要处理公司内部资料,加上AnythingLLM效果更佳。
