Ollama 命令速查表 - 本地大模型运行 CLI 全参数
Ollama 是本地大模型运行的"事实标准",面向希望离线/本地跑 LLM、控制数据不出本机,并想一行命令就拉起模型服务的开发者与隐私敏感团队。它比手动搭 llama.cpp 更省心,提供统一的模型管理与 OpenAI 兼容 API;本表帮你掌握模型拉取/运行、标签管理、Modelfile 温度与权重定制,以及服务配置。
运行与交互 5
ollama run llama3.1拉取并进入交互式对话
ollama run llama3.1 "一句话总结"单次提问后退出
ollama run -m指定运行参数(如上下文长度)
ollama serve启动本地推理服务(默认 11434)
ollama ps查看正在运行的模型
模型管理 5
ollama pull <model>拉取模型到本地
ollama push <model>推送模型到注册表
ollama list列出已安装模型
ollama rm <model>删除本地模型
ollama cp <src> <dst>复制模型(改名/分支)
Modelfile 定制 5
FROM llama3.1Modelfile 指定基础模型
PARAMETER temperature 0.7设置采样温度
SYSTEM "你是一名严谨的助手"设置系统提示词
TEMPLATE """{{ .Prompt }}"""自定义对话模板
ollama create mymodel -f Modelfile从 Modelfile 构建模型
服务与端口 5
ollama serve前台启动推理服务
OLLAMA_HOST=0.0.0.0 ollama serve允许局域网访问
curl http://localhost:11434/api/generate调用生成 API
ollama show <model>查看模型元数据/模板
ollama embeddings生成文本嵌入向量
实用技巧 5
ollama run llama3.1 -c 4096限制上下文窗口省显存
ollama list | head快速预览已装模型
ollama run --verbose显示 token 速度等诊断
多模型并行 ps 监控用 ollama ps 看显存占用
ollama run <m> "翻译..."把本地模型当离线翻译器
提示
- Ollama 是本地推理事实标准,AI 表补"本地模型"入口能覆盖隐私/离线/零 API 成本场景,与云端 CLI 形成互补。
- 用 Modelfile 的 SYSTEM/PARAMETER 固化行为,比每次在提示词里重复系统指令更稳、可版本化。
- 显存紧张用 `-c` 限制上下文窗口,或用 `ollama ps` 监控多模型并行占用,避免 OOM。
- 需要被代码调用时走 `ollama serve` + REST API,比交互式更适合服务化部署。
常见问题
Ollama 有哪些常用命令?
最常用的是 ollama run <模型> 直接拉取并进入交互;ollama pull <模型> 只下载不运行;ollama list 查看本地已拉取的模型;ollama ps 查看正在运行的模型;ollama create 用 Modelfile 定制模型;ollama serve 把模型以兼容 OpenAI 的 API 暴露在本机 11434 端口。
怎么用 Ollama 下载并运行一个模型?
执行 ollama run llama3.2 这类命令即可:若本地没有该模型会自动从官方库拉取,拉完直接进入对话。只想先下载可执行 ollama pull <模型>。
Ollama 怎么把模型跑成 API 服务?
ollama serve 会启动本地服务,默认在 11434 端口提供与 OpenAI 兼容的 /v1 接口;也可以不显式 serve,因为 ollama run 时后端已按需拉起。把 OpenAI 客户端的 base URL 指向 http://localhost:11434 即可接入。
Ollama 怎么查看本地有哪些模型、哪些正在运行?
ollama list 列出全部已拉取的模型及大小、修改时间;ollama ps 只显示当前正在内存中运行的模型与占用。要删模型用 ollama rm <模型>。
由 巧匠 维护
公开更新于 2026年8月21日,内容持续校对官方文档。