本地 LLM 推理框架/工具對照(2026 年 8 月)
Ollama、LM Studio、llama.cpp、vLLM、MLX、SGLang——8 個主流本地/地端 LLM 推理工具對照:定位、平台、模型格式、授權與適用場景。分清「桌面 app / 推理引擎 / Apple 專屬 / 生產服務框架」四類。
| 工具 | 類型 | 平台 | 模型格式 | 授權 | 適合場景 |
|---|---|---|---|---|---|
| Ollama | 桌面 app + CLI | macOS/Win/Linux;NVIDIA/AMD/Apple | GGUF(可匯入 safetensors) | MIT | 單機易上手,一行指令跑模型 |
| LM Studio | 桌面 GUI | macOS(Apple Silicon)/Win/Linux | GGUF + MLX | 閉源(免費);SDK 開源 | GUI 使用者;Mac 走 MLX 優化 |
| llama.cpp | 推理引擎/函式庫 | 跨硬體(CUDA/Metal/Vulkan/CPU) | GGUF(此格式的源頭) | MIT | 嵌入整合/CPU/邊緣;眾多 app 底層 |
| vLLM | 生產服務框架 | NVIDIA/AMD/Intel GPU/CPU | safetensors + 多量化 | Apache-2.0 | 高吞吐生產部署、GPU 叢集 |
| MLX-LM | Apple 專屬套件 | 僅 Apple Silicon | MLX(可轉 HF) | MIT | Apple Silicon 推理與微調 |
| SGLang | 生產服務框架 | NVIDIA/AMD/Intel/TPU/NPU | HF 相容 + OpenAI API | Apache-2.0 | 低延遲高吞吐、分散式叢集 |
| text-generation-webui | 桌面 app / Web UI | Linux/Win/macOS;多後端 | GGUF + safetensors | AGPL-3.0 | 進階實驗、多後端切換 |
| GPT4All | 桌面 app | Win/macOS/Linux;Vulkan GPU | GGUF | MIT | 隱私本地使用、平價硬體 |
方法與來源
各工具定位/平台/授權取自其官方 GitHub repo 與官方文件(2026-08 現況),擷取日 2026-08-26。**分類**:桌面 app(Ollama、LM Studio、GPT4All、text-generation-webui)/ 推理引擎函式庫(llama.cpp、vLLM、SGLang)/ Apple 專屬(MLX-LM)。8 者皆提供 OpenAI 相容 API。授權/平台為易變欄位,以官方 repo 現況為準。**待註**:Ollama 的 GPU 逐條清單為依 llama.cpp 底層歸納(細項 medium);LM Studio app 本體為閉源(免費),其 SDK/CLI 開源。來源:llama.cpp https://github.com/ggml-org/llama.cpp ;Ollama https://github.com/ollama/ollama ;vLLM https://github.com/vllm-project/vllm ;MLX-LM https://github.com/ml-explore/mlx-lm ;LM Studio https://lmstudio.ai/ 。
來源:https://github.com/ggml-org/llama.cpp
擷取日期:2026-08-26
常見問題
- 「本地 LLM 推理框架/工具對照(2026 年 8 月)」涵蓋哪些對象?
- 本表涵蓋 Ollama、LM Studio、llama.cpp、vLLM、MLX-LM、SGLang、text-generation-webui、GPT4All,對照欄位包含:工具、類型、平台、模型格式、授權、適合場景。
- 這張表的資料來源與方法為何?
- 各工具定位/平台/授權取自其官方 GitHub repo 與官方文件(2026-08 現況),擷取日 2026-08-26。
- 資料最後更新於何時?
- 本表資料擷取/更新日為 2026-08-26。