选择并调好您的模型
在您的机器上跑哪个本地模型?2026 年 open-weight 模型的全景(尤其是中国的),以及把它们卡进您 RAM 的简单规则。
本文目录
本文核对于 3 个月前,部分命令可能已有变化。 如有出入,请告诉我们。
要点速览
决定一切的是您机器的内存:4 位量化下每十亿参数约 0.6 GB,再加上上下文。根据 Quelle IA(2026 年 9 月 28 日版),16 GB 以内首选 Qwen3.5-9B;从 24 GB 显卡到 128 GB 的 mini-PC,首选 Qwen 3.8 27B,Gemma 4 26B A4B 是更快的选择,gpt-oss-120b 适合智能体。最大的开放模型,如 GLM-5.3-Flash 或 DeepSeek V4.1 Flash,需要 200 GB 以上。在代码方面,最好的本地模型仍明显不及 Claude:本地负责边界清晰、私密的任务,云端负责长周期的大工程。
请先完成: 选择硬件
这是一个不太爱听的真相:不是您选择您的模型,是您的机器选择。 您可以梦想跑地球上最大的 open-weight 巨兽,但如果您只有 32 GB RAM,它永远跑不起来。好消息是,到 2026 年,本地的全景已经变得极好,前提是瞄准得当。我们先立下决定一切的规则(尺寸匹配),再看目录,最后切入真正的问题:什么时候您的 mini-PC 够用,什么时候 Claude 还是领先。
尺寸匹配的规则(决定一切的那条)
在模型的名字之前,先讲物理。一个模型,就是数十亿个参数(即「权重」),每一个都占内存。心算的公式一行就够:
所需 RAM ≈(参数量 × 每权重字节数)+ 上下文缓存(KV cache)
每权重的字节数取决于精度(讲到量化时再说)。实践中,在 Q4_K_M,标准格式,下,按每十亿参数约 0.6 GB算(这是 Quelle IA 遵循的规则,详见其「Comment on compte」一节,法语网站)。给系统加 0.5 到 2 GB,如果您用长上下文或多个并行请求,再加 30% 到 50%。
几个 Q4_K_M 下的参照,给您练练眼力:一个 Llama 8B 装进约 6 GB,一个 32B 的稠密(dense)模型约 19 GB,一个 Llama 70B 要 40-43 GB。这是一张随手备查的表,按内存档位划分。这些是 Quelle IA(法语网站)在 2026 年 9 月 28 日版中的选择;它们变化频繁,下载 20 GB 之前请先查看您机器的页面。
| 机器内存 | 装得下的评分最高者 | 在 Ollama 里 |
|---|---|---|
| 8 GB 显卡 | Qwen3.5-4B | qwen3.5:4b |
| 16 GB(显卡、Mac、笔记本) | Qwen3.5-9B | qwen3.5:9b |
| 24 GB 显卡、32 GB 的 Mac 或 Ryzen AI Max | 4 位的 Qwen 3.8 27B;更快的 Gemma 4 26B A4B | qwen3.8:27b、gemma4:26b |
| 64 到 128 GB(Ryzen AI Max、Mac) | 8 位或完整版的 Qwen 3.8 27B;128 GB 上跑智能体用 gpt-oss-120b | qwen3.8:27b-q8_0、gpt-oss:120b |
| 200 GB 以上(DGX Spark 集群、512 GB 的 Mac) | GLM-5.3-Flash、DeepSeek V4.1 Flash | mini-PC 之外 |
想查您的确切配置:每台机器的页面(例如 128 GB 的 Ryzen AI Max+ 395 或 32 GB 的 Mac mini M6),或者用四个问题 找到我的模型(法语网站)。
# 集成显卡从系统拿走了多少,单位是字节
cat /sys/class/drm/card*/device/mem_info_gtt_used
# 给机器上的其他服务留出 28 GB 内存(数值单位为字节)
# 写进 Ollama 服务的环境变量里
OLLAMA_GPU_OVERHEAD=30064771072
不设这一项,Ollama 会按”机器上只有我一个”来算它的层数。它看到的是一块 128 GB 的显卡,于是就敢把一个 65 GB 的模型装进一台还跑着三十个服务的 94 GB 机器里。
捷径:让工具替您做尺寸匹配
刚才立下的整条规则(数 GB、掂量量化、认出 MoE),有个开源小工具两秒钟就替您算完:llmfit(MIT 许可,仓库 AlexsJones/llmfit)。它扫描您的机器(RAM、CPU 核心、VRAM、多 GPU)和已装的运行时(Ollama、llama.cpp、LM Studio、MLX、Docker Model Runner),跟一份模型和量化的目录交叉比对,给您一个打过分的排名:哪些装得下、哪些跑得快、该瞄准哪个量化。免得白白拉一个 20 GB 的模型回来。
已完成 0 步,共 2 步 勾选记录只保存在此浏览器中。
-
安装它
用您惯用的包管理器,按您的系统来:
# macOS / Linux(Homebrew) brew install AlexsJones/llmfit/llmfit # macOS / Linux(快速脚本) curl -fsSL https://llmfit.axjns.dev/install.sh | sh # Windows(Scoop) scoop install llmfit # 什么都不长期安装:Docker docker run ghcr.io/alexsjones/llmfit -
跑分析
不带参数,您会得到一个交互式终端界面(外加一个 web 仪表盘,在
http://<机器IP>:8787)。想要纯表格或便于脚本处理的 JSON?选项都在。llmfit # 交互界面 + web 仪表盘 llmfit --cli # 终端里的经典表格 llmfit recommend --json --use-case coding --limit 3 # 代码场景前 3,输出 JSON
这两个工具告诉您什么装得下。想知道装得下的里面哪个评分最高,按任务细分(代码、智能体、法语……),请看 Quelle IA 的逐机推荐(法语网站):64 台真实机器,附带注明日期的价格。
2026 年的模型全景
标志性事实:中国的实验室主导着 open-weight(阿里巴巴、DeepSeek、智谱 Z.ai、月之暗面、MiniMax、小米),Google(Gemma)和 OpenAI(gpt-oss)是主要的美国选项。两种轮廓浮现出来。巨型模型(总参数从几千亿到 2.8 T)面向服务器或机器集群。还有紧凑型模型(约 25-30B,稠密或 MoE),它们才真正能在 mini-PC 上跑。我们关心的就是第二个家族。
以下是截至 2026 年 9 月 28 日的稳妥选择,依据 Quelle IA(法语网站):
| 模型 | 类型 / 大小 | 干什么 | 您跑得动吗? |
|---|---|---|---|
| Qwen 3.8 27B(阿里巴巴,2026 年 8 月) | 稠密,27B,256K 上下文 | 128 GB 以内评分最高,代码也包括在内 | ✅ 24 GB 显卡或 32 GB 统一内存:qwen3.8:27b |
| Gemma 4 26B A4B(Google,2026 年 4 月) | MoE,26B / 约 4B 激活,256K 上下文 | 快,非中国,测试机的参考模型 | ✅ 32 GB 起:gemma4:26b |
| Qwen3.5-9B / 4B(阿里巴巴,2026 年 2 月) | 稠密 | 8 到 16 GB 的机器 | ✅ qwen3.5:9b、qwen3.5:4b |
| gpt-oss-120b(OpenAI,2025 年 8 月) | MoE,117B | 128 GB 以内智能体评分最高 | ⚠️ 128 GB 的机器,下载 65 GB:gpt-oss:120b |
| Qwen3.6 27B(阿里巴巴,2026 年 4 月) | 稠密,27.8B,256K 上下文 | 上一代,依然扎实 | ✅ 24 GB 起:qwen3.6:27b |
| GLM-4.7-Flash(智谱 Z.ai) | Q4 约 19 GB,198K 上下文 | 真正装得进本地的 GLM | ✅ 32 GB 起:glm-4.7-flash |
| GLM-5.3-Flash(智谱 Z.ai,2026 年 8 月) | MoE,320B | 代码和智能体方面最好的本地模型 | ❌ 4 位约 220 GB;可通过 glm-5.3-flash:cloud 在线使用 |
| DeepSeek V4 Flash / V4.1 Flash | MoE;V4 Flash:284B,13B 激活,1M 上下文 | 长上下文;V4.1 Flash 位居本地榜首 | ❌ DGX Spark 集群 |
| Kimi K3(月之暗面,2026 年 7 月) | 总参数 2.8 T | 长周期智能体任务 | ❌ 仅限服务器 |
在 mini-PC 上首选就是 qwen3.8:27b,只要装得下。如果速度比最后几分质量更重要,gemma4:26b 凭借 4B 激活参数响应快得多。而在跑智能体的 128 GB 机器上,gpt-oss:120b 值得一试。排名每周都在变:本地模型排名、所有开放模型(包括您家里装不下的),以及用 比较 把两个模型放在一起对照(均为法语网站)。
把量化讲清楚
您看到过像 Q4_K_M 这样的名字。来解码一下。GGUF 是本地模型的文件格式,后缀表示精度:每个权重保留多少比特。比特越少 = 文件越轻 = 装进越少的 RAM。代价是质量略有损失。
| 等级 | 质量 | 何时使用 |
|---|---|---|
Q8_0 | 近乎完美 | 对代码很少值得(太重) |
Q6_K / Q5_K_M | 极佳 | 关键推理,如果您有内存余量 |
Q4_K_M | 非常好 | 事实上的标准,您的默认选择 |
< Q4 | 可见的退化 | 只在内存逼您时 |
Q4_K_M 大约只有原始 FP16 模型的 30% 重,而损失仅约 2-3%。专门对代码而言,它经得起考验,升到 Q5 或 Q6 并不会让代码生成有可感知的改善。您只有在被迫时才会降到 Q4 以下,而且您会很快察觉(代码和推理是最先遭殃的)。
在 Ollama 里接上正确的量化
实践中很简单:在 Ollama 里,标签(tag)已经编码了量化。您通过把精度写进名字里来选择它。
已完成 0 步,共 2 步 勾选记录只保存在此浏览器中。
-
按正确的量化拉取模型
标签后面的后缀就是量化。不带后缀的话,Ollama 取一个默认值(通常是 Q4_K_M)。
# 默认值(一般是 Q4_K_M), 开始用很完美 ollama pull qwen3.8:27b # 或者显式的量化,如果您想确保万无一失 ollama pull qwen3.8:27b-q4_K_M # 更保真,如果您内存够(64 GB 及以上) ollama pull qwen3.8:27b-q8_0 -
把上下文卡到真实需要上
上下文耗 RAM(那个出了名的 KV cache)。
OLLAMA_CONTEXT_LENGTH的默认值取决于显存:低于 24 GiB 为 4,000 个 token,24 到 48 GiB 为 32,000,更高则为 256,000。在小显卡上跑代理嫌太低,在 Ryzen AI Max 或大内存 Mac 上则很高,缓存会悄悄膨胀(在 Strix Halo 上是在 GTT 内存里)。上下文过大也可能把您推进 swap,这是「Ollama 很慢」的头号原因。把OLLAMA_CONTEXT_LENGTH或num_ctx设到任务真正需要的量:按 Ollama 文档,编码代理用 64,000,脚本则少得多。
说实话:本地还是 Claude?
我们不会给您卖梦。以下是 Quelle IA 2026 年 9 月 28 日版所呈现的本地状况,不加滤镜。
对于边界清晰且私密的任务,短窗口生成、重构、自动补全、定点调试,本地真的有竞争力。它私密、按使用免费,而且在基准上的差距已经明显收窄(GLM-5.3 和 DeepSeek V4 正在逼近最好的模型,Kimi K3 在智能体上很硬)。还有一点常被忽略:一个 open-weight 模型在好的框架里(一个配置得当的 OpenCode)表现,比在裸聊天里好得多。
但有两个局限要记住:
- 顶点仍然是 Claude。 在 Quelle IA 代码排名(法语网站)上,Claude Opus 5.5(99.9)和 Claude Fable 5.1(98.6)领先。能装进 128 GB mini-PC 的最好模型 Qwen 3.8 27B 在那里得 81.1(仍是暂定分数)。
- 最好的开放模型在 mini-PC 上跑不了。 Kimi K3(2.8 T 参数)、GLM-5.3(744B)、DeepSeek V4 Pro(1.6 T),那是 API 或服务器的事。就连代码方面最好的本地模型 GLM-5.3-Flash(88.9)也需要两台 DGX Spark。本地能装下的(Qwen 3.8 27B、Gemma 4 26B A4B、gpt-oss-120b)在长链智能体可靠性和工具使用上低一档。
本文全部命令
常见问题
什么是 MoE 模型?它需要多少内存?
MoE(Mixture of Experts,混合专家)模型的总参数量很大,但每个 token 只激活其中一小部分。内存要按总参数量来估算,因为所有参数都必须加载;速度则取决于激活参数的数量。比如 Gemma 4 26B A4B 占用 16 到 19 GB 内存,但每个 token 只激活约 40 亿参数,因此比同等规模的稠密模型快得多。
本地模型该选哪种量化?
Q4_K_M 是事实上的标准:体积约为原始 FP16 模型的 30%,损失只有 2% 到 3%,跑代码也很可靠。只有在需要关键推理、且内存有余量时,才升到 Q5 或 Q6。除非迫不得已,别降到 Q4 以下,因为代码和推理会最先受影响。
为什么 Ollama 在我的机器上很慢?
头号原因是上下文设得太大,导致系统溢出到磁盘上的交换空间(swap)。上下文要占内存,而在显存超过 48 GiB 的机器上,Ollama 的默认值高达 256,000 个 token。把 OLLAMA_CONTEXT_LENGTH 或 num_ctx 设成任务真正需要的大小:根据 Ollama 文档,编程智能体用 64,000,脚本则少得多。
不用自己计算,怎样知道我的电脑能跑哪些模型?
开源工具 llmfit 会扫描您的机器(内存、CPU 核心数、显存)以及已安装的运行时(如 Ollama 或 LM Studio),然后列出哪些模型放得下、哪些跑得快、该选哪种量化。它还能模拟您尚未拥有的配置,买机器前很实用。如果什么都不想装,CanIRun.ai 网站可以直接在浏览器里给出估算。
为什么 free 命令看不到模型占用的内存?
在 AMD Strix Halo 这类共享内存的 APU 上,模型权重以 GTT 内存的形式占用系统内存,而这部分内存在 free 和 Docker 容器的内存上限中都看不到。机器因此可能在毫无征兆的情况下被占满。在让多个模型同时常驻之前,先看看集成 GPU 实际占用了多少,并用 OLLAMA_GPU_OVERHEAD 为机器的其余部分预留内存。
本文涉及的术语: 参数RAM(内存)量化OllamaGPU(显卡)智能体开源(对比开放权重)Docker统一内存推理OpenCodeAPI工具调用
发现错误?
命令失效了,价格变了?
这些工具每个月都在变。请告诉我这篇文章哪里不对,我会改正并更新日期。