跳到正文
全部 31 篇FREN中文
目录
第 4 部分 · 第 6 篇,共 8 篇 难度:进阶 阅读时间:16 分钟 适用平台:Linux, Mac和Windows

选择并调好您的模型

在您的机器上跑哪个本地模型?2026 年 open-weight 模型的全景(尤其是中国的),以及把它们卡进您 RAM 的简单规则。

本文目录
  1. 01尺寸匹配的规则(决定一切的那条)
  2. 02捷径:让工具替您做尺寸匹配
  3. 032026 年的模型全景
  4. 04把量化讲清楚
  5. 05在 Ollama 里接上正确的量化
  6. 06说实话:本地还是 Claude?
  7. 07常见问题

要点速览

决定一切的是您机器的内存:4 位量化下每十亿参数约 0.6 GB,再加上上下文。根据 Quelle IA(2026 年 9 月 28 日版),16 GB 以内首选 Qwen3.5-9B;从 24 GB 显卡到 128 GB 的 mini-PC,首选 Qwen 3.8 27B,Gemma 4 26B A4B 是更快的选择,gpt-oss-120b 适合智能体。最大的开放模型,如 GLM-5.3-Flash 或 DeepSeek V4.1 Flash,需要 200 GB 以上。在代码方面,最好的本地模型仍明显不及 Claude:本地负责边界清晰、私密的任务,云端负责长周期的大工程。

请先完成: 选择硬件

这是一个不太爱听的真相:不是您选择您的模型,是您的机器选择。 您可以梦想跑地球上最大的 open-weight 巨兽,但如果您只有 32 GB RAM,它永远跑不起来。好消息是,到 2026 年,本地的全景已经变得极好,前提是瞄准得当。我们先立下决定一切的规则(尺寸匹配),再看目录,最后切入真正的问题:什么时候您的 mini-PC 够用,什么时候 Claude 还是领先。

尺寸匹配的规则(决定一切的那条)

在模型的名字之前,先讲物理。一个模型,就是数十亿个参数(即「权重」),每一个都占内存。心算的公式一行就够:

所需 RAM ≈(参数量 × 每权重字节数)+ 上下文缓存(KV cache)

每权重的字节数取决于精度(讲到量化时再说)。实践中,在 Q4_K_M,标准格式,下,按每十亿参数约 0.6 GB算(这是 Quelle IA 遵循的规则,详见其「Comment on compte」一节,法语网站)。给系统加 0.5 到 2 GB,如果您用长上下文或多个并行请求,再加 30% 到 50%。

几个 Q4_K_M 下的参照,给您练练眼力:一个 Llama 8B 装进约 6 GB,一个 32B 的稠密(dense)模型约 19 GB,一个 Llama 70B 要 40-43 GB。这是一张随手备查的表,按内存档位划分。这些是 Quelle IA(法语网站)在 2026 年 9 月 28 日版中的选择;它们变化频繁,下载 20 GB 之前请先查看您机器的页面。

机器内存装得下的评分最高者在 Ollama 里
8 GB 显卡Qwen3.5-4Bqwen3.5:4b
16 GB(显卡、Mac、笔记本)Qwen3.5-9Bqwen3.5:9b
24 GB 显卡、32 GB 的 Mac 或 Ryzen AI Max4 位的 Qwen 3.8 27B;更快的 Gemma 4 26B A4Bqwen3.8:27b、gemma4:26b
64 到 128 GB(Ryzen AI Max、Mac)8 位或完整版的 Qwen 3.8 27B;128 GB 上跑智能体用 gpt-oss-120bqwen3.8:27b-q8_0、gpt-oss:120b
200 GB 以上(DGX Spark 集群、512 GB 的 Mac)GLM-5.3-Flash、DeepSeek V4.1 Flashmini-PC 之外

想查您的确切配置:每台机器的页面(例如 128 GB 的 Ryzen AI Max+ 395 或 32 GB 的 Mac mini M6),或者用四个问题 找到我的模型(法语网站)。

# 集成显卡从系统拿走了多少,单位是字节
cat /sys/class/drm/card*/device/mem_info_gtt_used

# 给机器上的其他服务留出 28 GB 内存(数值单位为字节)
# 写进 Ollama 服务的环境变量里
OLLAMA_GPU_OVERHEAD=30064771072

不设这一项,Ollama 会按”机器上只有我一个”来算它的层数。它看到的是一块 128 GB 的显卡,于是就敢把一个 65 GB 的模型装进一台还跑着三十个服务的 94 GB 机器里。

捷径:让工具替您做尺寸匹配

刚才立下的整条规则(数 GB、掂量量化、认出 MoE),有个开源小工具两秒钟就替您算完:llmfit(MIT 许可,仓库 AlexsJones/llmfit)。它扫描您的机器(RAM、CPU 核心、VRAM、多 GPU)和已装的运行时(Ollama、llama.cpp、LM Studio、MLX、Docker Model Runner),跟一份模型和量化的目录交叉比对,给您一个打过分的排名:哪些装得下、哪些跑得快、该瞄准哪个量化。免得白白拉一个 20 GB 的模型回来。

已完成 0 步,共 2 步 勾选记录只保存在此浏览器中。

  1. 安装它

    用您惯用的包管理器,按您的系统来:

    # macOS / Linux(Homebrew)
    brew install AlexsJones/llmfit/llmfit
    # macOS / Linux(快速脚本)
    curl -fsSL https://llmfit.axjns.dev/install.sh | sh
    # Windows(Scoop)
    scoop install llmfit
    # 什么都不长期安装:Docker
    docker run ghcr.io/alexsjones/llmfit
    
  2. 跑分析

    不带参数,您会得到一个交互式终端界面(外加一个 web 仪表盘,在 http://<机器IP>:8787)。想要纯表格或便于脚本处理的 JSON?选项都在。

    llmfit              # 交互界面 + web 仪表盘
    llmfit --cli        # 终端里的经典表格
    llmfit recommend --json --use-case coding --limit 3   # 代码场景前 3,输出 JSON
    

这两个工具告诉您什么装得下。想知道装得下的里面哪个评分最高,按任务细分(代码、智能体、法语……),请看 Quelle IA 的逐机推荐(法语网站):64 台真实机器,附带注明日期的价格。

2026 年的模型全景

标志性事实:中国的实验室主导着 open-weight(阿里巴巴、DeepSeek、智谱 Z.ai、月之暗面、MiniMax、小米),Google(Gemma)和 OpenAI(gpt-oss)是主要的美国选项。两种轮廓浮现出来。巨型模型(总参数从几千亿到 2.8 T)面向服务器或机器集群。还有紧凑型模型(约 25-30B,稠密或 MoE),它们才真正能在 mini-PC 上跑。我们关心的就是第二个家族。

以下是截至 2026 年 9 月 28 日的稳妥选择,依据 Quelle IA(法语网站):

模型类型 / 大小干什么您跑得动吗?
Qwen 3.8 27B(阿里巴巴,2026 年 8 月)稠密,27B,256K 上下文128 GB 以内评分最高,代码也包括在内✅ 24 GB 显卡或 32 GB 统一内存:qwen3.8:27b
Gemma 4 26B A4B(Google,2026 年 4 月)MoE,26B / 约 4B 激活,256K 上下文快,非中国,测试机的参考模型✅ 32 GB 起:gemma4:26b
Qwen3.5-9B / 4B(阿里巴巴,2026 年 2 月)稠密8 到 16 GB 的机器✅ qwen3.5:9b、qwen3.5:4b
gpt-oss-120b(OpenAI,2025 年 8 月)MoE,117B128 GB 以内智能体评分最高⚠️ 128 GB 的机器,下载 65 GB:gpt-oss:120b
Qwen3.6 27B(阿里巴巴,2026 年 4 月)稠密,27.8B,256K 上下文上一代,依然扎实✅ 24 GB 起:qwen3.6:27b
GLM-4.7-Flash(智谱 Z.ai)Q4 约 19 GB,198K 上下文真正装得进本地的 GLM✅ 32 GB 起:glm-4.7-flash
GLM-5.3-Flash(智谱 Z.ai,2026 年 8 月)MoE,320B代码和智能体方面最好的本地模型❌ 4 位约 220 GB;可通过 glm-5.3-flash:cloud 在线使用
DeepSeek V4 Flash / V4.1 FlashMoE;V4 Flash:284B,13B 激活,1M 上下文长上下文;V4.1 Flash 位居本地榜首❌ DGX Spark 集群
Kimi K3(月之暗面,2026 年 7 月)总参数 2.8 T长周期智能体任务❌ 仅限服务器

在 mini-PC 上首选就是 qwen3.8:27b,只要装得下。如果速度比最后几分质量更重要,gemma4:26b 凭借 4B 激活参数响应快得多。而在跑智能体的 128 GB 机器上,gpt-oss:120b 值得一试。排名每周都在变:本地模型排名、所有开放模型(包括您家里装不下的),以及用 比较 把两个模型放在一起对照(均为法语网站)。

把量化讲清楚

您看到过像 Q4_K_M 这样的名字。来解码一下。GGUF 是本地模型的文件格式,后缀表示精度:每个权重保留多少比特。比特越少 = 文件越轻 = 装进越少的 RAM。代价是质量略有损失。

等级质量何时使用
Q8_0近乎完美对代码很少值得(太重)
Q6_K / Q5_K_M极佳关键推理,如果您有内存余量
Q4_K_M非常好事实上的标准,您的默认选择
< Q4可见的退化只在内存逼您时

Q4_K_M 大约只有原始 FP16 模型的 30% 重,而损失仅约 2-3%。专门对代码而言,它经得起考验,升到 Q5 或 Q6 并不会让代码生成有可感知的改善。您只有在被迫时才会降到 Q4 以下,而且您会很快察觉(代码和推理是最先遭殃的)。

在 Ollama 里接上正确的量化

实践中很简单:在 Ollama 里,标签(tag)已经编码了量化。您通过把精度写进名字里来选择它。

已完成 0 步,共 2 步 勾选记录只保存在此浏览器中。

  1. 按正确的量化拉取模型

    标签后面的后缀就是量化。不带后缀的话,Ollama 取一个默认值(通常是 Q4_K_M)。

    # 默认值(一般是 Q4_K_M), 开始用很完美
    ollama pull qwen3.8:27b
    # 或者显式的量化,如果您想确保万无一失
    ollama pull qwen3.8:27b-q4_K_M
    # 更保真,如果您内存够(64 GB 及以上)
    ollama pull qwen3.8:27b-q8_0
    
  2. 把上下文卡到真实需要上

    上下文耗 RAM(那个出了名的 KV cache)。OLLAMA_CONTEXT_LENGTH 的默认值取决于显存:低于 24 GiB 为 4,000 个 token,24 到 48 GiB 为 32,000,更高则为 256,000。在小显卡上跑代理嫌太低,在 Ryzen AI Max 或大内存 Mac 上则很高,缓存会悄悄膨胀(在 Strix Halo 上是在 GTT 内存里)。上下文过大也可能把您推进 swap,这是「Ollama 很慢」的头号原因。把 OLLAMA_CONTEXT_LENGTH 或 num_ctx 设到任务真正需要的量:按 Ollama 文档,编码代理用 64,000,脚本则少得多。

说实话:本地还是 Claude?

我们不会给您卖梦。以下是 Quelle IA 2026 年 9 月 28 日版所呈现的本地状况,不加滤镜。

对于边界清晰且私密的任务,短窗口生成、重构、自动补全、定点调试,本地真的有竞争力。它私密、按使用免费,而且在基准上的差距已经明显收窄(GLM-5.3 和 DeepSeek V4 正在逼近最好的模型,Kimi K3 在智能体上很硬)。还有一点常被忽略:一个 open-weight 模型在好的框架里(一个配置得当的 OpenCode)表现,比在裸聊天里好得多。

但有两个局限要记住:

  • 顶点仍然是 Claude。 在 Quelle IA 代码排名(法语网站)上,Claude Opus 5.5(99.9)和 Claude Fable 5.1(98.6)领先。能装进 128 GB mini-PC 的最好模型 Qwen 3.8 27B 在那里得 81.1(仍是暂定分数)。
  • 最好的开放模型在 mini-PC 上跑不了。 Kimi K3(2.8 T 参数)、GLM-5.3(744B)、DeepSeek V4 Pro(1.6 T),那是 API 或服务器的事。就连代码方面最好的本地模型 GLM-5.3-Flash(88.9)也需要两台 DGX Spark。本地能装下的(Qwen 3.8 27B、Gemma 4 26B A4B、gpt-oss-120b)在长链智能体可靠性和工具使用上低一档。

常见问题

什么是 MoE 模型?它需要多少内存?

MoE(Mixture of Experts,混合专家)模型的总参数量很大,但每个 token 只激活其中一小部分。内存要按总参数量来估算,因为所有参数都必须加载;速度则取决于激活参数的数量。比如 Gemma 4 26B A4B 占用 16 到 19 GB 内存,但每个 token 只激活约 40 亿参数,因此比同等规模的稠密模型快得多。

本地模型该选哪种量化?

Q4_K_M 是事实上的标准:体积约为原始 FP16 模型的 30%,损失只有 2% 到 3%,跑代码也很可靠。只有在需要关键推理、且内存有余量时,才升到 Q5 或 Q6。除非迫不得已,别降到 Q4 以下,因为代码和推理会最先受影响。

为什么 Ollama 在我的机器上很慢?

头号原因是上下文设得太大,导致系统溢出到磁盘上的交换空间(swap)。上下文要占内存,而在显存超过 48 GiB 的机器上,Ollama 的默认值高达 256,000 个 token。把 OLLAMA_CONTEXT_LENGTH 或 num_ctx 设成任务真正需要的大小:根据 Ollama 文档,编程智能体用 64,000,脚本则少得多。

不用自己计算,怎样知道我的电脑能跑哪些模型?

开源工具 llmfit 会扫描您的机器(内存、CPU 核心数、显存)以及已安装的运行时(如 Ollama 或 LM Studio),然后列出哪些模型放得下、哪些跑得快、该选哪种量化。它还能模拟您尚未拥有的配置,买机器前很实用。如果什么都不想装,CanIRun.ai 网站可以直接在浏览器里给出估算。

为什么 free 命令看不到模型占用的内存?

在 AMD Strix Halo 这类共享内存的 APU 上,模型权重以 GTT 内存的形式占用系统内存,而这部分内存在 free 和 Docker 容器的内存上限中都看不到。机器因此可能在毫无征兆的情况下被占满。在让多个模型同时常驻之前,先看看集成 GPU 实际占用了多少,并用 OLLAMA_GPU_OVERHEAD 为机器的其余部分预留内存。

本文涉及的术语: 参数RAM(内存)量化OllamaGPU(显卡)智能体开源(对比开放权重)Docker统一内存推理OpenCodeAPI工具调用

发现错误?

命令失效了,价格变了?

这些工具每个月都在变。请告诉我这篇文章哪里不对,我会改正并更新日期。

只保留页面、您的留言和选填的联系方式,别无其他。

第 24 / 31 篇 · 第 4 部分 还没有读过任何一篇 打开文章目录