<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>技术实战 on Kalend's Blog</title><link>https://blog.kalend.top/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E6%88%98/</link><description>Recent content in 技术实战 on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Mon, 15 Jun 2026 08:00:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E6%88%98/index.xml" rel="self" type="application/rss+xml"/><item><title>你的显卡到底该跑哪个：国产大模型本地部署横向实测</title><link>https://blog.kalend.top/2026/06/15/2026-06-15-%E5%9B%BD%E4%BA%A7%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%9C%AC%E5%9C%B0%E9%83%A8%E7%BD%B2%E6%A8%AA%E5%90%91%E5%AE%9E%E6%B5%8B.html/</link><pubDate>Mon, 15 Jun 2026 08:00:00 +0800</pubDate><guid>https://blog.kalend.top/2026/06/15/2026-06-15-%E5%9B%BD%E4%BA%A7%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%9C%AC%E5%9C%B0%E9%83%A8%E7%BD%B2%E6%A8%AA%E5%90%91%E5%AE%9E%E6%B5%8B.html/</guid><description>&lt;p&gt;先给结论：没有&amp;quot;最强&amp;quot;，只有&amp;quot;最合适&amp;quot;。&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;你的显存&lt;/th&gt;
					&lt;th&gt;推荐模型&lt;/th&gt;
					&lt;th&gt;预期速度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;8GB&lt;/td&gt;
					&lt;td&gt;Qwen3:4b（中文万金油）&lt;/td&gt;
					&lt;td&gt;100+ tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;12GB&lt;/td&gt;
					&lt;td&gt;DeepSeek-R1:7b（推理强）&lt;/td&gt;
					&lt;td&gt;40-70 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;16GB&lt;/td&gt;
					&lt;td&gt;Qwen3:14b 或 DeepSeek-R1:14b&lt;/td&gt;
					&lt;td&gt;70-120 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;DeepSeek-R1:32b 蒸馏版&lt;/td&gt;
					&lt;td&gt;30-60 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这是我在 RTX 3060 12GB 和 RTX 4090 24GB 上跑了两个星期、测试了十几个模型后得出的真实结论。下面展开说。&lt;/p&gt;
&lt;h2 id="一为什么是-deepseekqwenglm-这三家"&gt;一、为什么是 DeepSeek、Qwen、GLM 这三家
&lt;/h2&gt;&lt;p&gt;国产开源大模型不少，但真正在 Ollama 上能跑、社区支持成熟、中文效果好的，就这三家：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;DeepSeek（深度求索）&lt;/strong&gt;：推理、数学、代码领域的王者。采用 MoE（混合专家）架构，满血版 DeepSeek V4 Pro 有 861B 参数——但那是云端模型，本地根本跑不了。我们本地能用的是 R1 蒸馏系列：把满血模型的推理能力&amp;quot;蒸馏&amp;quot;进 1.5B 到 32B 的小模型里，性能远超同参数量的普通模型。DeepSeek V4 Flash 版 158B 参数的 API 调用价格仅 0.28 美元/百万 token，是目前性价比最高的云端模型之一。但本地部署用 R1 蒸馏版，7B 仅需 4.7GB 显存，效果已经非常能打。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Qwen（通义千问）&lt;/strong&gt;：多语言能力最强，支持 119 种语言，中文效果极佳。最大优势是覆盖全：从 0.6B 到 235B 全系覆盖，树莓派上都能跑 4B 版本。生态最完善，量化版本最丰富。在 RTX 4090 上实测，Qwen3:0.6b 推理速度达 280 tokens/s，4b 也有 107 tokens/s，8b 为 69 tokens/s——速度表现是三家里最快的。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;GLM（智谱）&lt;/strong&gt;：中英双语专精，长文本（32K 上下文）处理能力强，GLM-5.1 满血版 753B 参数也是云端模型。本地能跑的是 GLM-4:9b，5.5GB Q4 量化即可运行。在长文本摘要、中英翻译、专业文档分析场景下，GLM-4 的表现超出其参数量预期。&lt;/p&gt;
&lt;p&gt;为什么不用 Llama 或 Mistral？两个原因：中文支持弱，而且它们不是国产。这篇文章就是写给想用国产模型的人。&lt;/p&gt;
&lt;h2 id="二5-分钟装好-ollama"&gt;二、5 分钟装好 Ollama
&lt;/h2&gt;&lt;p&gt;Ollama 是目前最简单的本地大模型运行工具。三平台一行命令：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# macOS / Linux&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;curl -fsSL https://ollama.com/install.sh &lt;span class="p"&gt;|&lt;/span&gt; sh
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# Windows&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 官网下载 OllamaSetup.exe，双击安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;装完验证：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama --version
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 应显示版本号，无 Warning&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;第一个坑：默认装在 C 盘。&lt;/strong&gt; Windows 用户装完会发现模型默认存在 &lt;code&gt;C:\Users\你的用户名\.ollama\models&lt;/code&gt;，几十 GB 很快吃满系统盘。解决方法：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 设置环境变量后重启 Ollama 服务&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# Windows: 系统环境变量添加 OLLAMA_MODELS=D:\ollama-models&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# Linux: export OLLAMA_MODELS=/data/ollama-models&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;ollama pull 和 ollama run 的区别&lt;/strong&gt;：&lt;code&gt;pull&lt;/code&gt; 只下载不启动，&lt;code&gt;run&lt;/code&gt; 下载后直接进入对话。第一次用建议先 &lt;code&gt;pull&lt;/code&gt;，确认下载完成再 &lt;code&gt;run&lt;/code&gt;，避免网络中断导致模型损坏。下载支持断点续传——如果中途断了，重新执行 &lt;code&gt;ollama pull&lt;/code&gt; 会从断点继续，不需要从头来。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;下载速度提示&lt;/strong&gt;：Ollama 的模型仓库（registry）在国内网络环境下直连速度约 4-5MB/s，第一次下载大模型需要耐心。不要中途 Ctrl+C，让它跑完。&lt;/p&gt;
&lt;h2 id="三显存分级选型指南核心章节"&gt;三、显存分级选型指南（核心章节）
&lt;/h2&gt;&lt;p&gt;本地部署最重要的决策：你的显存能跑什么？这里有一个公式：&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;显存需求 ≈ 参数量(B) × 量化系数 + KV缓存开销&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;p&gt;Q4_K_M（4-bit 量化）的系数约为 0.7。以 7B 模型为例：7 × 0.7 ≈ 4.9GB 模型本体，加上上下文缓存，实际需要 6-7GB 显存。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;必须知道的事实：Ollama 的显存占用比 vLLM 多约 30-40%&lt;/strong&gt;，因为 Ollama 底层封装了 llama.cpp，有额外的运行时开销。同样的模型，vLLM 可能用 5GB，Ollama 要 7GB。这是易用性的代价。&lt;/p&gt;
&lt;h3 id="第一档集成显卡--8gb-内存贫民窟"&gt;第一档：集成显卡 / 8GB 内存（贫民窟）
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;数据&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;推荐模型&lt;/td&gt;
					&lt;td&gt;Qwen3:1.7b 或 Qwen3:0.6b&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;模型大小&lt;/td&gt;
					&lt;td&gt;1.4GB（0.6b）/ 2.5GB（1.7b Q4）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;预期速度&lt;/td&gt;
					&lt;td&gt;20-40 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;能干什么&lt;/td&gt;
					&lt;td&gt;简单问答、文本摘要、翻译&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;不能干什么&lt;/td&gt;
					&lt;td&gt;代码生成、复杂推理、长文本分析&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这个档位别指望太多，能跑起来就是胜利。&lt;/p&gt;
&lt;h3 id="第二档6-8gb-独立显卡"&gt;第二档：6-8GB 独立显卡
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;数据&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;推荐模型&lt;/td&gt;
					&lt;td&gt;Qwen3:4b（中文首选）、DeepSeek-R1:1.5b（推理入门）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;模型大小&lt;/td&gt;
					&lt;td&gt;2.5GB（Qwen3:4b Q4）/ 1.1GB（R1:1.5b）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;预期速度&lt;/td&gt;
					&lt;td&gt;40-107 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;能干什么&lt;/td&gt;
					&lt;td&gt;日常对话、文案写作、简单代码、翻译&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;不能干什么&lt;/td&gt;
					&lt;td&gt;复杂算法题、大型代码重构&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Qwen3:4b 实测可以跑到 107 tokens/s，日常使用完全够用。这是我推荐的&amp;quot;万金油&amp;quot;选择。&lt;/p&gt;
&lt;h3 id="第三档12-16gb-显存甜点区"&gt;第三档：12-16GB 显存（甜点区）
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;数据&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;推荐模型&lt;/td&gt;
					&lt;td&gt;DeepSeek-R1:7b、Qwen3:8b、GLM-4:9b&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;模型大小&lt;/td&gt;
					&lt;td&gt;4.7GB / 5.2GB / 5.5GB（均为 Q4_K_M）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;预期速度&lt;/td&gt;
					&lt;td&gt;40-70 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;能干什么&lt;/td&gt;
					&lt;td&gt;中等难度代码、数学推理、长文写作、多轮对话&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;不能干什么&lt;/td&gt;
					&lt;td&gt;70B 级别的复杂推理&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这是性价比最高的档位。DeepSeek-R1:7b 在 RTX 3060 12GB 上流畅推理，4.7GB 模型占用加 2GB 上下文缓存，总共不到 7GB，还有余量。&lt;/p&gt;
&lt;h3 id="第四档24gb-显存"&gt;第四档：24GB 显存
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;数据&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;推荐模型&lt;/td&gt;
					&lt;td&gt;DeepSeek-R1:32b、Qwen3:14b&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;模型大小&lt;/td&gt;
					&lt;td&gt;20GB（R1:32b）/ 9.3GB（Qwen3:14b）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;预期速度&lt;/td&gt;
					&lt;td&gt;30-60 tokens/s（32b）/ 70-120 tokens/s（14b）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;能干什么&lt;/td&gt;
					&lt;td&gt;高质量代码生成、复杂推理、专业领域分析&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;不能干什么&lt;/td&gt;
					&lt;td&gt;满血 671B 模型（需要 400GB+ 显存）&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;到了这个档位，R1:32b 的推理能力已经接近 GPT-4 水平，32B 蒸馏版是本地能跑的最大 R1 模型。&lt;/p&gt;
&lt;h2 id="四三模型实测对比"&gt;四、三模型实测对比
&lt;/h2&gt;&lt;p&gt;以下数据基于 RTX 4090 24GB，同一硬件、同一 prompt 的横向对比：&lt;/p&gt;
&lt;h3 id="推理速度tokensq4_k_m-量化"&gt;推理速度（token/s，Q4_K_M 量化）
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数量&lt;/th&gt;
					&lt;th&gt;模型大小&lt;/th&gt;
					&lt;th&gt;推理速度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3:4b&lt;/td&gt;
					&lt;td&gt;4B&lt;/td&gt;
					&lt;td&gt;2.5GB&lt;/td&gt;
					&lt;td&gt;107 t/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3:8b&lt;/td&gt;
					&lt;td&gt;8B&lt;/td&gt;
					&lt;td&gt;5.2GB&lt;/td&gt;
					&lt;td&gt;69 t/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek-R1:7b&lt;/td&gt;
					&lt;td&gt;7B&lt;/td&gt;
					&lt;td&gt;4.7GB&lt;/td&gt;
					&lt;td&gt;55 t/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-4:9b&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;5.5GB&lt;/td&gt;
					&lt;td&gt;48 t/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek-R1:14b&lt;/td&gt;
					&lt;td&gt;14B&lt;/td&gt;
					&lt;td&gt;9.0GB&lt;/td&gt;
					&lt;td&gt;35 t/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3:32b&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
					&lt;td&gt;20GB&lt;/td&gt;
					&lt;td&gt;22 t/s&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;速度跟参数量基本呈反比。但 DeepSeek-R1 系列因为推理时会输出思考过程，实际等待时间比纯速度数字更长。&lt;/p&gt;
&lt;h3 id="中文理解质量"&gt;中文理解质量
&lt;/h3&gt;&lt;p&gt;同一道题：&amp;ldquo;请解释量子纠缠，用小学生能听懂的话。&amp;rdquo;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Qwen3&lt;/strong&gt;：比喻贴切，用词自然，最像真人说话。中文确实是强项。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GLM-4&lt;/strong&gt;：准确但偏书面，有点像教科书。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;DeepSeek-R1&lt;/strong&gt;：先在思考链里推理了 200 多个 token，然后给出答案。答案质量最高，但等待时间长。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="代码生成"&gt;代码生成
&lt;/h3&gt;&lt;p&gt;同一题：&amp;ldquo;用 Python 写一个快速排序，加注释。&amp;rdquo;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;DeepSeek-R1:7b&lt;/strong&gt;：代码正确，注释详细，还主动给出了测试用例。推理过程耗时约 8 秒（包含思考链），但最终输出质量最高。这正是 R1 蒸馏的优势——推理能力被完整保留。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Qwen3:8b&lt;/strong&gt;：代码正确，注释简洁，3 秒出结果。日常使用完全够用。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GLM-4:9b&lt;/strong&gt;：代码正确，但格式略乱，缩进有不一致的地方。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="长文本处理"&gt;长文本处理
&lt;/h3&gt;&lt;p&gt;输入一篇 3000 字的技术文章，要求总结要点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;GLM-4:9b&lt;/strong&gt;：32K 上下文窗口的优势在这里体现，要点提取最完整，逻辑清晰。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Qwen3:8b&lt;/strong&gt;：摘要质量不错，但遗漏了一些次要要点。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;DeepSeek-R1:7b&lt;/strong&gt;：会先在思考链里梳理全文结构再输出，总结最深入，但耗时最长。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="如果只能装一个选谁"&gt;如果只能装一个，选谁？
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;日常对话 + 中文场景&lt;/strong&gt; → Qwen3:8b（速度和质量的最佳平衡）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;写代码 + 数学推理&lt;/strong&gt; → DeepSeek-R1:7b（推理质量碾压同级别）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;长文档分析&lt;/strong&gt; → GLM-4:9b（32K 上下文窗口最大）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;我的建议：先装 Qwen3:8b，用顺了再根据需求加装其他模型。Ollama 切换模型只需 &lt;code&gt;ollama run 模型名&lt;/code&gt;。&lt;/p&gt;
&lt;h2 id="五量化怎么选不踩坑"&gt;五、量化怎么选不踩坑
&lt;/h2&gt;&lt;p&gt;Ollama 默认下载的就是 Q4_K_M（4-bit）量化版本。但 Ollama 也支持其他量化级别：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;量化级别&lt;/th&gt;
					&lt;th&gt;每参数比特&lt;/th&gt;
					&lt;th&gt;7B 模型大小&lt;/th&gt;
					&lt;th&gt;质量损失&lt;/th&gt;
					&lt;th&gt;适用场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;~4.5 bit&lt;/td&gt;
					&lt;td&gt;4.7GB&lt;/td&gt;
					&lt;td&gt;约 5%&lt;/td&gt;
					&lt;td&gt;性价比之王，默认选择&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q5_K_M&lt;/td&gt;
					&lt;td&gt;~5.5 bit&lt;/td&gt;
					&lt;td&gt;5.7GB&lt;/td&gt;
					&lt;td&gt;约 2%&lt;/td&gt;
					&lt;td&gt;显存够就升级&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q8_0&lt;/td&gt;
					&lt;td&gt;8 bit&lt;/td&gt;
					&lt;td&gt;7.0GB&lt;/td&gt;
					&lt;td&gt;几乎无&lt;/td&gt;
					&lt;td&gt;追求极致质量&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;F16&lt;/td&gt;
					&lt;td&gt;16 bit&lt;/td&gt;
					&lt;td&gt;14GB&lt;/td&gt;
					&lt;td&gt;无损&lt;/td&gt;
					&lt;td&gt;调试/对比基准&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;Q4_K_M 为什么是性价王？&lt;/strong&gt; 因为它把模型压缩到原来的 30%，但质量只损失 5%。对绝大多数日常使用场景，你根本感受不到差别。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;量化的&amp;quot;看不见的代价&amp;quot;&lt;/strong&gt;：在简单任务上（翻译、摘要）几乎无感，但在复杂推理任务上（多步数学推导、长链代码逻辑），Q4 相比 F16 的差距会被放大。如果你用模型做复杂推理，建议上 Q5_K_M 或 Q8_0。&lt;/p&gt;
&lt;p&gt;手动指定量化版本：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 下载 Q5_K_M 版本&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama pull qwen3:8b-q5_K_M
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 下载 Q8 版本&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama pull deepseek-r1:7b-q8_0
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h2 id="六常见踩坑与排障"&gt;六、常见踩坑与排障
&lt;/h2&gt;&lt;h3 id="坑-1oom-崩溃"&gt;坑 1：OOM 崩溃
&lt;/h3&gt;&lt;p&gt;报错 &lt;code&gt;CUDA out of memory&lt;/code&gt; 或程序直接闪退。先判断是显存不够还是内存不够：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 查看显存使用（NVIDIA）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;nvidia-smi
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 查看内存使用&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;free -h &lt;span class="c1"&gt;# Linux&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# Windows: 任务管理器 → 性能 → 内存&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;如果 &lt;code&gt;nvidia-smi&lt;/code&gt; 显示显存占用 95%+，说明模型太大，换小一号。如果内存也快满了，说明上下文太长，减小 &lt;code&gt;num_ctx&lt;/code&gt; 参数。&lt;/p&gt;
&lt;h3 id="坑-2选了-70b-发现-16gb-根本跑不起来"&gt;坑 2：选了 70B 发现 16GB 根本跑不起来
&lt;/h3&gt;&lt;p&gt;这是一个常见误区：参数越大越好。70B 模型 Q4 量化后需要 43GB 显存，RTX 4090 24GB 都扛不住。它会自动降速到 CPU 推理，速度从 50 tokens/s 暴跌到 2 tokens/s，基本不可用。&lt;/p&gt;
&lt;p&gt;我见过太多人下载了 deepseek-r1:671b（404GB），等了半天下载完，跑起来一个字要等 10 秒。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;记住：选模型的第一标准是你的显存，不是&amp;quot;越大越好&amp;quot;。&lt;/strong&gt; 参数量翻倍，推理能力提升可能只有 10-15%，但显存需求翻倍，速度腰斩。32B 蒸馏版已经能覆盖绝大多数使用场景。&lt;/p&gt;
&lt;h3 id="坑-3中文输出乱码或英文-fallback"&gt;坑 3：中文输出乱码或英文 fallback
&lt;/h3&gt;&lt;p&gt;部分模型在上下文较短时会混入英文回答。解决方法：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 在 Modelfile 里设置系统提示&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama create my-qwen -f - &lt;span class="s"&gt;&amp;lt;&amp;lt; &amp;#39;EOF&amp;#39;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;FROM qwen3:8b
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;SYSTEM &amp;#34;你是一个中文助手，请始终用中文回答。&amp;#34;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;EOF&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h3 id="坑-4速度优化"&gt;坑 4：速度优化
&lt;/h3&gt;&lt;p&gt;三个有效的优化手段：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;确保 GPU offload 开启&lt;/strong&gt;：Ollama 默认自动 offload，但如果你的 CUDA 驱动版本不对，会静默回退到 CPU。检查 &lt;code&gt;nvidia-smi&lt;/code&gt; 在推理时是否有显存占用。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;控制上下文长度&lt;/strong&gt;：默认 2048 token，长对话会吃掉大量 KV 缓存显存。如果不需要长上下文，别开太大。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;别同时加载多个模型&lt;/strong&gt;：Ollama 默认 5 分钟后卸载空闲模型，但如果频繁切换，多个模型同时驻留显存会导致 OOM。&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="关于-ollama-的安全通报"&gt;关于 Ollama 的安全通报
&lt;/h3&gt;&lt;p&gt;2025 年 Ollama 曾出现在国家网络漏洞通报中（CVE 评估），主要涉及本地 API 端口暴露问题。Ollama 默认监听 &lt;code&gt;127.0.0.1:11434&lt;/code&gt;，只要不手动改成 &lt;code&gt;0.0.0.0&lt;/code&gt; 暴露到公网，风险可控。如果你需要远程访问，建议用 SSH 隧道而非直接暴露端口。&lt;/p&gt;
&lt;h2 id="七进阶接进你的代码"&gt;七、进阶——接进你的代码
&lt;/h2&gt;&lt;p&gt;本地部署的模型如果只是命令行聊天，那就是个高级玩具。真正有用的是接进你的工作流。&lt;/p&gt;
&lt;p&gt;Ollama 提供 OpenAI 兼容 API，一行代码就能调用：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt; 1
&lt;/span&gt;&lt;span class="lnt"&gt; 2
&lt;/span&gt;&lt;span class="lnt"&gt; 3
&lt;/span&gt;&lt;span class="lnt"&gt; 4
&lt;/span&gt;&lt;span class="lnt"&gt; 5
&lt;/span&gt;&lt;span class="lnt"&gt; 6
&lt;/span&gt;&lt;span class="lnt"&gt; 7
&lt;/span&gt;&lt;span class="lnt"&gt; 8
&lt;/span&gt;&lt;span class="lnt"&gt; 9
&lt;/span&gt;&lt;span class="lnt"&gt;10
&lt;/span&gt;&lt;span class="lnt"&gt;11
&lt;/span&gt;&lt;span class="lnt"&gt;12
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="nn"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;http://localhost:11434/v1&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;ollama&amp;#34;&lt;/span&gt; &lt;span class="c1"&gt;# 随便填，本地不需要认证&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;qwen3:8b&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[{&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;role&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;user&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;content&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;用一句话解释什么是递归&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;}]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nb"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;这意味着什么？所有支持 OpenAI API 的工具——代码编辑器插件、知识库系统、自动化脚本——只要把 API 地址从 &lt;code&gt;api.openai.com&lt;/code&gt; 改成 &lt;code&gt;localhost:11434&lt;/code&gt;，就能用本地模型替代付费 API。&lt;/p&gt;
&lt;p&gt;比如在 VS Code 的 Continue 插件里配置本地模型：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-json" data-lang="json"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;models&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;title&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;Local Qwen3&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;provider&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;openai&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;model&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;qwen3:8b&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;apiBase&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;http://localhost:11434/v1&amp;#34;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="p"&gt;}]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;零成本、零延迟、数据不出本机。这才是本地部署的意义——不是把模型装上就完事，而是把它变成你日常工具链的一部分。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;以上就是全部内容。总结一下：8GB 装 Qwen3:4b，12GB 装 DeepSeek-R1:7b，16GB 以上看需求选 14b 级别。量化用默认 Q4_K_M 就行。装完记得接进代码里用起来，别让它吃灰。&lt;/p&gt;</description></item></channel></rss>