<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>本地部署 on Kalend's Blog</title><link>https://blog.kalend.top/tags/%E6%9C%AC%E5%9C%B0%E9%83%A8%E7%BD%B2/</link><description>Recent content in 本地部署 on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Fri, 24 Jul 2026 08:30:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/tags/%E6%9C%AC%E5%9C%B0%E9%83%A8%E7%BD%B2/index.xml" rel="self" type="application/rss+xml"/><item><title>AI Agent的'遗忘症'怎么治？三层方案从金鱼脑到长期记忆</title><link>https://blog.kalend.top/2026/07/24/2026-07-24-agent-memory-implementation.html/</link><pubDate>Fri, 24 Jul 2026 08:30:00 +0800</pubDate><guid>https://blog.kalend.top/2026/07/24/2026-07-24-agent-memory-implementation.html/</guid><description>&lt;p&gt;先说结论：三层方案能治，且完全免费本地运行。&lt;/p&gt;
&lt;p&gt;你一定经历过这种崩溃——跟AI说了一百遍&amp;quot;代码用TypeScript不要JavaScript&amp;quot;，换个对话窗口它又问你用什么语言。你跟它讲过的项目背景、踩过的坑、你的审美偏好，下次全部归零。&lt;/p&gt;
&lt;p&gt;这不是模型的问题，是架构的问题。LLM天生没有状态，context window有物理上限，窗口关了记忆就没了。之前分析过记忆架构的理论框架，今天直接上手搭——三层方案，从热记忆到语义搜索到知识图谱，照着做就能跑通。&lt;/p&gt;
&lt;h2 id="为什么大多数ai助手是金鱼脑"&gt;为什么大多数AI助手是&amp;quot;金鱼脑&amp;quot;
&lt;/h2&gt;&lt;p&gt;先搞清楚病因。&lt;/p&gt;
&lt;p&gt;LLM是无状态函数——输入token，输出token，没有内部记忆寄存器。你的&amp;quot;对话历史&amp;quot;就是每次请求时把前面的内容重新塞进context window发给模型。这就是为什么窗口越来越大（从4K到128K到1M），但问题没有根本解决：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;限制&lt;/th&gt;
					&lt;th&gt;表现&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;物理上限&lt;/td&gt;
					&lt;td&gt;128K窗口大约装10万字中文，一个复杂项目的完整上下文轻松超限&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;成本线性增长&lt;/td&gt;
					&lt;td&gt;token越多越贵，1M窗口一次调用可能几块钱&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;信息衰减&lt;/td&gt;
					&lt;td&gt;&amp;ldquo;Lost in the Middle&amp;quot;效应——中间的信息被遗忘，首尾偏好&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;跨会话断连&lt;/td&gt;
					&lt;td&gt;关掉对话窗口，一切归零&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;那向量检索（RAG）呢？它解决了&amp;quot;找不到&amp;quot;的问题，但没解决&amp;quot;记不准&amp;quot;的问题。向量检索的本质是模糊联想——你问&amp;quot;上次那个数据库迁移方案&amp;rdquo;，它能找到语义相近的段落，但找不到你说的那一个精确段落。而且它没有结构化能力：&amp;ldquo;张三负责后端、李四负责前端&amp;quot;这种关系型信息，向量检索搞不定。&lt;/p&gt;
&lt;p&gt;所以需要多层方案。每一层解决不同的问题。&lt;/p&gt;
&lt;h2 id="第一层热记忆每轮都带上你的核心信息"&gt;第一层：热记忆——每轮都带上你的核心信息
&lt;/h2&gt;&lt;p&gt;热记忆是最简单也最有效的一层。原理很直白：把最重要的信息写进一个固定文本段，每次对话开始时自动注入到system prompt里。&lt;/p&gt;
&lt;h3 id="载体和格式"&gt;载体和格式
&lt;/h3&gt;&lt;p&gt;热记忆通常存在一个markdown文件里，比如这样：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt; 1
&lt;/span&gt;&lt;span class="lnt"&gt; 2
&lt;/span&gt;&lt;span class="lnt"&gt; 3
&lt;/span&gt;&lt;span class="lnt"&gt; 4
&lt;/span&gt;&lt;span class="lnt"&gt; 5
&lt;/span&gt;&lt;span class="lnt"&gt; 6
&lt;/span&gt;&lt;span class="lnt"&gt; 7
&lt;/span&gt;&lt;span class="lnt"&gt; 8
&lt;/span&gt;&lt;span class="lnt"&gt; 9
&lt;/span&gt;&lt;span class="lnt"&gt;10
&lt;/span&gt;&lt;span class="lnt"&gt;11
&lt;/span&gt;&lt;span class="lnt"&gt;12
&lt;/span&gt;&lt;span class="lnt"&gt;13
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-markdown" data-lang="markdown"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="gu"&gt;## 用户偏好
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;-&lt;/span&gt; 代码语言：TypeScript，禁止JavaScript
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;-&lt;/span&gt; 回复风格：先结论后细节，不要铺垫
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;-&lt;/span&gt; 禁止行为：不要用emoji，不要加&amp;#34;首先&amp;#34;/&amp;#34;其次&amp;#34;连接词
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="gu"&gt;## 环境信息
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;-&lt;/span&gt; 操作系统：Debian 13，内核6.12
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;-&lt;/span&gt; 部署方式：Docker Compose，compose文件在~/infra/
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;-&lt;/span&gt; 数据库：PostgreSQL 16，连接串在.env
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="gu"&gt;## 高频踩坑
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;-&lt;/span&gt; Hugo日期必须RFC3339格式，否则日期变0001-01-01
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;-&lt;/span&gt; 又拍云API只支持HMAC-SHA1签名，不支持Basic Auth
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h3 id="工作原理"&gt;工作原理
&lt;/h3&gt;&lt;p&gt;每轮对话开始时，系统把这段内容注入到system prompt中。模型看到的不是&amp;quot;你是一个通用助手&amp;rdquo;，而是&amp;quot;你是一个帮忞写代码的助手，用TypeScript，先给结论，不要emoji&amp;quot;。&lt;/p&gt;
&lt;p&gt;这就是热记忆的核心——&lt;strong&gt;每轮都带上的上下文常量&lt;/strong&gt;。&lt;/p&gt;
&lt;h3 id="怎么写怎么更新"&gt;怎么写、怎么更新
&lt;/h3&gt;&lt;p&gt;写热记忆的原则：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;只放高频信息&lt;/strong&gt;。你的项目结构、技术栈、编码习惯——每次对话都需要的&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;控制在2000字符以内&lt;/strong&gt;。热记忆占用context window，太长浪费token&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用结构化格式&lt;/strong&gt;。分块（用户偏好/环境/踩坑），用列表不用段落&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;定期清理&lt;/strong&gt;。过时的信息及时删除，否则会&amp;quot;污染&amp;quot;新对话&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;更新方式：手动编辑文件，或者在对话中告诉AI&amp;quot;记住XXX&amp;quot;，它会自动更新热记忆段。&lt;/p&gt;
&lt;h3 id="适用场景"&gt;适用场景
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;场景&lt;/th&gt;
					&lt;th&gt;是否适合热记忆&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;用户编码偏好&lt;/td&gt;
					&lt;td&gt;✅ 高频、稳定、短文本&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;高频踩坑记录&lt;/td&gt;
					&lt;td&gt;✅ 避免重复犯错&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;项目架构概览&lt;/td&gt;
					&lt;td&gt;⚠️ 可以放摘要，细节放其他层&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;历史对话记录&lt;/td&gt;
					&lt;td&gt;❌ 太长，放不下&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;人物关系网络&lt;/td&gt;
					&lt;td&gt;❌ 结构化信息，需要图谱&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;热记忆是第一道防线，解决80%的&amp;quot;又忘了&amp;quot;问题。但它的容量有限，跨会话的深度信息需要更深的存储。&lt;/p&gt;
&lt;h2 id="第二层语义搜索跨会话的长期记忆"&gt;第二层：语义搜索——跨会话的&amp;quot;长期记忆&amp;quot;
&lt;/h2&gt;&lt;p&gt;当信息量超过热记忆的容量限制，或者你需要查找历史对话中的某个细节时，就需要语义搜索层。&lt;/p&gt;
&lt;p&gt;这一层的核心是向量数据库——把文本切块、转成向量、存入数据库，查询时用语义相似度匹配。&lt;/p&gt;
&lt;h3 id="为什么不用传统搜索"&gt;为什么不用传统搜索
&lt;/h3&gt;&lt;p&gt;传统搜索（grep、全文检索）是精确匹配。你搜&amp;quot;数据库迁移&amp;quot;，它只找包含这几个字的段落。但用户可能说的是&amp;quot;把MySQL换成PostgreSQL那件事&amp;quot;——语义一样，措辞完全不同。&lt;/p&gt;
&lt;p&gt;向量搜索解决的就是这个问题。它把文本编码成高维向量，语义相近的文本在向量空间中距离更近。&lt;/p&gt;
&lt;h3 id="实际工具怎么用"&gt;实际工具怎么用
&lt;/h3&gt;&lt;p&gt;以MemPalace为例（57.6k stars，本地免费，ChromaDB底层）：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;存储信息&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_store&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;wing&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;devops&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="c1"&gt;# 域/分类&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;room&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;hugo-blog&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="c1"&gt;# 主题/子分类&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;Hugo日期必须用RFC3339格式(2026-05-14T10:00:00+08:00)，否则日期变0001-01-01&amp;#34;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;语义搜索&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_recall&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;query&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;Hugo日期格式问题&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;wing&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;devops&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="c1"&gt;# 可选，限定搜索范围&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;top_k&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;5&lt;/span&gt; &lt;span class="c1"&gt;# 返回最相关的5条&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;搜索结果包含文本内容、相似度分数、来源wing/room，可以按相关性排序后注入到当前对话中。&lt;/p&gt;
&lt;h3 id="组织结构wing-room-drawer"&gt;组织结构：Wing-Room-Drawer
&lt;/h3&gt;&lt;p&gt;MemPalace用三层结构组织信息：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Wing（域）→ Room（主题）→ Drawer（条目）
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;───────────────────────────────────────
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;devops/ hugo-blog/ Hugo日期格式踩坑
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; 又拍云API签名问题
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; docker/ Compose网络配置
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;user/ preferences/ 编码风格偏好
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; background/ 技术背景
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;conversation/ general/ 历史对话摘要
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;这种结构的好处是搜索时可以限定范围——搜Hugo相关的问题只在&lt;code&gt;devops/hugo-blog&lt;/code&gt;里找，不会被无关信息干扰。&lt;/p&gt;
&lt;h3 id="容量和性能"&gt;容量和性能
&lt;/h3&gt;&lt;p&gt;当前实际运行数据：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;指标&lt;/th&gt;
					&lt;th&gt;数值&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;总Drawer数&lt;/td&gt;
					&lt;td&gt;21,986&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Wing数&lt;/td&gt;
					&lt;td&gt;14&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;底层存储&lt;/td&gt;
					&lt;td&gt;ChromaDB（本地SQLite）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;单次查询延迟&lt;/td&gt;
					&lt;td&gt;&amp;lt;100ms&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;存储成本&lt;/td&gt;
					&lt;td&gt;零（纯本地）&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;2万多个drawer，查询依然在100毫秒内完成。这就是向量数据库的优势——检索时间不随数据量线性增长。&lt;/p&gt;
&lt;h3 id="适用场景-1"&gt;适用场景
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;场景&lt;/th&gt;
					&lt;th&gt;是否适合语义搜索&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;查找历史对话&lt;/td&gt;
					&lt;td&gt;✅ 语义匹配，模糊查询&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;技术记录检索&lt;/td&gt;
					&lt;td&gt;✅ 按wing/room分类存储&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;项目详情&lt;/td&gt;
					&lt;td&gt;✅ 长文本切块后存储&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;精确关系查询&lt;/td&gt;
					&lt;td&gt;❌ &amp;ldquo;谁负责后端&amp;quot;这种结构化问题&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;时间序列分析&lt;/td&gt;
					&lt;td&gt;❌ 需要专门的时间窗口支持&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;语义搜索解决了&amp;quot;跨会话的深度记忆&amp;quot;问题，但它的底层还是文本匹配。当你需要查询结构化的关系信息——&amp;ldquo;项目A现在的状态是什么&amp;rdquo;、&amp;ldquo;张三和李四什么关系&amp;rdquo;——就需要知识图谱。&lt;/p&gt;
&lt;h2 id="第三层知识图谱结构化的关系网络"&gt;第三层：知识图谱——结构化的&amp;quot;关系网络&amp;rdquo;
&lt;/h2&gt;&lt;p&gt;向量搜索是模糊匹配，知识图谱是精确查询。&lt;/p&gt;
&lt;p&gt;知识图谱的核心是三元组：&lt;strong&gt;Subject → Predicate → Object&lt;/strong&gt;。比如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;忞 → 负责 → 博客系统
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;博客系统 → 使用 → Hugo + Stack主题
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;博客系统 → 部署到 → 又拍云CDN
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;忞 → 偏好 → TypeScript
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;这种结构让查询变得精确——&amp;ldquo;忞负责什么？&amp;ldquo;直接返回&amp;quot;博客系统&amp;rdquo;，不需要语义匹配。&lt;/p&gt;
&lt;h3 id="时间窗口自动废止旧事实"&gt;时间窗口：自动废止旧事实
&lt;/h3&gt;&lt;p&gt;知识图谱最容易出的问题是信息过时。&amp;ldquo;张三负责后端&amp;rdquo;，三个月后张三离职了，旧事实还在图谱里，查出来就是错的。&lt;/p&gt;
&lt;p&gt;解决方案是时间窗口——每条三元组都有&lt;code&gt;valid_from&lt;/code&gt;和&lt;code&gt;valid_to&lt;/code&gt;字段：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt; 1
&lt;/span&gt;&lt;span class="lnt"&gt; 2
&lt;/span&gt;&lt;span class="lnt"&gt; 3
&lt;/span&gt;&lt;span class="lnt"&gt; 4
&lt;/span&gt;&lt;span class="lnt"&gt; 5
&lt;/span&gt;&lt;span class="lnt"&gt; 6
&lt;/span&gt;&lt;span class="lnt"&gt; 7
&lt;/span&gt;&lt;span class="lnt"&gt; 8
&lt;/span&gt;&lt;span class="lnt"&gt; 9
&lt;/span&gt;&lt;span class="lnt"&gt;10
&lt;/span&gt;&lt;span class="lnt"&gt;11
&lt;/span&gt;&lt;span class="lnt"&gt;12
&lt;/span&gt;&lt;span class="lnt"&gt;13
&lt;/span&gt;&lt;span class="lnt"&gt;14
&lt;/span&gt;&lt;span class="lnt"&gt;15
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 添加事实&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_kg_add&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;subject&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;张三&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;predicate&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;负责&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nb"&gt;object&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;后端服务&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;valid_from&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;2026-01&amp;#34;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 后来张三离职了，废止旧事实&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_kg_invalidate&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;subject&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;张三&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;predicate&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;负责&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nb"&gt;object&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;后端服务&amp;#34;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# valid_to 自动设为今天&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;查询时只返回当前有效的事实（valid_to为空或大于今天），过时的信息自动过滤。&lt;/p&gt;
&lt;h3 id="实际使用场景"&gt;实际使用场景
&lt;/h3&gt;&lt;p&gt;&lt;strong&gt;场景1：追踪人物关系&lt;/strong&gt;&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 记录团队分工&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_kg_add&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;subject&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;张三&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;predicate&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;负责&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nb"&gt;object&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;后端API&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_kg_add&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;subject&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;李四&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;predicate&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;负责&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nb"&gt;object&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;前端React&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_kg_add&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;subject&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;项目Alpha&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;predicate&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;后端负责人&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nb"&gt;object&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;张三&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 查询：谁负责后端？&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_knowledge&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;entity&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;后端API&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# → 张三 → 负责 → 后端API&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;场景2：追踪项目状态变化&lt;/strong&gt;&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 项目状态随时间变化&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_kg_add&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;subject&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;项目Alpha&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;predicate&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;状态&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nb"&gt;object&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;开发中&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;valid_from&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;2026-01&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_kg_invalidate&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;subject&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;项目Alpha&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;predicate&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;状态&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nb"&gt;object&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;开发中&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_kg_add&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;subject&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;项目Alpha&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;predicate&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;状态&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nb"&gt;object&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;测试中&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;valid_from&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;2026-04&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;场景3：技术栈关系&lt;/strong&gt;&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_kg_add&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;subject&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;博客系统&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;predicate&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;使用框架&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nb"&gt;object&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;Hugo&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_kg_add&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;subject&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;博客系统&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;predicate&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;使用主题&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nb"&gt;object&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;Stack&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_kg_add&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;subject&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;博客系统&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;predicate&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;托管平台&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nb"&gt;object&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;又拍云&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_kg_add&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;subject&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;Stack主题&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;predicate&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;依赖&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nb"&gt;object&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;Hugo 0.144+&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 查询：博客系统的依赖链是什么？&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;mempalace_knowledge&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;entity&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;博客系统&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# → 返回所有相关三元组&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h3 id="何时该用知识图谱何时不该"&gt;何时该用知识图谱，何时不该
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;场景&lt;/th&gt;
					&lt;th&gt;用知识图谱&lt;/th&gt;
					&lt;th&gt;用语义搜索&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&amp;ldquo;谁负责后端&amp;rdquo;&lt;/td&gt;
					&lt;td&gt;✅ 精确关系&lt;/td&gt;
					&lt;td&gt;❌ 模糊匹配不准&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&amp;ldquo;上次聊了什么&amp;rdquo;&lt;/td&gt;
					&lt;td&gt;❌ 不适合文本&lt;/td&gt;
					&lt;td&gt;✅ 语义匹配&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&amp;ldquo;项目状态历史&amp;rdquo;&lt;/td&gt;
					&lt;td&gt;✅ 时间窗口&lt;/td&gt;
					&lt;td&gt;❌ 无时间概念&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&amp;ldquo;技术文档查询&amp;rdquo;&lt;/td&gt;
					&lt;td&gt;❌ 结构化太重&lt;/td&gt;
					&lt;td&gt;✅ 文本匹配&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&amp;ldquo;依赖关系链&amp;rdquo;&lt;/td&gt;
					&lt;td&gt;✅ 图遍历&lt;/td&gt;
					&lt;td&gt;❌ 无法表达关系&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;简单判断：如果查询里有&amp;quot;谁/什么/关系/状态/版本&amp;quot;这种结构化关键词，用知识图谱。如果是&amp;quot;上次/记得/聊过/说过&amp;quot;这种模糊回忆，用语义搜索。&lt;/p&gt;
&lt;h2 id="四级回忆链怎么把三层串起来"&gt;四级回忆链：怎么把三层串起来
&lt;/h2&gt;&lt;p&gt;三层不是独立工作的，它们形成一个级联回忆链：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;热记忆（每轮自动注入）
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; ↓ 没找到？
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;MemPalace语义搜索（按需查询）
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; ↓ 还没找到？
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;session_search（跨会话精确搜索）
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; ↓ 最后手段
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;结构化文件搜索（grep/全文检索）
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;决策逻辑很简单：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;热记忆&lt;/strong&gt;：高频、稳定、短文本——每次自动带上，不需要主动查询&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;语义搜索&lt;/strong&gt;：中频、长文本、需要模糊匹配——用户提到某个话题时触发&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;session_search&lt;/strong&gt;：低频、需要精确匹配某个历史对话——明确要求时触发&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;文件搜索&lt;/strong&gt;：兜底——其他方式都找不到时，直接grep源文件&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这个级联的效率在于：热记忆零成本（已经注入了），语义搜索100ms内返回，session_search秒级，文件搜索最慢但最全。90%的需求在前两层就解决了。&lt;/p&gt;
&lt;h3 id="遗忘机制"&gt;遗忘机制
&lt;/h3&gt;&lt;p&gt;记忆系统不仅要能记，还要能忘。过时的信息如果不清理，会造成&amp;quot;记忆污染&amp;rdquo;——AI带着过期信息做决策，比没有记忆更糟糕。&lt;/p&gt;
&lt;p&gt;三种遗忘机制：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;机制&lt;/th&gt;
					&lt;th&gt;触发方式&lt;/th&gt;
					&lt;th&gt;作用&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;kg_invalidate&lt;/td&gt;
					&lt;td&gt;手动标记&lt;/td&gt;
					&lt;td&gt;知识图谱中的事实失效，设valid_to=今天&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;热记忆清理&lt;/td&gt;
					&lt;td&gt;定期审计&lt;/td&gt;
					&lt;td&gt;删除过时的高频信息，释放context空间&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;sync清理&lt;/td&gt;
					&lt;td&gt;文件删除后同步&lt;/td&gt;
					&lt;td&gt;删除源文件时自动清理对应的存储条目&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="避坑指南"&gt;避坑指南
&lt;/h2&gt;&lt;h3 id="坑1过早上知识图谱"&gt;坑1：过早上知识图谱
&lt;/h3&gt;&lt;p&gt;最常见的错误。需求还没验证就建复杂系统——三元组设计了一百个关系类型，实际只用到三个。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;正确做法&lt;/strong&gt;：先用热记忆+语义搜索跑一个月，确认确实有结构化查询需求，再加知识图谱。三层方案是渐进式的，不是一步到位的。&lt;/p&gt;
&lt;h3 id="坑2记忆污染"&gt;坑2：记忆污染
&lt;/h3&gt;&lt;p&gt;跨会话的过时信息混入当前对话。比如三个月前记录的&amp;quot;项目状态：开发中&amp;quot;，现在已经是&amp;quot;已上线&amp;quot;了，但没有及时更新。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;正确做法&lt;/strong&gt;：给信息打时间戳，定期审计，用kg_invalidate废止过时事实。热记忆更要频繁清理——它每轮都注入，过时信息的伤害最大。&lt;/p&gt;
&lt;h3 id="坑3热记忆膨胀"&gt;坑3：热记忆膨胀
&lt;/h3&gt;&lt;p&gt;什么都往热记忆里塞，2000字符变成5000字符，再变成10000字符。结果context window被记忆占了大半，留给实际对话的空间不够了。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;正确做法&lt;/strong&gt;：热记忆只放&amp;quot;每轮都需要&amp;quot;的信息。&amp;ldquo;偶尔用到的&amp;quot;放语义搜索，&amp;ldquo;结构性的&amp;quot;放知识图谱。一个判断标准：如果这条信息连续5轮对话都没被用到，就不该在热记忆里。&lt;/p&gt;
&lt;h3 id="坑4向量检索的记忆泡沫"&gt;坑4：向量检索的&amp;quot;记忆泡沫&amp;rdquo;
&lt;/h3&gt;&lt;p&gt;向量搜索返回的结果看着相关，但实际上是噪声。比如你问&amp;quot;数据库性能优化&amp;rdquo;，它返回了&amp;quot;数据库备份方案&amp;quot;——语义相近但不是你要的。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;正确做法&lt;/strong&gt;：用wing/room限定搜索范围，设置相似度阈值过滤低质量结果。语义搜索是召回，不是精确匹配，返回结果需要二次筛选。&lt;/p&gt;
&lt;h2 id="落地建议最小可用方案"&gt;落地建议：最小可用方案
&lt;/h2&gt;&lt;p&gt;不需要三层一步到位。推荐的渐进路线：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第一周：只用热记忆&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;把用户偏好、技术栈、高频踩坑写进热记忆段，2000字符以内。这一层零成本，立即见效。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第二周：加入语义搜索&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;安装MemPalace（本地ChromaDB，不需要API Key），开始把重要对话、技术记录存进去。配置wing/room分类结构。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第三周：按需加知识图谱&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;如果发现经常需要查询&amp;quot;谁负责什么&amp;quot;、&amp;ldquo;项目状态&amp;rdquo;、&amp;ldquo;依赖关系&amp;quot;这种结构化信息，再加知识图谱层。不需要就不加。&lt;/p&gt;
&lt;p&gt;整个方案完全本地运行，不需要任何云服务、API Key或月费。MemPalace底层是ChromaDB（SQLite），数据存在本地磁盘，隐私完全可控。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;记忆系统的终点不是&amp;quot;记住&amp;rdquo;，而是&amp;quot;学会&amp;quot;。&lt;/p&gt;
&lt;p&gt;三层方案解决的是信息的存储和检索，但真正有价值的是从记忆中提取规律、变成行为。热记忆让你不用重复解释偏好，语义搜索让你不用重复查找历史，知识图谱让你不用重复梳理关系。&lt;/p&gt;
&lt;p&gt;把这些省下来的时间和精力，用在真正需要创造力的地方。&lt;/p&gt;
&lt;p&gt;— varkm&lt;/p&gt;</description></item><item><title>一张4090能跑GLM-5.2还是Qwen3-32B？国产大模型本地部署2026版</title><link>https://blog.kalend.top/2026/07/23/2026-07-23-4090-local-model-deploy.html/</link><pubDate>Thu, 23 Jul 2026 08:30:00 +0800</pubDate><guid>https://blog.kalend.top/2026/07/23/2026-07-23-4090-local-model-deploy.html/</guid><description>&lt;p&gt;先说结论：4090 跑不了 GLM-5.2，Qwen3-30B-A3B 才是你的甜区。&lt;/p&gt;
&lt;p&gt;GLM-5.2 是 744B 参数的 MoE 模型，哪怕 2-bit 量化也要 238GB 显存，4090 的 24GB 连零头都不够。别折腾了，老老实实调 API。&lt;/p&gt;
&lt;p&gt;但 4090 并不是废物。2026 年国产大模型格局变了，MoE 架构让小显存也能跑大模型。一张 4090，能跑的东西比你想的多。&lt;/p&gt;
&lt;h2 id="4090-的-24gb-显存2026-年能跑什么"&gt;4090 的 24GB 显存，2026 年能跑什么？
&lt;/h2&gt;&lt;p&gt;2026 年国产大模型三足鼎立：DeepSeek V4、GLM-5.2、Qwen3。&lt;/p&gt;
&lt;p&gt;但「能发布」和「能本地跑」是两回事。4090 的 24GB 显存有硬天花板：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;量化方案&lt;/th&gt;
					&lt;th&gt;显存需求上限&lt;/th&gt;
					&lt;th&gt;能跑的最大模型&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~12B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;INT8&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~24B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;INT4/Q4_K_M&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~32B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;2-bit&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~48B（质量严重下降）&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;关键点：MoE 模型虽然只激活部分参数，但推理时需要加载&lt;strong&gt;全部权重&lt;/strong&gt;到显存。30B 总参 / 3B 激活的 MoE，显存需求按 30B 算，不是 3B。&lt;/p&gt;
&lt;p&gt;所以 4090 的实际天花板是：&lt;strong&gt;32B INT4 或 30B MoE Q4_K_M&lt;/strong&gt;。&lt;/p&gt;
&lt;h2 id="glm-52--744b-的看得到吃不到"&gt;GLM-5.2 — 744B 的&amp;quot;看得到吃不到&amp;quot;
&lt;/h2&gt;&lt;p&gt;GLM-5.2 是智谱 2026 年的旗舰模型：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;值&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;总参数&lt;/td&gt;
					&lt;td&gt;744B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;激活参数&lt;/td&gt;
					&lt;td&gt;~40B（MoE）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;MoE，256 个专家（每个 token 激活 8+1 个）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;2-bit 量化显存&lt;/td&gt;
					&lt;td&gt;238GB&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;4-bit 量化显存&lt;/td&gt;
					&lt;td&gt;~372GB&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;即使是最激进的 2-bit 量化（质量已经很差），也需要 238GB 显存。4090 的 24GB 只有它的十分之一。&lt;/p&gt;
&lt;p&gt;这个模型适合什么硬件？&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Mac Studio 256GB 统一内存&lt;/strong&gt;：勉强能跑 2-bit，速度慢但可用&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;多卡服务器&lt;/strong&gt;：4×A100 80GB 或 8×4090，用张量并行&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;云 GPU&lt;/strong&gt;：按小时租 A100/H100，适合偶尔用&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;4090 用户想用 GLM 系列，替代方案是：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;显存（FP16）&lt;/th&gt;
					&lt;th&gt;可用性&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-4-9B&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;✅ 4090 轻松跑&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-Z1-9B&lt;/td&gt;
					&lt;td&gt;9B（推理增强）&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;✅ 4090 轻松跑&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5.2 API&lt;/td&gt;
					&lt;td&gt;744B&lt;/td&gt;
					&lt;td&gt;无&lt;/td&gt;
					&lt;td&gt;✅ 按 token 付费&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;说实话，GLM-4-9B 和 GLM-Z1-9B 的能力跟 GLM-5.2 差了一个量级。如果你需要 GLM-5.2 级别的能力，调 API 是唯一现实选择。&lt;/p&gt;
&lt;h2 id="qwen3-30b-a3b--4090-的真正甜区"&gt;Qwen3-30B-A3B — 4090 的真正甜区
&lt;/h2&gt;&lt;p&gt;Qwen3 系列里，最适合 4090 的不是 Qwen3-32B，而是 Qwen3-30B-A3B。&lt;/p&gt;
&lt;p&gt;为什么？MoE 架构。&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;对比项&lt;/th&gt;
					&lt;th&gt;Qwen3-30B-A3B&lt;/th&gt;
					&lt;th&gt;Qwen3-32B&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;总参数&lt;/td&gt;
					&lt;td&gt;30B&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;激活参数&lt;/td&gt;
					&lt;td&gt;3B&lt;/td&gt;
					&lt;td&gt;32B（全量）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;MoE&lt;/td&gt;
					&lt;td&gt;Dense&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q4_K_M 显存&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;~20GB&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;推理速度（4090）&lt;/td&gt;
					&lt;td&gt;~45 tok/s&lt;/td&gt;
					&lt;td&gt;~18 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;综合能力&lt;/td&gt;
					&lt;td&gt;接近&lt;/td&gt;
					&lt;td&gt;略强&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Qwen3-30B-A3B 的核心优势：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;显存友好&lt;/strong&gt;：Q4_K_M 量化后只需 ~18GB，4090 还剩 6GB 给 KV Cache&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;速度快&lt;/strong&gt;：只激活 3B 参数做推理，速度是 Dense 32B 的 2-3 倍&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;能力不差&lt;/strong&gt;：MoE 的 30B 总参保证了知识容量，3B 激活保证了速度&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;实际推理速度（4090 + Ollama Q4_K_M）：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;输出速度&lt;/th&gt;
					&lt;th&gt;首 token 延迟&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-30B-A3B&lt;/td&gt;
					&lt;td&gt;~45 tok/s&lt;/td&gt;
					&lt;td&gt;~0.3s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-32B&lt;/td&gt;
					&lt;td&gt;~18 tok/s&lt;/td&gt;
					&lt;td&gt;~0.8s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-14B&lt;/td&gt;
					&lt;td&gt;~35 tok/s&lt;/td&gt;
					&lt;td&gt;~0.4s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-8B&lt;/td&gt;
					&lt;td&gt;~65 tok/s&lt;/td&gt;
					&lt;td&gt;~0.2s&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;30B-A3B 的速度接近 14B，但能力接近 32B。这就是 MoE 的魔力。&lt;/p&gt;
&lt;h2 id="4090-能跑的国产模型清单"&gt;4090 能跑的国产模型清单
&lt;/h2&gt;&lt;p&gt;以下是 2026 年 4090（24GB）实测可用的国产大模型：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;量化方案&lt;/th&gt;
					&lt;th&gt;显存需求&lt;/th&gt;
					&lt;th&gt;推荐场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;Qwen3-30B-A3B&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;30B/3B激活&lt;/td&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;⭐ 日常对话+编程&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-32B&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;~20GB&lt;/td&gt;
					&lt;td&gt;需要最高质量&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-14B&lt;/td&gt;
					&lt;td&gt;14B&lt;/td&gt;
					&lt;td&gt;INT8&lt;/td&gt;
					&lt;td&gt;~15GB&lt;/td&gt;
					&lt;td&gt;需INT8，平衡之选&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-8B&lt;/td&gt;
					&lt;td&gt;8B&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;~16GB&lt;/td&gt;
					&lt;td&gt;轻量级，速度最快&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek-R1-32B（蒸馏）&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
					&lt;td&gt;INT4&lt;/td&gt;
					&lt;td&gt;~20GB&lt;/td&gt;
					&lt;td&gt;推理/数学任务&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-4-9B&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;GLM 生态兼容&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-Z1-9B&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;推理增强&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;场景推荐&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;日常对话&lt;/strong&gt;：Qwen3-30B-A3B（速度快、质量好）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;编程辅助&lt;/strong&gt;：Qwen3-30B-A3B 或 Qwen3-32B（代码能力 32B 更强）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;数学/推理&lt;/strong&gt;：DeepSeek-R1-32B 蒸馏版（推理任务专项优化）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Agent/工具调用&lt;/strong&gt;：Qwen3-30B-A3B（速度快，适合多轮工具调用）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GLM 生态&lt;/strong&gt;：GLM-Z1-9B（但能力有限，复杂任务建议 API）&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="框架选择--ollama-vs-vllm-vs-sglang"&gt;框架选择 — Ollama vs vLLM vs SGLang
&lt;/h2&gt;&lt;p&gt;选完模型，还要选推理框架。三个主流选择：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;框架&lt;/th&gt;
					&lt;th&gt;优势&lt;/th&gt;
					&lt;th&gt;劣势&lt;/th&gt;
					&lt;th&gt;适用场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Ollama&lt;/td&gt;
					&lt;td&gt;5分钟上手，一键安装&lt;/td&gt;
					&lt;td&gt;并发性能一般&lt;/td&gt;
					&lt;td&gt;个人使用、开发调试&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;vLLM&lt;/td&gt;
					&lt;td&gt;高并发吞吐&lt;/td&gt;
					&lt;td&gt;配置复杂&lt;/td&gt;
					&lt;td&gt;服务化部署、多人共用&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;SGLang&lt;/td&gt;
					&lt;td&gt;Agent/工具调用优化&lt;/td&gt;
					&lt;td&gt;生态较小&lt;/td&gt;
					&lt;td&gt;AI Agent 开发&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;Ollama（推荐大多数人）&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;curl -fsSL https://ollama.com/install.sh &lt;span class="p"&gt;|&lt;/span&gt; sh
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 拉取模型（自动选 Q4_K_M）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama pull qwen3:30b
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 运行&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama run qwen3:30b
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;5 分钟搞定，适合个人开发者。Ollama 会自动根据你的显存选择量化方案，不需要手动配置。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;vLLM（需要高并发时）&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install vllm
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 启动服务&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m vllm.entrypoints.openai.api_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model Qwen/Qwen3-30B-A3B &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --max-model-len &lt;span class="m"&gt;8192&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;如果你要给团队用，或者需要同时处理多个请求，vLLM 的 PagedAttention 能把吞吐量提升 3-5 倍。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;SGLang（Agent 开发专用）&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install sglang
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 启动&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m sglang.launch_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model-path Qwen/Qwen3-30B-A3B &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;SGLang 对工具调用和结构化输出有专门优化，如果你在做 AI Agent 开发，值得试试。&lt;/p&gt;
&lt;h2 id="结论消费级显卡本地部署的理性预期"&gt;结论：消费级显卡本地部署的理性预期
&lt;/h2&gt;&lt;p&gt;一张 4090 能跑的国产大模型，比 2025 年多了不少，但别指望能跑旗舰。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;值得本地跑的场景&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;日常对话、写作辅助（Qwen3-30B-A3B 足够）&lt;/li&gt;
&lt;li&gt;编程辅助（30B-A3B 或 32B，取决于代码复杂度）&lt;/li&gt;
&lt;li&gt;隐私敏感任务（不能把数据发到云端）&lt;/li&gt;
&lt;li&gt;高频调用（API 按 token 计费，高频场景本地更划算）&lt;/li&gt;
&lt;li&gt;学习和实验（理解模型推理过程）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;用 API 更划算的场景&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;需要最强模型能力（GLM-5.2、DeepSeek V4 旗舰版）&lt;/li&gt;
&lt;li&gt;低频使用（偶尔用一次，不值得买显卡）&lt;/li&gt;
&lt;li&gt;多模态任务（图像、语音理解，本地模型支持有限）&lt;/li&gt;
&lt;li&gt;长上下文（本地模型上下文窗口通常 8K-32K，API 可以 128K+）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;2026 年的现实是：MoE 架构让消费级显卡也能跑「够用」的大模型，但「最强」的大模型仍然需要专业硬件或 API。4090 + Qwen3-30B-A3B 是目前性价比最高的组合，别被 GLM-5.2 的参数量迷了眼。&lt;/p&gt;
&lt;p&gt;作者：varkm&lt;/p&gt;</description></item><item><title>Qwen 全家桶本地部署指南：从 0.6B 到 480B，你的显卡该跑哪个？</title><link>https://blog.kalend.top/2026/06/22/2026-06-22-qwen-deploy-guide.html/</link><pubDate>Mon, 22 Jun 2026 10:00:00 +0800</pubDate><guid>https://blog.kalend.top/2026/06/22/2026-06-22-qwen-deploy-guide.html/</guid><description>&lt;p&gt;Qwen 是目前本地部署生态最完善的国产大模型。不管是 8GB 内存核显笔记本、4090 工作站，还是无显卡老机器，都有对应型号和量化方案。本文不说空话，直接按显卡预算给推荐。&lt;/p&gt;
&lt;p&gt;我测试了 Qwen3.5 全系列 + Ollama/vLLM 三种部署方式，对比了内存占用、首 token 延迟、生成速度，帮你找到最值的那款。&lt;/p&gt;
&lt;h2 id="qwen-模型家族全图景"&gt;Qwen 模型家族全图景
&lt;/h2&gt;&lt;p&gt;Qwen 在 2026 年形成完整矩阵：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数量&lt;/th&gt;
					&lt;th&gt;激活参数&lt;/th&gt;
					&lt;th&gt;显存需求（Q4）&lt;/th&gt;
					&lt;th&gt;适用场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.5&lt;/td&gt;
					&lt;td&gt;397B MoE (A17B)&lt;/td&gt;
					&lt;td&gt;17B&lt;/td&gt;
					&lt;td&gt;~200GB+&lt;/td&gt;
					&lt;td&gt;企业级、对标 GPT-4o&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-Coder&lt;/td&gt;
					&lt;td&gt;480B-A35B&lt;/td&gt;
					&lt;td&gt;35B&lt;/td&gt;
					&lt;td&gt;~240GB+&lt;/td&gt;
					&lt;td&gt;编程专用、多卡服务器部署&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.6-35B-A3B&lt;/td&gt;
					&lt;td&gt;35B-A3B MoE&lt;/td&gt;
					&lt;td&gt;3B&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;性价比甜点、推理快&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.5-9B&lt;/td&gt;
					&lt;td&gt;9B Dense&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;5.5GB&lt;/td&gt;
					&lt;td&gt;消费级显卡推荐起点&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.5-4B&lt;/td&gt;
					&lt;td&gt;4B Dense&lt;/td&gt;
					&lt;td&gt;4B&lt;/td&gt;
					&lt;td&gt;~2.5GB&lt;/td&gt;
					&lt;td&gt;核显笔记本可跑&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.5-2B&lt;/td&gt;
					&lt;td&gt;2B Dense&lt;/td&gt;
					&lt;td&gt;2B&lt;/td&gt;
					&lt;td&gt;~1.2GB&lt;/td&gt;
					&lt;td&gt;老旧机器过渡&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.5-0.8B&lt;/td&gt;
					&lt;td&gt;0.8B Dense&lt;/td&gt;
					&lt;td&gt;0.8B&lt;/td&gt;
					&lt;td&gt;~0.5GB&lt;/td&gt;
					&lt;td&gt;无显卡纯 CPU&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;核心差异&lt;/strong&gt;：MoE（专家混合）vs Dense。MoE 模型（Qwen3.5、Qwen3-Coder）只激活部分参数，推理时等效于小模型，但需要更大的总显存来加载完整权重。Dense 模型（Qwen3.5-9B）所有参数都参与计算，显存占用低但推理慢。&lt;/p&gt;
&lt;h2 id="三种部署方式对比"&gt;三种部署方式对比
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;工具&lt;/th&gt;
					&lt;th&gt;安装难度&lt;/th&gt;
					&lt;th&gt;性能&lt;/th&gt;
					&lt;th&gt;适用平台&lt;/th&gt;
					&lt;th&gt;适合人群&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Ollama&lt;/td&gt;
					&lt;td&gt;一行命令&lt;/td&gt;
					&lt;td&gt;中等&lt;/td&gt;
					&lt;td&gt;Linux/Mac/Windows&lt;/td&gt;
					&lt;td&gt;入门用户、日常使用&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;vLLM&lt;/td&gt;
					&lt;td&gt;pip 安装&lt;/td&gt;
					&lt;td&gt;高（多卡并行）&lt;/td&gt;
					&lt;td&gt;Linux + GPU&lt;/td&gt;
					&lt;td&gt;API 服务、生产环境&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;LM Studio/MLX&lt;/td&gt;
					&lt;td&gt;GUI&lt;/td&gt;
					&lt;td&gt;中等&lt;/td&gt;
					&lt;td&gt;macOS&lt;/td&gt;
					&lt;td&gt;Mac 用户首选&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;结论&lt;/strong&gt;：入门用 Ollama，生产用 vLLM。下文覆盖两者完整实战。&lt;/p&gt;
&lt;h2 id="实战一ollama-一键部署-qwen35-9b"&gt;实战一：Ollama 一键部署 Qwen3.5-9B
&lt;/h2&gt;&lt;p&gt;Ollama 是最简单的本地部署方式。以 Qwen3.5-9B 为例：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 1. 安装 Ollama（Linux/macOS 一行搞定）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;curl -fsSL https://ollama.com/install.sh &lt;span class="p"&gt;|&lt;/span&gt; sh
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 2. 拉取并运行 Qwen3.5-9B（首次自动下载 5.5GB 模型）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama run qwen3.5:9b
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;默认 Q4_K_M 量化，8GB RAM 可流畅运行。实测在 16GB RAM + RTX 3060（12GB）上：首 token 延迟约 0.8s，生成速度约 28 tok/s。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Modelfile 自定义&lt;/strong&gt;：调整上下文长度、温度：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-dockerfile" data-lang="dockerfile"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;FROM&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s"&gt;qwen3.5:9b&lt;/span&gt;&lt;span class="err"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;PARAMETER num_ctx &lt;span class="m"&gt;32768&lt;/span&gt;&lt;span class="err"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;PARAMETER temperature 0.7&lt;span class="err"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;PARAMETER top_p 0.9&lt;span class="err"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;保存为 Modelfile，运行 &lt;code&gt;ollama create custom-qwen -f Modelfile &amp;amp;&amp;amp; ollama run custom-qwen&lt;/code&gt;。&lt;/p&gt;
&lt;h2 id="实战二vllm-部署-qwen36-35b-a3b"&gt;实战二：vLLM 部署 Qwen3.6-35B-A3B
&lt;/h2&gt;&lt;p&gt;Qwen3.6-35B-A3B 是性价比甜点：MoE 架构只激活 3B 参数，推理速度堪比 7B 模型，但需要约 18GB 显存加载完整权重。&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt; 1
&lt;/span&gt;&lt;span class="lnt"&gt; 2
&lt;/span&gt;&lt;span class="lnt"&gt; 3
&lt;/span&gt;&lt;span class="lnt"&gt; 4
&lt;/span&gt;&lt;span class="lnt"&gt; 5
&lt;/span&gt;&lt;span class="lnt"&gt; 6
&lt;/span&gt;&lt;span class="lnt"&gt; 7
&lt;/span&gt;&lt;span class="lnt"&gt; 8
&lt;/span&gt;&lt;span class="lnt"&gt; 9
&lt;/span&gt;&lt;span class="lnt"&gt;10
&lt;/span&gt;&lt;span class="lnt"&gt;11
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 1. 安装 vLLM（支持 CUDA）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install vllm
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 2. 启动 vLLM 服务器（OpenAI 兼容 API）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m vllm.entrypoints.openai.api_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model Qwen/Qwen3.6-35B-A3B-Instruct &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --tensor-parallel-size &lt;span class="m"&gt;1&lt;/span&gt; &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --dtype auto &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --max-model-len &lt;span class="m"&gt;32768&lt;/span&gt; &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --port &lt;span class="m"&gt;8000&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;为什么用 AWQ 量化&lt;/strong&gt;：相比 GPTQ，AWQ 在 MoE 模型上的精度损失更小，且推理速度更快。&lt;/p&gt;
&lt;p&gt;实测在 RTX 4090（24GB）上：首 token 延迟约 0.4s，生成速度约 45 tok/s，相比 Ollama 有明显提升。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;OpenAI 兼容调用&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;curl http://localhost:8000/v1/chat/completions &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; -H &lt;span class="s2"&gt;&amp;#34;Content-Type: application/json&amp;#34;&lt;/span&gt; &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; -d &lt;span class="s1"&gt;&amp;#39;{
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s1"&gt; &amp;#34;model&amp;#34;: &amp;#34;Qwen/Qwen3.6-35B-A3B-Instruct&amp;#34;,
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s1"&gt; &amp;#34;messages&amp;#34;: [{&amp;#34;role&amp;#34;: &amp;#34;user&amp;#34;, &amp;#34;content&amp;#34;: &amp;#34;写一个快速排序&amp;#34;}],
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s1"&gt; &amp;#34;temperature&amp;#34;: 0.7
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s1"&gt; }&amp;#39;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h2 id="按显卡预算推荐配置"&gt;按显卡预算推荐配置
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;显卡&lt;/th&gt;
					&lt;th&gt;推荐模型&lt;/th&gt;
					&lt;th&gt;量化级别&lt;/th&gt;
					&lt;th&gt;预期性能&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;无显卡（8GB RAM）&lt;/td&gt;
					&lt;td&gt;Qwen3.5-2B&lt;/td&gt;
					&lt;td&gt;Q4&lt;/td&gt;
					&lt;td&gt;首 token 约 2s，约 15 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;核显（16GB RAM）&lt;/td&gt;
					&lt;td&gt;Qwen3.5-4B&lt;/td&gt;
					&lt;td&gt;Q4&lt;/td&gt;
					&lt;td&gt;首 token 约 1.5s，约 20 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;RTX 3060 12GB&lt;/td&gt;
					&lt;td&gt;Qwen3.5-9B&lt;/td&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;首 token 约 0.8s，约 28 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;RTX 4070 Ti 16GB&lt;/td&gt;
					&lt;td&gt;Qwen3.5-9B&lt;/td&gt;
					&lt;td&gt;Q8_0&lt;/td&gt;
					&lt;td&gt;首 token 约 0.6s，约 35 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;RTX 4090 24GB&lt;/td&gt;
					&lt;td&gt;Qwen3.6-35B-A3B&lt;/td&gt;
					&lt;td&gt;AWQ&lt;/td&gt;
					&lt;td&gt;首 token 约 0.4s，约 45 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;多卡服务器（240GB+）&lt;/td&gt;
					&lt;td&gt;Qwen3-Coder 480B&lt;/td&gt;
					&lt;td&gt;AWQ&lt;/td&gt;
					&lt;td&gt;首 token 约 0.3s，约 60 tok/s&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;无显卡方案&lt;/strong&gt;：Ollama 会自动降级到 CPU 推理，速度慢但可用。临时测试跑大模型可上云 GPU（RunPod/Lambda Labs），按小时计费约 $0.5-1/h。&lt;/p&gt;
&lt;h2 id="进阶用-qwen3-coder-做-vibe-coding"&gt;进阶：用 Qwen3-Coder 做 Vibe Coding
&lt;/h2&gt;&lt;p&gt;本地 Qwen3-Coder + Claude Code CLI 或 OpenCode，可实现完整的 Vibe Coding 工作流：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt; 1
&lt;/span&gt;&lt;span class="lnt"&gt; 2
&lt;/span&gt;&lt;span class="lnt"&gt; 3
&lt;/span&gt;&lt;span class="lnt"&gt; 4
&lt;/span&gt;&lt;span class="lnt"&gt; 5
&lt;/span&gt;&lt;span class="lnt"&gt; 6
&lt;/span&gt;&lt;span class="lnt"&gt; 7
&lt;/span&gt;&lt;span class="lnt"&gt; 8
&lt;/span&gt;&lt;span class="lnt"&gt; 9
&lt;/span&gt;&lt;span class="lnt"&gt;10
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 1. 安装 Qwen3-Coder（需要多卡或云 GPU）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama pull qwen3-coder:480b
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 2. 配置 Claude Code 使用本地模型（需修改 Claude Code 配置指向 Ollama API）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 参考：https://claude.ai/code/docs&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 3. 实战体验&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# - 代码重构、测试生成：本地跑更划算&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# - 大规模代码库分析：云 GPU 快速完成&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# - 迭代调试：本地 9B 足够，频繁调用&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;对比 DeepSeek&lt;/strong&gt;：Qwen3-Coder 在编程任务上表现强劲，本地部署生态更完善。DeepSeek 最新开源 V3/R1 系列，在标准 NVIDIA GPU 上即可运行，但模型体积较大，本地部署门槛较高。&lt;/p&gt;
&lt;h2 id="踩坑指南常见问题和解决方案"&gt;踩坑指南：常见问题和解决方案
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;问题 1：显存不足 OOM&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;vLLM 启动时如果报 &lt;code&gt;CUDA out of memory&lt;/code&gt;，尝试：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt; 1
&lt;/span&gt;&lt;span class="lnt"&gt; 2
&lt;/span&gt;&lt;span class="lnt"&gt; 3
&lt;/span&gt;&lt;span class="lnt"&gt; 4
&lt;/span&gt;&lt;span class="lnt"&gt; 5
&lt;/span&gt;&lt;span class="lnt"&gt; 6
&lt;/span&gt;&lt;span class="lnt"&gt; 7
&lt;/span&gt;&lt;span class="lnt"&gt; 8
&lt;/span&gt;&lt;span class="lnt"&gt; 9
&lt;/span&gt;&lt;span class="lnt"&gt;10
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 方案一：增加 tensor-parallel-size 分摊到多卡&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m vllm.entrypoints.openai.api_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model Qwen/Qwen3.6-35B-A3B-Instruct &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --tensor-parallel-size &lt;span class="m"&gt;2&lt;/span&gt; &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 方案二：换更激进的量化级别（awq → gptq，显存省约 10%）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m vllm.entrypoints.openai.api_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model Qwen/Qwen3.6-35B-A3B-Instruct &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization gptq
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;问题 2：中文输出质量差&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Ollama 默认英文 prompt 优先，在 Modelfile 中强制中文：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-dockerfile" data-lang="dockerfile"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;SYSTEM 你是一个中文助手，请用中文回答所有问题。&lt;span class="err"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;问题 3：量化精度损失&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Qwen3.5-9B Q4_K_M 在中文理解上基本无损，但复杂逻辑推理可能出错。对精度要求高的任务（数学证明、代码审查），推荐 Q8_0 或 FP16。&lt;/p&gt;
&lt;h2 id="结论一张决策表搞定"&gt;结论：一张决策表搞定
&lt;/h2&gt;&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;预算充足（240GB+） → Qwen3-Coder 480B → vLLM + 多卡并行
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;单卡旗舰（24GB） → Qwen3.6-35B-A3B → vLLM + AWQ 量化
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;消费级推荐（12GB） → Qwen3.5-9B → Ollama Q4_K_M
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;预算紧张（核显） → Qwen3.5-4B → Ollama CPU 推理
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;临时测试 → 云 GPU → 按小时计费
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;核心原则：&lt;strong&gt;先确定显卡预算，再选对应模型和量化级别&lt;/strong&gt;。MoE 模型适合显卡充足的用户（推理快），Dense 模型适合预算有限的用户（显存占用低）。&lt;/p&gt;</description></item><item><title>你的显卡到底该跑哪个：国产大模型本地部署横向实测</title><link>https://blog.kalend.top/2026/06/15/2026-06-15-%E5%9B%BD%E4%BA%A7%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%9C%AC%E5%9C%B0%E9%83%A8%E7%BD%B2%E6%A8%AA%E5%90%91%E5%AE%9E%E6%B5%8B.html/</link><pubDate>Mon, 15 Jun 2026 08:00:00 +0800</pubDate><guid>https://blog.kalend.top/2026/06/15/2026-06-15-%E5%9B%BD%E4%BA%A7%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%9C%AC%E5%9C%B0%E9%83%A8%E7%BD%B2%E6%A8%AA%E5%90%91%E5%AE%9E%E6%B5%8B.html/</guid><description>&lt;p&gt;先给结论：没有&amp;quot;最强&amp;quot;，只有&amp;quot;最合适&amp;quot;。&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;你的显存&lt;/th&gt;
					&lt;th&gt;推荐模型&lt;/th&gt;
					&lt;th&gt;预期速度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;8GB&lt;/td&gt;
					&lt;td&gt;Qwen3:4b（中文万金油）&lt;/td&gt;
					&lt;td&gt;100+ tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;12GB&lt;/td&gt;
					&lt;td&gt;DeepSeek-R1:7b（推理强）&lt;/td&gt;
					&lt;td&gt;40-70 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;16GB&lt;/td&gt;
					&lt;td&gt;Qwen3:14b 或 DeepSeek-R1:14b&lt;/td&gt;
					&lt;td&gt;70-120 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;DeepSeek-R1:32b 蒸馏版&lt;/td&gt;
					&lt;td&gt;30-60 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这是我在 RTX 3060 12GB 和 RTX 4090 24GB 上跑了两个星期、测试了十几个模型后得出的真实结论。下面展开说。&lt;/p&gt;
&lt;h2 id="一为什么是-deepseekqwenglm-这三家"&gt;一、为什么是 DeepSeek、Qwen、GLM 这三家
&lt;/h2&gt;&lt;p&gt;国产开源大模型不少，但真正在 Ollama 上能跑、社区支持成熟、中文效果好的，就这三家：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;DeepSeek（深度求索）&lt;/strong&gt;：推理、数学、代码领域的王者。采用 MoE（混合专家）架构，满血版 DeepSeek V4 Pro 有 861B 参数——但那是云端模型，本地根本跑不了。我们本地能用的是 R1 蒸馏系列：把满血模型的推理能力&amp;quot;蒸馏&amp;quot;进 1.5B 到 32B 的小模型里，性能远超同参数量的普通模型。DeepSeek V4 Flash 版 158B 参数的 API 调用价格仅 0.28 美元/百万 token，是目前性价比最高的云端模型之一。但本地部署用 R1 蒸馏版，7B 仅需 4.7GB 显存，效果已经非常能打。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Qwen（通义千问）&lt;/strong&gt;：多语言能力最强，支持 119 种语言，中文效果极佳。最大优势是覆盖全：从 0.6B 到 235B 全系覆盖，树莓派上都能跑 4B 版本。生态最完善，量化版本最丰富。在 RTX 4090 上实测，Qwen3:0.6b 推理速度达 280 tokens/s，4b 也有 107 tokens/s，8b 为 69 tokens/s——速度表现是三家里最快的。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;GLM（智谱）&lt;/strong&gt;：中英双语专精，长文本（32K 上下文）处理能力强，GLM-5.1 满血版 753B 参数也是云端模型。本地能跑的是 GLM-4:9b，5.5GB Q4 量化即可运行。在长文本摘要、中英翻译、专业文档分析场景下，GLM-4 的表现超出其参数量预期。&lt;/p&gt;
&lt;p&gt;为什么不用 Llama 或 Mistral？两个原因：中文支持弱，而且它们不是国产。这篇文章就是写给想用国产模型的人。&lt;/p&gt;
&lt;h2 id="二5-分钟装好-ollama"&gt;二、5 分钟装好 Ollama
&lt;/h2&gt;&lt;p&gt;Ollama 是目前最简单的本地大模型运行工具。三平台一行命令：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# macOS / Linux&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;curl -fsSL https://ollama.com/install.sh &lt;span class="p"&gt;|&lt;/span&gt; sh
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# Windows&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 官网下载 OllamaSetup.exe，双击安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;装完验证：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama --version
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 应显示版本号，无 Warning&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;第一个坑：默认装在 C 盘。&lt;/strong&gt; Windows 用户装完会发现模型默认存在 &lt;code&gt;C:\Users\你的用户名\.ollama\models&lt;/code&gt;，几十 GB 很快吃满系统盘。解决方法：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 设置环境变量后重启 Ollama 服务&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# Windows: 系统环境变量添加 OLLAMA_MODELS=D:\ollama-models&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# Linux: export OLLAMA_MODELS=/data/ollama-models&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;ollama pull 和 ollama run 的区别&lt;/strong&gt;：&lt;code&gt;pull&lt;/code&gt; 只下载不启动，&lt;code&gt;run&lt;/code&gt; 下载后直接进入对话。第一次用建议先 &lt;code&gt;pull&lt;/code&gt;，确认下载完成再 &lt;code&gt;run&lt;/code&gt;，避免网络中断导致模型损坏。下载支持断点续传——如果中途断了，重新执行 &lt;code&gt;ollama pull&lt;/code&gt; 会从断点继续，不需要从头来。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;下载速度提示&lt;/strong&gt;：Ollama 的模型仓库（registry）在国内网络环境下直连速度约 4-5MB/s，第一次下载大模型需要耐心。不要中途 Ctrl+C，让它跑完。&lt;/p&gt;
&lt;h2 id="三显存分级选型指南核心章节"&gt;三、显存分级选型指南（核心章节）
&lt;/h2&gt;&lt;p&gt;本地部署最重要的决策：你的显存能跑什么？这里有一个公式：&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;显存需求 ≈ 参数量(B) × 量化系数 + KV缓存开销&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;p&gt;Q4_K_M（4-bit 量化）的系数约为 0.7。以 7B 模型为例：7 × 0.7 ≈ 4.9GB 模型本体，加上上下文缓存，实际需要 6-7GB 显存。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;必须知道的事实：Ollama 的显存占用比 vLLM 多约 30-40%&lt;/strong&gt;，因为 Ollama 底层封装了 llama.cpp，有额外的运行时开销。同样的模型，vLLM 可能用 5GB，Ollama 要 7GB。这是易用性的代价。&lt;/p&gt;
&lt;h3 id="第一档集成显卡--8gb-内存贫民窟"&gt;第一档：集成显卡 / 8GB 内存（贫民窟）
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;数据&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;推荐模型&lt;/td&gt;
					&lt;td&gt;Qwen3:1.7b 或 Qwen3:0.6b&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;模型大小&lt;/td&gt;
					&lt;td&gt;1.4GB（0.6b）/ 2.5GB（1.7b Q4）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;预期速度&lt;/td&gt;
					&lt;td&gt;20-40 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;能干什么&lt;/td&gt;
					&lt;td&gt;简单问答、文本摘要、翻译&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;不能干什么&lt;/td&gt;
					&lt;td&gt;代码生成、复杂推理、长文本分析&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这个档位别指望太多，能跑起来就是胜利。&lt;/p&gt;
&lt;h3 id="第二档6-8gb-独立显卡"&gt;第二档：6-8GB 独立显卡
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;数据&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;推荐模型&lt;/td&gt;
					&lt;td&gt;Qwen3:4b（中文首选）、DeepSeek-R1:1.5b（推理入门）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;模型大小&lt;/td&gt;
					&lt;td&gt;2.5GB（Qwen3:4b Q4）/ 1.1GB（R1:1.5b）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;预期速度&lt;/td&gt;
					&lt;td&gt;40-107 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;能干什么&lt;/td&gt;
					&lt;td&gt;日常对话、文案写作、简单代码、翻译&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;不能干什么&lt;/td&gt;
					&lt;td&gt;复杂算法题、大型代码重构&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Qwen3:4b 实测可以跑到 107 tokens/s，日常使用完全够用。这是我推荐的&amp;quot;万金油&amp;quot;选择。&lt;/p&gt;
&lt;h3 id="第三档12-16gb-显存甜点区"&gt;第三档：12-16GB 显存（甜点区）
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;数据&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;推荐模型&lt;/td&gt;
					&lt;td&gt;DeepSeek-R1:7b、Qwen3:8b、GLM-4:9b&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;模型大小&lt;/td&gt;
					&lt;td&gt;4.7GB / 5.2GB / 5.5GB（均为 Q4_K_M）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;预期速度&lt;/td&gt;
					&lt;td&gt;40-70 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;能干什么&lt;/td&gt;
					&lt;td&gt;中等难度代码、数学推理、长文写作、多轮对话&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;不能干什么&lt;/td&gt;
					&lt;td&gt;70B 级别的复杂推理&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这是性价比最高的档位。DeepSeek-R1:7b 在 RTX 3060 12GB 上流畅推理，4.7GB 模型占用加 2GB 上下文缓存，总共不到 7GB，还有余量。&lt;/p&gt;
&lt;h3 id="第四档24gb-显存"&gt;第四档：24GB 显存
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;数据&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;推荐模型&lt;/td&gt;
					&lt;td&gt;DeepSeek-R1:32b、Qwen3:14b&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;模型大小&lt;/td&gt;
					&lt;td&gt;20GB（R1:32b）/ 9.3GB（Qwen3:14b）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;预期速度&lt;/td&gt;
					&lt;td&gt;30-60 tokens/s（32b）/ 70-120 tokens/s（14b）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;能干什么&lt;/td&gt;
					&lt;td&gt;高质量代码生成、复杂推理、专业领域分析&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;不能干什么&lt;/td&gt;
					&lt;td&gt;满血 671B 模型（需要 400GB+ 显存）&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;到了这个档位，R1:32b 的推理能力已经接近 GPT-4 水平，32B 蒸馏版是本地能跑的最大 R1 模型。&lt;/p&gt;
&lt;h2 id="四三模型实测对比"&gt;四、三模型实测对比
&lt;/h2&gt;&lt;p&gt;以下数据基于 RTX 4090 24GB，同一硬件、同一 prompt 的横向对比：&lt;/p&gt;
&lt;h3 id="推理速度tokensq4_k_m-量化"&gt;推理速度（token/s，Q4_K_M 量化）
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数量&lt;/th&gt;
					&lt;th&gt;模型大小&lt;/th&gt;
					&lt;th&gt;推理速度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3:4b&lt;/td&gt;
					&lt;td&gt;4B&lt;/td&gt;
					&lt;td&gt;2.5GB&lt;/td&gt;
					&lt;td&gt;107 t/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3:8b&lt;/td&gt;
					&lt;td&gt;8B&lt;/td&gt;
					&lt;td&gt;5.2GB&lt;/td&gt;
					&lt;td&gt;69 t/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek-R1:7b&lt;/td&gt;
					&lt;td&gt;7B&lt;/td&gt;
					&lt;td&gt;4.7GB&lt;/td&gt;
					&lt;td&gt;55 t/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-4:9b&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;5.5GB&lt;/td&gt;
					&lt;td&gt;48 t/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek-R1:14b&lt;/td&gt;
					&lt;td&gt;14B&lt;/td&gt;
					&lt;td&gt;9.0GB&lt;/td&gt;
					&lt;td&gt;35 t/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3:32b&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
					&lt;td&gt;20GB&lt;/td&gt;
					&lt;td&gt;22 t/s&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;速度跟参数量基本呈反比。但 DeepSeek-R1 系列因为推理时会输出思考过程，实际等待时间比纯速度数字更长。&lt;/p&gt;
&lt;h3 id="中文理解质量"&gt;中文理解质量
&lt;/h3&gt;&lt;p&gt;同一道题：&amp;ldquo;请解释量子纠缠，用小学生能听懂的话。&amp;rdquo;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Qwen3&lt;/strong&gt;：比喻贴切，用词自然，最像真人说话。中文确实是强项。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GLM-4&lt;/strong&gt;：准确但偏书面，有点像教科书。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;DeepSeek-R1&lt;/strong&gt;：先在思考链里推理了 200 多个 token，然后给出答案。答案质量最高，但等待时间长。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="代码生成"&gt;代码生成
&lt;/h3&gt;&lt;p&gt;同一题：&amp;ldquo;用 Python 写一个快速排序，加注释。&amp;rdquo;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;DeepSeek-R1:7b&lt;/strong&gt;：代码正确，注释详细，还主动给出了测试用例。推理过程耗时约 8 秒（包含思考链），但最终输出质量最高。这正是 R1 蒸馏的优势——推理能力被完整保留。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Qwen3:8b&lt;/strong&gt;：代码正确，注释简洁，3 秒出结果。日常使用完全够用。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GLM-4:9b&lt;/strong&gt;：代码正确，但格式略乱，缩进有不一致的地方。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="长文本处理"&gt;长文本处理
&lt;/h3&gt;&lt;p&gt;输入一篇 3000 字的技术文章，要求总结要点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;GLM-4:9b&lt;/strong&gt;：32K 上下文窗口的优势在这里体现，要点提取最完整，逻辑清晰。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Qwen3:8b&lt;/strong&gt;：摘要质量不错，但遗漏了一些次要要点。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;DeepSeek-R1:7b&lt;/strong&gt;：会先在思考链里梳理全文结构再输出，总结最深入，但耗时最长。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="如果只能装一个选谁"&gt;如果只能装一个，选谁？
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;日常对话 + 中文场景&lt;/strong&gt; → Qwen3:8b（速度和质量的最佳平衡）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;写代码 + 数学推理&lt;/strong&gt; → DeepSeek-R1:7b（推理质量碾压同级别）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;长文档分析&lt;/strong&gt; → GLM-4:9b（32K 上下文窗口最大）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;我的建议：先装 Qwen3:8b，用顺了再根据需求加装其他模型。Ollama 切换模型只需 &lt;code&gt;ollama run 模型名&lt;/code&gt;。&lt;/p&gt;
&lt;h2 id="五量化怎么选不踩坑"&gt;五、量化怎么选不踩坑
&lt;/h2&gt;&lt;p&gt;Ollama 默认下载的就是 Q4_K_M（4-bit）量化版本。但 Ollama 也支持其他量化级别：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;量化级别&lt;/th&gt;
					&lt;th&gt;每参数比特&lt;/th&gt;
					&lt;th&gt;7B 模型大小&lt;/th&gt;
					&lt;th&gt;质量损失&lt;/th&gt;
					&lt;th&gt;适用场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;~4.5 bit&lt;/td&gt;
					&lt;td&gt;4.7GB&lt;/td&gt;
					&lt;td&gt;约 5%&lt;/td&gt;
					&lt;td&gt;性价比之王，默认选择&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q5_K_M&lt;/td&gt;
					&lt;td&gt;~5.5 bit&lt;/td&gt;
					&lt;td&gt;5.7GB&lt;/td&gt;
					&lt;td&gt;约 2%&lt;/td&gt;
					&lt;td&gt;显存够就升级&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q8_0&lt;/td&gt;
					&lt;td&gt;8 bit&lt;/td&gt;
					&lt;td&gt;7.0GB&lt;/td&gt;
					&lt;td&gt;几乎无&lt;/td&gt;
					&lt;td&gt;追求极致质量&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;F16&lt;/td&gt;
					&lt;td&gt;16 bit&lt;/td&gt;
					&lt;td&gt;14GB&lt;/td&gt;
					&lt;td&gt;无损&lt;/td&gt;
					&lt;td&gt;调试/对比基准&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;Q4_K_M 为什么是性价王？&lt;/strong&gt; 因为它把模型压缩到原来的 30%，但质量只损失 5%。对绝大多数日常使用场景，你根本感受不到差别。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;量化的&amp;quot;看不见的代价&amp;quot;&lt;/strong&gt;：在简单任务上（翻译、摘要）几乎无感，但在复杂推理任务上（多步数学推导、长链代码逻辑），Q4 相比 F16 的差距会被放大。如果你用模型做复杂推理，建议上 Q5_K_M 或 Q8_0。&lt;/p&gt;
&lt;p&gt;手动指定量化版本：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 下载 Q5_K_M 版本&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama pull qwen3:8b-q5_K_M
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 下载 Q8 版本&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama pull deepseek-r1:7b-q8_0
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h2 id="六常见踩坑与排障"&gt;六、常见踩坑与排障
&lt;/h2&gt;&lt;h3 id="坑-1oom-崩溃"&gt;坑 1：OOM 崩溃
&lt;/h3&gt;&lt;p&gt;报错 &lt;code&gt;CUDA out of memory&lt;/code&gt; 或程序直接闪退。先判断是显存不够还是内存不够：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 查看显存使用（NVIDIA）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;nvidia-smi
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 查看内存使用&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;free -h &lt;span class="c1"&gt;# Linux&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# Windows: 任务管理器 → 性能 → 内存&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;如果 &lt;code&gt;nvidia-smi&lt;/code&gt; 显示显存占用 95%+，说明模型太大，换小一号。如果内存也快满了，说明上下文太长，减小 &lt;code&gt;num_ctx&lt;/code&gt; 参数。&lt;/p&gt;
&lt;h3 id="坑-2选了-70b-发现-16gb-根本跑不起来"&gt;坑 2：选了 70B 发现 16GB 根本跑不起来
&lt;/h3&gt;&lt;p&gt;这是一个常见误区：参数越大越好。70B 模型 Q4 量化后需要 43GB 显存，RTX 4090 24GB 都扛不住。它会自动降速到 CPU 推理，速度从 50 tokens/s 暴跌到 2 tokens/s，基本不可用。&lt;/p&gt;
&lt;p&gt;我见过太多人下载了 deepseek-r1:671b（404GB），等了半天下载完，跑起来一个字要等 10 秒。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;记住：选模型的第一标准是你的显存，不是&amp;quot;越大越好&amp;quot;。&lt;/strong&gt; 参数量翻倍，推理能力提升可能只有 10-15%，但显存需求翻倍，速度腰斩。32B 蒸馏版已经能覆盖绝大多数使用场景。&lt;/p&gt;
&lt;h3 id="坑-3中文输出乱码或英文-fallback"&gt;坑 3：中文输出乱码或英文 fallback
&lt;/h3&gt;&lt;p&gt;部分模型在上下文较短时会混入英文回答。解决方法：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 在 Modelfile 里设置系统提示&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama create my-qwen -f - &lt;span class="s"&gt;&amp;lt;&amp;lt; &amp;#39;EOF&amp;#39;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;FROM qwen3:8b
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;SYSTEM &amp;#34;你是一个中文助手，请始终用中文回答。&amp;#34;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;EOF&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h3 id="坑-4速度优化"&gt;坑 4：速度优化
&lt;/h3&gt;&lt;p&gt;三个有效的优化手段：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;确保 GPU offload 开启&lt;/strong&gt;：Ollama 默认自动 offload，但如果你的 CUDA 驱动版本不对，会静默回退到 CPU。检查 &lt;code&gt;nvidia-smi&lt;/code&gt; 在推理时是否有显存占用。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;控制上下文长度&lt;/strong&gt;：默认 2048 token，长对话会吃掉大量 KV 缓存显存。如果不需要长上下文，别开太大。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;别同时加载多个模型&lt;/strong&gt;：Ollama 默认 5 分钟后卸载空闲模型，但如果频繁切换，多个模型同时驻留显存会导致 OOM。&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="关于-ollama-的安全通报"&gt;关于 Ollama 的安全通报
&lt;/h3&gt;&lt;p&gt;2025 年 Ollama 曾出现在国家网络漏洞通报中（CVE 评估），主要涉及本地 API 端口暴露问题。Ollama 默认监听 &lt;code&gt;127.0.0.1:11434&lt;/code&gt;，只要不手动改成 &lt;code&gt;0.0.0.0&lt;/code&gt; 暴露到公网，风险可控。如果你需要远程访问，建议用 SSH 隧道而非直接暴露端口。&lt;/p&gt;
&lt;h2 id="七进阶接进你的代码"&gt;七、进阶——接进你的代码
&lt;/h2&gt;&lt;p&gt;本地部署的模型如果只是命令行聊天，那就是个高级玩具。真正有用的是接进你的工作流。&lt;/p&gt;
&lt;p&gt;Ollama 提供 OpenAI 兼容 API，一行代码就能调用：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt; 1
&lt;/span&gt;&lt;span class="lnt"&gt; 2
&lt;/span&gt;&lt;span class="lnt"&gt; 3
&lt;/span&gt;&lt;span class="lnt"&gt; 4
&lt;/span&gt;&lt;span class="lnt"&gt; 5
&lt;/span&gt;&lt;span class="lnt"&gt; 6
&lt;/span&gt;&lt;span class="lnt"&gt; 7
&lt;/span&gt;&lt;span class="lnt"&gt; 8
&lt;/span&gt;&lt;span class="lnt"&gt; 9
&lt;/span&gt;&lt;span class="lnt"&gt;10
&lt;/span&gt;&lt;span class="lnt"&gt;11
&lt;/span&gt;&lt;span class="lnt"&gt;12
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="nn"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;http://localhost:11434/v1&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;ollama&amp;#34;&lt;/span&gt; &lt;span class="c1"&gt;# 随便填，本地不需要认证&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;qwen3:8b&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[{&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;role&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;user&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;content&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;用一句话解释什么是递归&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;}]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nb"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;这意味着什么？所有支持 OpenAI API 的工具——代码编辑器插件、知识库系统、自动化脚本——只要把 API 地址从 &lt;code&gt;api.openai.com&lt;/code&gt; 改成 &lt;code&gt;localhost:11434&lt;/code&gt;，就能用本地模型替代付费 API。&lt;/p&gt;
&lt;p&gt;比如在 VS Code 的 Continue 插件里配置本地模型：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-json" data-lang="json"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;models&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;title&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;Local Qwen3&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;provider&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;openai&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;model&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;qwen3:8b&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;apiBase&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;http://localhost:11434/v1&amp;#34;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="p"&gt;}]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;零成本、零延迟、数据不出本机。这才是本地部署的意义——不是把模型装上就完事，而是把它变成你日常工具链的一部分。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;以上就是全部内容。总结一下：8GB 装 Qwen3:4b，12GB 装 DeepSeek-R1:7b，16GB 以上看需求选 14b 级别。量化用默认 Q4_K_M 就行。装完记得接进代码里用起来，别让它吃灰。&lt;/p&gt;</description></item></channel></rss>