中文精炼导读

核心观点

  • Sebastian Raschka 撰写了一篇"全本地栈编程智能体"教程:用本地推理引擎(Ollama)承载开源权重 LLM、配合本地 coding harness,作为 Claude Code / Codex 订阅之外的替代方案——透明、可检查、除硬件与电费外免费、完全可控、可随意修改。
  • 模型选择上主推 Qwen3.6 35B-A3B(约 22GB 下载、需 30-40GB 内存,在 Mac Mini M4 与 DGX Spark 上跑得飞快),并基于 Cohere 六月基准指出它是该尺寸等级目前最强的本地模型;North Mini Code 是同级最值得考虑的替代。
  • 选择 harness 的关键判断是"模型与 harness 的匹配":Qwen 系列专门针对 Qwen-Code harness 优化(NVIDIA Polar 论文的基准显示 Qwen3.5-4B 在 Qwen-Code 里编码表现最好);但作者用自建的小型能力基准意外发现,Qwen3.6 在 Codex CLI 里的表现反而优于其"原生"Qwen-Code harness——说明把 Codex 当通用 harness 用未必是坏主意。
  • 隐私是本地化的核心动机之一:Qwen-Code、Cline、Codex、Claude Code 都有默认开启的遥测/数据共享,需要显式关闭(如 Qwen-Code 用 ~/.qwen/settings.json 关闭 usage statistics、telemetry、hooks);作者还提醒 Claude Code 没有官方开源版本、且似乎会向 Anthropic 与 Datadog 发数据,信任成本更高。
  • 评估建议是"用真实任务测而不是只看基准":他分享了一个 agent-problem-pack 小任务集,5 个任务里 Qwen3.6 与 North Mini Code 35B-A3B 都能解决 4 个、Gemma 4 E2B 失败较多、老款 Nemotron 3 Nano 表现相近。
本地智能体栈:LLM + 推理引擎 + coding harness
本地智能体栈:LLM + 推理引擎 + coding harness

内容精讲

文章开头坦诚作者的日常主力仍是 Codex 与 Claude Code("为了跟上不断加入的新工具与功能"),订阅计划的额度(尤其 Codex)也还很慷慨、暂时不用操心成本;但他一直在用本地方案测试与体验,而且"拥有并使用一套全本地栈"让他感到愉悦。本地方案的吸引力每天都在增加:如果有硬件,运行成本几乎为零;隐私是硬需求——比如处理报销票据这类私人数据,他更愿意让本地模型消化而不是发给 OpenAI 或 Anthropic;再加上 Anthropic 最近有"为 LLM 研究限流其旗舰模型性能"的先例,专有服务未来可能更受限,熟悉开源权重替代品作为备份是明智的。其他动机还包括:可预测的固定成本与免疫 API 涨价、可复现性(模型升级如 GPT 5.4→5.6 可能解决所有查询、但也可能破坏既有工作流)、以及飞机/木屋度假等离线场景。

文章随后解释 harness 与模型的关系:多数 coding harness 原理相似、功能相近,但实现细节不同,且某些 LLM 通常主要针对特定 harness 优化——如果 LLM 开发者同时开发 harness,通常可以合理假设他们的模型"先为自己的 harness 优化"(同时支持其他)。作者主要用 Qwen3.6 + Qwen-Code 组合,理由是:Qwen-Code 像 Codex 一样开源(Claude Code 则不是);Qwen 模型针对 Qwen-Code 专门优化过;可以在同一台机器上并排跑 Codex(配最新 GPT 模型)与 Qwen-Code(配本地 Qwen 模型),无需手动切换。NVIDIA 的 Polar 论文(2026 年 5 月)基准显示,Qwen3.5-4B 基座模型在 Qwen-Code harness 中编码表现最好(RL 前后都是),印证了"模型- harness 匹配"的价值。关于模型本身:Qwen3.6 35B-A3B 约 22GB 下载、需 30-40GB 内存,M4 Mac Mini 与 DGX Spark 上跑得很流畅;架构上是类似 Qwen3-Coder 与 Qwen3.5 的混合注意力。Cohere 六月的 North Mini Code 报告基准显示,Qwen3.6 35B-A3B 在该尺寸等级几乎横扫全部基准(只差一项)——不过 Qwen-Code 是通用 harness,也可以接 North Mini Code 或 Gemma 4 等模型。

本地 LLM 设置环节选择 Ollama 作为推理引擎:相对容易跨平台安装与命令行使用。模型下载方面,Mac 上推荐用 MLX 版本(Apple 的 Metal 性能着色器、为 Apple Silicon 优化):`ollama pull qwen3.6:35b-mlx`;Linux 上用非 MLX 版本 `ollama pull qwen3.6:35b`。Ollama 还支持云端托管开源权重模型(包括当前最强开源权重模型 GLM 5.2,太大无法在消费级硬件本地跑)——云端模型收费、订阅制类似 ChatGPT/Claude,但好处是能方便地"本地式"测试最新 SOTA 开源模型。

关于隐私与安全性,作者专门审查了 Qwen-Code:远程代码执行引擎默认可以用 prompt 引导 agent 读文件、跑命令、经批准的工具发数据,所以"默认 hooks 应关闭";主隐私顾虑大部分可用自定义 ~/.qwen/settings.json 修复(关闭 usageStatisticsEnabled、自动更新、telemetry、logPrompts、所有 hooks 等)。他特别指出 Cline、Codex、Claude Code 有类似的遥测默认需要显式禁用,且 Claude Code 没有官方开源代码库、信任更难,还似乎同时向 Anthropic 与 Datadog 发数据。结论是 Qwen-Code 总体遵循标准实践、无特别非标准的顾虑。安装方面,作者推荐从 GitHub 克隆源码自行构建(比直接跑安装脚本更可审计)。

配置流程很直观:运行 qwen 命令 → 选择 Custom Provider → 选 OpenAI-compatible(Ollama 遵循 OpenAI API 标准)→ 填本地端点 http://127.0.0.1:11434/v1 → 填 ollama 作 API key 占位 → 选择 ollama pull 下载过的模型 → 启用 thinking 模式(更高 token 消耗但解题能力更好)。日常用法与 Claude Code 类似(/ 命令),可用 /model 切换模型、编辑 ~/qwen/settings.json 添加新模型、git pull + npm run build 更新工具。

能力评估部分,作者强调"基准代替不了实测":他建议用一两天真实工作流试用,并维护一套反映自己常见用法的小任务集(他开源了 agent-problem-pack)。他 5 任务小基准的结果:Qwen3.6 与 North Mini Code 35B-A3B 都解决 4/5、Gemma 4 E2B 失败较多、类似尺寸的 Nemotron 3 Nano 表现相近。作为彩蛋他还给出 Codex CLI 与 Claude Code 接本地模型的配置:Codex UI 不支持非 OpenAI 模型,但 CLI 可以——在 ~/.codex/ollama.config.toml 配置 Ollama profile,再用 `codex --profile ollama` 启动;意外发现 Qwen3.6 经 Codex 跑同一小基准的表现优于其在"原生"Qwen-Code 中的表现——尽管样本小,这暗示把 Codex 当通用 harness 用也许不是坏主意。

阅读价值

适合想摆脱订阅、掌控数据或拥有离线开发能力的开发者,以及任何想评估"本地开源模型 + harness"是否够用的工程师:这篇文章是一份从模型选型(Qwen3.6 vs North Mini Code)、推理引擎(Ollama/MLX)、隐私配置、harness 安装(Qwen-Code/Codex/Claude Code)到能力实测的完整落地指南;"模型与 harness 匹配"和"实测优于基准"这两个观点尤其值得实践验证。

阅读英文原文 → 返回 AI 技术文档

本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: https://magazine.sebastianraschka.com/p/using-local-coding-agents