
如何让自己的本地AI写代码SmallCode对接LM Studio、Ollama与llama.cpp全流程及.env配置详解【免费下载链接】smallcodeAI coding agent optimized for small LLMs. 87% benchmark with 4B-active model.项目地址: https://gitcode.com/gh_mirrors/sm/smallcode想让本地AI写代码却总被小模型不听话劝退SmallCode 正是为此而生的本地AI编程代理AI Coding Agent专为 8B–35B 参数的小模型优化通过上下文预算、宽容的工具调用解析和 TODO 驱动规划让消费级显卡甚至 CPU 上的本地模型也能稳定地读文件、改代码、跑测试全程不经过任何云端 API。本文带你从零完成SmallCode 对接 LM Studio、Ollama、llama.cpp的完整流程并逐项详解.env配置。一、SmallCode 是什么SmallCode 是一个终端原生的 AI 编程代理核心定位只有一个让本地小模型干好写代码这件事。和假设你拥有前沿大模型的通用工具不同它的每一项设计都在为小模型补短板维度传统工具面向前沿模型SmallCode面向本地小模型目标模型Claude / GPT 等前沿模型8B–35B 本地模型上下文全量注入容易爆窗预算管理 自动摘要工具调用假设 JSON 完美可靠宽容解析器多格式自动修复任务规划一次性生成TODO 文件分解成原子步骤文件编辑整文件重写搜索替换补丁patch隐私请求发送到云端完全本地运行无需联网一句话总结代码不出本机小模型也能干活。二、环境准备与一键安装2.1 系统要求Node.js 18推荐 20.x / 22.x LTS一个本地模型服务LM Studio、Ollama 或 llama.cpp三选一即可可选Python 3 Git仅在使用 RAG 代码索引时需要2.2 安装 SmallCode方式一npm 全局安装最省事npm install -g smallcode # 或直接用 npx 试运行npx smallcode方式二克隆源码直接运行git clone https://gitcode.com/gh_mirrors/sm/smallcode cd smallcode npm install node bin/smallcode.js安装成功后进入你想让 AI 编辑的项目目录输入smallcode即可启动全屏终端界面。如果终端显示异常加--classic使用经典界面。三、对接三大本地模型服务LM Studio / Ollama / llama.cpp SmallCode 只认一种协议——OpenAI 兼容接口所以任何提供/v1端点的本地推理服务都能接。下面按三种主流方案分别说明。3.1 对接 LM Studio图形界面新手首选打开 LM Studio下载并加载一个编码模型如 Qwen Coder 等 8B–35B 本地编程模型在侧边栏启动Local Server本地服务器记下 LM Studio 显示的模型名称它默认监听http://localhost:1234/v1。完成后在小模型服务里看到的模型名就是要填进.env的SMALLCODE_MODEL。3.2 对接 Ollama命令行党最爱Ollama 拉取模型只需一行例如ollama pull qwen2.5-coder:14bOllama 默认监听11434端口。注意它的 OpenAI 兼容接口在/v1路径下。好消息是 SmallCode 内置了地址自动归一化——即使你只写了http://localhost:11434忘了带/v1它也会自动补全逻辑见 bin/config.js。3.3 对接 llama.cpp server极客向、性能可调用 llama.cpp 的llama-server启动 OpenAI 兼容服务后默认监听8080端口SMALLCODE_BASE_URLhttp://localhost:8080/v13.4 三大服务端口速查表 ✅本地服务默认 Base URL填入 .env典型模型LM Studiohttp://localhost:1234/v1任意 GGUF 模型Ollamahttp://localhost:11434/v1qwen2.5-coder:14b、gpt-oss:20bllama.cpphttp://localhost:8080/v1任意 GGUF 模型模型怎么选SmallCode 官方推荐8B–35B更小的模型≤4B难以完成多步工具调用更大的模型则不需要 SmallCode 的扶小模型机制。仓库内置了多份模型档案如 profiles/qwen3-8b.toml、profiles/qwen2.5-coder-14b.toml会自动适配上下文长度、工具调用格式与提示策略。完整 LM Studio / llama.cpp 设置细节可参考 docs/rag-harness.md。四、.env 配置详解两个必填项 常用可选项 在项目根目录创建.env文件这是 SmallCode 与你的本地模型接线的唯一入口。所有可选配置项都能在全量模板 .env.example 中查到。4.1 必填两项模型名 服务地址SMALLCODE_MODELyour-model-name SMALLCODE_BASE_URLhttp://localhost:1234/v1SMALLCODE_MODEL模型名称必须与本地服务中显示的完全一致Ollama 如qwen2.5-coder:14bLM Studio 如加载时显示的 GGUF 名。SMALLCODE_BASE_URL对应上表的 Base URL。4.2 高频可选项超时、思考预算、双档路由# 慢速硬件纯 CPU 推理把模型响应超时从 300 秒调大 SMALLCODE_MODEL_TIMEOUT1800 # 限制推理型模型的思考token默认 2000 SMALLCODE_THINKING_BUDGET2000 # 双档路由简单任务走本地硬失败后升级到大模型可选云端 SMALLCODE_MODEL_STRONGopenai/gpt-4o-mini SMALLCODE_BASE_URL_STRONGhttps://openrouter.ai/api/v1双档路由是新手容易忽略的亮点日常编码全部留在本地只有当本地模型重试、任务分解后仍然失败时才按你的配置升级到更强模型且默认每次会话最多升级 5 次并弹窗确认防止费用失控。4.3 不想手写 .env用 /provider 向导 SmallCode 内置交互式配置向导启动后输入/provider它会带你选择服务商LM Studio / Ollama / 自定义…→ 填 Base URL → 实测/v1/models接口验证连通性 → 选模型最后保存为全局或项目级.env全程不用手改文件。另外SmallCode 也兼容 smallcode.toml 配置文件向后兼容其中[model]段可以写name、baseUrl、timeout效果与.env等价。五、启动 SmallCode本地AI开始写代码 ⚡配置完成后在你的项目目录执行smallcode常见启动方式smallcode --classic # 经典界面终端兼容性问题时用 smallcode -P fix the parser bug # 一次性任务模式 smallcode --resume # 继续上一次的会话进入界面后直接输入任务比如给这个 Express 项目加一个 /health 接口AI 就会自己读代码、改文件、跑验证。常用斜杠命令命令作用/provider交互式配置模型服务商/model、/profile查看/切换当前模型与档案/plan查看 AI 当前的任务分解计划/budget、/tokens查看上下文预算与 token 用量/undo撤销上一次编辑/help查看全部命令六、常见问题排查连不上、超时、界面异常怎么办 ️症状大概率原因解决Cannot reach endpointBase URL 端口或/v1写错对照 3.4 速查表确认模型服务已启动模型名匹配失败.env里的名字与服务端不一致用服务端的模型列表核对向导会自动探测timeout: no response after 300s纯 CPU / 老硬件推理慢SMALLCODE_MODEL_TIMEOUT1800全屏界面乱码终端不支持备用屏幕smallcode --classic多步任务频繁跑偏模型太小换 8B 以上编码模型如 14B七、延伸资料与模块路径 想更深入地了解架构与源码可以从这些地方入手完整本地部署与 RAG 索引指南docs/rag-harness.md全量配置项模板.env.example默认 TOML 配置含双档路由示例smallcode.toml端点自动归一化逻辑bin/config.js架构总览ARCHITECTURE.md内置技能TDD、调试、头脑风暴等skills/README.md小结装好 SmallCode → 启动 LM Studio / Ollama / llama.cpp 任一服务 →.env填对模型名和 Base URL → 在项目目录敲下smallcode你的本地 AI 就开始写代码了。全程离线、代码不出机器这正是本地模型编程最大的底气。【免费下载链接】smallcodeAI coding agent optimized for small LLMs. 87% benchmark with 4B-active model.项目地址: https://gitcode.com/gh_mirrors/sm/smallcode创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考