
刚刚35B 开源 Agent 模型上线 OpenRouter开源模型开卷API 生意【免费下载链接】Nex-N2.5-mini项目地址: https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-mini当一家模型厂商把权重开源到 Hugging Face、把入口挂上 OpenRouter这背后不只是多了一个试用渠道而是一场分发逻辑的转向开源模型不再只靠开发者自己下载、自己起服务而是直接进入一个按 token 计费、OpenAI 兼容、开箱即用的全球 API 市场。Nex-AGI 刚刚把 Nex-N2.5 家族的 mini 与 Pro 双双挂上 OpenRouter其中 Nex-N2.5-mini 是一款 35B 级的轻量多模态 Agent 模型。这篇文章结合 OpenRouter 上的真实 API 文档与本仓库源码拆解这次上架的三层含义新的分发通道、社区实操的接入方式以及对本地部署派API 还是自托管的账。一、OpenRouter 上架意味着什么开源模型的新分发通道在 README.md 的首页Nex-N2.5 的入口列表里除了 GitHub、Hugging Face 与官网还赫然列着两条 OpenRouter 链接Pro 与 mini。这并非简单的加个渠道它标志着开源模型商业化的又一个节点第一托管即服务权重与 API 分道扬镳。模型权重照常开源本仓库即 mini 的完整权重16 个 safetensors 分片由 model.safetensors.index.json 索引total_size约 70.2GBbfloat16但想立刻跑起来的人不必再为两张 H100操心——OpenRouter 上已经有服务在跑充值、拿 key、发请求即可。第二OpenAI 兼容协议成为事实标准。从 OpenRouter 模型页可见Nex-N2.5-mini 以标准的 Chat Completions API 对外提供且公开声明的可选参数包括reasoning、reasoning_effort、temperature、top_k、top_p、max_tokens、logprobs等。这意味着现有的 OpenAI SDK 生态、LangChain 等 Agent 框架改一行model字段就能切过来。第三Agent 模型比聊天模型更需要平台级路由。Agent 任务往往要跑几万 token 的推理轨迹中间还伴随工具调用与环境反馈的反复迭代。OpenRouter 的多 provider 路由与按量计费天然适配这种长耗时不挑单次质量的负载形态——这正是 Agent 模型与 API 市场互相需要的地方。二、社区最新实操接入、调参与生产实践社区中已经出现Nex-N2.5 上线 OpenRouter接入、调参与生产实践指南这类跟进文章核心操作其实非常简单一切围绕 OpenAI 兼容接口展开。接入一个 curl 即可完成首调curl -X POST https://openrouter.ai/api/v1/chat/completions \ -H Authorization: Bearer $OPENROUTER_API_KEY \ -H Content-Type: application/json \ -d { model: nex-agi/nex-n2.5-mini, messages: [ {role: user, content: Explain how binary search works.} ] }响应结构与 OpenAI 完全一致choices[].message返回正文usage中带有 token 数与费用估算开启stream: true则返回 SSE 流式数据。生产环境需要重点处理的是错误码语义——400 为参数不支持、401/403 为鉴权与限额、429 需退避重试、502 为上游生成失败该场景不扣费这套约定与主流模型 API 完全对齐接入成本几乎为零。调参用reasoning_effort控制思考模式Nex-N2.5 的核心卖点是自适应思考这一点在 chat_template.jinja 中体现得淋漓尽致模板会依据reasoning_effort决定是否输出think推理块——none直接回答、high强制思考、medium让模型自行判断要不要思考。README 的采样建议是temperature0.7, top_p0.95, top_k40OpenRouter 侧同样开放这三个参数。Agent 场景的常见做法是首轮用medium快筛、关键决策点切high把推理预算花在刀刃上。生产要点函数调用与推理解析是 Agent 的骨架Agent 不是能聊天而是能干活。仓库里的 chat_template.jinja 内置了完整的工具调用协议系统提示中注入tools声明模型以tool_callfunction...parameter.../function/tool_call的 XML 结构发起调用工具结果以tool_response回灌并支持多步工具循环模板会反向扫描确保最后一个 user 消息是真实查询而非工具回包。本地以 SGLang 部署时需配套--tool-call-parser qwen3_coder与--reasoning-parser qwen3才能正确解析这两种特殊输出——这是从能生成文本到能驱动工具的关键一跳。三、Agent 能力从哪来仓库源码里的工程细节OpenRouter 上的模型与服务能力并非凭空而来仓库里的一行行配置揭示了它的血统。config.json 显示其model_type为qwen3_5_moe40 层结构256 个 MoE 专家、每个 token 激活 8 个num_experts_per_tok: 8并带 shared expert注意力采用线性注意力 全注意力交替full_attention_interval: 4每 4 层插入一次全注意力max_position_embeddings达 262144——即 262K 长上下文足够容纳一条长程 Agent 任务的全部探索轨迹。视觉侧由 processor_config.json 支持图像与视频输入Qwen3VLProcessortemporal patch 采样这正是通过视觉反馈感知环境、验证结果、推进任务的硬件基础。权重侧model.safetensors.index.json 显示总权重约 70.2GBbfloat1616 分片。之所以 35B 级模型权重体积这么大是因为 256 个专家全部落盘实际推理时单 token 只激活 8 个专家显存占用与算力消耗远低于全量加载的直觉。社区已有实践把同系模型经 mlx 静态混合量化压到 17.8GB、峰值内存约 17.9GB推理约 50 tokens/s也有安卓端 GGUFQ4_K_M落地对比的工程复盘——这些都在说明同一件事这个模型从云上 API 到本地边缘每一档硬件都有对应的姿势。部署层面的官方姿势也写得很清楚mini 单节点 2×H100、--tp 2配合定制 SGLang fork 镜像nexagi/sglang:v0.5.18-nex-patch并建议开启--mamba-scheduler-strategy extra_buffer以应对长推理轨迹下的调度压力——这套参数就是官方在 OpenRouter 背后跑服务的参考配置。四、对本地部署派的影响API 还是自托管上架 OpenRouter 之后API 还是自托管第一次成为值得摆上桌面算的账。自托管派的核心筹码是三样数据不出域、按量可控、可微调。Agent 场景会反复把业务数据喂进上下文代码库、数据库 Schema、企业内部文档自托管在合规上无可替代且 config.json 的 bfloat16 全精度权重支持继续预训练与微调这是 API 永远给不了的。2×H100 的门槛对个人开发者不低但对有合规需求的团队而言这笔基建投入是买数据主权。API 派的核心筹码则是时间与边际成本。先不算硬件折旧光是把 SGLang 定制 fork、推理解析器、函数调用解析器、长上下文调度这整套环境调通就足以劝退不少只想验证 Agent 效果的团队。OpenRouter 按 token 计费把前期的环境成本摊薄为零——尤其适合 PoC、爬坡期产品与偶发高负载。一个现实的混合策略正在成为社区共识先 API 验证效果把链路、参数与工具协议跑通再在业务稳定后迁回自托管甚至用 API 作为自托管集群的弹性溢出通道。因为两边的接口语言是一致的——OpenAI 兼容的 Chat Completions、同一份reasoning_effort语义、同一套工具调用协议迁移成本被压到了最低。结语把权重开源到社区、把 API 挂上 OpenRouterNex-AGI 实际上同时踩中了两条增长曲线一条是开源生态的信任曲线可审计、可微调、可私有化一条是 API 市场的效率曲线即开即用、按量付费。当 35B 级 Agent 模型把思考、工具调用、多模态感知这些能力以标准协议公开售出开源模型之间的竞争就正式从谁的权重能下载进入谁的 API 更好用的下半场。对开发者而言这是最好的时代能力在门口路费按 token 算随时可以转身自建。【免费下载链接】Nex-N2.5-mini项目地址: https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-mini创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考