2026/10/3 7:26:16

Agent 技术摘要 06 —— Harness、原生视觉、Jev、mmproj、dsh

Agent 技术摘要 06 —— Harness、原生视觉、Jev、mmproj、dsh 本系列为笔者在实习过程中的所见所闻记录内容为技术摘要旨在提供关于Agent领域相关技术名词的通俗和简要介绍详细内容暂不展开供同在该领域进修的童鞋们参考。01 Harness用来控制、约束和自动化运行代码的框架或平台它的竞品包括 Jenkins、GitHub Actions、GitLab CI、ArgoCD 等。想象你去了一个超级现代化的机场Harness 平台你把行李代码扔进传送带系统自动帮你过安检跑自动化测试系统自动帮你打包贴标签打包成 Docker 镜像打上 Tag系统自动把行李送到对应的登机口触发 Promotion把代码晋级到 Stage 环境 或 Prod 环境。Harness (Harness.io) 就是这样一个商业化的 DevOps 平台。程序员写完代码点一下提交Harness 就会接管后续所有的脏活累活保证代码安全、自动地上线。如果你用 Python 写代码你用的pytest框架本质上就是一个 Test Harness。 如果你用 JavaJUnit就是一个 Test Harness。有时候程序员为了测试某个特定的函数会自己手写一段测试脚本这段专门用来跑测试的脚本也可以被称为 Test Harness。看到 Harness 的地方它的真实身份通俗理解公司的发布流程/运维文档Harness.io (CI/CD 平台)帮你把代码自动打包、晋级到 Stage 环境的“流水线大管家”代码仓库/测试目录/教科书Test Harness (测试框架)带有“副刹车”的教练车用来安全地运行和给你的代码打分英文 AI 论文动词 (Harness)“利用 / 驾驭” Harness the power of AI02 原生视觉指模型能够直接利用图像的视觉表示进行理解和推理而不是只接收外部 OCR 或图像描述工具转换出来的文字。直接看图不等于模型不需要编码器或预处理而是视觉信息不必先被压缩为一段自然语言描述。 Qwen2.5-VL 就包含视觉编码器并通过视觉语言对齐和端到端训练学习多模态能力。有些厂商用 natively multimodal 强调模型从预训练阶段就联合学习多种模态而不是先训练纯文本模型再添加视觉模块进行适配。例如Google 对 Gemini 的“原生多模态”描述明确包含“从一开始就在不同模态上预训练”。概念说明什么VLM模型能够关联和处理视觉与语言原生视觉能力通常强调模型内部能利用视觉输入而非仅依赖外部转文字原生多模态训练通常强调多模态能力在预训练阶段就被联合学习03 Jev给程序做结构化决策的模型Jev 是 TypeSafe AI 推出的决策模型官方称为 System One Model。它接收上下文和指定类型的问题返回选择、评分、概率等结构化结果主要用于分类、路由和筛选。例如一个客服 Agent 收到上下文用户说“本月被重复扣款请退款” 问题交给哪个部门 候选项账务、技术支持、销售 输出账务以及相应的概率或置信度04 mmproj本地多模态推理使用的配套权重组件mmproj 来自 multimodal projector多模态投影器在 llama.cpp 的 GGUF 生态中它通常指一个配套权重文件例如model.gguf mmproj-model-f16.gguf主模型文件负责语言模型部分mmproj 文件负责多模态侧的编码与投影。05 dshDeepSeek Harness是 DeepSeek 开发的开源 Agent Harness采用高度插件化的架构。可以让 Agent 编写适用于 dsh 插件体系的代码实现你需要的工作流或扩展能力。dsh-TUITerminal User Interface终端用户界面。它在终端里为 DeepSeek Harness 提供全屏交互、流式 Markdown、工具调用展示、会话管理和状态显示等功能。