2026/10/11 20:05:20

断层领先的含金量:MindCube-tiny 与 ViewSpatial 为何拉开身位

断层领先的含金量:MindCube-tiny 与 ViewSpatial 为何拉开身位 断层领先的含金量MindCube-tiny 与 ViewSpatial 为何拉开身位【免费下载链接】ZDTaichu5.0-9B项目地址: https://ai.gitcode.com/hf_mirrors/TaichuAI/ZDTaichu5.0-9B九月的开源多模态赛道上最值得拆解的事件之一是紫东太初 ZDTaichu5.0-9B 以约 9B 参数同时刷新了空间具身与通用多模态两条能力线。社区情报中反复出现同一个措辞——断层领先并且具体指向两个基准MindCube-tiny三维空间推理与 ViewSpatial动态视角空间一致性。多数解读停留在9 项基准 8 项第一的概括上但第一和断层之间隔着巨大的技术鸿沟。本文以九大空间基准的完整成绩单为起点深入仓库源码把这两项全场第一背后的位置编码、视觉表征、数据处理与推理协议逐层拆开。九大空间基准全景与成绩单官方模型卡README.md把空间能力拆成三组九个基准并与 Qwen3.5-9B、STEP3-VL-10B、gemma4-8B-E4B 三个开源对手以及 Gemini 3 Pro、Grok 4、GPT-5.2 三个闭源对手同场比较分组基准ZDTaichu5.0-9BQwen3.5-9BSTEP3-VL-10Bgemma4-8B-E4BGemini 3 ProGrok 4GPT-5.2基础空间感知CV-Bench86.8287.1983.4968.1090.07—86.84基础空间感知3DSRBench60.9656.7855.0153.6268.9254.9360.20基础空间感知SparBench51.8250.7945.6828.5048.7444.7655.07复杂空间推理ViewSpatial62.5048.2046.1441.6850.3643.2347.30复杂空间推理MMSI-Bench47.2038.7032.1829.2045.2037.8041.30复杂空间推理MindCube-tiny78.2757.6062.8148.8570.8763.5660.38具身交互ERQA48.0041.5047.7530.2066.00—59.80具身交互RoboSpatial56.0054.1052.8649.4357.40—43.78具身交互VSI-Bench59.6955.6842.4232.9152.5147.9254.49加粗对比开源模型最佳下划线全部列出模型最佳—为该基准未参与。数据取自 README.md九项中八项开源第一且 ViewSpatial、MMSI-Bench、MindCube-tiny、VSI-Bench 四项连闭源模型一并压过。真正的断层出现在复杂空间推理这一档MindCube-tiny 上 78.27 分把最强闭源 Gemini 3 Pro70.87甩开 7.4 分比同参数段的 Qwen3.5-9B 高出 20.67 分ViewSpatial 上 62.50 分领先最佳闭源 12.14 分几乎是 gemma4-8B-E4B41.68的 1.5 倍。这一档考的不是认出物体而是想清楚空间关系——正是具身智能与机器人落地最难啃的部分。MindCube-tiny三维推理断层领先的技术来源MindCube-tiny 考查的是物体在旋转、平移、视角切换后的空间状态判断属于典型的mental transformation任务——模型必须在内部完成一次三维心智旋转。20 分上下的差距不是多训几轮能抹平的它来自位置编码、视觉表征、训练数据与推理协议的四层协同。第一层3D M-RoPE把图像当成有厚度的空间。仓库的架构注释modeling.py写得很直白视觉 token 接收三维位置 IDtemporal、height、width文本 token 保持标准一维位置。get_vision_position_ids()按 InternVL 风格的分块网格为每个 tile 计算 (t, h, w) 三维坐标get_rope_index()再用mm_token_type_ids把文本、图像、视频按模态分组生成形状为 (3, B, S) 的位置张量最终交给Qwen3_5TextRotaryEmbedding的 interleaved M-RoPE 消费配置见 configuration.pymrope_section: [11, 11, 10]、mrope_interleaved: true、partial_rotary_factor: 0.25。推理时_prepare_position_ids_for_generation在 prefill 阶段算好 3D 位置并缓存rope_deltas后续 decode 步直接复用。这意味着模型从第一层注意力开始就知道这个 token 在第几行、第几列、哪个视点三维推理的几何先验被直接写进了位置编码而不是让模型从像素里硬猜。第二层C-RADIOv4-H 视觉塔653M 参数、三教师蒸馏。视觉编码器是 ViT-H/16653M配置中的 teachers 列表暴露了它的知识来源siglip2-g-384、dino_v3_7b 与 sam3 三个教师分别贡献语义对齐、深度级表征与分割先验config.json。特征经由extract_feature()走 pixel_shuffle空间到深度重排ps_versionv2修正了布局后进入三层投影RMSNorm → Linear(5120→20480) → SquaredReLU → Linear(20480→4096)modeling.py。三维推理最需要的物体边界、遮挡层次、深度顺序信息早在视觉塔阶段就被压缩进了表征——这是单靠语言模型强化无法替代的部分。第三层动态分块与任意分辨率不把细节丢掉。image_processing.py 里的dynamic_preprocess实现了带两道护栏的 InternVL 风格分块面积上限护栏保证tile 数不超过源图像素宽高比护栏剔除与原图比例偏差超过 3 倍的畸形候选并始终附加一张全图缩略图。窄长全景、低分辨率小图都不会被暴力压扁成固定方形三维推理所依赖的细节与比例关系得以保留。第四层空间能力是训练范围不是补丁。模型卡明确列出空间训练覆盖README.md左右/上下/前后、遮挡、包含、相对距离稠密计数、细粒度定位、点/坐标/边界框跨图像与视点关联相机运动、相对位姿、深度排序、房间级布局自我中心egocentric与他者中心allocentric视角2D/3D 旋转、折纸、三视图投影、截面、部件运动推理。社区报道同步印证官方开放了全流程空间多模态数据生产管线支撑工业与机器人真实场景的持续迭代——MindCube-tiny 这类心智旋转任务正是这套训练体系里的标准动作而非特例。第五层推理协议想必须发生在答之前。模型卡脚注规定ViewSpatial、MMSI-Bench、MindCube-tiny、VSI-Bench 四类多图空间推理评估时要求模型先输出think/think包裹的内部推理再以\boxed{}给出最终答案README.md且 chat_template.jinja 原生支持think标签的解析与剥离。官方同时给出采样建议空间推理与 grounding 类任务使用temperature0README.md把解码随机性降到最低。发布亮点中的 Entropy-Gated Adaptive Recurrent Reasoning熵门控自适应循环推理则进一步声称对高不确定性 token 在潜在空间内动态追加循环细化步把算力花在最难的推理环节上。ViewSpatial动态视角一致性为何难追ViewSpatial 考的是换个机位场景还是不是同一个场景——相机运动、相对位姿、深度排序、房间级布局、跨视角物体对应。它比 MindCube-tiny 更隐蔽的难点在于单图内可以靠启发式蒙对跨视角一致性却要求模型把同一空间的多帧观测在内部对齐成一个连贯的几何模型。ZDTaichu5.0-9B 在此项拿到 62.50比闭源最强的 Gemini 3 Pro50.36高 12 分——这个差距的来源比 MindCube-tiny 更依赖整体架构。多图统一建模图像不是孤立的。前向过程把所有图像 tile 注入同一条 token 序列由mm_token_type_ids分组、get_rope_index()统一分配 3D 位置modeling.py。多张图在同一序列中共享位置坐标系模型学到的不是图 A 是什么、图 B 是什么而是图 A 与图 B 是同一空间的两次观测。能力清单中的 association across images and viewpoints跨图像与视点关联正是为此设计的训练目标。视频按多图处理时间维等于视点序列。processing.py 的处理逻辑很有意思视频不做独立的时间流处理而是每帧按max_num_tiles1切成 512×512 单 tile与图片共享同一条像素管线帧头写入 Frame N sampled at T.TT seconds: 文本mm_token_type_ids中甚至不出现视频类型。下游模型看到的是一个帧序排列的多图序列而在 M-RoPE 位置生成里modeling.py每帧 token 的 t 通道锚定vid_spatial_start frame_idx随时间步进h/w 通道保持不变——相机在动、物体空间位置不变这个物理事实被直接编码成了归纳偏置。帧间文本走独立位置区间视频结束自动复位状态机。动态视角一致性的底层语法就这样搭在了静态空间推理的同一套机制上。为什么别人追不上视角一致性是整体涌现不是单项加练。对比同代模型会发现规律STEP3-VL-10B 在 MindCube-tiny 上能到 62.81ViewSpatial 却只有 46.14Qwen3.5-9B 两者分别 57.60 与 48.20。语言理解强的模型未必视角一致性强——视角一致性同时依赖视觉塔的表征保真度C-RADIO 三教师蒸馏带来的深度与分割先验和位置编码的几何保真度3D M-RoPE 的时间/空间解耦两个条件缺一个跨视角对应就会退化成图像相似度匹配。闭源模型同样没能追平GPT-5.247.30、Grok 443.23在这一项集体失守说明这不是规模问题而是架构取舍问题。工程可复现性是断层能落地的最后一块拼图。领先的空间能力如果没有部署链路支撑只会停留在论文层面。仓库给出了两条完整路径Hugging Face Transformers 离线推理三条调用即可完成多模态生成README.md在线服务则适配了 vLLM v0.26.0 定制分支需要--mamba-ssm-cache-dtype float32、--gdn-prefill-backend triton等针对混合 DeltaNet/注意力架构的参数--max-model-len 220000支撑长视频输入。9B 规模配合单卡部署正是边缘计算与机器人场景的甜蜜点——这解释了为何社区把 ZDTaichu5.0-9B 与物理 AI 产业验证期绑定在一起讨论。结论九项空间基准八项开源第一、四项全场第一其中 MindCube-tiny 与 ViewSpatial 的领先幅度以断层形容并不夸张。逐层拆解后可以看到这种领先不是单一技巧的胜利而是四件事的叠加3D M-RoPE 把空间几何写进位置编码、C-RADIOv4-H 以三教师蒸馏沉淀深度级视觉先验、动态分块保住任意分辨率下的细节、空间感知与跨视角关联进入原生训练范围。对开发者而言真正有价值的信息是在 9B 这个量级空间具身能力的上限不由参数量决定而由架构对空间结构的归纳方式决定——这也是轻量模型适配物理世界这条技术路线被验证的意义所在。【免费下载链接】ZDTaichu5.0-9B项目地址: https://ai.gitcode.com/hf_mirrors/TaichuAI/ZDTaichu5.0-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考