K2 Horizon 36B-A4B 本地部署,先确认权重大小和运行支持
核对 K2 Horizon MoVA 36B-A4B 的 BF16 GGUF 文件、显存计算边界与运行时支持,再选择硬件或与 Qwen3.6-35B-A3B 比较。
下载 K2 Horizon 36B-A4B 前,先确认准确的模型仓库、运行时支持和权重格式。这次检查的官方 GGUF 快照包含约 74.925 GB 的 BF16 文件;上游架构支持仍在推进,模型卡指向 IFM 的 llama.cpp 分支。A4B 不能理解为只需存储 40 亿参数的内存预算。
本文为评估本地推理的开发者提供部署规划参考。我们于 2026 年 9 月 14 日检查了官方文档和仓库元数据,没有下载完整权重,没有在消费级 GPU 上运行,也没有实测与 Qwen 的速度对比。下面的硬件估算是算术示例,不是已验证配置。
选运行框架前,先认准模型
官方仓库的准确名称是 IFM/K2-Horizon-MoVA-36B-A4B。它来自 IFM,不是 Moonshot 的 Kimi K2。复制名字相近模型的安装命令,不能证明架构兼容。
模型卡描述了总计 36B、激活 4B 参数的稀疏骨干,以及原生 512K 上下文。这些数字都有明确范围,不能直接用来替代全部存储张量或完整运行内存的统计。
宣传的最大上下文,也不代表每套本地配置都能分配出来。权重、缓存和运行缓冲区需要一起容纳。应从文档支持的配置和适度负载开始,而不是因为模型卡写了最大值,就直接选满上下文。
官方 GGUF 快照实际提供了什么
官方 GGUF 仓库将权重标为 BF16。这次检查的文件列表包含 K2-Horizon-36B-BF16.gguf,大小为 74,924,627,296 字节,约为十进制 74.925 GB,或二进制 69.779 GiB。下载页面与操作系统显示的单位不同,比较时要分清。
这不能证明已有官方 Q4 文件。如果出现社区转换版,需要独立核对发布者、revision、格式和运行要求。文件扩展名看起来熟悉,也不代表已经安装的推理引擎支持该架构。
| 需要确认的项目 | 为什么会影响部署 |
|---|---|
| 模型仓库与 revision | 确定实际架构和权重 |
| BF16 或量化格式 | 改变存储与加载要求 |
| 运行时分支和 commit | 决定是否实现该架构 |
| 上下文与并发 | 影响权重之外的内存需求 |
| 模态和辅助文件 | 可能增加纯文字估算遗漏的组件 |
算出 4 bit 权重体积,不代表已有可用部署
举例说,360 亿参数乘以 4 bit,再除以 8,得到 180 亿字节,即 18 GB 的原始权重数值。这个计算没有包含额外张量、量化缩放数据、元数据和运行时分配,也不能证明对应量化文件已经发布,或被相关运行时支持。
如果改用 4B 激活参数计算,回答的就变成了某条计算路径的问题。稀疏模型仍需要访问对当前 token 未激活的权重。运行时的设备放置或卸载策略可以改变权重存放位置,但不能让剩余权重消失。
不能仅凭 A4B 标签规划 16 GB 全 GPU 部署。快照中的官方 BF16 文件大得多;即使讨论假设量化格式,也要算完整预算。类似的统计陷阱,可参阅总参数、激活参数与文件体积的区别。
按文档支持的运行路径部署
官方 GGUF 模型卡说明,上游 llama.cpp 支持仍在推进,并引导用户使用 IFM 分支。托管页面自动生成的“使用此模型”组件,不是端到端兼容性测试;从其他架构复制的通用 Ollama 命令也一样。
主模型卡包含在两张 H200 GPU 上验证的服务配置。这说明的是发布者记录的环境,不是消费级 GPU 推荐。运行方案前,记录分支、commit、依赖、权重 revision 和启动参数,便于之后复现故障。
先确认运行时能加载准确的架构与权重,再用简短文本请求验证,随后才测试更长上下文。K2 Horizon 被列为文本生成模型;不能因为对比模型支持图像,就认定它也接受图片。如果基本加载失败,调高输出 token 或换提示词无法解决架构不支持的问题。
与 Qwen 比较,也要对准版本
本文指定的对比模型是 Qwen/Qwen3.6-35B-A3B。其官方模型卡描述了 35B 语言模型、3B 激活参数和视觉编码器。它的原生上下文与扩展方案也各有文档限制。不要替换成没有指明版本的 Qwen 35B,也不要认为名字相近的版本都能用同样的运行方式。
比较模型的标称参数量之前,先比较可用权重格式与软件支持。如果两者都适合现有硬件,再使用同样的任务、上下文、并发和验收标准。实际内存峰值、首次输出时间、生成速度和任务结果应分别记录。
本文不宣布速度或质量上的胜者。没有对齐硬件、格式和任务条件时,社区速度报告可以提供配置参考,但不构成受控比较。现有 Qwen 本地内存指南说明了为何下载大小与运行内存需要分开处理;那篇讨论的是另一个 Qwen 模型。
常见问题
K2 Horizon 与 Kimi K2 是同一个模型吗?
不是。请核对发布者与准确仓库 ID。本文讨论 IFM 的 K2 Horizon MoVA 36B-A4B。
A4B 代表小显卡也能装下吗?
不是。激活参数描述单个 token 的计算,而非整个模型的存储需求。要为全部所需权重和运行内存做预算。
普通 llama.cpp 不看版本就能用吗?
不能这样假设。这次核对的官方 GGUF 模型卡指向 IFM 分支,上游支持仍在推进。部署前应查看当前支持说明和具体 revision。
常见问题
- K2 Horizon 就是 Kimi K2 吗?
- 不是。本文讨论 IFM/K2-Horizon-MoVA-36B-A4B。
- A4B 表示全部内存需求吗?
- 不是。激活参数不包含全部存储权重,也不代表运行时内存。
- 本文实测了消费级 GPU 部署吗?
- 没有。依据是官方文档、文件元数据及明确标注的算术示例。


