GLM 5.1/5.2#

一个大型的专家混合模型,使用 动态稀疏注意力 (DSA),由 GLM-5.1 / GLM-5.2 系列共享。与 DeepSeek-V4-Flash 类似,稀疏注意力路径将模型的层分成多个 KV Cache 组;LMCacheMPConnector 在其自己的块大小中存储和检索每个组,因此 KV 重用在没有额外标志的情况下工作。

验证过的模型#

引擎文档: GLM-5.2 在 vLLM 支持的模型 (架构 GlmMoeDsaForCausalLM)。另见 vLLM GLM-5.2 食谱

状态: 已通过 LMCache (vLLM 0.23.0 + LMCache 0.4.7) 验证。

启动 LMCache MP 服务器:

lmcache server \
    --port 6555 \
    --max-workers 8 \
    --l1-size-gb 100 \
    --eviction-policy LRU \
    --chunk-size 1024

使用 LMCache MP 连接器(8 个 GPU)启动 vLLM:

vllm serve zai-org/GLM-5.2-FP8 \
    --tensor-parallel-size 8 \
    --tool-call-parser glm47 \
    --enable-auto-tool-choice \
    --reasoning-parser glm45 \
    --no-enable-prefix-caching \
    --kv-transfer-config \
    '{"kv_connector":"LMCacheMPConnector","kv_role":"kv_both","kv_connector_extra_config":{"lmcache.mp.port":6555}}'

--tool-call-parser glm47--enable-auto-tool-choice--reasoning-parser glm45 是 GLM-5.2 的服务要求(请参见 vLLM 配方)。--no-enable-prefix-caching 将所有 KV 重用路由通过 LMCache,而不是 vLLM 的引擎内前缀缓存。服务器的 --port 6555 必须与连接器配置中的 lmcache.mp.port 匹配;--max-workers 设置为张量并行大小。调整 --tensor-parallel-size 以匹配您的硬件。有关通用的 LMCache + vLLM 连接(端口、远程主机),请参见 快速入门

如果在 vLLM 设置中遇到任何问题,请参考 vLLM Recipes 以获取更多详细信息。

状态: 未通过 LMCache 验证。

状态: 支持。TRT-LLM + LMCache 的配置方式,请参阅 快速入门

CacheBlend 支持#

未验证。

压缩支持#

方法

状态

备注

CacheGen

未验证

注意事项#

  • 动态稀疏注意力 KV 组。 GLM-5.2 的 DSA 路径将模型的层分成多个具有不同块几何形状的 KV 缓存组。LMCache 在其各自的块大小中存储和检索每个组;除了上述启动命令外,不需要额外的标志。