GLM 5.1/5.2#
一个大型的专家混合模型,使用 动态稀疏注意力 (DSA),由 GLM-5.1 / GLM-5.2 系列共享。与 DeepSeek-V4-Flash 类似,稀疏注意力路径将模型的层分成多个 KV Cache 组;LMCacheMPConnector 在其自己的块大小中存储和检索每个组,因此 KV 重用在没有额外标志的情况下工作。
验证过的模型#
zai-org/GLM-5.2-FP8 (8 GPUs)
引擎文档: GLM-5.2 在 vLLM 支持的模型 (架构 GlmMoeDsaForCausalLM)。另见 vLLM GLM-5.2 食谱。
状态: 已通过 LMCache (vLLM 0.23.0 + LMCache 0.4.7) 验证。
启动 LMCache MP 服务器:
lmcache server \
--port 6555 \
--max-workers 8 \
--l1-size-gb 100 \
--eviction-policy LRU \
--chunk-size 1024
使用 LMCache MP 连接器(8 个 GPU)启动 vLLM:
vllm serve zai-org/GLM-5.2-FP8 \
--tensor-parallel-size 8 \
--tool-call-parser glm47 \
--enable-auto-tool-choice \
--reasoning-parser glm45 \
--no-enable-prefix-caching \
--kv-transfer-config \
'{"kv_connector":"LMCacheMPConnector","kv_role":"kv_both","kv_connector_extra_config":{"lmcache.mp.port":6555}}'
--tool-call-parser glm47、--enable-auto-tool-choice 和 --reasoning-parser glm45 是 GLM-5.2 的服务要求(请参见 vLLM 配方)。--no-enable-prefix-caching 将所有 KV 重用路由通过 LMCache,而不是 vLLM 的引擎内前缀缓存。服务器的 --port 6555 必须与连接器配置中的 lmcache.mp.port 匹配;--max-workers 设置为张量并行大小。调整 --tensor-parallel-size 以匹配您的硬件。有关通用的 LMCache + vLLM 连接(端口、远程主机),请参见 快速入门。
如果在 vLLM 设置中遇到任何问题,请参考 vLLM Recipes 以获取更多详细信息。
状态: 未通过 LMCache 验证。
状态: 支持。TRT-LLM + LMCache 的配置方式,请参阅 快速入门。
CacheBlend 支持#
未验证。
压缩支持#
方法 |
状态 |
备注 |
|---|---|---|
未验证 |
注意事项#
动态稀疏注意力 KV 组。 GLM-5.2 的 DSA 路径将模型的层分成多个具有不同块几何形状的 KV 缓存组。LMCache 在其各自的块大小中存储和检索每个组;除了上述启动命令外,不需要额外的标志。