BlendServe
-
聊聊大模型推理系统之 BlendServe:通过资源感知批处理策略,最大化硬件资源利用率和推理吞吐量
作者:InternLM、Qwen 等 LLM 全文约 2600 字,预计阅读 7 分钟 近年来,大型语言模型(LLM)的广泛应用推动了推理服务系统的不断优化。然而,在离线批量推理场景中,如何平衡计算资源利用效率和性能仍是一个亟待解决的问题
作者:InternLM、Qwen 等 LLM 全文约 2600 字,预计阅读 7 分钟 近年来,大型语言模型(LLM)的广泛应用推动了推理服务系统的不断优化。然而,在离线批量推理场景中,如何平衡计算资源利用效率和性能仍是一个亟待解决的问题