#LLM服务
相关项目
vllm
vLLM是一个高性能且易用的LLM推理与服务平台,具备PagedAttention内存管理、CUDA/HIP图形加速、量化支持、并行解码算法及流式输出等技术优势。vLLM无缝集成Hugging Face模型,兼容多种硬件设备,支持分布式推理和OpenAI API。最新版本支持Llama 3.1和FP8量化。用户可通过pip安装并参考详细文档快速入门。
flashinfer
FlashInfer是一个面向大型语言模型(LLM)服务和推理的GPU内核库。它实现了多种注意力机制,如FlashAttention、SparseAttention和PageAttention。通过优化共享前缀批处理解码和压缩KV缓存等技术,FlashInfer提高了LLM推理效率。该项目兼容PyTorch、TVM和C++,便于集成到现有系统,适用于多种LLM应用场景。
Mooncake
Mooncake是一种创新的大语言模型服务架构。它采用以KVCache为中心的分离设计,将预填充和解码集群分开,并充分利用GPU集群的闲置资源实现KVCache的分布式缓存。Mooncake的核心调度器在确保延迟服务水平目标的同时,最大化系统的有效吞吐量。通过实施预测性早期拒绝策略,该架构在高负载情况下表现优异,尤其适合长上下文场景。实验结果表明,在特定模拟环境中,Mooncake能够在满足服务水平目标的前提下,将系统吞吐量提升525%。