llmperf-leaderboard

llmperf-leaderboard

LLM推理服务性能基准测试与比较

LLMPerf Leaderboard 项目对多家LLM推理服务进行性能评测,主要衡量输出令牌吞吐量和首个令牌响应时间(TTFT)。测试涵盖Llama-2系列的7B、13B和70B聊天模型,为开发者提供客观透明的性能数据和可复现的测试方法,有助于选择合适的LLM服务。

LLMPerfLLM推理提供商性能基准测试吞吐量响应时间Github开源项目

LLMPerf 排行榜 :trophy:

利用 LLMPerf,我们对一系列 LLM 推理提供商进行了基准测试。 我们的分析主要评估它们在以下关键指标下的性能、可靠性和效率:

  • 输出令牌吞吐量,代表每秒返回的平均输出令牌数。这一指标对于需要高吞吐量的应用(如摘要和翻译)很重要,并且易于在不同模型和提供商之间进行比较。
  • 首个令牌时间(TTFT),代表 LLM 返回第一个令牌所需的时间。TTFT 对于流式应用(如聊天机器人)尤为重要。

LLMPerf 排行榜以清晰、透明的方式展示结果。我们的目标是为用户和开发者提供每个提供商能力和局限性的重要洞察,为未来的集成和部署决策提供信息。为了保持透明度和实用性,我们还在 运行配置 中提供了可复现的步骤,如下所示:

运行配置

对于每次基准测试运行,都使用 LLMPerf 仓库 中的以下命令模板执行:

   python token_benchmark_ray.py \
    --model <MODEL_NAME> \
    --mean-input-tokens 550 \
    --stddev-input-tokens 0 \
    --mean-output-tokens 150 \
    --stddev-output-tokens 0 \
    --max-num-completed-requests 150 \
    --num-concurrent-requests 5 \
    --llm-api <litellm/openai> 

对每个提供商,我们执行:

  • 总请求数: 150
  • 并发度: 5(向提供商发送 5 个并发请求)
  • 提示词令牌长度: 550
  • 预期输出长度: 150
  • 测试模型: LLama-2 聊天模型的 7B、13B 和 70B 版本

我们在 us-west-2(俄勒冈)区域的 AWS EC2(实例类型:i4i.large)上运行 LLMPerf 客户端。结果截至 2023 年 12 月 19 日太平洋标准时间凌晨 3 点。您可以在 raw_data 文件夹中找到详细结果。

注意事项和免责声明

请注意,可能存在一些潜在的偏差来源或与您感知行为的差异:

  • 提供商的后端端点可能差异很大,因此这并不反映软件在特定硬件上的运行情况。
  • 结果可能随一天中的时间而变化。
  • 结果(如 TTFT 测量)取决于客户端位置,也可能受某些提供商为增加 ITL 而在第一个令牌上延迟的影响。我们当前的测量位置是美国西部(俄勒冈)。
  • 结果仅是系统能力的代理,也受现有系统负载和提供商流量的影响。
  • 结果可能与用户的工作负载不相关。

输出令牌吞吐量(令牌/秒)

输出令牌吞吐量以每秒返回的平均输出令牌数来衡量。我们通过向每个 LLM 推理提供商发送 150 个请求来收集结果,并根据 150 个请求计算平均输出令牌吞吐量。更高的输出令牌吞吐量表示 LLM 推理提供商的吞吐量更高。

70B 模型

<img src="https://yellow-cdn.veclightyear.com/2b54e442/67a3bc8b-cf61-413a-90fa-2cc764a451a9.jpg">
框架模型中位数平均值最小值最大值P25P75P95P99
anyscalemeta-llama/Llama-2-70b-chat-hf6663228656727782
bedrockmeta.llama2-70b-chat-v12121132220222222
fireworksaccounts/fireworks/models/llama-v2-70b-chat4040334638424546
groqllama2-70b-4096185184148208174195207208
leptonllama2-70b3333313932343438
perplexityllama-2-70b-chat303084429313644
replicatemeta/llama-2-70b-chat10921110101111
togethertogether_ai/togethercomputer/llama-2-70b-chat6564257961687476

13B 模型

<img src="https://yellow-cdn.veclightyear.com/2b54e442/2b45847a-eeb2-4483-a0d3-19ca55508f65.jpg">
框架模型中位数平均值最小值最大值P25P75P95P99
anyscalemeta-llama/Llama-2-13b-chat-hf12012081156110128141148
bedrockmeta.llama2-13b-chat-v13635193933383839
fireworksaccounts/fireworks/models/llama-v2-13b-chat4242394541434444
leptonllama2-13b4343374842444648
replicatemeta/llama-2-13b-chat161863512203535
togethertogether_ai/togethercomputer/llama-2-13b-chat102101112398108119122

7B 模型

<img src="https://yellow-cdn.veclightyear.com/2b54e442/93b9bca6-f5f1-4165-a612-47d38bcffc70.jpg">
框架模型中位数平均值最小值最大值P25P75P95P99
anyscalemeta-llama/Llama-2-7b-chat-hf5151455749545657
fireworksaccounts/fireworks/models/llama-v2-7b-chat7676538275787982
leptonllama2-7b3636334035384040
replicatemeta/llama-2-7b-chat263227820357377
togethertogether_ai/togethercomputer/llama-2-7b-chat7575509570818790

首个令牌时间(秒)

对于流式应用,TTFT 是 LLM 返回第一个令牌所需的时间。

70B 模型

<img src="https://yellow-cdn.veclightyear.com/2b54e442/bca7371f-4b7a-446b-8d4e-3317c6e82e33.jpg"> | 框架 | 模型 | 中位数 | 平均值 | 最小值 | 最大值 | P25 | P75 | P95 | P99 | |------------|------------------------------------------------------------------------------------------------------|---------|--------|-------|-------|-------|-------|-------|-------| | anyscale | meta-llama/Llama-2-70b-chat-hf | 0.21 | 0.25 | 0.18 | 0.59 | 0.19 | 0.30 | 0.36 | 0.47 | | bedrock | meta.llama2-70b-chat-v1 | 0.39 | 0.41 | 0.29 | 0.72 | 0.37 | 0.41 | 0.54 | 0.69 | | fireworks | accounts/fireworks/models/llama-v2-70b-chat | 0.51 | 0.51 | 0.32 | 0.96 | 0.39 | 0.56 | 0.79 | 0.95 | | groq | llama2-70b-4096 | 0.22 | 0.23 | 0.17 | 0.36 | 0.19 | 0.24 | 0.3 | 0.35 | | lepton | llama2-70b | 0.93 | 0.9 | 0.72 | 1.12 | 0.82 | 0.96 | 1.01 | 1.1 | | perplexity | llama-2-70b-chat | 0.37 | 0.42 | 0.29 | 0.70 | 0.34 | 0.52 | 0.63 | 0.66 | | replicate | meta/llama-2-70b-chat | 1.19 | 5.08 | 0.97 | 71.57 | 1.03 | 1.7 | 24.23 | 63.63 | | together | together_ai/togethercomputer/llama-2-70b-chat | 0.63 | 0.62 | 0.46 | 0.89 | 0.55 | 0.67 | 0.77 | 0.87 |

13B模型

<img src="https://yellow-cdn.veclightyear.com/2b54e442/3b9727d1-8b65-4a76-af7f-36a8c4872673.jpg">
框架模型中位数平均值最小值最大值P25P75P95P99
anyscalemeta-llama/Llama-2-13b-chat-hf0.200.220.180.560.190.220.340.50
bedrockmeta.llama2-13b-chat-v10.270.330.160.770.250.30.740.76
fireworksaccounts/fireworks/models/llama-v2-13b-chat0.490.470.280.660.390.540.590.65
leptonllama2-13b1.081.070.821.40.951.151.241.37
replicatemeta/llama-2-13b-chat5.656.270.9817.013.628.3114.7616.71
togethertogether_ai/togethercomputer/llama-2-13b-chat0.540.890.390.910.460.600.700.81

* 在数据收集时,Perplexity不提供13B模型。可以在这里找到更多关于提供模型的详细信息。

7B模型

<img src="https://yellow-cdn.veclightyear.com/2b54e442/80ae9dbb-6a40-42a3-a149-6c70c427e300.jpg">
框架模型中位数平均值最小值最大值P25P75P95P99
anyscalemeta-llama/Llama-2-7b-chat-hf0.200.230.180.500.190.230.340.46
fireworksaccounts/fireworks/models/llama-v2-7b-chat0.330.330.211.090.320.340.370.88
leptonllama2-7b1.131.110.881.331.041.181.291.32
replicatemeta/llama-2-7b-chat3.683.610.997.22.315.016.376.99
togethertogether_ai/togethercomputer/llama-2-7b-chat0.520.580.420.950.460.710.840.94

* 在数据收集时,Perplexity不提供Llama-2-7B模型。可以在这里找到更多关于提供模型的详细信息。

* 在数据收集时,Bedrock不提供Llama-2-7B模型。可以在这里找到更多关于提供模型的详细信息。

反馈

  • 请通过此链接提供您的反馈。我们很乐意听取您的意见。
  • 对于有兴趣在此仪表板上展示其API的LLM推理服务提供商,请提交一个问题或通过电子邮件与我们联系,以进行进一步沟通(例如设置测试账户等)。

编辑推荐精选

openai-agents-python

openai-agents-python

OpenAI Agents SDK,助力开发者便捷使用 OpenAI 相关功能。

openai-agents-python 是 OpenAI 推出的一款强大 Python SDK,它为开发者提供了与 OpenAI 模型交互的高效工具,支持工具调用、结果处理、追踪等功能,涵盖多种应用场景,如研究助手、财务研究等,能显著提升开发效率,让开发者更轻松地利用 OpenAI 的技术优势。

Hunyuan3D-2

Hunyuan3D-2

高分辨率纹理 3D 资产生成

Hunyuan3D-2 是腾讯开发的用于 3D 资产生成的强大工具,支持从文本描述、单张图片或多视角图片生成 3D 模型,具备快速形状生成能力,可生成带纹理的高质量 3D 模型,适用于多个领域,为 3D 创作提供了高效解决方案。

3FS

3FS

一个具备存储、管理和客户端操作等多种功能的分布式文件系统相关项目。

3FS 是一个功能强大的分布式文件系统项目,涵盖了存储引擎、元数据管理、客户端工具等多个模块。它支持多种文件操作,如创建文件和目录、设置布局等,同时具备高效的事件循环、节点选择和协程池管理等特性。适用于需要大规模数据存储和管理的场景,能够提高系统的性能和可靠性,是分布式存储领域的优质解决方案。

TRELLIS

TRELLIS

用于可扩展和多功能 3D 生成的结构化 3D 潜在表示

TRELLIS 是一个专注于 3D 生成的项目,它利用结构化 3D 潜在表示技术,实现了可扩展且多功能的 3D 生成。项目提供了多种 3D 生成的方法和工具,包括文本到 3D、图像到 3D 等,并且支持多种输出格式,如 3D 高斯、辐射场和网格等。通过 TRELLIS,用户可以根据文本描述或图像输入快速生成高质量的 3D 资产,适用于游戏开发、动画制作、虚拟现实等多个领域。

ai-agents-for-beginners

ai-agents-for-beginners

10 节课教你开启构建 AI 代理所需的一切知识

AI Agents for Beginners 是一个专为初学者打造的课程项目,提供 10 节课程,涵盖构建 AI 代理的必备知识,支持多种语言,包含规划设计、工具使用、多代理等丰富内容,助您快速入门 AI 代理领域。

AEE

AEE

AI Excel全自动制表工具

AEE 在线 AI 全自动 Excel 编辑器,提供智能录入、自动公式、数据整理、图表生成等功能,高效处理 Excel 任务,提升办公效率。支持自动高亮数据、批量计算、不规则数据录入,适用于企业、教育、金融等多场景。

UI-TARS-desktop

UI-TARS-desktop

基于 UI-TARS 视觉语言模型的桌面应用,可通过自然语言控制计算机进行多模态操作。

UI-TARS-desktop 是一款功能强大的桌面应用,基于 UI-TARS(视觉语言模型)构建。它具备自然语言控制、截图与视觉识别、精确的鼠标键盘控制等功能,支持跨平台使用(Windows/MacOS),能提供实时反馈和状态显示,且数据完全本地处理,保障隐私安全。该应用集成了多种大语言模型和搜索方式,还可进行文件系统操作。适用于需要智能交互和自动化任务的场景,如信息检索、文件管理等。其提供了详细的文档,包括快速启动、部署、贡献指南和 SDK 使用说明等,方便开发者使用和扩展。

Wan2.1

Wan2.1

开源且先进的大规模视频生成模型项目

Wan2.1 是一个开源且先进的大规模视频生成模型项目,支持文本到图像、文本到视频、图像到视频等多种生成任务。它具备丰富的配置选项,可调整分辨率、扩散步数等参数,还能对提示词进行增强。使用了多种先进技术和工具,在视频和图像生成领域具有广泛应用前景,适合研究人员和开发者使用。

爱图表

爱图表

全流程 AI 驱动的数据可视化工具,助力用户轻松创作高颜值图表

爱图表(aitubiao.com)就是AI图表,是由镝数科技推出的一款创新型智能数据可视化平台,专注于为用户提供便捷的图表生成、数据分析和报告撰写服务。爱图表是中国首个在图表场景接入DeepSeek的产品。通过接入前沿的DeepSeek系列AI模型,爱图表结合强大的数据处理能力与智能化功能,致力于帮助职场人士高效处理和表达数据,提升工作效率和报告质量。

Qwen2.5-VL

Qwen2.5-VL

一款强大的视觉语言模型,支持图像和视频输入

Qwen2.5-VL 是一款强大的视觉语言模型,支持图像和视频输入,可用于多种场景,如商品特点总结、图像文字识别等。项目提供了 OpenAI API 服务、Web UI 示例等部署方式,还包含了视觉处理工具,有助于开发者快速集成和使用,提升工作效率。

下拉加载更多