#T-Eval

T-Eval - 分步骤评估大语言模型工具使用能力的基准测试框架

T-Eval大语言模型工具使用能力评估基准测试Github开源项目

T-Eval是一个评估大语言模型工具使用能力的基准测试框架。它将评估过程分解为指令遵循、规划、推理、检索、理解和审查等多个子过程，实现了细粒度分析。该项目提供英文和中文评测数据集、测试脚本和排行榜。T-Eval为研究人员和开发者提供了一个深入分析语言模型工具使用能力的新方法。

相关文章

Article Cover

T-Eval: 评估大型语言模型工具使用能力的创新方法

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号