jury

综合性NLP实验评估工具包

Jury是一个全面的NLP实验评估工具包，提供多种自动化指标。它支持多种评估指标的同时计算，可处理多预测/多参考的评估场景。Jury优化了evaluate库的设计，简化了自定义指标的添加。该工具包统一了指标计算的输入结构，支持并发计算，适用于各类NLP项目。

访问官网

Github

文档

论文

介绍相关项目

fairness-indicators - Tensorflow 的公平性评估和可视化工具包

Fairness IndicatorsGithubTensorflow二分类和多分类分类器公平性指标开源项目模型评估

Fairness Indicators支持团队评估和改进模型的公平性，适用于二元和多分类模型。通过TensorFlow工具包，可以计算常见的公平性指标，并分析数据集分布及模型性能。该工具能处理大规模数据集，并提供信心区间和多阈值评估功能。Fairness Indicators与TensorFlow Data Validation、TensorFlow Model Analysis和What-If Tool紧密集成，助力优化模型。

You Rate AI - 真实用户体验驱动的AI服务评估系统

AI工具AI评分AnthropicGoogleOpenAI语言模型

本平台专注于从真实用户体验出发评估人工智能服务，摒弃学术论文和基准测试的局限。该评估系统提供涵盖写作、角色扮演、编码、逻辑和知识等方面的综合评分，使用户能直观比较各种AI服务性能。评分数据定期更新，确保提供最新、最实用的AI性能比较信息，助力用户做出明智选择。作为用户导向评估的领先平台，我们致力于为AI爱好者和专业人士提供可靠的AI服务参考。

RateMyJD - 智能职位描述评估与优化平台

AI分析AI工具RateMyJD人才招聘求职者职位描述

RateMyJD是一个基于AI的职位描述评估平台，为用户提供深度分析和改进建议。通过输入职位描述，获取智能评估结果和优化方案，提升招聘效率，增强职位吸引力。该平台还提供申请人跟踪系统(ATS)试用，全面支持招聘流程，助力企业在人才市场中获得竞争优势。RateMyJD是您的AI招聘工具，让职位描述优化变得简单高效。

evalplus - 提升大语言模型代码生成评估的框架

EvalPlusGithubHumanEval+LLM评估MBPP+代码生成开源项目

EvalPlus是一个开源框架,旨在严格评估大语言模型的代码生成能力。它包含HumanEval+和MBPP+两个增强数据集,测试用例数量大幅提升。该框架提供精确评估、代码严谨性检验、LLM生成样本等功能,可显著加速相关研究。EvalPlus支持代码生成、后处理和评估全流程,在GitHub开源并提供Docker镜像,便于研究人员使用。

SWE-bench - 基于GitHub问题的语言模型评估

DockerGitHubGithubICLR 2024Princeton NLPSWE-bench开源项目

SWE-bench是一个基准测试平台，用于评估语言模型在解决GitHub问题中的表现。提供代码库和问题描述，模型生成修复补丁。项目支持Docker容器实现高效可重复测试。最新更新包括SWE-agent的引入，提升评估基准表现。支持x86_64和实验性arm64架构，提供多样数据集和模型下载选项。欢迎NLP、机器学习和软件工程领域的贡献和反馈。

ToolQA - 评估工具增强型大语言模型的开源数据集

GithubToolQA大语言模型工具增强开源项目数据集评估基准

ToolQA是一个开源数据集，专门用于评估工具增强型大语言模型。数据集涵盖8个领域，包含需要综合使用多个工具解答的问题，分为简单和困难两个级别。ToolQA通过人机协作创建，提供了数据统计、下载链接、工具实现和基准代码，为研究人员评估和改进大语言模型的外部工具使用能力提供全面资源。

LLMBox - 全面的大型语言模型训练与评估框架

GithubLLMBox大语言模型开源项目模型评估训练管道高效推理

LLMBox是一个综合性大型语言模型(LLM)库，集成了统一的训练流程和全面的模型评估功能。该框架旨在提供LLM训练和应用的完整解决方案，其设计注重实用性，在训练和使用过程中体现出高度的灵活性和效率。LLMBox支持多样化的训练策略和数据集，提供丰富的评估方法，并具备高效的推理和量化能力，为LLM的研究和开发提供了强大支持。

alpaca_eval - 精确且成本低的指令追随语言模型自动评估工具

AlpacaEvalGPT-4Githubinstruction-following开源项目自动评价评估

AlpacaEval是一款基于LLM的自动评估工具，针对指令追随模型（如ChatGPT）的评估，具备快速、低成本和高度人类相关性（0.98）的特点。主要功能包括模型排行榜、自动评估器、评估器构建工具包及20K人工偏好数据。AlpacaEval 2.0通过长度控制胜率，提高了与ChatBot Arena的对应性，适合模型开发阶段的快速评估。

XL-Judge-LLM - 多语言法律评判和文本生成的先进模型

GithubHuggingfacetransformers开源项目文本生成机器学习模型模型卡片自然语言处理

XL-Judge-LLM是基于Transformers库开发的文本生成模型，专注于法律评判和复杂文本生成。该模型利用维基百科和推理数据集等多个大规模数据集进行训练，在F1值、准确率和困惑度方面表现出色。支持多语言处理，可用于直接应用和下游任务，为法律评判和文本生成提供可靠的解决方案。

lmms-eval - 大规模多模态模型评估框架加速AI发展

AI基准测试GithubLMMs-eval多模态模型开源项目评估框架

lmms-eval是专为大规模多模态模型(LMMs)设计的评估框架,整合多种基准和数据集,提供一致高效的评估方法。支持图像、视频等多模态任务,简化评估流程,加速模型开发和性能比较。该框架为研究人员提供灵活工具,助力理解和改进LMMs能力,推动人工智能向通用人工智能(AGI)发展。lmms-eval旨在成为加速LMMs发展的重要生态系统组件。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com