SWE-bench

基于GitHub问题的语言模型评估

SWE-bench Docker GitHub ICLR 2024 Princeton NLP Github 开源项目

SWE-bench是一个基准测试平台，用于评估语言模型在解决GitHub问题中的表现。提供代码库和问题描述，模型生成修复补丁。项目支持Docker容器实现高效可重复测试。最新更新包括SWE-agent的引入，提升评估基准表现。支持x86_64和实验性arm64架构，提供多样数据集和模型下载选项。欢迎NLP、机器学习和软件工程领域的贡献和反馈。

访问官网

Github

Huggingface

介绍相关项目

code-review-gpt - 使用大型语言模型提升CI/CD流水线的代码审查效率

CI/CDCode Review GPTGithub代码审查大语言模型开源项目自动化工具

Code Review GPT使用大型语言模型在CI/CD流水线中审查代码，帮助识别暴露的秘密、低效代码和不可读代码。工具可以在命令行本地运行，审查暂存文件。虽然处于alpha阶段，但仍能提供有价值的反馈，简化代码审查流程，提高效率。

MMBench - 全面评估多模态大模型能力的基准测试

GithubMMBench多模态模型开源项目循环评估视觉语言模型评估基准

MMBench是评估视觉语言模型多模态理解能力的基准测试集。它包含近3000道多项选择题,涵盖20个能力维度,采用循环评估和LLM选项提取等创新方法,提供可靠客观的评估。通过细粒度的能力测试和可重复的评价标准,MMBench为多模态模型开发提供了有价值的反馈。

checklist - 全面评估NLP模型行为的测试框架

CheckListGithubNLP开源项目模型评估测试行为测试

CheckList是一个用于全面测试NLP模型的框架,它提供了多种测试类型和工具。主要功能包括生成测试数据、扰动现有数据、创建和运行各类测试等。通过CheckList,研究人员和开发者可以更全面地评估NLP模型的行为表现,识别潜在问题和偏差。该项目包含详细教程和代码示例,支持多语言测试,并可与主流NLP库集成。

FL-bench - 开源联邦学习基准测试平台

FL-benchGithub个性化联邦学习开源项目算法实现联邦学习领域泛化

FL-bench是一个开源的联邦学习基准测试平台,实现了多种经典和前沿算法。平台支持个性化联邦学习和域泛化等研究方向,提供简单接口用于自定义数据集和模型。集成了可视化工具,方便研究人员快速实现和对比不同方法。FL-bench旨在促进联邦学习领域的创新与发展。

LLM4SE - 大型语言模型在软件工程领域的最新研究进展

Github人工智能代码模型大语言模型开源项目论文列表软件工程

LLM4SE项目汇集软件工程领域最新的大型语言模型研究成果，包括全面的模型列表、论文汇总和统计数据。涵盖代码生成、程序理解等多个方面，通过内部文献搜索引擎持续更新。该项目为研究人员和开发者提供了跟踪AI在软件开发中最新应用的重要资源。

speech-to-text-benchmark - 开源语音识别基准测试框架对比多家主流引擎

Github基准测试开源项目模型大小计算效率识别准确率语音转文本

该项目提供了一个开源的语音识别基准测试框架，对比了Amazon、Azure、Google等主流云服务以及OpenAI Whisper、Picovoice等引擎的性能。框架使用LibriSpeech、TED-LIUM和Common Voice数据集，评估词错率、计算效率和模型大小等指标。测试结果客观展示了各引擎在准确度和资源消耗方面的表现，为选择语音识别解决方案提供了参考依据。

benchmarks - 主流机器学习库全面性能基准测试

CatBoostGPU加速Github基准测试开源项目性能比较机器学习

Benchmarks是GitHub上的开源项目，致力于多个主流机器学习库的性能对比。该项目涵盖CatBoost、XGBoost、LightGBM和H2O等库，对比范围包括二元分类、训练速度、模型评估、排序任务和SHAP值计算。此外还提供CPU与GPU性能对比和Kaggle竞赛数据集上的质量评估。这些全面的基准测试为机器学习从业者提供了客观的性能参考数据。

github-roast - 基于OpenAI的智能代码审查工具，结合SvelteKit技术

Cloudflare D1Cloudflare PagesGitHub RoastGithubOpenAISvelteKit开源项目

GitHub Roast是一个代码审查工具，利用OpenAI的gpt-4o-mini模型提供智能化的代码分析和反馈。该项目基于SvelteKit构建，使用Cloudflare Pages部署，并支持Cloudflare D1数据库。GitHub Roast具有简单的设置和部署流程，为开发者提供高效的代码质量提升体验。项目提供了详细的设置指南，包括创建Cloudflare D1数据库、导入数据和部署到Cloudflare Pages的步骤，方便开发者快速上手和使用。

primeqa - PrimeQA：多语言问答系统的开源研究和开发平台

GithubPrimeQA信息检索多语言问答开源项目机器阅读理解问题生成

PrimeQA是一个开源平台，帮助研究人员和开发人员训练先进的问答模型。用户可以在PrimeQA上复制NLP会议中的实验，下载预训练模型并应用于自定义数据。该平台支持信息检索、多语言阅读理解、问题生成及检索增强的生成技术。PrimeQA在多个排行榜中名列前茅，整合Transformers工具包以提供强大的问答功能，满足领先的研究和开发需求。

sage - 多语言拼写纠正与文本增强工具包

GithubSAGE多语言开源项目拼写纠正文本增强评估

SAGE是一个开源的多语言拼写纠正和文本增强工具包。该项目提供预训练的Transformer模型用于拼写纠正，支持多种语言。SAGE还包含数据增强算法，可模拟真实拼写错误。此外，SAGE提供评估功能，用于衡量拼写纠正工具的性能。这一工具包为处理拼写问题提供了完整解决方案。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号