bigcodebench

高难度代码生成基准测试评估LLM编程能力

BigCodeBench 代码生成评估基准大语言模型编程能力 Github 开源项目

BigCodeBench是一个具有挑战性的代码生成基准测试，用于评估大型语言模型的实际编程能力。它提供复杂指令和多样函数调用，包括数据集、生成和评估脚本。基于EvalPlus框架，BigCodeBench实现精确评估和排名，提供预生成样本以加速研究。支持多种评估环境，采用unittest进行代码测试，为研究人员提供全面工具。

访问官网

Github

Huggingface

介绍相关项目

lm-evaluation-harness - 统一测试生成式语言模型的多任务评估框架

GPT-NeoXGithubHugging FaceLanguage Model Evaluation HarnessOpen LLM LeaderboardvLLM开源项目

该项目提供统一框架，用于评估生成式语言模型，通过60多个标准学术基准和数百个子任务实现多样化测试。更新包括新的Open LLM Leaderboard任务、内部重构、基于配置的任务创建、Jinja2提示设计支持等高级配置选项，旨在简化和优化模型评估。支持快速高效推理、商业API、本地模型和基准测试。被广泛应用于机构如NVIDIA、Cohere、BigScience等，也支撑了🤗 Hugging Face的Open LLM Leaderboard。

Yi-Coder-9B - 涵盖52种编程语言的高效代码生成模型

GithubHuggingfaceYi-Coder代码性能开源模型开源项目文本生成模型编程语言

Yi-Coder系列拥有高效的代码生成能力，支持52种编程语言，尤其在长文本上下文使用表现出色，最多128K tokens。Yi-Coder-9B-Chat在LiveCodeBench中达23%通过率，适用于代码生成与智能交互。详情参见Yi-Coder博客和README。

evalgpt - 智能化的代码解释与任务分解系统

EvalGPTGithub代码生成任务执行开源项目扩展性错误处理

EvalGPT是一个基于GPT-4、CodeLlama和Claude 2等大型语言模型的代码解释框架。此工具能自动生成代码、执行并返回结果，提升开发效率。EvalGPT的架构借鉴了Google的Borg系统，通过规划、调度和内存模块，高效地完成任务，同时确保了广泛的错误处理和可扩展性，适用于各种编程需求。

TabularBenchmarks - 机器学习算法在表格数据上的性能评估基准

Github开源项目性能评估数据集机器学习算法表格数据

TabularBenchmarks是一个开源项目，提供多种数据集和评估脚本，用于测试机器学习算法在表格数据上的性能。项目将数据集存放在input文件夹，算法实现则位于scripts文件夹。这些资源使研究人员能够客观比较不同算法处理表格数据的效果，有助于为特定任务选择合适的算法。

CodeLlama-34b-hf - 面向代码生成与理解的大型语言模型

Code LlamaGithubHuggingfaceMetaPython代码合成开源项目模型预训练模型

这是一个预训练和微调的语言模型，专注于代码生成和理解，参数规模可达34亿。适用于多样化的代码合成任务，特别针对Python进行了优化。基于Transformer架构，该模型为商业应用和研究提供了安全可靠的支持。

CodeLlama-13b-hf - Meta开发的13B参数通用代码生成和理解模型

Code LlamaGithubHuggingface人工智能模型代码生成开源项目机器学习模型自然语言处理

CodeLlama-13b-hf是Meta开发的13B参数大型语言模型，专注于代码生成和理解。作为Code Llama系列的基础版本之一，该模型支持代码补全和填充功能。它采用优化的transformer架构，于2023年上半年训练完成，适用于商业和研究用途。这一通用代码合成工具能有效处理多种编程任务，为开发者提供代码辅助功能。

Codestral-22B-v0.1-GGUF - 针对80多种编程语言优化的开源代码助手模型

Codestral-22BGithubHuggingface人工智能代码生成开源项目机器学习模型量化模型

Codestral-22B-v0.1-GGUF是一个支持80多种编程语言的开源代码助手模型。它能够回答代码问题、生成代码，并提供Fill in the Middle功能。该模型已被量化为多个版本，以适应不同的硬件配置，让开发者能够在本地设备上高效运行这一代码辅助工具。模型支持Python、Java、C++等主流编程语言，可用于代码文档编写、解释和重构等任务。

CodeLlama-34B-GGUF - 340亿参数的代码生成与理解模型

CodeLlamaGGUFGithubHuggingfacellama.cpp代码生成开源项目模型量化

CodeLlama-34B-GGUF是Meta的CodeLlama 34B模型的GGUF量化版本,专门用于代码生成和理解。模型参数量340亿,支持多种量化等级,可在CPU和GPU上推理。TheBloke提供多个GGUF文件,兼容llama.cpp等推理框架。用户可根据设备选择合适版本,轻松部署这个强大的代码AI助手。适用于代码补全、bug修复等多种开发任务,提高编程效率。

FL-bench - 开源联邦学习基准测试平台

FL-benchGithub个性化联邦学习开源项目算法实现联邦学习领域泛化

FL-bench是一个开源的联邦学习基准测试平台,实现了多种经典和前沿算法。平台支持个性化联邦学习和域泛化等研究方向,提供简单接口用于自定义数据集和模型。集成了可视化工具,方便研究人员快速实现和对比不同方法。FL-bench旨在促进联邦学习领域的创新与发展。

starcoder2-3b - 多语言代码生成模型专注17种主流编程语言

GithubHuggingfaceStarCoder2代码生成开源项目机器学习模型编程语言自然语言处理

StarCoder2-3B是一个基于30亿参数训练的代码生成模型,专注于17种主流编程语言。该模型采用分组查询注意力和滑动窗口技术,具有16384个token的上下文理解能力。StarCoder2-3B可根据上下文生成代码片段,适用于多种代码生成和补全任务,但生成的代码可能需要进一步优化。模型在大规模多语言代码数据集上训练,旨在提供灵活的编程辅助功能。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号