bigcodebench

高难度代码生成基准测试评估LLM编程能力

BigCodeBench 代码生成评估基准大语言模型编程能力 Github 开源项目

BigCodeBench是一个具有挑战性的代码生成基准测试，用于评估大型语言模型的实际编程能力。它提供复杂指令和多样函数调用，包括数据集、生成和评估脚本。基于EvalPlus框架，BigCodeBench实现精确评估和排名，提供预生成样本以加速研究。支持多种评估环境，采用unittest进行代码测试，为研究人员提供全面工具。

访问官网

Github

Huggingface

介绍相关项目

MultiBench - 多模态学习的多尺度标准基准

BenchmarkGithubMultiBenchMultimodal学习开源项目数据集深度学习

MultiBench是一个系统化、统一的大规模基准，用于多模态表征学习，覆盖15个数据集、10种模态、20个预测任务和6个研究领域。它提供自动化的端到端机器学习管道，简化数据加载、实验设置和模型评估，确保在真实世界中的适用性和鲁棒性。

codebert-cpp - 训练于GitHub代码库的C++代码分析模型

C++CodeBERTGithubHuggingface代码生成开源项目机器学习模型模型预训练

CodeBERT-CPP是基于Microsoft CodeBERT架构的C++代码分析模型，经100万步训练优化。该模型利用GitHub代码库数据进行掩码语言建模，主要用于CodeBERTScore评分系统，也适用于其他C++代码分析任务。作为开源项目，CodeBERT-CPP为开发者提供了一个专业的C++代码评估工具。

CritiqueLLM - 大型语言模型输出评估的智能批评生成框架

CritiqueLLMGithub人工智能大语言模型开源项目自然语言处理评估

CritiqueLLM是一个用于评估大型语言模型输出的批评生成框架。该项目提供了数据收集、参考评分、无参考评分和配对比较等功能。通过支持逐点评分和成对比较，CritiqueLLM能生成详细的批评信息，为研究人员和开发者提供了全面的评估工具，有助于分析和改进大型语言模型的表现。

AlignBench - 多维度评估中文大语言模型对齐性能的基准

AlignBenchGPT-4-0613Github大语言模型对齐水平开源项目评测

AlignBench 是多维度评估中文大语言模型对齐性能的评测基准。最新的 v1.1 版本提供了动态更新的数据、详细评分规则和高质量参考答案，确保评估的可靠性和可解释性。涵盖八大能力类别的数据主要来自真实用户问题，并使用 GPT-4 作为评分模型，通过多维度分析方法系统评估模型性能。

CodeGeeX - 强大的多语言代码生成与翻译模型

CodeGeeXGithub人工智能代码生成多语言开源项目编程助手

CodeGeeX是一个拥有130亿参数的大规模多语言代码生成模型。该模型可生成Python、C++、Java等主流编程语言的可执行代码,并支持跨语言代码翻译。CodeGeeX提供免费的VS Code和Jetbrains IDE扩展,在HumanEval-X多语言基准测试中表现优异。项目完全开源,同时支持Ascend和NVIDIA平台,为开发者提供高效的代码生成工具。

codegemma-7b-it - 自然语言代码生成与对话专家

CodeGemmaGithubHuggingface代码完成代码生成对话生成开源项目模型评估方法

CodeGemma项目集合了7B和2B参数的开源代码模型，专注代码补全、生成及对话功能，尤其突出自然语言转代码的能力。codegemma-7b-it变体特别在指令生成方面展示了优异表现。借助FIM技术和依赖关系图打包技术，模型增强了与真实应用的契合度。此外，该项目注重伦理与安全，符合Google政策标准，适用于代码生成、学习和技术交流，兼容多种编程语言。

Qwen2.5-Coder-7B-Instruct-GGUF - 基于5.5万亿数据训练的大规模代码生成模型

GithubHuggingfaceQwen2.5-Coder人工智能代码代码生成代码调试开源项目模型模型量化

Qwen2.5-Coder-7B-Instruct的量化版本模型，经过5.5万亿数据规模训练，具备代码生成、推理和bug修复等核心功能。模型支持128K长文本处理，可满足大规模代码开发需求。基于llama.cpp实现量化，在保持原有性能的同时优化了模型部署效率。

Auto-GPT-Benchmarks - 自动化智能代理基准测试框架评估代码检索记忆和安全性能

AI代理Auto-GPTGithub基准测试开源项目性能评估排名

Auto-GPT-Benchmarks 是一个自动化智能代理基准测试框架，用于客观评估代理在代码、检索、记忆和安全性方面的性能。框架提供详细评分和排名，有助于开发者优化代理性能。尽管该项目已被弃用，其功能已转移至 AutoGPT 主仓库的 benchmark 文件夹。最新测试结果显示 Beebot、mini-agi 和 Auto-GPT 表现最佳。

DeepSeek-Coder - 支持多种编程语言的高性能开源代码模型

AI编程助手DeepSeek CoderGithub代码生成开源项目性能评估模型训练

DeepSeek-Coder是一系列基于2T代码和自然语言数据训练的代码语言模型。提供1B至33B不同规模版本，支持项目级代码补全和插入。该模型在多种编程语言和基准测试中表现出色，支持87种编程语言，并在HumanEval、MBPP等评测中优于现有开源模型。

babilong - BABILong基准测试长文本处理能力评估大语言模型极限

BABILongGithub开源项目推理能力数据集语言模型评估长文本处理

BABILong是一个用于评估自然语言处理模型长文本处理能力的基准测试。它将bAbI数据集的任务句子隐藏在PG19背景文本中，生成长达数百万标记的测试样本。该基准包含20个推理任务，涉及事实链接、归纳、演绎和计数等多个方面。BABILong为评估和改进大语言模型的长文本处理能力提供了有效工具，同时也对现有长文本模型提出了挑战。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能，包括文生视频、动态画面和形象生成等，帮助用户快速上手，创造专业级内容。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台，用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品，帮助用户探索创意灵感。

Project Cover

讯飞文书

讯飞文书依托讯飞星火大模型，为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能，满足事务性工作的高频需求，帮助撰稿人节省精力，提高效率，优化工作与生活。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号