deepeval

简化LLM输出评估的开源框架

DeepEval LLM评估开源框架 AI测试指标评估 Github 开源项目

DeepEval是一款开源的大型语言模型(LLM)输出评估框架。它提供G-Eval、幻觉检测和答案相关性等多种评估指标，支持本地运行。该框架适用于RAG和微调应用，可与LangChain和LlamaIndex等工具集成。DeepEval具备批量评估、自定义指标创建功能，易于集成到CI/CD环境。此外，它还支持对主流LLM基准进行简易评估，并可与Confident AI平台对接，实现持续评估和结果分析。

访问官网

Github

介绍相关项目

Parea AI - 专业AI应用开发测试与评估解决方案

AI工具AI评估LLM测试Parea AI人工智能实验跟踪

Parea AI为AI团队提供实验和人工标注平台,集成实验跟踪、可观察性和人工标注功能。平台支持评估、审核、提示词管理、可观察性和数据集管理,助力LLM应用高效部署。简洁的SDK设计可与主流LLM服务和框架轻松对接,全面提升AI应用开发效率。

llm - LLM实验项目集合探索大型语言模型应用

API密钥GithubLLM实验OpenAIPinecone开源项目虚拟环境

该开源项目提供了一系列LLM实验。内容包括虚拟环境设置、必要包安装以及API集成指南。通过这些实验，开发者可以深入了解大型语言模型的应用，探索AI文本处理和向量数据库技术。项目注重实践，为AI领域学习者提供了有价值的资源。

RoleLLM-public - 评估与提升大语言模型角色扮演能力的框架

GithubRoleLLM基准测试大语言模型开源项目微调角色扮演

RoleLLM框架旨在评估和增强大语言模型的角色扮演能力。该框架包含RoleBench数据集、Context-Instruct知识提取方法、RoleGPT风格模仿技术和RoCIT微调策略。通过这些组件，RoleLLM显著提升了开源模型的角色扮演表现，在某些方面达到了与GPT-4相当的水平。这一框架为大语言模型在角色扮演任务中的应用提供了新的研究方向。

Q-Bench - 评测多模态大语言模型的低层视觉能力

GithubICLR2024Q-Bench低层视觉基准测试多模态大语言模型开源项目

Q-Bench是一个评估多模态大语言模型低层视觉能力的基准测试。它通过感知、描述和评估三个领域，使用LLVisionQA和LLDescribe数据集测试模型性能。该项目采用开放式评估框架，支持研究者提交结果或模型。Q-Bench对比了开源和闭源模型的表现，并与人类专家水平进行对照，为深入理解和提升多模态AI的基础视觉处理能力提供了关键洞察。

RefChecker - 针对大语言模型输出的精细化幻觉检测框架

GithubRefChecker事实性大语言模型幻觉检测开源项目评估框架

RefChecker是一个标准化评估框架，用于检测大语言模型(LLM)输出中的细微幻觉。该框架将LLM响应分解为知识三元组，在三种不同背景下进行精细化幻觉检测。项目包括人工标注的基准数据集、模块化架构和自动化检查器，有助于评估和改进LLM输出的事实准确性。RefChecker为研究人员和开发者提供了评估和提高LLM生成内容可靠性的工具。

promptfoo - 本地LLM应用测试与评估工具

GithubLLM应用promptfoo基准测试开源项目测试驱动开发自动化红队

提供专业工具集，专为本地测试、评估及红队操作LLM应用设计。支持多种模型和API，确保应用安全可靠，提升评估效率并自动评分输出。适用于CLI、库和CI/CD环境，支持OpenAI、Anthropic等API，完全开源且本地运行，保障数据隐私。

spelltest - AI应用的LLM质量测试工具

AI质量保证GithubGoogle ColabSpelltest大语言模型开源项目模拟测试

高效测试大型语言模型应用，确保在各种场景下提供准确的响应。通过模拟用户交互和自动质量评估，实现无缝开发流程集成，降低手动测试成本，提高用户满意度。

checklist - 全面评估NLP模型行为的测试框架

CheckListGithubNLP开源项目模型评估测试行为测试

CheckList是一个用于全面测试NLP模型的框架,它提供了多种测试类型和工具。主要功能包括生成测试数据、扰动现有数据、创建和运行各类测试等。通过CheckList,研究人员和开发者可以更全面地评估NLP模型的行为表现,识别潜在问题和偏差。该项目包含详细教程和代码示例,支持多语言测试,并可与主流NLP库集成。

EasyDeL - 多模型训练优化框架

EasyDeLFlaxGithubJAX开源项目机器学习模型训练

EasyDeL是一个开源框架，用于通过Jax/Flax优化机器学习模型的训练，特别适合在TPU/GPU上进行大规模部署。它支持多种模型架构和量化方法，包括Transformers、Mamba等，并提供高级训练器和API引擎。EasyDeL的架构完全可定制和透明，允许用户修改每个组件，并促进实验和社区驱动的开发。不论是前沿研究还是生产系统构建，EasyDeL都提供灵活强大的工具以满足不同需求。最新更新包括性能优化、KV缓存改进和新模型支持。

hallucination_evaluation_model - 开源幻觉检测模型助力提升LLM输出质量

GithubHHEM-2.1-OpenHuggingfaceRAG人工智能幻觉检测开源项目模型语言模型

HHEM-2.1-Open是一款用于检测大型语言模型(LLM)幻觉的开源工具。该模型在多项基准测试中表现优异，性能超过GPT-3.5-Turbo和GPT-4。它特别适用于检索增强生成(RAG)应用，可评估LLM生成摘要与给定事实的一致性。HHEM-2.1-Open支持无限长度上下文，运行高效，可在普通硬件上使用，是提升LLM输出质量和可靠性的实用工具。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号