insuranceqa-corpus-zh

开源中文保险问答语料库支持机器学习和NLP研究

保险语料库问答数据集机器学习数据格式分词处理 Github 开源项目

insuranceqa-corpus-zh是一个开源的中文保险行业问答语料库,包含真实用户问题和专业回答。作为保险领域首个开放QA语料库,它提供问答语料和问答对语料两种格式,支持答案选择、阅读理解等多种机器学习任务。数据集划分为训练集、测试集和验证集,并附有详细使用说明和格式介绍,方便研究人员快速应用。该项目适合进行保险领域自然语言处理和问答系统相关研究。

访问官网

Github

介绍相关项目

LLM-Tool-Survey - 大型语言模型工具学习调查研究

Github人工智能大语言模型工具学习开源项目综述自然语言处理

该研究系统性调查大型语言模型(LLMs)通过工具学习增强解决复杂问题能力。从工具学习的优势和实现方法两方面全面回顾现有文献,总结基准测试和评估方法,讨论当前挑战和未来方向,为相关研究和开发提供见解。

Chinese-Llama-2-7b - 开源且可商用的中文Llama2模型，兼容中英文SFT数据集与llama-2-chat格式

Chinese Llama 2 7BGithubHuggingFaceLlama2开源项目模型开源量化模型

项目提供开源且商用的中文Llama2模型及中英文SFT数据集，兼容llama-2-chat格式并支持优化。项目包含在线演示、多模态模型、Docker部署和API接口，支持多种硬件配置，用户可快速下载与测试。

PMC-LLaMA - 开源医疗大语言模型推动医学智能研究

GithubPMC-LLaMA医学问答医疗语言模型开源项目指令微调预训练

PMC-LLaMA是一个基于医学文献预训练和指令微调的开源大语言模型。该模型在USMLE、MedMCQA等医学测试中表现优异，能够有效处理医学问答和相关查询。PMC-LLaMA为研究人员提供了便利的使用和开发平台，促进医学人工智能研究的进展。

DAMO-ConvAI - 达摩院对话式AI研究代码库

DAMO ConvAIGithub人工智能对话AI开源项目自然语言处理阿里巴巴

DAMO-ConvAI是达摩院对话式AI研究的开源代码库，汇集了多项前沿成果。项目在LREC-COLING 2024、EMNLP 2023和ACL 2023等顶级会议上发表论文，并在DSTC11-SIMMC赛道及Spider、SparC、CoSQL等排行榜上名列前茅。DAMO-ConvAI专注于对话系统、自然语言处理和机器学习领域的研究，为开发者提供丰富资源。

MNBVC - MNBVC大规模中文语料集：覆盖多样类型数据支持开源社区

GithubMNBVChuggingface中文语料集开源社区开源项目数据清洗

MNBVC中文语料集由MOP里屋社区发起，目标是创建最大的中文互联网语料集，涵盖新闻、小说、论文等多种类型数据。当前数据量为34582GB，最终目标为40TB。MNBVC提供多种文件格式的数据，包括txt、json、jsonl和parquet，并配备一系列优化工具及爬虫代码协助数据处理。项目欢迎有技术背景的志愿者参与，提升数据清洗效率。访问Wiki了解更多信息。

speech_dataset - 多语言语音识别与合成数据集详细介绍及应用

Github多人语音识别开源开源项目数据集语音合成语音识别

此页面总结了多语言语音数据集，包括中文、英文、日语、韩语、俄语等。涵盖了语音识别、语音合成、说话人识别和分离等应用领域，详细描述了每个数据集的时长、下载地址及其具体用途，帮助用户快速找到符合科研或项目需求的语音数据。

YAYI-UIE - 多领域信息抽取统一模型

GithubYAYI-UIE信息抽取大模型开源开源项目指令微调

YAYI-UIE是一个信息抽取统一大模型，基于百万级高质量数据训练而成。该模型支持命名实体识别、关系抽取和事件抽取等任务，涵盖通用、安全、金融、生物、医疗等多个领域。YAYI-UIE在多个中英文数据集上展现出优秀的零样本性能，为信息抽取研究和应用提供了有力工具。作为开源项目，YAYI-UIE促进了中文预训练大模型社区的发展，推动了开放人工智能生态系统的建设。

Chinese-Word-Vectors - 多样化中文词向量预训练模型集合

Chinese Word VectorsGithub中文开源项目词向量语义关系语料库

该项目集成了多种中文词向量模型，涵盖稠密和稀疏表示方法，以及词、n-gram、字符等上下文特征。同时提供中文类比推理数据集CA8和评估工具包，便于模型质量评估。这些预训练资源可应用于多种自然语言处理任务，为相关研究和开发工作提供了有力支持。

AI-Competition-Collections - 全面的AI竞赛经验和技巧开源资源集

AI比赛经验Github开源项目数据竞赛机器学习自然语言处理计算机视觉

这是一个综合性AI竞赛资源库，囊括计算机视觉、自然语言处理、语音识别等领域的比赛经验和技巧。项目汇总了顶级赛事的解决方案，同时提供竞赛平台和相关公众号信息。对AI开发者和竞赛参与者而言，此资源库提供了丰富的学习和参考材料。

ArXivQA - 使用自动化问答系统解读最新ArXiv论文

ArXivGithub开源项目文献分析深度学习自动问答语言模型

该平台提供基于最新ArXiv论文的自动化问答功能，覆盖多模态代理、语言不平衡、开源审查等研究领域。利用自然语言处理技术，快速提取论文关键信息，帮助研究人员高效掌握和应用前沿科研成果。项目由Anthropic支持，使用Claude-2.1 API实现问答功能。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号