Chinese-Word-Vectors

多样化中文词向量预训练模型集合

Chinese Word Vectors 词向量语义关系中文语料库 Github 开源项目

该项目集成了多种中文词向量模型，涵盖稠密和稀疏表示方法，以及词、n-gram、字符等上下文特征。同时提供中文类比推理数据集CA8和评估工具包，便于模型质量评估。这些预训练资源可应用于多种自然语言处理任务，为相关研究和开发工作提供了有力支持。

Github

文档

论文

介绍相关项目

paraphrase-multilingual-MiniLM-L12-v2 - 多语言句子相似性和语义聚类的高效工具

BERT模型GithubHuggingfacesentence-transformers开源项目模型特征提取语义搜索语句相似性

paraphrase-multilingual-MiniLM-L12-v2模型是sentence-transformers框架的一部分，能够将句子转换为384维的密集向量。该模型支持多语言功能，适合进行句子聚类和语义搜索，并能通过HuggingFace Transformers应用。在此模型的优化下，您可在多语言环境（如法语、葡萄牙语、中文）中高效实现句子相似性比较和特征提取，并利用其简便的安装和使用过程提升操作效率。

LLMDataHub - 大语言模型训练数据集合

GithubLLMDataHub大语言模型开源社区开源项目数据集聊天机器人

LLMDataHub汇聚高品质大语言模型训练数据，为研究人员和从业者提供丰富的数据资源。该平台涵盖多种数据集，适合提升聊天机器人对话质量、应答生成及语言理解。同时，平台更新最新数据集，助您获取行业前沿资源。

huozi - 支持32K上下文的双语稀疏混合专家模型

GithubHIT-SCIR中文MT-Bench开源项目活字3.0活字通用大模型自然语言处理

活字3.0是一个支持32K上下文的稀疏混合专家模型，具备中英文知识、数学推理和代码生成能力，并在指令遵循和安全性上有所提升。项目开源了中文MT-Bench数据集，支持多种推理框架如Transformers、vLLM和llama.cpp，为自然语言处理研究和应用提供更多选择。

awesome_Chinese_medical_NLP - 中文医学自然语言处理（NLP）开源资源大全

CBLUEGithubawesome_Chinese_medical_NLP中文医疗信息处理命名实体识别开源项目知识图谱

收录中文医学自然语言处理（NLP）各类资源，如术语集、语料库、词向量、预训练模型、知识图谱、命名实体识别、问答系统和信息抽取工具。项目旨在推动中文医学NLP技术发展，提供丰富的开源数据集和工具，包含中文医疗信息处理挑战榜CBLUE数据集、中文电子病历预训练Bert模型及多种医学词汇和知识图谱资源。这些材料涵盖术语标准化、文本分类等领域，为中文医学NLP研究和应用奠定坚实基础。

Conan-embedding-v1 - 中文文本处理的开源深度学习工具

GithubHuggingfaceconan-embedding句子转换器开源项目文本分类检索性能模型语义相似度

Conan-embedding-v1是一个开源项目，采用sentence-transformers库，支持多种中文自然语言处理任务如STS、分类、重排序、检索和聚类。通过在AFQMC、ATEC和AmazonReviewsClassification等数据集上的测试，该项目展示了其在复杂中文语境中的有效性。其分析与性能指标对比提供了开发者和研究人员一种提升自然语言处理效率和准确性的方法。

LLMBox - 全面的大型语言模型训练与评估框架

GithubLLMBox大语言模型开源项目模型评估训练管道高效推理

LLMBox是一个综合性大型语言模型(LLM)库，集成了统一的训练流程和全面的模型评估功能。该框架旨在提供LLM训练和应用的完整解决方案，其设计注重实用性，在训练和使用过程中体现出高度的灵活性和效率。LLMBox支持多样化的训练策略和数据集，提供丰富的评估方法，并具备高效的推理和量化能力，为LLM的研究和开发提供了强大支持。

emotion2vec - 通用语音情感表示模型开源实现

Githubemotion2vec开源项目情感表征特征提取自监督预训练语音情感识别

emotion2vec是一个开源的语音情感表示模型,采用自监督预训练方法提取跨任务、跨语言和跨场景的通用情感特征。该模型在IEMOCAP等数据集上取得了领先性能,并在多语言和多任务上展现出优异表现。项目开源了预训练模型、特征提取工具和下游任务训练脚本,为语音情感分析研究提供了有力支持。

sentence-transformers-multilingual-e5-large - 多语言句子嵌入模型适用于语义搜索和文本相似度分析

GithubHuggingfacesentence-transformers多语言模型嵌入向量开源项目模型自然语言处理语义相似度

sentence-transformers-multilingual-e5-large是一个多语言句子嵌入模型，将句子和段落映射到1024维向量空间。该模型基于sentence-transformers库构建，适用于聚类、语义搜索等任务。支持多语言处理，可通过Python代码轻松调用。模型在Sentence Embeddings Benchmark上进行了评估，为自然语言处理应用提供了有效的文本表示方法。

Chinese-Llama-2-7b - 开源且可商用的中文Llama2模型，兼容中英文SFT数据集与llama-2-chat格式

Chinese Llama 2 7BGithubHuggingFaceLlama2开源项目模型开源量化模型

项目提供开源且商用的中文Llama2模型及中英文SFT数据集，兼容llama-2-chat格式并支持优化。项目包含在线演示、多模态模型、Docker部署和API接口，支持多种硬件配置，用户可快速下载与测试。

xlm-v-base - 多语言模型中的突破性词汇扩展

GithubHuggingfaceXLM-V命名实体识别多语言开源项目模型自然语言推理词汇瓶颈

XLM-V是一个多语言模型，拥有百万词汇表，并在2.5TB数据上进行训练。相比于XLM-R，该模型在语言推理、问答与命名实体识别等任务中表现优异。通过减少语言间的词汇共享，这一创新提高了模型的表现，尤其在词汇重叠较少的语言中。XLM-V不仅提高跨语言任务的效果，也在低资源任务中实现重大突破，为机器学习和语言研究带来更多可能性。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com