unbiased-toxic-roberta

RoBERTa模型识别多语言有毒评论并减少偏见

模型评估 Huggingface 模型 Detoxify 机器学习有毒评论分类 Github 开源项目自然语言处理

该项目开发了基于RoBERTa的多语言模型,用于检测互联网上的有毒评论。模型在Jigsaw三个挑战数据集上训练,可识别威胁、侮辱和仇恨言论等多种有毒内容。它支持多种语言,易于使用,适用于研究和内容审核。项目还探讨了模型的局限性和伦理问题,努力减少对特定群体的意外偏见。

文档

chinese-roberta-wwm-ext-large - 中文自然语言处理的全词掩码预训练模型

BERTGithubHuggingface中文自然语言处理全词掩码开源项目模型知识蒸馏预训练模型

中文BERT全词掩码预训练模型加速中文自然语言处理，提升精准语义理解。基于Google BERT并结合全词掩码策略，其在文本分类、情感分析以及问答系统等多种NLP应用中表现优异，是探索中文语言理解的有力工具。

regardv3 - BERT模型用于分析语言中人口群体偏见

BERTGithubHuggingface偏见识别开源项目情感分析模型自然语言处理语言分类

该BERT分类器模型专门分析语言中的社会偏见。通过1.7K个偏见语言样本训练，它能测量特定人口群体的语言极性和社会认知。不同于一般情感分析，此模型聚焦识别文本中的人口统计学偏见，为控制性语言生成研究提供关键工具。

xlm-roberta-base-language-detection-onnx - 基于XLM-RoBERTa的多语言文本识别系统

GithubHuggingfaceONNX转换XLM-RoBERTa多语言模型开源项目文本分类模型语言检测

这是一个将xlm-roberta-base转换为ONNX格式的语言检测模型，支持阿拉伯语、中文、英语等20种语言识别。模型通过序列分类技术实现语言检测，并结合Optimum库确保高效运行，适合多语言文本分析场景。

roberta-base-zeroshot-v2.0-c - 商用优化的零样本文本分类工具

GithubHugging FaceHuggingfacezeroshot分类商业友好数据开源项目模型模型训练自然语言推理

该系列模型专为Hugging Face平台优化，支持在GPU和CPU上进行零样本分类，无需预先训练数据。最近的改进包括基于商业友好的数据集训练，能满足严苛的许可条件。roberta和deberta系列以合理的准确性和速度满足不同需求，可用于多种语言和大范围文本输入，非常适合全球多样化的应用场景。最新的模型更新可在Zeroshot Classifier Collection中查阅，确保多种使用环境下的合规性。

xlm-roberta-large - 大规模多语言预训练模型

GithubHuggingfaceXLM-RoBERTa多语言模型开源项目机器学习模型自然语言处理预训练模型

XLM-RoBERTa是一个在2.5TB多语言数据上预训练的大型语言模型，覆盖100种语言。该模型采用掩码语言建模技术，能够生成双向文本表示。XLM-RoBERTa主要应用于序列分类、标记分类和问答等下游任务的微调。凭借其在多语言和跨语言任务中的出色表现，XLM-RoBERTa为自然语言处理领域提供了坚实的基础。

robbert-v2-dutch-base - 荷兰语自然语言处理的先进预训练模型

GithubHuggingfaceRobBERT人工智能开源项目机器学习模型自然语言处理荷兰语模型

RobBERT是基于RoBERTa架构开发的荷兰语预训练语言模型，在多项自然语言处理任务中展现出卓越性能。模型通过39GB荷兰语语料库（含660亿词）预训练，可用于文本分类、回归和标记等任务。RobBERT在情感分析、指代消解和命名实体识别方面表现突出，尤其适合小规模数据集场景。作为目前最先进的荷兰语BERT模型，RobBERT为荷兰语自然语言处理研究和应用提供了强大工具。

pretraining-with-human-feedback - 基于人类偏好预训练的语言模型代码库

GithubHugging Facetoxicity人类偏好多任务开源项目预训练

该项目为根据人类偏好预训练语言模型提供了一套基于Hugging Face Transformers和wandb的工具。项目实现了五种预训练目标，通过对训练数据注释并使用这些目标函数提升模型性能，包括毒性检测和隐私信息识别等任务。项目还提供详细的配置文件和评估方式指导。

politicalBiasBERT - BERT微调模型实现政治倾向文本自动分类

BERTGithubHuggingface开源项目政治偏见文本分类机器学习模型自然语言处理

politicalBiasBERT是一个基于BERT模型微调的政治倾向分析工具。该模型通过大量政治文本训练，能够自动将输入文本分类为左派、中立或右派。研究人员和开发者可使用简单的Python代码调用此模型，快速分析文本的政治倾向。这一工具为政治文本分析和舆情研究提供了有力支持。

roberta-base-go_emotions - RoBERTa模型实现28种情感多标签分类

GithubHuggingfaceRoBERTago_emotions数据集text-classification多标签分类开源项目情感分析模型

该模型基于roberta-base，利用go_emotions数据集训练而成，可对文本进行28种情感的多标签分类。模型在测试集上实现0.474的准确率和0.450的F1分数。为提升性能，还提供ONNX版本。研究者可通过Hugging Face Transformers框架便捷应用此模型。值得注意的是，某些情感标签如'gratitude'表现优异，F1值超过0.9，而'relief'等标签表现欠佳，可能与训练数据分布不均有关。通过优化每个标签的阈值，模型的整体F1分数可提升至0.541，显示出进一步改进的潜力。

scenario-teacher-data-hate_speech_filipino-model-xlm-roberta-base - 优化后的模型用于菲律宾语的仇恨言论检测

GithubHuggingfacexlm-roberta-base仇恨言论准确率开源项目数据集模型训练过程

该项目利用xlm-roberta-base模型微调适用于菲律宾语的仇恨言论检测，已达到78.17%的准确率和76.87%的F1得分。模型特别适应于处理此类任务，通过调整学习率和其他超参数优化性能。训练使用了Adam优化和线性学习率调度策略，总计训练了6969个epoch。

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com