ToxicityModel

基于RoBERTa的毒性检测与评分优化工具

词汇评级毒性识别开源项目模型 Huggingface AI辅助 ToxicityModel transformers Github

这是一款基于RoBERTa的微调模型，用于有效检测和评分文本毒性。模型通过有毒及无毒语言示例训练，特别在wiki_toxic和toxic_conversations_50k数据集上表现出色。作为RLHF训练的辅助工具，该模型的输出值可用于判断文本的毒性与否，适合多种需检测有毒语言的应用场景。

Github

Huggingface

介绍相关项目

unbiased-toxic-roberta-onnx - 基于RoBERTa的公平评论审核模型ONNX实现

GithubHuggingfaceRoBERTa内容审核开源项目文本分类有害内容检测模型模型转换

这是一个基于RoBERTa架构的评论审核模型ONNX版本，专注于识别和分类不当言论。模型支持多维度评估，包括攻击性、不当行为、语言暴力等标签分类。通过Optimum库优化，便于系统集成，同时提供完整文档支持和活跃的开发者社区。

detoxify - 基于Pytorch Lightning和Transformers的多语言有害评论分类模型

DetoxifyGithubJigsawMultilingualPytorch LightningToxic Comment ClassificationTransformersUnintended Bias in Toxicity Classification开源项目

Detoxify项目利用Pytorch Lightning和Transformers构建模型，识别和分类包含威胁、辱骂和身份攻击的有害评论。这些模型支持多语言操作，致力于减少无意中的偏见。项目在多次Jigsaw挑战赛中表现出色，提供高效的有害内容检测方案，适合用于研究和内容审核工作，帮助更快速地标记有害内容和提高用户体验。

toxic-comment-model - 使用DistilBERT进行在线毒性评论分类的模型与偏见分析

DistilBERTGithubHuggingface偏差培训数据开源项目模型毒性评论

该模型基于DistilBERT进行精调，专为在线毒性评论分类设计。尽管总体表现出色，但在识别某些身份群体时表现出偏见，如穆斯林和犹太人。通过示例代码能快速应用此模型，其在10000条测试数据中取得94%的准确率，但f1-score为0.59。更多信息及训练代码可在指定GitHub仓库获取。

twitter-roberta-base-offensive - 基于roBERTa的推特攻击性语言识别模型

GithubHuggingfaceroBERTa开源项目情感分析推特数据文本分类模型自然语言处理

这是一个基于roBERTa-base的模型，通过5800万条推文训练并使用TweetEval基准进行微调，专门用于识别攻击性语言。该模型能对文本进行预处理和分类，区分攻击性和非攻击性内容。它采用了自然语言处理技术，可作为社交媒体平台的内容审核工具。模型支持Python环境下的使用，能够输出文本的攻击性概率评分。

distilroberta-base-offensive-hateful-speech-text-multiclassification - 基于DistilRoBERTa的多分类攻击性和仇恨言论检测模型

GithubHuggingfacedistilroberta-base仇恨言论检测多分类开源项目文本分类模型预训练模型

这是一个基于DistilRoBERTa-base的预训练模型，专门用于多分类攻击性和仇恨言论检测。该模型在原创数据集上进行微调，准确率达到94.50%。项目提供了Hugging Face上的数据集和演示空间，以及GitHub上的训练notebook。这为研究人员和开发者提供了一个高效工具，用于识别和分类在线有害内容。

pretraining-with-human-feedback - 基于人类偏好预训练的语言模型代码库

GithubHugging Facetoxicity人类偏好多任务开源项目预训练

该项目为根据人类偏好预训练语言模型提供了一套基于Hugging Face Transformers和wandb的工具。项目实现了五种预训练目标，通过对训练数据注释并使用这些目标函数提升模型性能，包括毒性检测和隐私信息识别等任务。项目还提供详细的配置文件和评估方式指导。

twitter-roberta-large-hate-latest - 增强的多类别仇恨言论检测模型

GithubHuggingfaceRoBERTaSuperTweetEval仇恨言论检测开源项目推特文本分类模型

此RoBERTa-large模型基于154M推文数据进行训练，并在SuperTweetEval数据集上进行微调，以实现仇恨言论的多类别分类检测。模型能够准确识别多种仇恨类型，包括性别、种族和宗教等，为社交媒体内容管理提供支持。

roberta-spam - RoBERTa垃圾短信检测系统提升组织安全防护能力

GithubHuggingfaceRoBERTa垃圾信息检测开源项目数据集文本分类机器学习模型

这个项目基于RoBERTa模型构建了一套垃圾短信检测系统。该系统能够精准识别和过滤垃圾信息，为组织安全增添一道防线，有助于规避财务风险、法律隐患和声誉受损。系统在准确率、精确度和召回率等指标上表现优异，可作为组织强化信息安全的有力工具。

roberta-hate-speech-dynabench-r4-target - 动态数据集驱动的在线仇恨检测模型

GithubHuggingfaceLFTWR4 Target动态生成数据集在线仇恨检测开源项目模型深度学习

roberta-hate-speech-dynabench-r4-target是一个基于动态生成数据集的在线仇恨检测模型。该模型源自'Learning from the Worst'研究，旨在通过创新的数据生成方法提高AI系统识别网络仇恨言论的准确性。作为R4 Target系列的一部分，这个模型代表了在线内容审核技术的最新进展，为构建更安全的互联网环境提供了有力工具。

granite-guardian-hap-38m - IBM开源轻量级文本毒性检测模型实现大语言模型安全防护

GithubHuggingfaceRoBERTa内容审核开源项目性能优化文本检测模型模型分类

Granite-Guardian-HAP-38m是一个用于检测英文文本有害内容的轻量级二分类模型。通过4层神经网络架构设计，模型参数量仅为3800万，较RoBERTa模型显著缩减规模。该模型支持CPU部署运行，具备低延迟推理能力，适用于大语言模型的安全防护以及批量文本处理场景。实测显示，模型在维持分类准确率的同时达到了理想的性能指标。

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com