相关项目
ua-gec
UA-GEC是一个经专业注释的乌克兰语语法错误纠正和流畅性编辑语料库。该语料库提供GEC+Fluency和GEC-only两个版本,适用于不同研究场景。语料库包含33,735个句子,涵盖从日常聊天到正式写作的多个领域。专业校对人员对语料进行了全面注释,包括流畅性、语法、标点和拼写等方面的错误。UA-GEC可用于乌克兰语GEC系统的开发和评估,同时也支持多语言和低资源NLP、形态丰富语言、文档级GEC以及流畅性纠正等研究领域。
opus-mt-uk-en
opus-mt-uk-en是一个开源的乌克兰语到英语神经机器翻译模型,基于transformer-align架构开发。该模型使用OPUS数据集训练,经过normalization和SentencePiece预处理。在Tatoeba测试集上,模型达到了64.1的BLEU分数和0.757的chr-F分数,显示出良好的翻译效果。研究者可以下载预训练权重和测试集结果进行进一步评估和应用。