dataset
Darija Open Dataset (DODa)是一个专注于摩洛哥方言的开源项目,包含约15万条条目。该数据集提供语义和语法分类、多种拼写形式、词形变化以及大量翻译句子。DODa采用拉丁字母和阿拉伯字母,反映了Darija拼写的多样性,为自然语言处理应用提供了丰富资源。项目目标是成为Darija NLP的重要参考,并鼓励社区贡献。