RecodeX 重构消息,Uri Katz与四名合著者基于整理后的意第绪语文本,构建并训练了一个80亿参数的MameLoshnLM模型,训练语料规模达9.15亿个意第绪语词。研究团队发现,常见的网络语料库将希伯来语页面和机器翻译页面错误归类,因此改用经过人工筛选的意第绪语文本进行训练。