合成翻译语料可撑起法语生物医学预训练
作者发布36.4GB法语生命科学语料与模型,性能为自报结果,宜作低资源领域方法信号跟踪。
原始事件 2026-09-22
作者团队称,仅用机器翻译生成的语料预训练,就能在法语生命科学下游任务上达到先进水平。
论文已被EMNLP 2025 Findings接收,作者同步放出TransCorpus工具包、36.4GB法语生命科学语料、预训练模型TransBERT-bio-fr及可复现代码。
需要说明:性能结论全部来自作者自己的评测,尚无独立复现;对多数读者这是低资源语言/领域建模的方法信号,而非已验证的通用结论。