资源 / Articles & Whitepapers / For organisations

白皮书 3:低资源语言 AI,为下一个十亿用户弥合训练数据缺口

执行摘要

世界上大多数语言在 AI 训练数据中仍然严重缺乏代表性,这意味着除非有针对性的数据收集有意识地弥合这一缺口,否则集中在非洲、南亚和东南亚以及中亚的下一波 AI 普及浪潮,将由对用户理解不佳的模型来服务。

第 1 节:缺口的规模

少数资源丰富的语言,以英语和普通话为首,占据了可用于 AI 训练的数字化文本、音频和视频的绝大部分。数以千计的其他语言,使用者多达数亿人,可用的训练数据却相对很少,与使用者人数无关。

第 2 节:为什么这一缺口不会自行消除

互联网内容量与历史上的数字化基础设施和出版经济的相关性,高于与使用者人数的相关性,这意味着等待互联网自然地产生更多代表性不足语言的数据并不是可行的策略。弥合缺口需要直接向母语者进行经同意的、付费的数据收集。

第 3 节:有效的收集是什么样的

有效的低资源语言数据项目会直接招募经过验证的母语者,而不是依赖双语中间人;会跨多种模态(语音、文本、图像和视频)而不只是文本进行收集;并且会采用与资源丰富语言相同的多级质量审核,而不是更宽松的流程。

第 4 节:尽早弥合缺口的商业理由

在代表性不足的语言中表现良好的 AI 产品,可以触达竞争对手系统性地服务不足的市场。由于 AI 的普及在使用这些语言的地区增长最快,现在进行的数据投资会在之后积累成持久的产品优势。

常见问题

为什么大多数 AI 模型在代表性不足的语言上表现不佳?

因为这些语言的训练数据在网上相对稀缺,主要用抓取自互联网的数据训练的模型,默认只在少数资源丰富的语言上表现出色。

随着这些地区更多人上网,这一缺口会自然消除吗?

不一定。内容量更多取决于历史上的数字化和出版基础设施,而不是人口规模,因此要弥合缺口需要有意识的、付费的、经同意的数据收集。

目前哪些语言的代表性最不足?

许多非洲语言(包括 Twi、Ewe、Ga、Fante、Hausa 和 Yoruba)、中亚语言(包括乌兹别克语和塔吉克语)以及众多东南亚语言,相对于其使用者人口,代表性仍然不足。

现在投资低资源语言数据的商业理由是什么?

在代表性不足的语言中表现良好的产品,能够占据依赖英语优先模型的竞争对手服务不佳的市场,随着 AI 普及在这些地区增长最快,从而形成持久的优势。

探讨低资源语言数据项目 →

Published 2026-10-02 by Jwuma, operated by Corpshore AI. This piece is written for organisations sourcing AI data work. Visit client.corpshore.ai 讨论一个方案。