AI 大模型的语言不平等：英语最便宜，其它语言要贵得多

沃卡惠
行业资讯
2023-08-01 09:24:23
427

7月31日消息，用户所使用的语言对于大型语言模型（LLM）的费用有很大的影响，可能造成英语使用者和其它语言使用者之间的人工智能鸿沟。最近的一项研究显示，由于OpenAI等服务所采用的的服务器成本衡量和计费的方式，英语输入和输出的费用要比其他语言低得多，其中简体中文的费用大约是英语的两倍，西班牙语是英语的1.5倍，而缅甸的掸语则是英语的15倍。

AI 大模型的语言不平等：英语最便宜，其它语言要贵得多

IT之家注意到，推特用户Dylan Patel（@dlan522p）分享了一张照片，展示了牛津大学进行的一项研究，该研究发现，让一个LLM处理一句缅甸语句子需要198个词元（tokens），而同样的句子用英语写只需要17个词元。词元代表了通过API（如OpenAI的ChatGPT或Anthropic的Claude2）访问LLM所需的计算力成本，这意味着缅甸语句子使用这种服务的成本比英语句子高出11倍。

词元化模型（即人工智能公司将用户输入转换为计算成本的方式）意味着，除了英语之外的其他语言使用和训练模型要贵得多。这是因为像中文这样的语言有着不同、更复杂的结构（无论是从语法还是字符数量上），导致它们需要更高的词元化率。例如，根据OpenAI的GPT3分词器，“你的爱意（your affection）”的词元，在英语中只需要两个词元，但在简体中文中需要八个词元。尽管简体中文文本只有4个字符（你的爱意），而英文有14个字符。

上一篇：保险反欺诈风控实践

下一篇：未来之城：智能技术如何引领可持续革命