不同语言使用 AI 大模型的成本不同：英语最便宜、中文是英文成本的 2 倍_大语言模型记忆对话成本分析

作者：不正经 | 2024-03-24 10:47:33

踩

大语言模型记忆对话成本分析

推特用户 Dylan Patel (@dylan522p) 发布的一张图片，大语言模型使用不同语言的成本差异很大。

这名用户展示了一张牛津大学的研究显示成果。根据对 GPT-4 和其他常见大语言模型的研究，由于 OpenAI 等服务所采用的服务器成本衡量和计费的方式，英语输入和输出的费用要比其他语言低得多，其中简体中文的费用大约是英语的两倍，西班牙语是英语的 1.5 倍，而缅甸的掸语则是英语的 15 倍。

根据牛津大学的研究，让一个 LLM 处理一句缅甸语句子需要 198 个词元（tokens），而同样的句子用英语写只需要 17 个词元。词元代表了通过 API（如 OpenAI 的 ChatGPT 或 Anthropic 的 Claude 2）访问 LLM 所需的计算力成本imu，这意味着缅甸语句子使用这种服务的成本比英语句子高出 11 倍。

词元化模型（即人工智能公司将用户输入转换为计算成本的方式）意味着，除了英语之外的其他语言使用和训练模型要贵得多。

这是因为像中文这样的语言有着不同、更复杂的结构（无论是从语法还是字符数量上），导致它们需要更高的词元化率。例如，根据 OpenAI 的 GPT3 分词器，“你的爱意（your affection）” 的词元，在英语中只需要两个词元，但在简体中文中需要八个词元。尽管简体中文文本只有 4 个字符（你的爱意），而英文有 14 个字符。

声明：本文内容由网友自发贡献，不代表【wpsshop博客】立场，版权归原作者所有，本站不承担相应法律责任。如您发现有侵权的内容，请联系我们。转载请注明出处：https://www.wpsshop.cn/w/不正经/article/detail/301819