
词元到底是什么?
词元是大语言模型处理文本的最小语义单元。直白地说,AI其实听不懂人类日常说的话,也看不懂完整的文案和报表。人类输入的文字、指令,以及AI输出的回答,都会被大模型自动拆分成一个个统一规格、便于识别的最小基础碎片——这些碎片就是词元。
可以打一个生活化的比方:词元就相当于AI世界里的电费、流量和汽油三合一。汽车要烧油、手机要用流量、家电要耗电,大模型只要开始工作、响应指令,全程都在实实在在消耗词元。
词元的本质,是将连续的自然语言文本离散化为可计算的最小单位。每一次计算所消耗的算力、电力和硬件损耗,都与处理的词元数量呈正相关。因此,词元不仅是技术概念,更是将AI能力商品化的天然度量衡。
一段文字如何变成词元?
大模型把文本切分成词元的过程,依靠的是一套叫“分词器”的算法。目前主流模型普遍采用BPE(字节对编码)算法。这套算法的运作原理可以概括为:不断合并训练语料中出现频率最高的符号对,直到达到预定词汇表大小。
以英文为例,BPE算法会把“hug”拆成“h”“u”“g”三个基础字符,然后统计训练语料中哪些字符组合出现频率最高,把高频组合合并成新词元。经过多轮迭代,“hug”这样的常见词可能被合并为一个词元,而“pug”和“pun”这种不常见的组合则可能被拆分得更细。
不同语言的词元消耗差异很大。在中文语境下,一个汉字通常对应1到2个词元。常用字约1个词元,生僻字或组合约2个词元。英文方面,平均1个英文单词约对应1.3个词元,1个词元大约相当于4个字符或0.75个单词。综合来看,中文消耗的词元通常比英文多30%到50%。
更关键的是,不同大模型的分词规则、编码方式和输出习惯各不相同——同样一段中文,在不同大模型上消耗的词元数量也不相同。这意味着,即使用户输入完全相同的文字,调用不同模型时产生的词元消耗也可能存在差异。
词元如何计费?
词元计费的核心逻辑可以归结为一句话:按实际消耗量收费,输入和输出分别计价。
输入与输出:为什么价格不同?
无论接入哪家厂商的API,同一款模型都会明确拆分为两个维度的单价。
输入侧(Prompt/Input) :这是模型“阅读”用户指令或上传文档所消耗的算力。大模型推理大致分两个阶段:prefill和decode。prefill阶段是“读题”——模型把输入完整读进去,理解上下文。输入是完整给定的,可以大规模并行处理,这正是GPU最擅长的,所以输入词元的成本更容易摊薄。
输出侧(Completion/Output) :这是模型经过逻辑思考后“写出”回答的算力。decode阶段是“答题”——模型一个词元一个词元地生成:第二个词元依赖第一个,第三个依赖前两个,每一步都依赖前一步,没法整段并行。就像考试:读材料可以一目十行,写答案必须一句一句往下写。
因此,输出词元通常比输入贵,主流旗舰模型的输出价普遍是输入价的五到六倍。例如,OpenAI GPT-5.5输入价格为每百万词元5美元,输出价格为30美元;阿里云通义千问qwen3.7-max输入12元/百万词元,输出36元/百万词元。
看不见的“思考成本”
还有一个越来越重要的隐藏项:推理词元(reasoning token)。很多模型在给出最终答案前,会先在内部“思考”很长一段——这些思考词元用户根本看不到,但照样计费,而且按输出价收取。用户可能只问了一句话,模型最后也只回了几百字,中间却悄悄生成了几千甚至上万个思考词元。同一个任务,开不开思考模式,账单可能差好几倍。
多模态输入也是同样的逻辑:图片、音频送进模型,都会折算成词元计费。背后的思路是统一的——把不同形态、不同环节的智能消耗,全部折算成可计量、可报价的单位。
缓存:让重复输入不再“浪费”
在AI智能体等需要反复调用同一套系统指令的场景中,用户每次请求都会携带大量重复的上下文。如果每次都重新计算这些输入,会造成严重的算力浪费。
缓存机制就是为了解决这个问题而设计的。如果多轮对话都在查阅同一份超大文档,后续的“读取缓存”费率往往只有原来的十分之一甚至更低。以某模型为例,输入价格为每百万词元3元,缓存命中时仅为0.025元——用户输入100万词元,无缓存折扣账单为3元,八成命中缓存则仅需约0.62元。
小米MiMo-V2.5-Pro调价后,输入缓存命中价格仅0.025元/百万词元,降幅达98%。DeepSeek V4 Pro缓存命中输入平时仅0.025元/百万词元。不过需要注意的是,部分服务商即便缓存命中也不给折扣,无论命中率多高均按原价收费。
峰谷定价:时段不同,价格不同
2026年,一种新的计费模式开始出现——峰谷定价。DeepSeek率先推出这一机制,将每日9至12点和14至18点设为高峰时段。以V4 Pro为例,缓存命中输入平时0.025元/百万词元,高峰时段涨至0.05元;缓存未命中输入从3元涨至6元,输出从6元翻倍至12元。
这种定价方式的本质,是把不同时段的算力使用压力用价格区分出来——高峰期价格更高,说明在特定时间段内调用需求对算力资源的占用更集中。
词元到底值多少钱?
同样是一百万词元,价格差异可以拉到三十多倍。
海外市场:OpenAI GPT-5.5输出价格为30美元/百万词元,高性能版本GPT-5.5 Pro更高达180美元/百万词元。Anthropic Claude Opus 4.8输出25美元/百万词元,谷歌Gemini 3.1 Pro输出12美元/百万词元。
国内市场:价格普遍低一个数量级。DeepSeek V4-Pro输出仅为0.87美元/百万词元,比GPT-5.5便宜约34倍。小米MiMo V2.5 Pro输出3美元/百万词元。阿里Qwen3 Max输出3.90美元/百万词元。
运营商词元套餐:三大运营商正将词元包装成类似流量包的产品进行售卖。中国电信面向个人用户推出9.9元/月含1000万词元、29.9元/月含4000万词元、49.9元/月含8000万词元三档套餐。
从“对话消耗”到“任务消耗”
词元的消耗模式正在发生根本变化。早期是“对话消耗”——单次聊天只用掉很少的词元。如今已转向“任务消耗”——AI智能体执行多步骤复杂任务时,单任务词元消耗能从几千级直接冲到百万级。
数据佐证了这一趋势:2024年初,国内日均词元调用量约1000亿;2025年底跃升至100万亿;2026年3月已突破140万亿。两年时间增长超过千倍。
词元经济的本质是“以算力换智力”的间接交易。过去可以随意尝试的多轮对话、冗余描述和模糊指令,在按词元收费的约束下将直接转化为可计算的成本。这意味着,使用AI的能力不再仅仅是“会不会提问”,而是“能否以尽可能少的词元投入,获得尽可能高质量的产出”。
版权声明:本平台仅提供信息存储空间服务,用户发布内容不代表本站观点,交易风险自担;侵权违法内容请立即举报(邮箱:37996619@qq.com),本站接通知后先行屏蔽,责任由发布者承担。