Token 计数器

粘贴文本,估算它在 GPT-4o / GPT-4 / Claude 等主流模型中占用的 Token 数量。

和 AI 对话按 Token 计量:API 按 Token 收费,模型的"上下文窗口"也按 Token 限制。Token 是模型切分文字的最小单位——一个英文单词约 1.3 个 Token,一个汉字约 0.7~2 个 Token(因模型而异)。粘贴文本即可按不同模型口径估算。

估算口径说明

本工具按公开统计规律估算:GPT-4o / o 系列新分词器(o200k)对中文约 0.7 Token/字、英文约 0.25 Token/字符;GPT-3.5 / GPT-4 旧分词器(cl100k)对中文约 1.5~2 Token/字、英文约 0.25 Token/字符;Claude 与 GPT 近似。精确数字以各家官方 tokenizer 为准,估算误差一般在 ±10% 内,做预算足够用。

为什么汉字和英文不一样

分词器把高频英文单词整词编码("the"=1 个 Token),而中文按字甚至按笔画组合切分,一个汉字可能是 1~2 个 Token。所以同样 1000 字的中文稿,Token 数常是英文的 2~3 倍——这也是中文 API 账单更贵的原因。想省 Token:能用英文的语境用英文,删掉重复背景介绍。

常见问题

1000 个汉字是多少 Token?
按 GPT-4o(o200k)约 700 Token,按 GPT-3.5/4(cl100k)约 1500~2000 Token。用本工具粘贴文本看"新模型/旧模型"两列即可。
上下文窗口是什么意思?
一次对话能容纳的最大 Token 总量(你的问题 + 全部历史 + AI 回答)。超出后模型会"忘记"最早的内容。GPT-4o 为 128K,Claude 长窗口版 200K,约等于十几万字中文。
估算能精确到个位数吗?
不能,本工具是统计估算。需要精确值请用各平台官方 tokenizer 页面。做费用预算和窗口判断,本工具足够。