← 返回实验室

🔤 Tokenizer 拆词实验室

探索大语言模型如何"阅读"文本 — 不同模型 tokenizer 不同,token 成本不能简单说“英文一定更省”

字符: 0 字节: 0 中文字符: 0 英文字符: 0

实时拆词与效率

同一段文本会被 GPT-2、cl100k、o200k 和字符级基线切成不同 token;悬浮 token 可查看 ID 与字节。

加载词表中...

💰 Token 效率对比

同一段文本,token 数越少,长上下文和 API 成本压力越低;但谁更省取决于具体 tokenizer。

DeepSeek 官方文档给出粗略换算:英文字符约 0.3 token,中文字符约 0.6 token;真实计费请以 API 返回的 usage 为准。