tiktoken 速查表
tiktoken 是 OpenAI 开源的快速 BPE tokenizer,用于将文本编码为 LLM 可理解的 token ID。支持 GPT-4o、GPT-4、DeepSeek 等主流模型。准确计算 token 是控制成本和满足上下文限制的关键。
更新: 2026-07-20·8 条命令
快速开始
``bash
pip install tiktoken
python -c "
import tiktoken
enc = tiktoken.get_encoding('cl100k_base')
tokens = enc.encode('你好世界')
print(f'Token 数: {len(tokens)}')
print(f'ID: {tokens}')
print(f'解码: {enc.decode(tokens)}')
"
``
启动模式(8)
| 命令 | 难度 | ||
|---|---|---|---|
pip install tiktoken安装 tiktoken | 基础 | pip install tiktoken | |
tiktoken encode将文本编码为 token ID | 基础 | python -c 'import tiktoken; enc = tiktoken.get_encoding("cl100k_base"); tokens = enc.encode("Hello world"); print(tokens)'
| |
tiktoken decode将 token ID 解码为文本 | 基础 | python -c 'import tiktoken; enc = tiktoken.get_encoding("cl100k_base"); print(enc.decode([9906, 1917]))'
| |
tiktoken count计算文本的 token 数量 | 基础 | python -c 'import tiktoken; enc = tiktoken.get_encoding("cl100k_base"); print(len(enc.encode("Hello world, how are you?")))'
| |
tiktoken encoding for model获取指定模型使用的编码器 | 基础 | python -c 'import tiktoken; enc = tiktoken.encoding_for_model("gpt-4o"); print(enc.name)'
| |
tiktoken batch count批量计算多段文本的 token 数 | 中级 | python -c 'import tiktoken; texts=["Hello","World"]; enc=tiktoken.get_encoding("cl100k_base"); print([len(enc.encode(t)) for t in texts])'
| |
tiktoken cost estimate估算聊天消息的 token 数和费用 | 中级 | python -c 'import tiktoken; enc=tiktoken.get_encoding("cl100k_base"); msgs=[{"role":"user","content":"Hello"}]; tpm=3; print(sum(len(enc.encode(m["content"])) for m in msgs) + tpm*len(msgs))'
| |
tiktoken special tokens包含特殊 token 的编码 | 高级 | python -c 'import tiktoken; enc=tiktoken.get_encoding("cl100k_base"); tokens=enc.encode("Hello", allowed_special={"<|endoftext|>"}); print(tokens)'
|
常见问题
本速查表数据整理自各工具官方文档。最后更新: 2026-07-20。