定義
BPE とは頻出する文字・部分文字列のペアを繰り返し統合してトークン単位を作る、 LLM のテキスト分割方式のこと。
BPE (バイトペア符号化)とは(詳しく解説)
BPE (Byte Pair Encoding) とは、 テキストを LLM が処理できる 「トークン」 に分割する仕組みの一つ。 もともとはデータ圧縮アルゴリズムだったものを言語モデル向けに転用したもので、 出現頻度の高い文字・部分文字列のペアを繰り返しマージし、 頻出語は 1 トークン、 未知語は複数トークンに分解する語彙を構築する。 GPT 系や多くのオープンモデルのトークナイザーで採用されているとされる。 実運用での落とし穴は、 日本語のようにスペース区切りが無い言語では英語より 1 文字あたりのトークン消費量が増えやすく、 同じ文章量でも料金やコンテキスト長の消費が大きくなりやすい点。 現場でモデルを選ぶ際は、 料金表の「1M トークンあたり」の相場感だけでなく、 実際の日本語テキストでトークナイザーに通してみて消費量を確認するのが定石とされる。 コスト試算時にこの前提を見落とすと、 想定より早くコンテキスト上限や予算に達することがある。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「BPE (バイトペア符号化)とは」 https://aipicks.jp/glossary/byte-pair-encoding
BPE (バイトペア符号化)の使用例
- 「ChatGPT」 は 1 語と数えても、 トークナイザー上では 2 トークンに分かれることがある。
- 日本語の長文を LLM API に渡す前に、 トークナイザーでトークン数を事前確認する。