サイモン・ウィリソン (Simon Willison) 氏は10月9日(現地時間)、トークンに基づいたテキストのカウントと切り詰めを行うPythonパッケージ「ttok」のバージョン1.0をリリースしました。この新バージョンでは、デフォルトで利用されるトークナイザーがGPT-4からGPT-5/GPT-6ファミリーへと更新され、トークン処理の最新化が図られています。

サイモン・ウィリソン (Simon Willison) 氏は、自身が開発したテキスト処理ツール「ttok」の最新バージョン1.0を公開しました。このPythonパッケージは、与えられたテキストのトークン数を正確にカウントし、指定された上限に応じてテキストを切り詰める機能を提供します。バージョン1.0の主な変更点は、デフォルトで利用されるトークナイザーがOpenAIのGPT-4からGPT-5およびGPT-6ファミリーへと切り替わったことです。

ウィリソン氏は以前、ttokのバージョン0.4を使用していましたが、自身の別のプロジェクトで uv tool upgrade ttok コマンドを用いてttokを更新した際、デフォルトのトークナイザーが依然としてGPT-4であることが判明しました。この経験が、最新のGPTモデルに対応すべくデフォルト設定を更新するきっかけになったと述べています。GPT-5/GPT-6トークナイザーに切り替える時だと感じたとウィリソン氏は自身のブログで語っています。

OpenAIはGPT-6がGPT-5ファミリーと同じトークナイザーを使用することについて公式な確認を行っていません。しかし、ウィリアム・リウ (William Liu) 氏によるコミットで報告された広範な実験結果は、これらのモデルが同一のトークナイザーを使用している可能性が極めて高いことを示唆しています。リウ氏の実験では、GPT-5.5、GPT-5.6 Sol/Terra/Luna、そしてGPT-6 Astra/Sol/Lunaを含む計7つのGPTモデルが用いられました。これらのモデルは、31種類の固定された入力テキスト全てにおいて、一致して44,794トークンを報告しました。この一貫した結果は、GPT-6がこのテストコーパスにおいて、GPT-5ファミリーから入力トークンカウントの変更を導入していないことを強く裏付けています。

このトークナイザーの互換性は、開発者にとって重要な意味を持ちます。GPT-5およびGPT-6が同じトークナイザーを使用しているとすれば、開発者はモデルをアップグレードしてもトークンカウントのロジックを大幅に変更する必要がありません。これにより、アプリケーションの安定性と保守性が向上し、よりスムーズな移行が可能となります。ウィリソン氏がttok 1.0でこの最新のトークナイザーをデフォルトとしたことは、開発者が最新かつ効率的なテキスト処理を容易に利用できるようにする狙いがあると考えられます。


参考: Simon Willison’s Weblog (アーカイブ) — 2026年10月9日 09:34 (JST)

この記事をシェア
X はてブ LinkedIn