トークンとは | AIの請求書に載っている単位
3行で捉える
- トークンは、AIが文章を扱うときの細かい単位です。実務でいちばん効くのは、これが料金の数え方だという点です。
- 単価は1つではありません。入力・出力・キャッシュ読みで別々に決まっていて、出力は入力の数倍が普通です。
- だから単価では比べられません。同じ依頼でも使う量が変わるので、作業1件あたりで測るしかありません。
そもそも何を数えているのか
AIは文章をそのまま読んでいるわけではありません。先に細かく切り分けます。この切れ端がトークンです。
英語なら「よく出てくる単語はそのまま1つ、珍しい単語は2つや3つに割れる」くらいの粒度です。日本語では1文字が複数のトークンになることもあり、一般に、同じ内容でも英語より多くのトークンを使うとされます。
正確な切り方は提供元ごとに違うので、「だいたいこのくらい」以上のことは、実際に測らないと分かりません。
そして実務では、切り方の理屈より数が請求書に直結することのほうが大事です。
値段は3種類あります
APIの価格表は「100万トークンあたりいくら」の形で示されます。ただし1つではありません。
入力トークン。こちらが渡した文章です。指示、資料、これまでのやりとり。全部入ります。
出力トークン。AIが書いた文章です。こちらが数倍高いのが普通です。読むより書くほうが計算がかかるからです。
2026年9月時点の例を挙げます。OpenAIのGPT-6 AstraはAPI標準料金で入力が100万トークンあたり10ドル、出力が50ドル。ただしFastモードは2倍で、キャッシュの読み書きには別の料金が付きます。AnthropicのClaude Fable 5.1も入力10ドル、出力50ドルです。どちらも出力が5倍。
キャッシュ読み。一度処理して置いておいた文脈を、もう一度読むときの料金です。ここに別の単価が設定されていることがあります。
2026年9月1日、AnthropicはFable 5.1でここを75%下げて、100万トークンあたり0.25ドルにしました。入力の10ドル、出力の50ドルは据え置きです。
安くなったのは「読み直し」だけですが、効き方は大きいとされています。前の版であるFable 5と比べて、トークンで課金される場合に限り、典型的な使い方で全体が約25%安、文脈と道具を多用するエージェント的な使い方だと最大45%安。同社が既定の努力の水準で、2026年8月の4週間の実使用を測った数字です。
価格表のどこを削るかを見ると、その会社がどんな使われ方を主流と見ているかが分かります。読み直しを削ったということは、そこが費用の大半になっていたということです。
同じ依頼でも、量が変わります
ここが見積もりのいちばん難しいところです。使うトークン数は、事前に決まりません。
いまのモデルは、答える前に長い下書きを書きます(思考の流れの監視とは)。エージェントとして動く場合は、道具を呼び、結果を読み、やり直します(AIエージェントとは)。何回やり直すかは、やってみないと分かりません。
提供元自身が、そこを認めています。
2026年9月2日のGemini 3.8 Flashの発表では、このモデルは設計上「より頑張る」とされています。複雑な課題では推論の手順を余分に踏み、道具を繰り返し呼ぶ。とくに努力の水準(effort)を上げた設定では、性能を出すためにトークンを多く使うことがあると書かれています。そのうえで、計算効率が最優先なら努力の水準を下げてトークンを抑えるか、前の版である3.7 Flashを使い続けてよいとまで添えてあります。
逆の方向も出ています。同年9月9日の業務向けGPT-6 Astraの発表では、より少ないトークンとより少ないやり直しで課題を終えるように訓練したとしています。
つまり単価と使用量は、別々に動きます。単価が同じでも量が増えれば請求は増えるし、単価が高くても量が減れば安くなることがあります。
「努力の水準」という設定
最近の価格の話を読むとき、もう1つ知っておくと早い言葉があります。努力の水準(effort)です。
どれだけ考えてから答えるかを、使う側が選べる設定です。低くすれば速くて安く、高くすれば時間もトークンも使うかわりに成績が上がる。
各社の比較表では、この水準ごとに点と費用が並んでいることがあります。「同じモデルなら同じ費用」ではありません。設定で変わります。
表を読むときは、どの水準で測った数字かを確かめるのが安全です(システムカードとは)。
実務では、こう測ります
単価の比較には意味がありません。手順は3つです。
1. 自社の代表的な作業を3つ決める。「議事録から要点を出す」「問い合わせに一次回答を書く」「バグを直す」のような、実際にやらせる形のものにします。
2. それぞれを何回か流して、トークン数と時間を記録する。1回では足りません。うまくいった回とこじれた回で、量が何倍も違うことがあります。
3. 作業1件あたりの円に直す。ここではじめて比べられます。
モデルを乗り換えるときも同じです。単価が下がったから安くなる、とは限りません。使う量が増えていれば、請求は増えます。
詳しい手順は別にまとめてあります(AI利用のコスト管理)。
桁が変わってきています
最後に、規模の感覚を置いておきます。
2026年9月6日にOpenAIが公開した社内の計測によると、同社の研究組織で、8月中旬の時点でエージェント利用量の中央値にあたる研究者が1日あたりAPI価格で600ドル超を使っているとのことです。上位1割はいま1日7000ドル超。
9月8日に発表されたミレニアム問題群への取り組みでは、全問題を通じて約3000億の出力トークン、うちNavier-Stokes分が約1300億が使われたとされています(詳細)。出力100万トークンあたり50ドルで単純計算すると、それだけで大きな金額になります。
もちろん社内の計算資源なので、そのまま請求されるわけではありません。ただ、トークンという単位が「文章の切れ端」から「計算資源の単位」に寄ってきているのは確かだと思います。
関連する用語とレビュー
AIエージェントとは / ハーネスとは / システムカードとは / AI利用クレジットとは / AI利用のコスト管理 / Googleの防御用AIは軽量級 Chromeの修正で2.6倍 / 週次: 同じモデルに名前が二つついた週 / AI用語解説トップ