最後に、この一文が読めるようになります。
「入力が272kトークンを超えると、そのリクエスト全体の入力・キャッシュ単価が2倍、出力単価が1.5倍になる。」
今はわからなくて大丈夫です。この本で順番にほどいていきます。AIと話すときは、いつも文章を入力して、返事を待つだけ。ところが長い資料を渡したり、何時間も作業を続けたりすると、「読める量」「以前の話を覚えているか」「料金」が気になってきます。この3つは関係していますが、同じことではありません。
ここでは、旅行の相談や資料づくりを例に、AIが扱う情報の量を説明します。計算が苦手でも、先に図や具体例を読めば進められます。途中で止めても、左の目次から戻れます。スマートフォンでは冒頭の「目次を開く」を使ってください。
言葉を知る
トークン、入力・出力、コンテキストを理解します。
記憶を分ける
今見ている情報と、保存してある情報を区別します。
料金を読める
272kの境界を、計算例と操作で確かめます。
文章を数える、小さな「部品」。
まず、トークンという言葉から始めます。AIは文章を、人間が見る「一文」のままで扱うのではなく、細かな単位に分けて処理します。この単位がトークンです。
たとえば、長いネックレスを小さなビーズに分けて数えるようなものです。ここで大切なのは、1トークンが必ず1文字、または1単語になるわけではないこと。短い単語が一つの部品になることも、単語の途中で分かれることもあります。記号や空白も関係します。
「明日の旅行について相談したい。」
日本語の文字数だけでは、正確に数えられません。
同じ文字数でも、日本語・英語・数字・プログラムのコードでは、トークン数が変わります。使うモデルや、文章を分割する仕組みによっても異なります。「日本語1文字=必ず何トークン」と決めつけず、正確な量が必要なときは、そのモデルに対応した計測方法を使います。
なお、画像などもモデルに渡すと処理量に数えられる場合があります。この本は、仕組みをつかみやすい文章の例を中心に進めます。
| 表記 | 読み替えると | 数字で書くと |
|---|---|---|
| 1k | 千 | 1,000 |
| 258k | 25万8千 | 258,000 |
| 272k | 27万2千 | 272,000 |
| 1M | 100万(メガ) | 1,000,000 |
| 1.05M | 105万 | 1,050,000 |
この本のkは1,000倍、Mは1,000,000倍の意味です。コンピューターの容量の説明で見かける「1,024倍」とは分けて考えてください。
関連する公式説明:Text generation、Conversation state
AIに渡すものと、AIが作るもの。
あなたが「京都へ2泊3日で旅行します。予定を考えて」と送ったとします。このAIに渡す情報が「入力」です。AIが返す旅行プランは「出力」です。
あなたの依頼
「京都旅行の予定を考えて」
AIが情報を使って
回答を組み立てる
AIの回答
「1日目は……」
「入力」は、最後に打った質問だけではありません。
続けて「雨の日なら?」と聞くとき、AIが旅行の話だとわかるには、前の依頼や旅行プランも必要です。アプリは必要な会話履歴を一緒に渡したり、サービス側に保存した履歴を参照させたりします。
入力には、質問のほかに、読み込んだ資料、アプリが用意した指示、検索結果、ツールの実行結果なども含まれます。自分の質問が短くても、AIに渡る情報全体は大きいことがあります。
画面に見えている依頼
「雨の日なら?」
人間には短い一言です。
回答に使う入力の例
京都・2泊3日という条件、前の旅程、そのほかの指示、新しい質問。
少し詳しく:AIが考えるための量もあります。
一部のモデルでは、回答に至る内部の推論にもトークンを使います。これは画面に表示される返事の文字量とは別です。APIの課金では、こうした推論トークンも出力料金の対象になり得ます。後半の計算機では「画面に見える回答」だけでなく、課金対象になる出力全体を入力します。
用語を整理すると、回答として見える出力と内部の推論は別ですが、料金表の「出力トークン」は両方を含む場合があります。
今の作業に広げておける「机」。
コンテキストは、AIが今の回答を作るために参照する情報です。日本語では「文脈」と訳されますが、AIの説明では「今の依頼に使う情報一式」と考えるとわかりやすくなります。
コンテキスト・ウィンドウは、その情報と生成に使うトークンを収められる上限です。机にたとえるなら、同時に広げて作業できる広さに当たります。資料が棚に何千冊あっても、机の上に全部広げられるとは限りません。
守ってほしい条件
ファイルの内容
「1Mのコンテキスト」と聞いても、いつでも100万トークンの資料を丸ごと入れ、その上で長い回答を追加できるとは限りません。入力だけでなく、出力や推論に使う分も考える必要があります。
机の広さと、読み解く力は別です。
大きな机なら、複数の契約書や長い設計資料を同時に扱いやすくなります。でも、机が広いだけで、資料の矛盾を必ず見つけられるわけではありません。「収まる量」と「正確に理解して使えるか」は別に確認します。
机の上と、保管ノートを分けて考える。
人間は「前に話したことを覚えている」と、ひとまとめに言います。しかし、AIアプリで「覚えている」ように見える理由はいくつかあります。ここを分けると、「メモリーを使えばコンテキストは無限になるの?」という疑問も解けます。
コンテキスト = 机の上
今の返事に使う情報。質問・資料・会話などを、利用できる枠の中に入れて扱います。
メモリー = 保管ノート
好みや継続中の作業などを、アプリが保存して再利用する仕組み。内容や保存方法は製品によって違います。
たとえば、「説明は日本語で、初心者向けにしてほしい」という好みをノートに保存しておきます。次の相談でアプリがその情報を取り出し、AIへの指示に加えれば、以前の好みを踏まえた回答になります。
この場合も、取り出して今回の入力に入れた情報は、その分のコンテキストを使います。ノートがあるから机の広さが無限になるわけではありません。また、保存されている情報が毎回すべて取り出されるとも限りません。
| 混同しやすいもの | 何を指す? | この本でのたとえ |
|---|---|---|
| モデルの学習済み知識 | 学習によって身につけた、言語や一般知識などの能力。会話ログそのものとは別。 | これまでに身につけた知識 |
| コンテキスト | 今回の処理で使う情報。 | 今、机に広げた資料 |
| 会話履歴 | 過去のやり取りの記録。すべてが毎回使われるとは限らない。 | 過去の打ち合わせ記録 |
| アプリのメモリー | 後から再利用するために保存した情報。動作は製品や設定次第。 | 好みや引き継ぎ事項のノート |
| コンピューターのメモリー | Macなどの機器が処理に使う物理的な記憶装置。16GBなどと表す。 | この教材のAIメモリーとは別の用語 |
この教材では、メモリーを「外に保存して、必要なときに取り出す情報」として説明しています。AIが人間と同じ仕組みで記憶している、という意味ではありません。
製品ごとの実例:OpenAI公式 Memories。表と保管ノートの図式は、用語を区別するための教育上の整理です。
短い質問を続けても、入力は大きくなります。
旅行の相談を続けてみましょう。1回目に条件を伝え、2回目に雨の場合を聞き、3回目に予算を追加します。前の条件を引き継ぐには、以前の情報を今回も使う必要があります。
会話が積み重なるイメージ
[京都・2泊3日という依頼]→ 最初の旅程
[最初の依頼 + 最初の旅程 + 雨の場合の質問]→ 雨の日の旅程
[これまでの会話 + 予算についての質問]→ 予算に合わせた旅程
あなたが新しく打った文章は短くても、AIが参照する会話全体は長くなっています。そのため、入力の量は「今回の質問の長さ」だけでは判断できません。
一度読んだ資料は、次から無料になるのでしょうか。
APIでは、以前の情報を再び入力として使うと、その情報も料金の対象になり得ます。会話を継続するための仕組みを使っただけで、履歴の入力料金がなくなるわけではありません。一方、同じ部分の処理を再利用して、安い単価を使える場合があります。これを後で説明する「キャッシュ」と呼びます。
机がいっぱいになる前に、引き継ぎメモを作る。
コンパクト(compaction)は、会話を続けるため、これまでの情報をより短い形に整理する処理です。自動で行うものを「オートコンパクト」「自動コンパクト」と呼びます。
たとえば、旅行の相談が何十往復にもなったら、「京都2泊3日・予算5万円・雨天用の案も必要・最終日は夕方に帰る」と引き継ぎメモを作ります。そのメモと最近の会話を机に残せば、次の相談に使う余地を作れます。
実際の圧縮は、人間が読む短い要約文だけとは限りません。モデル用の圧縮された状態を使う場合もあります。ここでは「引き継ぎメモ」としてイメージしてください。
体験:机の上を整理してみよう
説明用の仮想例です。実際の圧縮率や保持する内容を再現するものではありません。
整理前:80%使用。過去の会話が机の大半を占めています。
便利ですが、原文が完全に残るわけではありません。
短く整理すると、重要な条件は引き継げても、途中の細かな表現や、却下した案の理由まで保てるとは限りません。元の会話を画面で読める場合でも、モデルが次に使う情報は短い形に変わっていることがあります。
正確な引用が必要な文章や、変更してはいけない数値は、元の資料を参照できる形で残してください。「AIが覚えているはず」に頼るより、必要な箇所を再び確認できる方が確実です。
早めにコンパクトする
新しい情報を入れる余地を作りやすくなります。一方で、細部の引き継ぎや圧縮処理の回数が気になります。
大きな枠を長く使う
多くの原文を一緒に扱えます。一方で、大きい入力を処理し続けるため、料金や待ち時間への影響を確認する必要があります。
この環境の設定例:50%でコンパクト
この会話で設定した値は129,200トークンです。表示上の実効枠258,400の半分を目安にしています。割合を追いかける設定ではなく、固定のトークン数です。
model_auto_compact_token_limit = 129200
これは圧縮を始めるための閾値です。閾値とは「処理を始める目安の境界値」。実際に判定されるタイミングによって、使用量がこの数字ぴったりで止まるわけではありません。また、表示枠の計算に使う95%とは別の設定です。
早めの圧縮には処理自体の負担や、キャッシュを再利用しにくくなる場合もあるため、「50%なら必ず最安・最高品質」という意味ではありません。
出典:Compaction、Codex設定リファレンス、Prompt caching。129,200はこの環境で選んだ設定値です。
ここからは「使った量に応じた料金」の話です。
API(エーピーアイ)は、プログラムからAIに処理を依頼するための窓口です。たとえば、自作の翻訳アプリが文章をAIへ送り、返ってきた翻訳を画面に表示する。その受け渡しに使います。
レストランにたとえるなら、ChatGPTのようなアプリは注文画面や席まで整ったお店。APIは、自分で作ったサービスから調理を依頼する窓口に近いものです。ただし実際の契約内容はサービスによって異なります。
ChatGPT / Codexのプラン
アプリの契約に応じた利用条件や上限があります。この教材のドル計算を、そのまま月額請求や利用枠に当てはめることはできません。
APIの従量料金
どのモデルを、どの処理方式で、何トークン使ったかなどに応じて料金を計算します。この先の数値例はこちらです。
「100万トークンあたり」は、料金の単位です。
「入力100万トークンあたり10ドル」は、100万トークン単位で購入しなければならないという意味ではありません。計算上は、使ったトークン数に比例させます。たとえば10万トークンなら100万の10分の1なので、単価10ドルの場合は1ドルです。
例:100,000 ÷ 1,000,000 × $10 = $1
出力にも別の単価があります。入力の計算と出力の計算をして、最後に合計します。1回の依頼には、読むための料金と、生成するための料金があると考えるとわかりやすいでしょう。
キャッシュは、同じ部分の処理を再利用する仕組み。
キャッシュは、前に処理した入力の一部を再利用するための仕組みです。たとえば毎回同じ資料から始まる依頼なら、条件が合うと、その先頭部分の処理を再利用できます。記憶ノートというより、同じ作業を繰り返すときの準備済みデータに近いものです。
キャッシュは、AIがあなたを長期的に覚えるメモリー機能ではありません。キャッシュされた入力もコンテキストを使い、料金の判定対象から消えるわけではありません。条件が合う部分に、キャッシュ用の料金区分が適用されます。
272kを超えると、「今回の単価表」が変わります。
いよいよ最初の疑問です。GPT-6 AstraのAPI・Standardでは、1回の入力が272,000トークンを超えると、そのリクエスト全体に長いコンテキスト用の単価が適用されます。
| 料金区分 | 入力が272,000以下 | 入力が272,000超 | 倍率 |
|---|---|---|---|
| 通常の入力 | $10 | $20 | 2倍 |
| キャッシュ読み込み | $1 | $2 | 2倍 |
| キャッシュ書き込み | $12.50 | $25 | 2倍 |
| 出力 | $50 | $75 | 1.5倍 |
2026年9月23日確認。出典:OpenAI公式 GPT-6 Astraモデル仕様。処理方式や追加サービスなどで条件は変わります。
「超えた1トークンだけ2倍」ではありません。
荷物の配送で、ある大きさを超えると荷物全体が「大型サイズ」の料金区分になる、と考えてください。大きさを超えた端の部分だけに追加料金をつける仕組みとは違います。
同じように、この料金境界では、その1回に含まれる入力全体の単価が変わり、さらにその1回の出力単価も変わります。ただし、以前のリクエストにさかのぼって値上げされるという意味ではありません。
入力 272,000
入力:0.272 × $10 = $2.72
出力:0.01 × $50 = $0.50
入力 272,001
入力:0.272001 × $20 = $5.44002
出力:0.01 × $75 = $0.75
比較条件:どちらも課金対象の出力10,000トークン、キャッシュ読み込み・書き込みなし、Standard。税・ツール料金などは含めません。金額は比較用の計算値です。
料金が「必ず2倍」になるわけでもありません。
入力は2倍、出力は1.5倍なので、合計の変化は入力と出力の割合で変わります。上の比較では、合計は約1.92倍です。「全体に長いコンテキスト用の単価が適用される」と「合計金額が一律2倍になる」を区別してください。
キャッシュを使う場合も、通常入力・キャッシュ読み込み・キャッシュ書き込みに分かれた入力全体で境界を考えます。キャッシュになった分を引いて272k以下と判定する計算にはしません。
数字を動かして、料金の変わり方を確かめよう。
まず「272,000」と「272,001」のボタンを交互に押してください。出力の量を変えなくても、入力の境界を超えると出力料金まで変わることがわかります。
1リクエストの料金計算機
GPT-6 Astra / Standard / 米ドル。入力は0〜900,000、課金対象の出力は0〜128,000に制限した学習用計算機です。
見える回答に加え、課金対象の推論トークンを含む値です。0は計算上の比較用です。
慣れたら:キャッシュも含めて計算する
入力全体のうち、キャッシュ読み込みと書き込みの量を指定します。残りが通常入力です。同じトークンを二重に数えないよう、3つの区分に分けます。
読み込み+書き込みは入力全体以下にしてください。単価区分の学習用であり、この入力操作で実際にキャッシュを作成するわけではありません。
入力272,000以下の単価
単価 / 100万:通常入力 $10・読み込み $1・書き込み $12.5・出力 $50
試算には、税、為替、検索などのツール料金、Fast・Batch・Flex等の処理方式による調整、地域設定などは含めません。実際の請求はAPIの利用記録と適用される料金条件で確認してください。計算はこのブラウザー内だけで行い、AIへの依頼や課金は発生しません。
おすすめの試し方
- 境界を見る:初期値のまま「272,001」を押す。入力・出力の両方が変わります。
- 合計との違いを見る:入力を270,000、出力を10,000にする。長いコンテキスト用の単価にはなりません。
- キャッシュを見る:入力300,000、読み込み200,000、書き込み0、出力10,000にする。合計は$3.15000です。安い読み込み単価を使えても、判定は300,000の入力全体です。
1Mに対応しているのに、なぜ表示は258k?
ここまで来ると、二つの数字を分けて読めます。モデルが扱える最大量と、アプリが通常の作業に割り当てる量です。大きな会議室が使える施設でも、日常の打ち合わせでは小さな部屋を使うことがある、と考えてください。
GPT-6 Astraのコンテキスト
モデル仕様に記載された容量。最大出力は128,000トークン。入力と生成に必要な余地を分けて考えます。
通常枠から計算した実効容量
モデル情報の通常枠272,000に、実効割合95%を掛けた値。約258kという表示と一致します。
95%は実効容量の計算に使う割合。自動コンパクトの開始割合とは別です。
この環境のモデル情報には、別に最大枠872,000も記録されていました。ただし、これとAPI仕様1,050,000との差の内訳や、今のタスクでその枠を利用できるかは、この数値だけでは確定できません。設定値が存在することと、実際にその容量で動作することは分けて確認します。
なぜ日常の枠を小さくするのか。
確認できた事実 API料金が切り替わる入力の境界は272kで、この環境の通常枠も272kでした。公式仕様上、モデルの最大容量は1.05Mです。
ここからは推測 大きな情報を毎回処理する負担を抑え、日常的な使いやすさと費用を両立するために、通常枠を小さめにする設計は合理的です。ただし、「料金が理由でこの既定値を選んだ」とOpenAIが説明した資料は、この教材の調査では確認できていません。二つの境界が一致することだけでは、設計意図の証明にはなりません。
大きな枠には、長い原文を同時に比べられる利点があります。小さめの枠と圧縮を組み合わせる方法には、情報量を管理しながら作業を続けられる利点があります。どちらが合うかは、原文の細部をどれだけ同時に必要とするかで変わります。
出典:GPT-6 Astra公式仕様、設定リファレンス。272,000・95%・872,000は2026年9月23日の制作者のCodex環境で読み取った値で、全ユーザー共通の保証値ではありません。
自分の作業に当てはめてみましょう。
| やりたいこと | 考えるポイント |
|---|---|
| 短い文章を直す | その文章と目的があれば進められることが多い。無関係な長い資料を一緒に入れる必要はありません。 |
| 複数の長い資料を照合する | 同時に比べる原文が多いほど、大きな枠が役立つ場合があります。容量と料金の両方を確認します。 |
| 何時間も同じ作業を続ける | 決定事項、未完了の作業、参照する原文の場所を整理すると、圧縮後に再開しやすくなります。 |
| 次回も好みを反映したい | アプリのメモリーや保存文書の役割。今の会話に残っていることと、次回使えることを分けます。 |
| API費用を把握したい | 入力全体、キャッシュの区分、課金対象の出力、処理方式を確認。文字数だけで請求額を決めないようにします。 |
引き継ぎメモに残すと役立つこと
目的:初心者向けの京都旅行プランを作る。
決まった条件:2泊3日、予算5万円、雨天案も用意。
変更してはいけないこと:最終日は17時までに京都駅へ戻る。
まだ決まっていないこと:2日目の昼食。
原文の場所:予約確認書と、利用者が示した条件の文書。
これは内容整理の例です。保存場所を決め、実際に保存されたことまで確認して初めて、次回使える引き継ぎになります。
4問で、理解を確かめる
間違えても問題ありません。答え合わせで理由を読んでください。
よくある疑問:100万トークンの枠を選ぶだけで高くなる?
このAPI料金条件は、選んだ容量ではなく、実際のリクエストの入力トークン数を見ます。広い枠を利用できる状態でも、入力が272,000以下なら、ここで説明した長いコンテキスト用の割増条件には該当しません。ほかの処理方式の料金などは別に確認します。
よくある疑問:272kを超えたら、残りの会話もずっと割高?
ここでの判定は各リクエストごとです。あるリクエストが境界を超えたことで、過去のリクエストの料金が変わることはありません。次の入力が境界以下になれば、その次のリクエストは境界以下の単価で計算します。
よくある疑問:コンパクトは、元のファイルを小さく書き換えるの?
ここで説明したコンパクトは、AIが会話を続けるための文脈を整理する処理です。元のPDFや文書ファイルを編集する操作とは別です。アプリが履歴をどう保存するかも、別の仕様です。
もう、最初の一文を読み解けます。
AIに渡す情報の量は、トークンで数えます。今使う情報には容量の上限があり、メモリーに保存してある情報とは区別します。
GPT-6 AstraのAPIでは、今回の入力が272,000トークンを超えると、今回の入力・キャッシュの単価は2倍、出力の単価は1.5倍。これは「超えた部分だけ」の値上げではありません。
そして、モデルの最大容量、アプリで使う枠、コンパクトを始める目安、料金の境界。それぞれが何を表す数字なのかを見れば、258kと1Mが一緒に出てきても整理できます。
用語を引き直す・公式資料で確かめる。
| 言葉 | この教材での意味 |
|---|---|
| トークン | AIが文章などを扱う小さな単位。文字数とは一致しない。 |
| 入力 / 出力 | AIへ渡す情報 / AIが生成するもの。料金上の出力には推論も含まれ得る。 |
| リクエスト | AIへの1回の処理依頼。 |
| コンテキスト | 今回の処理で参照する情報。 |
| コンテキスト・ウィンドウ | 入力や生成に使うトークンを収められる上限。 |
| メモリー | 後で再利用するために情報を保存するアプリの仕組み。製品ごとに異なる。 |
| コンパクト | 会話を続けるため、文脈を短い形に整理すること。 |
| 閾値(しきいち) | 動作や条件が切り替わる境界値。 |
| API | プログラムからAIなどに処理を依頼するための窓口。 |
| キャッシュ | 同じ入力部分の処理を再利用するための仕組み。 |
| Standard | この教材の料金例に用いた通常の処理方式。 |
| k / M | この教材では千倍 / 百万倍。272k=272,000、1M=1,000,000。 |
公式資料
確認日:2026年9月23日。以下のリンクを開くとインターネットに接続します。教材本体の閲覧・図・計算はオフラインで使えます。
- GPT-6 Astra — モデル仕様と料金
1,050,000のコンテキスト、128,000の最大出力、Standard単価、272k超の倍率。 - Conversation state — 会話状態とコンテキスト
会話の引き継ぎ、入力・出力・推論と容量の関係。 - Text generation — テキスト生成
モデルへの入力と生成の基本。 - Reasoning models — 推論モデル
内部の推論と出力・利用量の考え方。 - Prompt caching — キャッシュ
入力の先頭部分の一致、読み込み・書き込み、圧縮による影響。 - Compaction — 文脈の圧縮
長い処理を続けるための圧縮状態。 - Configuration Reference — Codex設定
コンテキスト枠と自動コンパクトの閾値は別設定。 - Memories — 保存して再利用する情報
アプリのメモリー機能についての製品別説明。
料金や製品仕様は更新されます。実際にAPIを利用するときは、利用するモデル・処理方式・その時点の公式料金を確認してください。このHTMLは、保存時点の説明を自動更新するものではありません。