AIの「読める量」と料金のしくみ
読書の進み具合 0%料金を試す
A gentle guide to AI · 2026.09.23

AIは、どれだけ
読める?
その量で、料金は
どう変わる?

「トークンって何?」から始めましょう。
小さな部品、作業机、保管ノート。
図と具体例で、一つずつ理解する入門書です。

予備知識ゼロでOK図解 + 2つの操作体験読了目安 30〜45分
AIの作業机と保管ノート机の上の資料が今使う情報。別の棚にあるノートは保存情報。必要な情報を机に持ってきて回答を作る。保存してある情報今の資料を使って回答をつくろう。今の依頼机の広さ = 一度に扱える量理解のためのたとえです。実物の構造ではありません。
目次を開く00 この本の読み方01 トークンとは02 入力と出力03 コンテキスト04 メモリーとの違い05 会話はなぜ増える?06 自動コンパクト07 APIと料金の単位08 272kを超えると09 料金を試す10 1Mと258kの関係11 使い分けと復習出典・用語集
00 · START HERE

最後に、この一文が読めるようになります。

「入力が272kトークンを超えると、そのリクエスト全体の入力・キャッシュ単価が2倍、出力単価が1.5倍になる。」

今はわからなくて大丈夫です。この本で順番にほどいていきます。

AIと話すときは、いつも文章を入力して、返事を待つだけ。ところが長い資料を渡したり、何時間も作業を続けたりすると、「読める量」「以前の話を覚えているか」「料金」が気になってきます。この3つは関係していますが、同じことではありません。

ここでは、旅行の相談や資料づくりを例に、AIが扱う情報の量を説明します。計算が苦手でも、先に図や具体例を読めば進められます。途中で止めても、左の目次から戻れます。スマートフォンでは冒頭の「目次を開く」を使ってください。

01

言葉を知る

トークン、入力・出力、コンテキストを理解します。

02

記憶を分ける

今見ている情報と、保存してある情報を区別します。

03

料金を読める

272kの境界を、計算例と操作で確かめます。

この教材で扱う範囲料金例は、2026年9月23日に確認したGPT-6 AstraのAPI・Standard(通常処理)です。ChatGPTやCodexの月額料金を計算する教材ではありません。「API」は第7章で説明します。図中の机やノートは理解のためのたとえで、AI内部をそのまま描いたものではありません。
01 · TOKEN

文章を数える、小さな「部品」。

まず、トークンという言葉から始めます。AIは文章を、人間が見る「一文」のままで扱うのではなく、細かな単位に分けて処理します。この単位がトークンです。

たとえば、長いネックレスを小さなビーズに分けて数えるようなものです。ここで大切なのは、1トークンが必ず1文字、または1単語になるわけではないこと。短い単語が一つの部品になることも、単語の途中で分かれることもあります。記号や空白も関係します。

文章 → 小さな部品 → 数えられる量

「明日の旅行について相談したい。」

明日旅行について相談したい
上の区切りは説明用のイメージです。実際のGPT-6の分割結果やトークン数を示すものではありません。

日本語の文字数だけでは、正確に数えられません。

同じ文字数でも、日本語・英語・数字・プログラムのコードでは、トークン数が変わります。使うモデルや、文章を分割する仕組みによっても異なります。「日本語1文字=必ず何トークン」と決めつけず、正確な量が必要なときは、そのモデルに対応した計測方法を使います。

なお、画像などもモデルに渡すと処理量に数えられる場合があります。この本は、仕組みをつかみやすい文章の例を中心に進めます。

表記読み替えると数字で書くと
1k1,000
258k25万8千258,000
272k27万2千272,000
1M100万(メガ)1,000,000
1.05M105万1,050,000

この本のkは1,000倍、Mは1,000,000倍の意味です。コンピューターの容量の説明で見かける「1,024倍」とは分けて考えてください。

ここで覚えることトークンは、AIが文章などの量を数えるための単位。文字数と同じではありません。

関連する公式説明:Text generationConversation state

02 · INPUT & OUTPUT

AIに渡すものと、AIが作るもの。

あなたが「京都へ2泊3日で旅行します。予定を考えて」と送ったとします。このAIに渡す情報が「入力」です。AIが返す旅行プランは「出力」です。

入力

あなたの依頼
「京都旅行の予定を考えて」

処理

AIが情報を使って
回答を組み立てる

出力

AIの回答
「1日目は……」

1回の依頼と処理を、ここでは「1リクエスト」と呼びます。日本語なら「1回の処理依頼」です。

「入力」は、最後に打った質問だけではありません。

続けて「雨の日なら?」と聞くとき、AIが旅行の話だとわかるには、前の依頼や旅行プランも必要です。アプリは必要な会話履歴を一緒に渡したり、サービス側に保存した履歴を参照させたりします。

入力には、質問のほかに、読み込んだ資料、アプリが用意した指示、検索結果、ツールの実行結果なども含まれます。自分の質問が短くても、AIに渡る情報全体は大きいことがあります。

画面に見えている依頼

「雨の日なら?」
人間には短い一言です。

回答に使う入力の例

京都・2泊3日という条件、前の旅程、そのほかの指示、新しい質問。

少し詳しく:AIが考えるための量もあります。

一部のモデルでは、回答に至る内部の推論にもトークンを使います。これは画面に表示される返事の文字量とは別です。APIの課金では、こうした推論トークンも出力料金の対象になり得ます。後半の計算機では「画面に見える回答」だけでなく、課金対象になる出力全体を入力します。

用語を整理すると、回答として見える出力と内部の推論は別ですが、料金表の「出力トークン」は両方を含む場合があります。

ここで覚えること入力=AIに渡す情報。出力=AIが作るもの。入力には、それまでの会話や資料も入ります。

出典:Conversation stateReasoning models

03 · CONTEXT WINDOW

今の作業に広げておける「机」。

コンテキストは、AIが今の回答を作るために参照する情報です。日本語では「文脈」と訳されますが、AIの説明では「今の依頼に使う情報一式」と考えるとわかりやすくなります。

コンテキスト・ウィンドウは、その情報と生成に使うトークンを収められる上限です。机にたとえるなら、同時に広げて作業できる広さに当たります。資料が棚に何千冊あっても、机の上に全部広げられるとは限りません。

指示・質問何をしてほしいか
守ってほしい条件
会話・資料やり取りや
ファイルの内容
考える余地内部の推論など
答える余地これから作る回答
コンテキスト・ウィンドウには、入力と生成に使う余地が必要一度に使える机の広さ = コンテキスト・ウィンドウ指示・質問何をしてほしいか守ってほしい条件会話・資料これまでのやり取り検索・ファイルの内容考える余地内部の推論など答える余地これから作る回答幅の比率は説明用。実際の配分や推論の保持方法はモデル・サービスによって異なります。
大きな入力だけで机を使い切ると、生成する余地が足りなくなることがあります。

「1Mのコンテキスト」と聞いても、いつでも100万トークンの資料を丸ごと入れ、その上で長い回答を追加できるとは限りません。入力だけでなく、出力や推論に使う分も考える必要があります。

机の広さと、読み解く力は別です。

大きな机なら、複数の契約書や長い設計資料を同時に扱いやすくなります。でも、机が広いだけで、資料の矛盾を必ず見つけられるわけではありません。「収まる量」と「正確に理解して使えるか」は別に確認します。

チャット画面に残っていることと、今使われていることも別です。画面を上へスクロールして過去の発言が読めても、それが一字一句すべて、今回の処理に渡されているとは限りません。アプリが一部を選んだり、短くまとめたりする場合があります。
ここで覚えることコンテキスト・ウィンドウは「今、一度に扱える容量」。生涯覚えていられる量や、月間の利用枠ではありません。

出典:Conversation state — context window

04 · MEMORY

机の上と、保管ノートを分けて考える。

人間は「前に話したことを覚えている」と、ひとまとめに言います。しかし、AIアプリで「覚えている」ように見える理由はいくつかあります。ここを分けると、「メモリーを使えばコンテキストは無限になるの?」という疑問も解けます。

今使う

コンテキスト = 机の上

今の返事に使う情報。質問・資料・会話などを、利用できる枠の中に入れて扱います。

後でも使えるよう保存する

メモリー = 保管ノート

好みや継続中の作業などを、アプリが保存して再利用する仕組み。内容や保存方法は製品によって違います。

たとえば、「説明は日本語で、初心者向けにしてほしい」という好みをノートに保存しておきます。次の相談でアプリがその情報を取り出し、AIへの指示に加えれば、以前の好みを踏まえた回答になります。

この場合も、取り出して今回の入力に入れた情報は、その分のコンテキストを使います。ノートがあるから机の広さが無限になるわけではありません。また、保存されている情報が毎回すべて取り出されるとも限りません。

混同しやすいもの何を指す?この本でのたとえ
モデルの学習済み知識学習によって身につけた、言語や一般知識などの能力。会話ログそのものとは別。これまでに身につけた知識
コンテキスト今回の処理で使う情報。今、机に広げた資料
会話履歴過去のやり取りの記録。すべてが毎回使われるとは限らない。過去の打ち合わせ記録
アプリのメモリー後から再利用するために保存した情報。動作は製品や設定次第。好みや引き継ぎ事項のノート
コンピューターのメモリーMacなどの機器が処理に使う物理的な記憶装置。16GBなどと表す。この教材のAIメモリーとは別の用語
「覚えておいて」と言えば、必ず永久保存される?そうとは限りません。保存機能があるか、何が保存されたかは、使っているアプリと設定によります。日付、金額、決定事項などの重要な情報は、確認できる文書にも残すと再利用しやすくなります。

この教材では、メモリーを「外に保存して、必要なときに取り出す情報」として説明しています。AIが人間と同じ仕組みで記憶している、という意味ではありません。

製品ごとの実例:OpenAI公式 Memories。表と保管ノートの図式は、用語を区別するための教育上の整理です。

05 · CONVERSATION

短い質問を続けても、入力は大きくなります。

旅行の相談を続けてみましょう。1回目に条件を伝え、2回目に雨の場合を聞き、3回目に予算を追加します。前の条件を引き継ぐには、以前の情報を今回も使う必要があります。

会話が積み重なるイメージ

1回目

[京都・2泊3日という依頼]→ 最初の旅程

2回目

[最初の依頼 + 最初の旅程 + 雨の場合の質問]→ 雨の日の旅程

3回目

[これまでの会話 + 予算についての質問]→ 予算に合わせた旅程

毎回すべての原文を渡すと仮定した単純な例。実際には履歴の選択、圧縮、保存状態の参照などが行われます。

あなたが新しく打った文章は短くても、AIが参照する会話全体は長くなっています。そのため、入力の量は「今回の質問の長さ」だけでは判断できません。

一度読んだ資料は、次から無料になるのでしょうか。

APIでは、以前の情報を再び入力として使うと、その情報も料金の対象になり得ます。会話を継続するための仕組みを使っただけで、履歴の入力料金がなくなるわけではありません。一方、同じ部分の処理を再利用して、安い単価を使える場合があります。これを後で説明する「キャッシュ」と呼びます。

会話全体の累計と、1回の入力を区別しましょう。10回の処理で毎回30,000トークンを入力したら、累計は300,000トークンです。でも、1回ごとの入力は30,000。後半で説明する272kの境界は、こうした累計ではなく、各リクエストの入力で判定します。
ここで覚えること長い会話では、以前の情報も入力になります。料金の境界は「これまで全部で何トークン使ったか」ではなく、「今回の入力はどれだけか」で考えます。

出典:Conversation statePrompt caching

06 · COMPACTION

机がいっぱいになる前に、引き継ぎメモを作る。

コンパクト(compaction)は、会話を続けるため、これまでの情報をより短い形に整理する処理です。自動で行うものを「オートコンパクト」「自動コンパクト」と呼びます。

たとえば、旅行の相談が何十往復にもなったら、「京都2泊3日・予算5万円・雨天用の案も必要・最終日は夕方に帰る」と引き継ぎメモを作ります。そのメモと最近の会話を机に残せば、次の相談に使う余地を作れます。

実際の圧縮は、人間が読む短い要約文だけとは限りません。モデル用の圧縮された状態を使う場合もあります。ここでは「引き継ぎメモ」としてイメージしてください。

体験:机の上を整理してみよう

説明用の仮想例です。実際の圧縮率や保持する内容を再現するものではありません。

過去の会話最近の会話現在の依頼空き

整理前:80%使用。過去の会話が机の大半を占めています。

過去の会話には、候補、迷った理由、雑談、決定事項が混ざっています。

便利ですが、原文が完全に残るわけではありません。

短く整理すると、重要な条件は引き継げても、途中の細かな表現や、却下した案の理由まで保てるとは限りません。元の会話を画面で読める場合でも、モデルが次に使う情報は短い形に変わっていることがあります。

正確な引用が必要な文章や、変更してはいけない数値は、元の資料を参照できる形で残してください。「AIが覚えているはず」に頼るより、必要な箇所を再び確認できる方が確実です。

早めにコンパクトする

新しい情報を入れる余地を作りやすくなります。一方で、細部の引き継ぎや圧縮処理の回数が気になります。

大きな枠を長く使う

多くの原文を一緒に扱えます。一方で、大きい入力を処理し続けるため、料金や待ち時間への影響を確認する必要があります。

この環境の設定例:50%でコンパクト

この会話で設定した値は129,200トークンです。表示上の実効枠258,400の半分を目安にしています。割合を追いかける設定ではなく、固定のトークン数です。

model_auto_compact_token_limit = 129200

これは圧縮を始めるための閾値です。閾値とは「処理を始める目安の境界値」。実際に判定されるタイミングによって、使用量がこの数字ぴったりで止まるわけではありません。また、表示枠の計算に使う95%とは別の設定です。

早めの圧縮には処理自体の負担や、キャッシュを再利用しにくくなる場合もあるため、「50%なら必ず最安・最高品質」という意味ではありません。

ここで覚えることコンパクトは、長い作業を続けるための情報整理。容量を無限に増やす機能でも、原文の完全保存でもありません。

出典:CompactionCodex設定リファレンスPrompt caching。129,200はこの環境で選んだ設定値です。

07 · API & PRICING

ここからは「使った量に応じた料金」の話です。

API(エーピーアイ)は、プログラムからAIに処理を依頼するための窓口です。たとえば、自作の翻訳アプリが文章をAIへ送り、返ってきた翻訳を画面に表示する。その受け渡しに使います。

レストランにたとえるなら、ChatGPTのようなアプリは注文画面や席まで整ったお店。APIは、自分で作ったサービスから調理を依頼する窓口に近いものです。ただし実際の契約内容はサービスによって異なります。

ChatGPT / Codexのプラン

アプリの契約に応じた利用条件や上限があります。この教材のドル計算を、そのまま月額請求や利用枠に当てはめることはできません。

APIの従量料金

どのモデルを、どの処理方式で、何トークン使ったかなどに応じて料金を計算します。この先の数値例はこちらです。

「100万トークンあたり」は、料金の単位です。

「入力100万トークンあたり10ドル」は、100万トークン単位で購入しなければならないという意味ではありません。計算上は、使ったトークン数に比例させます。たとえば10万トークンなら100万の10分の1なので、単価10ドルの場合は1ドルです。

入力料金 = 入力トークン数 ÷ 1,000,000 × 入力単価
例:100,000 ÷ 1,000,000 × $10 = $1

出力にも別の単価があります。入力の計算と出力の計算をして、最後に合計します。1回の依頼には、読むための料金と、生成するための料金があると考えるとわかりやすいでしょう。

キャッシュは、同じ部分の処理を再利用する仕組み。

キャッシュは、前に処理した入力の一部を再利用するための仕組みです。たとえば毎回同じ資料から始まる依頼なら、条件が合うと、その先頭部分の処理を再利用できます。記憶ノートというより、同じ作業を繰り返すときの準備済みデータに近いものです。

キャッシュは、AIがあなたを長期的に覚えるメモリー機能ではありません。キャッシュされた入力もコンテキストを使い、料金の判定対象から消えるわけではありません。条件が合う部分に、キャッシュ用の料金区分が適用されます。

読み込む料金と、書き込む料金があります。GPT-6 Astraでは、再利用する「キャッシュ読み込み」と、再利用できるよう保存する「キャッシュ書き込み」の単価が別です。書き込みは通常入力より割高なので、将来どれだけ再利用できるかも関係します。同じ内容なら必ずキャッシュが使える、とは限りません。

出典:GPT-6 Astraの料金仕様Prompt caching

08 · THE 272K BOUNDARY

272kを超えると、「今回の単価表」が変わります。

いよいよ最初の疑問です。GPT-6 AstraのAPI・Standardでは、1回の入力が272,000トークンを超えると、そのリクエスト全体に長いコンテキスト用の単価が適用されます。

GPT-6 Astra · Standard · 100万トークンあたりの米ドル
料金区分入力が272,000以下入力が272,000超倍率
通常の入力$10$202倍
キャッシュ読み込み$1$22倍
キャッシュ書き込み$12.50$252倍
出力$50$751.5倍

2026年9月23日確認。出典:OpenAI公式 GPT-6 Astraモデル仕様。処理方式や追加サービスなどで条件は変わります。

「超えた1トークンだけ2倍」ではありません。

荷物の配送で、ある大きさを超えると荷物全体が「大型サイズ」の料金区分になる、と考えてください。大きさを超えた端の部分だけに追加料金をつける仕組みとは違います。

同じように、この料金境界では、その1回に含まれる入力全体の単価が変わり、さらにその1回の出力単価も変わります。ただし、以前のリクエストにさかのぼって値上げされるという意味ではありません。

境界ちょうど

入力 272,000

入力:0.272 × $10 = $2.72
出力:0.01 × $50 = $0.50

$3.22000
1トークン超過

入力 272,001

入力:0.272001 × $20 = $5.44002
出力:0.01 × $75 = $0.75

$6.19002

比較条件:どちらも課金対象の出力10,000トークン、キャッシュ読み込み・書き込みなし、Standard。税・ツール料金などは含めません。金額は比較用の計算値です。

272kの境界を超えると単価が変わり、料金が段差状に上がる模式図料金入力の量 →通常の単価で増える全体の単価が変わる272,000
狭い画面では図を横にスクロールできます。縦横の縮尺は説明用です。出力を固定し、キャッシュを使わない場合の段差を示しています。

料金が「必ず2倍」になるわけでもありません。

入力は2倍、出力は1.5倍なので、合計の変化は入力と出力の割合で変わります。上の比較では、合計は約1.92倍です。「全体に長いコンテキスト用の単価が適用される」と「合計金額が一律2倍になる」を区別してください。

境界を決めるのは、入力の量です。入力が270,000、出力が10,000なら、合計280,000でも、この272kの条件だけで長いコンテキスト用料金にはなりません。入力が272,000を超えるかどうかで判定します。コンテキストに収まるかの判定とは、見る数字が違います。

キャッシュを使う場合も、通常入力・キャッシュ読み込み・キャッシュ書き込みに分かれた入力全体で境界を考えます。キャッシュになった分を引いて272k以下と判定する計算にはしません。

最初の一文を言い換えると「今回AIに渡す情報が27万2千トークンを超えたら、今回の処理には別の単価表を使う。以前の処理は変わらず、超えた部分だけの割増でもない。」
09 · TRY IT

数字を動かして、料金の変わり方を確かめよう。

まず「272,000」と「272,001」のボタンを交互に押してください。出力の量を変えなくても、入力の境界を超えると出力料金まで変わることがわかります。

1リクエストの料金計算機

GPT-6 Astra / Standard / 米ドル。入力は0〜900,000、課金対象の出力は0〜128,000に制限した学習用計算機です。

見える回答に加え、課金対象の推論トークンを含む値です。0は計算上の比較用です。

慣れたら:キャッシュも含めて計算する

入力全体のうち、キャッシュ読み込みと書き込みの量を指定します。残りが通常入力です。同じトークンを二重に数えないよう、3つの区分に分けます。

読み込み+書き込みは入力全体以下にしてください。単価区分の学習用であり、この入力操作で実際にキャッシュを作成するわけではありません。

入力272,000以下の単価

$3.22000
通常入力 272,000 トークン$2.72000キャッシュ読み込み$0.00000キャッシュ書き込み$0.00000出力$0.50000

単価 / 100万:通常入力 $10・読み込み $1・書き込み $12.5・出力 $50

試算には、税、為替、検索などのツール料金、Fast・Batch・Flex等の処理方式による調整、地域設定などは含めません。実際の請求はAPIの利用記録と適用される料金条件で確認してください。計算はこのブラウザー内だけで行い、AIへの依頼や課金は発生しません。

おすすめの試し方

  1. 境界を見る:初期値のまま「272,001」を押す。入力・出力の両方が変わります。
  2. 合計との違いを見る:入力を270,000、出力を10,000にする。長いコンテキスト用の単価にはなりません。
  3. キャッシュを見る:入力300,000、読み込み200,000、書き込み0、出力10,000にする。合計は$3.15000です。安い読み込み単価を使えても、判定は300,000の入力全体です。
10 · MODEL vs APP

1Mに対応しているのに、なぜ表示は258k?

ここまで来ると、二つの数字を分けて読めます。モデルが扱える最大量と、アプリが通常の作業に割り当てる量です。大きな会議室が使える施設でも、日常の打ち合わせでは小さな部屋を使うことがある、と考えてください。

公式のAPI仕様
1,050,000

GPT-6 Astraのコンテキスト

モデル仕様に記載された容量。最大出力は128,000トークン。入力と生成に必要な余地を分けて考えます。

このCodex環境での観測
258,400

通常枠から計算した実効容量

モデル情報の通常枠272,000に、実効割合95%を掛けた値。約258kという表示と一致します。

272,000 × 0.95 = 258,400
95%は実効容量の計算に使う割合。自動コンパクトの開始割合とは別です。

この環境のモデル情報には、別に最大枠872,000も記録されていました。ただし、これとAPI仕様1,050,000との差の内訳や、今のタスクでその枠を利用できるかは、この数値だけでは確定できません。設定値が存在することと、実際にその容量で動作することは分けて確認します。

なぜ日常の枠を小さくするのか。

確認できた事実 API料金が切り替わる入力の境界は272kで、この環境の通常枠も272kでした。公式仕様上、モデルの最大容量は1.05Mです。

ここからは推測 大きな情報を毎回処理する負担を抑え、日常的な使いやすさと費用を両立するために、通常枠を小さめにする設計は合理的です。ただし、「料金が理由でこの既定値を選んだ」とOpenAIが説明した資料は、この教材の調査では確認できていません。二つの境界が一致することだけでは、設計意図の証明にはなりません。

大きな枠には、長い原文を同時に比べられる利点があります。小さめの枠と圧縮を組み合わせる方法には、情報量を管理しながら作業を続けられる利点があります。どちらが合うかは、原文の細部をどれだけ同時に必要とするかで変わります。

ここで覚えること「258kしか表示されない」だけでは、「モデルが1Mに対応できない」とは言えません。モデル仕様、アプリの割り当て、圧縮を始める閾値は別の数字です。

出典:GPT-6 Astra公式仕様設定リファレンス。272,000・95%・872,000は2026年9月23日の制作者のCodex環境で読み取った値で、全ユーザー共通の保証値ではありません。

11 · PUT IT TOGETHER

自分の作業に当てはめてみましょう。

やりたいこと考えるポイント
短い文章を直すその文章と目的があれば進められることが多い。無関係な長い資料を一緒に入れる必要はありません。
複数の長い資料を照合する同時に比べる原文が多いほど、大きな枠が役立つ場合があります。容量と料金の両方を確認します。
何時間も同じ作業を続ける決定事項、未完了の作業、参照する原文の場所を整理すると、圧縮後に再開しやすくなります。
次回も好みを反映したいアプリのメモリーや保存文書の役割。今の会話に残っていることと、次回使えることを分けます。
API費用を把握したい入力全体、キャッシュの区分、課金対象の出力、処理方式を確認。文字数だけで請求額を決めないようにします。

引き継ぎメモに残すと役立つこと

目的:初心者向けの京都旅行プランを作る。
決まった条件:2泊3日、予算5万円、雨天案も用意。
変更してはいけないこと:最終日は17時までに京都駅へ戻る。
まだ決まっていないこと:2日目の昼食。
原文の場所:予約確認書と、利用者が示した条件の文書。

これは内容整理の例です。保存場所を決め、実際に保存されたことまで確認して初めて、次回使える引き継ぎになります。

4問で、理解を確かめる

間違えても問題ありません。答え合わせで理由を読んでください。

Q1. 1トークンは、必ず日本語1文字?
Q2. メモリーに保存すれば、コンテキストは無限になる?
Q3. 入力272,001・出力10,000の場合、割高になるのは?
Q4. Codexの表示枠が約258kなら、GPT-6 Astraの最大容量も258k?

よくある疑問:100万トークンの枠を選ぶだけで高くなる?

このAPI料金条件は、選んだ容量ではなく、実際のリクエストの入力トークン数を見ます。広い枠を利用できる状態でも、入力が272,000以下なら、ここで説明した長いコンテキスト用の割増条件には該当しません。ほかの処理方式の料金などは別に確認します。

よくある疑問:272kを超えたら、残りの会話もずっと割高?

ここでの判定は各リクエストごとです。あるリクエストが境界を超えたことで、過去のリクエストの料金が変わることはありません。次の入力が境界以下になれば、その次のリクエストは境界以下の単価で計算します。

よくある疑問:コンパクトは、元のファイルを小さく書き換えるの?

ここで説明したコンパクトは、AIが会話を続けるための文脈を整理する処理です。元のPDFや文書ファイルを編集する操作とは別です。アプリが履歴をどう保存するかも、別の仕様です。

もう、最初の一文を読み解けます。

AIに渡す情報の量は、トークンで数えます。今使う情報には容量の上限があり、メモリーに保存してある情報とは区別します。

GPT-6 AstraのAPIでは、今回の入力が272,000トークンを超えると、今回の入力・キャッシュの単価は2倍、出力の単価は1.5倍。これは「超えた部分だけ」の値上げではありません。

そして、モデルの最大容量、アプリで使う枠、コンパクトを始める目安、料金の境界。それぞれが何を表す数字なのかを見れば、258kと1Mが一緒に出てきても整理できます。

REFERENCE

用語を引き直す・公式資料で確かめる。

言葉この教材での意味
トークンAIが文章などを扱う小さな単位。文字数とは一致しない。
入力 / 出力AIへ渡す情報 / AIが生成するもの。料金上の出力には推論も含まれ得る。
リクエストAIへの1回の処理依頼。
コンテキスト今回の処理で参照する情報。
コンテキスト・ウィンドウ入力や生成に使うトークンを収められる上限。
メモリー後で再利用するために情報を保存するアプリの仕組み。製品ごとに異なる。
コンパクト会話を続けるため、文脈を短い形に整理すること。
閾値(しきいち)動作や条件が切り替わる境界値。
APIプログラムからAIなどに処理を依頼するための窓口。
キャッシュ同じ入力部分の処理を再利用するための仕組み。
Standardこの教材の料金例に用いた通常の処理方式。
k / Mこの教材では千倍 / 百万倍。272k=272,000、1M=1,000,000。

公式資料

確認日:2026年9月23日。以下のリンクを開くとインターネットに接続します。教材本体の閲覧・図・計算はオフラインで使えます。

  1. GPT-6 Astra — モデル仕様と料金
    1,050,000のコンテキスト、128,000の最大出力、Standard単価、272k超の倍率。
  2. Conversation state — 会話状態とコンテキスト
    会話の引き継ぎ、入力・出力・推論と容量の関係。
  3. Text generation — テキスト生成
    モデルへの入力と生成の基本。
  4. Reasoning models — 推論モデル
    内部の推論と出力・利用量の考え方。
  5. Prompt caching — キャッシュ
    入力の先頭部分の一致、読み込み・書き込み、圧縮による影響。
  6. Compaction — 文脈の圧縮
    長い処理を続けるための圧縮状態。
  7. Configuration Reference — Codex設定
    コンテキスト枠と自動コンパクトの閾値は別設定。
  8. Memories — 保存して再利用する情報
    アプリのメモリー機能についての製品別説明。
事実・例・推測の区別料金とモデルの数値は公式仕様、258k周辺の設定値は制作者の環境での観測です。旅行、机、ノート、配送の説明と図は教材用のたとえ。272kを通常枠に選んだ理由は公式確認できていないため、推測として記載しています。

料金や製品仕様は更新されます。実際にAPIを利用するときは、利用するモデル・処理方式・その時点の公式料金を確認してください。このHTMLは、保存時点の説明を自動更新するものではありません。

著者: 藤川忠彦(ふじかわ ただひろ) — 企業向けAI導入アドバイザー、神奈川県茅ヶ崎市。

机の枠に並ぶ小さな札と、赤い境界線を越えた一つの札で、AIが一度に扱える量と料金が切り替わる境界を表した表紙画像
FUJIKAWA LAB SPECIMEN 50 / 50