MarkdownとAIの入力コスト

文書をMarkdownに変換してGPT-6 Astraのトークンを節約する

ローカルで変換し、タスクに必要な内容を送信。7つのファイルで、GPT-6 Astra向けのMarkdown変換による節約と限界を検証しました。

文書をローカルでMarkdownに変換・確認してからGPT-6 Astraに送信します。視覚的な証拠が必要な場合は画像も残します。
このページの内容

次のAIタスクでは、レポートの単語、予算表の数値、スキャンされたドキュメントの指示が必要になる場合があります。元のファイルを送信することで、モデルに各ページの表示処理を依頼することもできます。

トークン数に応じて料金が発生する場合、その区別は重要です。

SourceShelfは、PDF、最新のOfficeドキュメント、および画像内のテキストをMac上でMarkdownにローカルで変換します。結果を確認し、目的に合ったPackに整理し、タスクに必要なコンテンツをGPT-6 Astraに送信できます。

SourceShelfの変換コードを用いて7つの合成ファイルを処理し、その違いを調査しました。Markdownと高精細なページ画像シナリオを比較した際、ローカルのコストモデルでは、40ページのテキストPDFで約84%、文字の少ない20ページのスキャン資料で約97%の入力トークン削減と推計しました。

これらは概算値であり、Astraの実際の請求額やすべての文書に対する約束ではありません。削減効果が大きいケースは、テキスト中心の作業におけるページ画像オーバーヘッドを排除することです。Markdownは本質的にプレーンテキストよりも小さくはありませんし、抜粋を選択することは、文書全体を変換することとは異なる種類の節約です。

元のフォーマットが重要な理由

OpenAIのResponses APIはファイルタイプを異なる方法で処理します。PDFは視覚認識可能なモデルに抽出されたテキストとページ画像の両方を提供します。WordおよびPowerPointファイルは抽出されたテキストを提供しますが、スプレッドシートは要約とメタデータを追加する別のプロセスに従います。Astraの場合、PDF autoの詳細では現在highを使用しています。OpenAIファイル入力ドキュメント

ご質問がポリシーの文言に関するものであれば、ページ画像の処理に費用をかけても、得られる利点が小さい場合があります。そのポリシーをレビューされたMarkdownに変換することで、その画像なしでテキストを送信する方法が得られます。

図表、エンジニアリング図面、または写真の場合、視覚情報は不可欠となる場合があります。タスクがそれらに依存する場合、関連する画像はリクエストに含めておいてください。

GPT-6 Astra APIの価格設定

2026年9月20日に確認したところ、GPT-6 Astraの標準ショートコンテキストAPI料金は以下の通りです:

トークンカテゴリ100万トークンあたり(米ドル)
入力10.00ドル
キャッシュされた入力1.00ドル
キャッシュ書き込み12.50ドル
出力50.00ドル

以下の計算では、$10の入力レートを使用してドキュメントの表現を比較可能にしています。出力、ツール、キャッシュ書き込み、その他のリクエストコンテンツは除外されています。完全な請求書の予測ではなく、入力レートの同等値です。OpenAI APIの価格設定

そのレートで、10万個の入力トークンを削除すると、キャッシュされていない読み取りごとに1ドルの価値があります。多くの独立したタスクでコンパクトなソース材料を再利用することで、その違いを意味のあるものにすることができます。

ローカルでの実験

40ページのレポート、20ページの画像のみのパック、2つのテキスト画像、Wordレポート、30スライドのPowerPointデッキ、500行のExcelワークブックを作成しました。すべての内容は合成されたものでした。スキャンされたパックは意図的に簡素化されており、レポートと2番目の画像にははるかに濃密なテキストが含まれていました。

私たちはMac上で、リポジトリのSourceShelf抽出器、セマンティックMarkdownレンダラー、Markdownライターを使用してファイルを処理しました。カウントには生成されたソースメタデータとヘディングが含まれます。文書は要約されたものではなく、変換されました。

テキストは、tiktoken 0.14.0のo200k_baseを使用してカウントされました。このトークナイザーはAstraを明示的にマッピングしていないため、これらはAstraのテキストトークンの権威あるカウントではなく、ローカルでの近似カウントです。画像トークンはAstraの文書化されたパッチルールに基づいて計算されました。PDFについては、144 DPIのページ画像を想定し、ローカルで抽出されたネイティブテキストを追加しました。OpenAIの実際のPDFラスター化とテキスト抽出は異なる場合があります。APIに送信されたファイルはなく、この実験中にAPIの使用料は請求されませんでした。

PDFとテキスト画像:削減効果が大きいケース

変換後の推定入力トークン残量:テキストPDFは16.2%、スキャンされたパケットは3.4%、スパースな画像は7.1%、密な画像は23.9%。各元データを100%として表示しています。これらは高詳細な推定値であり、API使用量の測定値ではありません。
テストドキュメント推定元の入力トークンMarkdownプロキシトークン推定削減推定入力コスト(USD):元 → Markdown
40ページのテキストPDF112,44918,18483.8%1.1245ドル → 0.1818ドル
20ページスキャンされたパケット45,6001,55996.6%0.4560ドル → 0.0156ドル
簡素なテキスト画像、1200 × 16002,28016292.9%0.0228ドル → 0.0016ドル
濃密なテキスト画像、1200 × 16002,28054576.1%0.0228ドル → 0.0055ドル

これらの比較には、highの画像詳細設定が使用されます。チャートは各元の値を100%に正規化します。棒の長さは、ドキュメント内の表現を比較するものであり、異なる文書間のトークン総数を比較するものではありません。たとえば、1200 × 1600の画像は32ピクセル単位の38 × 50パッチ、つまり1,900パッチを占めます。Astraの1.2倍率は2,280個の画像トークンを生成します。まばらな画像をレビューされたMarkdownの162トークンに変換することで、その入力コストのほとんどが削減されます。OpenAI画像トークン計算

40ページのレポートについては、モデル化された節約額はキャッシュされていない読み取りあたり約0.94ドル、または同じレートで100回の独立した読み取りごとに94.27ドルです。これは100回の測定APIリクエストではなく、推測値です。キャッシュヒットはドル差を縮小します:100万トークンがキャッシュされているごとに1ドルであれば、同じトークン差は読み取りあたり約0.094ドルの価値があります。キャッシュ書き込みには独自のレートがあります。

画像の詳細を変更すると結果が大きく変わります。画像送信が必要な場合は、lowを使用することも別の選択肢となります。文書化された低詳細画像サイズを想定されたPDFページ画像に適用することで、テキストレポートのPDF削減率は37.0%、スキャンされたパケットのPDF削減率は66.3%に低下しました。高密度な単体画像は低詳細で231個の画像トークンに減少し、545トークン版のMarkdownバージョンよりも少なくなりました。モデルがその削減された画像情報を正確に読み取れるかどうかはテストしていません。

Officeファイル:変換だけでは節約にはならない

対照として調べたOfficeファイルでは、異なる結果になりました:

テストドキュメント対照用プレーンテキストのトークン数SourceShelfのMarkdownトークン数増減
Wordレポート、40セクション17,88018,021+0.8%
PowerPointデッキ、30スライド5,3705,674+5.7%
Excelワークブック、500データ行5,5067,142+29.7%

対照データには、テストファイルの元のテキストを使用しました。APIへのファイル送信時に測定したトークン数ではありません。見出し、出所、スライド境界、およびMarkdownテーブルの構文のコストを示しています。圧縮されたOfficeファイルのバイトサイズとMarkdownを比較しても、トークン削減量を測定することにはなりません。

Office文書において、SourceShelfの実用的な利点は、コンテンツを読みやすく、再利用可能にし、選択を容易にすることです。別の手動選択実験では、変換されたWordレポートから関連する4つのセクションを保持することで、ペイロードが18,021から1,893トークンに減少し、89.5%減少しました。変換されたデッキから3スライドを保持することで、ペイロードが5,674から679トークンに減少し、88.0%減少しました。

これらの削減は意図的に資料を除外しています。質問がこれらのセクションのみを必要とし、全文のレビューに代わるものではない場合に適切です。選択はエクスポートされたMarkdownで行われました。それらは自動的な関連性機能ではありませんでした。

スプレッドシートの計算には、ワークブックと適切な分析ツールへのアクセスを維持してください。Markdownテーブルは便利な参考資料ですが、式評価や完全なスプレッドシート分析に代わるものではありません。より大きなコレクションの場合、取得が別の選択肢となります:OpenAIのファイル検索は、すべてのリクエストに文書全体を投入する代わりに、関連する段落を提供できます。

利用する前に変換結果を確認する

トークンが少ないのは、タスクに必要な情報が残っている場合にのみ有効です。

当社のチェックにより、Officeファイル、2つの単体画像、およびスキャン資料において、重複を含むすべての期待されるアルファベット・数値語が復元されました。長いテキストPDFは、このチェックにより99.65%を保持しており、一部の欠落とテキストの再配置が見られました。単語保持チェックは、表の関係性、読み取り順序、または意味が完全に維持されていることを証明するものではありません。

これらの鮮明な合成テストファイルも、難しい手書き、複雑なチャート、不十分なスキャン、またはすべてのビジネス文書を反映するものではありません。SourceShelfのOCRとフォーマット変換には制限があります。名前、金額、日付、表、読み順を確認し、テキストでは保持できない証拠が含まれる場合は元のページまたは画像を添付してください。

実用的なSourceShelfワークフロー

  1. ローカルで変換する。PDF、.docx、.pptx、.xlsx、またはサポートされている画像を手動でMacのSourceShelfにドラッグします。テキスト認識と変換はデバイス上で行われます。ローカルPDF変換
  2. Markdownを検査する。 次のタスクで必要になる情報、特にスキャンされたテキストや表を確認してください。
  3. 目的に合ったPackを作成する。 質問に関連するソースを含める。より狭いタスクの場合は、有用なソースラベルを保持したまま、エクスポートされたMarkdownからの抜粋を用意する。SourceShelfリファレンスパック
  4. テキストと必要なビジュアルを送信してください。 Astra APIワークフローに Markdownをテキストとして入力してください。視覚的な内容が重要な場合は、個別の画像を含めてください。Markdown画像リンク単体ではピクセルが送信されません。
  5. レビューされたソースを再利用する。 将来のタスクのために変換を保持し、元の変更があったら更新してください。独自のワークフローで節約効果を検証するには、実際のAPI使用量を確認してください。

ローカル変換自体では元のドキュメントをアップロードしません。その後、Markdownまたは画像をクラウドモデルに送信すると、選択したコンテンツはデバイスの外部に送信されます。

コンテキストサイズ、キャッシュ、サブスクリプション制限

大規模なコンテキストは、慎重に選択するもう一つの理由を加えます。272,000入力トークンを超えるAstraプロンプトは、リクエスト全体に高い料金が適用されます:入力とキャッシュレートが2倍、出力レートが1.5倍です。今回のテストはこの閾値を下回っています。より大きなリクエストをそれ以下に減らすと、追加の節約につながる可能性があります。履歴やツールも含めたリクエスト全体のトークン数を数えてください。アストラモデルの価格に関する注記

これらのドル計算はAPIの使用に関係しています。これらは、固定価格のChatGPTサブスクリプションの節約や、Codexで実行できる追加タスク数に直接変換されるものではありません。

一度用意して、丁寧に再利用してください

便利な習慣は簡単です:ソースを一度準備し、確認し、モデルに必要な素材を渡すだけです。PDFやスキャンを用いたテキスト中心の作業では、これにより作業自体に使えるトークン予算をより多く残せる場合があります。

結果をポータブルに保つ別の方法については、Open Knowledge Formatのガイドをご覧ください。AIツールが変更されても、読み取り可能なソースとメタデータは一緒に保持できます。

SourceShelf

AIに役立つコンテキストを

SourceShelfで文書をローカル変換し、Markdownを確認して、目的に合ったPackを作成できます。

Mac App StoreでSourceShelfを見る