# Économisez des tokens GPT-6 Astra en convertissant les documents en Markdown

Votre prochaine tâche d'IA pourrait nécessiter les mots d'un rapport, les chiffres d'un tableau de budget ou les instructions d'un document numérisé. L'envoi du fichier original peut également demander au modèle de traiter l'apparence de chaque page.

Cette distinction est importante lorsque vous payez par jeton.

SourceShelf convertit les PDF, les documents Office modernes et le texte contenu dans les images en Markdown localement sur votre Mac. Vous pouvez examiner le résultat, l'organiser dans un Pack ciblé et envoyer le contenu dont votre tâche a besoin à GPT-6 Astra.

Nous avons exécuté sept fichiers synthétiques à travers le code de conversion de SourceShelf pour explorer la différence. Notre modèle de coût local a estimé **84 % de moins de jetons d'entrée pour un PDF texte de 40 pages** et **97 % de moins pour un dossier numérisé peu dense de 20 pages** lorsque nous avons comparé Markdown à un scénario avec images des pages en détail élevé.

Ce sont des estimations illustratives, pas des factures Astra mesurées ni une promesse pour chaque document. La plus grande opportunité est de supprimer le coût supplémentaire des images de page du travail axé sur le texte. Markdown n'est pas intrinsèquement plus petit que le texte brut, et sélectionner un extrait représente un type de gain différent de la conversion d'un document entier.

## Pourquoi le format original est important

L’API Responses d’OpenAI traite les types de fichiers différemment. Les PDF fournissent à la fois du texte extrait et des images de page aux modèles capables de vision. Les fichiers Word et PowerPoint fournissent du texte extrait, tandis que les tableurs suivent un processus distinct qui ajoute des résumés et des métadonnées. Pour Astra, le détail pour PDF `auto` utilise actuellement `high`. [Documentation d'entrée de fichiers d'OpenAI](https://developers.openai.com/api/docs/guides/file-inputs)

Si votre question concerne le libellé d'une politique, le paiement des images de page peut ajouter peu de valeur. En convertissant cette politique en Markdown révisé, vous avez la possibilité d'envoyer son texte sans ces images.

Pour un diagramme, un dessin technique ou une photographie, les informations visuelles peuvent être essentielles. Conservez l'image pertinente dans la demande lorsque la tâche en dépend.

## Tarifs de l'API GPT-6 Astra

Comme vérifié le 20 septembre 2026, les tarifs standard de l'API à court contexte de GPT-6 Astra sont les suivants :

| Catégorie de jeton | USD par million de jetons |
| --- | ---: |
| Entrée | 10,00 $ |
| Entrée en cache | 1,00 $ |
| Écritures en cache | 12,50 $ |
| Sortie | 50,00 $ |

Les calculs ci-dessous utilisent le **taux d'entrée de 10 $** pour rendre les représentations du document comparables. Ils excluent la sortie, les outils, les écritures en cache et le contenu des autres demandes. Ce sont des équivalents de taux d'entrée plutôt que des prédictions d'une facture complète. [Tarifs de l'API OpenAI](https://developers.openai.com/api/docs/pricing)

À ce rythme, la suppression de 100 000 jetons d'entrée vaut 1 dollar par lecture sans cache. Réutiliser du matériel source compact sur de nombreuses tâches indépendantes peut rendre cette différence significative.

## Notre expérience locale

Nous avons créé un rapport de 40 pages, un dossier de 20 pages uniquement composé d'images, deux images textuelles, un rapport Word, un diaporama PowerPoint de 30 diapositives et un tableur Excel de 500 lignes. Tout le contenu était synthétique. Le dossier numérisé était délibérément peu dense ; le rapport et la deuxième image contenaient beaucoup plus de texte dense.

Nous avons exécuté les fichiers à travers les extracteurs SourceShelf du dépôt, le rendu sémantique Markdown et le module d’écriture Markdown sur un Mac. Les comptages incluent les métadonnées de source générées et les titres. Les documents ont été convertis, pas résumés.

Le texte a été compté avec `tiktoken 0.14.0` en utilisant `o200k_base`. Ce tokenizer ne prend **pas** explicitement en charge Astra : ces comptages locaux sont donc des approximations, pas des mesures faisant autorité pour les tokens de texte d’Astra. Les jetons d'image ont été calculés en utilisant les règles de découpage en patches documentées d'Astra. Pour les PDF, nous avons supposé des images de page à 144 DPI et avons ajouté le texte natif extrait localement. La rasterisation réelle des PDF et l'extraction de texte d'OpenAI peuvent différer. Aucun fichier n'a été envoyé à l'API, et aucune utilisation de l'API n'a été facturée pendant cet essai.

### PDF et images textuelles : la plus grande opportunité

![Tokens d'entrée estimés restants après conversion : 16,2 % pour le PDF textuel, 3,4 % pour le paquet numérisé, 7,1 % pour l'image avec peu de texte et 23,9 % pour l'image dense. Chaque original est normalisé à 100 % ; il s'agit d'estimations en détail élevé, non d'une utilisation mesurée de l'API.](/assets/blog/fr/astra-token-comparison.svg)

| Document de test | Tokens d'entrée originaux estimés | Tokens proxy Markdown | Réduction estimée | Coût d'entrée estimé (USD) : original → Markdown |
| --- | ---: | ---: | ---: | ---: |
| PDF texte de 40 pages | 112 449 | 18 184 | 83,8 % | 1,1245 $ → 0,1818 $ |
| Paquet numérisé de 20 pages | 45 600 | 1 559 | 96,6 % | 0,4560 $ → 0,0156 $ |
| Image avec peu de texte, 1200 × 1600 | 2 280 | 162 | 92,9 % | 0,0228 $ → 0,0016 $ |
| Image de texte dense, 1200 × 1600 | 2 280 | 545 | 76,1 % | 0,0228 $ → 0,0055 $ |

Ces comparaisons utilisent les détails d'image `high`. Le graphique normalise chaque original à 100 %; les longueurs des barres comparent les représentations au sein d'un document, et non les totaux de jetons entre les documents. Par exemple, une image de 1200 × 1600 occupe 38 × 50 patches de 32 pixels, soit 1 900 patches. Le multiplicateur 1,2 d'Astra produit 2 280 jetons d'image. En transformant l'image avec peu de texte en 162 jetons de Markdown revu, on élimine la plupart de ce coût d'entrée. [Calculs de jetons d'image OpenAI](https://developers.openai.com/api/docs/guides/images-vision#patch-based-image-tokenization)

Pour le rapport de 40 pages, l'économie modélisée est d'environ **0,94 $ par lecture sans cache**, ou **94,27 $ sur 100 lectures indépendantes** au même taux. Il s'agit d'une extrapolation, et non de 100 requêtes API mesurées. Les hits de cache réduiraient la différence en dollars : à 1 $ par million de jetons en cache, la même différence de jeton vaut environ 0,094 $ par lecture. Les écritures de cache ont leur propre taux.

Les modifications de détail de l'image modifient considérablement le résultat. L'utilisation de `low` est une autre option lorsque vous devez toujours envoyer des images. L'application de la taille d'image documentée à faible détail à nos images de page PDF supposées a réduit les réductions estimées du PDF à **37,0 % pour le rapport textuel** et **66,3 % pour le paquet numérisé**. L'image autonome dense est tombée à 231 tokens d'image à faible détail, soit moins que sa version Markdown de 545 tokens. Nous n'avons pas testé si le modèle pouvait lire avec précision cette image réduite.

### Fichiers Office : la conversion seule n'est pas l'économie

Les fichiers Office témoins racontent une autre histoire :

| Document de test | Jetons de contrôle en texte clair | Jetons SourceShelf Markdown | Variation |
| --- | ---: | ---: | ---: |
| Rapport Word, 40 sections | 17 880 | 18 021 | +0,8% |
| Présentation PowerPoint, 30 diapositives | 5 370 | 5 674 | +5,7 % |
| Fichier Excel, 500 lignes de données | 5 506 | 7 142 | +29,7 % |

Ces témoins contiennent le texte source des fichiers de test ; ce ne sont **pas des comptages mesurés lors d’envois à l’API**. Ils indiquent le coût des titres, de la provenance, des limites de diapositive et de la syntaxe de la table Markdown. Comparer la taille en octets du fichier Office compressé avec celle de Markdown ne mesurerait pas les économies de jetons.

Pour les documents Office, l'avantage pratique de SourceShelf réside dans la possibilité de rendre le contenu lisible, réutilisable et plus facile à sélectionner. Dans une expérience de sélection manuelle distincte, le maintien de quatre sections pertinentes du rapport Word converti a réduit le contenu envoyé de **18 021 à 1 893 jetons : 89,5 % de moins**. Le maintien de trois diapositives de la présentation convertie l'a réduit de **5 674 à 679 jetons : 88,0 % de moins**.

Ces réductions excluent intentionnellement le matériel. Elles sont appropriées lorsque la question ne nécessite que ces sections et ne peuvent pas remplacer un examen complet du document. Les sélections ont été effectuées dans le Markdown exporté ; il ne s'agissait pas d'une fonctionnalité de pertinence automatique.

Pour les calculs de tableur, conservez l'accès au fichier de travail et à un outil d'analyse approprié. Les tableaux Markdown sont un matériel de référence utile, mais ils ne remplacent pas l'évaluation des formules ni l'analyse complète de tableur. Pour les collections plus importantes, la récupération est une autre option : l’outil [File Search](https://developers.openai.com/api/docs/guides/tools-file-search) d'OpenAI peut fournir des passages pertinents au lieu d'insérer l'ensemble des documents dans chaque demande.

## Vérifiez la conversion avant de vous y fier

Moins de jetons sont utiles uniquement si les informations nécessaires à la tâche survivent.

Nos vérifications ont récupéré tous les mots alphanumériques attendus, y compris leurs occurrences répétées, dans les fichiers Office, les deux images et le dossier numérisé. Le long texte PDF a conservé **99,65 %** grâce à cette vérification, avec certaines omissions et un texte réordonné. Une vérification de rétention de mots ne prouve pas que les relations de tableau, l'ordre de lecture ou le sens restent intacts.

Ces fichiers de test synthétiques et propres ne représentent pas non plus une écriture difficile, des graphiques complexes, des scans médiocres ou tous les documents professionnels. La conversion OCR et le formatage de SourceShelf présentent des limitations. Vérifiez les noms, les montants, les dates, les tableaux et l'ordre de lecture ; joignez la page ou l'image originale lorsqu'elle contient des éléments que le texte ne peut pas préserver.

## Un flux de travail pratique SourceShelf

1. **Convertir localement.** Déplacez vos PDF, `.docx`, `.pptx`, `.xlsx`, ou les images prises en charge dans SourceShelf sur Mac. La reconnaissance de texte et la conversion se font sur votre appareil. [Conversion PDF locale](/fr/pdf-to-markdown-mac/)
2. **Inspectez le Markdown.** Vérifiez les informations sur lesquelles dépendra votre prochaine tâche, en particulier le texte et les tableaux numérisés.
3. **Construisez un paquet ciblé.** Incluez les sources pertinentes pour la question. Pour des tâches plus spécifiques, préparez un extrait du Markdown exporté tout en préservant les étiquettes de source utiles. [Packs de référence SourceShelf](/fr/local-ai-reference-packs/)
4. **Envoyez du texte et les visuels nécessaires.** Fournissez le Markdown en texte à votre flux de travail Astra API. Incluez des images individuelles lorsque leur contenu visuel est important. Un lien d'image Markdown seul ne transmet pas ses pixels.
5. **Réutilisez la source revue.** Conservez la conversion pour les tâches futures et actualisez-la lorsque l’original change. Vérifiez l'utilisation réelle de l'API pour valider les économies dans votre propre flux de travail.

La conversion locale elle-même n’envoie pas le document original vers un serveur. Lorsque vous envoyez ensuite Markdown ou des images à un modèle cloud, le contenu sélectionné quitte votre appareil.

## Taille du contexte, mise en cache et limites d'abonnement

Les grands contextes ajoutent une autre raison de choisir avec soin. Les requêtes Astra dépassant 272 000 jetons d'entrée affichent des taux plus élevés sur l'ensemble de la demande : deux fois les taux d'entrée et de stockage en cache, et 1,5 fois le taux de sortie. Nos cas de test sont restés inférieurs à ce seuil ; réduire une demande plus importante en dessous de ce seuil pourrait générer une économie supplémentaire. Comptez la demande complète, y compris l'historique et les outils. [Notes de prix du modèle Astra](https://developers.openai.com/api/docs/models/gpt-6-astra)

Ces calculs en dollars concernent l'utilisation de l'API. Ils ne se traduisent pas directement en économies sur un abonnement ChatGPT à prix fixe ou sur un nombre fixe de tâches Codex supplémentaires.

## Préparer une fois, réutiliser avec soin

L'habitude utile est simple : préparez la source une seule fois, vérifiez-la et donnez au modèle le matériel dont la tâche a besoin. Pour les travaux axés sur le texte avec des PDF et des scans, cela peut vous laisser beaucoup plus de budget de tokens disponible pour le travail lui-même.

Pour une autre façon de conserver le résultat portable, consultez notre [Guide pour Open Knowledge Format](/fr/blog/what-is-open-knowledge-format-okf/). Vous pouvez conserver les sources lisibles et leurs métadonnées ensemble à mesure que vos outils d'IA évoluent.
