OpenAI vient de publier son guide de prompting pour GPT-5.6, et la conclusion principale bouscule la façon dont la plupart des gens rédigent leurs prompts. Dans les propres tests d'OpenAI, supprimer les instructions répétées d'un prompt système a amélioré les scores d'évaluation d'environ 10 à 15 % tout en réduisant le nombre total de tokens de 41 à 66 % et le coût de 33 à 67 %. Les longues listes de règles que vous avez rédigées pour les anciens modèles ralentissent désormais GPT-5.6, le rendent plus coûteux et moins précis.

Ce guide de prompting GPT-5.6 distille les sept changements les plus importants en français clair. Vous découvrirez pourquoi « énoncer chaque instruction une seule fois » surpasse les longues listes de règles, comment choisir entre les nouveaux modèles Sol, Terra et Luna, comment fonctionnent les six niveaux d'effort de raisonnement, et comment les nouveaux réglages comme la verbosité et l'appel d'outils programmatique changent ce que vous devriez saisir. Tout ce qui suit est tiré des recommandations officielles d'OpenAI pour la famille de modèles mise en ligne le 9 juillet 2026.

Les points essentiels

  • Les prompts allégés ont obtenu des scores 10 à 15 % plus élevés et réduit les tokens jusqu'à 66 % : énoncez chaque instruction exactement une fois.
  • GPT-5.6 dispose de deux réglages indépendants : quel modèle utiliser (Sol, Terra ou Luna) et l'intensité du raisonnement (six niveaux d'effort, de none à max).
  • Le mode pro applique un calcul supplémentaire avant de fournir une réponse finale unique, et il peut se combiner avec n'importe quel niveau d'effort pour vos demandes les plus critiques.
  • GPT-5.6 est plus concis par défaut que GPT-5.5, si bien que vos anciennes règles « sois bref » risquent désormais de tronquer trop d'informations.
  • Les nouvelles fonctionnalités de verbosité et d'appel d'outils programmatique vous permettent de fixer la longueur une fois pour toutes et de laisser le modèle traiter les données en code plutôt que token par token.

Ce qui a réellement changé dans GPT-5.6

De l'éditeur

Tous les modèles d'IA dans une seule app

Fello AI réunit GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 et plus dans une seule app native pour Mac et iPhone.

Téléchargez maintenant !

GPT-5.6 n'est pas un modèle unique mais une famille de trois modèles, conçue pour raisonner différemment des versions précédentes. Le changement pratique le plus important est que le modèle accomplit davantage avec moins d'instructions, de sorte que les prompts optimisés pour GPT-5.5 ou GPT-5.4 peuvent activement nuire à vos résultats. OpenAI le dit sans détour et recommande d'auditer vos anciens prompts plutôt que de les copier tels quels.

Les sept conseils ci-dessous suivent les priorités d'OpenAI, en commençant par le changement qui améliore le plus les scores. Si vous voulez d'abord comprendre les trois modèles dans le détail, lisez notre article sur ChatGPT 5.6 et les différences entre Sol, Terra et Luna. Revenez ensuite ici pour corriger vos prompts.

Conseil 1 : supprimez les instructions répétées de vos anciens prompts

La recommandation la plus forte d'OpenAI est d'énoncer chaque instruction exactement une fois. En leurs propres termes, « les configurations avec des prompts système plus allégés ont amélioré les scores d'évaluation d'environ 10 à 15 % tout en réduisant le nombre total de tokens de 41 à 66 % et le coût de 33 à 67 % ». C'est un cas rare où vous réduisez le coût et améliorez la qualité en même temps.

Les anciens modèles avaient souvent besoin que la même règle soit répétée à trois endroits pour être respectée. GPT-5.6, non. Éliminez les énoncés répétés, les notes de style dupliquées, les exemples redondants et les directives de processus qui ne modifient pas le comportement. Si une ligne n'apporte rien de nouveau, elle vous coûte désormais en précision autant qu'en tokens.

Concrètement, ouvrez votre prompt système le plus long et supprimez chaque phrase qui répète une instruction précédente. Conservez une version claire de chaque règle, puis testez. C'est le gain le plus rapide de tout le guide de prompting GPT-5.6 d'OpenAI.

Conseil 2 : adaptez la puissance de calcul à la tâche grâce à deux réglages

GPT-5.6 répartit ses capacités en deux contrôles indépendants. L'un concerne le modèle auquel vous envoyez la requête, l'autre l'intensité du raisonnement avant de répondre. Bien configurer les deux vous évite de surpayer pour des tâches simples et de sous-dimensionner le raisonnement pour les tâches complexes.

Choisissez votre modèle : Sol, Terra ou Luna

Sol est le modèle phare pour vos problèmes les plus difficiles, Terra est la solution polyvalente pour le travail professionnel quotidien, et Luna est l'option bon marché et rapide pour les tâches à grand volume. L'écart de prix est important, donc le choix du modèle compte autant que le prompt. OpenAI l'a accentué le 30 juillet 2026 en réduisant Luna de 80 % et Terra de 20 % via l'API tout en laissant Sol à $5 / $30 : orienter la bonne tâche vers le bon niveau fait désormais économiser davantage qu'au lancement.

ModèleIdéal pourPrix par 1 M de tokens (entrée / sortie)
SolProblèmes les plus difficiles : codage complexe, agents multi-étapes, recherche$5 / $30
TerraTravail professionnel quotidien, qualité et coût équilibrés$2 / $12
LunaTravail bon marché, rapide et à grand volume comme la synthèse et la rédaction$0.20 / $1.20

Sol : le modèle phare pour les problèmes difficiles

Sol est conçu pour vos travaux les plus exigeants, notamment le codage complexe, les agents multi-étapes et la recherche scientifique ou en cybersécurité. À $5 en entrée et $30 en sortie par million de tokens, c'est le niveau le plus coûteux : réservez-le aux problèmes qui nécessitent vraiment un raisonnement de pointe. Sol est aussi le modèle qui exécute le mode pro et l'effort max le plus profond, ce qui en fait la cible idéale pour les réglages haute puissance.

Terra : la solution polyvalente du quotidien

Terra est le niveau de production équilibré, compétitif par rapport à la génération précédente à 60 % de son prix. À $2 en entrée et $12 en sortie par million de tokens, en baisse de 20 % depuis le 30 juillet 2026, il gère la majeure partie de la rédaction professionnelle, de l'analyse et du support sans la prime Sol. Pour la plupart des équipes, il devient le choix par défaut dès qu'elles le testent sur de vraies tâches et constatent que la qualité tient.

Luna : rapide et économique

Luna est le niveau économique à grand volume à $0.20 en entrée et $1.20 en sortie par million de tokens, après qu'OpenAI l'a réduit de 80 % le 30 juillet 2026. Il est optimisé pour l'automatisation de routine comme la synthèse, la rédaction et la classification, où la vitesse et le prix comptent plus que l'intelligence maximale. Orientez vos tâches les plus simples et à plus grand volume ici pour maîtriser les coûts.

Les recommandations d'OpenAI sur les modèles suggèrent de commencer avec Sol comme référence, puis de tester si Terra ou Luna convient à vos tâches réelles. Beaucoup de travaux quotidiens fonctionnent parfaitement sur Terra à 60 % de moins que Sol, et Luna coûte désormais un vingt-cinquième de Sol en entrée comme en sortie. Vous pouvez voir comment les trois se comparent à leurs concurrents dans notre sélection des meilleurs modèles IA du moment.

Réglez l'effort de raisonnement

Le second réglage est l'effort de raisonnement, et GPT-5.6 expose six niveaux. Le conseil d'OpenAI est de commencer au réglage que vous utilisiez sur votre dernier modèle, puis de tester un niveau en dessous, car la nouvelle génération a généralement besoin de moins de réflexion pour atteindre la même réponse.

Niveau d'effortQuand l'utiliser
noneRecherches simples où la latence prime
lowTravaux légers sensibles à la vitesse
mediumDéfaut équilibré pour la plupart des tâches
highQuand vos tests montrent un gain de qualité mesurable
xhighTâches difficiles qui profitent clairement d'un raisonnement plus intense
maxVos problèmes les plus difficiles, où la qualité prime

Descendre d'un niveau permet souvent d'économiser sans perte de qualité, ce qui explique pourquoi OpenAI présente le test du niveau inférieur comme une habitude par défaut. Réservez les niveaux les plus élevés aux rares problèmes qui en ont vraiment besoin.

Conseil 3 : activez le mode pro pour vos réponses les plus critiques

GPT-5.6 intègre un véritable mode pro, et c'est le réglage à utiliser quand la qualité prime sur la vitesse ou le coût. Dans l'API Responses, vous définissez reasoning.mode sur pro, et le modèle applique un calcul supplémentaire à la requête avant de renvoyer une réponse finale unique. Il se superpose au modèle et au niveau d'effort déjà choisis.

Ne confondez pas le mode pro avec l'effort max. Max est le plus élevé des six niveaux d'effort, qui accorde plus de temps à une seule chaîne de raisonnement pour un problème avec des dépendances cachées ou un contexte complexe. Le mode pro ajoute un cycle distinct de traitement par le modèle avant la réponse finale, et vous pouvez le combiner avec n'importe quel niveau d'effort, de low à max. Réservez le mode pro au petit nombre de requêtes où une mauvaise réponse a de vraies conséquences.

Pour les travaux véritablement parallélisables, ChatGPT et Codex exposent aussi un ultra mode qui décompose une tâche et lance des sous-agents coordonnateurs au lieu d'exécuter une seule chaîne. Cela a fait passer Sol de 88,8 % à 91,9 % sur le benchmark de codage Terminal-Bench 2.1, mais chaque sous-agent consomme des tokens de façon indépendante : le mode ultra est excessif pour les requêtes de routine. N'y recourez que lorsqu'une tâche se divise proprement et que le délai d'obtention du résultat est prioritaire. Une mise en garde si vous exécutez Codex localement sur un Mac : une régression de journalisation distincte, connue sous le nom de bug SSD de Codex, a écrit des téraoctets de diagnostics superflus sur le disque avant qu'OpenAI livre la majeure partie du correctif en juin 2026.

Conseil 4 : réécrivez vos règles « sois bref »

GPT-5.6 produit déjà des réponses plus courtes que GPT-5.5 par défaut. Cela signifie que les règles de brièveté générales que vous avez ajoutées pour les anciens modèles risquent maintenant de tronquer trop d'informations, en supprimant des détails que vous souhaitiez conserver. OpenAI conseille explicitement aux utilisateurs qui migrent de vérifier si « sois concis » ou « garde ça court » méritent encore leur place.

Lorsque vous voulez une réponse courte, évitez les consignes de brièveté vagues. Dites plutôt au modèle quelles informations conserver et quels détails il peut omettre. Une instruction comme « garde le prix et la date limite, supprime le contexte historique » vous donne un contrôle que « sois bref » ne donnera jamais.

Conseil 5 : décrivez le ton comme un comportement concret, pas des adjectifs

Des mots comme « amical » ou « empathique » sont trop abstraits pour des résultats cohérents. GPT-5.6 répond bien mieux quand vous décrivez le comportement d'écriture réel souhaité. Précisez le degré de directivité, ce par quoi commencer et ce qu'il faut omettre.

L'exemple même d'OpenAI remplace « sois empathique » par une instruction concrète : énoncer la réponse directement et, si l'utilisateur signale un problème, reconnaître ce problème spécifique avant d'indiquer l'étape suivante. Un prompt de support pourrait dire « nommez le problème du client dans votre première ligne, donnez la solution en étapes numérotées, supprimez le paragraphe d'excuse ». Des instructions concrètes produisent le même ton à chaque fois, ce qui est exactement ce que les équipes recherchent lorsqu'elles comparent des options comme Claude vs ChatGPT pour de vrais flux de travail.

Conseil 6 : fixez la longueur de sortie une fois grâce au réglage de verbosité

La longueur de sortie est désormais son propre contrôle. GPT-5.6 ajoute un paramètre de verbosité avec les options low, medium et high, que vous définissez une fois pour toute votre application au lieu de demander des réponses plus courtes dans chaque prompt. Dans l'API, il s'agit du paramètre text.verbosity.

Le bon modèle consiste à définir votre niveau de détail par défaut avec la verbosité, puis à utiliser le prompt uniquement pour les exigences de longueur propres à la tâche. Cela permet de concentrer vos prompts sur la tâche tandis qu'un seul réglage global contrôle la quantité de réponse du modèle. C'est un changement mineur qui supprime beaucoup d'instructions de longueur répétées.

Conseil 7 : laissez GPT-5.6 écrire du code pour utiliser vos outils

Celui-ci s'adresse aux développeurs. GPT-5.6 intègre une fonctionnalité appelée appel d'outils programmatique, qui change l'économie des tâches à forte densité de données. Jusqu'ici, chaque résultat d'outil était renvoyé au modèle pour être lu mot par mot : « analyser 900 lignes de données publicitaires » signifiait que le modèle lisait les 900 lignes.

Le modèle peut désormais écrire un petit programme JavaScript à la place. Le script s'exécute dans un environnement isolé sans accès réseau, récupère les données, effectue le filtrage et les calculs en code, et renvoie uniquement un résultat structuré compact. Les 900 lignes ne passent jamais par le modèle, donc les réponses arrivent plus vite à une fraction du coût. Cela fonctionne mieux pour les tâches délimitées comme le filtrage, la jointure, le tri, la déduplication et l'agrégation des résultats d'outils.

OpenAI déconseille les instructions vagues comme « utilise l'appel d'outils programmatique efficacement ». Décrivez plutôt la phase délimitée, les outils éligibles, le schéma de sortie, la limite de tentatives et la condition d'arrêt. Réservez les appels directs au modèle pour les jugements sémantiques, les approbations et les citations, et utilisez le code pour les traitements déterministes intensifs.

Faut-il réécrire chaque prompt ?

Si vous construisez des produits sur l'API, oui, ces sept changements méritent un audit ciblé des prompts, et les économies de tokens seules couvrent généralement l'effort. Si vous chattez simplement avec GPT-5.6 dans ChatGPT, les mêmes réflexes s'appliquent : principalement écrire des listes de règles plus courtes et décrire le ton de façon concrète. Vous pouvez vérifier ce que le niveau gratuit vous offre dans notre guide sur ce qu'inclut le plan gratuit de ChatGPT.

Si jongler avec les modèles, les niveaux d'effort et les réglages de verbosité vous semble trop complexe, une application comme Fello AI gère l'orientation pour vous. Elle réunit les modèles de la classe GPT-5.6 aux côtés de Claude, Gemini, Grok et DeepSeek en un seul endroit, vous permettant d'envoyer chaque tâche à un modèle performant sans toucher un seul paramètre technique. C'est un moyen simple d'obtenir des réponses de pointe, et de générer des images, des documents et des diaporamas, sans apprendre l'intégralité de l'API.

Conclusion

Le fil conducteur de chaque évolution de GPT-5.6 est le même : dire moins et laisser le modèle faire davantage. Commencez par supprimer les règles répétées, car ce seul geste améliore la qualité tout en réduisant le coût. Ensuite, associez chaque tâche au bon modèle et au bon niveau d'effort, réécrivez vos règles de brièveté et de ton, et appuyez-vous sur la verbosité et l'appel d'outils programmatique pour arrêter de vous répéter.

Commencez aujourd'hui par votre prompt système le plus long : supprimez chaque instruction dupliquée et testez un niveau d'effort en dessous de celui que vous utilisiez auparavant. Cet après-midi de nettoyage est le travail le plus rentable que vous puissiez faire avec GPT-5.6.

FAQ

Comment rédiger des prompts pour GPT-5.6 ?

Énoncez chaque instruction exactement une fois et supprimez les règles répétées des anciens prompts : OpenAI a constaté que cela améliore les scores de 10 à 15 % tout en réduisant les tokens jusqu'à 66 %. Choisissez le bon niveau de modèle, définissez un niveau d'effort de raisonnement et décrivez le ton comme un comportement concret plutôt que par des adjectifs vagues.

Quels sont les niveaux d'effort de raisonnement de GPT-5.6 ?

GPT-5.6 dispose de six niveaux : none, low, medium, high, xhigh et max. OpenAI recommande de commencer au réglage utilisé sur votre dernier modèle, puis de tester un niveau en dessous, car GPT-5.6 a généralement besoin de moins de réflexion pour atteindre la même réponse. Réservez max à vos problèmes les plus difficiles.

GPT-5.6 dispose-t-il d'un mode pro ?

Oui. Définissez reasoning.mode sur pro dans l'API Responses et GPT-5.6 applique un calcul supplémentaire avant de renvoyer une réponse finale unique. Il se combine avec n'importe quel niveau d'effort et convient aux requêtes à fort enjeu. Cela diffère de l'effort max, le plus haut des six niveaux d'effort, et du mode ultra de ChatGPT, qui lance des sous-agents.

Quel modèle GPT-5.6 choisir : Sol, Terra ou Luna ?

Utilisez Sol ($5/$30 par million de tokens) pour vos problèmes les plus difficiles, Terra ($2/$12) pour le travail professionnel quotidien, et Luna ($0.20/$1.20) pour les tâches bon marché à grand volume. OpenAI a réduit Terra de 20 % et Luna de 80 % le 30 juillet 2026, et a laissé Sol inchangé. OpenAI suggère de commencer avec Sol, puis de tester si Terra ou Luna convient à vos tâches réelles pour réduire les coûts.

Qu'est-ce que l'appel d'outils programmatique dans GPT-5.6 ?

L'appel d'outils programmatique permet à GPT-5.6 d'écrire un petit programme JavaScript pour traiter les résultats d'outils dans un environnement isolé, puis de renvoyer uniquement un résultat compact. Les grands jeux de données ne passent jamais par le modèle token par token, ce qui rend les tâches à forte densité de données plus rapides et bien moins coûteuses.