Claude Fable 5 vient de sortir : 80,3 % sur SWE-Bench Pro, prix 2× Opus 4.8, gratuit jusqu'au 22 juin

Anthropic a publié aujourd'hui le premier modèle de classe Mythos disponible publiquement — Claude Fable 5, avec des protections qui basculent vers Opus 4.8 sur les requêtes à haut risque. 80,3 % sur SWE-Bench Pro (11 points de plus qu'Opus 4.8). 10 $/50 $ par million de tokens. Gratuit sur les plans Pro/Max jusqu'au 22 juin, puis facturation à la consommation.

By WaveSpeedAI 12 min read

Anthropic a lancé aujourd’hui son premier modèle de classe Mythos accessible au public. Claude Fable 5 est devenu généralement disponible sur l’API Claude, AWS Bedrock, Vertex AI et Microsoft Foundry le 9 juin 2026 — accompagné de Claude Mythos 5, le même modèle sous-jacent mais avec les garde-fous levés, réservé au programme partenaire Project Glasswing. La tarification des deux est fixée à 10 $ en entrée / 50 $ en sortie par million de tokens — exactement 2× le tarif de Claude Opus 4.8.

Les points intéressants ne sont pas dans le titre, cependant. Sous les chiffres du lancement se cache un détail tarifaire significatif (gratuit sur Pro/Max jusqu’au 22 juin, puis facturation par crédit), un profil de benchmark de pointe qui distingue véritablement Fable 5 de la frontière précédente, et un nouveau choix architectural — des garde-fous de classification automatisés qui reviennent à Opus 4.8 plutôt que de refuser — qui affecte concrètement la façon dont ce modèle est déployé.

Ce qui a été livré

DétailValeur
Nom du modèleClaude Fable 5 (public) + Claude Mythos 5 (restreint)
ID du modèle APIclaude-fable-5
Tarif entrée10 $/1M tokens
Tarif sortie50 $/1M tokens
vs tarif Opus 4.82× (5 $/25 $)
DisponibilitéAPI Claude, AWS Bedrock, Vertex AI, Microsoft Foundry
Accès abonnementPro / Max / Team / Enterprise — gratuit jusqu’au 22 juin 2026
Après le 22 juinNécessite des crédits d’utilisation supplémentaires en plus de l’abonnement
Accès Mythos 5Partenaires Project Glasswing uniquement ; chercheurs en biologie via le programme d’accès de confiance

Deux points tarifaires à retenir :

  1. La fenêtre gratuite de 13 jours est le levier de lancement. Anthropic utilise le bundle d’abonnement pour stimuler l’adoption pendant les deux premières semaines. Après le 22 juin, le même modèle sur Pro/Max nécessite un achat explicite de crédits, ce qui remet les utilisateurs en production dans une logique de facturation par token au tarif annoncé de 10 $/50 $.
  2. Le prix 2× Opus 4.8 est élevé, mais l’écart de benchmark l’explique en grande partie (voir ci-dessous). À 50 $/1M en sortie, Fable est le modèle frontier le plus cher du marché — environ 3,3× Sonnet 4.6, 5× GPT-5.5, et 5,5× Gemini 3.5 Flash sur les tokens de sortie.

Les benchmarks — et ce qu’ils montrent vraiment

Fable 5 est lancé avec des revendications de pointe sur « la quasi-totalité des benchmarks testés ». Les chiffres publiés par Anthropic les plus concrets et directement comparables :

BenchmarkFable 5Opus 4.8GPT-5.5Gemini 3.1 Pro
SWE-Bench Pro80,3 %69,2 %58,6 %54,2 %
FrontierCode29,3 %13,4 %5,7 %

Trois lectures :

80,3 % sur SWE-Bench Pro est le chiffre porteur. C’est la variante la plus difficile de SWE-Bench et celle qui est la plus prédictive des performances réelles sur du code en production. Fable 5 devance Opus 4.8 de 11,1 points, GPT-5.5 de 21,7 points, et Gemini 3.1 Pro de 26,1 points. C’est un écart de niveau, pas une avance marginale. Pour les flux de travail de codage où l’on compare la qualité des modèles tête-à-tête, c’est la plus grande avance frontier sur un seul axe rapportée cette année.

FrontierCode est le chiffre le plus révélateur. Ce benchmark cible le niveau le plus difficile des problèmes de programmation — puzzles algorithmiques abstraits, travail sur des structures de données inédites, optimisation critique des performances. Fable 5 à 29,3 % dépasse de plus de 2× Opus 4.8 et de plus de 5× GPT-5.5. Sur un benchmark où le plafond frontier est autour de 30 %, ce type de saut est ce qui se rapproche le plus d’une preuve de changement de niveau que les données de benchmark peuvent fournir.

Les études de cas d’Anthropic soutiennent les chiffres. Stripe aurait utilisé Fable 5 pour réaliser une migration de codebase de 50 millions de lignes en une journée. Hebbia indique que Fable 5 est le meilleur scorer sur son Finance Benchmark. IMC déclare qu’il a « réussi leurs évaluations d’analyse de trading presque partout ». Ce sont des témoignages favorables à la première partie, mais la cohérence du cadrage « code/finance/travail de connaissance scientifique » à travers plusieurs clients indépendants est le signal qui mérite d’être pondéré.

Ce qui n’est pas dans la publication des benchmarks : les chiffres Terminal-Bench, GPQA, MMLU, HumanEval, AIME. Anthropic semble avoir privilégié SWE-Bench Pro et FrontierCode comme métriques de codage principales, ce qui est cohérent avec le positionnement du modèle comme frontier en ingénierie logicielle.

Les garde-fous — un choix architectural différent

La raison pour laquelle Fable 5 peut être lancé publiquement tient aux trois garde-fous de classification automatisés qu’Anthropic a construits au-dessus de Mythos 5 :

  1. Cybersécurité — bloque les tâches offensives de cyber et le développement d’exploits
  2. Biologie/Chimie — revient à Opus 4.8 sur la plupart des requêtes bio/chimie présentant un risque à double usage (incluant spécifiquement la conception d’AAV)
  3. Prévention de la distillation — bloque les tentatives d’extraction de capacités pour des modèles concurrents

Le choix architectural qui compte : lorsqu’un garde-fou se déclenche, la réponse est gérée par Opus 4.8 plutôt que refusée. C’est un choix UX significatif. Les utilisateurs obtiennent une réponse utilisable à la plupart des requêtes même lorsque le raisonnement frontier de Fable 5 est bloqué par la revue de sécurité. Anthropic rapporte que plus de 95 % des sessions Fable n’impliquent aucun retour arrière — ce qui signifie que les garde-fous sont suffisamment bien calibrés pour que les flux de travail en production ne les remarquent pas.

Résultats du red-teaming externe :

  • Plus de 1 000 heures de tests de bug bounty externes — aucun jailbreak universel découvert
  • Zéro requête de cybersécurité nuisible à tour unique satisfaite parmi 30 techniques de jailbreak publiques
  • Un red-teamer externe a qualifié les garde-fous de « plus robustes de tout modèle testé »

Pour les développeurs qui déploient des applications orientées clients, c’est une posture opérationnelle différente de celle qui consiste à refuser à la suite d’un déclencheur de politique. Vous pouvez construire un produit autour du modèle sans concevoir d’UX de repli pour chaque refus de sécurité — Opus 4.8 gère la longue traîne de façon invisible.

Mythos 5 — et ce que son existence implique

Le même modèle avec les garde-fous levés est lancé sous le nom Mythos 5, restreint aux partenaires de cybersécurité Project Glasswing et en expansion via un programme d’accès de confiance pour les chercheurs en biologie. L’écart de capacité entre Fable 5 et Mythos 5 est concentré dans trois catégories :

  • ExploitBench (cyber) : Mythos 5 à 78 % vs 40 % pour Opus 4.8 (Fable 5 ne passe pas ce benchmark car les prompts cyber déclenchent le garde-fou)
  • Conception de médicaments : Mythos 5 aurait accéléré les processus de conception de protéines d’environ 10×, avec 9 des 14 cibles donnant des candidats médicaments
  • Génération d’hypothèses scientifiques : hypothèses inédites de biologie moléculaire préférées environ 80 % du temps lors de comparaisons expertes en aveugle

L’existence de Mythos 5 indique que le modèle sous-jacent possède des capacités sensiblement plus fortes que ce que Fable 5 expose. Pour la plupart des flux de travail en production, c’est invisible — mais pour la recherche en sécurité, la découverte de médicaments et des domaines similaires, la branche Mythos est là où vit la véritable frontière. L’accès public est bloqué précisément parce qu’Anthropic a conclu que le modèle brut présente des risques à double usage que les garde-fous de classification existent pour atténuer.

Ce que la rupture du modèle Sonnet vous dit

Il y a deux semaines, j’ai soutenu que le schéma historique d’Anthropic d’associer des versions mineures Opus et Sonnet rendait une version Sonnet 4.7 plus probable que Sonnet 4.8. Le schéma a rompu plus fortement que prévu : ni Sonnet 4.7, ni Sonnet 4.8, et maintenant la branche Mythos est le lancement principal. Opus 4.8 a été lancé pour occuper le niveau Pro ; Fable 5 occupe un nouveau niveau entièrement au-dessus.

Trois interprétations de ce que cela signifie pour la gamme Claude à venir :

  1. La branche Mythos est la nouvelle frontière, avec Sonnet et Opus comme choix de niveau production en dessous. Le plafond de capacité a visiblement été relevé.
  2. La dénomination s’est découplée du versionnement. À l’avenir, attendez-vous à plus de branches nommées (Mythos, Fable) et moins de la triade Opus/Sonnet/Haiku. L’approche string-in-source-map pour prédire les sorties de modèles est morte.
  3. La séparation des niveaux de tarification s’élargit. Fable 5 à 10 $/50 $ est 2× Opus 4.8, qui était déjà 5× Haiku 4.5. Le coût des capacités frontier augmente plus vite que le coût des capacités de niveau production — ce qui signifie que les décisions de routage comptent plus qu’auparavant.

Où Fable 5 s’intègre en production aujourd’hui

Lectures de déploiement concrètes :

Utilisez Fable 5 pour :

  • Les flux de travail intensifs en code où les performances SWE-Bench Pro comptent directement — migrations à grande échelle, travail sur de nouveaux algorithmes, refactorisations critiques pour les performances. L’avance de 11 points sur Opus 4.8 se traduit par une sortie mesurément meilleure sur de vrais codebases.
  • Le travail de connaissance riche en vision — extraction de données structurées depuis des figures scientifiques, reconstruction d’applications web à partir de captures d’écran, traitement de documentation technique avec des diagrammes intégrés.
  • Le raisonnement sur de longs contextes — le cadrage d’Anthropic met l’accent sur « le maintien de la concentration sur des millions de tokens », ce qui suggère que la courbe de dégradation du modèle à l’extrémité des contextes de 1M+ est significativement meilleure que la frontière précédente.
  • L’analyse financière/de trading — des benchmarks indépendants (Hebbia) placent Fable 5 en tête des évaluations spécifiques à la finance.

Restez sur des alternatives moins chères pour :

  • La génération à haut volume / faibles enjeux — à 50 $/1M en sortie, Fable 5 n’est pas économique pour la génération de contenu, la classification ou l’extraction structurée. Sonnet 4.6 ou Gemini 3.5 Flash font ce travail à environ 10 % du prix.
  • Les flux de travail d’agents MCP / orchestrés par outils — Gemini 3.5 Flash mène actuellement MCP Atlas et Toolathlon à une fraction du coût. La force de codage de Fable ne se traduit pas automatiquement par une force dans l’orchestration d’agents.
  • Les requêtes cyber ou bio où Fable reviendra en arrière de toute façon — vous payez le tarif Fable pour la sortie d’Opus 4.8. Utilisez directement Opus 4.8.

Comment accéder à Claude Fable 5 aujourd’hui

Trois chemins de déploiement :

  1. Directement via Anthropicclaude-fable-5 est en direct sur l’API Claude et sur AWS Bedrock, Vertex AI et Microsoft Foundry. Gratuit sur les plans Pro/Max jusqu’au 22 juin ; la facturation par token prend effet après à 10 $/50 $.
  2. Via le point de terminaison LLM WaveSpeedAI — accès compatible OpenAI aux modèles de texte frontier actuels derrière une seule clé API. Lorsque Fable 5 se propagera sur la plateforme, vous pourrez le tester en A/B contre Opus 4.8, Sonnet 4.6, GPT-5.5 et Gemini 3.5 Flash sous la même interface sans faire tourner les identifiants de fournisseur.
  3. Via les routeurs de fournisseurs — si vous êtes sur un agrégateur (Vercel AI SDK, LangChain, etc.), l’ID de modèle claude-fable-5 est déjà dans le registre de modèles public. Les politiques de routage « utiliser Fable pour les tâches lourdes en SWE, Sonnet pour tout le reste » deviennent un changement de configuration en une ligne.

Ce qu’il faut surveiller dans les deux prochaines semaines

Trois signaux :

  1. La transition tarifaire du 22 juin. Quand la fenêtre Pro/Max gratuite se termine, le signal d’adoption publique devient le nombre d’abonnés qui paient réellement un dépassement pour Fable 5. C’est la lecture la plus claire pour savoir si la tarification 2× Opus 4.8 est viable pour la longue traîne des cas d’utilisation.
  2. La réplication indépendante des benchmarks. Les chiffres SWE-Bench Pro et FrontierCode d’Anthropic sont de première partie. Surveillez la réplication par des suites de benchmarks indépendantes — et les preuves que l’avance de 11 points sur Opus 4.8 tient en dehors des ensembles de tests sélectionnés par Anthropic.
  3. La prochaine version de Sonnet. Avec Mythos comme nouvelle branche frontier, que se passe-t-il avec Sonnet ? Un Sonnet mis à jour positionné face à Gemini 3.5 Flash sur les benchmarks coût/agent ré-ancrerait le niveau valeur de la gamme Claude. Le silence sur Sonnet signalerait qu’Anthropic laisse le niveau production reposer sur 4.6 plus longtemps que la cadence historique ne le suggère.

En attendant : Fable 5 est le nouveau plafond, Opus 4.8 est la valeur par défaut de niveau production, et Sonnet 4.6 reste le choix valeur. Les deux prochaines semaines vous diront si la branche Mythos est un one-off frontier ou la nouvelle norme pour la cadence de lancement d’Anthropic.