Le cache réutilise les préfixes d'invite stables pour réduire la latence et les coûts. Comprenez le TTL, les points d’arrêt, l’invalidation et les métriques pour la production.

Réponse directe

La mise en cache des invites d'Anthropic réutilise les préfixes d'outils, les instructions système et les messages identiques, évitant ainsi de retraiter le même contexte dans les appels à proximité. La durée de vie par défaut est de cinq minutes, avec une option d'une heure, et l'efficacité apparaît dans les champs cache_creation_input_tokens et cache_read_input_tokens. Le gain ne se produit que lorsque le préfixe reste identique et répond au minimum du modèle ; Les horodatages, les outils réorganisés ou les instructions modifiées peuvent invalider le cache.

La mise en cache nécessite de séparer la stable de la variable

Les politiques, exemples et définitions d'outils doivent apparaître avant les données qui changent à chaque demande. Un horodatage inséré dans le préfixe peut empêcher tous les accès.

TTL suit le rythme

Cinq minutes pour assister à des conversations actives ; une heure peut servir à des analyses espacées, avec un coût d'écriture plus élevé. Le choix doit tenir compte de la cadence et de la répétition réelles.

Les métriques confirment le gain

La lecture et la création du cache doivent être surveillées ainsi que la latence et le coût. Sans lecture du cache, l'optimisation n'existe que dans le code, pas dans le résultat.

Les outils changent également le préfixe

La modification des paramètres ou de leur ordre invalide les couches suivantes. Les catalogues dynamiques doivent utiliser des mécanismes qui préservent l'ensemble stable lorsque la plateforme le prend en charge.

Lecture Nexus

La mise en cache rapide est une ingénierie de contexte : stabiliser les contrats, mesurer les accès et préserver la confidentialité. L’économie durable dépend d’une architecture prévisible et non de l’activation d’un domaine isolé.

FAQ

Quelle est la durée du cache ?

La valeur par défaut est de cinq minutes et il existe une option d'une heure, selon la documentation actuelle.

Comment puis-je savoir s’il y a eu un accès au cache ?

Vérifiez cache_read_input_tokens ; cache_creation_input_tokens affiche le contenu écrit dans le cache.

Le cache stocke-t-il le texte de l'invite ?

Anthropic rapporte que les représentations et les hachages KV sont en mémoire pendant le TTL, sans stocker le texte brut au repos.

Guides essentiels pour approfondir la décision

Sources primaires et références

Cette analyse éditoriale a été réalisée par Nexus à partir des sources officielles ci-dessous, consultées le 20 septembre 2026. Le texte est original et interprète les implications pratiques pour les entreprises.

Date rapportée par source principale : documentation officielle consultée le 20 septembre 2026 ; analyse technique.