Der Cache verwendet stabile Eingabeaufforderungspräfixe wieder, um Latenz und Kosten zu reduzieren. Verstehen Sie TTL, Haltepunkte, Invalidierung und Metriken für die Produktion.

Direkte Antwort

Das Prompt-Caching von Anthropic verwendet identische Tool-Präfixe, Systemanweisungen und Nachrichten wieder und vermeidet so die erneute Verarbeitung desselben Kontexts bei Aufrufen in der Nähe. Die Standard-TTL beträgt fünf Minuten, mit einer Option von einer Stunde, und die Wirksamkeit wird in den Feldern „cache_creation_input_tokens“ und „cache_read_input_tokens“ angezeigt. Der Gewinn tritt nur ein, wenn das Präfix identisch bleibt und das Modellminimum erfüllt; Zeitstempel, neu angeordnete Tools oder geänderte Anweisungen können den Cache ungültig machen.

Beim Caching muss der Stable von der Variable getrennt werden

Richtlinien, Beispiele und Tooldefinitionen müssen vor Daten erscheinen, die sich bei jeder Anfrage ändern. Ein in das Präfix eingefügter Zeitstempel kann alle Treffer verhindern.

TTL hält mit dem Strom Schritt

Nehmen Sie fünf Minuten an aktiven Gesprächen teil; Eine Stunde kann für räumlich verteilte Analysen verwendet werden, wobei die Schreibkosten höher sind. Bei der Auswahl müssen echte Kadenz und Wiederholung berücksichtigt werden.

Kennzahlen bestätigen den Gewinn

Cache-Lesevorgänge und Cache-Erstellung müssen zusammen mit Latenz und Kosten überwacht werden. Ohne Cache-Lesen existiert die Optimierung nur im Code, nicht im Ergebnis.

Tools ändern auch das Präfix

Durch das Ändern von Einstellungen oder deren Reihenfolge werden nachfolgende Ebenen ungültig. Dynamische Kataloge müssen Mechanismen verwenden, die den stabilen Satz bewahren, wenn die Plattform ihn unterstützt.

Nexus-Lesung

Prompt-Caching ist Kontext-Engineering: Verträge stabilisieren, Treffer messen und den Datenschutz wahren. Die nachhaltige Wirtschaft hängt von einer vorhersehbaren Architektur ab, nicht von der Aktivierung eines isolierten Bereichs.

FAQ

Wie lang ist der Cache?

Der Standardwert beträgt fünf Minuten und es gibt laut aktueller Dokumentation eine Option für eine Stunde.

Woher weiß ich, ob ein Cache-Treffer vorliegt?

Cache_read_input_tokens prüfen; Cache_creation_input_tokens zeigt den in den Cache geschriebenen Inhalt.

Speichert der Cache Eingabeaufforderungstext?

Anthropic berichtet, dass KV-Darstellungen und Hashes während der TTL im Speicher bleiben, ohne dass der Rohtext im Ruhezustand gespeichert wird.

Wichtige Leitfäden, um tiefer in die Entscheidung einzutauchen

Primärquellen und Referenzen

Diese redaktionelle Analyse wurde von Nexus anhand der unten aufgeführten offiziellen Quellen erstellt, die am 20. September 2026 konsultiert wurden. Der Text ist original und interpretiert praktische Implikationen für Unternehmen.

Von der Hauptquelle gemeldetes Datum: konsultierte offizielle Dokumentation am 20. September 2026; technische Analyse.