View a markdown version of this page

Prompt-Caching für schnellere Modellinferenz - Amazon Bedrock

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Prompt-Caching für schnellere Modellinferenz

Prompt-Caching ist ein optionales Feature, das Sie mit unterstützten Modellen in Amazon Bedrock verwenden können, um die Latenz bei Inferenzantworten und die Kosten für Eingabe-Token zu reduzieren. Indem Sie Teile Ihres Kontextes zu einem Cache hinzufügen, kann das Modell den Cache verwenden, um die Neuberechnung von Eingaben zu überspringen, sodass Bedrock an den Recheneinsparungen teilhaben und Ihre Antwortlatenzen verringern kann.

Prompt-Caching kann hilfreich sein, wenn Sie Workloads mit langen und sich wiederholenden Kontexten haben, die häufig für mehrere Abfragen wiederverwendet werden. Wenn Sie beispielsweise über einen Chatbot verfügen, bei dem Benutzer Dokumente hochladen und Fragen zu ihnen stellen können, kann es für das Modell zeitaufwändig sein, das Dokument jedes Mal zu verarbeiten, wenn der Benutzer eine Eingabe vornimmt. Mit Prompt-Caching können Sie das Dokument zwischenspeichern, sodass künftige Abfragen, die das Dokument enthalten, es nicht erneut verarbeiten müssen.

Wenn Sie Prompt-Caching verwenden, wird Ihnen ein reduzierter Tarif für aus dem Cache gelesene Token berechnet. Je nach Modell kann für in den Cache geschriebene Token ein höherer Tarif berechnet werden als für nicht zwischengespeicherte Eingabe-Token. Für alle Token, die nicht aus dem Cache gelesen oder in den Cache geschrieben wurden, wird der Standardsatz für Eingabe-Token für dieses Modell berechnet. Weitere Informationen finden Sie auf der Amazon-Bedrock-Preisseite.

Funktionsweise

Wenn Sie sich für das Prompt-Caching entscheiden, erstellt Amazon Bedrock einen Cache, der aus Cache-Checkpoints besteht. Dies sind Markierungen, die den zusammenhängenden Unterabschnitt Ihres Prompts definieren, den Sie zwischenspeichern möchten (häufig als Prompt-Präfix bezeichnet). Diese Prompt-Präfixe sollten zwischen Anforderungen statisch sein. Änderungen am Prompt-Präfix bei nachfolgenden Anforderungen führen zu Fehleinträgen im Cache.

Cache-Checkpoints haben eine Mindest- und Höchstzahl an Token, abhängig vom jeweiligen Modell, das Sie verwenden. Sie können nur dann einen Cache-Checkpoint erstellen, wenn Ihr gesamtes Prompt-Präfix der Mindestanzahl an Token entspricht. Claude 3.7 SonnetErfordert beispielsweise mindestens 1.024 Token pro Cache-Checkpoint, während, Claude Opus 4.5 Claude Opus 4.6Claude Haiku 4.5, und mindestens 4.096 Token pro Cache-Checkpoint Claude Sonnet 4.5 erfordern. Das bedeutet, dass für ein Modell mit einem Minimum von 1.024 Token Ihr erster Cache-Checkpoint nach 1.024 Token und Ihr zweiter Cache-Checkpoint nach 2.048 Token definiert werden kann. Wenn Sie versuchen, einen Cache-Checkpoint hinzuzufügen, bevor Sie die Mindestanzahl an Token erreicht haben, ist Ihre Inferenz trotzdem erfolgreich, aber Ihr Präfix wird nicht zwischengespeichert. Der Cache hat eine Gültigkeitsdauer (Time To Live, TTL), die bei jedem erfolgreichen Cache-Treffer zurückgesetzt wird. Während dieses Zeitraums bleibt der Kontext im Cache erhalten. Wenn innerhalb des TTL-Fensters keine Cache-Treffer auftreten, läuft Ihr Cache ab. Viele Modelle unterstützen eine TTL von 5 Minuten. Die genauen TTL-Bedingungen finden Sie auf der Modellkarte Ihres Modells.

Sie können das Prompt-Caching jederzeit verwenden, wenn Sie Modellinferenzen in Amazon Bedrock für unterstützte Modelle erhalten. Prompt-Caching wird von den folgenden Amazon-Bedrock-Features unterstützt:

Converse und APIs ConverseStream

Sie können eine Konversation mit einem Modell führen, bei der Sie in Ihren Prompts Cache-Checkpoints angeben.

InvokeModel und APIs InvokeModelWithResponseStream

Sie können einzelne Prompt-Anfragen einreichen, bei denen Sie das Prompt-Caching aktivieren und Ihre Cache-Checkpoints angeben.

Promptes Caching mit Inferenz Cross-region

Prompt-Caching kann in Verbindung mit regionsübergreifender Inferenz verwendet werden. Cross-region Inference wählt automatisch die optimale AWS Region innerhalb Ihrer Region aus, um Ihre Inferenzanfrage zu bearbeiten, wodurch die verfügbaren Ressourcen und die Modellverfügbarkeit maximiert werden. In Zeiten hoher Nachfrage können diese Optimierungen zu erhöhten Cache-Schreibvorgängen führen.

Amazon Bedrock Prompt Management

Wenn Sie einen Prompt erstellen oder ändern, können Sie wählen, ob Prompt-Caching aktiviert werden soll. Je nach Modell können Sie System-Prompts, Systemanweisungen und Nachrichten (Benutzer- und Assistentnachrichten) zwischenspeichern. Sie können Prompt-Caching auch deaktivieren.

Anmerkung

Promptes Caching wird nur für On-Demand-Inferenzendpunkte unterstützt. Es wird mit der Batch-Inferenz-API nicht unterstützt.

Die APIs bieten Ihnen die größte Flexibilität und detaillierte Kontrolle über den Prompt-Cache. Sie können in Ihren Prompts einen individuellen Cache-Checkpoint festlegen. Sie können den Cache erweitern, indem Sie weitere Cache-Checkpoints erstellen, und zwar bis zur maximalen Anzahl von Cache-Checkpoints, die für das jeweilige Modell zulässig sind. Weitere Informationen finden Sie unter Unterstützte Modelle, Regionen und Limits.

Unterstützte Modelle, Regionen und Limits

Promptes Caching ist in allen AWS Regionen verfügbar, in denen die unterstützten Modelle verfügbar sind. Informationen zur Verfügbarkeit von Modellen nach Regionen finden Sie unterRegionale Verfügbarkeit nach Modellen.

In der folgenden Tabelle sind die unterstützten Modelle zusammen mit ihren Token-Mindestwerten, der maximalen Anzahl von Cache-Checkpoints und Feldern, die Cache-Checkpoints zulassen, aufgeführt.

Unter Modelle auf einen Blick können Sie herausfinden, welche Modelle Prompt-Caching unterstützen. Wählen Sie dann das Modell aus, an dem Sie interessiert sind. Die folgende Tabelle zeigt das Zwischenspeichern von Eingabeaufforderungen für Modelle, die nicht in Models-at-a-Glance enthalten sind.

Modellname Modell-ID Art der Veröffentlichung Mindestanzahl von Token pro Cache-Checkpoint Maximale Anzahl von Cache-Checkpoints pro Anforderung TTL wird unterstützt Felder, die Prompt-Cache-Checkpoints akzeptieren

Claude Opus 4.5

anthropic.claude-opus-4-5-20251101-v 1:0

Allgemein verfügbar

4.096

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude Opus 4.6

anthropic.claude-opus-4-6-v1

Allgemein verfügbar

4.096

4

5 Minuten

„System“, „Nachrichten“ und „Tools“

Claude Sonnet 4.5

anthropic.claude-sonnet-4-5-20250929-v1:0

Allgemein verfügbar

4.096

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude Sonnet 4.6

anthropic.Claude-Sonett-4-6

Allgemein verfügbar

1,024

4

5 Minuten

„System“, „Nachrichten“ und „Tools“

Claude Haiku 4.5

anthropic.claude-haiku-4-5-20251001-v1:0

Allgemein verfügbar

4.096

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude Opus 4

anthropic.claude-opus-4-20250514-v1:0

Allgemein verfügbar

1,024

4

5 Minuten

„System“, „Nachrichten“ und „Tools“

Claude 3.7 Sonnet

anthropic.claude-3-7-sonnet-20250219-v1:0

Allgemein verfügbar

1,024

4

5 Minuten

„System“, „Nachrichten“ und „Tools“

Claude 3.5 Sonnet v2

anthropic.claude-3-5-sonnet-20241022-v2:0

Vorversion

1,024

4

5 Minuten

„System“, „Nachrichten“ und „Tools“

GPT-5.6 Verkauft

openai.gpt-5.6-sol

Allgemein verfügbar

1,024

4

30 Minuten

prompt_cache_breakpointaktiviertinput_text, input_image und blockiert (Responses API) input_file

GPT-5.6 Erde

openai.gpt-5.6-terra

Allgemein verfügbar

1,024

4

30 Minuten

prompt_cache_breakpointaktiviertinput_text, input_image und blockiert (Responses API) input_file

GPT-5.6 Luna

openai.gpt-5.6-luna

Allgemein verfügbar

1,024

4

30 Minuten

prompt_cache_breakpointaktiviertinput_text, input_image und blockiert (Responses API) input_file

Um die 1-stündige TTL-Option mit unterstützten Modellen (Claude Opus4.5, undClaude Sonnet 4.5) zu verwendenClaude Haiku 4.5, geben Sie das ttl Feld in Ihrem Cache-Checkpoint an. Fügen Sie in der Converse API Ihrem Objekt hinzu"ttl": "1h". cachePoint Fügen Sie in der InvokeModel API für Claude-Modelle Ihrem cache_control Objekt "ttl": "1h" etwas hinzu. Wenn kein ttl Wert angegeben wird, gilt das standardmäßige 5-Minuten-Caching-Verhalten. Die 1-stündige TTL ist nützlich für länger andauernde Sitzungen oder Batchverarbeitungsszenarien, in denen Sie den Cache über längere Zeiträume beibehalten möchten.

Amazon Nova bietet automatisches Prompt-Caching für alle Text-Prompts, einschließlich User- und System-Nachrichten. Dieser Mechanismus kann die Latenz verbessern, wenn Prompts mit sich wiederholenden Teilen beginnen, auch ohne explizite Konfiguration. Damit jedoch Kosteneinsparungen erzielt und konsistentere Leistungsvorteile gewährleistet werden können, empfehlen wir Explizites Prompt-Caching.

Cache-Verwaltung für Modelle von Anthropic

Für Claude-Modelle bietet Amazon Bedrock einen vereinfachten Ansatz für das Cache-Management, der die Komplexität der manuellen Platzierung von Cache-Checkpoints reduziert. Anstatt von Ihnen die Angabe exakter Cache-Checkpoint-Positionen zu verlangen, können Sie das automatische Cache-Management mit einem einzigen Haltepunkt am Ende Ihres statischen Inhalts verwenden.

Wenn Sie das vereinfachte Cache-Management aktivieren, sucht das System automatisch nach Cache-Treffern an den Grenzen früherer Inhaltsblöcke und schaut dabei bis zu etwa 20 Inhaltsblöcke ab dem angegebenen Haltepunkt zurück. Auf diese Weise kann das Modell das Präfix mit der längsten Übereinstimmung in Ihrem Cache finden, ohne dass Sie die optimalen Checkpoint-Positionen vorhersagen müssen. Damit Sie dieses Verfahren nutzen können, platzieren Sie einen einzelnen Cache-Checkpoint am Ende Ihres statischen Inhalts, und zwar vor dynamischen oder variablen Inhalten. Das System findet automatisch die beste Cache-Übereinstimmung.

Für eine genauere Steuerung können Sie immer noch mehrere Cache-Checkpoints (bis zu 4 bei Claude-Modellen) verwenden, um die genauen Cache-Grenzen festzulegen. Sie sollten mehrere Cache-Checkpoints verwenden, wenn Sie Abschnitte zwischenspeichern, die sich unterschiedlich häufig ändern, oder wenn Sie mehr Kontrolle darüber haben möchten, was genau zwischengespeichert wird.

Wichtig

Bei der automatischen Präfixüberprüfung werden nur etwa 20 Inhaltsblöcke von Ihrem Cache-Checkpoint aus geprüft. Wenn Ihr statischer Inhalt diesen Bereich überschreitet, sollten Sie in Erwägung ziehen, mehrere Cache-Checkpoints zu verwenden oder Ihren Prompt so umzustrukturieren, dass die am häufigsten wiederverwendeten Inhalte innerhalb dieses Bereichs platziert werden.

Bewährte Methoden für die Verwendung der Cache-Verwaltung in Anthropic Models

Wenn Sie Eingabeaufforderungen haben, die regelmäßig verwendet werden (d. h. Systemaufforderungen, die häufiger als alle 5 Minuten verwendet werden), verwenden Sie weiterhin den 5-Minuten-Cache, da dieser weiterhin ohne zusätzliche Kosten aktualisiert wird.

Der 1-Stunden-Cache eignet sich am besten für die folgenden Szenarien:

  • Wenn Sie Eingabeaufforderungen haben, die wahrscheinlich seltener als 5 Minuten, aber häufiger als jede Stunde verwendet werden. Dies ist beispielsweise der Fall, wenn die Bearbeitung eines externen Agenten länger als 5 Minuten dauert, oder wenn Sie eine lange Chat-Konversation mit einem Benutzer speichern und Sie im Allgemeinen erwarten, dass dieser Benutzer in den nächsten 5 Minuten nicht antwortet.

  • Wenn die Latenz wichtig ist und Ihre Folgeanfragen möglicherweise länger als 5 Minuten gesendet werden.

  • Wenn Sie Ihr Ratenlimit verbessern möchten, verwenden Sie es, da Cache-Treffer nicht von Ihrem Ratenlimit abgezogen werden.

Sie können sowohl 1-Stunden- als auch 5-Minuten-Cache-Kontrollen in derselben Anfrage verwenden, allerdings mit einer wichtigen Einschränkung: Cache-Einträge mit längerer TTL müssen vor kürzeren TTLs stehen (d. h. ein 1-Stunden-Cache-Eintrag muss vor allen 5-minütigen Cache-Einträgen stehen).

Cache-Management für Modelle von OpenAI

OpenAI-Modelle auf Amazon Bedrock unterstützen das sofortige Zwischenspeichern über die Responses API auf dem Endpunkt. bedrock-mantle Das Caching-Verhalten unterscheidet sich je nach Modellgeneration.

GPT-5.6 Modelle

GPT-5.6 Sol (openai.gpt-5.6-sol), Terra (openai.gpt-5.6-terra) und Luna (openai.gpt-5.6-luna) führen explizite Haltepunkte für den Prompt-Cache ein, sodass Sie präzise kontrollieren können, welche Teile Ihrer Eingabeaufforderung zwischengespeichert werden. Dies ist besonders nützlich für Agenten-Workflows, bei denen sich Systemanweisungen, Tooldefinitionen und Referenzdateien bei vielen Aufrufen wiederholen, während sich nur die letzten Eingaben ändern.

Wichtigste Merkmale:

  • Explizite Cache-Breakpoints — Markieren Sie das genaue Ende eines wiederverwendbaren Prompt-Präfixes, indem Sie "prompt_cache_breakpoint": {"mode": "explicit"} es zu einem unterstützten Inhaltsblock hinzufügen.

  • Cache-Modi — Legt festprompt_cache_options.mode, um das Verhalten von Breakpoints zu steuern:

    • implicit(Standard) — Platziert einen automatischen Breakpoint für die neueste Nachricht und verwendet auch alle von Ihnen angegebenen expliziten Breakpoints.

    • explicit— Deaktiviert den automatischen Breakpoint. Für Lese- und Schreibvorgänge im Cache werden nur explizite Breakpoints verwendet. Wenn keine expliziten Breakpoints vorhanden sind, verwendet die Anfrage kein Prompt-Caching und es fallen keine Cache-Schreibgebühren an.

  • Minimale Präfixlänge — 1.024 Token pro Breakpoint.

  • Mindest-TTL von 30 Minuten — Zwischengespeicherte Präfixe bleiben mindestens 30 Minuten lang für die Wiederverwendung verfügbar. Dies ist ausreichend, um die Anzahl der Anrufe abzudecken, die ein einzelner Agentenlauf generiert. Die TTL wird über prompt_cache_options.ttl festgelegt und ist standardmäßig auf. 30m

  • Abrechnung von Cache-Schreibvorgängen — Tokens, die in den Cache geschrieben werden, werden mit dem 1,25-fachen der Rate für nicht zwischengespeicherte Eingabe-Tokens abgerechnet. Cache-Lesevorgänge werden im Vergleich zu nicht zwischengespeicherten Eingabe-Tokens mit einem discount von 90% in Rechnung gestellt.

  • Zwischengespeicherte Token werden nicht auf die Ratenbegrenzungen angerechnet — Im Cache zwischengespeicherte Eingabetoken, die durch das Zwischenspeichern von Eingabeaufforderungen gelesen werden, werden nicht auf das Kontingent für Eingabe-Tokens pro Minute angerechnet.

Die Antwort verstehen

Das Verwendungsobjekt in der Antwort umfasst zwei cachespezifische Felder:

  • cached_tokens— Anzahl der aus dem Cache gelesenen Eingabe-Token (abgerechnet zum Cache-Lese-Diskontsatz).

  • cache_write_tokens— Anzahl der in den Cache geschriebenen Eingabe-Tokens (abgerechnet mit dem 1,25-fachen Tarif für nicht zwischengespeicherte Eingabetoken).

Wenn cached_tokens ist größer als Null und gleich Null, cache_write_tokens stimmt Ihre Anfrage vollständig mit einem vorhandenen Cache-Eintrag überein — es wurden keine neuen Schreibvorgänge durchgeführt und Sie haben die maximalen Kosteneinsparungen erzielt.

Bewährte Methoden für die Verwendung der Cache-Verwaltung in GPT 5.6-Modellen

  • Platzieren Sie Breakpoints hinter stabilen Inhalten — Systemanweisungen, Tooldefinitionen und Referenzdokumente, die sich zwischen Aufrufen nicht ändern, sollten vor dem Breakpoint erscheinen. Der Inhalt nach dem Breakpoint kann beliebig geändert werden, ohne dass das zwischengespeicherte Präfix ungültig wird.

  • explicitModus für Agentenschleifen verwenden — Wenn Sie die volle Kontrolle darüber haben möchten, was zwischengespeichert wird, und wenn Sie vermeiden möchten, dass automatische Breakpoints Schreibplätze belegen.

  • Überwachen cache_write_tokens — Vergleichen Sie das Cache-Schreibvolumen mit den nachfolgenden Cache-Lesevorgängen, um die Auswirkungen auf die Nettokosten zu verstehen und die Platzierung der Breakpoints entsprechend anzupassen.

GPT-5.5 und frühere Modelle

Bei OpenAI-Modellen vor GPT-5.6 (wie openai.gpt-5.5 undopenai.gpt-5.4) erfolgt das Prompt-Caching automatisch. Sie müssen keine speziellen Parameter hinzufügen — das System speichert automatisch geeignete Eingabeaufforderungspräfixe von 1.024 Token oder mehr im Cache. Für Cache-Schreibvorgänge fallen bei diesen Modellen keine zusätzlichen Gebühren an.

Wichtigste Merkmale:

  • Automatisches Caching — Keine Codeänderungen erforderlich. Das System speichert Präfixe automatisch im Cache, basierend auf der exakten Präfixübereinstimmung.

  • Minimale Präfixlänge — 1.024 Token.

  • Keine Cache-Schreibgebühr — Nur Cache-Lesevorgänge werden zu einem ermäßigten Preis abgerechnet.

  • Zwischengespeicherte Token werden nicht auf die Ratenbegrenzungen angerechnet — Im Cache zwischengespeicherte Eingabetoken, die durch das Zwischenspeichern der Eingabeaufforderung gelesen werden, werden nicht auf das Kontingent für Eingabe-Tokens pro Minute angerechnet.

Bewährte Methoden für die Verwendung der Cache-Verwaltung in und früheren Modellen GPT-5.5

  • Platzieren Sie statischen Inhalt (Systemaufforderungen, Tooldefinitionen, Referenzdokumente) an den Anfang Ihrer Aufforderung.

  • Fügen Sie variablen Inhalt (benutzerspezifische Eingaben) am Ende hinzu.

  • Sorgen Sie für einen stetigen Strom von Anfragen mit identischen Präfixen, um Cache-Räumungen zu minimieren.

Erste Schritte

Die folgenden Abschnitte geben Ihnen einen kurzen Überblick darüber, wie Sie das Prompt-Caching-Feature für jede Methode der Interaktion mit Modellen über Amazon Bedrock verwenden können.

Die Converse-API bietet erweiterte und flexible Optionen für die Implementierung von Prompt-Caching in Multi-Turn-Konversationen. Weitere Informationen zu den Prompt-Anfragen der einzelnen Modelle finden Sie im vorherigen Abschnitt Unterstützte Modelle, Regionen und Limits.

Beispielanforderung

Die folgenden Beispiele zeigen einen Cache-Checkpoint, der im Feld messages, system oder tools einer Anfrage an die Converse-API festgelegt ist. Sie können an jedem dieser Orte Checkpoints für eine bestimmte Anfrage platzieren. Wenn Sie beispielsweise eine Anfrage an das Modell Claude 3.5 Sonnet v2 senden, könnten Sie zwei Cache-Checkpoints in messages platzieren, einen Cache-Checkpoint in system und einen in tools. Ausführlichere Informationen und Beispiele für die Strukturierung und das Senden von Converse-API-Anfragen finden Sie unter Inferenz mithilfe der Converse-API.

Wichtig

Cache-Checkpoints werden in dieser Reihenfolge verarbeitet: → →. tools system messages Die minimale Cachegröße wird anhand der kumulierten Tokens für alle drei Abschnitte zusammen bewertet, nicht für jeden Abschnitt einzeln. Da die Abschnitte verkettet sind, wird durch das Ändern des Inhalts in einem früheren Abschnitt der Cache für spätere Abschnitte ungültig (z. B. macht das Ändern die system Caches und tools ungültig). messages Platzieren Sie stabile Inhalte (,system) vor variablem Inhalt (tools) und Cache-Checkpoints nach dem stabilen Inhalt, um optimale Cache-Trefferraten zu erzielen. messages

Geben Sie den gewünschten TTL-Wert wie folgt an. Wenn kein TTL-Wert angegeben ist, gilt das Standardverhalten von 5 Minuten Caching.

"cachePoint" : { "type": "default", "ttl" : "5m | 1h" }
messages checkpoints

In diesem Beispiel liefert das erste image-Feld ein Bild für das Modell, und das zweite text-Feld fordert das Modell auf, das Bild zu analysieren. Solange die Zahl der Token vor dem cachePoint im content-Objekt der Mindestanzahl von Token für das Modell entspricht, wird ein Cache-Checkpoint erstellt.

... "messages": [ { "role": "user", "content": [ { "image": { "bytes": "asfb14tscve..." } }, { "text": "What's in this image?" }, { "cachePoint": { "type": "default" } } ] } ] ...
system checkpoints

In diesem Beispiel geben Sie Ihren System-Prompt in das text-Feld ein. Darüber hinaus können Sie ein cachePoint-Feld hinzufügen, um den System-Prompt zwischenzuspeichern.

... "system": [ { "text": "You are an app that creates play lists for a radio station that plays rock and pop music. Only return song names and the artist. " }, { "cachePoint": { "type": "default" } } ], ...
tools checkpoints

In diesem Beispiel geben Sie Ihre Tool-Definition in das toolSpec-Feld ein. (Alternativ können Sie ein Tool aufrufen, das Sie zuvor definiert haben. Weitere Informationen finden Sie unterVerwenden eines Tools, um eine Amazon-Bedrock-Modellantwort zu vervollständigen.) Anschließend können Sie ein cachePoint-Feld hinzufügen, um das Tool zwischenzuspeichern.

... toolConfig={ "tools": [ { "toolSpec": { "name": "top_song", "description": "Get the most popular song played on a radio station.", "inputSchema": { "json": { "type": "object", "properties": { "sign": { "type": "string", "description": "The call sign for the radio station for which you want the most popular song. Example calls signs are WZPZ and WKRP." } }, "required": [ "sign" ] } } } }, { "cachePoint": { "type": "default" } } ] } ...

Die Modellantwort der Converse API enthält drei neue Felder, die speziell für das Zwischenspeichern von Eingabeaufforderungen vorgesehen sind. Die Werte cacheReadInputTokens und cacheWriteInputTokens geben an, wie viele Token aus dem Cache gelesen wurden und wie viele Token aufgrund Ihrer vorherigen Anforderung in den Cache geschrieben wurden. Die cacheDetails Werte geben die TTL an, die für die Anzahl der in den Cache geschriebenen Token verwendet wurde. Dies sind Werte, die Ihnen von Amazon Bedrock in Rechnung gestellt werden, und zwar zu einem Preis, der unter den Kosten für die vollständige Modellinferenz liegt.

Wichtig

Wenn das Zwischenspeichern von Eingabeaufforderungen aktiviert ist, stellt das inputTokens Feld nur die nicht zwischengespeicherten Eingabetoken dar (Token, die nicht aus dem Cache gelesen oder in den Cache geschrieben wurden). Verwenden Sie die folgende Formel, um die Gesamtzahl der in einer Anfrage gesendeten Eingabetoken zu berechnen:

total input tokens = inputTokens + cacheReadInputTokens + cacheWriteInputTokens

Prompt-Caching ist standardmäßig aktiviert, wenn Sie die InvokeModelAPI aufrufen. Sie können Cache-Checkpoints an jeder beliebigen Stelle in Ihrem Anforderungstext festlegen, ähnlich wie im vorherigen Beispiel für die Converse-API.

Anthropic Claude

Das folgende Beispiel zeigt, wie Sie den Hauptteil Ihrer InvokeModel Anfrage für das Anthropic Claude 3.5 Sonnet v2-Modell strukturieren. Beachten Sie, dass das genaue Format und die Felder des Hauptteils für InvokeModel Anfragen je nach ausgewähltem Modell variieren können. Das Format und den Inhalt der Anforderungs- und Antworttexte für verschiedene Modelle finden Sie unter Inferenzanforderungsparameter und Antwortfelder für Basismodelle.

Geben Sie den gewünschten TTL-Wert wie folgt an. Wenn kein TTL-Wert angegeben ist, gilt das Standardverhalten von 5 Minuten Caching.

"cache_control" : { "type": "ephemeral", "ttl" : "5m | 1h" }
body={ "anthropic_version": "bedrock-2023-05-31", "system":"Reply concisely", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe the best way to learn programming." }, { "type": "text", "text": "Add additional context here for the prompt that meets the minimum token requirement for your chosen model.", "cache_control": { "type": "ephemeral" } } ] } ], "max_tokens": 2048, "temperature": 0.5, "top_p": 0.8, "stop_sequences": [ "stop" ], "top_k": 250 }
Amazon Nova

Das folgende Beispiel zeigt, wie Sie den Hauptteil Ihrer InvokeModel Anfrage für das Modell strukturieren. Amazon Nova Beachten Sie, dass das genaue Format und die Felder des Hauptteils für InvokeModel Anfragen je nach ausgewähltem Modell variieren können. Das Format und den Inhalt der Anforderungs- und Antworttexte für verschiedene Modelle finden Sie unter Inferenzanforderungsparameter und Antwortfelder für Basismodelle.

{ "system": [{ "text": "Reply Concisely" }], "messages": [{ "role": "user", "content": [{ "text": "Describe the best way to learn programming" }, { "text": "Add additional context here for the prompt that meets the minimum token requirement for your chosen model.", "cachePoint": { "type": "default" } }] }], "inferenceConfig": { "maxTokens": 300, "topP": 0.1, "topK": 20, "temperature": 0.3 } }

Weitere Informationen zum Senden einer InvokeModel Anfrage finden Sie unterSenden Sie eine einzelne Aufforderung mit InvokeModel.

Für OpenAI-Modelle auf dem bedrock-mantle Endpunkt verwenden Sie die Responses API mit Prompt-Caching-Parametern, die für die Modellgenerierung spezifisch sind. Bei GPT-5.6 Modellen steuern Sie das Caching mit expliziten Breakpoints. Für GPT-5.5 und frühere Versionen erfolgt das Caching automatisch.

GPT-5.6 Beispiel mit expliziten Cache-Breakpoints

Das folgende Beispiel zeigt eine Response-API-Anfrage zur openai.gpt-5.6-sol Verwendung expliziter Cache-Breakpoints. Die Systemanweisung wird zwischengespeichert und für nachfolgende Anfragen wiederverwendet.

{ "model": "openai.gpt-5.6-sol", "prompt_cache_key": "my-app:system-prompt-v1", "prompt_cache_options": { "mode": "explicit" }, "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions. Follow these guidelines: 1. Always cite the relevant documentation section. 2. If unsure, escalate to a human agent. 3. Be concise but thorough...", "prompt_cache_breakpoint": { "mode": "explicit" } } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }

GPT-5.5 Beispiel mit automatischem Caching

Bei Modellen GPT-5.5 und früheren Modellen erfolgt das Zwischenspeichern der Eingabeaufforderung automatisch. Es sind keine Breakpoints oder Cache-Schlüssel erforderlich — stellen Sie einfach sicher, dass Ihr Prompt-Präfix 1.024 Token überschreitet.

{ "model": "openai.gpt-5.5", "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions..." } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }

Antwort

Die Antwort enthält Metriken zur Cache-Nutzung im usage Objekt:

{ "id": "resp_abc123", "output": [...], "usage": { "input_tokens": 2048, "output_tokens": 256, "total_tokens": 2304, "input_tokens_details": { "cached_tokens": 1920, "cache_write_tokens": 0 } } }

In dieser Antwort wurden 1.920 Token aus dem Cache bereitgestellt und es wurden keine neuen Token geschrieben, was auf einen vollständigen Cache-Treffer mit maximalen Kosteneinsparungen hindeutet.

In einem Chat-Playground der Amazon-Bedrock-Konsole können Sie die Prompt-Caching-Option aktivieren, sodass Amazon Bedrock automatisch Cache-Checkpoints für Sie erstellt.

Folgen Sie den Anweisungen unter Generieren von Antworten in der Konsole mithilfe von Playgrounds, um mit dem Erstellen von Prompts in einem Amazon-Bedrock-Playground zu beginnen. Bei unterstützten Modellen wird das Prompt-Caching im Playground automatisch aktiviert. Ist dies jedoch nicht der Fall, gehen Sie wie folgt vor, um das Zwischenspeichern der Eingabeaufforderung zu aktivieren:

  1. Öffnen Sie das Menü Konfigurationen.

  2. Aktivieren Sie die Option Prompt-Caching.

  3. Führen Sie Ihre Prompts aus.

Nachdem Ihre kombinierten Eingabe- und Modellantworten die für einen Checkpoint erforderliche Mindestanzahl an Token erreicht haben (die je nach Modell unterschiedlich ist), erstellt Amazon Bedrock automatisch den ersten Cache-Checkpoint für Sie. Während Sie weiter chatten, wird bei jedem weiteren Erreichen der Mindestanzahl an Token ein neuer Checkpoint erstellt, bis zu der für das Modell maximal zulässigen Anzahl von Checkpoints. Sie können Ihre Cache-Checkpoints jederzeit einsehen, indem Sie neben der Option Prompt-Caching die Option Cache-Checkpoints anzeigen auswählen, wie im folgenden Screenshot gezeigt.

Benutzeroberflächen-Umschalter für Prompt-Caching in einer Text-Playground von Amazon Bedrock

Sie können sehen, wie viele Token aufgrund jeder Interaktion mit dem Modell aus dem Cache gelesen und in den Cache geschrieben werden, indem Sie das Popup-Fenster mit den Caching-Metriken ( The metrics icon shown in model responses when prompt caching is enabled. ) in den Playground-Antworten aufrufen.

Feld für Caching-Metriken, in dem die Anzahl der Token angezeigt wird, die aus dem Cache gelesen und in den Cache geschrieben wurden.

Wenn Sie während einer Konversation den Umschalter für Prompt-Caching deaktivieren, können Sie den Chat mit dem Model fortsetzen.