Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Almacenamiento en caché de peticiones para una inferencia de modelos más rápida
El almacenamiento en caché de peticiones es una característica opcional que puede utilizar con los modelos compatibles en Amazon Bedrock para reducir la latencia de la respuesta de inferencia y los costos de los tokens de entrada. Al agregar partes de su contexto a una caché, el modelo puede usar la caché para omitir el recálculo de las entradas, lo que permite a Bedrock compartir los ahorros de cómputo y reducir las latencias de respuesta.
El almacenamiento en caché de peticiones puede ser útil cuando tiene cargas de trabajo con contextos largos y repetitivos que se reutilizan con frecuencia para múltiples consultas. Por ejemplo, si tiene un chatbot en el que los usuarios pueden cargar documentos y hacer preguntas sobre ellos, el modelo puede tardar mucho tiempo en procesar el documento cada vez que el usuario proporciona información. Con el almacenamiento en caché de peticiones, puede almacenar en caché el documento para que las futuras consultas que contengan el documento no tengan que volver a procesarlo.
Al utilizar el almacenamiento en caché de peticiones, se le cobrará una tarifa reducida por los tokens leídos desde la memoria caché. Según el modelo, los tokens escritos en la memoria caché pueden cobrarse a una tarifa superior a la de los tokens de entrada no almacenados en caché. Los tokens que no se lean o escriban en la memoria caché se cobran según la tarifa de token estándar de ese modelo. Para obtener más información, consulte la página de Precios de Amazon Bedrock
Funcionamiento
Si decide utilizar el almacenamiento en caché de peticiones, Amazon Bedrock crea una caché compuesta por puntos de control de caché. Son marcadores que definen la subsección contigua de la petición que desea almacenar en caché (lo que suele denominarse “prefijo de petición”). Estos prefijos de petición deben ser estáticos entre las solicitudes; si se modifica el prefijo de petición en solicitudes posteriores, se producirá una pérdida de memoria caché.
Los puntos de control de caché tienen un número mínimo y máximo de tokens, según el modelo específico que utilice. Solo puede crear un punto de control de caché si el prefijo de petición total cumple con el número mínimo de tokens. Por ejemplo, Claude 3.7 Sonnet requiere al menos 1024 fichas por punto de control de caché, mientras que, Claude Opus 4.5 Claude Opus 4.6Claude Haiku 4.5, y Claude Sonnet 4.5 requiere al menos 4096 fichas por punto de control de caché. Esto significa que, para un modelo con un mínimo de 1024 fichas, el primer punto de control de la memoria caché se puede definir después de 1024 fichas y el segundo punto de control de la memoria caché se puede definir después de las 2048 fichas. Si intenta añadir un punto de control de caché antes de alcanzar el número mínimo de tokens, la inferencia se seguirá realizando correctamente, pero el prefijo no se almacenará en caché. La caché tiene un tiempo de vida útil (TTL), que se restablece cada vez que se accede a ella correctamente. Durante este período, se conserva el contexto de la memoria caché. Si no se realiza ningún acceso a la caché en la ventana TTL, la caché caduca. Muchos modelos admiten un TTL de 5 minutos. Compruebe la tarjeta de modelo de su modelo para ver las condiciones exactas del TTL.
Puede utilizar el almacenamiento en caché de peticiones cada vez que obtenga inferencia de modelos en Amazon Bedrock para los modelos compatibles. Las siguientes características de Amazon Bedrock admiten el almacenamiento en caché de peticiones:
- Converse y las API ConverseStream
-
Puede mantener una conversación con un modelo en el que especifique puntos de control de caché en sus peticiones.
- InvokeModel y API InvokeModelWithResponseStream
-
Puede enviar solicitudes de petición únicas en las que se habilite el almacenamiento en caché de peticiones y se especifiquen puntos de control de caché.
- Almacenamiento rápido en caché con inferencia Cross-region
-
El almacenamiento rápido en caché se puede utilizar junto con la inferencia entre regiones. Cross-region La inferencia selecciona automáticamente la AWS región óptima dentro de su geografía para atender su solicitud de inferencia, lo que maximiza los recursos disponibles y la disponibilidad del modelo. En momentos de alta demanda, estas optimizaciones pueden provocar un aumento de las escrituras en caché.
- Administración de peticiones de Amazon Bedrock
-
Al crear o modificar una petición, puede optar por habilitar el almacenamiento en caché de peticiones. Según el modelo, puede almacenar en caché las peticiones del sistema, las instrucciones del sistema y los mensajes (del usuario y del asistente). También puede elegir deshabilitar el almacenamiento en caché de peticiones.
nota
El almacenamiento rápido en caché solo se admite para los puntos finales de inferencia bajo demanda. No es compatible con la API de inferencia por lotes.
Las API le proporcionan la mayor flexibilidad y un control detallado sobre la caché de peticiones. Puede establecer un punto de control de caché individual dentro de sus peticiones. Puede añadirlo a la caché creando más puntos de control de caché, hasta el número máximo de puntos de control de caché permitido para el modelo específico. Para obtener más información, consulte Modelos y regiones compatibles, y límites.
Modelos y regiones compatibles, y límites
El almacenamiento rápido en caché está disponible en todas AWS las regiones en las que están disponibles los modelos compatibles. Para comprobar la disponibilidad de los modelos por región, consulteDisponibilidad regional por modelos.
En la siguiente tabla se muestran los modelos compatibles junto con su número mínimo de tokens, número máximo de puntos de control de caché y los campos que permiten puntos de control de caché.
Para ver qué modelos admiten el almacenamiento rápido en caché, consulte la sección Modelos de un vistazo y, a continuación, elija el modelo que le interese. En la siguiente tabla se muestra el almacenamiento rápido en caché de los modelos que no están presentes en Models-at-a-Glance.
| Nombre de modelo | ID del modelo | Tipo de versión | Número mínimo de tokens por punto de control de caché | Número máximo de puntos de control de caché por solicitud | TTL compatible | Campos que aceptan puntos de control de caché de peticiones |
|---|---|---|---|---|---|---|
Claude Opus 4.5 |
anthropic.claude-opus-4-5-20251101-v 1:0 |
Disponibilidad general |
4.096 |
4 |
5 minutos, 1 hora |
`system`, `messages` y `tools` |
Claude Opus 4.6 |
antropic.claude-opus-4-6-v1 |
Disponibilidad general |
4.096 |
4 |
5 minutos |
`system`, `messages` y `tools` |
Claude Sonnet 4.5 |
anthropic.claude-sonnet-4-5-20250929-v1:0 |
Disponibilidad general |
4.096 |
4 |
5 minutos, 1 hora |
`system`, `messages` y `tools` |
Claude Sonnet 4.6 |
antropico. Claude-sonnet-4-6 |
Disponibilidad general |
1 024 |
4 |
5 minutos |
`system`, `messages` y `tools` |
Claude Haiku 4.5 |
anthropic.claude-haiku-4-5-20251001-v1:0 |
Disponibilidad general |
4.096 |
4 |
5 minutos, 1 hora |
`system`, `messages` y `tools` |
Claude Opus 4 |
anthropic.claude-opus-4-20250514-v1:0 |
Disponibilidad general |
1 024 |
4 |
5 minutos |
`system`, `messages` y `tools` |
Claude 3.7 Sonnet |
anthropic.claude-3-7-sonnet-20250219-v 1:0 |
Disponibilidad general |
1 024 |
4 |
5 minutos |
`system`, `messages` y `tools` |
Claude 3.5 Sonnet v2 |
anthropic.claude-3-5-sonnet-20241022-v2:0 |
Vista previa |
1 024 |
4 |
5 minutos |
`system`, `messages` y `tools` |
GPT-5.6 Sol |
openai.gpt-5.6-sol |
Disponibilidad general |
1 024 |
4 |
30 minutos |
|
GPT-5.6 Terra |
openai.gpt-5.6-terra |
Disponibilidad general |
1 024 |
4 |
30 minutos |
|
GPT-5.6 Luna |
openai.gpt-5.6-luna |
Disponibilidad general |
1 024 |
4 |
30 minutos |
|
Para usar la opción TTL de 1 hora con los modelos compatibles (Claude Opus4.5, yClaude Sonnet 4.5)Claude Haiku 4.5, especifica el ttl campo en el punto de control de la caché. En la API de Converse, "ttl": "1h" añádelo a tu objeto. cachePoint En la InvokeModel API para los modelos Claude, añade algo "ttl": "1h" a tu cache_control objeto. Si no se proporciona ningún ttl valor, se aplica el comportamiento de almacenamiento en caché predeterminado de 5 minutos. El TTL de 1 hora es útil para sesiones de larga duración o escenarios de procesamiento por lotes en los que desee mantener la caché durante períodos prolongados.
Amazon Nova ofrece un almacenamiento en caché de peticiones automático para todas las peticiones de texto, incluidos los mensajes User y System. Este mecanismo puede proporcionar beneficios de latencia cuando las peticiones comienzan con partes repetitivas, incluso sin una configuración explícita. Sin embargo, para ahorrar costos y garantizar beneficios de rendimiento más sistemáticos, recomendamos optar por el almacenamiento en caché de peticiones explícito.
Gestión de caché para modelos de Anthropic
Para los modelos Claude, Amazon Bedrock ofrece un enfoque simplificado de administración de la memoria caché que reduce la complejidad de colocar manualmente los puntos de control de caché. En lugar de tener que especificar las ubicaciones exactas de los puntos de control de caché, puede utilizar la administración automática de caché con un único punto de interrupción al final del contenido estático.
Al habilitar la administración simplificada de la memoria caché, el sistema comprueba automáticamente si se ha accedido a la memoria caché en los límites de los bloques de contenido anteriores y analiza hasta aproximadamente 20 bloques de contenido desde el punto de interrupción especificado. Esto permite que el modelo encuentre el prefijo coincidente más largo de la caché sin necesidad de que usted prediga las ubicaciones óptimas de los puntos de control. Para usarlo, coloque un único punto de control de caché al final del contenido estático, antes de cualquier contenido dinámico o variable. El sistema encontrará automáticamente la mejor coincidencia en la caché.
Para un control más detallado, puede seguir utilizando varios puntos de control de caché (hasta cuatro para los modelos Claude) para especificar los límites exactos de la caché. Debe utilizar varios puntos de control de caché si almacena en caché secciones que cambian con diferentes frecuencias o si desea tener más control sobre qué es exactamente lo que se almacena en caché.
importante
La comprobación automática de prefijos solo examina aproximadamente 20 bloques de contenido de su punto de control de caché. Si su contenido estático se extiende más allá de este intervalo, considere la posibilidad de usar varios puntos de control de caché o reestructurar la petición para colocar dentro de este intervalo el contenido que se reutiliza con más frecuencia.
Mejores prácticas para utilizar la gestión de caché en modelos antrópicos
Si tiene mensajes que se utilizan con una cadencia normal (es decir, mensajes del sistema que se utilizan con más frecuencia que cada 5 minutos), siga utilizando la memoria caché de 5 minutos, ya que se seguirá actualizando sin coste adicional.
La memoria caché de 1 hora se utiliza mejor en los siguientes escenarios:
-
Cuando tiene mensajes que probablemente se usen con menos de 5 minutos, pero con más frecuencia que cada hora. Por ejemplo, cuando un agente secundario tarda más de 5 minutos o cuando se guarda una larga conversación de chat con un usuario y, por lo general, se espera que el usuario no responda en los próximos 5 minutos.
-
Cuando la latencia es importante y es posible que tus mensajes de seguimiento se envíen durante más de 5 minutos.
-
Cuando quieras mejorar tu límite de velocidad, úsalo, ya que las visitas a la memoria caché no se deducen de tu límite de velocidad.
Puedes usar controles de caché de 1 hora y 5 minutos en la misma solicitud, pero con una restricción importante: las entradas de caché con TTL más largos deben aparecer antes que los TTL más cortos (es decir, una entrada de caché de 1 hora debe aparecer antes que cualquier entrada de caché de 5 minutos).
Gestión de caché para modelos de OpenAI
Los modelos OpenAI de Amazon Bedrock admiten el almacenamiento rápido en caché a través de la API de respuestas en el punto final. bedrock-mantle El comportamiento del almacenamiento en caché varía según la generación del modelo.
GPT-5.6 modelos
GPT-5.6 Sol (openai.gpt-5.6-sol), Terra (openai.gpt-5.6-terra) y Luna (openai.gpt-5.6-luna) introducen puntos de interrupción explícitos en la caché de solicitudes, lo que le permite controlar con precisión qué partes de la solicitud se almacenan en caché. Esto resulta especialmente útil para los flujos de trabajo de los agentes, en los que las instrucciones del sistema, las definiciones de las herramientas y los archivos de referencia se repiten en muchas llamadas y solo cambian las entradas más recientes.
Características clave:
Puntos de interrupción de caché explícitos: marca el final exacto de un prefijo de aviso reutilizable añadiéndolo
"prompt_cache_breakpoint": {"mode": "explicit"}a un bloque de contenido compatible.Modos de caché: configurados
prompt_cache_options.modepara controlar el comportamiento de los puntos de interrupción:implicit(predeterminado): coloca un punto de interrupción automático en el último mensaje y también utiliza los puntos de interrupción explícitos que proporciones.explicit— Desactiva el punto de interrupción automático. Solo se utilizan puntos de interrupción explícitos para las lecturas y escrituras de la caché. Si no existen puntos de interrupción explícitos, la solicitud no utiliza el almacenamiento rápido en caché ni incurre en cargos por escritura en caché.
Longitud mínima del prefijo: 1024 fichas por punto de interrupción.
TTL de 30 minutos como mínimo: los prefijos en caché permanecen disponibles para su reutilización durante al menos 30 minutos, el tiempo suficiente para cubrir la ráfaga de llamadas que genera una sola operación de agente. El TTL se establece mediante
prompt_cache_options.ttly su valor predeterminado es.30mFacturación por escritura en caché: los tokens escritos en la memoria caché se facturan a 1,25 veces la tasa de cambio de los tokens de entrada no almacenados en caché. Las lecturas de caché se facturan con un descuento del 90% en comparación con los tokens de entrada no almacenados en caché.
Los tokens almacenados en caché no se tienen en cuenta para los límites de velocidad: los tokens de entrada en caché que se leen mediante el rápido almacenamiento en caché no se tienen en cuenta para la cuota de entradas por minuto.
Interpretación de la respuesta
El objeto de uso de la respuesta incluye dos campos específicos de la memoria caché:
cached_tokens— Número de tokens de entrada leídos de la caché (facturados con la tasa de descuento de lectura de caché).cache_write_tokens— Número de fichas de entrada grabadas en la memoria caché (facturadas a 1,25 veces la tasa de entradas no almacenadas en caché).
Si cached_tokens es mayor que cero y cache_write_tokens igual a cero, la solicitud coincidió totalmente con una entrada de caché existente: no se produjeron nuevas escrituras y usted obtuvo el máximo ahorro de costes.
Mejores prácticas para usar la administración de caché en los modelos GPT 5.6
Coloca los puntos de interrupción después del contenido estable: las instrucciones del sistema, las definiciones de las herramientas y los documentos de referencia que no cambien entre llamadas deberían aparecer antes del punto de interrupción. El contenido después del punto de interrupción puede cambiar libremente sin invalidar el prefijo almacenado en caché.
Utilice el
explicitmodo para bucles de agente: cuando desee tener un control total sobre lo que se almacena en caché y evitar que los puntos de interrupción automáticos consuman espacios de escritura.Supervise
cache_write_tokens: compare el volumen de escritura en caché con las lecturas de caché posteriores para comprender el impacto neto en los costes y ajustar la ubicación de los puntos de interrupción en consecuencia.
GPT-5.5 y modelos anteriores
Para los modelos OpenAI anteriores a GPT-5.6 (como openai.gpt-5.5 yopenai.gpt-5.4), el almacenamiento rápido en caché es automático. No es necesario añadir ningún parámetro especial: el sistema almacena automáticamente en caché los prefijos de texto aptos de 1.024 fichas o más. La escritura en caché no conlleva ningún coste adicional en estos modelos.
Características clave:
Almacenamiento en caché automático: no es necesario cambiar el código. El sistema almacena en caché los prefijos automáticamente en función de la coincidencia exacta de los prefijos.
Longitud mínima del prefijo: 1024 fichas.
Sin tarifa de escritura en caché: solo las lecturas en caché se facturan con descuento.
Los tokens en caché no se tienen en cuenta para los límites de velocidad: los tokens de entrada en caché que se leen mediante el rápido almacenamiento en caché no se tienen en cuenta para la cuota de entradas por minuto.
Mejores prácticas para usar la administración de caché en modelos anteriores GPT-5.5
Coloca el contenido estático (instrucciones del sistema, definiciones de herramientas, documentos de referencia) al principio de la solicitud.
Coloque el contenido variable (entrada específica del usuario) al final.
Mantén un flujo constante de solicitudes con prefijos idénticos para minimizar los desalojos de caché.
Introducción
En las siguientes secciones se muestra una breve descripción de cómo utilizar la característica de almacenamiento en caché de peticiones para cada método de interacción con los modelos a través de Amazon Bedrock.
La API Converse ofrece opciones avanzadas y flexibles para implementar el almacenamiento en caché de peticiones en conversaciones de varios turnos. Para obtener más información sobre los requisitos de petición de cada modelo, consulte la sección anterior Modelos y regiones compatibles, y límites.
Ejemplo de solicitud
Los siguientes ejemplos muestran un punto de control de caché establecido en los campos messages, system o tools de una solicitud a la API Converse. Puede colocar puntos de control en cualquiera de estas ubicaciones para una solicitud determinada. Por ejemplo, si envía una solicitud al modelo Claude 3.5 Sonnet v2, puede colocar dos puntos de control de caché en messages, un punto de control de caché en system y otro en tools. Para obtener información más detallada y ejemplos de cómo estructurar y enviar solicitudes de la API Converse, consulte Inferencia mediante la API de Converse.
importante
Los puntos de control de la caché se procesan en este orden: tools → →. system messages El tamaño mínimo de la caché se evalúa en función de los símbolos acumulados en las tres secciones juntas, no en cada sección individualmente. Como las secciones están encadenadas, al cambiar el contenido de una sección anterior se invalida la caché de las secciones posteriores (por ejemplo, la modificación tools invalida las cachés system ymessages). Para obtener las mejores tasas de aciertos de caché, coloca el contenido estable (tools,system) antes del contenido variable (messages) y coloca los puntos de control de la caché después del contenido estable.
Especifique el valor ttl deseado como se muestra a continuación; si no se especifica el valor ttl, se aplicará el comportamiento predeterminado de 5 minutos de almacenamiento en caché.
"cachePoint" : { "type": "default", "ttl" : "5m | 1h" }
La respuesta del modelo de la Converse API incluye tres campos nuevos que son específicos para solicitar el almacenamiento en caché. Los valores cacheReadInputTokens y cacheWriteInputTokens indican cuántos tokens se han leído de la caché y cuántos se han escrito en ella debido a una solicitud anterior. Los cacheDetails valores indican el ttl utilizado para el número de token escrito en la memoria caché. Estos son valores que Amazon Bedrock le cobra a una tarifa inferior al costo de la inferencia completa del modelo.
importante
Cuando se habilita el almacenamiento en caché de mensajes, el inputTokens campo representa solo los símbolos de entrada no almacenados en caché (símbolos que no se leyeron ni se escribieron en la caché). Para calcular el total de símbolos de entrada enviados en una solicitud, usa la siguiente fórmula:
total input tokens = inputTokens + cacheReadInputTokens + cacheWriteInputTokens
El almacenamiento rápido en caché está habilitado de forma predeterminada cuando llamas a la InvokeModelAPI. Puede establecer puntos de control de caché en cualquier punto del cuerpo de la solicitud, de forma similar al ejemplo anterior de la API Converse.
Para obtener más información sobre el envío de una InvokeModel solicitud, consulteEnvíe un único mensaje con InvokeModel.
Para los modelos OpenAI en el bedrock-mantle punto final, se utiliza la API de respuestas con parámetros de almacenamiento en caché rápidos específicos para la generación del modelo. En el caso de GPT-5.6 los modelos, el almacenamiento en caché se controla con puntos de interrupción explícitos. En el caso de GPT-5.5 las versiones anteriores, el almacenamiento en caché es automático.
GPT-5.6 ejemplo con puntos de interrupción de caché explícitos
En el siguiente ejemplo, se muestra una solicitud de la API de respuestas para openai.gpt-5.6-sol utilizar puntos de interrupción de caché explícitos. La instrucción del sistema se almacena en caché y se reutiliza en las solicitudes posteriores.
{ "model": "openai.gpt-5.6-sol", "prompt_cache_key": "my-app:system-prompt-v1", "prompt_cache_options": { "mode": "explicit" }, "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions. Follow these guidelines: 1. Always cite the relevant documentation section. 2. If unsure, escalate to a human agent. 3. Be concise but thorough...", "prompt_cache_breakpoint": { "mode": "explicit" } } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }
GPT-5.5 ejemplo con almacenamiento en caché automático
En los modelos GPT-5.5 y modelos anteriores, el almacenamiento rápido en caché es automático. No se necesitan puntos de interrupción ni claves de caché; solo asegúrate de que el prefijo de búsqueda supere los 1024 tokens.
{ "model": "openai.gpt-5.5", "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions..." } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }
Respuesta
La respuesta incluye las métricas de uso de la memoria caché en el objeto: usage
{ "id": "resp_abc123", "output": [...], "usage": { "input_tokens": 2048, "output_tokens": 256, "total_tokens": 2304, "input_tokens_details": { "cached_tokens": 1920, "cache_write_tokens": 0 } } }
En esta respuesta, se distribuyeron 1.920 fichas desde la memoria caché y no se escribió ninguna nueva, lo que indica que se ha agotado toda la memoria caché y se han reducido al máximo los costes.
En un entorno de pruebas de chat de la consola de Amazon Bedrock, puede activar la opción de almacenamiento en caché de peticiones y Amazon Bedrock creará automáticamente puntos de control de caché por usted.
Siga las instrucciones de Generación de respuestas en la consola mediante áreas de juego para empezar a usar peticiones en un entorno de pruebas de Amazon Bedrock. En los modelos compatibles, el almacenamiento en caché de peticiones se activa automáticamente en el entorno de pruebas. Sin embargo, si no es así, haz lo siguiente para activar el almacenamiento rápido en caché:
-
Abra el menú de configuraciones.
-
Active la opción Almacenamiento en caché de peticiones.
-
Ejecute sus peticiones.
Cuando las respuestas combinadas de entrada y modelo alcancen la cantidad mínima requerida de tokens para un punto de control (que varía según el modelo), Amazon Bedrock creará automáticamente el primer punto de control de caché para usted. A medida que siga chateando, cada vez que alcance el número mínimo de tokens, se creará un nuevo punto de control, hasta el número máximo de puntos de control permitido para el modelo. Puede ver los puntos de control de caché en cualquier momento seleccionando Ver los puntos de control de la caché junto a la opción Almacenamiento en caché de peticiones, como se muestra en la siguiente captura de pantalla.
Puede ver cuántos tokens se leen y escriben en la caché debido a cada interacción con el modelo consultando la ventana emergente Métricas de almacenamiento en caché (
) en las respuestas del entorno de pruebas.
Si desactiva la opción de almacenamiento en caché de peticiones mientras está en medio de una conversación, puede seguir chateando con el modelo.