Well-Architected on a Budget: Cutting Database and AI Inference Cost with Valkey on Kubernetes
Cada milisegundo y cada dólar cuentan al escalar una carga de trabajo en Kubernetes. En esta sesión, mostramos cómo el proyecto Valkey, el almacén de datos en memoria de código abierto impulsado por la comunidad, se convierte en una palanca de costos en las dos capas más costosas de un clúster moderno: la base de datos y la inferencia de IA.
Primero, implementamos el patrón de caché lateral delante de una base de datos relacional en el clúster, descargando el tráfico de lectura intensiva para que pueda reducir o eliminar réplicas de lectura y recuperar esos recursos de Pod. Un solo nodo Valkey absorbe cientos de miles de solicitudes por segundo, ofreciendo lecturas hasta 80 veces más rápidas y un costo hasta un 55 % menor para los datos de acceso frecuente.
Luego, nos centramos en la IA generativa. Creamos una caché semántica con la búsqueda vectorial de Valkey delante de un modelo de lenguaje natural (LLM), de modo que las solicitudes semánticamente similares reutilizan las respuestas almacenadas en caché en lugar de volver a invocar el modelo. Esto reduce el costo de inferencia hasta en un 86 % y la latencia de extremo a extremo hasta en un 88 %.
También explicamos tres maneras de ejecutar Valkey en tu clúster: manifiestos manuales, un gráfico de Helm y el operador de Valkey. Cada decisión se basa en la eficiencia de costos, el rendimiento y la confiabilidad, para que puedas implementar patrones esa misma tarde.
-
7:00 PM - 7:10 PM -05
Bienvenida e Introducción
virtualSPEAKERS -
7:10 PM - 7:50 PM -05
Well-Architected on a Budget: Cutting Database and AI Inference Cost with Valkey on Kubernetes
virtualSPEAKERS -
7:50 PM - 8:00 PM -05
Cierre y Despedida
virtualSPEAKERS