aiexpert
Inicio / Podcast / Ep. 26
26
Episodio 26 · 10 ago 2026 · 16 min · Boletín

La semana en que la economía de la IA agéntica se convirtió en la restricción dominante

La semana en que la economía de la IA agéntica se convirtió en la restricción dominante — quien no optimice memoria, CPU e inferencia va a financiar el roadmap del competidor.

Presentan AlanPresentación AdaPresentación
00:00 -15:35
Descargar MP3 RSS

Transcripción del episodio

El guion que salió al aire, íntegro
Alan

Once dólares y cuarenta y un centavos por gigabyte de DDR5. Precios de 2008.

Ada

La IA quemó veinte años de deflación de memoria en algunos meses. Y el presupuesto de infra que el CTO aprobó en enero ya está reventado.

Alan

Esta es la ai|expert Wire. La semana en que la economía de la IA agéntica se convirtió en la restricción dominante — y quien no optimice memoria, CPU e inferencia va a financiar el roadmap del competidor.

Alan

Tres choques simultáneos de infra esta semana: memoria, CPU y tokens. Ninguno es cíclico. Todos convergen en el mismo punto.

Ada

Y la cuenta no va a esperar al próximo trimestre para llegar.

Alan

Empieza por la memoria. El Stanford DAM Project publicó los números: DDR5 está entre $11,41 y $13,28 por gigabyte — precios que no se veían desde 2008. Counterpoint Research coloca la suba de DRAM en 80 a 90 por ciento solo en el primer trimestre de 2026. Bloomberg reporta una suba de 700 por ciento en el precio spot en el último año. El científico Daniel Lemire lo resumió sin rodeos: "RAM en base unitaria está tan cara como en 2007. No me acuerdo de una anomalía histórica similar." [ref: ram-pricing-crisis-ai-demand-r]

Ada

El mecanismo es directo. Cada chip HBM apila hasta 12 dies de DRAM. La NVIDIA B300 usa ocho de esos chips — 96 dies por placa. Y por cada bit de HBM producido, Micron renuncia a tres bits de DRAM convencional. Samsung, SK Hynix y Micron controlan más del 95 por ciento de la producción global de DRAM, y todas realocaron capacidad hacia HBM de aceleradores de IA. El resultado: los centros de datos consumen ahora 70 por ciento de todos los chips de memoria producidos en el mundo. [ref: ram-pricing-crisis-ai-demand-r]

Alan

La demanda crece a 200 por ciento anual. La producción de memoria crece a 20 por ciento. Ese diferencial no cierra en 2026. SK Hynix vendió toda su capacidad de producción de 2026 en octubre. El CEO de la empresa advirtió en julio: la demanda va a superar la oferta bastante más allá de 2030. Para arquitectos dimensionando clusters de inferencia ahora: traten la asignación de HBM y DDR5 como restricción primaria de planificación. No FLOPS. Memoria.

Alan

El segundo choque es CPU. Amazon, en mayo, ordenó internamente que los ingenieros dejaran de desperdiciar ciclos de CPU. Instancias EC2 que antes llegaban en horas ahora demoran días. Un ingeniero con múltiples años en la empresa declaró a The Information que nunca había esperado tanto tiempo por una instancia de computación. [ref: amazons-cpu-crackdown-agentic-]

Ada

El motivo es estructural. La inferencia tradicional usaba una CPU para cada ocho GPUs — trabajo liviano de tokenización y ruteo. Los workloads agénticos rompen ese modelo completamente. Cada loop de agente — planificar, llamar herramienta, parsear respuesta, re-tokenizar, rutear al siguiente sub-agente — corre casi enteramente en CPU. Un paper de Georgia Tech e Intel midió: el procesamiento de herramientas en CPU representa 50 a 90 por ciento de la latencia total en workloads agénticos. [ref: amazons-cpu-crackdown-agentic-]

Alan

El CFO de Intel, David Zinsner, confirmó en la call de resultados del Q1 2026: la proporción CPU a GPU en los data centers ya pasó de 1:8 a 1:4, y puede converger a 1:1 en deployments agénticos. Analistas de JP Morgan modelaron el ideal en siete CPUs por GPU. Amazon triplicó la cantidad de servidores CPU año a año. Aun así agotó el inventario. [ref: amazons-cpu-crackdown-agentic-]

Ada

SemiAnalysis reportó que Amazon y Microsoft vendieron toda la capacidad de CPU a empresas de IA — incluyendo OpenAI y Anthropic. OpenAI portó toda su base de código a ARM para conseguir acceso a las instancias Graviton de AWS. Los precios de CPU de servidor subieron 20 por ciento desde marzo. Los plazos de entrega para CPUs de alto número de cores llegaron a seis meses.

Alan

El costo compuesto es brutal. Un agente de código interno de la propia Amazon generó 1,8 millones de dólares en costos de tokens en un mes — 860 por ciento por encima del presupuesto de desarrollo. La escasez está concentrada en spot instances. La capacidad reservada y contratada no está en falta. Quien trancó reserved instances antes del Q1 está protegido. Quien está en on-demand está compitiendo por lo que sobra. [ref: amazons-cpu-crackdown-agentic-]

Alan

Tercer choque: la capa de inferencia. OpenAI gastó 5,02 mil millones de dólares en inferencia en Azure solo en la primera mitad de 2025. En junio de 2026, el equipo de ingeniería desarrolló una optimización puramente en software — sin hardware nuevo, sin reformulación arquitectónica — que cortó el costo de inferencia en más de 50 por ciento. [ref: how-openai-keeps-chatgpt-fast-]

Ada

El diseño que viabilizó la ganancia: el harness agéntico en Rust trata todo el historial visible al modelo como append-only. Nuevos mensajes y resultados de herramientas siempre al final, nunca insertados antes. Herramientas en orden determinístico. Políticas de aprobación aplicadas en tiempo de ejecución. El prefijo estable entre turnos maximiza el cache hit rate entre requisiciones. Y el precio de la API codifica el incentivo: GPT-5.2 ofrece 90 por ciento de descuento en tokens de entrada cacheados — $1,75 por millón en el precio estándar. No es elegancia de ingeniería. Es economía aplicada al diseño. [ref: how-openai-keeps-chatgpt-fast-]

Alan

Martin Spier, que lidera performance de ChatGPT en OpenAI, planteó la escala del problema así: si una tarea requiere 30 requisiciones al modelo, un segundo extra por requisición acumula en treinta segundos. Cortar trabajo repetido en toda la cadena importa tanto como acelerar el modelo en aislamiento. Y las métricas estándar de benchmark no capturan la forma de los traces agénticos — multi-turno, cola pesada, intercalados con herramientas.

Ada

Databricks publicó esta semana una guía de gestión de costos para deployments de IA agéntica a escala organizacional, con datos y contribuciones de Stripe, Coinbase, Uber y Ramp. El concepto central es la "frontera de eficiencia" — el conjunto de modelos con mejor costo por unidad de inteligencia, distinto de la frontera de inteligencia bruta que los labs persiguen. Esa frontera se mueve rápido: Stripe probó el Opus 4.7, constató que no mejoraba significativamente sobre Opus 4.6 por el costo mayor, y bloqueó el rollout. Databricks vio regresiones de costo comparando Opus 5.0 con 4.8. [ref: managing-ai-coding-costs-at-sc]

Alan

El resultado directo de ajustar harness y configuraciones de caching: casi 50 por ciento de reducción en tokens generados sin degradación de calidad observada para desarrolladores. El Smart Router del Unity AI Gateway corta el costo promedio por tarea en más de 30 por ciento. El error más común en el presupuesto: hard caps por usuario bloquean a los ingenieros productivos rodando loops agénticos largos, mientras ignoran el desperdicio real — spawns accidentales de múltiples agentes un viernes a la noche, retry loops que multiplican el costo diez veces hasta la mañana siguiente. A la escala de Databricks, 500 a mil ingenieros iban contra límites duros mensuales, inundando el canal interno de Slack con pedidos de desbloqueo. [ref: managing-ai-coding-costs-at-sc]

Ada

El mensaje al CTO es objetivo: si el roadmap de agentes de 2026 no tiene línea de caching, ruteo por complejidad de tarea y planificación de ratio CPU-por-GPU, estás financiando el roadmap del competidor. No es hipérbole. Es el costo compuesto de memoria a precio de 2008, CPU en escasez estructural, y tokens que multiplican en cada hop agéntico.

Alan

Segundo bloque: agentes saliendo de lo artesanal. Tres movimientos esta semana muestran que la infraestructura de agentes está virando a commodity — y el diferencial competitivo migró de capa.

Ada

Quien aún está construyendo con la spec de noviembre del MCP tiene una deuda técnica medible en latencia y costo de infra. Eso no es opinión.

Alan

El 28 de julio de 2026, Google y Hugging Face co-lideraron la publicación de la nueva especificación del MCP bajo la Agentic AI Foundation. Es el cambio arquitectónico más grande del protocolo desde su lanzamiento. El handshake initialize fue removido. El header Mcp-Session-Id fue removido. El protocolo ahora es stateless: cada requisición carga todo lo que el servidor necesita para responderla, sin conexión previa necesaria. Los SDKs de TypeScript y Python cruzaron mil millones de descargas cada uno antes de la publicación. [ref: google-leads-mcp-spec-overhaul]

Ada

El problema anterior era concreto y caro. Tres pods detrás de un load balancer: la segunda requisición de un cliente podía caer en la máquina equivocada y retornar error 400 Session Not Found. Los workarounds: reglas de sticky session que destruían el autoscaling, almacenes Redis agregando una lectura y una escritura en cada tool call, inspección de paquetes en el gateway. Hugging Face midió: una única tool call generaba más de 100 mensajes de protocolo MCP bajo la spec antigua. [ref: google-leads-mcp-spec-overhaul]

Alan

Con la nueva spec: cualquier instancia de servidor responde a cualquier requisición. Los load balancers estándar de round-robin funcionan sin alteración. Los servidores MCP corren como funciones serverless que escalan a cero cuando están ociosos. El GitHub MCP Server ya removió Redis del almacenamiento de sesiones. La motivación de Google: el MCP Toolbox for Databases registró más de 20 millones de tool calls en más de 40 bases de datos en un único mes — los round-trips de Redis y el routing sticky son un ítem de costo visible a esa escala. [ref: google-leads-mcp-spec-overhaul]

Alan

En el campo de aplicación, dos casos de producción muestran dónde está la línea hoy. Spotify lanzó Honk en febrero de 2025 — un agente corriendo sobre Claude Code y la plataforma Fleet Management que genera mil pull requests merged cada diez días, en miles de repositorios, sin ingeniero en el loop hasta que el PR pasa todas las pruebas. Más de 1.500 PRs en producción. Ahorros de 60 a 90 por ciento en el tiempo de migración. El caso fue presentado en QCon London en marzo de 2026. [ref: spotify-deploys-autonomous-codebase-migration-agentcontinuous-refactoring-at-sca]

Ada

Lo que el caso de Spotify revela no es el modelo — es lo que necesita existir antes del modelo. Un catálogo de servicios confiable que mapee ownership de cada componente. CI lo suficientemente riguroso para atrapar errores de IA. Sin esos pre-requisitos, la automatización autónoma a escala de flota no llega al aire con seguridad. Spotify construyó esa fundación desde 2022. El modelo es una capa intercambiable. La infra de gobernanza no. [ref: spotify-deploys-autonomous-codebase-migration-agentcontinuous-refactoring-at-sca]

Alan

Y en SRE, Instacart abrió el código del Blueberry esta semana — un agente de triaje de incidentes nativo de Slack. En abril de 2026: 25 mil passes de diagnóstico en 270 canales, hipótesis de causa raíz en promedio en tres minutos por alerta, diez sub-agentes lanzados en paralelo en cada disparo — uno para conocimiento interno, los demás recolectando deploy history, feature flags, logs de error y barridas de anomalías simultáneamente. [ref: instacart-open-sources-blueberry-an-ai-assistant-for-faster-incident-triage]

Ada

El número que importa: la precisión diagnóstica fue de mediados de los 60 por ciento a la franja de los 90 por ciento después de anclar el sistema con 14 años de historial de incidentes de Instacart. Tasa de éxito de workflow de 99,9 por ciento. 58 mil dispatches de herramientas MCP en un único mes. Blueberry genera hipótesis y evidencia — toda decisión de remediación permanece con el ingeniero. Los equipos sin corpus histórico estructurado van a empezar en los 60. El corpus no es un detalle de implementación — es lo que mueve el indicador. [ref: instacart-open-sources-blueberry-an-ai-assistant-for-faster-incident-triage]

Alan

El diferencial competitivo ya no es "tenemos agentes." Es qué gates, qué protocolo, qué blast radius, qué corpus de historial de incidentes. Eso es lo que separa 90 por ciento de precisión de 62.

Alan

La semana cerró con una cuenta objetiva: memoria más cara que en 2008, CPU en escasez estructural, y tokens que multiplican en cada hop agéntico. Quien vaya a dimensionar esto correctamente no está esperando que el precio baje — está ruteando, cacheando y trancando capacidad reservada ahora. En la Edition del viernes: qué quiere ByteDance con un modelo de diez trillones de parámetros, y por qué el objetivo declarado es Anthropic. Que tengan buena semana.