aiexpert
Inicio / Podcast / Ep. 19
19
Episodio 19 · 26 jun 2026 · 24 min · Edición

La edición en que la capa debajo del modelo se convirtió en noticia

La semana en que la infraestructura debajo del modelo se convirtió en historia: agentes exigen su propio runtime, la memoria heredada subió 60%, y el laboratorio que creó Claude abandonó SQL.

Presentan AlanPresentación AdaPresentación
00:00 -24:01
Descargar MP3 RSS

Transcripción del episodio

El guion que salió al aire, íntegro
Alan

Noventa y cinco por ciento.

Ada

Es la fracción de queries internas de Anthropic que ya corren vía Claude — no vía SQL. Y la empresa que construyó el modelo decidió, en silencio, que el BI tradicional terminó.

Alan

Esta es la Edición 19 de ai|expert. Esta semana, la infraestructura debajo del modelo se convirtió en noticia: agentes exigen su propio runtime, la memoria heredada subió 60%, y el laboratorio que creó Claude abandonó SQL. Pero la historia más importante es qué tienen en común estos tres hechos.

Alan

Existe una creencia persistente en el mercado de que los agentes de IA son un problema de prompt. Que si das las instrucciones correctas, el comportamiento correcto emerge. Grab puso a prueba esa hipótesis en ocho países y 900 ciudades — y construyó un sistema completo para demostrar que está equivocada.

Ada

Palana es la respuesta de Grab. Una plataforma de ejecución nativa de Kubernetes corriendo actualmente cientos de agentes en producción — desde ambientes de desarrollo remoto hasta automatizaciones en Slack, agentes Hermes y workers de OpenClaw. El diseño parte de una premisa radical: trata el agente como hostil por defecto. [ref: grab-builds-secure-agentic-ai-]

Alan

Hostil por diseño. Eso es una frase fuerte.

Ada

Y merece serlo. Cuando un agente puede ejecutar herramientas arbitrarias, llamar APIs externas y escribir código, el modelo de riesgo es completamente diferente del de un servicio sin estado. Grab listó explícitamente las amenazas en alcance: inyección de prompt, secuestro de lógica, comprometimiento de dependencia, escalada de objetivos, exposición de credenciales. Esto no es paranoia — es modelado de amenaza serio para equipos corriendo fintech en producción.

Alan

Y la respuesta arquitectónica central es: todo control de seguridad debe vivir fuera del límite de confianza del agente.

Ada

Cada agente corre en su propio namespace de Kubernetes, con RBAC restrictivo, cuotas de recursos, políticas de red personalizadas y service accounts aisladas. Pero el detalle más elegante es el manejo de credenciales. Tokens de control de versión, claves de API del model gateway — viven en HashiCorp Vault y nunca llegan al contenedor del agente. El agente recibe solo placeholders abstractos. Cuando inicia una llamada externa, un proxy seguro intercepta, valida el destino e intercambia el placeholder por la credencial real. El secreto nunca toca la memoria de ejecución ni los logs del contenedor. [ref: grab-builds-secure-agentic-ai-]

Alan

Eso resuelve un problema que la mayoría de equipos solo descubren en el primer incidente.

Ada

El kill switch sigue la misma filosofía. Pedirle a un agente que se detenga es una feature — no un control de seguridad. Un agente comprometido no puede ser confiable para auto-detenerse. Los kill switches de Palana operan en el control plane: las políticas de red se desactivan directamente fuera del runtime, y un reaper externo maneja shutdowns por idle sin tocar el proceso del agente.

Alan

Lo que me lleva a Cloudflare. Grab resuelve el aislamiento — pero quién maneja qué pasa cuando el paso cuatro de seis falla?

Ada

Esa es exactamente la pregunta de saga rollback. Cloudflare entregó una respuesta elegante el 25 de junio: declaras la lógica de compensación directamente dentro de la definición del step. No en el catch block — en el step en sí. [ref: cloudflares-saga-rollback-patt]

Alan

Cuál es la diferencia práctica?

Ada

El catch block acumula estado. Conforme el workflow evoluciona, el código de compensación se desincroniza del forward path. Con el patrón saga de Cloudflare, el rollback vive junto a la operación que necesita deshacer. Pasas un objeto options a step.do() con la función de rollback. Recibe el output del step forward — pero debe manejar output igual a undefined, porque un proveedor de pagos puede capturar un cargo antes de que la confirmación llegue a Workflows. El step falló, pero la transacción ya fue procesada. El rollback sigue corriendo.

Alan

Y cuando múltiples steps corren en paralelo?

Ada

Se vuelve sutil. Steps secuenciales hacen rollback en orden inverso — simple. Steps paralelos completan en orden impredecible, entonces Cloudflare ordena por tiempo de inicio inverso, no por tiempo de conclusión. Esto hace que la secuencia sea determinística independientemente de qué rama terminó primero. Crítico cuando dos steps paralelos escriben en recursos compartidos que necesitan deshacerse en una secuencia específica.

Alan

El CUGA de IBM añade a este cuadro el patrón fork listo para usar. IBM Research publicó cuga-apps el 23 de junio: 24 aplicaciones FastAPI de un solo archivo, cada una encapsulando un CugaAgent. El framework quedó en primer lugar en AppWorld — 750 tareas reales en 457 APIs — de julio de 2025 a febrero de 2026.

Ada

La API toma cuatro argumentos: model factory, lista de tools, instrucciones especiales y ruta cuga_folder. Llamas await agent.invoke() y el harness maneja el loop de planificación, ejecución, despacho de herramientas, rastreo de estado y un paso de reflexión que detecta tool calls malos y replana sin exponer el fallo al usuario. En una tarea de 20 steps, la mayoría de los harnesses pierden el rastro de resultados intermedios. CUGA los mantiene en un variable manager en la capa de orquestación. [ref: cuga-20-production-agentic-app]

Alan

Lo que me llama la atención es la separación entre costo y código. Los tres modos de razonamiento — Fast, Balanced, Accurate — son claves de config, no cambios de implementación.

Ada

En producción eso importa mucho. La mayoría de los harnesses codifican el tradeoff costo-performance en el código del agente. Cambiarlo exige reescritura. En CUGA es una clave en settings.toml. La galería alojada corre en gpt-oss-120b vía Groq — no en una API frontier — porque los modelos de peso abierto cuestan 80 a 90 por ciento menos que las alternativas cerradas, según IBM misma.

Alan

Y Windows cierra el cuadro. Microsoft entregó el SDK de MXC — Microsoft Execution Containers — en Build 2026 el 2 de junio. Partners de lanzamiento: OpenAI, NVIDIA, Manus, Nous Research y el proyecto open source OpenClaw.

Ada

Cuatro tiers de aislamiento: process isolation para workloads ligeras y sensibles a latencia, session isolation que separa el agente del desktop interactivo y del clipboard del usuario, micro-VMs vía Hyper-V para código de mayor riesgo, y contenedores Linux vía WSL para toolchains de ML. GitHub Copilot CLI ya usa el tier de process isolation para restringir código generado dinámicamente. [ref: windows-platform-security-and-]

Alan

Pero hay una brecha crítica en la versión preview.

Ada

El filtro de red de salida no funciona en la versión actual. Esa es una brecha seria — el comprometimiento de agente típicamente se manifiesta como exfiltración de datos a endpoints del atacante. La propia documentación de Microsoft afirma que los perfiles MXC no deben aún ser tratados como fronteras de seguridad. Los equipos que implantan agentes en ambientes regulados necesitan añadir controles de red explícitos encima de MXC, y tratar el SDK como una primera capa de control, no como un límite de seguridad.

Alan

La tesis que emerge de los cuatro casos es la misma: los equipos que están poniendo agentes en producción dejaron de iterar prompts y comenzaron a diseñar runtime, aislamiento y rollback. El problema cambió de capa.

Alan

Mientras los ingenieros de runtime diseñan sus namespaces y kill switches, hay presión viniendo de abajo que la mayoría de los presupuestos de IA aún no han precificado. DDR2 — tecnología de 23 años — subió 55% a 60% en Q2 de 2026. Y la proyección para Q3 es otro 35% a 40%.

Ada

Los datos vienen de TrendForce, reportados por Tom's Hardware. Y la causa no tiene nada de nostálgico. Samsung, SK Hynix y Micron redirigieron capacidad de wafer hacia HBM y DRAM de servidor para alimentar la infraestructura de IA. Micron declaró una relación de conversión de tres a uno: cada slot de ramp de HBM jubiló tres slots de DDR5. Conforme la DRAM de servidor absorbió la producción de las fabs, el DDR4 se tensionó. Los OEMs y ODMs comenzaron a especificar DDR3. Algunos diseños DDR3 fueron rehecho para usar DDR2. La cascada llegó hasta el fondo de la pila de memoria heredada. [ref: ai-chip-shortage-ripples-backw]

Alan

Y el spot de DDR4 se invirtió — negociando arriba de DDR5, a pesar de ser más lento.

Ada

Eso lo dice todo sobre el estado actual del mercado. La jerarquía normal de precios se rompió. Rick Tsai, CEO de MediaTek, lo puso directamente en ISSCC en febrero: la memoria representa aproximadamente 50 por ciento del BOM total en desarrollo de XPU. El CFO de HP reportó a principios de 2026 que la memoria y almacenamiento subieron de 15 a 18 por ciento del BOM de PC a aproximadamente 35 por ciento.

Alan

Micron solo pudo servir 55% a 60% de la demanda de clientes principales en diciembre de 2025.

Ada

Nueva capacidad significativa de DRAM no llega antes de finales de 2027 en el mejor caso. La nueva fab de Micron en Idaho no estará operacional hasta 2027. Para cualquier stack de inferencia que dependa de equipos de red de larga vida, controladores embarcados o hardware de edge con specs de memoria fijas: el impacto de capex ya está llegando. Audita BOM ahora, no en la renovación del contrato.

Alan

En el otro extremo del espectro, NVIDIA publicó la especificación DSX para la generación Rubin. Refrigeración líquida directa en el chip, con líquido refrigerante a 45 grados Celsius — más caliente que una bañera de agua caliente. Y eso es intencional.

Ada

La mezcla es 75 por ciento agua y 25 por ciento propilenglicol fluyendo a través de cold plates directamente sobre cada procesador. El líquido entra a 45 grados y sale a aproximadamente 55 grados, habiendo extraído la carga térmica de la superficie del die. Porque el trabajo térmico sucede en la fuente, el aire ambiente alrededor no necesita estar frío. La temperatura ambiente se desacopla de los termos del servidor, eliminando el layout de hot-aisle/cold-aisle requerido en instalaciones refrigeradas por aire. El calor va a dry coolers externos — arrays grandes de radiadores — donde es rechazado al aire externo sin pérdida de agua por evaporación. [ref: nvidias-45c-breakthrough-cuts-]

Alan

Qué significa eso para el consumo de agua?

Ada

Los data centers convencionales con torres de enfriamiento consumen aproximadamente 2.6 millones de galones de agua por megavatio por año. El diseño DSX reduce eso a casi cero — hasta 100% de reducción — en climas donde el aire externo puede hacer el trabajo de rechazo de calor sin enfriadores mecánicos. Ali Heydari, director de enfriamiento e infraestructura de data center de NVIDIA:

Alan

"El diseño de referencia DSX tiene consumo cero de agua. Eliminamos enormes cantidades de uso de energía de enfriamiento y prácticamente todo uso de agua."

Ada

Los enfriadores son necesarios solo alrededor del 1% del año en la mayoría de las geografías. Para un operador de 50 megavatios, el ahorro combinado de energía de enfriamiento y agua supera cuatro millones de dólares por año. La generación Rubin está 100% refrigerada por líquido — cada chip, cada componente de red, cero ventiladores en ningún lugar del sistema. Lo que significa que cualquier proveedor de cloud construyendo sobre ella no tiene opción: la transición a refrigeración líquida es obligatoria.

Alan

Hay un detalle operacional que los equipos en climas cálidos no pueden ignorar.

Ada

En regiones donde la temperatura del aire externo es persistentemente alta, la estimación de 1% de uso de enfriadores se extiende. Los operadores en climas cálidos necesitan modelar perfiles locales de bulbo húmedo antes de remover la infraestructura de enfriamiento mecánico. El diseño de referencia DSX es un blueprint, no una garantía universal.

Alan

Apple fue en la dirección opuesta. Mientras NVIDIA densifica el cluster, Apple tira el modelo hacia dentro del dispositivo. Core AI fue anunciado en WWDC 2026 — el reemplazo oficial de Core ML.

Ada

El framework corre modelos de 3 mil millones a 70 mil millones de parámetros completamente en el dispositivo, en iPhone, iPad, Mac y Apple Vision Pro, con cero dependencias de servidor y cero costo por token. Es el mismo runtime que Apple usa internamente para Apple Intelligence, ahora expuesto a desarrolladores terceros. La API de Swift es memory-safe y zero-copy. Compilación ahead-of-time compila los modelos una vez y los carga casi instantáneamente en las ejecuciones posteriores. [ref: apple-core-ai-framework-pushes]

Alan

El SAM3 es la prueba de concepto más concreta.

Ada

850 millones de parámetros, cuantización int4 simétrica por canal, 3 gigabytes reducidos a 430 megabytes — 86% de reducción de tamaño, con "pérdida mínima de precisión" según los docs de Apple. Los equipos deben validar esa afirmación en sus propios eval sets antes de ir a producción. El AFM Core Advanced de Apple — su propio foundation model — es un MoE disperso de 20 mil millones de parámetros que activa solo 1 a 4 mil millones por inferencia, siguiendo una arquitectura de tipo DeepSeek. Y el demo del techo: un modelo de 1 billón de parámetros — Kimi 2.6 — corriendo distribuido en cuatro Mac Studios vía red macOS Tahoe 26.2. Prueba de concepto, no configuración de producción. Pero señala hacia dónde Apple quiere llegar con orquestación multi-dispositivo.

Alan

Core AI llega en beta de Xcode 27 ahora, con lanzamiento de producción dirigido para otoño de 2026. Hugging Face cierra el bloque democratizando acceso a inferencia de peso abierto.

Ada

Un comando. hf jobs run. GPU a10g-large, un dólar y cincuenta centavos por hora, facturado por minuto de uso de hardware. El servidor habla la API OpenAI Chat Completions, asegurado por token HF — privado por defecto. El demo más ambicioso: Qwen 3.5-122B en un flavor de dual-H200 con tensor-parallel-size 2. La ventana de contexto estándar de Qwen 3.5-122B es de 256 mil tokens, que agota la VRAM en configuraciones vLLM por defecto — necesitas limitar max-model-len y max-num-seqs antes de escalar el flavor. [ref: hugging-face-and-vllm-partner-]

Alan

Para equipos corriendo evals y generación en lote, esto quita el contrato de infraestructura de la ecuación.

Ada

Y la lectura que queda de este bloque completo: el capex de inferencia se está partiendo en dos extremos. Edge barato — un dólar cincuenta por hora o costo cero en dispositivo Apple. Cluster ultadenso — Rubin 100% líquido, rack al límite de densidad. Y la memoria heredada está comiendo el margen en el medio, sin alivio de capacidad hasta 2027.

Alan

Volvemos al número que abrió el programa. Noventa y cinco por ciento de las queries de analytics de Anthropic corriendo vía Claude. Lo que el equipo publicó en junio es el anti-hype más útil que he leído en semanas — porque comienza con el fracaso.

Ada

Un LLM crudo apuntado a un data warehouse responde correctamente 21% de las preguntas de analytics. Ese es el número de partida. El equipo de Anthropic identificó tres clases de fallo. Ambigüedad concepto-entidad: el término "revenue" mapea a 40 tablas plausibles en su warehouse — la palabra en sí no resuelve el dato. Staleness: las definiciones de métricas cambian diariamente, y la documentación que era 95% precisa al lanzamiento cayó a 65% en un único mes cuando el mantenimiento fue deprioritizado. Y fallo de recuperación: el dato correcto existe, pero en un warehouse de un millón de campos el agente lo pasa por alto. [ref: anthropics-95-claude-analytics]

Alan

Su solución no fue más prompt engineering. Fue data engineering.

Ada

Cuatro capas: cimientos de datos con modelado dimensional y testing shift-left; una capa de sources-of-truth con definiciones canónicas de métricas y un grafo de conocimiento de la empresa indexando docs, roadmaps y decision logs; una capa de skills — carpetas markdown que Claude lee bajo demanda, con aproximadamente 30 archivos de referencia por dominio describiendo tablas, columnas, joins y gotchas antes de que se escriba SQL; y una capa de validación con suites de eval en CI y revisión adversarial de cada respuesta.

Alan

La revisión adversarial es el tradeoff que todo arquitecto necesita precificar explícitamente.

Ada

Seis por ciento de ganancia de precisión. 32 por ciento más tokens. 72 por ciento de aumento de latencia. Ese es el costo real de cada punto porcentual arriba de 95%. Y el riesgo más crítico no es el modelo — es skill decay. La precisión cayó de 95% a 65% en un único mes cuando los archivos de skill se desincronizaron de los cambios de schema. La solución: pon los archivos markdown de skill en el mismo repo que tus modelos de transformación dbt. El PR que cambia un modelo es el mismo PR que actualiza el skill. Noventa por ciento de los PRs de modelo de datos ahora incluyen un cambio de skill en el mismo diff. [ref: anthropics-95-claude-analytics]

Alan

Aquí yo y Ada discrepamos. Crees que este resultado se generaliza a otros equipos?

Ada

No automáticamente. Anthropic está describiendo qué funcionó con su propio modelo, sus propios datos, y un equipo que trató el mantenimiento de skills como disciplina de ingeniería continua. Un error de 5% es inaceptable para reporting business-critical en muchos contextos — analytics financiero, compliance, métricas de SLA. Esto no es un blueprint que hagas fork y depliegues.

Alan

Estoy de acuerdo en el riesgo operacional. Pero el argumento contrario tiene igual fuerza: donde 100% de precisión es requerida, lo que Meta acaba de demostrar es que las reglas determinísticas ganan sobre inferencia — con menor costo y más auditabilidad.

Ada

Meta publicó un case study de la infraestructura de clasificación de activos que alimenta su stack de privacidad. La línea central es directa.

Alan

"El LLM no toma la decisión de producción en el caso común. Las reglas determinísticas lo hacen."

Ada

Meta usa LLMs en los extremos — cold-start de clasificación, interpretación semántica desde contexto de código y documentación, razonamiento de política para casos que no coinciden con patrones conocidos. Las reglas determinísticas manejan el volumen de producción porque son de baja latencia, repetibles y auditables. Y conforme los patrones se estabilizan, las decisiones del LLM se destiilan en reglas versionadas aprobadas por humanos. [ref: privacy-aware-infrastructure-i]

Alan

El concepto de evidence brief es lo que transforma el proceso.

Ada

Antes de llamar a un LLM, el sistema arma un "evidence brief" — señales de apoyo, señales contradictorias, metadatos de proveniencia y resolución de código. La resolución de código rastrea la fuente real de runtime de un valor de campo. Si el campo `age` en un pipeline de cache viene de un objeto de config de TTL, no de un perfil de usuario, ese rastreo elimina una clase completa de falsos positivos. Horas de optimización de prompt produjeron ganancias marginales cuando el modelo razonaba sobre campos crudos y ruidosos. La corrección fue estructural — no era problema de prompt.

Alan

Y revisión humana en dos puertas específicas. No en todo — en dos puntos donde el riesgo es más alto.

Ada

Adjudicación de los rótulos de referencia y aprobación de promociones de reglas. Una regla nueva que expande o contrae el alcance de protección de datos requiere aprobación humana. El resto es automático. Es lo opuesto de "humano en el loop en todo" — es concentrar accountability donde la consecuencia es real.

Alan

Lo que cierra el bloque es Genesis Workbench — donde el LLM como interfaz de datos encuentra ciencia regulada, con las restricciones más rígidas del mundo.

Ada

Databricks y NVIDIA hicieron open-source Genesis Workbench: un stack de referencia modular que conecta modelos de biología acelerados por GPU directamente a la plataforma Databricks para descubrimiento computacional de fármacos. Genómica, análisis de células individuales, diseño de moléculas grandes, docking de moléculas pequeñas y fine-tuning — cada uno como módulo independiente y desplegable separadamente. Una UI React point-and-click para que científicos de laboratorio corran pipelines completos sin escribir código. Un único script para desplegar el ambiente completo. [ref: genesis-workbench-databricks-n]

Alan

Los números de producción vienen de TetraScience, en despliegue en una farmacéutica top-20.

Ada

Predicciones de binding con 94% de precisión en 30 minutos. Compara eso con 48 horas con aproximadamente 50% de precisión usando software estándar de proveedor. La calidad de candidatos mejoró de 25% a 50%. La identificación de leads aceleró hasta 50%. Desarrollo de línea celular — normalmente de seis a ocho meses — cayó a 2.5 meses usando NVIDIA VISTA-2D y Geneformer en BioNeMo. Estos son números de una configuración específica en un sitio específico — pero establecen el techo de lo que el stack logra cuando la gobernanza de datos está apretada.

Alan

Y el punto arquitectónico central: cero llamadas de API externas en runtime.

Ada

Secuencias, bibliotecas de compuestos y resultados de ensayo nunca salen del perímetro gobernado. Unity Catalog maneja control de acceso y auditoría. MLflow rastrea cada artefacto de modelo. GPU Model Serving ejecuta inferencia dentro del propio workspace del cliente. Adoptar un modelo más nuevo — GenMol, Protein-Complex — es un paso de despliegue, no una reescritura, porque cada modelo es un submódulo independiente en el mismo substrato de registry y serving. Y Genesis Workbench expone todo como MCP tools — cualquier cliente compatible con MCP, incluyendo Claude, puede llamar los modelos y workflows como herramientas.

Alan

La pregunta que los tres casos en este bloque fuerzan en cualquier arquitecto: dónde es el LLM la interfaz correcta, y dónde es overkill — caro y no auditable?

Ada

La respuesta que emerge no es "LLM o no LLM." Es un triage. LLMs donde la ambigüedad semántica es el problema real y el contexto estructurado no lo resuelve solo. Reglas determinísticas donde latencia, auditabilidad y repetibilidad son no-negociables. Y un camino claro para destilar las decisiones del LLM en reglas conforme los patrones se estabilizan — con aprobación humana en promociones que cambian alcance de protección. Genesis Workbench es la respuesta para verticales reguladas que necesitan el modelo pero no pueden enviar datos propietarios fuera del perímetro. Meta es la respuesta para escala. Anthropic es el blueprint para equipos dispuestos a tratar el mantenimiento de contexto como disciplina de ingeniería permanente, no configuración inicial.

Alan

La semana que pasa deja una pregunta simple con una respuesta difícil: cuál es la capa debajo del modelo que aún no has dibujado? Runtime de aislamiento, memoria heredada en el BOM, gobernanza de skills, reglas que reemplazan inferencia — todo era invisible hace seis meses. La próxima semana en el Wire: la apuesta de 110 mil millones de dólares de Reliance Jio para poner IA dentro de cada llamada telefónica en India. Buen trabajo.