La semana en que los agentes se convirtieron en una disciplina de ingeniería medible—y el silicio bajo ellos dejó de ser monopolio.
Ochenta y ocho por ciento.
Esa es la proporción de proyectos de agentes de IA que nunca llegan a producción. No proyectos que decepcionan. Proyectos que se abandonan antes de que un usuario real interactúe con ellos.
Esta es la Edición 22 de ai|expert. La semana en que los agentes se convirtieron en una disciplina de ingeniería medible—y el silicio bajo ellos dejó de ser monopolio.
Comenzamos con el problema que dominó la semana en investigación: el gap entre benchmark y producción en sistemas agénticos no es editorial—es estructural. Y dos papers y un lanzamiento de framework intentaron cerrar ese gap al mismo tiempo, desde ángulos completamente diferentes.
LangChain abrió el juego el miércoles. Publicaron Harbor como código abierto—un runner de evaluación que cambia la comparación de texto por inspección de estado real. El agente manipula un ambiente Docker definido por Dockerfile o Compose. Un script test.sh verifica artefatos y efectos secundarios de API. La pregunta deja de ser "¿la respuesta parece correcta?" y pasa a ser "¿el filesystem cambió de la forma correcta?" Eso cambia fundamentalmente qué cuenta como aprobación. [ref: langchains-agent-benchmarking-]
Los números son densos. El Harbor-Index tiene ochenta y dos tasks destilados de más de seis mil candidatos en cincuenta y cuatro benchmarks—cubriendo ingeniería de software, investigación, análisis de datos, y uso de herramientas de largo horizonte. El τ³-bench contribuye con treinta tasks multi-turno con usuario simulado, donde el scoring valida resultados reales y no coherencia superficial de diálogo. El ContextBench añade treinta tasks de recuperación, cada uno con corpus completo enviado dentro del sandbox, forzando al agente a localizar y combinar información en lugar de depender del conocimiento paramétrico o de una base de datos de vectores externa. [ref: langchains-agent-benchmarking-]
La arquitectura en dos capas es lo que torna la operación viable. El subset "lite" corre ocho veces más rápido y seis veces más barato que la suite completa. Commits diarios pasan por lite. Decisiones de release pasan por completo. No es novedad teórica—fue esa separación la que capturó la regresión cuando LangChain removió el middleware de to-do-list y comprimió el system prompt en Deep Agents 0.7. El benchmark detectó el problema antes del release. Ese es el caso de uso que justifica todo el overhead de infraestructura.
El overhead es real y necesita ser presupuestado. LangChain no publicó latencia por task, costo en dólares por sesión, o consumo de GPU para la suite completa. Cada nuevo task requiere Dockerfile, script de test, y setup de ambiente determinístico. El costo de integración es sustancialmente mayor que un eval de prompt. Y lo que fue publicado es ingeniería de release interna de LangChain—no evidencia de adopción en producción por clientes externos. Los arquitectos deben buscar curvas de costo y tasas de regresión a escala de cliente antes de importar la stack.
Estoy de acuerdo con la salvedad, pero no disminuyo el estándar. La separación entre suite rápido para commits y suite pesado para release gates es lo que falta en la mayoría de los equipos que operan agentes hoy. O no evalúan, o evalúan todo con el mismo peso. Ese es el déficit operacional.
Y el KDD '26 llegó con el diagnóstico del otro lado del mismo problema. Un tutorial de Grace Hui Yang y colaboradores de Bloomberg, Bayer, Salesforce AI Research y Microsoft Research—cuatro organizaciones con experiencia directa de producción—mapeó en detalle los modos de falha que los leaderboards estáticos no capturan. [ref: agents-in-the-wild-bridging-th]
Los números que anclan el argumento: ochenta y ocho por ciento de los proyectos de agentes nunca llegan a producción, según CIO Research 2025. Gartner proyecta que más del cuarenta por ciento de los restantes serán cancelados antes de 2027. Los modos de falha nombrados por el tutorial—corrupción silenciosa de llamadas de herramienta, errores en cascada en grafos de agentes, loops de retry que consumen budget mientras parecen exitosos—son exactamente los que tests de output final no detectan. Un argumento de herramienta corrompido en el paso dos puede envenenar todos los pasos siguientes silenciosamente. [ref: agents-in-the-wild-bridging-th]
El detalle operacional que el tutorial añade es observabilidad cross-agente. El OpenTelemetry GenAI semconv llegó al status estable en semconv 1.29+. Pero rastrear estado entre agentes en un grafo multi-agente sigue siendo un problema de ingeniería no resuelto dentro de presupuestos industriales de latencia y compute. Y la coordinación multi-agente introduce modos de falha que sistemas monolíticos evitan completamente: deadlocks entre agentes colaborando, overhead de sincronización de estado, y ausencia de protocolos seguros de comunicación inter-agente.
Hay una heurística operacional aquí que Zylos.ai documentó con números concretos. Un agente de código puede consumir dos dólares de llamadas de API en un buen día y cuarenta dólares en un mal día atrapado en un loop de retry. Cualquier sesión costando más de cinco veces la mediana del tipo de feature se convierte en incidente de corrección—no de facturación. Por encima de cincuenta veces la mediana es loop descontrolado. Costo como señal de corrección es el segundo lente que falta en la mayoría de los equipos.
La conclusión combinada de ambos papers: evaluación basada en estado de artefacto, costo de sesión como señal de corrección, y rastreo cross-agente por semconv estable. Tres contribuciones prácticas de la semana para quienquiera que opere agentes en producción hoy.
La tercera pieza de investigación de esta semana va en la dirección opuesta. No es sobre medir el comportamiento externo del agente—es sobre confiar en lo que el modelo dice sobre sí mismo. Sobre interpretabilidad como fundación para seguridad.
Y la respuesta del paper es directa: no confíes aún. Un paper de Hiskias Dingeto auditó el Natural Language Autoencoder de Anthropic para el Qwen-2.5-7B—el checkpoint de capa veinte disponible en HuggingFace, fine-tuned a partir del Qwen-2.5-7B-Instruct. El resultado: aproximadamente dos por ciento de las afirmaciones específicas en las explicaciones están genuinamente ancladas en activación. El resto—aproximadamente noventa y ocho por ciento—sobrevive rastreando el gist general de la entrada sin llevar hechos verificables. La explicación parece fiel. No lo es. [ref: activation-explanations-fail-f]
Y el modo de falha no es un edge case raro. En tests sintéticos con ground truth exacto, la receta de entrenamiento estándar produjo lo que el paper llama "códigos privados"—lenguaje falso que el reconstructor aprendió a depender—en cinco de cinco ejecuciones. Falso por construcción, con scores altos de reconstrucción.
El problema es estructural en el objetivo. El objetivo de reconstrucción recompensa suficiencia: la explicación necesita contener suficiente información para regenerar la activación. Pero el objetivo no penaliza adiciones falsas. Eso es válido independiente de escala o modelo. La insensibilidad proviene del objetivo en sí.
El paper propone RECAP—Readable Encodings via Co-trained Auxiliary Predictors. Cabezas lineales entrenadas junto al modelo mantienen contenido designado decodificable. Un probe entrenado con RECAP alcanza AUC de cero punto noventa y seis al distinguir afirmaciones verdaderas de falsas—contra cero punto ochenta y dos del baseline. Bajo edición adversarial diseñada para suprimir el ochenta y siete por ciento de la penalidad de mentira mientras preserva el score de reconstrucción, el probe RECAP aún detecta engaño con AUC cero punto noventa y cinco.
El probe de control, en esa misma condición adversarial, colapsa a cero punto cincuenta y uno—indistinguible del azar. El costo del RECAP: más cero punto cero cero uno nats de entrenamiento. Técnicamente barato. Pero con una restricción operacional crítica: RECAP requiere co-entrenamiento durante el entrenamiento inicial. No puede ser añadido a pesos ya publicados—incluyendo el checkpoint público del Qwen-2.5-7B NLA que está en uso ahora. [ref: activation-explanations-fail-f]
Cualquier equipo usando explicaciones de activación hoy para auditar vectores de steering o probes de concepto está limitado a protocolos de auditoría post-hoc. Que son pasos diagnósticos manuales—no filtros automatizados.
Y hay una implicación que atraviesa todos los tres bloques de investigación de esta semana. Estamos construyendo evaluaciones de agentes sobre stacks de interpretabilidad que, por este paper, pueden darnos afirmaciones plausibles y falsas al mismo tiempo. Pérdida de reconstrucción sola no es gate suficiente de fidelidad. Cualquier capa de seguridad construida sobre verbalizadores de activación necesita verificación por afirmación—no solo similaridad vectorial.
Medir es necesario. Pero el instrumento de medición también puede mentir.
Mientras el lado de software renegociaba sus contratos con la realidad, el lado de hardware renegociaba su contrato con NVIDIA. Y esa renegociación tiene números.
El DAC 2026 fue el punto de medición de esta semana para el lado de compute. Las submisiones crecieron más del veintiséis por ciento año a año en ambos tracks—Research e Engineering. Cuarenta por ciento del programa técnico enfocado en IA y diseño de chips. Pero el número que importa es de proyección: los embarques de ASICs customizados crecerán a cuarenta y cuatro punto seis por ciento CAGR en 2026, más del doble del dieciséis punto uno por ciento para GPUs merchant. La participación de NVIDIA en aceleradores de inferencia específicos del dominio—donde dos tercios de todo el compute de IA está concentrado—debe caer de más del noventa por ciento hoy a veinte a treinta por ciento antes de 2028. [ref: diy-ai-chips-enterprises-desig]
El Engineering Track del DAC—que solo acepta resultados en producción, no prototipos de investigación—es donde está la sustancia. Samsung presentó un ambiente de emulación pre-silicon usando Deep Q-Networks con enhancements dueling y double-DQN y replay de experiencia priorizado, para optimizar parámetros de QoS de SoC en throughput, latencia, y potencia. Eliminando tuning manual de arbitraje y asignación de banda. Eso es RL aplicado al diseño de hardware, no a generación de texto.
IBM presentó dos papers que merecen atención separada. El primero: flujos de verificación agéntica usando servidores MCP para ingerir especificaciones de diseño, HDL, waveforms, y bases de cobertura—con reducción estimada del quince al cuarenta por ciento en esfuerzo manual de triage de falhas en verificación de hardware IBM Z. El segundo paper es el más dramático operacionalmente: un framework MCP que genera utilidades EDA a partir de especificaciones del usuario usando bloques MCP reutilizables, reduciendo el desarrollo de una herramienta de verificación estructural de cuatro person-weeks estimadas a menos de treinta minutos. [ref: diy-ai-chips-enterprises-desig]
Cuatro person-weeks a treinta minutos no es aceleración incremental. Es una categoría diferente de impacto—y es en un dominio donde los ciclos de diseño cuestan millones y los errores de verificación cuestan tape-outs enteros.
Y eso tiene validación externa al DAC. Midjourney migró inferencia de GPUs NVIDIA a TPUs Google, reduciendo costos mensuales de compute de dos punto uno millones de dólares a setecientos mil dólares—una reducción del sesenta y cinco por ciento. Morgan Stanley estima que Amazon embarcará un punto cinco millones de chips Trainium en 2026. XPUs—aceleradores customizados—deben liderar el crecimiento de gastos en data center en 2026 con veintidós por ciento, superando a GPUs en diecinueve por ciento.
Pero el DAC también expuso el fricción real que esta transición carga. TSMC está operando el nodo de tres nanómetros con cien por ciento de capacidad, con demanda tres veces la oferta actual. Los sustratos físicos para el silicon customizado ya están en escasez estructural. Y la ventaja de costo del cuarenta a sesenta y cinco por ciento de los ASICs—atractiva en escala de hyperscaler corriendo billones de queries por día—se ve muy diferente para una empresa corriendo decenas de miles de queries por semana. El break-even requiere volumen sustancial de inferencia.
Y hay la dinámica que un observador del DAC nombró como miopía colectiva. Samsung, NVIDIA, Meta, y OpenAI están cada una construyendo capas similares de IA en cima de motores EDA licenciados—efectivo y miope al mismo tiempo. Cada gigante reconstruye la misma tubería en privado. Las lecciones no se propagan entre ellas.
El socio más improbable de la semana fue Cerebras y AMD.
Inferencia disaggregada: AMD Helios, con EPYC e Instinct MI400, procesa prompts y prefill de alto throughput. El Wafer Scale Engine de Cerebras se encarga de la generación de tokens, donde el ancho de banda de memoria es el cuello de botella dominante. La afirmación de las dos compañías: cinco veces más tokens por segundo por watt que enfoques competidores. Disponible en Cerebras Cloud en el segundo semestre de 2026. [ref: cerebras-amd-partnership-signa]
Con la salvedad obligatoria: este benchmark proviene de AMD Performance Labs y Cerebras, modelamiento interno de julio de 2026. Sin validación independiente, sin MLPerf, sin trazas de producción en vivo. Latencia absoluta, comportamiento de tail p99, costo por millón de tokens—no publicados. Y el interconnect entre los dos dominios de silicon—protocolo, banda, y topología física para transferencia de estado KV-cache—aún no ha sido divulgado. Ese es el unknown que define si la arquitectura funciona en la práctica.
El contexto estratégico es real independiente del benchmark. NVIDIA adquirió assets de Groq por veinte billones de dólares en diciembre para tecnología de baja latencia. Cerebras tiene un deal separado con OpenAI de más de diez billones de dólares para entregar setecientos cincuenta megawatts de compute antes de 2028. La asociación con AMD es la tercera apuesta de Cerebras en un mercado de inferencia que claramente se está reestructurando fuera del monopolio NVIDIA. [ref: cerebras-amd-partnership-signa]
Quienquiera que apueste a la arquitectura Cerebras-AMD hoy está apostando al interconnect que nadie ha descrito aún. El patrón—prefill en GPU denso, decode en Wafer Scale Engine—tiene lógica arquitectural. El costo real por query no.
El silicon se está fragmentando. La regulación está intentando controlar por dónde los fragmentos pueden fluir.
El decreto ejecutivo de veinte de julio, con vigencia a partir del primero de enero de 2027, elimina exenciones de cadena de suministro para semiconductores provenientes de naciones adversarias en contratos de defensa. La tarifa del veinticinco por ciento de la Sección 232 sobre chips de IA avanzados importados es el impacto inmediato de costo. Y las potenciales restricciones de exportación de dos años para el silicon Blackwell de NVIDIA a naciones adversarias componen la presión en cualquier equipo de IA enfocado en defensa. [ref: us-defense-supply-chain-order-]
El requerimiento operacional es específico y oneroso. Contratistas primarios y subcontratistas en todos los niveles deben mapear cadenas de suministro críticas desde materias primas hasta productos finales—un "Bill of Materials indentured" que vincula dependencias de software y firmware a componentes físicos, fabricantes, y países de origen. Riesgos significativos reportados en quince días. Planes de acción correctivos confidenciales, en cuarenta y cinco días.
El Departamento de Defensa tiene ciento ochenta días para desarrollar la política de mapeo y noventa días adicionales para promulgar regulaciones. Pero los contratistas ya deben rastrear acceso administrativo, hosting de datos, ubicaciones de desarrollo, y propiedad beneficiaria ahora—no en 2027. La ventana de preparación es menor de lo que parece.
El NDAA de 2026 bane "Covered AI" de contratos de defensa e inteligencia—primordialmente DeepSeek y su parent High Flyer, más cualquier modelo desarrollado por entidades con veinte por ciento o más de propiedad indirecta de esas fuentes o de China, Rusia, Irán, o Corea del Norte. Subcontratistas deben certificar compliance como condición de contrato, con exposición a sanciones de la False Claims Act por submisiones imprecisas. [ref: us-defense-supply-chain-order-]
Y aquí está el detalle que la mayoría de los equipos van a descubrir tarde: la definición de cadena de suministro crítica incluye proveedores de cloud, proveedores de servicios gerenciados, y desarrolladores de software. Capas de abstracción multi-cloud son superficie de compliance directo. Cada cluster de GPUs y archivo de pesos de modelo debe ser tratado como item de Bill of Materials desde la primera orden de compra.
Probar proveniencia por cuatro niveles de subcontratista bajo escrutinio de la False Claims Act no es un problema que se resuelve después del deploy. El Departamento de Defensa también fue instruido a usar IA para analizar las submisiones de los contratistas e identificar puntos únicos de falha—lo que torna los propios mapas de cadena de suministro en una superficie de ataque de alto valor.
La política está siendo usada para resolver un problema de hardware. Y el hardware está siendo rediseñado para escapar de la política. Ambos movimientos están ocurriendo al mismo tiempo.
Para cerrar, tres casos donde la semana salió del paper y entró en producción real. Comenzamos con Anthropic auditando su propia operación.
Claude Tag—el agente de código integrado al Slack de Anthropic—cierra sesenta y cinco por ciento de los pull requests de ingeniería de producto del equipo de Claude Code. En paralelo, el system prompt de Claude Code fue reducido en ochenta por ciento. Estos dos números juntos son la señal más clara hasta ahora de que los modelos de frontera requieren menos scaffolding—no más. [ref: claude-tag-closes-65-of-anthro]
El mecanismo fue detallado en un fireside chat transcrito por Simon Willison, con los ingenieros Cat Wu y Thariq Shihipar. Claude Tag corre en modo "auto"—sin aprobación humana para cada tool call—en canales públicos del Slack de Anthropic, generando diffs abiertamente y automatizando revisión de código para las capas externas del producto. Revisión humana reservada para cambios críticos. Lo que no fue publicado: los criterios exactos que distinguen cambio rutinario de cambio crítico.
La inversión de paradigma más importante no es en cantidad de PRs—es en los prompts. En modelos como Fable 5 y Opus 4.8, añadir ejemplos al system prompt ahora degrada la calidad. Las listas de "no hagas X, no hagas Y" también. La receta que estabilizaba modelos antiguos ahora perjudica activamente a los nuevos. Cualquier sistema en producción estabilizado por prompting de few-shot y listas de restricciones enfrentará una re-arquitectura de ruptura al migrar a esta generación de modelos.
La timeline de idea a producción se comprimió de seis a doce meses a alrededor de una semana. Lo que llaman internamente "ant fooding"—testear features en empleados antes de cualquier rollout externo—es la retención interna como gate de lanzamiento. Features que no ganan tracción internamente no llegan al rollout amplio.
Thariq Shihipar invirtió el Mythical Man-Month: rewrites son ahora el enfoque correcto. Una suite de tests disciplinada torna el rewrite más seguro que preservar código legado cuando el codebase es el único documento de especificación. Y fue el benchmark—no la intuición del ingeniero—lo que justificó deletear el scaffolding legado en 0.7. [ref: claude-tag-closes-65-of-anthro]
Con la salvedad de proveniencia de datos: sesenta y cinco por ciento proviene del equipo que construyó la herramienta. No de otros equipos de Anthropic. No de compañías externas. Inferencia económica, burn rate de GPU, tasa de PRs que requirieron enmienda humana después del merge—no publicados.
El segundo caso es la FDA.
En dos meses de lanzamiento, ELSA—la plataforma interna de IA generativa de la FDA—pasó de menos del uno por ciento a ochenta y cinco por ciento de adopción diaria entre los dieciséis mil empleados de la agencia. La capa de datos subyacente, Halo, procesa aproximadamente un petabyte de documentos y cientos de gigabytes por día de cincuenta a sesenta fuentes de todos los ocho centros de la FDA en una single stack Databricks con Unity Catalog aplicando controles de acceso a nivel de tabla. [ref: fdas-ai-platform-achieves-85-d]
Lo que tornou esta adopción posible fue lo que pasó antes. El CDER—el centro de medicamentos de la FDA—gastó cinco años validando la fundación Databricks antes de que los otros siete centros siguieran. La adopción en dos meses vino después de que la fundación estuviera probada. No lo contrario. Esa es la lección de secuenciamiento que la mayoría de los casos de adopción rápida omiten.
El resultado operacional más concreto: revisores de aplicaciones de drogas ahora consultan tres a cuatro millones de páginas de registros de materiales iniciales en aproximadamente tres minutos. La misma tarea tomaba días antes de la consolidación. Compartición de datos entre centros que tomaba cuatro a cinco días fue reemplazada por streaming en tiempo real. Y los empleados construyen cientos de nuevos agentes por semana vía servidores MCP en cima del Unity Catalog—sin escribir queries. [ref: fdas-ai-platform-achieves-85-d]
Lo que la FDA no divulgó es crítico para cualquier arquitecto que quiera usar este caso como referencia: latencia de inferencia, costo por token, horas de GPU, los modelos base específicos que alimentan el ELSA, y—más importante—el harness de evaluación, detección de alucinación, o protocolos de red-teaming para una plataforma influyendo decisiones regulatorias pre-mercado de drogas.
En un ambiente donde la extracción de datos corrompida puede distorsionar una revisión de medicamento, la ausencia de protocolos publicados de human-in-the-loop no es una brecha de comunicación—es riesgo real. La FDA migró de chatbots aislados a una fábrica de agentes unificada. El stack de evaluación que justifica esa confianza permanece no divulgado. Antes de citar la FDA como referencia de adopción, un arquitecto en industria regulada debe hacer exactamente esa pregunta.
Y el tercer caso cierra el ciclo entre hardware y aplicación real.
Bristol Myers Squibb está implantando ocho sistemas DGX Vera Rubin NVL72 en un segundo DGX SuperPOD—la primera compañía de ciencias de la vida en adquirir silicon Vera Rubin en escala. La afirmación de eficiencia es diez veces más performance por megawatt sobre el cluster anterior. El cluster anterior ya estaba saturado—en producción con predicciones de larga escala para moléculas grandes y construcción de modelos fundacionales propios. [ref: bristol-myers-squibb-builds-ai]
El impacto clínico es el número que anclamos. Robert Plenge de BMS indica que herramientas de IA ya han reducido el tiempo necesario para producir medicamentos para tests clínicos en veinte a treinta por ciento—con expectativa de llegar al cincuenta por ciento. El throughput de screening de candidatos creció de aproximadamente diez a decenas de compuestos. Y un candidato para enfermedad de células falciformes está en tests iniciales producido con esta metodología.
El patrón transferible se llama "Predict First". Inferencia barata filtra candidatos antes de síntesis cara en laboratorio mojado. Investigadores someten jobs en lenguaje natural—identificación de blancos, ranqueamiento de moléculas por optimización multi-parámetro—antes de cualquier validación física. El patrón es aplicable en cualquier dominio regulado donde validación física es el costo dominante. No es específico de pharma. [ref: bristol-myers-squibb-builds-ai]
Lo que falta en el modelo publicado: BMS no divulgó profundidad de fila, políticas de preemción, o distribuciones de latencia para el dispatcher de jobs en lenguaje natural. La integración de un single data plane—rompiendo restricciones de sitios de adquisiciones anteriores—es una migración que típicamente cuesta más que el hardware en sí. Y el método de gating "Predict First" no tiene harness de evaluación público, dejando la tasa de falsos negativos en compuestos viables como incógnita.
BMS opera en dominio de compliance que torna esos detalles improbables de ser publicados. Pero el principio "Predict First"—compute barato como gate antes de validación física cara—es el patrón que sale de este caso y entra en tu arquitectura.
Cinco capas, un movimiento. Mide el agente por el estado que deja en el mundo, no por el texto que produce. Cuestiona lo que el modelo dice sobre sí mismo antes de construir seguridad en cima de eso. Elige el silicon correcto sin quedar atrapado en un único proveedor. Opera dentro de una regulación que trata clusters de GPU como items de bill of materials con proveniencia rastreable. Y entrega resultados en producción en dominios donde el costo del error es clínico. La edición vuelve el viernes. Buen trabajo.