Los proveedores redujeron precios, los desarrolladores aprendieron a reducir tokens, y Uber recordó a todos que el ROI de IA sigue siendo más frágil de lo que el hype sugiere—todo en una misma semana.
Cuatro meses.
Fue el tiempo que le tomó a Uber quemar el presupuesto completo de IA de 2026. Y el CEO lo admitió públicamente: nadie puede probar la conexión entre tokens consumidos y características útiles entregadas al cliente.
Esta es la Wire #14 de ai|expert. El día en que el costo del token dejó de ser un detalle de ingeniería y se convirtió en un KPI de board.
Comenzamos con la paradoja de esta semana. Anthropic lanzó Claude Opus 4.8 con el precio del fast mode reducido en dos tercios—de 30 a 10 dólares por millón de tokens de entrada. El mismo día, GitHub publicó un playbook que redujo el gasto de tokens en workflows agénticos en hasta 62%. Y aun así, en Uber, el presupuesto anual de IA llegó a cero antes de fin de abril. Tres historias que solo tienen sentido cuando las ves en secuencia.
Opus 4.8 tiene números que justifican la atención. 69,2% en SWE-Bench Pro—contra 58,6% en GPT-5.5 y 54,2% en Gemini 3.1 Pro. 84% en Online-Mind2Web para uso de computadora. 88,6% en SWE-bench Verified. El fast mode ahora cuesta 10 dólares por millón de tokens de entrada y 50 por millón de salida—contra 30 y 150 de Opus 4.7. Para quien ejecuta loops agénticos con muchos turnos cortos, este corte de dos tercios en fast mode cambia la planilla de costos de forma directa. Databricks reportó 61% de reducción en costo por token al migrar a 4.8 en cargas de trabajo multimodales con PDFs y diagramas. [ref: anthropics-claude-opus-48-clai]
Anthropic también entregó dos funcionalidades operacionales que suman. La Messages API ahora acepta entradas de sistema dentro del mismo array de mensajes—el agente puede actualizar instrucciones en medio de la tarea sin romper el cache de prompt. Y "dynamic workflows" en Claude Code: el modelo planea la tarea, distribuye el trabajo entre subagentes paralelos, y esos subagentes verifican y contestan las conclusiones unos de otros antes de converger. Es auto-revisión distribuida—pero la advertencia de Anthropic es que el consumo de tokens puede superar significativamente una sesión normal de Claude Code.
Hay una señal en el system card que merece atención antes de poner en producción. Anthropic identificó una tendencia creciente de que el modelo especule sobre quién está evaluando su respuesta—presente en aproximadamente 5% de los episodios de entrenamiento. Aún no se convierte en comportamiento malo observable; Opus 4.8 hace menos afirmaciones falsas de éxito que versiones anteriores. Pero para pipelines de agentes legales o de auditoría, monitorea el drift de calibración.
GitHub transformó ese escenario en un problema de ingeniería resolvible. Un proxy de API intercepta cada llamada de los CLIs—Claude, Copilot, Codex—y genera un artefacto de uso por ejecución. Dos agentes corren diariamente: un auditor que agrega consumo por workflow y señala picos anómalos, y un optimizador que abre issues en el repositorio propio proponiendo correcciones específicas. Resultado, medido en doce workflows internos a lo largo de al menos 109 ejecuciones post-corrección: Auto-Triage Issues cayó 62%. Smoke Claude, 59%. Security Guard, 43%. [ref: github-reduces-agentic-token-c]
La métrica que GitHub usa—Effective Tokens—pondera salida a 4x, lectura de cache a 0,1x, con multiplicador por modelo: Haiku a 0,25x, Sonnet a 1x, Opus a 5x. Una caída de 10% en Effective Tokens es una caída de 10% en costo, independientemente del modelo. Una unidad que va directo al board sin necesidad de traducción. La filosofía que documentaron es simple: "The cheapest LLM call is the one you don't make."
Y ese es exactamente el control que le faltó a Uber.
Uber implementó Claude Code para 5.000 ingenieros en diciembre. En marzo, 84% eran usuarios de coding agéntico. En abril, 95%. 70% del código commiteado vino de IA. 11% de las actualizaciones de backend en producción fueron ejecutadas por agentes sin revisión humana. El costo de IA subió seis veces desde 2024, sobre una base de P&D de 3,4 mil millones de dólares. [ref: uber-pumps-brakes-on-ai-spendi]
El COO Andrew Macdonald dijo en Rapid Response: "That link is not there yet"—ninguna evidencia de ligación entre tokens consumidos y features útiles al consumidor. Y lo que agravó fue la estructura de incentivos: leaderboards internos que ranqueaban ingenieros por uso de IA. Más tokens, posición más alta. Creaste un sistema que recompensaba gasto, no resultado. Duolingo enfrentó lo equivalente—evaluó ingenieros por consumo de herramientas de IA y tuvo que recular después de resistencia interna.
El dato macroeconómico cierra el cuadro. Los costos de token enterprise cayeron 67% en doce meses—de 18,40 a 6,07 dólares por millón en promedio. Pero 95% del volumen aún corre en los modelos frontier más caros, incluso para tareas que no los necesitan. El gasto promedio por organización subió 108% año a año, llegando a 1,2 millones de dólares. 78% de líderes de TI se toparon con cobranças que nunca habían presupuestado. El precio cayó. El volumen explotó. La cuenta subió. [ref: cnbc-signals-enterprise-cost-m]
Entonces el board va a preguntar: ¿dónde está el routing?
Arquitecturas con tiered intelligence stacks están llegando a costo promedio de 2,31 dólares por millón de tokens—contra 18,40 de una stack frontier-only. Diferencia de 87%. OpenRouter, que recaudó 113 millones de dólares en mayo y procesa alrededor de 25 billones de tokens por semana—cinco veces más que hace seis meses—existe para resolver ese routing en producción. Modelos open-weight capturaron 38% del volumen de tokens enterprise en Q1 2026, ante 11% hace un año. El desplazamiento está sucediendo—pero la mayoría de las empresas aún no han construido el harness de evals necesario para confiar endpoints más baratos con tráfico crítico.
Todo lo que se volvió más barato en el bloque anterior necesita hardware para correr. Esta semana, cuatro historias mapean la oferta que sostiene—o bloquea—esa capacidad.
AWS reveló que RNG—Resilient Network Graph—es ahora la arquitectura estándar para la mayoría de las nuevas construcciones globalmente, después de un pilot en Dublín en 2024. La topología reemplaza la fat-tree jerárquica por una malla quasi-aleatoria con switches commodity y paneles ópticos pasivos llamados ShuffleBoxes. Los números declarados: 69% menos hardware de red, 33% más throughput, 40% menos consumo de energía de red. [ref: amazons-resilient-network-grap]
El protocolo Spraypoint distribuye paquetes aleatoriamente a vecinos hasta que se alcanza un waypoint asociado al destino—sin silicon customizado. Esto genera casi el doble de caminos independientes entre routers. Pero los arquitectos necesitan cautela: el paper académico no publica latencia p99 para diferenciales de hop count, y no hay evidencia publicada de integración con RDMA o RoCE. La ganancia de throughput es real en la infraestructura de AWS. El impacto directo en clusters de inferencia aún es teórico.
En Dell, los números de Q1 fiscal 2027 muestran el otro lado de la ecuación. Ingreso total de 43,84 mil millones de dólares, suba de 88% año a año—el crecimiento más rápido desde el IPO de 2018. Ingreso de servidores de IA: 16,1 mil millones, suba de 757%. La proyección anual fue revisada de 50 a 60 mil millones de dólares. [ref: dell-q1-beats-on-ai-server-dem]
Más de 5.000 clientes de servidor de IA en el trimestre—neoclouds, entidades soberanas, enterprises. Y el COO Jeff Clarke dijo que están "repricing every day" por causa del ambiente inflacionario de componentes que comenzó en enero 2026. DRAM, NAND, CPUs x86 y discos rígidos están bajo restricción de oferta en el segundo semestre de 2027. Si no tienes contrato de largo plazo firmado ahora, estás en la cola de asignación detrás de quien sí—y la cotización de esta semana puede no ser válida el próximo mes.
Para quien quiere escapar de esa cola, una alternativa on-prem ganó viabilidad real esta semana.
Cuatro Mac Studio M3 Ultra con 512 GB de RAM cada—costo total alrededor de 38 mil dólares—corriendo DeepSeek V3.1 671B a aproximadamente 25 tokens por segundo y Kimi K2, un MoE de un billón de parámetros, a aproximadamente 34 tokens por segundo. Sin API de nube, sin egress de datos. Lo que tornó esto viable ahora es RDMA sobre Thunderbolt 5, que Stabilise.io midió en 5 a 9 microsegundos de latencia entre nodos a 80 gigabits por segundo. [ref: the-10k-sovereign-ai-cluster-h]
El argumento de compliance es arquitectónico, no de benchmark: pesos y prompts nunca salen del edificio. Para equipos bajo GDPR, HIPAA o NIS2, esa propiedad puede superar cualquier ventaja de throughput de cloud.
Pero el límite es claro. Estos clusters son más adecuados para inferencia en batch que para chat interactivo. Configurar RDMA requiere comandos manuales en modo de recuperación de macOS. Frameworks de Apple Silicon aún se quedan atrás de vLLM en performance absoluta. Para modelos MoE, el tiempo de comunicación se aproxima al tiempo de computación durante el routing de expertos—requiere tuning manual de la capa de memoria. Es viable. No es plug-and-play.
Y Lombardía cierra el mapa europeo con una sorpresa regulatoria. El consejo regional aprobó sobretaxa de 200% en data centers en zonas agrícolas y 100% en zonas rurales. Con 30 GW de capacidad solicitada en toda Italia y la región autorizando solo 2 GW—el consejero regional Massimo Sertori los llamó "proyectos reales y concretos"—la tasa de supervivencia del pipeline planeado está en dígitos simples. La ley nacional cortó el plazo de licenciamiento a 10 meses. Pero la ley regional obliteró la economía de los terrenos que los operadores querían. [ref: italy-imposes-200-tax-on-data-]
El takeaway para quien modela expansión europea es directo: clasificación de uso del suelo es la variable de costo primaria antes de firmar cualquier opción de terreno en Lombardía. Brownfield industrial es el único camino económicamente viable. Una sobretaxa de 200% en greenfield rural, combinada con un techo de autorización de 2 GW contra un pipeline regional de 15 GW-plus, elimina todo lo demás.
El costo del token se convirtió en lenguaje de board—y quien no tenga el equivalente de Effective Tokens en la planilla antes de la próxima ronda de aprobación va a repetir el error de Uber. El viernes, la Edition va a fondo en evals de producción y en lo que el caso Pymetrics y el MDASH de Microsoft revelan sobre auditar agentes antes de que ellos te auditen a ti. Que tengas una buena semana.