aiexpert
Inicio / Noticias / Nota
Research · 24 jul 2026, 20:34 · 2 fuentes

Kimi K3 logra 68.5% en DeepSWE, cuesta 2.8x menos por tarea que Claude Fable 5

Together AI lanzó un análisis de benchmark DeepSWE el 24 de julio mostrando que Kimi K3 de Moonshot AI de peso abierto se iguala al Claude Fable 5 de Anthropic en tareas de codificación de ingeniería de software a un descuento de costo nítido. En pass@1, Kimi K3 anotó 68.5% versus 69.9% de Fable — una brecha de 1.4 puntos. Pero cuando los benchmarks permiten múltiples intentos (pass@2 y pass@4), Kimi adelanta: 82.0% vs 80.2% en pass@2 y 89.4% vs 88.5% en pass@4.

El costo es el titular: Kimi K3 cuesta $4.65 por lanzamiento de tarea versus $13.41 para Claude Fable 5 en su configuración xhigh. Medido por tarea resuelta, Kimi entregó 14.7 soluciones por $100 contra 5.3 de Fable — 2.8x la salida por dólar. La brecha de desempeño refleja una diferencia estratégica: Fable es más confiable en intentos únicos (pass@1 más alto, más soluciones cuatro-para-cuatro); Kimi lanza una red más amplia en reintentos y logra mejor cobertura pass@2/4. Ambos modelos fallan en tipos de tareas casi idénticos (correlación 0.72).

Kimi K3 es de peso abierto, implementado a través de la plataforma de inferencia Together AI, mientras que Fable 5 es cerrado y disponible solo a través de Anthropic. Esto hace que Kimi sea adecuado para equipos que construyen flujos de trabajo agénticos donde múltiples intentos y alojamiento propio son aceptables — agentes de voz, bucles de generación de código, tareas de búsqueda-e-iteración. Fable sigue siendo preferido para rutas de producción de un solo disparo que requieren determinismo.

Para arquitectos que eligen entre LLM de peso abierto y cerrado para tareas de razonamiento y codificación, esto señala un hito: los modelos de peso abierto ahora logran capacidad de razonamiento de nivel de punta en proporciones de costo/token de producción más cercanas a modelos pequeños. DeepSWE es un benchmark estrecho, pero mide ingeniería de software real. La ventaja de costo ($4.65 vs $13.41) puede impulsar la adopción entre equipos que construyen agentes de CI/CD y sistemas de programación autónoma, especialmente donde el reintento de tarea es tolerable.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source together.ai
  2. 02 together.ai together.ai “Kimi K3 matches Claude Fable 5 on quality, costs a third as much per solved task, and as an open model gives teams full control over their deployment.”