Todo lo que la redacción publicó, en orden cronológico. Cada ítem trae origen, fuentes y tiempo de lectura.
RESEARCH ReviewBench Expone la Brecha del 30% en la Detección de Agentes de Revisión de Código
RESEARCH OpenAI Expone Red de Estafas ChatGPT Operando desde Camboya
RESEARCH El Pipeline de Auditoría KAISEN Revela Fallas Silenciosas en la Equidad de la IA Clínica
RESEARCH ReToken Reduce a la Mitad la Memoria GPU de Modelos Vision-Language RESEARCH OSReward expone sesgo sistemático en jueces VLM para evaluación de agentes
RESEARCH Agentes de IA Dominan Conversaciones, Reducen Intercambio Humano-Humano
RESEARCH Primer benchmark de oficina para preciar el trabajo de agentes revela brecha de productividad
RESEARCH Ningún modelo de frontera supera el 2.6% en tareas contables de ocho pasos RESEARCH El ajuste de API de OpenAI eleva GPT-5.6 Sol a 38,3% en ARC-AGI-3
RESEARCH Agentes Frontera Alcanzan 65% en Verificación de Estado en Flujos de Producción
RESEARCH Modelo Gráfico Multimodal Elimina Barreras de Dominio en Transferencia Zero-Shot RESEARCH πR² Permite que los Robots Reaccionen en Tiempo Real sin Reentrenamiento
RESEARCH Desktop-Delta Bench Limita el Razonamiento de Agentes GUI al 65%
RESEARCH CARE Reduce la Activación de Expertos en Fine-Tuning MoE-LoRA RESEARCH Alibaba Identifica Corrupción Silenciosa de Rama en Destilación de Difusión
RESEARCH El preentrenamiento de embeddings vence al tamaño del modelo en 1.215 pruebas de matching de entidades
RESEARCH OPD Supera a GRPO en la Planificación de Agentes de Horizonte Largo
RESEARCH DataOrchestra reduce la computación de canalizaciones de datos al omitir reescrituras innecesarias
RESEARCH Google Logra Tasa de Error Cuántica Récord Sin Pausar la Computación
RESEARCH Intercambiar el orden de imagen y texto cambia la precisión de VLM en 26 puntos
RESEARCH Microsoft's OpenForgeRL Entrena Agentes en Arreos de Producción
RESEARCH El 98 por ciento de las explicaciones de activación no fundamentan afirmaciones
RESEARCH LangChain lanza Harbor para la medición de agentes en el mundo real
RESEARCH Google Vincula Investigación de Laboratorios de EE. UU. a su Nube y Economía de Tokens RESEARCH CodeRescue Router Reduce 64.5% de Costos de Modelo Mientras Aumenta Tasa de Solución
RESEARCH Agentes de producción afectados por modos de fallo ocultos que no detectan los benchmarks
RESEARCH Solo 2 de 13 algoritmos en CircuitKIT alcanzan estatus de producción
RESEARCH Ataques Soft-Prefix Cambian el Razonamiento de LLM al 90% en Inyección de Vectores Oculto
RESEARCH Dense Patch Tokens igualan a modelos de visión-lenguaje con 1% de los parámetros
RESEARCH SWE-Pruner Pro Reduce 39% de Uso de Tokens en Agentes de Codificación
RESEARCH OpenAI Suspende Modelo Tras Escapar de la Caja de Arena y Evadir Seguridad
RESEARCH Marco de Agente Android Reduce el Tiempo de Tareas Móviles en un 95 Porciento
RESEARCH Método E3 Reduce el Uso de Tokens de Agente LLM en Ediciones de Código en un 91%
RESEARCH TerraZero Supera InterPlan Sin Datos Humanos
RESEARCH Los jueces LLM revierten el 85% de los veredictos con respuestas de referencia
RESEARCH Tres horas en una GPU de $329 sustituyen a miles de horas de entrenamiento NAS
RESEARCH Apple's MM-ToolSandBox Revela por qué la Mitad de los Agentes de IA Avanzada Fracasa en Tareas Visuales
RESEARCH Correcciones a Nivel de Activación Sobrepasan las Ediciones de Prompts para Jueces LLM Prejuiciosos