La salida de un modelo de lenguaje no contiene ningún registro detectable de la computación interna que la produjo. Un nuevo artículo de Benjamin Belay, publicado el 17 de agosto de 2026, introduce el término "proveniencia computacional" y demuestra que las salidas pueden contener tal evidencia si el modelo se diseña de esa manera desde el entrenamiento.
La distinción importa para implementaciones de alto riesgo. Esquemas de marca de agua como SynthID-Text de Google, PVMark y VOW abordan una pregunta diferente: si una salida fue generada por un modelo específico. El objetivo de Belay es más difícil: ¿puede una salida probar qué ruta de razonamiento interno se utilizó, no solo qué modelo la generó? En contextos de salud, finanzas o derecho, un auditor no puede verificar si la computación que produjo una respuesta fue la prevista, se omitió o se corrompió en el camino.
La configuración experimental es mínima. Dos arquitecturas—una red feed-forward modular y un transformer—se entrenaron en tareas aritméticas con una ruta obligatoria a través de dos estados intermedios discretos. Como los dos estados producen respuestas finales idénticas, la comparación externa no puede distinguir qué ruta tomó el modelo. Los investigadores autentican el estado utilizado, luego entrenan el modelo para que el estado verificado incruste un patrón estadístico sutil en el texto generado. Un detector posterior recupera ese patrón sin acceso a los pesos o activaciones del modelo.
Ambas arquitecturas pasaron los 128 pares coincidentes en evaluaciones públicas, y el mismo resultado se mantuvo en evaluaciones protegidas de extremo a extremo selladas. La computación causal requerida se reprodujo en cinco modelos feed-forward entrenados independientemente y tres transformers entrenados independientemente. Cero fallos en todas las configuraciones.
La limitación crítica es lo que previene el despliegue inmediato. En un experimento separado utilizando un transformer estándar entrenado sin estados intermedios discretos obligatorios, las sondas lineales no recuperaron un estado intermedio aprendido naturalmente de las salidas. Las representaciones internas emergentes naturales no se auto-anotan en el texto generado: la señal de proveniencia debe diseñarse durante el entrenamiento. No se demuestra ningún camino de retrofit para modelos existentes aquí.
Esto difiere de lo que los sistemas de marca de agua actuales resuelven. VOW (abril de 2026) reformula la detección de marca de agua como computación segura de dos partes utilizando Funciones Pseudoaleatorias Obliviosas Verificables, resolviendo la brecha de confianza entre usuario y proveedor. PVMark utiliza pruebas de conocimiento cero para que terceros puedan verificar los resultados de detección sin la clave secreta. Las marcas de agua infalibles de la Universidad de Washington introducen firmas digitales robustas para prevenir la atribución falsa. Todas abordan la atribución de salida: quién hizo este texto. La proveniencia computacional aborda la verificación de razonamiento: qué computación produjo este texto. Son problemas ortogonales que la conversación sobre cumplimiento de IA regularmente conflata.
Para arquitectos que construyen hacia el cumplimiento del Artículo 50 de la Ley de IA de la UE o requisitos de auditoría interna, el techo práctico de la marca de agua existente es visible: esquemas que dependen del sesgo de logit en el tiempo de inferencia pueden eliminarse mediante paráfrasis, deshabilitarse trivialmente en modelos de peso abierto y requieren horas para extraer carga para inserción multi-bit. La proveniencia computacional no soluciona esos problemas. Opera en una capa diferente—arquitectura de entrenamiento del modelo—con requisitos diferentes: estados intermedios discretos, verificados en el tiempo de entrenamiento, con el patrón estadístico incorporado en el proceso de generación en sí.
Las tareas aritméticas con cuellos de botella binarios forzados no son inferencia transformer a escala. Las activaciones continuas distribuidas en miles de cabezas de atención no se asignan claramente a "dos estados intermedios discretos". Extender el enfoque a la complejidad realista de tareas—razonamiento de cadena de pensamiento, recuperación multi-salto, llamada de herramientas—mientras se mantiene la integridad causal no está demostrado. El delta de costo de entrenamiento también no se reporta.
Si su requisito de auditoría es "probar que el modelo utilizó la cadena de razonamiento aprobada", ningún sistema de producción actual responde esa pregunta. El artículo de Belay es la primera demostración controlada de que la pregunta es respondible en absoluto.