Artículos

Auditoría independiente de un backtest: qué revisa que una réplica no

Qué examina una revisión estadística de un backtest, cómo trata la selección de variantes y qué distingue los datos medidos de las declaraciones.

Una réplica pregunta si las mismas reglas, datos y supuestos reproducen una trayectoria. Una auditoría estadística pregunta qué evidencia contiene esa trayectoria una vez consideradas la incertidumbre, la selección y la información que falta. Son trabajos complementarios. Una réplica puede reproducir exactamente una elección ajustada al historial; una revisión estadística puede detectar debilidades sin reconstruir la lógica que produjo las operaciones. Rigor analiza los archivos entregados y las declaraciones que los acompañan. Ese alcance importa cuando una gestora compara investigaciones o un proveedor prepara la documentación de una señal para otra persona.

Qué significa independiente en esta revisión

La independencia empieza por separar el análisis del producto evaluado. Rigor no vende robots ni señales, y el precio del informe no depende de la clase obtenida. Su metodología publica las preguntas, las reglas de evaluación y las limitaciones. Esto permite discutir una conclusión concreta y el archivo que la sostiene. No convierte al auditor en observador de todo el proceso de investigación: los ensayos descartados, las modificaciones anteriores y las decisiones no registradas pueden quedar fuera de los materiales entregados.

Evidencia estadística frente al azar

La primera comprobación estudia cuánto respaldo tiene el Sharpe observado. El Sharpe probabilístico considera la longitud de la serie, la asimetría y la curtosis. El informe también examina dependencia temporal y remuestrea bloques de retornos mediante bootstrap estacionario. Los bloques conservan parte de la estructura local que se perdería al mezclar observaciones aisladas. El resultado sigue dependiendo de la muestra recibida y del método. Una serie corta, irregular o dominada por episodios concretos exige leer la incertidumbre junto con la cifra principal; repetir el cálculo no elimina esa incertidumbre.

Selección entre variantes

La siguiente pregunta es cuántas oportunidades hubo de encontrar una curva llamativa. El Sharpe deflactado compara el resultado con una referencia que aumenta al considerar más intentos. Rigor utiliza el mayor conteo entre la declaración y la evidencia de variantes o pasadas de optimización entregadas. Cuando hay una matriz de variantes, puede estudiar además el sobreajuste mediante validación cruzada combinatoria. La curva ganadora aislada no cuenta la historia de las alternativas descartadas.

Declarado · Supongamos 100 variantes independientes y 3 años de rendimientos diarios, con 252 periodos al año y un Sharpe anual declarado de 1.8. La calculadora sitúa el Sharpe esperado de la mejor variante sin habilidad en 1.47. Es una cuenta bajo supuestos de asimetría nula y colas normales, no una medición de una cartera. La calculadora ilustra la selección bajo sus supuestos; no mide una estrategia del lector. La independencia entre intentos es una simplificación: variantes parecidas pueden compartir gran parte de su comportamiento. Tampoco permite reconstruir búsquedas anteriores que nadie documentó.

Sensibilidad a los costos

La comprobación de costos recalcula operaciones con distintos niveles de fricción y estudia el costo de equilibrio. Necesita detalles de operaciones y supuestos identificables. Una curva neta por sí sola no permite separar comisión, diferencial y deslizamiento ni deducir cómo cambiarían con otro volumen. Si faltan las operaciones, esta parte puede quedar sin medir aunque otras estadísticas sí se calculen. La diferencia es relevante para una réplica: reproducir la misma hipótesis de costos confirma coherencia del cálculo, pero deja abierta la sensibilidad a hipótesis diferentes.

Comportamiento fuera de muestra

El informe compara el tramo posterior a la fecha declarada como inicio fuera de muestra con el tramo anterior. Examina su Sharpe y la distancia entre ambos. La fecha es una declaración del cliente; el archivo por sí solo no demuestra que se eligiera antes de conocer los resultados. Cambiar reglas después de mirar ese tramo altera su interpretación aunque las fechas sigan intactas. Si falta la fecha o los tramos no contienen datos suficientes, el informe indica la limitación en lugar de fabricar una comparación.

Calidad de los datos

Otra dimensión busca señales de problemas en los materiales: duplicados, saltos, valores congelados, depósitos y patrones asociados a martingala o rejilla, entre otros. Una bandera requiere examinar la causa y el contexto; no reconstruye automáticamente el historial original. La ausencia de banderas tampoco establece la procedencia del archivo. Rigor lee lo entregado y no contrasta registros con un bróker. Para una gestora, conservar el export original y explicar transformaciones facilita responder a observaciones concretas sin confundir limpieza estadística con autenticidad de origen.

Comparación con un benchmark

La revisión compara la serie con el benchmark entregado mediante exceso de retorno, relación entre drawdowns y ratio de información. Las fechas deben solaparse lo suficiente para sostener la comparación. Elegir una referencia pertinente sigue siendo una decisión de investigación que conviene documentar: comparar con una exposición distinta puede responder otra pregunta. Sin el benchmark o sin un solapamiento suficiente, no se puede inferir la comparación a partir del nombre de la estrategia. La dimensión recoge esa ausencia y no la sustituye por una expectativa.

Medido, declarado y pendiente de datos

Medido, o Medido, significa que el informe calculó el dato desde el archivo recibido. Declarado, o Declarado, identifica lo que indicó el cliente o su plataforma y que el análisis no puede comprobar. No medido indica información insuficiente para esa medición. Estas etiquetas se aplican a cada dato: un Sharpe calculado puede coexistir con un número de intentos declarado. Medir una operación matemática no convierte sus premisas en hechos observados. Al compartir el informe, conserva las etiquetas y las limitaciones junto a las conclusiones, también cuando el resultado complique la presentación inicial.

Preguntas frecuentes

¿La revisión reconstruye la estrategia?

No. Analiza los archivos recibidos y las declaraciones asociadas. Reconstruir la señal o repetir el backtest requiere reglas, código y datos que esta revisión no reconstruye.

¿Un dato medido describe resultados futuros?

No. Describe un cálculo sobre el material entregado. Las dependencias, los supuestos y la información ausente siguen limitando su interpretación; el informe no recomienda comprar, vender ni invertir.

Relacionado

Ponlo a prueba

La calculadora de suerte es gratis y no pide registro. Con tu cuenta, el primer informe completo también es gratis.