TikTok Performance
Medición de vídeo vertical
Edición de 7 de agosto de 2026
Vocabulario de color Observable. Documentado o medible Inferido. Deducción razonada No se puede saber. Fuera del instrumento La regla completa
Experimentos

Por qué un test dentro de un sistema de recomendación es más difícil de lo que parece

Comparar dos versiones parece sencillo hasta que el propio sistema decide quién ve qué. Los cuatro mecanismos que rompen la comparación y qué queda en pie.

Experimentos13 min
Respuesta breve

Un sistema de recomendación asigna la distribución en función de las señales tempranas de cada pieza, de modo que la exposición no es independiente del resultado. Eso rompe el supuesto básico de cualquier comparación: los dos grupos no son equivalentes porque el propio sistema los ha construido en función de lo que estaba midiendo. El efecto no se corrige después.

Retícula de sensores sobre fondo oscuro. Si el instrumento decide dónde mirar, deja de observar el fenómeno completo.
Retícula de sensores sobre fondo oscuro. Si el instrumento decide dónde mirar, deja de observar el fenómeno completo.

El supuesto que se rompe

Cualquier comparación entre dos versiones descansa en un supuesto: que los grupos que las reciben son equivalentes salvo en la versión. Si lo son, la diferencia observada se puede atribuir a la versión. Si no lo son, no.

En un sistema de recomendación ese supuesto no se cumple casi nunca, y por una razón que es la esencia del sistema: la asignación no es independiente del resultado. El modelo observa las primeras señales de cada pieza y decide en función de ellas a quién sigue entregándola.

Dicho de otra forma: el mecanismo que reparte el público está mirando la misma variable que el experimento quiere medir, y actúa sobre ella. No es un ruido añadido, es una realimentación.

asignación de la distribución
No se puede saber
Qué cuenta literalmente

Decisión del sistema de recomendación sobre a quién se entrega cada pieza y en qué volumen, tomada de forma continua a partir de señales de comportamiento.

Qué no cuenta

No es aleatoria. No es independiente del resultado que se quiere medir. No es observable desde la cuenta. No es estable entre periodos.

Qué tendría que ser cierto además

Para que una comparación entre dos piezas fuera válida tendría que ser cierto que la asignación fue independiente de las señales tempranas de cada una, lo que contradice el funcionamiento declarado de estos sistemas.

Pertenece a la tercera categoría: es el factor determinante del resultado y está fuera del alcance del observador.

Los cuatro mecanismos

Realimentación temprana. Las señales de los primeros minutos condicionan la distribución posterior. Una pieza que arranca bien por azar recibe más entrega y acumula más resultado, lo que refuerza la impresión de que era mejor.

Selección de público. El sistema no entrega cada versión al mismo tipo de personas. Si una versión encaja mejor con un perfil, el sistema la lleva a ese perfil, con lo que la comparación mezcla el efecto de la versión con el del público al que llegó.

Competencia interna. Dos piezas de la misma cuenta publicadas a la vez compiten entre sí por la atención de las mismas personas. La presencia de una afecta al resultado de la otra, que es exactamente lo que un diseño de comparación intenta evitar.

No estacionariedad. El sistema cambia mientras se mide. Un experimento que dure semanas puede empezar bajo un modelo y terminar bajo otro, sin que nadie lo sepa.

Lo que ofrece la superficie de pago

La distribución de pago permite algo más de control y no elimina el problema. Conviene ser preciso sobre qué se gana y qué no.

Se gana la posibilidad de fijar públicos y presupuestos, y en algunos productos de asignar personas a grupos de forma aleatoria. Eso resuelve, cuando está disponible, la parte de selección de público y buena parte de la realimentación.

No se gana el control sobre la optimización interna, que en la mayoría de los productos sigue asignando entregas según el rendimiento estimado. Si el sistema optimiza dentro de cada grupo, la comparación entre grupos ya no compara sólo las versiones: compara dos procesos de optimización distintos.

Tampoco se gana equivalencia con la superficie orgánica. Un resultado obtenido en distribución de pago describe el comportamiento en esa superficie, con ese público y con esa mecánica de entrega, y extrapolarlo a la orgánica es un salto que hay que declarar.

Qué controla cada superficie
ElementoOrgánicaPago
Elección del públicoNoParcialmente
Asignación aleatoriaNoEn algunos productos
Optimización interna de la entregaNoNormalmente no se desactiva
Momento de publicación
Volumen entregadoNoParcialmente, vía presupuesto

Ordenación de definiciones, no de resultados. Ninguna celda contiene una cifra, porque este cuadro clasifica lo que cada término designa.

Una prueba dentro de un recomendador, por categoría
Lo observable
  • Los resultados de cada versión
  • El calendario exacto de publicación
  • Si hubo o no asignación controlada y de qué tipo
Lo inferido
  • Que la diferencia observada mezcla efecto de versión y efecto de reparto
  • Que la alternancia reparte el efecto de calendario entre versiones
  • Que la consistencia a lo largo de muchas repeticiones es difícil de explicar por azar
Lo inventado
  • Que una comparación orgánica entre dos piezas prueba cuál es mejor
  • Que un resultado en distribución de pago se traslada a la orgánica
  • Que un ajuste posterior corrige la falta de asignación aleatoria

Ningún tratamiento estadístico posterior repara una asignación que dependía del resultado. Es un problema de diseño, no de análisis.

Qué queda en pie

Tres diseños siguen siendo útiles dentro de estas restricciones, con expectativas ajustadas.

Alternancia en el tiempo. Publicar las dos versiones de forma alterna a lo largo de muchas semanas, no en bloques. No consigue equivalencia y reparte el efecto del calendario y del estado del sistema entre ambas. Es el diseño más barato y el más razonable en superficie orgánica.

Repetición del contraste. Repetir la misma comparación muchas veces con piezas distintas. Ninguna repetición aisla nada y la consistencia del resultado a lo largo de muchas repeticiones empieza a ser difícil de explicar por azar.

Separación geográfica en distribución de pago. Cuando la segmentación territorial es viable y las zonas son comparables antes de empezar, permite un contraste más limpio, con las condiciones que se detallan en grupos de control y qué se puede aislar de verdad.

Cómo se informa de un resultado así

Con una fórmula que reconozca la naturaleza de la evidencia. En lugar de la versión A funciona mejor, escribir: en las publicaciones alternadas del periodo, las piezas de tipo A mostraron mayor retención intermedia que las de tipo B. La asignación no fue controlada, de modo que la diferencia es compatible con un reparto distinto por parte del sistema.

Esa segunda frase no debilita el informe: lo hace resistente. Un resultado presentado con sus límites sobrevive a la pregunta incómoda, y un resultado presentado como prueba se derrumba con ella.

Lo que conviene llevarse

En un sistema de recomendación, la asignación del público depende del resultado que se quiere medir. Eso no es ruido: es realimentación, y no se corrige después.

La superficie de pago ofrece más control y no equivalencia con la orgánica. Lo que queda es alternancia, repetición y, cuando se puede, separación geográfica, siempre con el límite declarado en el propio informe.

Preguntas frecuentes

¿Puedo hacer un test A y B publicando dos vídeos en orgánico?

Se puede publicar y no se obtiene una comparación válida. El sistema decide a quién entrega cada pieza en función de sus señales tempranas, de modo que los grupos no son equivalentes y la diferencia mezcla versión y reparto.

¿La distribución de pago resuelve el problema?

Lo reduce. Permite fijar públicos y, en algunos productos, asignar de forma aleatoria. No suele permitir desactivar la optimización interna de la entrega, y sus resultados describen esa superficie, no la orgánica.

¿Qué es la realimentación temprana?

El mecanismo por el que las señales de los primeros minutos condicionan la distribución posterior. Una pieza que arranca bien por azar recibe más entrega y acumula más resultado, lo que refuerza la impresión de que era mejor.

¿Sirve de algo alternar las versiones en el tiempo?

Sirve para repartir el efecto del calendario y del estado del sistema entre ambas, que es la mejora más barata disponible en orgánico. No consigue equivalencia entre grupos y hay que decirlo en el informe.

¿Puedo corregir estadísticamente la falta de asignación aleatoria?

No de forma fiable. Cuando la asignación depende de la variable que se mide, ningún ajuste posterior reconstruye la comparación. Es un problema de diseño y se resuelve antes, no después.

Fuentes

Textos normativos y organismos públicos citados por su carácter verificable. La documentación de plataforma se cita tal como estaba publicada en la fecha de consulta, 7 de agosto de 2026, y puede cambiar sin aviso.

El boletín

Un envío cada quincena: lo publicado, una definición revisada y una nota de trabajo. Sin medias de sector, sin tasas de referencia y sin casos que no podamos acreditar. Baja cuando quieras.

Tratamos tu dirección sólo para el envío. Detalles en privacidad.