Resumen de Experimentos
Esta guía le presenta la práctica de la experimentación. Detalla por qué debería experimentar desde el principio, ofrece recomendaciones de procedimientos y proporciona información para ayudarle a familiarizarse con el proceso.Razones por las que los experimentos importan
Los experimentos son el estándar de referencia para identificar los efectos de los cambios en la experiencia de juego. Si comprende los efectos de los cambios en la experiencia de juego y tiene datos que lo respalden, es más fácil tomar una decisión que le permita elaborar un diseño de juego, experiencias y estrategias de marketing más eficaces. La experimentación continua le permite determinar si la eficacia de sus cambios disminuye con el tiempo. Independientemente de la etapa del proceso de desarrollo del juego (creación u operación) en la que se encuentre, Experimentos de PlayFab permite a las personas, los equipos y los estudios realizar cambios cuidadosos en las experiencias de juego mientras recopilan datos empíricos, lo que a su vez le ayuda a averiguar exactamente qué funciona mejor para el juego. Los experimentos son una práctica eficaz que le proporciona información sobre el comportamiento de los jugadores en una audiencia controlada y limitada (tráfico de jugadores). De esta forma, protege su base de jugadores de una experiencia de juego insatisfactoria. Además, puede hacer un mejor uso de los recursos y habilitar o deshabilitar fácilmente características del juego en un juego en producción. Los experimentos le ayudan a transformar el poder de decisión de “creemos” a “sabemos”. Es una práctica eficaz, que le proporciona información sobre el comportamiento de los jugadores con una audiencia controlada y limitada (tráfico de jugadores). De esta forma, protege su base de jugadores de una experiencia de juego repulsiva. Además, se puede hacer un mejor uso de los recursos y habilitar o deshabilitar fácilmente características del juego en un juego en producción. Estos son algunos objetivos comunes de los estudios de juegos al experimentar:- Aumento de la base de jugadores activos
- Mayor tasa de conversión
- Menor tasa de abandono
La fiabilidad del experimento es importante
Cuando tome decisiones basadas en los resultados de los experimentos que está ejecutando, querrá asegurarse de que existe una relación o causalidad. La fiabilidad de un experimento se equipara a la significación estadística de los resultados del experimento. La fiabilidad es el foco de los resultados de los experimentos de PlayFab. Se comprueba la significación estadística de todas las métricas. Por ejemplo, si ejecuta un experimento que mide un aumento del dos por ciento en la retención y se muestra como estadísticamente significativo con un valor p de 0,04, eso significa que hay un 4 % de probabilidad de que se hubiera observado un resultado del 2 % o más suponiendo que no hubiera diferencia entre A y B (es decir, suponiendo que la hipótesis nula sea cierta). La diferencia real no se puede medir directamente, y la estadística se usa para obtener una estimación razonable. Existe la posibilidad de que el ruido (aleatoriedad) nos induzca a error. La significación estadística es importante porque refleja su tolerancia al riesgo y su nivel de confianza. Las métricas pueden fluctuar de un día a otro, y el análisis estadístico proporciona la base matemática sólida para tomar decisiones de negocio en un entorno con ruido. Experimentos de PlayFab marca los movimientos de las métricas como estadísticamente significativos con una confianza del 95 % o un valor p de 0,05.Discrepancia de proporción de muestras (SRM)
Una discrepancia de proporción de muestras (conocida como SRM) es una comprobación de calidad de los datos que indica una diferencia significativa entre las proporciones esperadas de usuarios entre las variantes del experimento (por ejemplo, configuradas antes de que comenzara el experimento) y las proporciones reales de usuarios observadas al final del experimento. Una SRM indica que hay datos faltantes o un problema de redundancia que afecta a las variantes de control y de tratamiento de manera desigual. El principio básico de los experimentos controlados requiere que las variantes de tratamiento y de control sean estadísticamente equivalentes. Cuando se viola este principio, los resultados del experimento pueden sufrir un sesgo de selección. Un análisis que tiene SRM se considera poco fiable y no debe usarlo para tomar decisiones. De hecho, si su experimento tiene una SRM, no saque ninguna conclusión del análisis (no hasta que haya resuelto la SRM).Cómo detectar una SRM
Tomemos un ejemplo en el que un experimento está configurado para ejecutarse con un 10 % de tráfico en cada una de las variantes de control y de tratamiento.
En este escenario, aunque la proporción real entre los dos grupos es la misma en cada caso, se obtiene un valor p cada vez más pequeño para recuentos de usuarios mayores en tratamiento y control. Esto indica que el resultado observado no es el esperado.
Cómo investigar una SRM
La investigación y resolución de una SRM es un proceso complejo e incierto. Por lo tanto, resolver una SRM requiere un enfoque estructural, con una visión panorámica y un conocimiento de la probabilidad de las causas principales y de las estrategias de resolución. Para ello:- Comience con la pregunta “¿por qué ha ocurrido esto?”
- Formule una hipótesis sobre la causa de esa SRM
- Prediga cuál sería la evidencia observada si esa hipótesis fuera cierta
- Busque esas evidencias
- Analice la causa para identificar una solución
- ¿Esto ocurrió solo en un análisis/experimento o en varios?
- ¿Qué hace el tratamiento? ¿Cuál es la naturaleza del experimento?
- ¿Cambió algo entre ahora (SRM) y antes (experimento anterior sin SRM)?
- ¿Cambió alguna de las vistas, canalizaciones o filtros?
Causas principales comunes de las SRM
- La experiencia de tratamiento en el juego se bloquea más que la experiencia de control
- La experiencia de tratamiento envía involuntariamente cantidades diferentes de datos. Por ejemplo, un experimento en el cliente que aumente el búfer de telemetría sin duda aumentará la cantidad de datos que se devuelven, lo que causará una SRM
Los experimentos como práctica
- Comience con una hipótesis Formule una hipótesis para asegurarse de que el experimento tiene un objetivo y un escenario claros. Además, asegúrese de que los cambios que está probando son lo suficientemente significativos como para importar. Para formar una hipótesis, use la siguiente plantilla: Debido a la observación [A] y a los comentarios [B], se cree que cambiar [C] para los jugadores [D] hará que ocurra [E]. Se validará cuando vea [F] y obtenga [G].
- Programe el experimento correctamente Para obtener resultados fiables, ejecute sus experimentos A/B durante períodos comparables. Tenga en cuenta los picos y valles estacionales.
- Duración de un experimento Dé al experimento tiempo suficiente. Un tiempo insuficiente asignado al experimento puede sesgar los resultados. Si el tiempo de ejecución es demasiado corto, es posible que no recopile suficientes puntos de datos para una conclusión estadísticamente precisa. Si el tiempo de ejecución es demasiado largo, podría arriesgarse a perder conversiones al no implementar la variante ganadora entre los jugadores potenciales. Si tiene dudas, es perfectamente razonable volver a probar.
- Preste atención al % de un grupo de prueba El % del grupo de prueba determina el tamaño de la muestra. Diríjase a la audiencia con el tamaño de muestra adecuado; de lo contrario, no obtendrá resultados fiables y las decisiones tomadas con base en esos datos podrían ser erróneas.
- Evite los errores de tipo 1 y tipo 2 La estadística en los experimentos proporciona probabilidad, no certeza. Por lo tanto, no puede proporcionar una certeza del 100 % de si una variante del experimento es la mejor. Así que evite los errores de tipo 1 y tipo 2. Para evitar el error de tipo 1, aumente el nivel de significación requerido antes de llegar a una decisión (lo que hemos hecho por usted estableciéndolo en el 95 % de forma predeterminada) y ejecute el experimento durante más tiempo para recopilar más datos. Y para reducir la probabilidad de un error de tipo 2, aumente la población del grupo de prueba del experimento (tamaño de la muestra).
- No realice cambios a mitad de un experimento Si interrumpe la prueba antes del final de la duración ideal o introduce nuevas variables que no formaban parte de la hipótesis original, los resultados no serán fiables. Es decir, sería difícil determinar si uno de los cambios causó el aumento de las conversiones o si fue simplemente azar. Tenga en cuenta que cuantas más variaciones haya, más tiempo deberá ejecutar las pruebas para obtener resultados fiables. Adopte un enfoque granular. La recomendación es experimentar con 2 a 4 variables en cualquier grupo de variantes al mismo tiempo. Eso proporciona el mejor equilibrio entre duración de la prueba y eficiencia.
- Preste atención a la significación estadística reflejada en el valor p Asegúrese de que los datos son fiables. La medida de la fiabilidad de los datos es la significación estadística, que determina que los resultados no se deben al azar. Los valores p se usan para determinar la significación estadística en una hipótesis nula sobre la que se basan los experimentos A/B. Mide la compatibilidad entre los datos recopilados y la hipótesis nula. Cuanto más bajo sea, más confianza se puede tener al rechazar la hipótesis nula.
- Mantenga una mente abierta A veces, puede verse tentado a ignorar la información estadística en favor del conocimiento convencional o incluso de la experiencia previa para tomar la decisión, por mucho que le sorprenda. Si no le convencen los resultados de una prueba, ejecútela de nuevo y compare los datos.
Adopte una cultura y un proceso de experimentación
La cultura de experimentación es valiosa. Debe asimilarla como parte de los demás procesos, para que todos se beneficien de ella en toda la organización. La experimentación A/B constante puede mejorar sustancialmente la conversión, ya que tiene una mayor probabilidad de encontrar formas de agregar valor positivo al producto para los jugadores. Puede cambiar el paradigma de toma de decisiones de depender de los HiPPO (la opinión de la persona mejor pagada, por sus siglas en inglés) a elecciones basadas en datos. Más ideas de los empleados verán la luz en forma de pruebas. Es importante que, cuando sea fácil probar ideas, se hable de los resultados y de los pasos siguientes. Además, los empleados se sienten motivados para ir a trabajar. Para construir una cultura de experimentación, introduzca procesos fiables y repetibles para la iteración del juego. Puede adquirir una cultura de experimentación constante mediante los siguientes pasos fundamentales:- Establezca objetivos Los objetivos de experimentación accionables (por ejemplo, la involucración) permiten al equipo avanzar con los experimentos, en lugar de quedarse atascado en objetivos abstractos como el “crecimiento”.
- Pruebe más con el apoyo de su equipo y priorice Recopile y analice datos cualitativos y cuantitativos de forma que se puedan generar y priorizar hipótesis/ideas según el impacto en el negocio. Guíe a su equipo a lo largo del proceso de experimentación usando un marco fiable y repetible; de lo contrario, el equipo se sentirá perdido si de repente les pide que experimenten más y realicen múltiples cambios.
- Comunique los resultados a su equipo Genere impulso en torno a la experimentación comunicando los resultados de las pruebas en equipo. Compartir proporciona al equipo información sobre cómo iterar y mejorar las pruebas futuras. Esto entusiasma a la gente con seguir experimentando.
- Acepte el fracaso El fracaso es parte de las pruebas; normalice el fracaso. No deje que el fracaso detenga la experimentación: reflexione, aprenda y siga adelante para continuar experimentando.
- Practique una buena higiene de experimentación Cree un protocolo estándar para cada experimento que ejecute su equipo. Ayuda a mantener los resultados de los experimentos precisos y significativos, independientemente de quién controle el experimento.
