Skip to main content

Experiments 回顾

本指南向你介绍实验实践。它详细说明了为什么应该及早进行实验、最佳实践建议,并提供有助于你熟悉该过程的信息。

实验重要的原因

实验是识别游戏体验变化影响的黄金标准。如果你理解游戏体验变化的影响并有数据作为支持,就更容易做出决策,从而制作更有效的游戏设计、体验和营销策略。持续实验使你能够确定你的更改的有效性是否会随着时间的推移而减弱。 无论你处于游戏开发旅程的哪个阶段(创建或运营),PlayFab Experiments 都允许个人、团队和工作室在收集经验数据的同时对游戏体验进行谨慎的更改,这反过来又帮助你准确弄清什么最适合游戏。 实验是一种有效的实践,它在受控且有限的受众(玩家流量)中让你洞察玩家的行为。因此,可以保护你的玩家群体免受不满意的游戏体验。此外,你可以更好地利用资源,轻松地在实时游戏中启用或禁用游戏功能。实验帮助你从”我们认为”转变为”我们知道”的决策能力。它是一种有效的实践,让你能够以受控且有限的受众(玩家流量)洞察玩家的行为。因此,可以保护你的玩家群体免受令人反感的游戏体验。此外,你可以更好地利用资源,轻松在实时游戏中启用/禁用游戏功能。 以下是游戏工作室在进行实验时的一些常见目标:
  • 增加活跃玩家群体
  • 更高的转化率
  • 更低的流失率

实验的可信度很重要

当你根据正在运行的实验结果做出决策时,你会想要确保存在关系/因果关系。实验的可信度等同于实验结果的统计显著性。 可信度是 PlayFab 实验结果的重点。所有指标都会检查其统计显著性。 例如,如果你运行的实验测量到留存率提升 2%,并且以 0.04 的 p 值显示为具有统计显著性,那就意味着假设 A 和 B 之间没有差异(即假设零假设为真),观察到 2% 或更大的结果有 4% 的可能性。真实差异是不可直接测量的,通过统计学可以得到合理的估计。噪声(随机性)有可能会误导我们。 统计显著性很重要,因为它反映了你的风险容忍度和信心水平。指标可能每天都在波动,统计分析为在嘈杂环境中做出业务决策提供了坚实的数学基础。 PlayFab Experiments 将 95% 置信度或 0.05 的 p 值处的指标变动标记为具有统计显著性。

样本比例不匹配 (SRM)

样本比例不匹配(称为 SRM)是一种数据质量检查,指示实验变体之间用户预期比例(例如,在实验开始前配置的)与实验结束时观察到的实际用户比例之间存在显著差异。 SRM 表示存在某些数据缺失或冗余问题,以不均匀的方式影响控制变体和处理变体。受控实验的基本原则要求处理变体和控制变体必须在统计上等效。当违反此原则时,实验结果可能会遭受选择偏差的影响。 存在 SRM 的分析被视为不可信,你不应用它做出决策。事实上,如果你的实验存在 SRM,请不要从分析中得出任何结论(除非你已经解决了 SRM)。

如何检测 SRM

以一个示例为例,其中实验配置为在控制变体和处理变体中各有 10% 的流量运行。 在此场景中,即使每种情况下两个 flight 之间的实际比例相同,随着 Treatment 和 Control 中用户计数增大,你的 p 值也越来越小。这表明观察到的结果与预期不同。

如何调查 SRM

SRM 调查和解决是一个复杂且不确定的过程。因此,解决 SRM 需要一种结构化的方法,具有全景视角,并意识到根本原因和解决策略的可能性。为此,
  • 从问题”为什么会发生这种情况?“开始
  • 对 SRM 的原因形成假设
  • 预测如果该假设为真,将观察到什么证据
  • 找到这些证据
  • 分析原因以确定解决方案
提出后续问题可以帮助调查以制定必要的解决步骤。例如:
  • 这只在一次分析/实验中发生,还是在多次中发生?
  • 处理组做什么?实验的性质是什么?
  • 现在(SRM)与之前(没有 SRM 的先前实验)之间有变化吗?
  • 视图、管道、过滤器是否发生了变化?

SRM 的常见根本原因

  • 游戏中的处理体验比控制体验崩溃得更多
  • 处理体验意外发送了不同数量的数据。例如,客户端上增加遥测缓冲区的实验肯定会增加返回的数据量,这将导致 SRM

将实验作为一种实践

  • 从假设开始 进行假设以确保实验有明确的目标和场景。此外,确保你正在测试的更改具有足够的重要性。 要形成假设,请使用以下模板: 由于观察 [A] 和反馈 [B],认为为玩家 [D] 更改 [C] 将使 [E] 发生。当我看到 [F] 并获得 [G] 时它将得到验证。
  • 正确安排实验 要获得可靠的结果,请在可比较的时间段内运行 A/B 实验。请考虑季节性高峰和低谷。
  • 实验的持续时间 为实验分配足够的时间。为实验分配的时间不足可能会使结果偏斜。如果运行时间太短,可能无法收集足够的数据点以得出具有统计准确性的结论。如果运行时间太长,可能会因未将获胜变体推广给潜在玩家而错过转化。如果你有疑问,重新测试是完全合理的。
  • 关注 flight 百分比 flight 百分比决定了你的样本大小。以正确的样本大小定位受众,否则你将无法获得可靠的结果,并且基于该数据做出的决策可能存在缺陷。
  • 避免第 1 类和第 2 类错误 实验中的统计学提供的是概率,而不是确定性。因此,它不能提供 100% 的确定性来说明实验的哪个变体最好。因此,避免第 1 类和第 2 类错误。 要避免第 1 类错误,请在做出决定之前提高所需的显著性水平(我们已经将其默认设置为 95%),并延长实验时间以收集更多数据。要减少第 2 类错误的机会,请增加实验的 flight 人群(样本大小)。
  • 不要中途更改实验 如果你在理想持续时间结束之前中断测试或引入原始假设中未包含的新变量,则结果将不可靠。也就是说,很难确定是其中一种变化导致了转化率的提升,还是仅仅是随机机会。 请注意,变体越多,你必须运行测试的时间就越长才能获得可靠的结果。采用细粒度方法。建议在任何变体组中同时试验 2-4 个变量。这可以为测试持续时间和效率提供最佳平衡。
  • 关注 p 值中反映的统计显著性 确保数据可靠。数据可靠性的度量是统计显著性,它决定了结果不是由于随机机会造成的。 p 值用于确定 A/B 实验所基于的零假设的统计显著性。它衡量收集的数据与零假设之间的兼容性。它越低,你就越可以自信地拒绝零假设。
  • 保持开放的心态 有时你可能会倾向于忽略统计信息,转而使用常规知识甚至以往经验来做出决定——无论这多么让你惊讶。如果你不被测试结果说服,请再次运行它并比较数据。

采用实验文化和流程

实验文化是有价值的。你必须将其作为其他流程的一部分吸收,以便组织内的每个人都能从中受益。持续的 A/B 实验可以显著提高转化率,因为你有更大的机会找到为玩家增加正向产品价值的方式。 你可以将决策范式从依赖 HiPPO(Highest Paid Person’s Opinion,即薪水最高者的意见)转变为以数据为驱动的选择。更多的员工想法将以测试的形式看到曙光。重要的是,当尝试想法很容易时,就要谈论结果和后续步骤。除此之外,员工感到有动力上班。 要建立实验文化,请为游戏迭代引入可靠且可重复的流程。你可以通过以下基础步骤获得持续实验的文化:
  • 设定目标 可付诸行动的实验目标(例如参与度)允许团队推进实验,而不是陷入”增长”等抽象目标中。
  • 在团队的支持下更多地测试和优先排序 收集和分析定性和定量数据,以便可以头脑风暴假设/想法并基于业务影响进行优先排序。使用可靠且可重复的框架在整个实验旅程中指导你的团队,否则,如果你突然要求团队进行更多实验和多次更改,团队会感到迷茫。
  • 将结果反馈给你的团队 通过团队沟通测试结果,围绕实验建立势头。分享为团队提供了有关如何迭代和改进未来测试的洞察。这让人们对进一步的实验充满兴奋。
  • 拥抱失败 失败是测试的一部分,让失败正常化。不要让失败阻碍实验,反思、学习并继续实验。
  • 实践良好的实验卫生 为团队运行的每个实验创建标准协议。这有助于保持实验结果准确且有意义,无论谁在控制实验。

运行实验的推荐规划流程

最后修改于 2026年8月13日