
利益相关者通常需要用户反馈来批准新的产品界面。但如果你没有时间招募一个小组怎么办?正是这种熟悉的压力推动产品团队转向一种截然不同的可用性测试方法——一种没有人类参与者的方法,称为合成用户测试。
合成用户测试使用AI参与者,这些参与者建立在涵盖消费者人口统计、心理统计和行为模式的庞大数据集之上,以模拟真实用户如何导航、反应和体验数字产品、设计或界面。与传统研究不同,它只需几分钟即可获得有意义的、类似人类的反馈。
目前,合成用户正被用于测试原型、标记摩擦点并按需模拟用户交互。在本文中,我们将列出从概念验证到发布前压力测试的使用案例,并讨论如何使用Delve AI进行合成用户测试。
在我们深入了解合成用户测试之前,我们需要谈谈合成用户。从定义上讲,合成用户是AI生成的persona或数字化身,使用人工智能和机器学习系统构建,复制真实用户的行为、偏好和决策过程。它们基于实际客户数据进行训练,可以回答研究问题、参加访谈(不是字面意义上的)并像真人一样进行可用性测试。
目前,来自Delve AI等平台的模拟用户可用于运行:
它们承诺解决用户测试的噩梦,包括但不限于参与者招募、日程冲突、预算超支和地理限制。你基本上可以以传统用户研究成本和时间的一小部分获得高质量的反馈。

(使用Delve AI为营销机构生成的合成用户面板)
当然,大多数用户体验研究人员、论坛和在线社区(如Reddit上的r/UXResearch)对此并不看好。我们稍后会讨论这些观点背后的原因。
在合成研究领域有几个术语经常被提及。然而,并非每种基于AI的测试方法都以相同的方式工作;你需要知道是什么让一种方法与其他方法不同。
目前,我们有:
其中最基本的是使用ChatGPT等平台构建的自定义 GPT。它们是围绕目标persona设计的AI模型。你定义配置文件,模型就会像那个人一样对你的产品做出响应。
严格意义上的合成用户是由LLM驱动的模型,被提示扮演个人persona或群体。它们对于模拟定性研究很有用,例如你通常从民族志研究中获得的探索性反馈。同样,合成面板反映了真实研究受众的人口统计构成。
数字孪生,如Delve AI的那些,是现有persona的虚拟副本或化身。你可以与它们互动,以预测特定细分市场将如何响应产品或信息传递的变化。

(秘鲁电信公司的客户数字孪生互动样本)
AI 智能体稍微复杂一些。它们是被编程为执行任务、做出决策并像真人一样适应环境的自主实体,用于压力测试复杂的工作流程或多步骤用户旅程。
如你所见,每种方法都有不同的用途,正确的选择取决于你是需要快速反馈还是详细的受众互动。
合成用户测试使用模拟用户来镜像真实人群,并将其部署到您的产品中,以在生命周期的每个阶段获取洞察,取代传统的可用性研究。在这里,合成用户作为特定人口统计或行为细分的成员,完整地走通流程、滚动、点击和购买产品。
然后,团队可以使用这些数据来验证原型、审核UI直观性,并定位用户失去动力的确切时刻。例如,电子商务品牌可以通过合成受访者绘制从产品发现到结账的完整路径,并找出触发购物车放弃的步骤。
一个简单的AI测试平台包括以下步骤,您需要:
完成后,合成受访者会浏览您的设计,完成给定的任务,并模拟其他交互。他们不遵循固定的脚本,而是根据经验行为模式做出动态决策。输出通常包括完整的思维记录、热图、任务成功率和关键可用性问题。
您可以在每个接触点了解用户的思维过程、目标和动机,并在投入全面的人类研究之前发现明显的可用性和功能问题。
使用适当的合成研究软件,您可以生成数百个AI参与者来回答问题并模拟边缘案例场景。目前,您可以将它们用作过滤器来测试早期阶段的原型,并进行A/B测试、理解力检查、旅程级测试等。

举例来说,让我们看看Growth Designers的案例。该团队对自己的网站进行了合成用户测试,并模拟了一个想要加入设计社区的首次访问者。反馈是即时的:
如您所见,这些都不是UX研究人员自己无法发现的问题。但AI用户在3分钟内就能完成,无需招募时间。这里的结论是什么?合成测试是早期发现明显问题和摩擦点的好方法。但是,对于不那么明显的问题,您仍然需要真人。
在UX研究中,您还可以使用合成用户来:
您可以在进行正式研究之前筛选流程、标记清晰度和导航问题,并获得方向性情感数据。一个优点是,合成用户基于匿名化、聚合的数据而不是个人客户数据运行,因此团队可以在用户旅程中运行可衡量的实验,而无需处理个人用户数据带来的合规开销。
首先想到的主要好处是速度、成本和持续反馈循环。想想看:一个正常的A/B测试可能需要数周才能看到有意义的结果,而且重复进行成本很高。合成用户缩短了时间线,并在几小时内提供可比的洞察。UX团队可以持续对每个变体运行测试,并在问题易于修复时纠正它们。

合成用户面板还可以扩展到数百个模拟参与者,并可用于以接近零的边际成本验证现有研究。它也很便宜,每百个AI研究参与者的成本约为99美元(或每个用户约0.99美元)。这种可扩展性,加上模拟任何类型人类交互的能力,为测试边缘案例和高风险流程打开了大门,否则这些测试成本太高、速度太慢或无法验证。
此外,合成受访者不受真实参与者固有偏见的影响。人类测试者通常对常见的UX流程有隐含的熟悉度。但合成受访者完全按照构建的方式与您的界面交互,这意味着他们标记的问题很可能也是您的首次用户会遇到的问题。
总的来说,合成用户测试具有足够的可扩展性,可以在决策上线前降低风险,并允许UX研究人员将精力集中在复杂问题上。难怪合成数据市场预计将从2025年的4亿美元增长到2035年的44亿美元。
合成测试在后端结合了大语言模型、persona 生成和浏览器自动化,以大规模模拟真实交互。Delve AI 的合成研究软件遵循相同的流程。
它按以下顺序包括三个步骤:
对于初学者,您可以选择我们的 研究 persona 工具,从您的研究数据(调查记录、用户访谈、市场报告等)生成 AI 驱动的 persona。
只需登录 Delve AI,访问 研究 persona 仪表板,指定您的细分市场,并上传您的研究文件。除了您的受众描述外,您还可以选择设置性别和地理位置等因素的分布(例如,性别:女性,30%)。

然后,该工具将使用 AI 和机器学习系统为您的品牌生成 ユーザーペルソナ。作为参考,我们为 Nike 生成了 ユーザーペルソナ。

每个 persona 都为您提供目标受众细分市场的 360 度视图,并提供有关用户人口统计(年龄、性别、地理位置、职业概况)、心理特征(目标、需求、动机、挑战)、行为(购买触发因素、障碍)、偏好(渠道、社交网络、品牌)等方面的定量和定性洞察。
您可以在此处找到完整的 persona 属性列表。
Persona 创建后的第二步是合成用户生成。因此,在创建您的 persona 后,访问 合成研究软件,并从侧边栏菜单中选择 面板。

到达那里后,按照以下步骤创建合成面板:
合成研究软件将在几分钟内为您创建合成受访者。您可以查看他们的基本人口统计详细信息——例如,B2C 用户的姓名、年龄、营销世代、地理位置,以及 B2B 用户的职位和公司名称——如果有灵感,您还可以单独与他们聊天。

由于这些用户来源于您的 persona,而 persona 基于用户数据和客户反馈,因此他们可以像其他任何人一样模拟人类行为(即您的用户和买家)。该面板可用于运行:
在开始之前,您需要确定此练习的目标是什么。例如,您是想测试网站导航、优化转化漏斗,还是改善整体用户体验?为了向您展示该流程的工作原理,我们将创建一项研究,以确定 Nike 的过滤相关 UI 摩擦和 SKU 繁重的认知过载。
在合成研究仪表板中,转到研究并点击"创建新研究"。您将看到需要完成的三个步骤:面板、问题和文件上传。
首先,在面板中:
在任务中,您可以添加要测试的网站/页面的 URL,或通过文件上传上传相关的设计文件。注意:添加任务场景和停止条件(即您希望用户何时停止测试)是完全可选的。
您还可以添加任何测试后问题,希望在用户完成练习后向他们提问(最后您将获得访谈记录)。

合成受访者将连接到真实的浏览器环境,与实际呈现的页面进行交互并执行真实操作。他们像真实用户一样应用推理和逻辑来完成任务。我们的系统捕获所有这些数据,并在测试完成后将其显示在仪表板上。
您可以按受访者或主旅程(所有用户的步骤都映射到一个单一的、连贯的用户旅程)查看 旅程 选项卡。
受访者视图将向您显示各个触点,以及用户情绪(例如,快乐、平静、沮丧)、操作和想法(您通常在主持会议中提取的思考出声评论)。您还可以获得屏幕截图,显示他们点击的位置以及他们喜欢或不喜欢的区域。

在主旅程视图中,除了屏幕截图外,您还可以在旅程的每个阶段获得热图。因为热图汇总了整个面板的注意力和点击活动,它们向您展示了单个会话无法展示的内容:哪些元素吸引焦点,哪些被忽略,以及用户聚集在哪里。
例如,在 Nike 研究中,儿童鞋列表页面上的热图显示注意力主要集中在左侧过滤器侧边栏的两个点上,确认用户正在过滤选项,而不是浏览它们。

报告 选项卡包括用户测试的执行摘要,其中包含关键合成洞察、可用性和可访问性反馈、用户界面的启发式评估以及建议的后续行动。
在 Nike 研究中,我们有三个反复出现的主题:不相关的过滤结果、模糊的产品描述迫使用户进入"查看产品详情"只是为了确认闭合类型,以及技术故障,包括缺失的产品图片和"添加到购物袋"时的安全错误。

其中包括一个过滤器侧边栏,需要大量滚动才能越过幼儿尺码,以及重复循环点击产品、滚动、打开详情并导航返回,因为结果列表和初始产品页面都无法区分魔术贴带和弹性鞋带。

Nike 报告提出了由于过滤器后仍出现不相关项目而导致的认知过载(关于可预测导航和清晰内容识别的 WCAG 问题),以及阻止用户依赖视觉线索的缺失产品图片。

我们的研究引用了系统与现实世界匹配失败(用户寻找"魔术贴",系统显示"钩环"或"EasyOn"),灵活性和效率问题(滚动越过婴儿/幼儿尺码才能到达 3Y),以及错误预防崩溃(安全错误中断转化漏斗)。

对于 Nike,这意味着审核产品标记,以便尺寸和样式过滤器仅返回相关结果,在列表页面产品卡上添加闭合类型徽章,以便用户无需打开每个产品即可验证,以及调查"添加到购物袋"安全触发器以及导致产品图片空白的延迟加载或 CDN 问题。

您可以使用此信息来调整用户流程、布局元素和导航功能。最好的部分是,您可以在每次迭代后重新运行研究,并使用新数据持续更新您的合成用户。除了可用性测试外,我们的合成用户测试平台还可以模拟用户旅程、验证布局更改,并跨不同人口统计和 persona 配置文件测试功能,以为产品开发提供信息。
根据Nielsen Norman Group的一篇文章,"合成用户……能够捕捉人类行为的总体趋势,但无法捕捉效果的幅度或人类数据的可变性。"这是UX研究人员、营销人员和Reddit用户反对合成测试的最大论据之一。
情感、深度和不可预测性。
合成用户行为基于匿名化的聚合数据,而非任何个人的实际生活经验。用户缺乏真实生活背景,其可预测性与实际人类不同,并且难以代表真实的人类状况、情感和观点。
此外,他们不会感到愤怒或沮丧,而是按照逻辑运作。正常人并不符合逻辑;他们根据因心情和情境而异的偏好做出决定。您会注意到,在许多合成研究工具中,虽然定量回答的准确率达到80-90%,但主观问题往往与人类回答不匹配。
偏见、数据和准确性。
合成用户是通常基于过去数据构建的概率引擎,这限制了它们形成新观点或预测未来用户行为的能力。它们对提示和数据质量高度敏感。训练数据中已经存在的任何偏见或不准确性都会在研究结果中被放大。
准确性也是一个问题。根据最近的研究,AI参与者倾向于肯定地回答问题,总是提供积极反馈,即使真实客户会更加挑剔。
道德和透明度。
除了输出准确性之外,合成测试还引发了可能削弱研究本身质量的道德问题。如果合成数据正在为决策提供信息,受影响的人应该知道这一点;将其冒充为来自真实用户的数据,即使是无意的,也是一种公司需要警惕的虚假陈述。
目前,如果您没有时间、预算或内部专业知识来进行适当的可用性研究,合成用户测试非常有用。在您投入实际研究之前,它可以作为压力测试概念的起点,但绝对不应该单独用于做出高风险决策。
毕竟,合成用户研究旨在补充真实的人类研究。它应该是众多输入之一,而不是最终的决策因素。
为了在实践中保持这种平衡,请始终:
最佳方式是采用混合研究方法,使用 AI persona 来缩小值得通过真实用户验证的范围。从小规模开始,严格验证您的合成数据,并对其来源保持透明。
准备开始合成用户测试了吗?注册 Delve AI 的 合成研究 软件!
合成用户可以处理您与真实参与者进行的大多数相同测试类型,例如A/B测试、理解力检查、旅程级测试、原型测试和用户流程演练。它们特别适用于功能回归测试和快速合理性检查,以过滤掉令人困惑的设计。
合成用户是AI生成的personas,模拟人在使用产品时可能的思考、反应和行为方式。它们模仿真实用户数据中发现的模式,但没有任何实际的人类体验、情感或观点。真实用户为您提供真实的行为和您无法预先设定的惊喜;合成用户为您提供速度、规模以及捕捉早期问题的低成本方式。
AI并没有取代UX研究;它正在重塑它。合成测试擅长加速早期阶段的迭代并捕捉明显的问题,但它无法取代通过观察真实人类在使用您的产品时遇到困难(或感到愉悦)所获得的同理心、背景和洞察。目前,大多数团队使用AI来处理重复性的早期漏斗测试,以便研究人员可以将更多时间花在复杂的工作上。
这个领域仍然是新的,但越来越多的平台提供合成用户测试,例如Delve AI、Synthetic Users和Uxia。
是的,因为合成测试跳过了参与者招募并缩短了研究时间。一个测试100个用户的合成会话可能花费约100美元并在几分钟内完成,而同等的传统研究可能轻易花费数千美元并需要数月才能完成。