
ステークホルダーは、新しい製品インターフェースを承認するために、しばしばユーザーフィードバックを必要とします。しかし、パネルを募集する時間がない場合はどうすればよいでしょうか?これは、製品チームを根本的に異なるユーザビリティテストのアプローチ、つまり人間の参加者を必要としない合成ユーザーテストへと駆り立てる、おなじみのプレッシャーです。
合成ユーザーテストは、消費者の人口統計、心理統計、行動パターンにまたがる膨大なデータセットに基づいて構築されたAI参加者を使用して、実際の人々がデジタル製品、デザイン、またはインターフェースをどのようにナビゲートし、反応し、体験するかを近似します。従来の調査とは異なり、意味のある人間らしいフィードバックを得るのにわずか数分しかかかりません。
現在、合成ユーザーは、プロトタイプのテスト、摩擦ポイントのフラグ付け、オンデマンドでのユーザーインタラクションのシミュレーションに使用されています。この記事では、コンセプト検証からローンチ前のストレステストまでのユースケースをリストアップし、Delve AIを使用して合成ユーザーテストを実施する方法について説明します。
合成ユーザーテストに入る前に、合成ユーザーについて話す必要があります。定義上、合成ユーザーは、人工知能と機械学習システムを使用して構築されたAI生成のペルソナまたはデジタルアバターであり、実際のユーザーの行動、好み、意思決定プロセスを再現します。これらは実際の顧客データでトレーニングされており、調査の質問に答えたり、インタビューに参加したり(文字通りではありませんが)、実際の人々のようにユーザビリティテストを受けたりすることができます。
現在、Delve AIのようなプラットフォームからのシミュレートされたユーザーは、次のことを実行するために使用できます:
これらは、参加者の募集、スケジュールの競合、予算超過、地理的制限など、ユーザーテストの悪夢を解消することを約束します。基本的に、従来のユーザー調査のコストと時間のほんの一部で質の高いフィードバックを得ることができます。

(Delve AIを使用して生成されたマーケティングエージェンシーの合成ユーザーパネル)
もちろん、ほとんどのUXリサーチャー、フォーラム、オンラインコミュニティ(Redditのr/UXResearchなど)は、それについてあまり良く思っていません。これらの感情の背後にある理由については後で説明します。
合成調査の分野では、いくつかの用語が使われています。しかし、すべてのAIベースのテスト方法が同じように機能するわけではありません。あるものを他のものと異なるものにしているものを知る必要があります。
現在、次のものがあります:
最も基本的なものは、ChatGPTのようなプラットフォームを使用して構築されたカスタムGPTです。これらは、ターゲットペルソナを中心に設計されたAIモデルです。プロファイルを定義すると、モデルはその人物として製品に応答します。
厳密な意味での合成ユーザーは、個々のペルソナまたはグループとしてロールプレイするようにプロンプトされたLLM駆動モデルです。これらは、エスノグラフィック研究から通常得られる探索的フィードバックなど、定性的調査をシミュレートするのに役立ちます。同様に、合成パネルは、実際の調査対象者の人口統計構成を反映します。
Delve AIのようなデジタルツインは、既存のペルソナの仮想レプリカまたはアバターです。それらと対話して、特定のセグメントが製品やメッセージングの変更にどのように反応するかを予測できます。

(ペルーの通信会社の顧客 デジタルツインインタラクションサンプル)
AIエージェントは少し複雑です。これらは、複雑なワークフローや複数ステップのユーザージャーニーをストレステストするために、実際の人間のようにタスクを実行し、意思決定を行い、環境に適応するようにプログラムされた自律的なエンティティです。
ご覧のとおり、各方法は異なる目的を果たしており、適切な選択は、迅速なフィードバックが必要か、詳細なオーディエンスインタラクションが必要かによって異なります。
合成ユーザーテストは、実際の人々を模倣したシミュレートされたユーザーを使用し、製品全体に展開してライフサイクルのあらゆる段階で洞察を得る手法であり、従来のユーザビリティ調査に代わるものです。ここでは、合成ユーザーが特定の人口統計学的または行動的セグメントのメンバーとして、完全なフローをたどり、スクロール、クリック、製品の購入を行います。
チームはこのデータを使用してプロトタイプを検証し、UIの直感性を監査し、ユーザーが勢いを失う正確な瞬間を特定できます。たとえば、eコマースブランドは、製品発見からチェックアウトまでの完全なパスをマッピングし、合成ユーザーを使用してカート放棄を引き起こすステップを特定できます。
シンプルなAIテストプラットフォームには、次のステップが含まれます:
完了すると、合成ユーザーがデザインを確認し、与えられたタスクを完了し、その他のインタラクションをシミュレートします。彼らは決められた台本に従うのではなく、経験的な行動パターンに基づいて動的な決定を下します。出力には通常、完全な思考トランスクリプト、ヒートマップ、タスク成功率、重要なユーザビリティの問題が含まれます。
すべてのタッチポイントでユーザーの思考プロセス、目標、動機を知ることができ、本格的な人間による調査研究にコミットする前に、明らかなユーザビリティと機能性の問題を発見できます。
適切な合成リサーチソフトウェアを使用すると、数百のAI参加者を生成して質問に答えさせ、エッジケースシナリオをシミュレートできます。現在、これらを初期段階のプロトタイプをテストし、A/Bテスト、理解度チェック、ジャーニーレベルのテストなどを実施するためのフィルターとして使用できます。

例を挙げると、Growth Designersのケースを見てみましょう。チームは自社のウェブサイトでsynthetic user testを実行し、デザインコミュニティに参加したい初めての訪問者をシミュレートしました。フィードバックは即座に得られました:
ご覧のとおり、これらはUXリサーチャーが自分で発見できない問題ではありません。しかし、AIユーザーは3分以内に、採用時間ゼロでこれを実行します。ここでの結論は?合成テストは、明らかな問題と摩擦ポイントを早期に発見するための優れた方法です。ただし、それほど明らかでない問題には、やはり人間が必要です。
UXリサーチでは、合成ユーザーをさらに次のように使用できます:
正式な調査を実施する前に、フローを絞り込み、明確性とナビゲーションの問題にフラグを立て、方向性のあるセンチメントデータを取得できます。プラス点は、合成ユーザーが個々の顧客データではなく、匿名化された集約データで動作するため、チームは個人ユーザーデータに伴うコンプライアンスのオーバーヘッドをナビゲートすることなく、ユーザージャーニー全体で測定可能な実験を実行できることです。
思い浮かぶ主なメリットは、スピード、コスト、継続的なフィードバックループです。考えてみてください:通常のA/Bテストは、意味のある結果が得られるまでに数週間かかることがあり、繰り返すのは高価です。合成ユーザーはそのタイムラインを短縮し、数時間で同等の洞察を提供します。UXチームは、すべてのバリエーションで継続的にテストを実行し、修正が容易な間に問題を修正できます。

合成ユーザーパネルは、数百のシミュレートされた参加者にスケールでき、ほぼゼロの限界費用で既存の調査を検証するために活用できます。コストも安く、100人のAIリサーチ参加者あたり約99ドル(またはユーザーあたり約0.99ドル)です。このスケーラビリティと、あらゆる種類の人間のインタラクションをシミュレートする能力を組み合わせることで、他の方法では高価すぎる、遅すぎる、または検証不可能なエッジケースやリスクの高いフローをテストする扉が開かれます。
合成ユーザーは、実際の参加者に固有のバイアスからも解放されています。人間のテスターは、一般的なUXフローに対する暗黙の親しみをもたらすことがよくあります。しかし、合成ユーザーは、構築されたとおりにインターフェースとインタラクトします。つまり、彼らがフラグを立てる問題は、初めてのユーザーも遭遇する可能性が高いものです。
全体として、合成ユーザーテストは、決定が実行される前にリスクを軽減するのに十分なスケーラビリティがあり、UXリサーチャーが複雑な問題に努力を集中できるようにします。Synthetic dataマーケットが2025年の4億ドルから2035年までに44億ドルに成長すると予測されているのも不思議ではありません。
シンセティックテストは、LLM、ペルソナ生成、ブラウザ自動化をバックエンドで組み合わせて、実際のインタラクションを大規模にシミュレートします。Delve AIのシンセティックリサーチソフトウェアは同じプロセスに従います。
以下の順序で3つのステップが含まれます:
初心者の方は、リサーチペルソナツールを選択して、リサーチデータ(調査トランスクリプト、ユーザーインタビュー、市場レポートなど)からAI駆動のペルソナを生成できます。
Delve AIにログインし、リサーチペルソナダッシュボードにアクセスし、セグメントを指定して、リサーチファイルをアップロードするだけです。オーディエンスの説明に加えて、性別や場所などの要因にわたる分布を設定するオプションも得られます(例:性別:女性、30%)。

このツールは、AIと機械学習システムを使用してブランドのユーザーペルソナを生成します。参考までに、Nikeのユーザーペルソナを生成しました。

各ペルソナは、ターゲットオーディエンスセグメントの360度ビューを提供し、ユーザーデモグラフィックス(年齢、性別、場所、キャリアプロフィール)、サイコグラフィックス(目標、ニーズ、動機、課題)、行動(購買トリガー、障壁)、好み(チャネル、ソーシャルネットワーク、ブランド)などに関する定量的および定性的インサイトの両方を提供します。
完全なペルソナアトリビュートのリストはこちらで確認できます。
ペルソナ作成後の2番目のステップは、シンセティックユーザー生成です。ペルソナを作成したら、シンセティックリサーチソフトウェアにアクセスし、サイドバーメニューからパネルを選択します。

そこで、シンセティックパネルを作成するために以下の手順に従ってください:
シンセティックリサーチソフトウェアは、数分でシンセティック回答者を作成します。基本的なデモグラフィック詳細(例:名前、年齢、マーケティング世代、B2Cユーザーの場所、さらにB2Bユーザーの役職と会社名)を確認でき、インスピレーションが湧いた場合は個別にチャットすることもできます。

これらのユーザーは、ユーザーデータとカスタマーフィードバックに基づいたペルソナから派生しているため、他の何よりも人間の行動(つまり、ユーザーとバイヤー)を模倣できます。このパネルは以下を実行するために使用できます:
開始する前に、この演習の目的を明確にする必要があります。たとえば、サイトナビゲーションをテストしたいのか、コンバージョンファネルを改善したいのか、ユーザーエクスペリエンス全体を改善したいのか?プロセスの仕組みを示すために、Nikeのフィルタリング関連のUI摩擦とSKU過多の認知的過負荷を判断するための調査を作成します。
シンセティックリサーチダッシュボードで、調査に移動し、「新しい調査を作成」をクリックします。完了すべき3つのステップが表示されます:パネル、質問、ファイルアップロード。
まず、パネルで:
タスクでは、テストしたいサイト/ページのURLを追加するか、ファイルアップロード経由で関連するデザインファイルをアップロードできます。注:タスクシナリオと停止条件(つまり、ユーザーにテストを停止してもらいたいタイミング)を追加することは完全にオプションです。
演習が終了した後にユーザーに尋ねたいテスト後の質問を追加することもできます(最後にインタビュートランスクリプトを取得します)。

シンセティック回答者は、実際のブラウザ環境に接続して、実際にレンダリングされたページと対話し、実際のアクションを実行します。彼らは実際のユーザーと同じように推論とロジックを適用してタスクを完了します。当社のシステムは、このすべてのデータをキャプチャし、テストが完了した後にダッシュボードに表示します。
ジャーニータブを回答者別またはマスタージャーニー(すべてのユーザーのステップが1つの一貫したユーザージャーニーにマッピングされる)で表示できます。
回答者ビューには、個々のタッチポイントが、ユーザーの感情(例:幸せ、落ち着いている、イライラしている)、アクション、思考(通常はモデレートされたセッションで抽出する思考発話コメンタリー)とともに表示されます。また、クリックした場所や好き嫌いの領域を示すスクリーンショットも取得できます。

マスタージャーニービューでは、ジャーニーの各段階でスクリーンショットに加えてヒートマップを取得できます。ヒートマップはパネル全体の注意とクリック活動を集約するため、個々のセッションでは示せないことを示します:どの要素が焦点を引き、どれが無視され、ユーザーがどこに集まるか。
たとえば、Nike調査では、キッズシューズリストページのヒートマップは、左側のフィルターサイドバーの2つのポイントに大きな注意が向けられていることを示しており、ユーザーがオプションを閲覧するのではなくフィルタリングしていたことを確認しています。

レポートタブには、ユーザーテストのエグゼクティブサマリーが含まれており、主要なシンセティックインサイト、ユーザビリティとアクセシビリティのフィードバック、ユーザーインターフェースのヒューリスティック評価、推奨されるフォローアップが含まれています。
Nike調査では、3つの繰り返しテーマがあります:無関係なフィルター結果、ユーザーが閉じ方のタイプを確認するためだけに「製品詳細を表示」に移動せざるを得なかった曖昧な製品説明、および製品画像の欠落と「カートに追加」時のセキュリティエラーを含む技術的な不具合。

これには、幼児サイズを通過するための広範なスクロールを伴うフィルターサイドバー、および結果リストも最初の製品ページもマジックテープストラップと伸縮性のあるレースを区別しなかったため、製品をクリックし、スクロールし、詳細を開き、戻るという繰り返しループが含まれていました。

Nikeのレポートでは、フィルターをかけているにもかかわらず関連性のない商品が表示されることによる認知的な負荷の増大(予測可能なナビゲーションと明確なコンテンツ識別に関するWCAGの懸念事項)、そして視覚的な手がかりに頼れなくなる商品画像の欠落が指摘されました。

今回の調査では、システムと実世界の不一致(ユーザーは「Velcro(ベルクロ)」を探すが、システムは「Hook-and-loop」や「EasyOn」と表示する)、柔軟性と効率性の問題(3歳児サイズにたどり着くために乳幼児サイズをスクロールして通り過ぎる必要がある)、そしてエラー防止の欠如(セキュリティエラーがコンバージョンファネルを中断させる)が指摘されました。

Nikeの場合、それはサイズやスタイルのフィルターが関連性の高い結果のみを返すよう商品タグ付けを見直すこと、ユーザーが確認のために各商品を開かなくても済むよう一覧ページの商品カードに留め具タイプのバッジを追加すること、そして「バッグに追加」時のセキュリティトリガーと、商品画像が空白になる原因となっている遅延読み込みやCDNの問題を併せて調査することを意味します。

この情報を活用することで、ユーザーフロー、レイアウト要素、ナビゲーション機能を調整できます。何より優れているのは、各イテレーションの後に調査を再実行し、新しいデータで合成ユーザーを継続的に更新できる点です。ユーザビリティテストに加えて、当社の合成ユーザーテストプラットフォームは、ユーザージャーニーのシミュレーション、レイアウト変更の検証、さまざまな人口統計やペルソナプロファイルにわたる機能テストを行い、製品開発に役立てることができます。
Nielsen Norman Groupの投稿によると、「合成ユーザーは…人間の行動における一般的な傾向を捉えますが、効果の大きさや人間データの変動性を捉えることには失敗します。」これは、UXリサーチャー、マーケター、そしてRedditユーザーによる合成テストに対する最大の反論の一つです。
感情、深さ、予測不可能性。
合成ユーザーの行動は、匿名化され集約されたデータに基づいており、個々の実際の経験に基づいているわけではありません。ユーザーは現実の文脈を欠き、実際の人々とは異なる予測可能な方法で動作し、実際の人間の状態、感情、意見を表現することが困難です。
さらに、彼らは怒りや欲求不満を感じず、論理的に動作します。普通の人々は論理的ではありません。彼らは気分や文脈によって変化する好みに基づいて意思決定を行います。多くの合成リサーチツールでは、定量的な回答の精度が80-90%である一方で、主観的な質問は人間の回答と一致しないことがよくあることに気づくでしょう。
バイアス、データ、精度。
合成ユーザーは通常、過去のデータに基づいて構築された確率エンジンであり、新しい意見を形成したり、将来のユーザー行動を予測する能力が制限されています。彼らはプロンプトとデータの質に非常に敏感です。トレーニングデータに既に存在するバイアスや不正確さは、研究結果において増幅されます。
精度も問題です。最近の研究によると、AI参加者は質問に肯定的に答える傾向があり、実際の顧客がより批判的である場合でも、常に肯定的なフィードバックを提供します。
倫理と透明性。
出力の精度を超えて、合成テストは研究自体の質を損なう可能性のある倫理的な問題を提起します。合成データが意思決定に影響を与えている場合、影響を受ける人々はそれを知る権利があります。それを実際のユーザーからのデータとして偽ること、たとえ意図的でなくても、企業が警戒すべき虚偽表示の一形態です。
現在、合成ユーザーテストは、適切なユーザビリティ調査を行うための時間、予算、または社内の専門知識がない場合に非常に役立ちます。実際の調査にコミットする前にコンセプトを圧力テストするための出発点となりますが、単独で重要な意思決定を行うために使用すべきではありません。
結局のところ、合成ユーザー調査は、真の人間による調査を補完するためのものです。多くのインプットの1つであるべきであり、最終的な意思決定要因ではありません。
このバランスを実践で保つために、常に以下を行ってください:
最善の方法は、ハイブリッド調査アプローチを採用することです。つまり、AI ペルソナを使用して、実際の人々で検証する価値があるものを絞り込みます。小さく始め、合成データを厳密に検証し、それがどこから来たのかについて透明性を保ちましょう。
合成ユーザーテストを始める準備はできましたか? delve aiの合成リサーチソフトウェアにサインアップしてください!
シンセティックユーザーは、実際の参加者と同じように、A/Bテスト、理解度チェック、ジャーニーレベルのテスト、プロトタイプテスト、ユーザーフローのウォークスルーなど、ほとんどのテストタイプを処理できます。特に機能的なリグレッションテストや、わかりにくいデザインをフィルタリングするための簡単なサニティチェックに便利です。
シンセティックユーザーは、製品を使用する際に人がどのように考え、反応し、行動するかをシミュレートするAI生成のpersonasです。実際のユーザーデータに見られるパターンをエミュレートしますが、実際の人間の経験、感情、意見は持っていません。実際のユーザーは、スクリプト化できなかった本物の行動と驚きを提供します。シンセティックユーザーは、スピード、スケール、そして初期の問題を発見するための低コストな方法を提供します。
AIはUXリサーチに取って代わるのではなく、再形成しています。シンセティックテストは、初期段階のイテレーションを加速し、明らかな問題を発見するのに優れていますが、実際の人間があなたの製品で苦労する(または喜ぶ)様子を観察することから得られる共感、コンテキスト、インサイトに取って代わることはできません。現在、ほとんどのチームは、研究者がより複雑な作業に時間を費やせるように、反復的な初期段階のテストをAIに処理させています。
この分野はまだ新しいですが、Delve AI、Synthetic Users、Uxiaなど、シンセティックユーザーテストを提供するプラットフォームが増えています。
はい、シンセティックテストは参加者の募集をスキップし、リサーチのタイムラインを短縮するためです。100人のユーザーをテストするシンセティックセッションは約100ドルで、数分で完了する可能性がありますが、同等の従来の調査は数千ドルのコストがかかり、完了までに数ヶ月かかる可能性があります。