
이해관계자들은 새로운 제품 인터페이스를 승인하기 위해 사용자 피드백이 필요한 경우가 많습니다. 하지만 패널을 모집할 시간이 없다면 어떻게 해야 할까요? 이는 제품 팀을 사용성 테스트에 대한 근본적으로 다른 접근 방식, 즉 인간 참가자 없이 진행하는 합성 사용자 테스트로 이끄는 익숙한 종류의 압박입니다.
합성 사용자 테스트는 소비자 인구통계, 심리통계 및 행동 패턴에 걸친 방대한 데이터셋을 기반으로 구축된 AI 참가자를 사용하여 실제 사람들이 디지털 제품, 디자인 또는 인터페이스를 탐색하고, 반응하고, 경험하는 방식을 근사화합니다. 기존 리서치와 달리 의미 있고 인간과 유사한 피드백을 얻는 데 몇 분밖에 걸리지 않습니다.
현재 합성 사용자는 프로토타입 테스트, 마찰 지점 표시, 주문형 사용자 상호작용 시뮬레이션에 사용되고 있습니다. 이 글에서는 컨셉 검증부터 출시 전 스트레스 테스트에 이르기까지 사용 사례를 나열하고 delve ai를 사용하여 합성 사용자 테스트를 수행하는 방법에 대해 논의하겠습니다.
합성 사용자 테스트에 대해 알아보기 전에 합성 사용자에 대해 이야기해야 합니다. 정의상 합성 사용자는 인공지능 및 머신러닝 시스템을 사용하여 구축된 AI 생성 페르소나 또는 디지털 아바타로, 실제 사용자 행동, 선호도 및 의사결정 프로세스를 복제합니다. 실제 고객 데이터로 학습되며 리서치 질문에 답하고, 인터뷰에 참여하고(문자 그대로는 아니지만), 실제 사람처럼 사용성 테스트를 받을 수 있습니다.
현재 delve ai와 같은 플랫폼의 시뮬레이션된 사용자는 다음을 실행하는 데 사용할 수 있습니다:
참가자 모집, 일정 충돌, 예산 초과, 지리적 제한을 포함하되 이에 국한되지 않는 사용자 테스트의 악몽을 해결할 것을 약속합니다. 기본적으로 기존 사용자 리서치의 비용과 시간의 일부만으로 양질의 피드백을 얻을 수 있습니다.

(delve ai를 사용하여 생성된 마케팅 에이전시의 합성 사용자 패널)
물론 대부분의 UX 리서처, 포럼 및 온라인 커뮤니티(예: Reddit의 r/UXResearch)는 이에 대해 긍정적으로 생각하지 않습니다. 이러한 정서 뒤에 있는 이유는 나중에 다루겠습니다.
합성 리서치 분야에서 사용되는 몇 가지 용어가 있습니다. 그러나 모든 AI 기반 테스트 방법이 동일하게 작동하는 것은 아닙니다. 무엇이 하나를 다른 것과 다르게 만드는지 알아야 합니다.
현재 우리는 다음을 가지고 있습니다:
가장 기본적인 것은 ChatGPT와 같은 플랫폼을 사용하여 구축된 커스텀 GPT입니다. 이들은 타겟 페르소나를 중심으로 설계된 AI 모델입니다. 프로필을 정의하면 모델이 그 사람처럼 제품에 응답합니다.
엄격한 의미에서 합성 사용자는 개별 페르소나 또는 그룹으로 역할극을 하도록 프롬프트된 LLM 기반 모델입니다. 민족지학적 연구에서 일반적으로 얻을 수 있는 탐색적 피드백과 같은 정성적 리서치를 시뮬레이션하는 데 유용합니다. 마찬가지로 합성 패널은 실제 리서치 청중의 인구통계학적 구성을 반영합니다.
delve ai의 것과 같은 디지털 트윈은 기존 페르소나의 가상 복제본 또는 아바타입니다. 특정 세그먼트가 제품이나 메시징의 변경에 어떻게 반응할지 예측하기 위해 상호작용할 수 있습니다.

(페루 통신회사의 고객 디지털 트윈 상호작용 샘플)
AI 에이전트는 조금 더 복잡합니다. 복잡한 워크플로우나 다단계 사용자 여정을 스트레스 테스트하기 위해 실제 사람처럼 작업을 수행하고, 결정을 내리고, 환경에 적응하도록 프로그래밍된 자율 엔티티입니다.
보시다시피 각 방법은 다른 목적을 제공하며, 올바른 선택은 빠른 피드백이 필요한지 아니면 상세한 청중 상호작용이 필요한지에 따라 달라집니다.
합성 사용자 테스트는 실제 사람을 모방한 시뮬레이션 사용자를 사용하여 제품 전반에 배치하고 라이프사이클의 모든 단계에서 인사이트를 얻으며, 기존의 사용성 연구를 대체합니다. 여기서 합성 사용자는 특정 인구통계학적 또는 행동 세그먼트의 구성원으로서 완전한 플로우를 거치며 스크롤하고, 클릭하고, 제품을 구매합니다.
그런 다음 팀은 이 데이터를 사용하여 프로토타입을 검증하고, UI 직관성을 감사하며, 사용자가 추진력을 잃는 정확한 순간을 찾아낼 수 있습니다. 예를 들어, 전자상거래 브랜드는 제품 발견부터 결제까지의 전체 경로를 매핑하고 합성 응답자를 통해 장바구니 이탈을 유발하는 단계를 발견할 수 있습니다.
간단한 AI 테스팅 플랫폼은 다음 단계를 포함합니다:
완료되면 합성 응답자가 디자인을 살펴보고 주어진 작업을 완료하며 다른 상호작용을 시뮬레이션합니다. 그들은 정해진 스크립트를 따르지 않고 경험적 행동 패턴을 기반으로 동적 결정을 내립니다. 결과물에는 일반적으로 전체 사고 기록, 히트맵, 작업 성공률 및 중요한 사용성 문제가 포함됩니다.
모든 터치포인트에서 사용자의 사고 과정, 목표 및 동기를 알게 되고, 본격적인 인간 연구에 착수하기 전에 명백한 사용성 및 기능 문제를 발견할 수 있습니다.
적절한 합성 연구 소프트웨어를 사용하면 수백 명의 AI 참가자를 생성하여 질문에 답하고 엣지 케이스 시나리오를 시뮬레이션할 수 있습니다. 현재 초기 단계 프로토타입을 테스트하고 A/B 테스트, 이해도 확인, 여정 수준 테스트 등을 수행하는 필터로 사용할 수 있습니다.

예를 들어, Growth Designers의 사례를 살펴보겠습니다. 팀은 자체 웹사이트에 대한 합성 사용자 테스트를 실행하고 디자인 커뮤니티에 가입하려는 첫 방문자를 시뮬레이션했습니다. 피드백은 즉각적이었습니다:
보시다시피, 이것들은 UX 연구자들이 스스로 발견할 수 없는 문제가 아닙니다. 하지만 AI 사용자는 채용 시간 없이 3분 이내에 이를 수행합니다. 여기서 결론은? 합성 테스팅은 초기에 명백한 문제와 마찰 지점을 포착하는 훌륭한 방법입니다. 그러나 그다지 명백하지 않은 문제에는 여전히 사람이 필요합니다.
UX 연구에서 합성 사용자를 추가로 사용하여 다음을 수행할 수 있습니다:
공식 연구를 진행하기 전에 플로우를 선별하고, 명확성 및 탐색 문제를 표시하며, 방향성 있는 감정 데이터를 얻을 수 있습니다. 장점은 합성 사용자가 개별 고객 데이터가 아닌 익명화되고 집계된 데이터로 작동하므로, 팀이 개인 사용자 데이터에 수반되는 규정 준수 오버헤드를 탐색하지 않고도 사용자 여정 전반에 걸쳐 측정 가능한 실험을 실행할 수 있다는 것입니다.
가장 먼저 떠오르는 이점은 속도, 비용 및 지속적인 피드백 루프입니다. 생각해보세요: 일반적인 A/B 테스트는 의미 있는 결과를 보기까지 몇 주가 걸릴 수 있으며, 반복하는 데 비용이 많이 듭니다. 합성 사용자는 해당 타임라인을 단축하고 몇 시간 내에 비교 가능한 인사이트를 제공합니다. UX 팀은 모든 변형에 대해 지속적으로 테스트를 실행하고 수정하기 쉬운 동안 문제를 해결할 수 있습니다.

합성 사용자 패널은 또한 수백 명의 시뮬레이션 참가자로 확장할 수 있으며 거의 제로에 가까운 한계 비용으로 기존 연구를 검증하는 데 활용될 수 있습니다. 비용도 저렴하여 AI 연구 참가자 100명당 약 $99(또는 사용자당 ~ $0.99)입니다. 이러한 확장성은 모든 종류의 인간 상호작용을 시뮬레이션하는 능력과 결합되어 비용이 너무 많이 들거나 느리거나 검증이 불가능한 엣지 케이스 및 고위험 플로우를 테스트할 수 있는 문을 엽니다.
합성 응답자는 실제 참가자에게 내재된 편향으로부터 추가로 자유롭습니다. 인간 테스터는 종종 일반적인 UX 플로우에 대한 암묵적인 친숙함을 가지고 있습니다. 하지만 합성 응답자는 구축된 그대로 인터페이스와 상호작용하므로, 그들이 표시하는 문제는 첫 사용자도 마주칠 가능성이 높은 문제입니다.
전반적으로 합성 사용자 테스팅은 라이브 전에 의사결정의 위험을 줄이고 UX 연구자가 복잡한 문제에 노력을 집중할 수 있을 만큼 확장 가능합니다. 합성 데이터 시장이 2025년 4억 달러에서 2035년까지 44억 달러로 성장할 것으로 예상되는 것은 놀라운 일이 아닙니다.
합성 테스팅은 LLM, 페르소나 생성 및 브라우저 자동화를 백엔드에서 결합하여 실제 상호작용을 대규모로 시뮬레이션합니다. Delve AI의 합성 리서치 소프트웨어는 동일한 프로세스를 따릅니다.
다음 순서로 세 단계가 포함됩니다:
초보자의 경우 연구 페르소나 도구를 선택하여 연구 데이터(설문조사 기록, 사용자 인터뷰, 시장 보고서 등)에서 AI 기반 페르소나를 생성할 수 있습니다.
Delve AI에 로그인하고 연구 페르소나 대시보드를 방문하여 세그먼트를 지정하고 연구 파일을 업로드하기만 하면 됩니다. 청중 설명 외에도 성별 및 위치와 같은 요소에 대한 분포를 설정할 수 있는 옵션이 있습니다(예: 성별: 여성, 30%).

그러면 도구는 AI 및 머신러닝 시스템을 사용하여 브랜드의 사용자 페르소나를 생성합니다. 참고로 Nike의 사용자 페르소나를 생성했습니다.

각 페르소나는 타겟 청중 세그먼트에 대한 360도 뷰를 제공하며 사용자 인구통계(연령, 성별, 위치, 경력 프로필), 심리통계(목표, 요구, 동기, 과제), 행동(구매 트리거, 장벽), 선호도(채널, 소셜 네트워크, 브랜드) 등에 대한 정량적 및 정성적 인사이트를 제공합니다.
여기에서 페르소나 속성의 전체 목록을 찾을 수 있습니다.
페르소나 생성 후 두 번째 단계는 합성 사용자 생성입니다. 페르소나를 생성한 후 합성 리서치 소프트웨어를 방문하여 사이드바 메뉴에서 Panels를 선택하세요.

거기에서 다음 단계에 따라 합성 패널을 생성하세요:
그러면 합성 리서치 소프트웨어가 몇 분 안에 합성 응답자를 생성합니다. 기본 인구통계 세부 정보(예: 이름, 연령, 마케팅 세대, B2C 사용자의 위치, B2B 사용자의 직책 및 회사 이름)를 확인할 수 있으며 영감이 떠오르면 개별적으로 채팅할 수도 있습니다.

이러한 사용자는 사용자 데이터와 고객 피드백에 기반한 페르소나에서 파생되므로 다른 어떤 것보다 인간 행동(즉, 사용자 및 구매자)을 모방할 수 있습니다. 이 패널은 다음을 실행하는 데 사용할 수 있습니다:
시작하기 전에 이 연습의 목표가 무엇인지 확실히 해야 합니다. 예를 들어 사이트 탐색을 테스트하거나 전환 퍼널을 개선하거나 전체 사용자 경험을 개선하고 싶으신가요? 프로세스 작동 방식을 보여드리기 위해 Nike의 필터링 관련 UI 마찰 및 SKU 과다 인지 과부하를 파악하기 위한 연구를 생성하겠습니다.
합성 리서치 대시보드에서 Studies로 이동하여 "Create a new study"를 클릭합니다. 완료해야 할 세 단계가 표시됩니다: Panel, Questions 및 File Upload.
시작하려면 Panels에서:
작업에서 테스트하려는 사이트/페이지의 URL을 추가하거나 File Upload를 통해 관련 디자인 파일을 업로드할 수 있습니다. 참고: 작업 시나리오 및 중지 조건(즉, 사용자가 테스트를 중지하기를 원하는 시점)을 추가하는 것은 완전히 선택 사항입니다.
또한 사용자가 연습을 마친 후 묻고 싶은 테스트 후 질문을 추가할 수 있습니다(마지막에 인터뷰 기록을 받게 됩니다).

합성 응답자는 실제 브라우저 환경에 연결하여 실제 렌더링된 페이지와 상호작용하고 실제 작업을 수행합니다. 실제 사용자가 하는 것처럼 작업을 완료하기 위해 추론과 논리를 적용합니다. 우리 시스템은 이 모든 데이터를 캡처하고 테스트가 완료된 후 대시보드에 표시합니다.
응답자별 또는 마스터 여정(모든 사용자의 단계가 하나의 일관된 사용자 여정으로 매핑됨)으로 Journey 탭을 볼 수 있습니다.
Respondent 뷰는 사용자 감정(예: 행복, 평온, 좌절), 행동 및 생각(일반적으로 조정된 세션에서 추출하는 think-aloud 해설)과 함께 개별 터치포인트를 보여줍니다. 또한 클릭한 위치와 좋아하거나 싫어한 영역을 보여주는 스크린샷도 제공됩니다.

Master Journey 뷰에서는 여정의 각 단계에서 스크린샷 외에 히트맵을 얻습니다. 히트맵은 전체 패널에 걸쳐 주의와 클릭 활동을 집계하기 때문에 개별 세션이 보여줄 수 없는 것을 보여줍니다: 어떤 요소가 초점을 끌고, 어떤 것이 무시되며, 사용자가 어디에 모이는지.
예를 들어 Nike 연구에서 Kids' shoes 목록 페이지의 히트맵은 왼쪽 필터 사이드바의 두 지점에 주의가 집중되어 있음을 보여주며, 사용자가 옵션을 탐색하는 것이 아니라 필터링하고 있음을 확인합니다.

Report 탭에는 사용자 테스트에 대한 요약 보고서가 포함되어 있으며, 여기에는 핵심 합성 인사이트, 사용성 및 접근성 피드백, 사용자 인터페이스에 대한 휴리스틱 평가, 권장 후속 조치가 담겨 있습니다.
Nike 연구에서는 세 가지 반복되는 주제가 나타났습니다. 관련성 없는 필터 결과, 사용자가 잠금 방식을 확인하기 위해 '제품 상세 정보 보기'를 클릭할 수밖에 없게 만드는 모호한 제품 설명, 그리고 제품 이미지 누락과 '장바구니에 담기' 시 발생하는 보안 오류를 포함한 기술적 결함입니다.

여기에는 유아용 사이즈를 지나치기 위해 필터 사이드바를 한참 스크롤해야 하는 문제와, 결과 목록과 초기 제품 페이지 모두 벨크로 스트랩과 신축성 있는 끈을 구분해주지 않아 제품을 클릭하고, 스크롤하고, 상세 정보를 열고, 다시 뒤로 가는 과정을 반복해야 했던 문제가 포함됩니다.

Nike 보고서에서는 필터를 적용했음에도 관련 없는 항목이 표시되어 발생하는 인지 부하 증가(예측 가능한 탐색과 명확한 콘텐츠 식별에 관한 WCAG 관련 우려 사항)와, 사용자가 시각적 단서에 의존하지 못하게 만드는 제품 이미지 누락 문제를 제기했습니다.

이번 연구에서는 시스템과 실제 세계 간의 불일치(사용자는 'Velcro(벨크로)'를 찾지만 시스템은 'Hook-and-loop' 또는 'EasyOn'이라고 표시), 유연성 및 효율성 문제(3세 사이즈에 도달하기 위해 영유아 사이즈를 지나쳐 스크롤해야 함), 그리고 오류 방지 실패(전환 퍼널을 방해하는 보안 오류)를 지적했습니다.

Nike의 경우, 이는 사이즈 및 스타일 필터가 관련성 있는 결과만 반환하도록 제품 태깅을 점검하고, 사용자가 확인을 위해 제품을 일일이 열어볼 필요가 없도록 목록 페이지의 제품 카드에 잠금 방식 배지를 추가하며, '장바구니에 담기' 시 발생하는 보안 트리거와 제품 이미지가 비어 보이게 만드는 지연 로딩 또는 CDN 문제를 함께 조사하는 것을 의미합니다.

이 정보를 활용하여 사용자 흐름, 레이아웃 요소, 탐색 기능을 조정할 수 있습니다. 가장 큰 장점은 매 반복 작업 후 연구를 다시 실행하고 새로운 데이터로 합성 사용자를 지속적으로 업데이트할 수 있다는 것입니다. 사용성 테스트 외에도, 당사의 합성 사용자 테스트 플랫폼은 사용자 여정을 시뮬레이션하고, 레이아웃 변경 사항을 검증하며, 다양한 인구 통계 및 페르소나 프로필에 걸쳐 기능을 테스트하여 제품 개발에 도움을 줄 수 있습니다.
Nielsen Norman Group의 게시물에 따르면, "합성 사용자는... 인간 행동의 일반적인 경향은 포착하지만 효과의 크기나 인간 데이터의 가변성을 포착하는 데는 실패합니다." 이것은 UX 연구자, 마케터, 그리고 Reddit 사용자들이 합성 테스트에 반대하는 가장 큰 논거 중 하나입니다.
감정, 깊이, 그리고 예측 불가능성.
합성 사용자 행동은 특정 개인의 실제 경험이 아닌 익명화되고 집계된 데이터에 기반합니다. 사용자는 실제 상황의 맥락이 부족하고, 실제 사람들과 달리 예측 가능하며, 실제 인간의 조건, 감정, 의견을 표현하는 데 어려움을 겪습니다.
게다가, 그들은 분노나 좌절을 느끼지 않으며 논리로 작동합니다. 일반 사람들은 논리적이지 않습니다; 그들은 기분과 상황에 따라 달라지는 선호도에 기반하여 결정을 내립니다. 많은 합성 연구 도구에서 정량적 응답은 80-90%의 정확도를 보이지만, 주관적인 질문은 종종 인간의 응답과 일치하지 않는다는 것을 알 수 있습니다.
편향, 데이터, 그리고 정확성.
합성 사용자는 일반적으로 과거 데이터를 기반으로 구축된 확률 엔진이므로 새로운 의견을 형성하거나 미래의 사용자 행동을 예측하는 능력이 제한됩니다. 그들은 프롬프트와 데이터 품질에 매우 민감합니다. 훈련 데이터에 이미 존재하는 편향이나 부정확성은 연구 결과에서 증폭됩니다.
정확성 또한 문제입니다. 최근 연구에 따르면, AI 참가자는 질문에 긍정적으로 답변하는 경향이 있으며, 실제 고객이 더 비판적일 때에도 항상 긍정적인 피드백을 제공합니다.
윤리와 투명성.
결과물의 정확성을 넘어, 합성 테스트는 연구 자체의 품질을 훼손할 수 있는 윤리적 질문을 제기합니다. 합성 데이터가 의사 결정에 영향을 미치고 있다면, 영향을 받는 사람들은 그 사실을 알 권리가 있습니다; 의도하지 않았더라도 이를 실제 사용자의 데이터로 위장하는 것은 기업이 경계해야 할 일종의 허위 표시입니다.
현재 합성 사용자 테스팅은 적절한 사용성 연구를 위한 시간, 예산 또는 사내 전문 지식이 없는 경우 매우 유용합니다. 실제 연구에 착수하기 전에 개념을 압력 테스트하는 출발점이 될 수 있지만, 단독으로 중요한 의사 결정을 내리는 데 사용해서는 절대 안 됩니다.
결국 합성 사용자 연구는 진정한 인간 연구를 보완하기 위한 것입니다. 여러 입력 중 하나여야 하며 최종 의사 결정 요소가 되어서는 안 됩니다.
실제로 이러한 균형을 유지하려면 항상 다음을 수행하세요:
가장 좋은 방법은 하이브리드 연구 접근 방식을 채택하는 것입니다. 여기서 AI 페르소나를 사용하여 실제 사람들과 검증할 가치가 있는 것을 좁힙니다. 작게 시작하고, 합성 데이터를 엄격하게 검증하며, 데이터의 출처에 대해 투명하게 공개하세요.
합성 사용자 테스팅을 시작할 준비가 되셨나요? Delve AI의 합성 리서치 소프트웨어에 가입하세요!
합성 사용자는 실제 참가자와 함께 실행하는 대부분의 동일한 테스트 유형을 처리할 수 있습니다. A/B 테스트, 이해도 확인, 여정 수준 테스트, 프로토타입 테스트, 사용자 플로우 워크스루 등이 있습니다. 특히 기능 회귀 테스트와 혼란스러운 디자인을 걸러내기 위한 빠른 정상 작동 확인에 유용합니다.
합성 사용자는 제품을 사용할 때 사람이 어떻게 생각하고, 반응하고, 행동할지를 시뮬레이션하는 AI 생성 personas입니다. 실제 사용자 데이터에서 발견되는 패턴을 모방하지만, 실제 인간의 경험, 감정 또는 의견은 없습니다. 실제 사용자는 스크립트로 작성할 수 없는 진정한 행동과 놀라움을 제공하고, 합성 사용자는 속도, 규모, 그리고 초기 문제를 포착할 수 있는 저비용 방법을 제공합니다.
AI는 UX 리서치를 대체하는 것이 아니라 재구성하고 있습니다. 합성 테스트는 초기 단계 반복을 가속화하고 명백한 문제를 포착하는 데 탁월하지만, 실제 인간이 제품을 사용하며 어려움을 겪거나 기뻐하는 것을 관찰하면서 얻는 공감, 맥락, 통찰력을 대체할 수는 없습니다. 현재 대부분의 팀은 AI를 사용하여 반복적인 초기 단계 테스트를 처리하므로 연구자들이 복잡한 작업에 더 많은 시간을 할애할 수 있습니다.
이 분야는 아직 새롭지만, Delve AI, Synthetic Users, Uxia와 같은 합성 사용자 테스트를 제공하는 플랫폼이 점점 늘어나고 있습니다.
네, 합성 테스트는 참가자 모집을 건너뛰고 리서치 일정을 단축하기 때문입니다. 100명의 사용자를 테스트하는 합성 세션은 약 $100의 비용이 들고 몇 분 안에 완료될 수 있는 반면, 동등한 전통적인 연구는 수천 달러의 비용이 들고 완료하는 데 몇 달이 걸릴 수 있습니다.