합성소비자란 무엇인가: 하버드·스탠퍼드 연구가 보여준 AI 소비자 조사의 가능성
합성소비자의 뜻과 원리, 그리고 하버드 경영대학원과 스탠퍼드대 연구가 보여준 정확도와 한계를 정리했습니다.
합성소비자, 정확히 무엇인가
‘합성소비자(Synthetic Consumers)’ 또는 ’합성응답(Synthetic Responses)’은 AI가 실제 소비자를 시뮬레이션해 설문이나 인터뷰에 답하는 것을 말합니다.
비유하면 이렇습니다. 영화 촬영에서 스턴트맨이 위험한 장면을 대신 찍듯, 합성소비자는 실제 소비자 대신 설문에 답합니다. 다만 스턴트맨이 배우의 움직임을 그대로 재현해야 쓸모가 있듯, 합성소비자도 실제 소비자의 태도와 선호를 높은 정확도로 재현해야 의미가 있습니다.
이것이 가능한 이유는 대규모 언어모델(LLM)이 인터넷의 방대한 소비자 리뷰, 커뮤니티 토론, 구매 후기 등을 학습했기 때문입니다. 이 데이터에는 소비자들이 제품을 어떻게 생각하고, 무엇을 선호하며, 어떤 가격에 반응하는지가 담겨 있습니다.
그렇다면 실제로 얼마나 정확할까요? 두 편의 주요 연구가 이 질문에 답합니다.
연구 1. 하버드 경영대학원, “Using LLMs for Market Research”
2023년 3월, 하버드 경영대학원(HBS)의 Ayelet Israeli 교수와 Microsoft의 James Brand, Donald Ngwe가 워킹페이퍼 “Using LLMs for Market Research”를 공개했습니다. 연구팀은 GPT-3.5로 소비자의 지불의향가격(WTP, Willingness-to-Pay)을 추정하고, 이를 사람에게 받은 설문 결과와 비교했습니다.
치약의 불소(Fluoride) 성분에 대한 지불의향가격을 비교하면 이렇습니다.
- GPT 추정값: 3.40달러
- 사람 설문 결과(Fong 외, 2023): 3.27달러
두 값의 차이는 4% 미만입니다. 비교에 쓰인 Fong 외(2023) 연구는 자신들의 설문 결과가 실제 시장 결과와 맞는지도 확인했습니다. GPT의 추정이 실제 시장 행동과도 가까울 수 있다는 뜻입니다.
연구팀은 한 걸음 더 나아가, 기존 사람 설문 데이터를 GPT에 추가로 학습시켰을 때 무엇이 달라지는지 실험했습니다. 처음 보는 제품 특성에 대해서도 예측이 크게 좋아졌습니다.
- 노트북의 ‘내장 프로젝터’ 기능: 학습 전 GPT는 사람보다 3배 넘게 높은 값을 추정했지만, 학습 후에는 사람의 추정과 거의 같아졌습니다.
- 치약의 새로운 맛(오이, 팬케이크): 학습 전에는 좋고 싫음의 방향이 사람과 반대였지만, 학습 후에는 같은 방향으로 바뀌었습니다.
연구팀은 GPT를 새 아이디어를 빠르게 시험하고 후보를 좁히는 도구로 쓰는 방법을 제안합니다.
연구 2. 스탠퍼드대, “Generative Agent Simulations of 1,000 People”
2024년 11월, 스탠퍼드대 박준성(Joon Sung Park) 연구팀이 발표한 연구입니다. 하버드 연구가 ’일반적인 소비자’를 시뮬레이션했다면, 이 연구는 특정한 한 사람을 그대로 재현하는 데 도전했습니다.
연구 방법. 연구팀은 미국인 1,052명을 모집해 한 사람당 2시간씩 심층 인터뷰를 했습니다. 어린 시절, 기억에 남는 일, 직업, 이민 정책에 대한 생각 등을 폭넓게 물었고, 이 인터뷰 기록을 LLM과 결합해 한 사람씩 시뮬레이션하는 AI 에이전트를 만들었습니다.
검증 방법. 에이전트가 실제 그 사람처럼 답하는지 두 가지로 확인했습니다.
- 종합사회조사(GSS, General Social Survey): 미국 사회과학 연구의 표준 설문
- 빅파이브(Big Five) 성격 검사: 심리학의 표준 성격 측정 도구
기준. 연구팀은 독특한 기준을 썼습니다. 사람이 2주 뒤 같은 설문에 다시 답할 때 자기 답을 얼마나 똑같이 반복하는지를 100%로 놓고, AI가 그 사람의 답을 얼마나 맞추는지 견준 것입니다. 사람도 2주 전 자기 답을 완벽히 반복하지 못합니다. 기분, 상황, 질문 해석에 따라 답이 달라지기 때문입니다. 연구팀은 이 ’사람 스스로의 응답 변동’을 현실적인 상한선으로 봤습니다.
결과. GSS에서 AI 에이전트는 사람이 2주 뒤 자기 답을 반복하는 정확도의 85% 수준으로 그 사람의 답을 맞췄습니다. 성격 검사와 실험 재현에서도 비슷한 수준이었습니다.
쉽게 풀면, 어떤 사람이 2주 뒤 같은 설문에서 자기 답의 90%를 똑같이 반복한다면, 그 사람을 시뮬레이션한 에이전트는 약 76.5%(90 × 0.85)를 맞춘다는 뜻입니다.
이 85%가 의미 있는 이유는 AI가 ’완벽한 예측’이 아니라 ’사람 수준의 변동’에 가까워졌다는 데 있습니다. 사람조차 자기 자신을 100% 재현하지 못하는 상황에서 그 일관성의 85%에 닿았다는 것은 실무에 쓸 수 있는 가능성을 보여 줍니다.
두 연구가 함께 보여 주는 것
두 연구는 접근은 달랐지만 같은 결론에 닿습니다.
- LLM은 소비자 행동을 의미 있는 수준으로 시뮬레이션할 수 있습니다.
- 알맞은 데이터를 더하면 정확도가 크게 오릅니다.
- 사람을 완전히 대신하기보다, 조사 효율을 높이는 보완재로 쓸 수 있습니다.
마케팅 실무자에게 주는 메시지
- 빠른 아이디어 검증. 신제품 컨셉 10개를 사람 패널로 시험하기 전에, 합성소비자로 먼저 3개로 좁힐 수 있습니다.
- 비용과 시간. 사람에게 받는 설문보다 비용과 시간을 크게 줄일 수 있습니다.
- 반복 조사. 같은 조건으로 몇 번이고 다시 조사할 수 있습니다. 사람 설문에서는 어려운 일입니다.
참고한 연구
이 글은 2026.04.22 Medium에 처음 실렸고, 블로그로 옮기며 다듬었습니다.