5,600회
44.42%
2025년 12월 12일(금) 부터 12월 18일(목) 까지 7일간의 데이터를 분석하며 발견한 흥미로운 결과를 공유합니다.
여러분은 AI 이미지를 얼마나 잘 구분하셨나요?
요약
마오밸 서비스의 첫 주가 마무리되었습니다! 재미있게 플레이해 주신 모든 분들께 진심으로 감사드립니다.
7일간 총 5,600회의 게임이 진행되었는데요, 데이터를 분석하며 발견한 흥미로운 결과를 공유해 드리고자 합니다.
데이터 정제 후 도출된 통계는 놀라웠습니다. 전체 게임의 평균 정답률은 44.42%로, 양자택일 문제에서 기대할 수 있는 무작위 확률 50%보다 통계적으로 유의미하게 낮았습니다.
95% 신뢰구간: 43.76% ~ 45.08%
상한선조차 50%에 미치지 못한다는 것은 사용자들이 단순히 찍는 것이 아니라 실제로 AI 생성 이미지에 속고 있음을 의미합니다.
다만 서비스 첫 주인 만큼 아직 데이터가 충분하지 않습니다. 현재 관찰된 패턴은 데이터가 쌓이면서 달라질 수 있으니, 이 리포트의 분석은 초기 관찰 결과로 이해해 주시기 바랍니다.
1. 문제별 정답률 분석
11개의 문제 중 정답률 분포를 분석한 결과, 명확한 난이도 계층이 형성되었습니다.

핵심 발견
| 난이도 | 기준 | 문제 수 |
|---|---|---|
| 쉬움 | ≥55% | 5개 |
| 보통 | 45%~55% | 4개 |
| 어려움 | ≤45% | 2개 |
2. 주제별 난이도 분석
7개의 주제 카테고리를 분석한 결과입니다. 다만, 각 주제별 문제 수가 1~3개로 적어 통계적으로 확정적인 결론을 내리기에는 이릅니다. 하지만 여전히 재미있는 통찰을 얻을 수 있었습니다.

핵심 발견
가장 어려운 주제
음식 카테고리 - 정답률 39.5%
음식 카테고리는 가장 낮은 정답률을 보였습니다. 사용자 피드백에 따르면, 많은 분들이 AI가 생성한 라면 이미지에서 그릇 가장자리에 표현된 기름 띠가 너무나 현실적이어서 속았다고 말씀해 주셨습니다.
3. 응답 시간 분석
응답 시간과 정답률 사이의 관계를 분석해 보았습니다.

오래 고민할수록 정답률이 높았을까?
평균 응답 시간: 5.90초
95% 신뢰구간: 5.87초 ~ 5.94초| 결과 | 평균 응답 시간 |
|---|---|
| 정답 | 6.6초 |
| 오답 | 7.0초 |
약간의 차이가 있지만, '오래 고민하면 더 틀린다'거나 '빠르게 답하면 더 맞힌다'는 식의 명확한 패턴은 현재 데이터에서는 확인되지 않습니다.
앞으로 더 많은 문제세트와 데이터가 쌓이면, 응답 시간과 정답률의 관계에 대해 더 명확한 인사이트를 얻을 수 있을 것입니다.
4. AI 모델 분석
마오밸 팀은 다음 5개의 최신 AI 이미지 생성 모델을 테스트하여 문제를 출제합니다:
- Gemini 3 Pro Image
- GPT Image 1
- FLUX 2 Pro
- Seedream v4.5
- Hunyuan Image 3.0
이번 주에는 오직 2개 모델만이 품질 기준을 통과했습니다.

Gemini 3 Pro Image의 활약
90.9%
전체 11문제 중 10문제승률 (사용자를 속인 비율)
48.8%
거의 50%에 근접 - 실제 사진과 거의 구별 불가
모델별 탈락 원인 분석
문제는 5개의 모델이 생성한 이미지 중 한 장만 선택되는데요. 선택된 이미지 외에 다른 이미지들이 탈락한 이유는 보통 아래와 같았습니다:
| 모델 | 주요 탈락 원인 |
|---|---|
| Gemini 3 Pro Image | 원본 대비 과도한 선명도와 채도, 너무 완벽한 시각적 품질이 오히려 AI 같은 느낌 |
| GPT Image 1 | 전체적으로 노란 색조, 인물 표현의 부자연스러움과 모델 특유의 그림책 이미지 같은 스타일 |
| FLUX 2 Pro | 품질 기준 미달, 모델 특유의 물빠진 색감(낮은 채도) |
| Seedream v4.5 | 품질 기준 미달, 부자연스러운 식생(풀 또는 나무) 표현 |
| Hunyuan Image 3.0 | 품질 기준 미달, 안개 낀 듯 흐릿한 결과물 |
Text to Image AI의 세 가지 한계점
마오밸 팀의 분석에 따르면, 현재 텍스트 프롬프트 기반 이미지 생성 모델은 다음 세 가지 근본적인 한계를 보입니다.
물리 법칙의 이해 부족
물리적으로 불가능한 상황, 빛과 그림자의 일관성, 물체 반사 표현, 전경과 배경의 초점 구분 등에서 오류가 발생
논리적 맥락 부재
출입구 앞에 자전거를 세워두거나 포크 옆에 또 포크가 있는 등 맥락상 부자연스러운 위치에 객체를 배치
과도한 완벽주의
쨍한 색감, 과한 선명도, 동물의 '빗질된' 듯한 털 표현 등 현실의 자연스러운 불완전함이 없음
5. 지역별 분석
전체 5,600개 세션 중 96.7%가 한국에서 발생했습니다 (5,417세션).


서울과 경기도가 전체의 80% 이상
| 지역 | 세션 수 | 비율 |
|---|---|---|
| 서울 | 3,832 | ~70% |
| 경기도 | 724 | ~14% |
| 기타 | - | ~16% |
다른 지역들은 표본 크기가 작아(대부분 100 이하) 지역 간 정답률 차이가 실제로 의미 있는 것인지, 아니면 우연의 결과인지 판단하기 어렵습니다.
예를 들어 강원도(57.0%)와 세종시(34.5%)의 차이가 크게 보이지만, 각각 74세션과 76세션에 불과해 확정적인 해석은 보류합니다.
6. 이용 환경 분석
이용자들의 접속 환경을 분석한 결과:
56.9%
43.9%
45.1%
모바일과 데스크톱 간 정답률 차이는 통계적으로 유의하지 않았습니다 (p=0.093).
화면 크기나 기기 종류보다는 개인의 관찰력이 더 중요한 요소인 것으로 보입니다.
7. 변경사항
두 번째 챌린지에서 달라지는 점들을 안내드립니다.
아카이브
새로운 문제세트
첫 번째 챌린지 문제세트는 아카이브되며 전체 문제 목록이 공개됩니다. 어떤 이미지가 AI였는지 확인해 보세요!
신규 모델
GPT Image 1.5 & FLUX 2 Max
최신 모델들이 테스트에 포함됩니다. 향상된 성능을 직접 경험해 보세요.
난이도 조정
다양한 모델 경험
더 많은 모델을 포함하기 위해 품질 기준을 완화합니다. 각 모델의 개성을 느껴보세요!
8. 업데이트 예고
다음 업데이트에서 만나볼 수 있는 기능들입니다.
COMING SOON
모델별 리더보드
어떤 AI 모델이 가장 사람을 잘 속이는지 순위를 확인하세요.
COMING SOON
통계 페이지
문제별, 주제별, 모델별 정답률을 한눈에 확인할 수 있습니다.
COMING SOON
프롬프트 가이드
마오밸처럼 사실적인 AI 이미지를 만드는 프롬프트 작성법을 공개합니다.
COMING SOON
AI 이미지 구분 팁
마오밸 팀이 알려드리는 AI 이미지 판별 노하우를 공유합니다.
AI가 만든 이미지가 범람하는 시대, 진짜와 가짜를 구분하는 눈은 점점 더 중요해지고 있어요. 재미있게 즐기면서, 동시에 AI 리터러시를 키울 수 있도록 주변에 많이 공유해 주세요!
이 뉴스레터가 마음에 드셨다면?
상단의 이메일 등록 버튼을 눌러 구독해 주세요!
새로운 챌린지와 뉴스레터 소식을 이메일로 가장 먼저 받아보실 수 있습니다.

