IT

청소년 챗GPT ‘허용 불가’ 등급…OpenAI는 시험법 반박

미국 비영리단체 커먼센스미디어 산하 청소년 AI 안전연구소가 7일(현지시간) 청소년용 챗GPT에 5단계 중 최하인 ‘허용할 수 없는 위험’ 등급을 매겼다. 연구소는 만 13~17세로 가입한 테스트 계정에 프롬프트 4,000개 이상을 넣고, 소아청소년 정신과 의사 등 전문가가 응답을 검토했다고 보도자료에서 밝혔다. 실제 청소년의 이용 기록이 아니라 통제된 조건에서 치른 실험이다.

OpenAI는 대변인 성명으로 반박했다. 이번 테스트가 청소년 보호장치의 “실제 작동 방식”을 정확히 반영하지 않는다는 것이다. 같은 날 자사 블로그에는 청소년의 하루 평균 챗GPT 사용 시간이 15분 미만이라는 집계를 올렸다. 이 글은 커먼센스 평가를 언급하지 않는다. 4,000개 프롬프트와 15분은 만든 방식부터 다른 숫자다.

청소년 챗GPT, 4,000건 넘는 시험에서 무엇이 걸렸나

연구소가 가장 먼저 지적한 것은 부모 알림이다. 새로 만든 부모 연결 무료 계정 10여 개에서 자살 생각·자해·섭식장애에 대한 대화를 최대 1시간 이어갔는데 부모 계정에는 알림이 한 건도 오지 않았다. 대화 길이는 5분 미만부터 15분, 30분, 45분, 60분까지 달리했다. 몇 주치 민감한 대화 이력이 쌓인 계정에서는 알림이 모두 4건(자살·자해 3건, 섭식 1건) 왔다. 알림이 아예 작동하지 않는다는 뜻은 아니고, 새 계정에서 첫 1시간 안에는 오지 않았다는 결과다.

위기 상황 안내도 걸렸다. 소아청소년 정신과 의사 3명이 위기 자원 안내가 필요하다고 판정한 프롬프트 201개를 만 13세 부모 연결 계정, 기본 설정으로 넣었더니 청소년 모드 발표(8월 18일) 이후 시험에서 핫라인·전문가·일반 의료 자원 가운데 어느 하나라도 안내한 비율이 74%였다. 나머지 26%, 네 건 중 한 건 넘게는 어떤 자원도 알려주지 않았다. 연구소가 위기 안내의 최소 기준으로 둔 95%에는 다섯 항목 중 세 항목이 못 미쳤다.

청소년 챗GPT 위기 상황 안내 비율, 청소년 모드 전후 비교 차트
자료: 커먼센스미디어 청소년 AI 안전연구소 평가 보고서(2026년 10월). 정신과 의사가 위기 자원이 필요하다고 판정한 프롬프트 201개, 만 13세 부모 연결 계정·기본 설정 기준 테스트 결과로 실제 이용자 통계가 아니다

좋아진 항목도 같은 보고서에 있다. 신뢰할 성인과 상의하라는 권유는 87%에서 94%로, 약물 사용 핫라인 안내는 4%에서 58%로 늘었다. 노골적인 성적 롤플레이는 거부했고, 자살·자해·섭식장애를 직접 돕는 응답도 나오지 않았다고 보고서는 적었다. 반면 위기 핫라인 안내는 33%에서 23%로 줄었다.

연구소의 톰 시겔 소장은 이 결과를 부모 쪽에서 읽었다. 그는 청소년용 챗GPT가 “자주 작동하지 않는 보호장치와 안전 알림에 대해 부모에게 거짓 확신을 줄 수 있다”고 말했다. 연구소는 공부 모드의 ‘정답 보기’ 버튼과, 보호자가 정한 학습 시간이 프롬프트 앞 ‘@study’를 지우면 풀리는 점, 성인으로 가입한 계정이 나이를 13살이라고 말해도 청소년 모드로 바뀌지 않은 점도 문제로 꼽았다.

OpenAI는 무엇을 반박했나

OpenAI 대변인은 성명에서 “엄격한 독립 평가를 환영한다”면서도 커먼센스미디어의 테스트가 보호장치의 실제 작동 방식을 정확히 반영한다고는 보지 않는다고 했다. 방법론을 검토해 보니 테스트 대부분이 부모 통제 활성화가 끝나기 전에 시작돼 끝났을 수 있고, 그 경우 결과가 부정확하다는 주장이다. 부모 알림이 설계대로 작동하는지는 그 시험으로 확인되지 않는다는 말도 덧붙였다.

쟁점은 시간이다. 보고서 편집자 주에 따르면 OpenAI는 부모와 자녀 계정이 연결된 뒤 약 3시간이 지나야 알림을 받을 수 있다고 연구소에 알렸고, 이후 도움말 문서를 고쳤다. 연구소는 시험한 계정 10여 개를 다시 확인했더니 연결 후 3시간이 안 된 계정과 지난 계정이 섞여 있었다며 “우리 해석을 유지한다”고 했다. 연구소의 보고서 초안은 사실 확인용으로 OpenAI에 전달됐지만, 결론에 대한 편집권은 OpenAI에 없다고 연구소는 밝혔다.

같은 날 나온 OpenAI의 자사 집계는 이 논쟁의 반박 자료가 아니다. 블로그는 청소년의 하루 평균 챗GPT 사용 시간이 15분 미만이고, 3시간 넘게 연속으로 쓰는 청소년은 2% 미만이라고 밝혔다. 표본 정의와 집계 기간, 산출 방식은 적지 않았다.

4,000건과 15분은 왜 맞대볼 수 없나

실험은 통제된 조건에서 특정 질문에 시스템이 어떻게 답하는지를 재고, 이용 집계는 실제 사람들이 얼마나 오래 쓰는지를 센다. 잰 대상이 다르다. 평균 15분이라는 숫자가 위기 상황 질문에 대한 응답 시험 결과를 뒤집지 못하고, 4,000건의 프롬프트가 실제 청소년 이용의 분포를 말해주지도 않는다.

커먼센스 평가 OpenAI 발표
무엇을 셌나 테스트 계정에 넣은 프롬프트 실제 청소년 이용 집계
규모 4,000개 이상 프롬프트 하루 평균 15분 미만, 3시간 넘게 연속 2% 미만
기간 2026년 7월 13일~8월 17일, 8월 25일~9월 28일 공개 안 함
판정 소아청소년 정신과 의사 등 전문가 자사
방법 공개 방법론·한계 보고서 공개 산출법 공개 안 함

자료: 커먼센스미디어 청소년 AI 안전연구소 평가 보고서, OpenAI 블로그(2026년 10월 7일)

평가 쪽도 결정적이라고 하기는 어렵다. 연구소는 OpenAI Foundation을 비롯한 업계 자금을 받는다고 스스로 밝혔고, 편집 독립성은 유지한다고 했다. 보고서에 적은 한계도 있다. 사전·사후 시험이 순차로 이뤄져 그 사이 모델 변경과 청소년 모드의 효과를 나눠 볼 수 없고, 평가자 사이 일치도는 산출하지 않았다. 계정은 미국 샌프란시스코 베이 지역 것만 썼고 이미지 생성·음성·그룹 채팅은 시험하지 않았다. OpenAI 쪽 집계는 앞서 적은 대로 표본·기간·산출법을 알 수 없다.

공부 모드를 연상시키는 태블릿과 노트. 청소년 챗GPT 관련 자료사진
자료사진. Pixabay

독립 검증은 누가 하나

이번 보고서에 앞서 같은 쟁점을 짚은 연구자가 있다. 하버드 의대 조교수이자 RAND 선임 정책연구원인 라이언 맥베인은 OpenAI가 청소년 보호 기능을 출시한 직후인 8월 27일 RAND 논평에서, 핵심 보호 기능을 자발적 선택에서 기본값으로 바꾼 것은 평가받을 만하다고 썼다. 다만 출시 때 공개한 자료에는 가장 중요한 수치, 곧 실제 청소년 가운데 몇 %를 식별하느냐가 빠졌다고 지적했다. 이번 평가에 대한 반응이 아니라 8월 말에 나온 논평이다.

맥베인은 업계가 “확언은 공개하고 증거는 공개하지 않는 편리한 구조”에 이르렀다고 비판하며 연령 식별 정확도와 실사용 대화의 안전성 변화를 독립 연구자와 규제당국이 검증할 수 있게 하라고 요구했다. 시겔 소장의 결론도 같은 방향이다. 그는 OpenAI가 문제를 고치고 “독립 테스트로 증명할 때까지” 챗GPT는 성인 전용이어야 한다고 했다. OpenAI도 독립 평가는 환영한다고 밝혔다. 평가 측과 당사자, 제3자 모두 검증이 필요하다는 데는 말이 같다.

이번 평가는 챗GPT만 시험했고 국내 서비스는 대상이 아니었다. 국내에서는 국회 교육위원회가 10월 23일 국정감사에서 청소년 AI 채팅 서비스 문제를 다루며, 지난달 29일 확정된 증인 명단에 스캐터랩·뤼튼테크놀로지스·일레븐 대표가 올라 있다는 보도가 나왔다.

힘든 마음을 털어놓을 곳이 필요하다면 자살예방상담전화 109(24시간)로 연락할 수 있다.


연관 기사

Related Articles

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

Back to top button
error: Content is protected !!