"인간보다 AI의 소설이 더 재미있다?" ChatGPT 작품을 독자가 높이 평가한 연구가 제시하는 창작의 미래

"인간보다 AI의 소설이 더 재미있다?" ChatGPT 작품을 독자가 높이 평가한 연구가 제시하는 창작의 미래

"AI가 쓴 이야기에, 사람은 정말로 감동할 수 있는가".

생성 AI가 급속히 보급된 이후, 반복적으로 제기되어 온 질문이다. 문장의 요약이나 이메일 작성, 광고 카피 등 실용적인 문장에서 AI가 힘을 발휘하는 것에 대해서는 이제 놀라는 사람이 적다. 하지만, 소설이라면 이야기가 다르다.

이야기를 쓰는 데는 인생 경험이나 감정, 기억, 갈등, 문화, 그리고 작가 자신의 가치관이 필요하다――. 오랫동안 창작은 인간에게 남겨진 영역 중 하나라고 여겨져 왔다.

그러나 그 전제를 흔드는 연구 결과가 나오고 있다.

미국 Villanova University의 연구자들이 실시한 실험에서는, ChatGPT가 생성한 단편 소설이 인간 작가에 의한 단편보다 "질이 높다", "이야기에 몰입된다"고 평가되는 경향이 나타났다.

더욱 흥미로운 것은, 독자가 AI 작품을 높게 평가하면서도 그 작품을 "인간이 썼다"고 믿고 있었던 경우에 특히 평가가 높았다는 점이다.

즉, 우리는 작품 자체를 읽는 것뿐만 아니라, "누가 썼다고 생각하는가"에 따라 작품의 가치를 바꾸고 있을 가능성이 있다.

이 연구는 단순히 "AI가 인간 작가를 초월했다"고 증명한 것이 아니다. 오히려 부각되는 것은, AI의 문장 능력 이상으로, 우리가 창작물을 어떻게 평가하고 있는가라는 문제다.


ChatGPT와 인간의 단편을 읽히는 실험

연구에서는 참가자에게 인간이 쓴 단편과 ChatGPT가 생성한 단편을 읽히고, 작품의 질이나 이야기의 몰입감 등을 평가하게 했다.

2026년 8월에 보도된 연구에서는, 주요 실험에 1,682명의 성인이 참여했다고 한다.

준비된 것은 6작품. 인간이 쓴 단편 3편과, 각각에 가까운 테마로 ChatGPT가 생성한 3편이었다.

다만, 참가자에게 전해진 작가 정보가 반드시 사실과는 한정되지 않았다.

AI가 쓴 작품을 "인간이 썼다"고 설명하는 경우도 있었고, 인간 작품이 "ChatGPT에 의한 작품"이라고 설명되는 경우도 있었다.

여기에, 이 연구의 중요한 장치가 있다.

작품 그 자체의 차이뿐만 아니라, "인간이 썼다", "AI가 썼다"는 라벨이 평가에 어느 정도 영향을 미치는지를 조사했다.

결과는 매우 흥미로웠다.

실제 작가로 비교하면, 참가자는 ChatGPT가 생성한 단편을 인간이 쓴 단편보다 높게 평가하는 경향을 보였다.

AI 작품이 "질이 높다", "읽기 쉽다", "이야기에 몰입된다"고 느껴졌다.

하지만 동시에, 같은 작품이라도 "인간이 썼다"고 설명된 경우에 평가가 더 높아졌다.

AI의 작품을 좋아하면서, "이것은 좋은 작품이니까 인간이 썼음에 틀림없다"고 느끼는 현상이 일어나고 있다고도 해석할 수 있다.


왜 AI의 이야기는 "읽기 쉬운가"

연구자들이 주목하는 것은, AI와 인간의 문장 구조의 차이다.

현재의 생성 AI는, 많은 경우, 문장을 명확하게 정리한다.

등장인물이 무엇을 생각하고 있는지, 이야기의 테마가 무엇인지, 사건에 어떤 의미가 있는지를 비교적 명확히 설명하는 경향이 있다.

한편, 인간 작가는 반드시 모든 것을 설명하지 않는다.

침묵이나 모호함을 남기거나, 등장인물의 행동만을 그려 독자에게 감정을 추측하게 하거나, 언뜻 보면 무관해 보이는 장면을 나중에 의미 있는 것으로 연결하거나 한다.

문학에서는, 그것이야말로 매력이 되는 경우도 많다.

하지만 "짧은 시간에 읽고, 어느 쪽이 이해하기 쉽고 재미있었는가"라고 평가하면, 반드시 복잡한 작품이 유리해지는 것은 아니다.

오히려, 테마가 명확하고, 전개가 매끄럽고, 감정의 의미도 이해하기 쉬운 AI 작품이 높은 점수를 얻기 쉬운 가능성이 있다.

이는 영화나 음악에도 비슷하다.

복잡하고 해석의 여지가 큰 작품보다, 처음부터 끝까지 이해하기 쉽고 감정을 움직여주는 작품이, 다수의 사람에게 평균적으로 높은 평가를 받는 것은 드물지 않다.

AI는 바로 이 "평균적으로 많은 사람이 받아들이기 쉬운 작품"을 만드는 능력을 급속히 높이고 있다고도 생각할 수 있다.


사람은 AI와 인간의 문장을 거의 구별할 수 없다

연구팀은 더 나아가, AI 작품과 인간 작품을 나란히 놓고, 참가자에게 작가를 맞추게 하는 실험도 진행했다.

약 900명을 대상으로 한 추가 실험에서는, 한쪽 실험에서 정답률은 약 40%, 다른 쪽에서는 약 52%였다고 보고되고 있다.

이분법이라면 우연히도 50% 정도는 정답할 수 있다.

즉 전체적으로 보면, 인간이 AI 작품과 인간 작품을 안정적으로 식별할 수 있었다고는 하기 어려운 결과였다.

여기에는, 생성 AI를 둘러싼 매우 큰 변화가 나타나고 있다.

몇 년 전까지 "AI 문장에는 독특한 부자연스러움이 있다", "읽으면 바로 알 수 있다"고 생각하는 사람도 많았다.

그러나 모델이 진화함에 따라, 문법상의 부자연스러움이나 의미의 파탄만을 단서로 AI를 판단하는 것은 어려워지고 있다.

게다가 흥미로운 것은, "소설을 많이 읽고 있다"고 자인하는 사람일수록 AI를 간파할 수 있는 것은 아니었다.

한편, 평소부터 ChatGPT 등의 생성 AI를 자주 사용하는 사람은, 작가를 맞추는 성적이 약간 높은 경향이 보였다고 한다.

AI를 사용함으로써, 특유의 문장 패턴이나 구성, 설명 방식에 익숙해질 가능성이 있다.

앞으로 중요한 것은, 문장력뿐만 아니라 "AI 리터러시"일지도 모른다.


SNS에서는 "별로 놀랍지 않다"는 목소리도

이 연구 결과는, SNS나 온라인 커뮤니티에서도 논쟁을 불러일으키고 있다.

 

Reddit에서는, "특히 의외의 결과는 아니다"라는 반응이 보였다.

생성 AI는 문법적으로 안정적이며, 이야기의 흐름을 정리하고, 독자가 이해하기 쉬운 문장을 짧은 시간에 만든다. 프로가 아닌 일반적인 글쓴이와 비교한다면, AI가 높게 평가되는 경우가 있어도 이상하지 않다는 생각이다.

한편, 매우 중요한 반론도 나오고 있다.

그것은 "평균적인 인간의 문장과 AI를 비교하는 것"과 "최고 수준의 작가와 AI를 비교하는 것"은 전혀 다른 문제라는 지적이다.

SNS 상에서는, AI 작품에 대해 "읽기 쉽지만, 어쩔 수 없이 무난해지기 쉽다", "세세하게 지시하지 않으면 독창적인 방향으로 나아가기 어렵다"는 목소리도 나오고 있다.

즉 AI는, 문장의 최저 라인이나 평균점을 크게 끌어올리는 한편, 인간의 일류 작가가 만들어내는 것 같은 뛰어난 작품을 만들 수 있는지는 별문제라는 시각이다.

"ChatGPT에 두 줄의 지시를 내리면 '해리 포터'급의 작품이 나오는 것은 아니다"라는 취지의 반응도 있으며, AI를 사용해 뛰어난 작품을 만들 경우에도, 플롯이나 설정, 구성을 계속 생각하는 인간의 일이 남는다는 의견이 지지되고 있다.


"6편의 단편만으로 소설 전체를 말할 수 없다"는 신중론

연구를 읽는 데 있어 중요한 것은, 그 범위를 이해하는 것이다.

실험에서 평가된 것은, 제한된 수의 단편이다.

이번 결과로부터, "AI는 모든 소설에서 인간보다 뛰어나다"고 결론지을 수는 없다.

단편과 장편 소설에서는 필요한 능력이 크게 다르기 때문이다.

1,000단어 정도의 짧은 이야기라면, 하나의 테마, 하나의 사건, 하나의 감정을 중심으로 구성할 수 있다.

한편, 300페이지의 장편이라면, 등장인물의 심리적 변화, 복선, 세계관, 여러 서브플롯, 문장의 리듬, 이야기 전체의 일관성 등을 장기간 유지해야 한다.

SNS에서도, 이 점을 강조하는 반응이 보인다.

"이 연구로 말할 수 있는 것은, 특정 조건 하에서 특정 AI 단편이 높게 평가되었다는 것까지다"라는 신중한 의견이다.

이 구별은 매우 중요하다.

AI 연구의 뉴스에서는, "AI가 인간을 초월했다"는 제목이 주목받기 쉽다.

그러나 실험 조건을 벗어나 일반화하면, 본래의 연구 결과와는 다른 이야기가 되어버린다.


AI가 창작을 도울수록, 이야기가 비슷해질 가능성

이번 연구와 함께 생각해보고 싶은 다른 연구가 있다.

2024년에 Science Advances에서 발표된 연구에서는, 생성 AI로부터 아이디어를 제공받은 사람이 쓴 단편은, AI를 사용하지 않았을 경우보다 "창의적", "잘 쓰여졌다", "즐길 수 있다"고 평가되는 경향이 나타났다.

특히, 원래 창작 능력의 평가가 낮았던 참가자일수록 AI로부터 큰 혜택을 받았다.

여기까지는 이번 연구와 방향성이 비슷하다.

그러나, 중요한 부작용도 있었다.

AI의 도움을 받아 쓰여진 이야기끼리는, 인간만으로 쓰여진 이야기보다 비슷해지는 경향이 있었다.

개인 단위에서는 작품의 평균점이 올라간다.

그러나 사회 전체로 보면, 비슷한 이야기가 늘어나고 다양성이 낮아질지도 모른다.

이는 생성 AI 시대의 창작을 생각하는 데 있어 큰 문제다.

만약 100만 명의 작가가 같은 AI로부터 플롯, 어휘 사용, 전개 방법을 제안받는다면, 각각의 작품은 일정 수준 이상이 될지도 모른다.

그 한편으로, "아무도 생각하지 못한 기묘한 작품"은 줄어들 가능성이 있다.

AI에 의해 창작의 평균점이 올라가는 것과, 문화 전체가 풍부해지는 것은 반드시 같은 것이 아니다.


"AI 같은 문장"을 근거로 작가를 의심하는 위험

AI와 인간을 구별하는 것이 어려워지면, 또 다른 문제도 발생한다.

"이 문장은 AI 같다"는 인상만으로, 인간 작가까지 의심받게 되는 것이다.

2026년에는, 영연방 단편 소설상을 둘러싸고, 수상작에 AI 사용 의혹이 떠올라 큰 논쟁이 되었다.

SNS에서는 특정 구문이나 표현이 "AI 특유의 표현이다"라고 지적되었지만, AI 검출 도구 자체의 신뢰성에 대해서도 의문이 제기되었다.

이러한 문제는 학교 교육에서도 발생한다.

교사가 "문장이 너무 정돈되어 있다", "평소와 문체가 다르다"는 이유로 AI 사용을 의심하더라도, 그것만으로 증명하는 것은 어렵다.

반대로 AI가 보급될수록, 인간 쪽이 AI와 비슷한 문장을 쓰는 것도 늘어날 것이다.

AI가 인간의 문장을 학습하고, 인간이 AI의 문장을 일상적으로 읽으며, 그 표현 방법을 무의식적으로 받아들인다.

인간과 AI의 문장은, 일방적으로 가까워지는 것이 아니라, 상호적으로 영향을 주기 시작하고 있다고도 생각할 수 있다.


독자가 평가하고 있는 것은 "문장"뿐인가

이번 연구에서 가장 흥미로운 것은, AI 작품의 문장력 그 자체보다도, "작가의 정체"가 평가를 좌우한 점