「比人类更有趣的AI小说?」一项研究显示读者对ChatGPT作品的高度评价,揭示创作的未来

「比人类更有趣的AI小说?」一项研究显示读者对ChatGPT作品的高度评价,揭示创作的未来

「AI写的故事,人真的能感动吗?」

自从生成AI迅速普及以来,这个问题被反复提出。对于AI在文章摘要、邮件撰写、广告文案等实用性文章中发挥的作用,已经没有多少人感到惊讶。然而,涉及小说时,情况就不同了。

写故事需要人生经验、情感、记忆、冲突、文化以及作者自身的价值观——。长久以来,创作被认为是人类保留的领域之一。

然而,有研究结果正在动摇这一前提。

美国维拉诺瓦大学的研究人员进行的实验显示,由ChatGPT生成的短篇小说往往被评价为比人类作者的短篇更“高质量”“更吸引人”。

更有趣的是,读者在高评价AI作品的同时,特别是在误以为是“人类写的”情况下,评价更高。

这意味着我们不仅仅通过阅读作品本身,还可能通过“认为是谁写的”来改变作品的价值。

这项研究并没有简单地证明“AI超越了人类作家”。反而更突出的是,我们如何评价创作物的问题,而不仅仅是AI的写作能力。


让参与者阅读ChatGPT和人类的短篇

在研究中,参与者被要求阅读由人类撰写的短篇和ChatGPT生成的短篇,并对作品的质量和故事的沉浸感进行评价。

据报道,2026年8月的研究中,主要实验有1,682名成年人参与。

准备了6部作品。3部是人类撰写的短篇,3部是ChatGPT生成的、主题相似的短篇。

然而,传达给参与者的作者信息不一定是真实的。

有的情况下,AI写的作品被解释为“人类写的”,而人类作品被解释为“ChatGPT的作品”。

这是这项研究的重要设计。

不仅调查了作品本身的差异,还研究了“人类写的”“AI写的”标签对评价的影响程度。

结果非常有趣。

在比较实际作者时,参与者倾向于对ChatGPT生成的短篇给予比人类写的短篇更高的评价。

AI作品被认为“质量更高”“更易阅读”“更吸引人”。

但同时,即使是同一作品,当被解释为“人类写的”时,评价更高。

这可以解释为,虽然喜欢AI的作品,但却感到“这是一部好作品,所以一定是人类写的”现象的发生。


为什么AI的故事“易读”

研究人员关注的是AI和人类文章结构的差异。

当前的生成AI通常会将文章整理得很清晰。

倾向于比较清楚地解释角色在想什么、故事的主题是什么、事件有什么意义。

另一方面,人类作家不一定解释一切。

可能会留下沉默和模糊,或者仅描绘角色的行为,让读者猜测情感,或者将看似无关的场景后来连接成有意义的。

在文学中,这往往成为魅力所在。

然而,当评价“在短时间内阅读,哪个更易懂更有趣”时,复杂的作品未必有优势。

相反,主题明确、发展顺畅、情感意义易于理解的AI作品可能更容易获得高分。

这类似于电影和音乐。

比起复杂且有大量解读空间的作品,从头到尾易于理解并能打动情感的作品更容易获得多数人的平均高评价。

AI正迅速提高这种“多数人易于接受的作品”创作能力。


人几乎无法区分AI和人类的文章

研究团队还进行了将AI作品和人类作品并列,让参与者猜测作者的实验。

在针对约900人的附加实验中,一项实验的正确率约为40%,另一项约为52%。

二选一的情况下,即使是偶然也有约50%的正确率。

从整体来看,人类稳定识别AI作品和人类作品的结果并不理想。

这反映了围绕生成AI的一个重大变化。

几年前,许多人认为“AI文章有独特的不自然感”“一读就能分辨”。

但随着模型的进化,仅凭语法上的不自然或意义的破绽来判断AI变得困难。

而且有趣的是,自认为“读过很多小说”的人并不一定能识别AI。

另一方面,平时经常使用ChatGPT等生成AI的人,识别作者的成绩略高。

通过使用AI,可能会习惯于其特有的文章模式、结构和解释方式。

未来重要的可能不仅是写作能力,还有“AI素养”。


社交媒体上也有“不感到惊讶”的声音

这项研究结果在社交媒体和在线社区中也引发了讨论。

 

在Reddit上,有“并不意外的结果”这样的反应。

生成AI在语法上稳定,能整理故事的流向,快速创作出易于读者理解的文章。与非专业的普通写作者相比,AI被高评价的情况并不奇怪。

另一方面,也有非常重要的反驳。

那就是“比较普通人类的文章和AI”与“比较顶级作家和AI”是完全不同的问题。

在社交媒体上,也有关于AI作品“易读但容易平庸”“如果不详细指示就难以走向创新方向”的声音。

也就是说,AI在提高文章的最低标准或平均分的同时,是否能创作出人类一流作家所创造的杰出作品则是另一个问题。

“给ChatGPT两行指示就不会出现《哈利·波特》级别的作品”这样的反应也存在,使用AI创作优秀作品时,仍然需要人类继续思考情节、设定、结构等工作。


“仅凭6部短篇无法概括整个小说”的谨慎论调

阅读研究时,重要的是理解其范围。

实验中被评价的是有限数量的短篇。

从此次结果来看,无法得出“AI在所有小说中优于人类”的结论。

短篇和长篇小说所需的能力大不相同。

对于约1,000字的短篇故事,可以围绕一个主题、一个事件、一个情感进行构建。

而对于300页的长篇,则必须长期维持角色的心理变化、伏笔、世界观、多条副线、文章节奏、故事整体的一致性等。

在社交媒体上,也有强调这一点的反应。

“这项研究只能说明在特定条件下特定的AI短篇被高度评价”这样的谨慎意见。

这种区分非常重要。

在AI研究的新闻中,“AI超越人类”的标题容易受到关注。

但如果超出实验条件进行泛化,就会与原本的研究结果不同。


AI越是帮助创作,故事越可能相似

还有另一项研究值得结合此次研究一起考虑。

2024年在《科学进展》上发表的研究显示,从生成AI获得创意的人所写的短篇,比不使用AI时更被评价为“有创意”“写得好”“有趣”。

尤其是,原本创作能力评价较低的参与者从AI中受益更大。

到此为止,与此次研究的方向相似。

然而,也有重要的副作用。

AI帮助下创作的故事之间,比起仅由人类创作的故事,更容易相似。

在个人层面上,作品的平均分上升。

但从社会整体来看,类似的故事增加,多样性可能下降。

这是在考虑生成AI时代的创作时的一个大问题。

如果100万名作家从同一个AI获得情节、用词、发展方法的建议,各自的作品可能达到一定水平以上。

但另一方面,“没人想到的奇怪作品”可能减少。

AI提高创作的平均分,与整个文化的丰富并不必然相同。


以“AI风格的文章”为依据怀疑作者的危险

当难以区分AI和人类时,会出现其他问题。

仅凭“这篇文章像AI写的”这样的印象,人类作者也可能被怀疑。

2026年,围绕英联邦短篇小说奖,获奖作品被怀疑使用AI,引发了大讨论。

在社交媒体上,特定的句法和表达被指为“AI特有的表达”,但关于AI检测工具本身的可靠性也提出了疑问。

这种问题也会在学校教育中发生。

即使教师因“文章过于整齐”“文体与平时不同”而怀疑使用AI,仅凭这些也难以证明。

反过来,随着AI的普及,人类写出类似AI的文章也会增加。

AI学习人类的文章,人类日常阅读AI的文章,并无意识地吸收其表达方式。

人类和AI的文章并不是单方面靠近,而是开始相互影响。


读者评价的仅仅是“文章”吗

此次研究中最有趣的可能不是AI作品的写作能力本身,而是“作者的身份”影响了评价。

认为是人类写的就给予高评价,认为是AI写的则评价下降。

这一现象表明,我们在评价艺术作品时,并不仅仅看完成的作品。

例如,即使是同样的文章,知道是“经历过战争的人写的”和知道是“AI生成的类似文章”,读者所接收到的意义是不同的。

即使文章的字串相同,但背后的故事不同。

文学中不仅有作品中的故事,还有“谁、为何写了这部作品”的另一个故事。

因此,有人对人类写作这一事实本身感到有价值。

这不一定是对AI的不合理偏见。

因为人们对艺术的需求不仅仅是信息或娱乐。


尽管如此,AI仍将大大改变创作的世界

另一方面,低估AI的能力也不现实。

此次研究至少显示了一个事实,即在一定条件下,AI生成的短篇已经能够达到或超过人类作品的读者评价。

在广告、游戏剧本、网络小说、视频脚本、漫画原作、社交媒体内容等需要大量文章的领域,这种能力具有极大的意义。

“能否写出杰作”这一问题,可能不如“能否几乎无限地创作出足够有趣的故事”对产业的影响重要。

一个作家一天能写的量是有限的。

AI没有这种限制。

根据每个读者的喜好,改变角色、舞台、类型、结局的“个人专属小说”也可能普及。

届时,文学可能会从“许多人阅读同一作品”转变为“为每个人生成不同作品”。


被问到的将不再是“AI还是人类”

围绕生成AI和创作的讨论中,容易陷入“AI打败作家”“只有人类才能写出真正的故事”这样的二选一讨论。

但实际的未来可能更复杂。

完全由人类撰写的作