维拉诺瓦大学团队用1682人做实验,发现大家分不清ChatGPT和人类写的短篇,AI故事评分还更高。
一项发表于《判断与决策》期刊的研究邀请1682名成年人阅读6篇短篇小说,其中3篇由人类创作、3篇由ChatGPT生成。结果显示,AI故事被认为更引人入胜,但当标注为人类创作时评价更高。在另一项905人参与的实验中,参与者判断作者身份的准确率仅为40%和52%,低于或接近随机水平。研究者认为,人们无法有效区分人类与AI创作的故事。
研究:人们无法有效区分 AI 生成与人类原创短篇小说
IT之家 8 月 9 日消息,从《奥德赛》到阿加莎 · 克里斯蒂的犯罪小说,人类创作了大量精彩故事,填满了一代又一代人的书架。但一项研究表明,如今人工智能或许已经开始成为人类作家的竞争对手。 发表在《判断与决策》(Judgment and Decision Making)期刊上的一项研究显示,研究人员邀请 1,682 名成年人阅读 6 篇短篇小说,其中 3 篇由人类创作,另外 3 篇由 ChatGPT 创作。每篇 AI 小说都围绕与其中一篇人类作品相似的主题展开。 研究人员会告诉参与者,他们阅读的故事究竟由人类还是 AI 创作,但这一信息并不总是准确的。随后,研究人员要求参与者评价故事的吸引力、阅读体验以及整体质量。 结果显示,阅读 AI 生成故事的参与者认为这些故事更加引人入胜,质量也高于阅读人类创作故事的参与者。不过,当参与者被告知某篇故事是由人类创作时,他们反而会给出更高的评价。 该研究的主要作者、美国宾夕法尼亚州维拉诺瓦大学的 Deena Skolnick Weisberg 博士表示:“AI 系统已经能够创作短篇故事,而且人们认为这些故事至少不逊于人类创作的作品,甚至可能更好。我们应该据此重新认识 AI 的能力。” 不过,Weisberg 本人也是一名创作者。她表示,这并不意味着写作应该交给 AI。她指出,科技公司利用 AI 创作的小说,很可能与人类作家创作的作品存在差异。 她说:“我们可能需要为 AI 创作的小说,以及 AI 与人类共同创作的小说留出空间,但这并不意味着人类创造的过程就不再值得欣赏。人类写作是为了进行创造性的自我表达,是为了挑战自己,也是为了理解和梳理自己的经历。AI 能够生成类似人类创作的故事,并不会改变这些事情。” 研究结果还表明,人们对 AI 的态度也会影响评价。对 AI 持更加积极态度的参与者,在被告知故事由 ChatGPT 创作后,给出的评价高于那些对 AI 持较负面态度的参与者。 研究人员随后又进行了两项实验,共有 905 名成年人参与。参与者会看到 6 篇短篇小说中的两篇,这两篇故事拥有相同主题,但只有其中一篇由人类创作。参与者需要判断哪一篇由人类写作,哪一篇由 AI 生成。 IT之家注意到,在其中一项实验中,约 40% 的参与者猜对了,甚至低于随机猜测的准确率;另一项实验中的正确率则为 52%。 研究人员写道:“ 没有普遍证据表明,参与者能够区分人类创作的故事和 AI 生成的故事 。” 研究人员还发现,参与者自称的小说阅读或写作经验,与他们判断故事作者身份的准确程度没有明显关系;但对 AI 系统越熟悉的人,判断准确率越高。 Weisberg 表示:“AI 写作具有某种特定的风格,我们可以通过练习逐渐学会识别这种风格,就像我们可以学会辨认不同人类作者独特的写作风格一样。” Weisberg 认为,人们更喜欢被标注为“人类创作”的故事,可能与他们对真实性的追求有关;但从实际阅读体验来看,人们之所以更喜欢 AI 生成的故事,可能是因为这些故事更容易阅读和理解。 不过,未参与这项研究的英国伯明翰大学电影与创意写作教授 Luke Kennard 强调,AI 仍然是一个极具争议的话题。 他说:“因为我们是人类,所以我们倾向于把 AI 拟人化,把它想象成某种发光的机器人,拥有一张善意且中立的面孔。但实际上,它只是基于海量被盗写作数据库运行的预测代码,而这些代码运行在规模庞大、成本高昂且具有破坏性的超大型数据中心中,并给周边社区带来灾难性的影响。” Kennard 还强调,AI 并不是类似拼写检查工具或同义词词典那样的普通“工具”,而是一种生存层面的威胁。 他说:“当然,只要提示词写得恰当,再经过一些调整和润色,它完全可以生成一首连贯、甚至令人愉悦的诗。毕竟,它的训练数据来自数千年的人类创作成果,如果连这个都做不到,反而才令人尴尬。我想,我们真正应该问的问题是:这一切值得吗?答案绝对是,也毫无疑问是 —— 不值得。”