美国大学研究:ChatGPT 的新闻搜索结果经常不准确

seekdeep1年前AI资讯469

据 The Verge 北京时间今日报道,美国哥伦比亚大学 Tow 数字新闻研究中心(Tow Center for Digital Journalism)的研究人员测试发现,OpenAI 的 ChatGPT 搜索工具在准确性上存在一些问题。

今年 11 月,OpenAI 面向订阅用户推出了这一工具,称其可以快速提供答案,并附带相关网页来源链接。然而研究显示,ChatGPT 搜索在识别文章引用时表现不佳,即使是面对来自与 OpenAI 数据共享的出版商的内容,ChatGPT 也难以准确处理。

研究人员测试了 20 家出版商的 200 条引文,其中 40 条来自禁止 OpenAI 爬虫抓取的网站。但 ChatGPT 依然自信地给出了错误答案,几乎没有表明自身的不确定性。

d50735fae6cd7b894bfb3455c3974aa8db330e97.jpg

测试结果显示,ChatGPT 的 153 次回答完全或部分错误,仅有 7 次明确表示无法准确回答。这 7 次回答中,它使用了“看起来”“有可能”等限定词,或直接承认“无法找到具体文章”。

一份图表进一步显示,ChatGPT 的回答中“错误”的占 89 次,“部分正确”有 57 次,而完全“正确”的只有 47 次。

测试中还记录了一些典型案例,例如,ChatGPT 错误地将《奥兰多哨兵报》读者来信的引用归因为《时代周刊》文章;另一个例子中,它在被要求确认《纽约时报》一篇关于濒危鲸鱼的文章引用时,链接到了一家完全剽窃该文章的网站。

OpenAI 对《哥伦比亚新闻评论》回应称,“在缺乏 Tow Center 隐藏的测试数据和方法的情况下,解决错误归因非常困难。这次研究是对我们产品的非典型测试。”OpenAI 同时承诺将继续优化搜索结果。

据IT之家此前报道,今年早些时候,OpenAI 还宣布与新闻行业进行了广泛的合作,并收集了合作伙伴对于搜索功能的反馈。任何网站或出版商都可以选择出现在 ChatGPT 搜索结果中。达成合作的媒体和出版商包含美联社、阿克塞尔・斯普林格、康泰纳仕、道奇梅雷迪思、《金融时报》、GEDI、赫斯特、《世界报》、路透社、大西洋月刊、时代杂志和 Vox 媒体等等。

相关文章

解锁大模型时代的无限可能,从GPT-3到Sora

从2020年OpenAI的GPT-3到2023年的GPT-4再到2024年的文生视频模型Sora,我们见证了大模型领域创新速度之快。从百度、阿里和360等为代表的头部科技企业率先入局到互联网公司、AI...

传统业务疲软,AI与智能驾驶能否撑起未来?百度2024年财报解析!

2024年,百度在AI转型的关键一年交出了一份喜忧参半的财报。智能云业务逆势增长26%,文心一言调用量激增33倍,转型成果初显。然而,传统广告业务持续承压,爱奇艺业绩表现不佳,整体业绩略显疲软。更值得...

UC伯克利仅使用当前模型检查点预测未来模型,GPT-5涌现能力可预测?!

LLM 规模扩展的一个根本性挑战是缺乏对涌现能力的理解。特别是,语言模型预训练损失是高度可预测的。然而,下游能力的可预测性要差得多,有时甚至会出现涌现跳跃(emergent jump),这使得预测未来...

微软Copilot全面升级OpenAI GPT-4 Turbo模型,免费用户同样享受!

在经过一系列工作之后,微软现已针对 Copilot 用户群全面升级为 OpenAI 最先进的 GPT-4 Turbo 模型。IT之家提醒,CopilotPro 用户如果不习惯的话还可以切换回标准 GP...

陷史上最大公关危机,Altman 捐出一半身家帮公司度难关。OpenAI 公布“ GPT-6 ”最新进展!

OpenAI 可能遇到了成立以来最大的公关危机!而 Sam Altman 的应对速度之快,效果之好,绝对值得所有公司老板和公关人逐帧学习。我们先看 OpenAI 最新的动作——官推 5 月 28 日突...

单次输出 64K tokens, OpenAI 测试长输出版 GPT-4o

OpenAI 于 7 月 29 日宣布,正在测试长输出版 GPT-4o(GPT-4o Long Output),每次请求最多可输出 64K tokens。目前该版本仅限 Alpha 测试参与者使用,可...