比人类便宜20倍：谷歌DeepMind推出“超人”AI系统

作者：中国企业新闻观察网发布时间：2024-04-03

谷歌 GPT-4

大模型的幻觉问题怎么解？谷歌DeepMind：用AI来做同行评审！事实核验正确率超过人类，而且便宜20倍。

AI的同行评审来了！

一直以来，大语言模型胡说八道（幻觉）的问题最让人头疼，而近日，来自谷歌DeepMind的一项研究引发网友热议：

大模型的幻觉问题，好像被终结了？

在这篇工作中，研究人员介绍了一种名为 "搜索增强事实性评估器"（Search-Augmented Factuality Evaluator，SAFE）的方法。

对于LLM的长篇回答，SAFE使用其他的LLM，将答案文本分解为单个叙述，然后使用诸如RAG等方法，来确定每个叙述的准确性。

——简单来说就是：AI答题，AI判卷，AI告诉AI你这里说的不对。

真正的「同行」评审。

另外，研究还发现，相比于人工标注和判断事实准确性，使用AI不但便宜20倍，而且还更靠谱！

目前这个项目已在GitHub上开源。

长文本事实性检验

大语言模型经常胡说八道，尤其是有关开放式的提问、以及生成较长的回答时。

比如小编随手测试一下当前最流行的几个大模型。

ChatGPT：虽然我的知识储备只到2021年9月，但我敢于毫不犹豫地回答任何问题。

Claude 3：我可以谦卑且胡说八道。

为了对大模型的长篇回答进行事实性评估和基准测试，研究人员首先使用GPT-4生成LongFact，这是一个包含数千个问题的提示集，涵盖38个主题。

LongFact包含两个任务：LongFact-Concepts和LongFact-Objects，前者针对概念、后者针对实体。每个包括30个提示，每个任务各有1140个提示。

然后，使用搜索增强事实性评估器（SAFE），利用LLM将长篇回复分解为一组单独的事实，并使用多步骤推理过程来评估每个事实的准确性，包括使用网络搜索来检验。

此外，作者建议将F1分数进行扩展，提出了一种兼顾精度和召回率的聚合指标。

SAFE工作流程

如上图所示，首先提示语言模型将长篇响应中的每个句子拆分为单个事实。

然后，通过指示模型将模糊的引用（代词等）替换为上下文中引用的适当实体，将每个单独的事实修改为自包含的事实。

为了对每个独立的个体事实进行评分，研究人员使用语言模型来推理该事实是否与上下文中相关，并且使用多步骤方法对每个相关事实进行评定。

如上图所示，在每个步骤中，模型都会根据要评分的事实和先前获得的搜索结果生成搜索查询。

在设定的步骤数之后，模型执行推理以确定搜索结果是否支持该事实。

比人类更好用

首先，直接比较对于每个事实的SAFE注释和人类注释，可以发现，SAFE在72.0%的单个事实上与人类一致（见下图），表明SAFE几乎达到了人类的水平。

——这还没完，跟人类一致并不代表正确，如果拿正确性PK一下呢？

研究人员在所有SAFE注释与人类注释产生分歧的案例中，随机抽样出100个，然后人工重新比较到底谁是正确的（通过网络搜索等途径）。

最终结果让人震惊：在这些分歧案例中，SAFE注释的正确率为76%，而人工注释的正确率仅为19%（见上图），——SAFE以将近4比1的胜率战胜了人类。

然后我们再看一下成本：总共496个提示的评分，SAFE发出的 GPT-3.5-Turbo API调用成本为64.57美元，Serper API调用成本为 31.74 美元，因此总成本为96.31美元，相当于每个响应0.19美元。

而人类标注这边，每个响应的成本为4美元，——AI比人类便宜了整整20多倍！

对此，有网友评价，LLM在事实核验上有「超人」级别的表现。

评分结果

据此，研究人员在LongFact上对四个模型系列（Gemini、GPT、Claude和PaLM-2）的13个语言模型进行了基准测试，结果如下图所示：

研究人员发现，一般情况下，较大的模型可以实现更好的长格式事实性。

例如，GPT-4-Turbo比GPT-4好，GPT-4比GPT-3.5-Turbo好，Gemini-Ultra比Gemini-Pro更真实，而PaLM-2-L-IT-RLHF比PaLM-2-L-IT要好。

在两个选定的K值下，三个表现最好的模型（GPT-4-Turbo、GeminiUltra和PaLM-2-L-IT-RLHF），都是各自家族中超大杯。

另外，Gemini、Claude-3-Opus和Claude-3-Sonnet等新模型系列正在赶超GPT-4，——毕竟GPT-4（gpt-4-0613）已经有点旧了。

是误导吗？

对于人类在这项测试中颜面尽失的结果，我们不免有些怀疑，成本应该是比不过AI，但是准确性也会输？

Gary Marcus表示，你这里面关于人类的信息太少了？人类标注员到底是什么水平？

为了真正展示超人的表现，SAFE需要与专业的人类事实核查员进行基准测试，而不仅仅是众包工人。人工评分者的具体细节，例如他们的资格、薪酬和事实核查过程，对于比较的结果至关重要。

「这使得定性具有误导性。」

当然了，SAFE的明显优势就是成本，随着语言模型生成的信息量不断爆炸式增长，拥有一种经济且可扩展的方式，来进行事实核验将变得越来越重要。

近期资讯

智能恒温，海尔燃气热水器JSLQ27-16E5DLPCU1：补贴下的节能新贵

#年货节好物集市#海尔作为全球知名的家电品牌，其燃气热水器产品一直以高品质、创新技术和卓越性能著称。海尔燃气热水器在市场上的表现尤为突出，凭借其超一级能效、节能增压、变频水伺服等先进技术，为用户提供了舒适、节能、安全的洗浴体验。海尔燃气热水器不仅在技术上不断创新，更在用户体验上追求极致，致力于为用户提供更加舒适、节能、安全的洗浴体验。

小米地瓜 2024-12-30

讯飞智作亮相央视首届“科晚”，打造“AI张腾岳”三分钟炫技3种语言

AI能写文章、能画画、能聊天，这些已经不再新鲜。飞董事长刘庆峰用一系列精彩的现场演示，向全国观众展现了人工智能赋能千行百业的创新实践，看AI技术如何真正走进百姓生活、服务社会发展。

中国财富网 2024-12-30

ThinkPad X1 Carbon Aura打破技术壁垒，树立AI PC新典范

随着各大电脑厂商陆续推出并迭代自身的AIPC产品，用户对AIPC的期望也在不断提升，从单纯的性能提升，到多场景智能化体验的升级，再到多设备的智能协作，用户愈发注重个性化需求的满足与高效便捷的交互方式。它以120TOPS的AI算力、重量低于1千克（986克）的轻薄设计，以及行业首创的跨生态协作能力，树立了AIPC行业发展的新标杆。

砍柴网 2024-12-30

Turbo 4来了！REDMI送上最有创意的邀请函：超级能效大礼包

快科技12月30日消息，博主体验more晒出了REDMITurbo4邀请函——超级能效大礼包，包含一个开心果抱枕和四袋三只松鼠开心果。据悉，和REDMIK80“狂暴辣”的谐音梗一样，REDMITurbo4的谐音梗是“超级能效”（超级能笑），突出了REDMITurbo4的卖点——领先的能效。

快科技 2024-12-30

天马 Micro LED 产线顺利全制程贯通：无尺寸限制的无边框拼接

IT之家12月30日消息，天马微电子宣布，天马MicroLED产线今日在厦门成功实现全制程贯通。本次全制程贯通仪式现场点亮的是天马自主研发生产的PID标准显示单元模块。该标准模块以天马LTPS基玻璃背板为基础，利用天马MicroLED产线自研的全激光巨量转移工艺，可打破传统显示尺寸限制，实现无尺寸限制的无边框拼接显示。

IT之家 2024-12-30

曝vivo明年将推出MR设备部分指标和体验超Vision Pro

【CNMO科技消息】12月30日，CNMO注意到，博主“数码闲聊站”披露了vivo明年的一系列动向。vivo将推出新一代自研影像芯片，而首款搭载该芯片的新机无疑是vivoX200Ultra。据悉，vivoX200Ultra在影像方面将主要聚焦于长焦拍摄和视频录制。

手机中国 2024-12-30

证券时报 2024-12-30

上海锋机五金模具取得一种高压泵组用便于清洁的水箱专利，后期维护少

金融界2024年12月30日消息，国家知识产权局信息显示，上海锋机五金模具有限公司取得一项名为“一种高压泵组用便于清洁的水箱”的专利，授权公告号CN222220619U，申请日期为2024年11月。

金融界 2024-12-30

比人类便宜20倍：谷歌DeepMind推出“超人”AI系统

推荐体验

相关资讯

比人类便宜20倍，ChatGPT让数据标注者危矣？

苏黎世大学：ChatGPT标注数据比人类便宜20倍，80%任务上占优势

ChatGPT标注数据比人类便宜20倍，80%任务上占优势 | 苏黎世大学

ChatGPT要把数据标注行业干掉了？比人便宜20倍，而且还更准

7 Papers＆Radios｜GPT-4学会反思；ChatGPT数据标注比人便宜20倍

近期资讯

智能恒温，海尔燃气热水器JSLQ27-16E5DLPCU1：补贴下的节能新贵

讯飞智作亮相央视首届“科晚”，打造“AI张腾岳”三分钟炫技3种语言

ThinkPad X1 Carbon Aura打破技术壁垒，树立AI PC新典范

Turbo 4来了！REDMI送上最有创意的邀请函：超级能效大礼包

天马 Micro LED 产线顺利全制程贯通：无尺寸限制的无边框拼接

曝vivo明年将推出MR设备部分指标和体验超Vision Pro

昆明理工大学举行中外师生文艺晚会

任天堂Switch 2据悉或于明年3月发售

天马Micro-LED产线顺利全制程贯通

上海锋机五金模具取得一种高压泵组用便于清洁的水箱专利，后期维护少

推荐体验

AIGC重要产品

AI对话：类ChatGPT产品体验

好用的AI绘画工具

火热的AIGC产品

AIGC近期要闻

大公司发布的大模型产品都有哪些？

政府对AIGC的扶持政策

AIGC对就业的影响：我们会失业吗？

AIGC产业影响

AIGC对内容创作的影响

AIGC对绘画设计领域的影响

AIGC对各行各业的影响