幻觉？马斯克的TruthGPT也搞不定！OpenAI联合创始人直言很复杂

作者：新智元发布时间：2023-05-03

上个月，马斯克疯狂呼吁叫停超级AI研发6个月。

还没等多久，老马就坐不住了，直接官宣推出一个名为TruthGPT的AI平台。

马斯克曾表示，TruthGPT将是一个「最大的求真人工智能」，它将试图理解宇宙的本质。

他强调，一个关心理解宇宙的人工智能不太可能灭绝人类，因为我们是宇宙中有趣的一部分。

然而，「幻觉」，到现在还没有哪个语言模型能够搞定。

最近，OpenAI联合创始人便解释为什么TruthGPT的远大理想的实现是如此地困难。

01 TruthGPT理想是泡沫？

马斯克的X.AI想要建立的TruthGPT，是一种诚实的语言模型。

这么做，直接将矛头对准ChatGPT。

因为，此前，像ChatGPT这样的AI系统经常产生错误输出等经典幻觉案例，甚至支持某些政治信仰的报道。

虽然ChatGPT可以让用户更多控制语言模型去解决问题，但「幻觉」仍然是OpenAI、谷歌以及未来马斯克的人工智能公司必须处理的核心问题。

OpenAI联合创始人兼研究员John Schulman在他的演讲「RL和Truthfulness – Towards TruthGPT」中讨论了这些挑战以及如何应对这些挑战。

02 为啥有「幻觉」？

根据Schulman的说法，幻觉大致可以分为两种类型：

1. 「模式完成行为」，即语言模型无法表达自己的不确定性，无法质疑提示中的前提，或者继续之前犯的错误。

2. 模型猜测错误。

由于语言模型代表一种知识图谱，其中包含来自其自身网络中训练数据的事实，因此微调可以理解为学习一个函数，该函数在该知识图谱上运行并输出token预测。

例如，微调数据集可能包含「星球大战的类型是什么？」这个问题，以及答案「科幻」。

如果这些信息已经在原始训练数据中，即它是知识图谱的一部分，那么模型不会学习新信息，而是学习一种行为——输出正确答案。这种微调也被称为「行为克隆」。

但问题是，如果问题是关于「Han Solo的衍生电影的名字是什么」出现在微调数据集中。

但如果答案「Solo」不是原始训练数据集的一部分（也不是知识图谱的一部分），即使网络不知道答案，它也会学习回答。

使用实际上正确但不在知识图谱中的答案进行微调，从而教会网络编造答案——即产生「幻觉」。相反，用不正确的答案进行训练会导致网络隐瞒信息。

因此，理想情况下，行为克隆应始终基于网络知识，但创建或评估数据集的人类工作者来说，通常不知道这种知识，例如指令调优。

根据Schulman的说法，当其他模型创建微调数据集时也存在这个问题，就像羊驼公式的情况一样。

他预测，具有较小知识图谱的较小网络，不仅会学会使用ChatGPT的输出给出答案和遵循指令，而且学会更频繁地产生幻觉。

03 OpenAI如何打击幻觉？

首先，对于简单的问题来说，语言模型大部分情况下能预测自己是否知道答案，还能表达不确定性。

因此，Schulman表示，微调数据集的时候，必须得让模型学会怎么表达不确定、怎么应对前提被更改的情况，以及错误被承认的情况。

要把这些情况的实例喂给模型，让它们学习。

但是模型在时机方面还是欠练，也就是说，它们并不知道该何时执行这些操作。

Schulman表示，这就是强化学习（RL）该出场的地方了。比如，基于人类反馈的强化学习（Reinforcement Learning with Human Feedback，RLHF）。

应用RL，模型就可以学习「行为边界」，学会何时做出何种行为。

而另一个难题，则是检索和引用来源的能力，例如通过WebGPT中所展示的能力，或者最近在ChatGPT的浏览器插件中所呈现的机制。

问题在于，有了复制行为的能力和RLHF，为什么ChatGPT还会产生幻觉？

原因在于问题本身的难易。

虽然上述方法对于简短的问题和答案效果不错，但对于ChatGPT中常见的长格式设置就会出现其他问题了。

一方面，完全错误的答案也不太可能，大部分情况都是错的和对的混在一起。

在极端情况下，可能就是100行代码中的一个错误而已。

在其他情况下，这些信息在传统意义上并不能说是错的，而是有误导性的。因此，在像ChatGPT这样的系统中，人们很难根据信息量或者正确性来衡量输出的质量。

但这种衡量对于旨在训练复杂行为边界的RL算法却非常重要。

目前，OpenAI依托于RLHF的基于排名的奖励模型，该模型能够预测它认为两个答案中哪个更好，但不会给出有效的信号来明确哪个答案好了多少、信息量大了多少或正确了多少。

Schulman表示，它缺乏向模型提供反馈以学习精细行为边界的能力。而这种精细的行为边界，才是有可能解决幻觉的道路。

此外，此过程还会因为RLHF标记过程中的人为出错而变得更加复杂。

因此，虽然Schulman将RL视作减少幻觉的重要方式之一，但他认为仍然存在许多还没解决的问题。

除了前面提到的奖励模型究竟需要什么样子才能引导正确的行为之外，RLHF目前仅依赖于人类的判准。

这可能会使知识的生成变得更加困难。因为对未来的预测有时会导致不那么令人信服的表述。

然而，Schulman认为，知识的生成是语言模型的下一个重要步骤，同时，他认为对未来的预测和给出推理规则等问题的理论构建，是亟待解决的下一类开放性问题。

Schulman说，一种可能的解决方案是，用其他AI模型来训练语言模型。

OpenAI也认为，这种方法对于AI对齐来说，很有意义。

04 ChatGPT架构师

作为ChatGPT架构师，John Schulman早在2015年还在读博士学位的他，就加入OpenAI成为联合创始人之一。

在一次采访中，Schulman解释了自己加入OpenAI的原因：

我想做人工智能方面的研究，我认为OpenAI这家公司的使命雄心勃勃，并且致力打造通用人工智能。

尽管，在当时谈论AGI似乎有些疯狂，但我认为开始考虑它是合理的，我希望在一个地方谈论AGI是可以接受的。

另外，据Schulman透露，OpenAI将人类反馈强化学习这一方法 (RLHF)引入ChatGPT的想法可以追溯到17年了。

当时，也是OpenAI的成员，曾发表了一篇论文「从人类偏好中进行深度强化学习」就提到了这一方法。

论文地址：https://arxiv.org/pdf/1706.03741.pdf

OpenAI安全团队之所以致力于这项工作，是因为想让自己的模型符合人类的偏好ーー试图让模型真正倾听人类意见，并试图做人类想做的事情。

在GPT-3完成训练的时候，然后Schulman决定加入这股潮流，因为他看到了整个研究方向的潜力。

当被问到第一次使用ChatGPT时，第一反应是什么的时候，Schulman的话语中透露着「无感」。

还记得去年ChatGPT横空出世，让许多人瞬间炸脑。

而在OpenAI内部没有人对ChatGPT感到兴奋。因为发布的ChatGPT是一个基于GPT-3.5较弱的模型，那时候同事们在玩转GPT-4了。

所以在那个时候，OpenAI没有人对ChatGPT感到兴奋，因为有这么一个更强大，更聪明的模型已经被训练过了。

对于未来人工智能下一前沿领域看法，Schulman称，AI在更艰难的任务上不断进步，然后，问题就来了，人类应该做些什么，在哪些任务下，人类可以在大模型帮助下有更大影响力，做更多的工作。

编辑：桃子拉燕

参考资料：

https://the-decoder.com/elon-musks-truthgpt-is-complicated-says-openai-co-founder/

近期资讯

日本公布登月探测器“倒栽葱”着陆原因：一个主引擎点火滞后

【文/观察者网陈思佳】当地时间12月26日，日本宇宙航空研究开发机构（JAXA）召开新闻发布会，公布了日本“小型落月实证机”（SLIM）今年1月在月球表面“倒栽葱”着陆的原因。SLIM项目负责人坂井真一郎说，调查显示，在SLIM着陆过程中，两个主引擎中的一个点火滞后了约1秒，供给的燃料未能正常燃烧并在滞留在引擎内。

观察者网 2024-12-27

工信部：试点部署万兆光网，力争累计建成5G基站450万座以上

12月26日至27日，全国工业和信息化工作会议在京召开。会议强调，2025年要围绕高质量发展，推动信息通信业高质量发展。

新京报 2024-12-27

韩国人来旅游吐槽烤鸭难吃中国人怎么什么都吃：结果囧

12月27日消息，近期，得益于免签政策的推行，韩国民众对中国旅游的热情不断高涨。一位韩国旅客在中国美食探索之旅中遭遇的一段小插曲，迅速在网络上走红，引发了网友们的广泛关注与热议。视频

2024-12-27

怒喵李楠的「百镜大战」大实话：别骗自己有技术，抓紧兑现风口

怒喵科技（AngryMiao）的创始人李楠，过去几年从小众机械键盘产品出发，正在尝试更多品类的C端科技产品。

极客公园 2024-12-27

本地 AI 开发利器，初探微软 Win11 AI Dev Gallery 功能

12月27日消息，科技媒体WindowsLatest昨日（12月26日）发布博文，微软针对Windows11AI+PC设备，推出了AIDevGallery功能，帮助开发者在其应用中融入端侧AI功能。

砍柴网 2024-12-27

全国首个智能瓦斯巡检系统在神东建成

近日，全国首个智能瓦斯巡检系统替代人工巡检试点矿井在国家能源神东煤炭集团上湾煤矿建成。近年来，随着煤矿智能化水平不断提升，井下安设大量电气设备，电源箱、控制开关等点多、面广，瓦斯检查路线长、点位多，采用传统人工巡检方式，不仅占用大量人力物力，且存在假检、漏检等情况。

央广网 2024-12-27

力箭一号遥六运载火箭发射任务失利：三级发动机点火约 3 秒后姿态失稳，实施自毁

2024年12月27日09时03分31秒，力箭一号遥六运载火箭在东风商业航天创新试验区点火升空，火箭一、二级飞行正常，三级发动机点火约3秒后姿态失稳，箭上自主安全控制系统实施自毁，发射任务失利。我们将始终保持对航天事业的敬畏之心，严格按照航天归零标准，尽快完成故障调查并在第一时间公布，全力确保后续飞行试验任务圆满成功。

IT之家 2024-12-27

江苏捷达交通工程集团有限公司取得新式水泥砂浆勾缝设备专利，提高装置使用后清理便捷性

金融界2024年12月27日消息，国家知识产权局信息显示，江苏捷达交通工程集团有限公司取得一项名为“一种新式水泥砂浆勾缝设备”的专利，授权公告号CN222205945U，申请日期为2024年2月。

金融界 2024-12-27

小米澎湃OS 2将迎首次重磅更新：超级小爱来了

快科技12月27日消息，日前，REDMI品牌总经理王腾发布最新视频，提到了小米总裁卢伟冰将在今晚举办的年度总结直播。据介绍，卢伟冰将在直播重点介绍小米澎湃OS 2最新的更新，超级小爱将首次向正

拾柒 2024-12-27

华为将发布2025年智能光伏十大趋势

2025年1月6日，华为将从技术创新、市场发展、产业环境等维度，发布2025年智能光伏十大趋势。华为智能光伏融合数字技术和电力电子技术，向全球客户和伙伴提供全场景智能光储解决方案，助力光伏成为主力能源。同时，华为致力于打造新型电力系统能源基础设施。

证券时报 2024-12-27

幻觉？马斯克的TruthGPT也搞不定！OpenAI联合创始人直言很复杂

推荐体验

相关资讯

幻觉？马斯克TruthGPT也搞不定，OpenAI联合创始人直言很复杂

被联合创始人马斯克告了，OpenAI回应

马斯克起诉OpenAI及其创始人

马斯克、苹果联合创始人、Pinterest联合创始人等呼吁暂停训练比GPT-4更强大的AI系统

夺权失败？揭秘马斯克与OpenAI创始人的权力斗争

近期资讯

日本公布登月探测器“倒栽葱”着陆原因：一个主引擎点火滞后

工信部：试点部署万兆光网，力争累计建成5G基站450万座以上

韩国人来旅游吐槽烤鸭难吃中国人怎么什么都吃：结果囧

怒喵李楠的「百镜大战」大实话：别骗自己有技术，抓紧兑现风口

本地 AI 开发利器，初探微软 Win11 AI Dev Gallery 功能

全国首个智能瓦斯巡检系统在神东建成

力箭一号遥六运载火箭发射任务失利：三级发动机点火约 3 秒后姿态失稳，实施自毁

江苏捷达交通工程集团有限公司取得新式水泥砂浆勾缝设备专利，提高装置使用后清理便捷性

小米澎湃OS 2将迎首次重磅更新：超级小爱来了

华为将发布2025年智能光伏十大趋势

推荐体验

AIGC重要产品

AI对话：类ChatGPT产品体验

好用的AI绘画工具

火热的AIGC产品

AIGC近期要闻

大公司发布的大模型产品都有哪些？

政府对AIGC的扶持政策

AIGC对就业的影响：我们会失业吗？

AIGC产业影响

AIGC对内容创作的影响

AIGC对绘画设计领域的影响

AIGC对各行各业的影响