GPT-4满分通过MIT本科数学考试！这套提示词火了｜GGView

作者：GGV纪源资本发布时间：2023-06-21

GGV有话说：

万万想不到啊，MIT数学考试，被GPT-4攻破了？！

突然有人在最新论文工作中高调宣布：GPT-4在MIT的数学和EECS（电气工程和计算机科学系）本科学位考试中，表现出的能力完全满足毕业要求。而且妥妥地拿下满分！要知道，测出这个结果的不是别人，正是来自MIT和波士顿大学、康奈尔大学的研究团队。

而且强如上一代王者GPT-3.5，在同样的测试中，只成功搞定了三分之一。论文一出，无数目光迅速被吸引过来。

GPT-4这样看似开挂的行为，自然引发了不少网友的感慨：比GPT-3.5强好多，好耶！

咱就是说，有没有可能以后不需要比GPT-4更强的模型，来解决学术问题了？

今天的GGView，就一起来看看 GPT-4到底是怎么开挂的！

来源：量子位 | 公众号 QbitAI

衡宇发自凹非寺

GPT-4开挂MIT考试

具体来说，GPT-4这次是参与了这样一场测试：

研究团队策划了一个数据集，其中包含4550个问题和解决方案。

这4550个问题和解决方案，来自MIT数学系和EECS的学生 获得本科学位，需要学习的课程问题集、期中考试和期末考试。

包括：

6-1：电气科学与工程；

6-2：电气工程与计算机科学；

6-3：计算机科学与工程；

6-4：人工智能与决策；

18-1：普通数学；

18-2：应用数学；

18-3：纯数学；

18-C：数学与计算机科学。

△每个专业的详细分类总结

题目统统出自MIT的数据集，从中随机生成228个问题， 不涉及图像和已有解决方案的问题。

题目的难度等级由易到难依次为：练习、习题、期中考试、期末考试、实验和专题。

按答案类型排序，题目的难度由易到难依次为：编程、开放、选择题、数值、表达式和图像。

这一次，参与考试的 不只有GPT-4和GPT-3.5，还有StableVicuna-13B、LLaMA-30B和LLaMA-60B。

选择让这4个大模型作为考试参赛选手，原因是它们是“最先进的大语言模型”。

△最终考试成绩

通过表格里的数据可以看到，得分最高的是经过调优后的GPT-4，得分率100%；表现最一般的是LLaMA-30B，只拿下了30%的分数。

值得关注的是， 原始版本的GPT-4开箱即用，完全不经过调优，在本次MIT考试中也拿到了90%的分数。

调优流程，包括Few-Shot+CoT+Self-critique+Experts。

从最终考试成绩的表格数据可以看到，从左到右每增加一个环节，调优后的GPT-4得分都会更上一层楼。

此外，研究团队还在提示框里进行了工程优化， 具体的“咒语”如下：

等等，评分人是GPT-4自己？

看到这样的结果，不少网友心生感慨，LLM在数学考试上的进步，未免有些神速了哈。

2年前，AI还在苦苦挣扎小学数学问题。

类似“小明种了5棵柠檬树，每年从每棵树上得到6个柠檬，10年间他总共得到多少柠檬”这种。

去年年初，MIT+哈佛+哥伦比亚大学+滑铁卢大学的联合研究表示，把数学问题转换成等价的编程问题，就可以让GPT-3的同门师兄弟——OpenAI的Codex掌握高数，达到 MIT本科水平。

学了6门MIT本科基础数学课里随机抽取的例题，6门课程每门随机出25道题，再加上一个ACT水平（美国高考）的数据集里的60道题。

总计210道题，AI全部答对。

不过有人提出，AI达到的“MIT本科水平”，实际是Codex在做语言题而非数学题——

因为当时的评测中，Codex负责读写，并不包括求解。

所以，这一回GPT-4表现奇佳，怎一个妙字了得～

好了，知道你很着急夸它，但你先别着急夸它，因为很快有人发现了一些“诡异”。

主要有 2大槽点。

第一个值得质疑一番的，就是OpenAI的训练数据集没有完全公布。

这也就意味着， 无法证明数据集中的4550个问题和解决方案，在GPT-4的训练集中不存在。

换句话说，如果GPT-4在预训练阶段已经接触到了这次的考题们，那最终拿下完美得分，就没什么好惊喜的了。

也难怪乎有网友毫不客气地yygq，认定GPT-4拿到这样的结果，一定是数据集已经包含在训练数据里了。

第二个槽点，就是GPT-4最后100%的得分率，似乎哪里不对劲？？？

定睛一看，在论文的第2.6节有一句很关键的点：

团队在数据集上微调开源大模型，“给定问题Q、基本事实解S和LLM答案A，我们使用GPT-4自动对模型响应进行评分”。

实际操作上，就是每个大模型生成这次考试的答案，然后派出GPT-4打分，分值在0-5之间。

所以给GPT-4打出满分的，实际上是GPT-4自己。

啊这……很难说没有王婆卖瓜自卖自夸的嫌疑。

此外，关于要给GPT-4提供“好的提示”，才能让它达到满分成绩，也让许多人抱有微词。

到底什么算“好的提示”呢？似乎无法定义。

甚至有人喊着，应该把这些题丢给MIT数学和EECS的学生去做，并不断给他们“好的提示”，这样人类学生也能拿下100%的吧……

One More Thing

一个小小的彩蛋：

整个测试中，基本上可以在笔记本电脑上部署运行的 StableVicuna-13B，也有48%的得分率。

这个成绩，不仅比模型更大的LLaMA-65B高出近10个百分点，就连MIT fine-tuing过后的LLaMA-30B，还要高。

让人不得不陷入一些关于模型规模与能力相关性的思考

。

温馨提示：虽然我们每天都有推送，但最近有读者表示因平台推送规则调整，有时候看不到我们的文章~

欢迎大家进入公众号页面，右上角点击“设为星标”点亮⭐️，收藏我们的公众号，新鲜内容第一时间奉上！

*文章观点仅供参考，不代表本机构立场。

近期资讯

Pandas数据导出：CSV文件

一、简介 Pandas是Python中用于数据分析和处理的强大库。它提供了灵活高效的数据结构，如DataFrame和Series，使得对数据的处理变得简单易行。在实际应用中，我们经常需要将处理后的数据

Jimaks 2024-12-27

TypeScript 数据类型 - 数组

数组创建数组 1. 字面量方式最常见和简单的方法是使用数组字面量（[]）。 2. 泛型方式使用 TypeScript 提供的数组泛型 Array。 3. 使用构造函数通过 Array 构

TSFullStack 2024-12-27

UniApp 实战：集成手机号、第三方微信与QQ登录功能及退出登录功能

UniApp 实战：集成手机号、微信与QQ登录功能前言在当今移动互联网迅速发展的时代，用户对于应用的便捷性和安全性提出了更高的要求。为了满足这些需求，开发者们不断探索更加友好和高效的用户认证方式。

天生我材必有用_吴用 2024-12-27

Kubernetes 网络策略详解与 Pod 间访问限制

在 Kubernetes 集群中，保护不同组件之间的通信是至关重要的。集群内部的 Pods 之间可以通过内部网络进行无障碍的访问，这样的自由通信虽然方便了应用开发和部署，但也带来了不小的安全隐患。为了

汪子熙 2024-12-27

Elasticsearch：使用 Ollama 和 Go 开发 RAG 应用程序

作者：来自 Elastic Gustavo Llermaly 使用 Ollama 通过 Go 创建 RAG 应用程序来利用本地模型。关于各种开放模型，有很多话要说。其中一些被称为 Mixtral 系

Elasticsearch 2024-12-27

“教你用代码撸出一个性感的3D地球 🌍——附带抖音爆款WebGL指南”

本文通过WebGL技术和Three.js框架，手把手教你实现一个可自转、可随鼠标交互的3D地球效果。详细讲解HTML代码和实现步骤，无需复杂设置，新手也能快速上手，轻松体验3D世界的开发乐趣！

answerball 2024-12-27

Spring Boot中RabbitMQ配置踩坑记录：当自定义配置遇上自动配置

问题背景在使用Spring Boot集成RabbitMQ时，我们经常会遇到这样的场景：项目中已经使用了Spring Boot的默认RabbitMQ配置，后来因为业务需求需要添加一些自定义配置。但是

从种子到参天大树 2024-12-27

Vue：让前端开发变得更有趣，少一些"刀耕火种"，多一些"数据思维" ✨

本文通过一个简单的 todos 应用，介绍 Vue 如何简化前端开发，帮助开发者摆脱繁琐的 DOM 操作。通过对比传统方法和 Vue 的响应式数据绑定、双向绑定等特性，让你更专注于业务逻辑，。

answerball 2024-12-27

从零开始学Java-单列集合：Set

在上一篇文章中我们讲解了单列集合的顶层Collection的第一种单列集合List,那下面我们就来学习一下第二种Set系列的单列集合吧，本文将详细的介绍Set集合。 Set集合 Set集合特点无序：

Fred_W 2024-12-27

5分钟搞懂 Golang noCopy策略

本文介绍了 Golang 中的 noCopy 策略，解释了如何防止包含锁的结构体被错误拷贝，以及如何使用 `go vet` 工具检测潜在的拷贝问题。

俞凡 2024-12-27

GPT-4满分通过MIT本科数学考试！这套提示词火了｜GGView

推荐体验

相关资讯