新V观海外：o1模型的开源复现和智商测试

作者：经济观察报发布时间：2024-09-26

OpenAI

经济观察报社论陈沛/文 自从OpenAI推出最新的高级推理模型o1，已经过去了10天左右的时间。

模型刚推出的时候，很多率先使用的用户会觉得这个预览版模型（o1-preview）的纯文本模式和类似规划代理的生成效果略感平淡，就像我在前一篇专栏中写过的情况。

也有一些研究者试图从OpenAI介绍的内容中针对自我对弈强化学习、数据合成等进行分析，以突出这个模型的特别提升之处。

在此期间，各种说法林林总总，不一而足。我则认为值得进一步分析的是随后很快出现的o1模型开源复现版，以及最新的智商测试结果。

一周内出现o1开源复现效果

美国SambaNova公司的Kaizhao Liang在o1模型发布一周内，就在HuggingFace上推出了一个类似o1模型思考过程的开源平替版——Llama3.1-Instruct-O1。

这个开源平替版用到了Llama-3.1-Instruct模型，用户可以选择405B、70B、8B三个开源模型版本，再设置思考步骤的限制（从1至100之间），然后就可以实现类似o1模型的思考过程。

实现原理非常清楚，作者给Llama-3.1-Instruct开源模型增加了额外的系统提示词，共包括八个阶段，要求模型仔细阅读问题，按照思考步骤数量设置计数器，并要求模型进行自我反思，完成全部解答阶段后进行重新组织，形成最终输出答案。

客观来看，这个方法比较讨巧，直接借用成熟的提示框架对开源模型的输出结果进行限定，以生成类似的思考效果，却不涉及上述的自我对弈强化学习过程。不过，这想必也不是开源复现版作者的本意。因为SambaNova作为AI推理加速服务商，更多是想展示它们在多步推理中的加速效果，而非高级推理能力。

测试发现o1模型智商超群

如何更加直观体现o1模型的推理能力，有人想到了进行智商测试。美国Tracking AI负责人Maxim Lott使用了门萨智商测试（Mensa Norway）对12个主流模型进行了测试，定期更新测试结果。

在最近的测试结果中，o1模型在35道题中答对了25道，智商达到121，是所有模型中唯一一个智商超过平均值（100）的模型。其它模型的智商多数普遍在80至90左右。

但是必须看到，由于这12个被测模型中既包括o1这样的纯文本模型，也包括GPT-4o、Gemini Advanced、Claude-3 Opus等多模态模型，而35道智商测试题中又有相当部分题目是复杂图形推理题，因此测试者需要把题目和选项转成非常全面的文本描述输入给纯文本模型，这个人工转换过程或多或少会让纯文本模型在测试结果上获得一定优势。

当然，就算排除掉这一点优势因素，o1模型在智商测试中所体现出来的复杂推理能力依然处于明显的领先位置。

OpenAI对o1模型的阶段定位

OpenAI的CEO Sam Altman在最近的表态中，将o1模型比喻成过去GPT系列模型的GPT-2，这似乎侧面印证了o1模型虽然表现出了显著的能力提升，但同时也存在着明显的缺点。

回顾过去，在发展GPT系列模型时，也是一直演进到GPT-3.5的阶段，才推出了ChatGPT引发了巨大关注。

展望后续的发展路线，如今o1模型已经来到了OpenAI之前提出5层通用人工智能的第2层（推理者，Reasoner），并将继续向之后第3层至第5层的智能代理（Agent）、创新者（Innovator）和组织者（Organizer）持续攀登。

相关资讯

新V观海外：o1模型的开源复现和智商测试

推荐体验

相关资讯

新V观海外：o1模型的开源复现和智商测试

新V观海外：OpenAI o1模型实测的惊艳感不足

开源日报 | Winamp正式开源；谷歌花费189亿元招募AI天才；o1模型的开源复现和智商测试；谷歌搜索快照功能彻底“死掉”

新V观海外：数据集和基准测试变革预示AI能力突变

新V观海外：OpenAI Sora模型背后的架构创新

近期资讯

如何有效解决手机等电子设备快速耗电问题的实用技巧与建议

合肥明士达取得铸件表面毛刺打磨装置专利，实现操作简单快捷且成本低

湖北宏玛达轮毂取得铝合金轮毂生产用毛刺去除装置专利，提高铝合金轮毂毛刺去除效率

如何有效恢复过期的微信文件及预防措施详解

苏州凯朗德取得一种铝型材加工用去毛刺装置专利，去毛刺时方便调整铝型材位置

如何有效利用QQ举报功能维护自己的网络安全与权益

永嘉县三金机械取得一种青铜蝶板的铸造装置专利，大幅降低工人的工作量

如何快速识别歌曲的实用技巧与方法分享

漯河建泰取得手机边框DDG用研磨设备专利，可提高工作效率

如何正确清洗手机，保持健康与设备清洁的实用指南

推荐体验

AIGC重要产品

AI对话：类ChatGPT产品体验

好用的AI绘画工具

火热的AIGC产品

AIGC近期要闻

大公司发布的大模型产品都有哪些？

政府对AIGC的扶持政策

AIGC对就业的影响：我们会失业吗？

AIGC产业影响

AIGC对内容创作的影响

AIGC对绘画设计领域的影响

AIGC对各行各业的影响