> 自媒体 > (AI)人工智能 > GPT-3数学不及格,愁坏团队,于是他们出了12500道数学
GPT-3数学不及格,愁坏团队,于是他们出了12500道数学
来源:量子位
2023-04-11 13:07:51
574
管理

贾浩楠 发自 凹非寺 量子位 报道 | 公众号 QbitAI

GPT-3,是个严重偏科的“文科生”。

UC伯克利的研究人员,在对类似GPT-3的大型语言模型进行测试后发现,数学,就是这类AI的盲区。

12500道高中数学题,GPT-3的正确率最低不到3%,最高也没超过7%。

完全不合格啊~

此外,AI解数学题时对不同解题方法的选择组合,也是衡量算法能力的参考。

所以,即便GPT-3平时面对的多是文本任务,但让它去学数学,依然有助于人们弄明白超大模型处理数学推理任务的特点。

之前的研究已经证明,牢固掌握数学概念对AI很重要。

例如,OpenAI最近推出了GPT-f,这是Metamath形式化语言的自动证明器和证明助手。

GPT-f对一些数学问题做出的证明,已经被Metamath主库所接受,这是AI的数学论证第一次数学社区所采用。

Facebook方面也声称已经成功实验了数学AI算法。在去年1月的一篇博客文章中,该公司的研究人员表示,他们已经教会了一个模型将复杂的数学方程视为一种语言,然后将解题过程视为翻译问题。

而在对AI进行训练测试后,发现成绩依然不理想。

数据集中的分步解决方案,能让语言模型像人类数学家一样使用 “短期记忆”。

即模型不必马上得出正确答案,而是可以逐步探索解法一步步走向正确答案。

但即使有了解决方案,研究者发现,对于GPT-2和GPT-3来说,准确率仍然很低.

从上图结果中能看出,让模型在产生答案之前生成自己的解决方案,实际上降低了准确性。因为在许多错误案例中,尽管解题步骤与问题相关,但它们是不合逻辑的。

此外,简单地增加模型中的训练时间和参数数量,有时会提高性能。但事实证明,这样做的代价过于高,训练的时间和能耗都大大增加。

而在AMPS上进行预训练可将准确率提升约25%,这相当于将模型大小提高15倍。

所以,尽管恶补了12500道高中数学竞赛题,GPT-3还是不及格。

但研究人员认为,让AI学会分步解题仍然有进步意义。

与直接在问题和答案上进行训练相比,MATH上训练过的模型,可以提高10%的相对准确率。

最重要的,是模型“掌握”了一些基本数学知识。在一些错误的解法下,AI已经懂得调用相关的公式定理,而不是胡言乱语一通。

AI数学竞赛的第一课,并不是毫无收获。

GPT-3也不要灰心,伯克利的团队说了,随着对模型的改进,今后它们的数学推理能力会越来越强。

MATH和AMPS现在都已开源,有兴趣的研究者可以直接下载:

https://github.com/hendrycks/math/

0
点赞
赏礼
赏钱
0
收藏
免责声明:本文仅代表作者个人观点,与本站无关。其原创性以及文中陈述文字和内容未经本网证实,对本文以及其中全部或者 部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。 凡本网注明 “来源:XXX(非本站)”的作品,均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对 其真实性负责。 如因作品内容、版权和其它问题需要同本网联系的,请在一周内进行,以便我们及时处理。 QQ:617470285 邮箱:617470285@qq.com
相关文章
比ChatGPT更具人性化?谷歌最新研发机器人几乎与医生并肩..
比ChatGPT更具人性化?谷歌最新研发机器人几乎与医生并肩据报道,谷歌的M..
连爆利空,ChatGPT遭官方5项指控!币圈大佬街头遇刺身亡,嫌犯被捕;欧美股..
当地时间4月13日(周四),火爆的美国就业市场和高通胀均释放降温的信号..
ChatGPT又崩了/ 腾讯前副总裁因重婚被诉/ AI不会画游戏手柄..
日报君 发自 凹非寺量子位 | 公众号 QbitAI大家好,今天是4月24日星期—..
大模型格局生变:OpenAI年收入高达13亿美元,竞争对手们却相继裁员倒闭..
(图片来源:unsplash)随着ChatGPT热潮带来 AI 行业快速变革,OpenAI营收..
OpenAI被曝将发布全新开源大模型,网友:GPT平替?
杨净 发自 凹非寺量子位 | 公众号 QbitAIOpenAI终于要“Open”了!最新爆..
盘点那些搞笑聊天对话,直接是一整天的快乐源泉~
Windows 下跌 12%、PC硬件卖不动,微软市值仍破18万亿全靠Open AI..
近日,微软发布了第四财季(2023年Q2季度)和全年财报。这份号称微软“史..
Open AI “宫斗”结束,自主意识AI初现,我们会被取代吗?..
在上周 OpenAI 的“宫斗”闹剧中,最终还是以奥特曼王冠加身的回归作为终..
从语言模型角度看,ChatGPT 的天花板非常低,还有很多红利..
ChatGPT在工业界刮起商业化的与资本风潮的前提下,也帮自然语言理解(NLP..
关于作者
泡沫人生(普通会员)
文章
562
关注
0
粉丝
0
点击领取今天的签到奖励!
签到排行

成员 网址收录40369 企业收录2981 印章生成216706 电子证书945 电子名片57 自媒体34015

@2022 All Rights Reserved 浙ICP备19035174号-7
0
0
分享
请选择要切换的马甲:

个人中心

每日签到

我的消息

内容搜索