首页 > 策划知识 > 策划知识 > 9.11和9.9哪个大?实测12个大模型8个都答错,ChatGPT也翻车了

9.11和9.9哪个大?实测12个大模型8个都答错,ChatGPT也翻车了

发布时间:2024-07-19 16:28:18来源: 15210273549

导读

一道小学生的数学题竟然难倒了全球AI大模型,只有4个大模型给出了正确答案!这究竟是怎么一回事?快来看看!

 

全球AI大模型被一道小学生数学题难倒

日前,一道来自小学生的数学题却难倒了不少海内外AI大模型,这道题的内容是“9.11和9.9哪个更大”,而仅有4个大模型给出了正确答案。

 

挑战大模型的数学推理能力

大模型的数学能力一直是短板,即便是目前最好的大模型GPT4也仍然有很大进步空间,而此前笔者在采访12位大模型时也得出了一个惊人的结论,这些大模型中仅有4个回答是正确的,而其他8个大模型却都给出了错误的答案。

 

数字切分问题与模型的理解能力

而针对大模型的数学能力,笔者曾进行过深入的采访,大部分行业人士认为大模型数学能力差的根本原因还是出在分词上,即Tokenizer(分词器)在处理数字时会出现问题,导致模型难以正确理解和计算。

 

正确答案揭晓与未来的发展方向

而这道9.11和9.9的大小比较题,12个大模型中,只有阿里通义千问、百度文心一言、Minimax和腾讯元宝答对,其他8个大模型都认为9.11比9.9更大。

 

虽然最终4个大模型给出了正确答案,但这并不能掩饰大模型数学能力的薄弱,毕竟面对简单的大小比较题,8个大模型都给出了错误答案。

 

而对于未来大模型的发展方向,笔者也咨询了不少专家学者以及从业者,针对此前大模型的回答,不少人表示“并不意外”。

一些专家认为,未来在模型的训练数据上会越来越依赖构造型的数据,而不是直接爬取下来的数据,以提升模型的复杂推理能力。

 

因为直接爬取下来的数据中会夹杂大量的错误数据,这些错误数据会误导模型,导致模型做出错误的判断。

而构造型的数据则可以事先筛选,保证数据的准确性和可靠性,从而培养模型健康的思维方式。

策划知识更多>>

2024年南京市鼓楼区教育局所属学校招聘教师公告 2024年宁波幼儿师范高等专科学校招聘专任教师公告 2024年度汕尾市高校毕业生基层公共就业创业服务岗位招募公告(28人) 2024年珠海市金湾区金融服务中心招聘合同制职员公告(1人) 2025年大连市瓦房店市教育系统自主招聘教师公告 2024年海南师范大学招聘员额制大学生心理健康教育工作人员公告(2人) 2024年巴东县事业单位考核聘用2022年 “三支一扶”高校毕业生公告(38人) 2024年苏州工业园区新洲幼儿园教学辅助人员、后勤辅助人员招聘启事 凭借黑猫好猫走红的欧拉汽车,为何如今的存在感越来越低了? 累计亏损900多亿的蔚来汽车,为何总能迎来高光时刻? 小米汽车:10月交付量冲击2万辆,明年将推出售价80万车型 奇瑞风云A9官图来了:很接近概念车,产品力怎么样? 新车:被称为“五座版MPV”,小鹏P7+有哪些过人之处? 名爵MG ES5上市,一口价10.39万起,竞争比亚迪元PLUS 埃安AION RT正式上市,11.98万起,高配有激光雷达 小鹏P7+正式上市,18.68万起,标配视觉智驾,主打空间 疑似日产轩逸纯电版谍照曝光,大沙发依旧,还有冰箱彩电 从默默无闻,到和理想、比亚迪并肩,零跑做对了什么? 预计售价30万起,搭第五代DM技术,比亚迪夏将于年内上市 限量38辆,起配价3052.5万元,可合法上路的赛道车型来了 对标海豚和缤果,吉利首款小型纯电车上市,搭载Flyme车机 外观跟小鹏X9一样“科幻”,小鹏P7+亮相巴黎,国内预售20.98万起 购车享0首付0息!解读小鹏高端MPV,标配后轮转向、800V+3C快充 超五星安全加持?两次针刺都不起火,宝骏云海安全性真有这么牛? 告别自燃与停车难,持证上岸的宝骏云海,到底有多香? 2024年莆田市第一医院南日分院(秀屿区南日镇卫生院)编外工勤人员招聘公告 2024年莆田市第一医院编外专技合同工招聘公告 2024年福建省级机关医院招聘高层次人才及学科带头人工作方案 2024年福建省农业科学院公开招聘博士研究生人员方案 2024年厦门市集美区杏东中学非在编教师招聘简章