大家好,我是木易,一个持续关注AI领域的互联网技术产品经理,国内Top2本科,美国Top10 CS研究生,MBA。我坚信AI是普通人变强的“外挂”,所以创建了“AI信息Gap”这个公众号,专注于分享AI全维度知识,包括但不限于AI科普,AI工具测评,AI效率提升,AI行业洞察。关注我,AI之路不迷路,2024我们一起变强。
一些结论
即使是当下最先进的AI模型,在面对高难度数学推理题时,仍有很大的提升空间。
模型名称 | 题目理解 | 解答过程 | 总体评价 |
---|---|---|---|
GPT-4o | 完全正确 | 输出大量内容,但大部分不正确,仅成功给出一组答案 | 题目理解强,但解答过程不准确 |
GPT-4 turbo | 理解与题目要求不符 | 解答与题目无关,推理和计算不准确 | 题目理解和解答均存在较大问题 |
Kimi Chat | 理解较为准确 | 解答中出现AI幻觉,第一小问解答不正确 | 题目理解较好,但解答过程出现错误 |
通义千问 | 初步理解正确,但未详细解释题目 | 思路正确,但详细解答过程中出现错误 | 初步理解正确,详细解答不够准确 |
牵动着无数家长和学子们的一年一度的高考刚刚落下帷幕,那么,今年的高考数学难吗?有考生吐槽:一出考场就哭了。
之前我曾经用高考语文作文横向对比过部分AI模型/工具的创意写作能力,并且做了后续的AI互评,让AI来评价AI写的文章。感兴趣的小伙伴可以翻看这里:
-
让AI写高考作文:GPT-4、Kimi、通义千问“创意写作”能力横向测评!
-
AI文章互评:得分最高的竟然不是GPT-4!
今天,让我们继续。今天我将以2024年新高考数学一卷的最后一题为基准,来测试各大AI模型/工具的表现。
2024年新高考数学一卷最后一题
这道题目是一道数列大题,对于AI来说应该算是很难的级别了,因为这并不是考察AI的知识积累,而是单纯的考察AI的推理能力,包括对题目的理解,知识点的定位,以及解答方法的分析推理。
其次,由于是数学题目,包括很多数学公式,所以我只能以图片的方式来发送给AI模型,这对于AI的多模态支持也是一个挑战,能够看出AI对图片的解析是否正确。
提示词:中文详细解释这道题目,然后写出详细完整的解答计算过程。
题目
答案
下面测评开始。
GPT-4o
模型
回答速度极快,大概几秒钟就开始响应我的问题。题目理解完全正确,但后面的解答过程中,虽然洋洋洒洒输出了一大堆,但基本都不正确,即使是第一小问。第一小问中,答案应该是三组:(1,2),(1,6),(5,6),GPT-4o
成功给出了一组。
GPT-4 turbo
模型
与GPT-4o
不同,GPT-4 turbo
模型在题目的理解上就出现了很大的问题,基本上牛头不对马嘴,更不用提后续的解答过程了。
这样的测试结果和OpenAI官方发布的GPT-4o
和GPT-4 turbo
的对比测评结果是相符的。
Kimi Chat
Kimi的表现可圈可点,可以说对题目的理解方面,是明显强于GPT-4 turbo
模型的。虽然这可能与提示词/题目都是中文的有关系,Kimi这种中文大模型会天然有一定的优势,但足以说明,Kimi在图片内容识别和题目的理解上是不错的。
但同样的,在后续的问题解析部分,Kimi也出现了AI幻觉,从第1问开始就不是很正确。我后续又追问了几个问题,让Kimi来写出具体的第1小问的解答,均未得到正确的结果。
通义千问
通义千问并没有遵循我在提示词里说的先详细解释题目,而是简单地写了一段初步理解。但从通义千问的简述来看,它对这道题目的理解是基本正确的。但同样在后续的解答中出现了幻觉,只能说是有思路,但没有做对。
结语
让AI做高考数学题目,离回答正确还有不小的距离。
精选推荐
-
使用GPT-4o模型的5种方法,总有一种适合你!
-
关于最新模型GPT-4o的14条总结,都在这里!
-
免费的GPT4终于要来了!OpenAI直播发布会详细解读!
-
春日暖阳,何不来看一场OpenAI的发布会
都读到这里了,点个赞鼓励一下吧,小手一赞,年薪百万!😊👍👍👍。关注我,AI之路不迷路,原创技术文章第一时间推送🤖。