weixin_40725706

这个屌丝很懒，什么也没留下！

热门标签

热门文章

当前位置: article > 正文

让AI做2024新高考1卷数学最后一题：AI智商横向对比！_2024新课标一卷数学最后一题

作者：weixin_40725706 | 2024-07-05 03:26:27

赞

踩

2024新课标一卷数学最后一题

大家好，我是木易，一个持续关注AI领域的互联网技术产品经理，国内Top2本科，美国Top10 CS研究生，MBA。我坚信AI是普通人变强的“外挂”，所以创建了“AI信息Gap”这个公众号，专注于分享AI全维度知识，包括但不限于AI科普，AI工具测评，AI效率提升，AI行业洞察。关注我，AI之路不迷路，2024我们一起变强。

一些结论

即使是当下最先进的AI模型，在面对高难度数学推理题时，仍有很大的提升空间。

模型名称	题目理解	解答过程	总体评价
GPT-4o	完全正确	输出大量内容，但大部分不正确，仅成功给出一组答案	题目理解强，但解答过程不准确
GPT-4 turbo	理解与题目要求不符	解答与题目无关，推理和计算不准确	题目理解和解答均存在较大问题
Kimi Chat	理解较为准确	解答中出现AI幻觉，第一小问解答不正确	题目理解较好，但解答过程出现错误
通义千问	初步理解正确，但未详细解释题目	思路正确，但详细解答过程中出现错误	初步理解正确，详细解答不够准确

牵动着无数家长和学子们的一年一度的高考刚刚落下帷幕，那么，今年的高考数学难吗？有考生吐槽：一出考场就哭了。

之前我曾经用高考语文作文横向对比过部分AI模型/工具的创意写作能力，并且做了后续的AI互评，让AI来评价AI写的文章。感兴趣的小伙伴可以翻看这里：

今天，让我们继续。今天我将以2024年新高考数学一卷的最后一题为基准，来测试各大AI模型/工具的表现。

2024年新高考数学一卷最后一题

这道题目是一道数列大题，对于AI来说应该算是很难的级别了，因为这并不是考察AI的知识积累，而是单纯的考察AI的推理能力，包括对题目的理解，知识点的定位，以及解答方法的分析推理。

其次，由于是数学题目，包括很多数学公式，所以我只能以图片的方式来发送给AI模型，这对于AI的多模态支持也是一个挑战，能够看出AI对图片的解析是否正确。

提示词：中文详细解释这道题目，然后写出详细完整的解答计算过程。

题目

答案

下面测评开始。

`GPT-4o`模型

回答速度极快，大概几秒钟就开始响应我的问题。题目理解完全正确，但后面的解答过程中，虽然洋洋洒洒输出了一大堆，但基本都不正确，即使是第一小问。第一小问中，答案应该是三组：（1，2），（1，6），（5，6），GPT-4o成功给出了一组。

`GPT-4 turbo`模型

与GPT-4o不同，GPT-4 turbo模型在题目的理解上就出现了很大的问题，基本上牛头不对马嘴，更不用提后续的解答过程了。

这样的测试结果和OpenAI官方发布的GPT-4o和GPT-4 turbo的对比测评结果是相符的。

Kimi Chat

Kimi的表现可圈可点，可以说对题目的理解方面，是明显强于GPT-4 turbo模型的。虽然这可能与提示词/题目都是中文的有关系，Kimi这种中文大模型会天然有一定的优势，但足以说明，Kimi在图片内容识别和题目的理解上是不错的。

但同样的，在后续的问题解析部分，Kimi也出现了AI幻觉，从第1问开始就不是很正确。我后续又追问了几个问题，让Kimi来写出具体的第1小问的解答，均未得到正确的结果。

通义千问

通义千问并没有遵循我在提示词里说的先详细解释题目，而是简单地写了一段初步理解。但从通义千问的简述来看，它对这道题目的理解是基本正确的。但同样在后续的解答中出现了幻觉，只能说是有思路，但没有做对。

结语

让AI做高考数学题目，离回答正确还有不小的距离。

精选推荐

都读到这里了，点个赞鼓励一下吧，小手一赞，年薪百万！本文内容由网友自发贡献，转载请注明出处：【wpsshop博客】

推荐阅读

相关标签

Copyright © 2003-2013 www.wpsshop.cn 版权所有，并保留所有权利。

闽ICP备14008679号