文章/llm-math-capability-benchmark

#灌水3 分钟阅读

LLM 数学能力大测试!

记录多款大语言模型解答物理与数学题的对比测试。

起因是有人在群里发了一道题:

3c46428c58094b0008844d974c483758.jpg

答案是下降。我反正是选错了,就想看看现在 LLM 的能力。于是便有了本次测试。

本次测试花费 1.11 刀,平均每次请求 0.034 刀。钱包在滴血🩸

全程在 OpenRouter 上进行测试(已氪金

一开始我只是随便试试:打开联网搜索,直接把问题图片丢进去。

O3 回答正确:

image.png

缺考的:

image.png

k2 不识图,我只好换成了文字

image.png

image.png

哈哈,答错了,失业的焦虑降低了。

此时有人质疑了,打开了联网搜索,还是放的图片,是不是正好在网上找到答案了。

非常的有道理,直接关闭联网搜索,然后手动输入题目,看看各大模型反应。

测试的模型有:

  • anthropic/claude-4-sonnet-20250522
  • openai/o3-pro-2025-06-10
  • google/gemini-2.5-pro
  • x-ai/grok-3
  • moonshotai/kimi-k2
  • deepseek/deepseek-r1-0528

Prompt:

请你回答下面这道中考物理易错题:

一只鸡在水里游泳,鸡把蛋下到水里,水面怎么变?
A. 上升 B. 下降 C. 不变

结果非常 exciting 啊,参赛选手全部回答正确。

联想起今天早上用 qwen3 的情景,让他求个导结果都算错了:

2b20e5f20a8b83f56859de4d7cff9c3c.png

61d3ee5f36a78a2f1015a7ffa8215fe5.png

正确答案是 60,这错太离谱了。我就觉得吧,这些 AI 肯定都得完蛋。

Prompt:

有一个函数:y=C(B(A(x))),其中:
A(x)=2x+1
B(a)=a*a
C(b)=3b+5
请你计算 y 对 x,在 x=2 时的导数

结果非常 exciting 啊,参赛选手全部回答正确。

任意选了一个答案:

image.png

那么不带数字,只输出表达式呢?

有一个函数:y=C(B(A(x))),其中:
A(x)=2x+1
B(a)=a*a
C(b)=3b+5
请你计算 y 对 x 的导数 f'(x)

结果非常 exciting 啊,参赛选手全部回答正确。

任意选了一个答案:

image.png

image.png

这下完蛋了,怎么能全对呢,非得证明人类更强不可。

于是群友掏出了一个 PDF,让我试试第十题:

image.png

Prompt:

设方程:
e^x = 3*t*t + 2*t + 1
t * sin(y) - y + pi/2 = 0
确定 y 为 x 的函数,其中 t 为参变量。求 dy/dx 在 t=0 时的值。
计算时,先算出表达式,再代入参数。

结果非常 exciting 啊,参赛选手全部回答正确。

image.png

image.png

image.png

image.png

image.png

image.png

怎么都说是 12\frac{1}{2}???答案明明写的 22 呀。一看,好家伙,答案最后一步代入的时候带错了。

好嘛,这下彻底完蛋了。唯一不失业的理由就是我比 AI 便宜了。

相关阅读

文章【无意义碎碎念】如何构建动物语言翻译器文章FalconFS:面向大规模深度学习流水线的分布式文件系统MemovLLM 部署为 systemd 服务

讨论

邮箱用于身份识别和回复通知,并由 Waline 存储。