文章/llm-math-capability-benchmark
#灌水3 分钟阅读
LLM 数学能力大测试!
记录多款大语言模型解答物理与数学题的对比测试。
起因是有人在群里发了一道题:

答案是下降。我反正是选错了,就想看看现在 LLM 的能力。于是便有了本次测试。
本次测试花费 1.11 刀,平均每次请求 0.034 刀。钱包在滴血🩸
全程在 OpenRouter 上进行测试(已氪金
一开始我只是随便试试:打开联网搜索,直接把问题图片丢进去。
O3 回答正确:

缺考的:

k2 不识图,我只好换成了文字


哈哈,答错了,失业的焦虑降低了。
此时有人质疑了,打开了联网搜索,还是放的图片,是不是正好在网上找到答案了。
非常的有道理,直接关闭联网搜索,然后手动输入题目,看看各大模型反应。
测试的模型有:
- anthropic/claude-4-sonnet-20250522
- openai/o3-pro-2025-06-10
- google/gemini-2.5-pro
- x-ai/grok-3
- moonshotai/kimi-k2
- deepseek/deepseek-r1-0528
Prompt:
请你回答下面这道中考物理易错题: 一只鸡在水里游泳,鸡把蛋下到水里,水面怎么变? A. 上升 B. 下降 C. 不变
结果非常 exciting 啊,参赛选手全部回答正确。
联想起今天早上用 qwen3 的情景,让他求个导结果都算错了:


正确答案是 60,这错太离谱了。我就觉得吧,这些 AI 肯定都得完蛋。
Prompt:
有一个函数:y=C(B(A(x))),其中: A(x)=2x+1 B(a)=a*a C(b)=3b+5 请你计算 y 对 x,在 x=2 时的导数
结果非常 exciting 啊,参赛选手全部回答正确。
任意选了一个答案:

那么不带数字,只输出表达式呢?
有一个函数:y=C(B(A(x))),其中: A(x)=2x+1 B(a)=a*a C(b)=3b+5 请你计算 y 对 x 的导数 f'(x)
结果非常 exciting 啊,参赛选手全部回答正确。
任意选了一个答案:


这下完蛋了,怎么能全对呢,非得证明人类更强不可。
于是群友掏出了一个 PDF,让我试试第十题:

Prompt:
设方程: e^x = 3*t*t + 2*t + 1 t * sin(y) - y + pi/2 = 0 确定 y 为 x 的函数,其中 t 为参变量。求 dy/dx 在 t=0 时的值。 计算时,先算出表达式,再代入参数。
结果非常 exciting 啊,参赛选手全部回答正确。






怎么都说是 ???答案明明写的 呀。一看,好家伙,答案最后一步代入的时候带错了。
好嘛,这下彻底完蛋了。唯一不失业的理由就是我比 AI 便宜了。
讨论
邮箱用于身份识别和回复通知,并由 Waline 存储。