消息称两年半时间,AI 门萨智商测试从 64 分到 151 分

9月28日消息,近日,在美国记者 Maxim Lott 维护的 TrackingAI 榜单上,Claude Fable 5.1 与支持看图作答的 GPT-6 Astra 在挪威门萨(Mensa Norway)智商测试(35 道图形推理题,限时 25 分钟)中一道未错,连续 7 次考出满分 151 分。

此外,GPT-5.6 Sol 与 Gemini 3.1 Pro 考到 145,公开卷上突破 140 分的模型已排成一长串,国产模型也杀进了第一梯队。

这种矩阵题最早由英国心理学家约翰·瑞文在 1936 年设计,被普遍看作最能测出整体聪明程度的题型。2024 年初,Gemini Advanced 做门萨卷最简单的第 1 题,还会一本正经地编出一串「A+B=C」的方程;有 AI 只蒙对 6 道,考了 64 分。

转折出现在 2024 年 9 月:OpenAI 的 o1 学会先内部推理、再作答,分数一下冲过 120,此后「先想再答」成了所有旗舰模型的标配,分数一路往上冲,今年 4 月榜单上跳出第一个 151 分。

AI 考这么好是不是因为题型它都见过? 2024 年 5 月 Lott 专门请了一位门萨会员从零出了一套从未在互联网露面的新题。换卷之后,刷题效应确实露了出来,有的模型一换到保密卷就原形毕露,比公开卷掉二十来分。

但头部模型面对一张从没见过的卷子,照样逼近满分。16 道题的保密卷最高能打约 136 分,OpenAI 的 GPT-5.6 Terra 看图版已杀到 135,Fable 5.1 与 Astra 也都有 130 分,旁边还并肩站着一个国产模型。

去年 10 月,Lott 还胸有成竹地预计 AI 至少要再等两年,才能在这张卷的看图版上拿满分;结果不到一年,GPT-5.6 Terra 就一脚油门冲到线前,比他的预测早了一年多。

Copyright © DoNews 2000-2026 All Rights Reserved
京ICP备2025120072号