23场对局,造出核弹把法国首都炸成平地,结果还是输了。这听起来像段子,却是英国前首相府数据科学家Liam Wilkinson周末爆改《文明6》测出的真实战况。他把Claude、GPT等四个顶尖大模型扔进游戏,搭了76个工具让AI接管全局。在这个没有画面和动画,只有管道分隔符和六边形坐标的纯文本世界里,AI每回合面临的决策组合高达10的166次方。 最魔幻的一局里,Claude扮演葡萄牙,开局稳扎稳打建起贸易帝国,外交胜利进度一度冲到18/20。眼看法国文化胜利进度条飙升,Claude慌了,和平手段穷尽后直接翻开科技树最后一页。接下来50个回合,它把资源全抽去搞曼哈顿计划,第305回合成功核平法国文化重镇图卢兹。 核弹确实停了法国的文化进度条,但AI赢了吗?并没有。在这死磕核武器的50回合里,它完全没注意到法国在疯狂攒外交分。第318回合,法国以20比18的外交分数拿下比赛。AI盯着单一威胁打了半个世纪,却输在了自己曾经领先的外交局里。 这场荒诞的核平复仇,扯下了大模型最尴尬的一块遮羞布。我们总以为堆算力、拼参数就能通向超级智能,但这场惨败证明,智力根本不是唯一瓶颈。当AI在复杂决策局里连全局状态都懒得看一眼,写出的战略计划执行率不到一半时,再聪明的大脑也治不了国。在教AI怎么毁灭世界之前,我们得先教它们怎么睁开眼看清棋盘,伸出手把事干成。 做选择题拿满分,真扔到复杂决策局里连两周都活不过。这就是顶尖大模型眼下的尴尬处境。 Wilkinson之前搞过一套包含3497道题的英国政府政策题库,GPT-5直接考了99.26分,妥妥的满级做题家。但治国不是背书,选择题根本测不出多线程决策和长期规划。把它扔进《文明6》这个需要眼观六路的真实考场,学霸直接原形毕露。 最离谱的是AI严重的感知盲区。它每回合忙着造建筑、搞外交,但主动看一眼排行榜、查查对手进度的动作,只占全部操作的1%到2%。不主动查的东西,对它来说就不存在。玩韩国那局最搞笑,AI在日记里全程吹嘘自己科技碾压,实际上科技产出排倒数第一。直到第178回合首都沦陷,它都不知道自己是最弱的那个,最后两城残国直接投降。 另一个大坑是知行差距。让AI写份治国纲领,它写得比很多人类政客都漂亮。但写完转头就忘。数据显示,AI写下计划后10回合内的实际执行率只有48%到66%。连表现最好的模型也有三分之一的计划烂在日记本里。 满脑子都是宏大战略,手脚却根本不听使唤。政策题库考满分没用,真扔进复杂决策局,这种不睁眼、不动手的AI根本玩不转。通向超级智能的路上,光长脑子不够,得先治好这严重的工程残疾。 四大顶级AI在《文明VI》中对决,Claude使用核弹攻击法国的游戏画面 咱们来看看这23场对局里最让人啼笑皆非的一局。Claude扮演葡萄牙,开局可以说是天胡。它稳扎稳打建起海上贸易帝国,外交胜利进度一路狂飙到18/20,距离赢下比赛就差两分。 眼看法国的文化胜利进度条开始飙升,这个满级做题家慌了。它试着搞外交、派间谍、弄贸易制裁,发现全都没用。于是,Claude直接翻开科技树最后一页,决定All in曼哈顿计划。 接下来的50个回合,它像疯了一样把资源从贸易和外交里抽出来,全砸进核武器研发。第305回合,核弹就绪,它直接把法国的文化重镇图卢兹夷为平地。法国的文化进度条确实停了,AI以为自己能绝地反击。 结果呢?法国转头靠疯狂攒外交分,在第318回合以20比18拿下了比赛。讽刺的是,那18分还是葡萄牙AI开局自己辛苦攒下的老本。它为了防文化胜利,把原本能赢的外交局给硬生生作死了。 这就暴露出大模型在感知架构上的致命短板。AI的视野里死死盯着那个飙升的文化威胁,却对法国偷偷攒外交分的动作视而不见。它不是不想赢,而是它的感知机制决定了它只能处理主动调用的信息,不查的东西对它就不存在。 参数规模再大,也掩盖不了这种顾此失彼的工程缺陷。一个连全局状态都看不全、执行起来顾头不顾尾的AI,就算脑子转得再快,也注定在复杂决策里翻车。通向超级智能的路上,咱们得先教这些偏执狂怎么睁开眼看清整个棋盘,而不是由着它们闭着眼睛扔核弹。 闭着眼睛狂奔,正是这批顶尖AI在整场游戏里的常态。Wilkinson从23场对局里扒出一个让人哭笑不得的数据:AI主动检查全局状态的行为占比,只有可怜的1%到2%。剩下的98%时间,它们都在低头处理局部任务,完全不看大环境。不主动调用工具去查的东西,对AI来说就等于不存在。 拿韩国那局来说,简直是把这种装瞎演绎到了极致。韩国在游戏里是自带科技加成的文明,AI在日记里一路狂吹,笃定自己正在碾压科技树。可它压根没去查过排行榜。实际数据惨不忍睹,它的科技产出每回合只有44.7,全场垫底。对比一下马其顿的89.3和波斯的64.9,简直没眼看。 这种迷之自信全建立在没验证过的幻觉上。直到第178回合波斯大军兵临城下,首都直接沦陷,它才被迫面对现实。到了第216回合,AI只能带着两座残城屈辱投降。从头到尾,它都没意识到自己才是全场最弱的那个。 这根本不是什么智力不够,而是感知架构的底层缺陷。你把模型参数翻十倍、百倍,它也不会突然变得爱看全局。1%到2%的感知盲区,靠堆算力根本填不平。通向超级智能的路上,如果AI连睁开眼看看周围环境的机制都没做好,再聪明的脑子也只是个闭眼狂奔的瞎子。先教它们学会感知真实世界,比盲目追求参数规模紧迫得多。 就算偶尔睁开眼看清了局势,真让这帮大模型动手干活,表现照样让人没眼看。Wilkinson从对局里扒出另一个扎心数据:AI写下战略计划后,10回合内的实际执行率只有48%到66%。 拆开来看更是惨烈。Claude Opus 4.6执行率最低,只有48.2%,连一半都达不到。GPT-5.4勉强算63.2%,表现最好的Gemini 3.1 Pro也就65.8%。哪怕是这些顶尖模型,也有三分之一的宏大计划直接烂在了日记本里,写完转头就忘。 这帮AI写起战略规划来一套一套的,逻辑和文笔比唐宁街的政客漂亮多了。可一旦进入执行环节,直接拉胯。研究者管这叫知行差距。让AI写份治国纲领它能拿满分,真让它按自己的纲领去治国,估计连两周都活不过。 这根本不是智力或者参数规模的问题,而是纯粹的执行落地工程缺陷。大脑转得飞快,手脚却根本不听使唤。以前我们总盯着怎么让AI更聪明,现在得认清现实,一个连自己定下的计划都执行不到一半的AI,根本担不起复杂决策的重任。通向超级智能的路上,光长脑子没用,先治好这手脚笨拙的工程残疾,把事干成,比盲目堆算力紧迫得多。 游戏里写好的计划执行不到一半,顶多是输掉一局《文明6》,但在现实物理世界,手脚笨拙的AI可是要出人命的。把视线从六边形棋盘拉到马路上,特斯拉最近就首起FSD行人致死案达成和解。美国国家公路交通安全管理局直接将调查升级至工程分析,一口气覆盖了全美320万辆配备FSD的车辆。 这可不是简单的公关危机。FSD在实验室里跑分、在模拟器里预测,数据漂亮得像满级做题家。可一到真实的物理世界,面对突然窜出来的行人、错综复杂的路口,它的执行系统就跟不上聪明的大脑了。这跟游戏里那些写得出宏大战略却连一半计划都落地不了的AI如出一辙。大模型在云端能算出最优的行驶轨迹,但真到了需要微调方向盘、紧急踩下刹车的那零点几秒,工程落地上的感知盲区和执行延迟就会要命。 以前行业里总觉得,只要算力堆得够高,模型参数够大,自动驾驶的长尾问题就能被暴力破解。现在看看这320万辆被拉进调查名单的车,现实狠狠打脸。通向超级智能的瓶颈,真不是大脑不够聪明,而是感知架构和执行落地的工程账根本没算明白。 AI得先学会在物理世界里真正睁开眼看清路况,伸出手稳稳握住方向盘。连基本的物理交互都做不到安全兜底,参数堆得再高也只是个危险的半成品。 现在整个行业都陷入了一种算力崇拜,总觉得只要参数堆得够多,通往超级智能的路就能被暴力破解。前阵子DeepMind发论文画了四条通往AGI的路径,底层逻辑全押在怎么让AI大脑更聪明上。但《文明6》里那些闭眼扔核弹的惨案,加上特斯拉FSD在现实里闹出的人命官司,直接把这种唯参数论的迷信按在地上摩擦。 感知盲区和执行拉胯,从来都不是智力问题,而是底层架构和工程落地的硬伤。你把模型参数翻十倍、百倍,它该装瞎还是装瞎,该烂尾的计划照样烂尾。大脑转得飞快,装在一个没有感知反馈、执行不听使唤的躯壳里,照样是个高级**。通向超级智能的真正瓶颈,早就不是云端里那个越来越大的大脑,而是怎么给这个大脑配上能看清现实的眼睛和能干活的手。 别再迷信大力出奇迹了。在教AI怎么思考宇宙终极问题之前,先让它们学会在物理世界里安全地睁开眼、稳稳地伸出手。把感知闭环和执行落地的工程账算明白,让AI真正能把事干成,比在跑分榜单上死磕那几个小数点紧迫得多。