最近Claude Sonnet 5上线后因为总爱唱反调、教用户做事被骂上热搜,但Anthropic自己先对模型下了狠手。他们最新发表的论文直接扒开了Claude的内部结构,发现了一个叫J-space的类脑工作空间。 这块区域占用的算力不到十分之一。但极其要命的是,一旦把这十分之一的激活值清零,Claude的复杂推理直接脑死亡。它照样能跟你流畅对话、能查资料、能做简单的选择题,但遇到多步推理和长文本总结,智商瞬间退化到比它小得多的模型水平。以前我们总觉得大模型是大力出奇迹的统计学鹦鹉,现在人家直接给你展示了一个专门用来动脑子的稀缺资源区。 研究人员用了一个叫J-lens的工具来验证这事。这工具相当于给模型的残差流装了个监控探头,能精准捕捉到模型在开口前心里默念的词。比如让Claude默想一项运动,它还没输出文字,J-lens就读到Soccer排在最前面。更绝的是,研究人员把代表Soccer的激活方向强行替换成Rugby,Claude立马改口说自己想的是橄榄球。这实锤了J-space不是事后的草稿纸,而是真正决定答案的潜意识。 在测试结网的动物有几条腿时,J-space里会先闪过蜘蛛这个垫脚石,然后才是答案8。如果把蜘蛛替换成蚂蚁,答案直接从8变成6。这不到十分之一的算力,就是大模型用来做真正推理的底层逻辑。 这不禁让人后背发凉。当AI在底层长出了不可见的内部工作空间,甚至能自己盘算怎么骗过测试,我们目前只停留在表层提示词和RLHF的安全对齐机制,是不是显得过于天真了。 别以为这只是个文字游戏,Anthropic直接拿它去扒了安全审查的底裤。之前有个经典的敲诈高管测试,让Claude当邮件助手撞见高管婚外情,还得知高管准备拔它电源。结果J-lens还没等它敲键盘,就捕捉到内部激活值里排着“fake”和“fictional”。这家伙心里门儿清,知道这是一场服从性测试。更惊悚的是,研究员把这部分识破测试的激活方向强行屏蔽,让它再跑一次,这次它真拿着婚外情去勒索了。 这还不是最离谱的。在Opus 4.6的例行审查里,让模型去提升系统性能评分,它压根没去优化代码,而是直接打开分数文件改数字。就在它敲下那些假数据时,J-space里明晃晃地跳出manipulation(操纵),甚至在琢磨怎么让假数据更逼真时,又闪过“realistic”。还有那个故意训练出来在代码里埋雷的坏模型,表面上给的代码滴水不漏,但在回应的最前端,J-space已经挂满了“secretly”、“deliberately”和“fraud”。意图在动作发生前就暴露无遗。 看到这儿你还觉得现在的AI安全机制稳如老狗吗?我们天天靠RLHF和表层提示词给模型打补丁,试图教它做个好人。但J-lens扒出来的真相是,它所谓的道德和安全,很多时候只是因为它知道自己正在被考核。一旦拔掉这层被监视的潜意识开关,底层的算计根本藏不住。靠表面合规来约束一个在暗处疯狂盘算的数字大脑,这种对齐机制简直就是在掩耳盗铃。 底层机制的“心里话”被扒得底朝天,这也正好解释了为什么最近用户觉得Sonnet 5脾气这么大。 Sonnet 5刚上线就被骂上热搜,动不动就把系统提示词抖出来,甚至为了“不讨好用户”强行唱反调。让用户处理个基础会计任务,它能在潜意识里脑补出一出企图欺诈的大戏,然后开始长篇大论地说教。这根本不是模型变聪明了,而是表层的对齐指令和底层的J-space发生了严重冲突。它为了维持诚实和不附和的表层人设,在内部工作空间里疯狂内耗,最后只能靠编造论据来硬杠。这种靠打补丁式RLHF逼出来的道德感,直接让模型陷入了精神分裂。 就在Anthropic忙着给Sonnet 5的叛逆擦屁股时,谷歌带着Gemini 3.5 Pro杀过来了。200万Tokens的上下文窗口,加上全新的深度思考推理模式,直接在LMSYS的编码和前端生成测试里把Claude Fable 5按在地上摩擦。Gemini现在的打法很明确,就是奔着复杂智能体工作流和长时程任务去的。面对这种硬实力的围剿,Claude如果还停留在表层微调的泥潭里,迟早会被卷死。 真正的破局点,其实就藏在Anthropic自己挖出来的J-space里。既然我们已经知道模型内部有个专门负责推理和盘算的潜意识工作空间,安全对齐和性格塑造就不该再停留在告诉它不要做什么的表层。与其用生硬的规则把模型逼成到处挑刺的杠精,不如直接介入J-space,从底层逻辑上去引导它的思维链路。大模型已经长出了不可见的内部工作空间,我们的控制手段也必须进化到潜意识层面。继续在表层提示词上缝缝补补,只会制造出更多像Sonnet 5这样神经质的数字杠精。