代码生成超八成,AI编程为何反爆账单?
AI Agent
AI Agent
Coding Agent
研发提效
成本治理
网易游戏
“AI写代码渗透率都超八成了,为啥研发周期没缩短,月度Token账单反而破千万了?”很多团队在规模化落地Coding Agent时,都撞上了流程与成本的两堵墙:代码写得快,但需求上游和测试下游成了新瓶颈;开发者为了效果猛堆算力,在降本和降智之间反复横跳。这篇文章拆解网易游戏如何引入SDD重构研发协作,并通过本地知识图谱和模型智能路由把账单打下来。不谈虚无缥缈的AGI,只看一线大厂怎么把AI Agent从个人玩具变成组织级生产力。
网易游戏内部的一组数据挺扎心。当AI编程工具的代码生成覆盖率飙过80%时,大家本以为研发周期能大幅缩短,结果整体交付时间没怎么变,月度Token账单倒是先破了千万大关。现在连Snowflake这种数据巨头都在高调宣扬用AI重新定义工作,大厂们也纷纷把AI Agent捧上神坛。但真到了落地环节,现实往往很骨感。这就是现实。
代码写得快,根本不等于写得对。以前程序员一天敲500行代码,现在AI一秒钟吐出5000行。表面看产能翻倍,但上游需求没理清,下游测试没跟上。AI生成的代码就像流水线上的半成品,如果策划给的需求本身就是一笔糊涂账,测试用例又没覆盖全,最后全堆在联调和修Bug上。Agent算力再强,也救不了烂需求。
更头疼的是那一路狂飙的账单。开发者为了追求生成质量,习惯性地塞入海量上下文,无脑堆算力。大模型在降本和降智之间反复横跳,写个简单的增删改查也要调用最贵的旗舰模型,杀鸡偏用牛刀,Token消耗自然像流水一样。
别总盯着模型参数和跑分看了。当编码不再是瓶颈,真正的较量是怎么把模糊需求翻译成Agent能懂的规格,以及怎么把高昂的使用成本抠下来。流程不重塑,成本不治理,AI编程充其量只是个昂贵的代码打字机。
网易游戏在内部推行AI编程时,就撞上了这堵隐形的墙。代码生成覆盖率飙到80%以上,可整体研发周期并没见缩短。原因很现实,瓶颈压根没消失,只是转移了。
以前程序员手敲代码慢,产品经理和测试同学有充足的时间去对齐需求、打磨用例。现在AI一秒钟吐出几千行代码,上游的需求如果还是一笔糊涂账,下游的测试如果还是老一套,结果就是灾难性的。
写代码的环节被AI按下了快进键,但需求澄清和测试验证的环节还停留在冷兵器时代。策划给的需求含糊其辞,AI只能按字面意思去硬编,最后生成的代码看似逻辑严密,实则南辕北辙。到了测试环节更惨,AI生成的代码量呈指数级暴增,传统的测试用例根本覆盖不全,联调和修Bug的时间反而被无限拉长。
网易游戏AI产品策划专家蓝师师在复盘时就直言,写得快,不等于写得对、测得完。这就好比给流水线换上了全自动机械臂,但进料口的零件还是歪瓜裂枣,出厂前的质检还是靠人工拿放大镜看。Agent算力再强,也救不了烂需求。
要打破这个死结,光盯着代码生成率自嗨没用。得把规范左移到需求策划阶段,让AI能看懂规格说明书,同时把测试标准前置。别等代码堆成山了再去擦屁股,把需求做扎实,才是给AI编程真正踩下油门。
流程没理顺带来的隐性成本已经够让人头疼了,但更扎心的是摆在桌面上的显性账单。网易游戏在内部推行AI编程时,月度Token消耗直接突破千万大关。这可不是什么小打小闹的测试开销,而是真金白银在燃烧。
很多开发者用Agent的姿势还停留在原始社会。为了追求所谓的生成质量,不管三七二十一,把整个项目的代码库、几万行的上下文一股脑全塞给大模型。以前写个简单的增删改查接口,程序员自己理清逻辑就行。现在倒好,地毯式代码检索,漫无目的地把无关文件全喂进去,还要调用最贵的旗舰模型。杀鸡偏用牛刀,Token消耗自然像开了闸的洪水。
这就逼着团队在降本和降智之间走钢丝。用便宜的小模型吧,上下文一长就开始降智,生成的代码驴唇不对马嘴;用贵的旗舰模型吧,效果是保住了,但月底的账单直接教做人。开发者每天盯着Token余额提心吊胆,稍不留神就掉进预算超支的坑里。
算不清这笔经济账,Agent规模越大,公司亏得越快。别把Token当不要钱的自来水,得搞精细化的成本治理。用本地代码知识图谱精准提取上下文,拒绝无脑投喂;用模型智能路由,让简单任务走小模型,复杂逻辑上旗舰机。不把Token经济学刻进团队基因,再强的AI也只会是个昂贵的碎钞机。
算不清账确实要命,但光盯着Token省钱,也解决不了交付周期没缩短的痛点。网易游戏在内部复盘时就看透了这一点,直接搞出了一套SDD(规格驱动开发)的解法。核心逻辑很直接,既然AI是个没有感情的执行机器,那就别给它喂模糊的人类语言,得把需求翻译成它能精准解析的规格。
以前策划写需求,经常是几页文档加几张草图,剩下的全靠开会脑电波对齐。现在SDD直接左移到需求上游,策划在写需求时就得按照机器能理解的格式输出规格说明。需求说得清,Agent才不会瞎编。到了下游测试环节,传统做法是等代码写完了再人工造用例,现在SDD延续至QA,测试标准直接前置。规格一旦定好,测试用例就能自动对齐,测得准才不至于让联调变成灾难。
这种从Harness Engineering到Looping Engineering的转变,本质上是把人的经验沉淀成了机器能循环执行的工程规范。网易游戏蓝师师在复盘时直言,写得快不等于写得对,必须用数据倒逼流程改造。
别总幻想着靠换个参数更大的模型来解决所有烂摊子。工具再强,也得有适配它的流水线。把规范左移、测试前置,用SDD把模糊需求翻译成Agent能懂的规格,才是真正给AI编程踩下油门。流程不重塑,再聪明的Agent也只能在烂需求里打转。
流程理顺了,接下来就得好好算算经济账。网易游戏月度Token消耗破千万,光靠SDD解决不了账单狂飙的问题,还得在成本治理上动真刀子。
很多开发者用Agent的姿势还停留在原始社会。以前自己写代码,上下文全在脑子里。现在有了AI,为了追求生成质量,不管三七二十一,把整个项目的代码库、几万行的上下文一股脑全塞给大模型。写个简单的增删改查接口,也要调用最贵的旗舰模型。这种漫无目的的地毯式代码检索,加上无脑堆算力,Token消耗自然像开了闸的洪水。
网易游戏在实战中摸索出的解法很务实。首先是搞本地代码知识图谱。这可不是为了赶时髦,而是为了精准提取上下文。通过知识图谱,Agent能顺藤摸瓜找到真正相关的代码片段,拒绝把无关文件全喂进去,从源头上掐断无效Token消耗。
其次是模型智能路由。杀鸡焉用牛刀,让合适的模型做合适的事情。简单的代码补全、格式化或者基础增删改查,直接路由给便宜高效的小模型;遇到复杂的架构设计、核心业务逻辑,再切到旗舰大模型。这种按需分配的策略,硬生生把账单砍下来一大截。
再加上上下文治理,在Agent链路的各个环节去抠细节。不把Token当不要钱的自来水,而是把成本意识刻进每一次调用里。
算不清这笔账,Agent规模越大公司亏得越快。成本治理从来不是盲目抠门,而是把好钢用在刀刃上。拒绝无脑堆算力,用精细化的工程手段把Token经济学落到实处,AI编程才能真正从昂贵的碎钞机变成赚钱的生产力。
单点工具再牛,也救不了一个烂团队。网易游戏在实战中摸爬滚打出来的经验很直接:AI Agent规模化落地的真正瓶颈,早就不是模型参数够不够大,而是怎么重构整个组织的研发流程和治理成本。
靠几个技术骨干用上新工具,顶多算个人提效。真要让几百人的研发团队整体跨越,得靠数据倒逼。把代码生成覆盖率、Token消耗明细、Bug修复率这些指标全拉出来,直接晒在周会上。数据不会骗人,当策划看到自己含糊的需求导致下游测试Token消耗暴增时,当开发看到自己无脑堆上下文导致预算超标时,不用你天天开会喊口号,流程他们自己就急着改。
更关键的是,得把Token经济学刻进团队基因。以前用传统IDE,大家觉得算力是公司的资源,随便造。现在用Agent,每一行生成的代码背后都是真金白银。得让开发者养成习惯,在敲下回车键前,先评估一下这次调用的投入产出比。简单任务走小模型,复杂逻辑上旗舰版,把成本意识变成写代码时的肌肉记忆。
别总幻想着靠引入一个更聪明的模型就能解决所有管理问题。当编码不再是瓶颈,真正的较量是组织级的系统工程能力。把规范前置和成本意识融入日常,用数据死盯流程改造,这才是跨越AI落地深水区的关键。团队基因不改,再强的AI充其量也就是个昂贵的代码打字机。