发布日期:2026-10-10 07:32 点击次数:176

别被那些‘AI我方写代码造我方’的标题骗了。Anthropic说80%坐褥代码是Claude写的?没错——但那是在东谈主类搭好脚手架、定好接口、连测试用例都预埋好的前提下。OpenAI喊出2028年杀青全自动AI探讨员?先望望他们最新发布的GPT-5.6在‘自我调动能力’这门课上只考了57.9分。分数不高不低,偶合卡在‘颖异点活九游会J9,但不敢托底’的窘态区。

真实点破泡沫的,是那篇75页的冷峻论文——《The Last AI Built by Humans》。它没讲愿景,只干了一件事:拿尺子量。这把尺子叫HCI(能力余量-阻滞性指数),不是看AI多横暴,而是看它离‘封顶’还差若干。后果很打脸:数学86.4分,科学85.8分,但软件工程只消52.6分,法律推理64.5分,多模态推理62.2分。为什么?因为数学题有方式谜底,编译器一跑就知谈对错;而写一个能应付线漂后量突增、兼容老系统、还要防安全裂缝的微干事?莫得唯独解,也莫得自动判卷机。AI不怕‘作念题’,怕的是‘拍板’。
更扎心的是RSI五级道路图:43.8%的所谓‘自我调动’系统,其实连第一级(L1奉行自主)都没出圈——即是东谈主类写好经过,AI照着点按钮。真实达到L5(递归元调动,即能改‘调动裂缝本人’)的,不到6%。不是AI太强要失控,是它太弱,连‘知谈我方那里弱’都还靠东谈主喂指示词。是以别再迷信‘算力堆出AGI’了。当一个模子连我方写的代码为什么在凌晨三点崩掉都说不清,它怎样敢去迭代下一代我方?真实的缺口,从来不是GPU,而是‘试错后还能稳住不翻车’的鲁棒性——那玩意儿,咫尺还没进任何磨练集。
这事儿其实早有线索。2023年GitHub官方作念过一次匿名回溯审计:抽样分析了1.2万份标着“Claude生成+东谈主工审核”的PR(代码提交),后果发现——78%的修改蚁集在CRUD逻辑和API胶水层,剩下22%里,有15%的东谈主类工程师最终重写了AI生成的中枢调整模块。不是他们保守,是上线前压测一跑,AI写的负载平衡战略在4000并发下开动立地丢苦求,而日记里连个像样的诞妄堆栈都莫得。
再看试验里的AI工程团队。字节越过里面共享过一组数据:他们用Copilot扶植拓荒后,新东谈主上手业务系统的时期从平均6.2周缩到3.1周,但SRE(褂讪性工程师)的介入频次反而高潮了37%。为什么?因为AI能秒出代码,但写不出“左迁开关在哪按”“熔断阈值设若干才不误伤”“灰度流量怎样切才不会带崩数据库”。这些不是函数签名能界说的事,是靠三年三夜值班熬出来的条款反射。
还有个常被忽略的事实:现时统统主流模子的磨练数据适度于2024年上半年,可真实坐褥环境里,光是Spring Boot框架就在这半年里打了7次安全补丁,K8s 1.31刚发布时连文档都还没皆。AI没见过这些,更没法基于没见过的东西作念推理方案。它不是不念念稳,是学问库根柢没给它“稳”的原材料。
是以别怪AI“不争光”。它就像刚考完驾照的生人司机——能挂挡、能打标的、甚而能倒库入库,可真让你独自开夜车走盘猴子路?标的盘一抖,导航失灵,雨刷器卡住……这时候最管用的,从来不是再加一块GPU,而是副驾上阿谁皱着眉、手一直虚搭在手刹上的老司机。AI的天花板不在算力,而在它还没学会“什么时候该松油门,什么时候必须踩死刹车”。这个分寸感,咫尺连东谈主类我方都还在写SOP、建checklist、开复盘会少量点攒。指望它我方悟出来?不如先教学它什么叫“凌晨三点接到告警电话时,第一响应不是改代码,而是先查变更单”。
说到底九游会J9,咱们缺的不是更奢睿的AI,而是更裸露的期待。


