文章正文

求婚大作战

kimi不是DeepSeek时刻_我的网站

战狼

A |     上周发了一篇文章,给大家介绍了智能体时代的翻红岗位:FDE。

B |     7月19日晚上,月之暗面发了一份公告,估计很多人都看到了。         01          标题叫《关于算力紧缺与会员暂停开放的说明》。         评论区炸了,大家纷纷吐槽↓          “这不就是驻场开发?”          “这不就是软件外包吗?”          实际上,它们的区别挺大,今天我们就详细掰扯一下。说三件事:          Kimi K3上线48小时,逼近集群承载极限;暂停C端新用户订阅,现有算力全部服务已订阅用户;后续新订阅,Kimi主权益和Kimi Code权益拆开卖,「以方便更精准匹配算力」。         同一个晚上,阿里千问官宣Qwen3.8即将发布开源,参数2.4万亿;对多数人来说,这就是条产品新闻。         FDE,Forward Deployed Engineer,前沿部署工程师,最近一年成了科技圈最热的新名词之一。         这个源自Palantir的岗位模式,如今被OpenAI、A社等头部AI公司争相复制,国内的大模型厂商和AI创业公司也纷纷挂出类FDE的招聘,薪资数字一个比一个夸张。         甚至,在今年1月上海市政府的“AI+制造”行动方案里,都明确写了要培育“前沿部署工程师”队伍。看完了,划走。         FDE确实长期驻扎在客户现场、也要做大量定制化工作,同时要直面客户的琐碎需求。         你要拿着算力股,里面有个反差,可以研究下。         被卖到停售的这个模型,三天来被用户骂得最多的,恰恰是「贵」,发布博客把输出定价写到100元每百万token,大概是上一代的4倍。         海外媒体直接拿这个说事,标题叫「中国廉价AI时代的终结」,上手用户晒的额度截图,一天烧掉三五成,到处都是,抱怨列表的另一头还挂着一个「慢」。         一边贵到挨骂,一边抢到关门,这两件事同时成立,说明什么?「便宜」和「贵」这场架,两边吵的不是同一件事。         拆开来看,有三个刻度。         这三个特征,和国内延续了二十多年的软件外包、驻场开发看起来一毛一样。         第一个刻度,单个token的标价;K3确实便宜,输入3美元、输出15美元每百万token,大约是GPT-5.6 Sol的一半,全部的价格优势,都长在这个刻度上。         第二个刻度不同了,干完一件事,到底花多少钱?          我查了第三方评测机构Artificial Analysis的数据,截至7月21日口径,跑完同一套智力测试,K3总共输出约1.3亿个token,是可比推理模型中位数6300万的两倍还多。         但是,就好比外科医生和屠夫都拿刀,没人认为他们是同行。         折到单个任务,K3约0.94美元,GPT-5.6 Sol开到最高档呢?1.04美元。         判断他们的区别,不能只看动作,要看服务对象、工作目标、能力要求、对产品和项目的影响力等多个因素。         01、出发点,有本质区别          软件外包:交付项目。

C |          几乎打平,单价一半,话多一倍,账单回到原点,用户骂「额度烧得快」,骂的就是这个刻度的日常体感。         第三个刻度,总需求,停售公告本身就说明问题了,需求大到人家把门关了。         而且关门这家,手里本来就有闸,Kimi Code设着7天总量加每5小时滚动窗口的双层限流,帮助页写得清楚。         隔壁更直接,Qwen3.8预览版压根没走「挂个API随便买」的路子,只放在Token Plan订阅里用,个人版挂两层滑动窗口,5小时、7天,触顶即停,条款清清楚楚写着:禁止当API批量调用。         按合同做完需求,项目结束人也结束,重点是完成合同。         还有DeepSeek,六月底放了个消息,V4正式版要搞峰谷定价,高峰时段API价格翻倍,注意,用智能最贵的那个时段,恰好是你上班干活的时段。         驻场开发:补充人力。         人坐在客户办公室,日常由客户安排,几乎不影响产品方向。         FDE:让AI产品真正跑起来。         几周之内,一家关门,一家装闸,一家把电网的峰谷电价搬进了API价目表;各干各的,指向同一件事:最强的智能,眼下是按份供应的。         代表AI产品或平台公司去现场,让产品融入客户业务流程,产生真实价值。         02          当然,我这话也不能说得太满,一家公司停售,只是一个样本,不等于一个趋势。         你说月之暗面自己卡买少了,也完全讲得通;而且这波需求里掺着补贴,Qwen预览期Credits消耗打一折,等于十倍用量白送,K3订阅套餐的定价能不能覆盖推理成本,也得打个问号。         客户买了AI智能体平台,上线发现业务系统接不上、知识库效果差、工作流跑不通……          FDE就需要到场解决问题,直接写适配器、调提示词、改工作流,更难的是客户也许还没想清楚怎么跟业务系统对接,FDE要负责抽丝剥茧,跟客户共创。         如果多个客户有同样问题,就把能力沉淀进产品,下个版本所有客户受益。         不过,有一件事是确定的:          补贴也好,真实需求也好,搅在一起的现状就是算力已经先不够用了。         有意思的是,市场第一反应完全没往这个方向走。         02、能力门槛,不在一个量级          ①AI开发能力:          传统外包开发通常掌握的是:Java、.NET、Python、Vue、Spring Boot、SQL……完成业务开发基本足够。         7月17日,A股CPO概念批量跌停;持仓群里刷屏的那句话你应该见过:「第二次DeepSeek时刻」。         FDE要理解AI应用开发,例如:提示词工程、Agengt、MCP、RAG、Tool /Function Calling、工作流、上下文工程…          甚至,还要了解模型选型与评测、Token成本优化、推理性能调优…          这些能力,传统开发一般涉及不到。         ②系统与产品能力:          AI项目大量时间花在对接客户系统上。         要接ERP、CRM、飞钉、Jira、Salesforce、知识库、BI……          所以,FDE还要会REST API、OAuth、Webhook、MCP Server等等。什么意思?          2025年1月那笔旧账还记得吧:          中国模型太省算力了,那算力和光是不是买多了?高盛的Rich Privorotsky在K3发布当天也往这个方向定性,说这可能是「算力扩张时代」终结的信号。         更重要的是,还要对这些业务系统有所了解。         48小时后,那份停售公告出来了,算是对这个定性,当场来了个回话。         价格战这事,随时可能反转;DeepSeek的V4预览版4月起就在走省算力路线,正式版上线要同步调价;比谁便宜,这个行业里从来没有过定局。         有一样东西,回不了头,这一代模型到底长成了什么形态?需要什么样的集群来伺候它?贵与便宜是策略,形态是宿命。         ③解决未知问题的能力:          传统开发面对Bug已知、需求明确、路径固定,可能每天都在重复救火。         所以,标价砍半的模型,用到停售的需求,翻倍的任务账单;三件事放在一起,你很难不问一句:K3的便宜,到底省在哪里了?          03          我先说结论,不全是省出来的。         K3拿到低价的每一招,都押着一个前提,三招拆开看,前提是同一个东西。         FDE面对的问题往往没有标准答案:模型为什么幻觉?Agent为什么死循环?Prompt为什么昨天有效今天就不中了?每天都要面对新闻体。         先说怎么看这套系统,把它想成一座货运园区;token是包裹,推理是分拣加派送,显卡是工位,园区里的高速互连是传送带,跨园区的网线是跨城干线。         ④客户沟通表达能力:          既要懂技术语言,又要懂业务语言。         同一天要和CIO讲ROI,给业务讲流程,给运维讲部署,给家里的产品研发讲功能改进和代码优化,随时切换。

D |          记住这个画面,我们拆第一招:稀疏。         有个词,大家可能不太喜欢,叫拉通对齐,但这是FDE很重要的能力,把前端客户和后方的产研拉通对齐。

E |          ⑤产品沉淀能力:          外包项目结束,代码留在客户那里,经验归零。         K3是混合专家模型,896个专家,每个token只激活其中16个;什么意思?每件包裹进园区,只叫醒该干活的那十几个工人,其余人不动,电费自然省了。         FDE要有顶层视角,今天帮A客户连接业务应用,明天整理成SDK,下周变成官方插件,一个月后内化进标准产品,赋能所有客户。         03、为何FDE门槛更高?          我们可以把三类岗位看成三种不同的人才模型:          软件外包:开发专家,擅长按照需求实现功能。         驻场开发:开发+协作,能够融入客户团队,完成项目开发。         FDE:产品经理 × 架构师 × AI工程师 × 交付负责人 × 业务顾问          他们需要在一个项目中,切换多种角色,最终让AI产品融入客户业务,并产生价值。

F |          但前提马上就跟来了,几百个专家摊在几十张卡上,包裹要在工位之间寄出去、算完、再寄回来;这东西有个行话,叫all-to-all通信。         这类流量对带宽和延迟极其敏感,差一点都不行。         有基准可查,DeepSeek开源的通信库实测,同一高带宽域内每卡能跑到约160GB/s;跨节点呢?掉到约50GB/s。         因此,FDE的竞争力来自跨越研发、产品、客户和AI应用之间的综合能力。

G |          月之暗面显然知道这个问题,应对就写在发布博客里:          训练阶段就搞了「完全均衡的专家并行」设计,部署一节明确建议「64个或更多加速器组成的supernode」,理由是推理效率受益于更大的高带宽通信域。         写到最后,再谈谈“污名化”本身。

H |          这里我要说一点,64卡是跑得经济的门槛,是把token卖到这个价的前提;传送带不够长,工人再省电,包裹也堵在路上。         第二招:缓存。         FDE其实承受着两种方向相反的污名。         第一种是向下的污名化↓          把FDE粗暴等同于驻场外包,认定这只是旧酒装新瓶的包装术,忽视了FDE在AI产品落地中的真正价值。         发布博客里有句话容易滑过去,借助Mooncake分离式推理架构,编程场景缓存命中率超过90%,实际输入价格仅为标价的四分之一。         Mooncake是月之暗面自研的推理底座,它干的事是什么呢?          把缓存(行话叫KV cache)从单卡显存里解放出来,在集群的处理器、内存、硬盘之间流转;翻译一下:包裹不必每次回总仓重新打包,去就近的中转仓取就行。         第二种污名化方向相反,却更加普遍↓          大量传统外包和售前岗位,正在把自己改名为FDE。         岗位描述换了,工作本质没变,没有产品可反哺,没有经验能沉淀,还是按人头收钱。         当市场上九成的“FDE”都是外包换皮时,真FDE也会被拖下水,“高级外包”的帽子反而被坐实了。         这东西有多能搬?          我查了它的开源基准,一台插满8张400G网卡的节点,搬运40GB缓存能跑到190GB/s。         如果一个吹竽团队里,都是南郭先生,那真正的吹竽高手反而成了另类。         所以,我们要把那些假FDE揪出来↓:          ①这家公司有自己的产品平台吗?没有产品承接现场改动的,是外包。

I |          四分之一的输入价不是白来的,它建立在集群内部大规模搬数据的能力上,网络带宽是这门生意的效率变量。         第三招:压缩。         ②现场经验能沉淀成可复用的能力吗?每个项目都从零开始的,是外包。         ③按什么收钱?按人头和工时计费的,是外包。         K3用自研的KDA线性注意力,把缓存体积大幅压小。敢按业务成果定价的,才是FDE。         最后,AI智能体落地正酣,让我们把一切留给时间。

J | 官方说法是,借助带缓存的KDA,「即使在大模型规模和长上下文条件下,也能以很有竞争力的token价格提供服务」。         你看,压小的包裹还是要搬,月之暗面今年挂出一篇系统论文,标题就很说明态度了:          「下一代模型的KVCache可以跨数据中心」,把缓存当一等公民资源,在更大的网络里调度。方向直接写在了论文标题上。         三招放在一起,答案完整了。

K |          稀疏省算力,前提是域够大,缓存省重复计算,前提是搬得动;压缩省显存,前提是缓存设施接得住,省钱的每一招,都建在网络上。

L |          很多人觉得推理是轻量活,训练才是重体力。这一代推理集群,长成了过去只有训练集群才有的形状。

M |          而且,这也不是一家的偏好,开源旗舰的「最小服务单元」,代际之间在变大。

N |          上一代K2,官方部署指引最少16卡;K3推荐64卡起步。DeepSeek-V3的技术报告里,解码阶段最小部署单元是320卡。         再看过去一周的牌桌,已开源的V4-Pro站在1.6万亿参数,Qwen3.8官宣2.4万亿即将开源,MiniMax被曝下一款2.5到3万亿,这一代模型,都长这个形状。         SemiAnalysis给K3的判词也通了:它需要「更多的GPU、HBM、DRAM和网络」。         回头再读那份停售公告,可以从技术角度换个读法了:          卡不是问题,市面上买得到;问题是把几十张卡绑成一个域;能同时跑稀疏、缓存、压缩的那种集群,临时拼几台机器凑不出来。

o |          缓存要在网络里流转,随便拉根网线也搬不动;公告里那句「承载极限」,说白了,是长成这个形状的算力池不够用。

p |          04          需求是真的,形态也定死了,这笔钱,落到产业链上,会记到哪一段的头上?          这份需求能兑现多少,第一道闸门,就在刚才那句判词里:HBM,高带宽内存。         SemiAnalysis给K3算过一笔硬件账;2.8万亿参数的权重超过1.5TB,单台机器的显存根本装不下,注定要摊在集群里。

q |          如果国产承接这头,闸门更窄。         同一家机构拆过长鑫存储的口径:HBM晶圆产能去年底约5000片每月,今年底爬到约3万片,综合良率约25%。         对比一下,国际大厂良率在85%以上;此前囤了约1300万堆库存,按他们的测算,约够160万颗910C级芯片用。         我翻译下啊:地和钢材是限量的。

r | 今年明年能盖几座园区,基本已经写死了,这一段的账,最确定,也最没有弹性。         量看完,再说形态,采购的单位在变。         以前叫「买卡」,现在叫「买超节点」。刚闭幕的世界人工智能大会上,我去逛一圈,燧原、沐曦、摩尔线程、中兴、百度、平头哥,各家的超节点扎堆亮相。

s |          园区里的传送带怎么修,取决于一个工程边界:铜的半径。         铜缆便宜、稳定,问题是它只够在一个机柜内部把卡连起来;阿里的磐久128单柜方案,柜内全铜,一只光模块不用。         英伟达NVL72同样柜内全铜,域一大过一个机柜,故事就换了。         华为CloudMatrix 384用十六个机柜拼一个域,柜内走铜,柜间走光;SemiAnalysis拆出来,整机约6912只400G光模块,芯片和光模块的配比约1比18。         注意,这个配比只属于多柜形态,不能套到所有超节点头上。

t |          K3建议的64卡,今天恰好压在这条铜光边界上,单柜方案还兜得住;往前看一代呢?V3的320卡早就在柜外了。         最小服务单元16、64、320这条代际曲线,正在把负载往机柜外面推;域每跨出一个机柜,光的账就跳一级。         最后说弹性,眼下最实的一段账,在园区之间。         跨集群的高速以太网,吃的是800G和1.6T光模块;我查了LightCounting今年2月的预测:800G出货量今年再翻一倍以上,1.6T增长到数千万端口量级,1.6T芯片组销售额今年突破20亿美元。         垫在这批订单底下的,是货运总量本身,谷歌在I/O上自报,单月处理token达3200万亿,一年涨了7倍。         OpenRouter的官方博客说:          今年2月起,agent产生的流量超过了人类,单条agent请求消耗约是人类的15倍;包裹越来越多,寄件的还从人换成了不知疲倦的机器。         当然,我前面说的全是需求往上走,这事还有另一面。         效率也在往前走,K3自己的输出token比上一代少了21%;横向比,仍是同行的两倍;DeepSeek的V4,前面提过,走的稀疏注意力就是奔着省去的。

u |          华为去年发了篇UB-Mesh论文,研究的东西更直接:机柜里用电缆直连,能少用光模块就少用。         还记得那个货运园区的比方吗?单件包裹在变小,包装在变省。

v |          所以,这其实是一场赛跑;总货量跑在前面,光互连的账就成立;哪天单件瘦身反超了总量,单位算力配多少光,就会掉头。         两边都是真的,谁能跑赢,没人知道。

w |          有几个东西可以盯着,按计划,7月27日,K3的权重和技术报告放出来,看看谁第一个用64卡以上的国产集群把它跑起来。

x |          Qwen3.8正式开源后,看它的部署指引推不推类似的大通信域;月之暗面全速扩容,看采购往哪种形态的集群流。         回到开头那个反差:骂它贵的,骂的是token的标价;把它抢到关门的,抢的是长成这个形状的算力。         参考来源:          [1].月之暗面、千问、DeepSeek 官方公告与文档,Artificial Analysis、SemiAnalysis、LightCounting,DeepSeek-V3 技术报告及 Mooncake、DeepEP、UB-Mesh 等公开论文与开源仓库(数据截至 2026-07-21)          [2].个人观点,仅供参考,不构成投资建议。

Current article:http://xvxj.linxiuhuaishuangniuzhenrua.bond/z0rjoy/580a.html

Published on:07:06:11


|