合城未来科技中央研究院的灯光已经连续亮了七十二个小时。
章宸从法兰克福飞回时是凌晨三点,他没有回家,直接让司机开到了研究院楼下。电梯门打开,走廊里的空气混杂著助焊剂和咖啡的味道——那是晶片验证团队连续作战的標誌性气息。林薇的办公室门半掩著,里面传出低哑的討论声。
推门进去,林薇正对著三块屏幕上的热成像图蹙眉。她的眼圈发青,头髮隨意扎在脑后,白大褂袖口沾著一块不知什么时候蹭上的导热硅脂。张京京坐在她旁边,手里捏著一份刚列印出来的失效分析报告,纸面上密密麻麻標註著红色批註。章宸的突然出现让两人同时抬头,林薇没有寒暄,直接把中间那块屏幕转向他。
“天权6號工程样片,第二次全工况热测试。目標功耗四十五瓦,实测峰值五十五瓦,超出目標值百分之二十二。”她用手指在屏幕上的热成像图上画了一个圈,“热量集中在gpu计算核心区域,这个区域的功率密度已经超过了每平方毫米零点八瓦,比天权5號高出一倍半。再往上加散热方案就只能上液冷,但我们的目標场景是终端设备,液冷不是选项。”
章宸拉过一把椅子坐下,仔细看了一遍热成像图的每一处热点分布。天权6號採用的是异构计算架构,cpu核心群和自研gpu核心群集成在同一颗晶片上,通过高速互联总线交换数据。热成像显示,cpu核心区域温度正常,但gpu核心区域出现了三个明显的热点——分別对应纹理处理单元、张量计算阵列和缓存控制器。其中张量计算阵列的热点温度最高,局部结温已经逼近一百一十度的安全红线。
“泄漏源定位了吗?”章宸问。
张京京把失效分析报告摊开在桌上。她用红笔圈出了三个位置:“第一泄漏源是张量计算阵列的时钟树。我们在设计时为了追求算力密度,把张量阵列的时钟频率拉得太高,导致动態功耗超出预算三十一个百分点。第二泄漏源是gpu与共享缓存之间的数据通路,位宽二百五十六比特,全速运行时静態漏电功耗比仿真数据高了四点七倍。第三泄漏源最麻烦——gpu核心与cpu核心之间的互联总线,异构调度时频繁的上下文切换產生了大量的瞬时电流尖峰,这些尖峰在仿真阶段被平均化处理了,没有引起足够重视。”
“仿真掩盖了峰值问题。”章宸一语道破。
林薇点头:“天权5號的冗余设计仿真良率百分之九十九,这套方法论在5號上很成功,团队就惯性延续到了6號。但异构计算的动態功耗波动幅度远大於同构架构,用平均功耗代替峰值功耗做仿真,等於把最危险的部分平滑掉了。”她调出另一组数据,“我们在仿真里看到的是四十五瓦的平均热功耗,但实际工作负载下,gpu张量阵列被调用的瞬间,功耗会在几纳秒內衝到五十五瓦,然后快速回落。这种尖峰式热衝击比持续高温更致命——它不仅影响稳定性,还会加速电子迁移,缩短晶片寿命。”
问题彻底摊开了。三个泄漏源,两个在设计层面,一个在方法论层面。留给团队的时间並不宽裕——天权6號的流片窗口定在十个月后,而解决热功耗问题需要重新设计gpu核心的部分微架构,从rtl修改到功能验证再到物理设计,每一步都卡在临界线上。
章宸没有急於定方案,而是问了一个问题:“自研gpu架构和之前用的第三方gpu ip相比,设计复杂度增加了多少?”
林薇从抽屉里拿出一张架构对比图。天权5號使用的是经过深度定製的第三方gpu ip核,性能不错但架构黑盒,无法做底层的功耗优化。天权6號的自研gpu架构名为“羲和”,从指令集到微架构全部自研,张量计算阵列、纹理处理单元、缓存层次结构都经过了重新设计,算力密度比第三方ip高出百分之四十,但功耗控制也相应复杂了一倍以上。
“自研架构的方向没有错。”林薇的语气很坚定,“第三方gpu ip的黑盒限制我们只能做外围优化,相当於在別人打好的地基上盖房子。羲和架构让我们第一次拥有了gpu底层设计的完整自由度,这次热功耗问题暴露的恰恰是我们可以通过架构优化来解决的——时钟树可以重构,数据通路可以重布,互联协议可以重写。如果还在用第三方ip,遇到同样的功耗问题我们连改的权限都没有。”
这话让章宸想起陈醒在启动“补天”计划时说的那句“我们也能写eda”。自研的代价是踩坑,但不自研的代价是把命脉交在別人手里。两害相权,未来科技选前者。
“三个泄漏源,分三条线同时攻坚。”章宸在白板上画了一个三叉戟结构,“第一条线,张量计算阵列的时钟树重构。目標是把动態功耗降回预算线以內,但不能牺牲算力密度——天权6號的ai推理性能是我们的核心卖点,不能因为解决功耗问题就把性能优势丟掉。”
张京京接话:“可以用多时钟域设计,把张量阵列按工作负载分成四个独立的时钟域。轻负载时只激活一个域,重负载时四个域並行,这样平均功耗和峰值功耗之间的波动幅度可以压缩百分之四十以上。代价是控制逻辑复杂一些,rtl代码量增加大约百分之十五。”
“做。”章宸在白板上写下一个“钟”字,“第二条线,数据通路静態漏电优化。四百七十倍的仿真偏差,说明我们的漏电模型本身就有问题。”
林薇从桌上翻出一份技术文档,递给章宸:“根源找到了。gpu与共享缓存之间的数据通路用的是高速lvds差分信號,仿真时我们用的是常温下的漏电参数。但实际工作中,gpu核心温度升高后,差分对的共模电压会漂移,导致静態偏置电流增大。这个问题可以通过两个手段解决——硬体层面引入自適应偏置校准电路,软体层面让天罡os实时监控温度並动態调整偏置电压。”
“自適应偏置校准电路的复杂度呢?”
“大概增加百分之三的晶片面积。但可以换来静態漏电功耗下降六成。”
“值得。”章宸在“钟”字旁边写了一个“漏”字,“第三条线,异构互联总线的瞬时电流尖峰。这个问题牵涉到cpu和gpu的调度协同——张京京,赵静那边的小芯团队有没有可能介入?”
林薇和张京京对视了一眼,然后林薇说:“我们討论过。赵静的小芯3.0在ai任务调度上有非常成熟的预判模型,可以用机器学习提前预测gpu的负载峰值,然后在cpu侧做预调度——提前把非紧急任务移出关键路径,拉平瞬时电流尖峰。但这需要羲和架构的gpu驱动层对小芯开放深度接口。”
“开放。”章宸没有任何犹豫,“告诉赵静,从今天起小芯团队正式加入天权6號的功耗攻坚组。她的预判模型需要什么数据,羲和架构就开放什么数据。权限不够就改权限,接口不够就加接口。”
他在白板上的“钟”和“漏”旁边,又写了一个大大的“调”字。时钟重构、漏电优化、调度协同——三条线构成了天权6號热功耗攻坚的核心路线图。
方案確定后,团队开始分工推进。张京京负责多时钟域设计的rtl修改,她带著八名微架构工程师直接搬进了研究院的封闭开发区,桌上堆满了时序分析报告和功耗仿真脚本。林薇亲自盯著自適应偏置校准电路的模擬验证,这个电路需要和羲和架构的物理设计紧密耦合,任何一个版图调整都可能影响到其他模块的布局布线。
赵静接到通知后不到一小时就赶到了中央研究院。她带著小芯团队的三名核心工程师,在会议室里和林薇的gpu架构团队进行了一场长达四个小时的技术对接。双方在开放接口的深度上反覆拉扯——gpu团队担心开放过多底层接口会影响晶片安全性,小芯团队则认为接口深度不够就做不出精准的负载预判。最终章宸亲自拍板:羲和架构的gpu驱动层向小芯开放全部性能监控接口和百分之八十的调度控制接口,核心安全接口保留,但设立联合安全审计机制,小芯团队可以查看安全接口的调用日誌但不直接操作。
“这是未来科技內部最大规模的一次跨团队技术融合。”林薇在当晚的进展总结会上说,“天权6號不是一颗传统意义上的晶片,它是cpu、自研gpu、小芯ai调度引擎和天罡os的深度耦合体。热功耗攻坚看上去是硬体问题,实际上需要软硬体协同才能彻底解决。”
攻坚进行了整整一周。
张京京的多时钟域设计方案在第三天完成了rtl初版,经过两轮功能验证后进入功耗仿真。初步仿真结果显示,四时钟域架构將张量阵列的动態功耗波动幅度压缩了百分之四十三,略超预期。但时序收敛成了新的痛点——四个时钟域之间的数据交换需要一个额外的同步缓衝层,这个缓衝层引入了大约零点三纳秒的延迟。
“零点三纳秒。”张京京盯著时序报告,手指无意识地敲著桌面,“在gpu主频两吉赫兹的情况下,零点三纳秒等於百分之六十个时钟周期。对於实时渲染和ai推理这种对延迟敏感的任务,这个代价太大了。”
她和团队在封闭开发区里又熬了两天,最终找到了一个精巧的解决方案:把同步缓衝层从数据通路中拆出来,改为一个独立的“影子寄存器组”,四个时钟域各自配一个影子寄存器,域间数据交换通过影子寄存器异步完成,不经过主数据通路。这个方案增加了一点三平方毫米的晶片面积,但把延迟代价从零点三纳秒压缩到了零点零八纳秒。
林薇的自適应偏置校准电路也在第五天通过了模擬验证。她在spice仿真中注入了从零下四十度到一百二十五度的温度扫描,校准电路在全温度范围內將差分对的静態偏置电流波动控制在正负百分之二以內。加上赵静团队的动態偏置电压调度算法,gpu与共享缓存之间数据通路的静態漏电功耗下降了百分之六十二,远超最初设定的目標。
最复杂的是第三条线——异构互联总线的瞬时电流尖峰。赵静的小芯预判模型在接入羲和架构的底层数据后,经过三轮叠代训练,將gpu负载峰值的预测准確率提升到了百分之九十四。但真正的挑战不在预测,而在於cpu侧的预调度能否在纳秒级的时间窗口內完成。小芯团队和gpu驱动团队联合攻关了整整六天,重构了cpu的调度栈,將预调度的响应延迟从十二纳秒压缩到了三纳秒以內。
第七天下午,三条线的成果在联合仿真平台上匯合。林薇按下了全工况功耗仿真的启动键,整层楼的技术人员都围到了屏幕前。仿真数据逐项跳出——cpu核心功耗正常,gpu纹理处理单元功耗正常,张量计算阵列动態功耗下降百分之四十一,数据通路静態漏电功耗下降百分之六十二,异构互联瞬时电流尖峰被压平了百分之七十八。
最后一行数据弹出:全工况实测功耗四十六点三瓦。
比目標值高出一点三瓦。
会议室里安静了片刻,然后林薇开口了:“一点三瓦,用封装层面的散热优化可以吃掉。这不是失败,是成功。”
章宸看著屏幕上的数据,忽然露出了这七天来的第一个笑容。天权6號的热功耗攻坚,核心问题已经解决了。剩下的一点三瓦裕量完全在封装散热的可控范围內——梁志远那边的追光四期先进封装团队已经在做高导热封装基板的验证,实验室数据显示可以將封装热阻降低百分之十五左右,足够覆盖这最后的一点三瓦。
“七个月。”章宸说,“从今天算起,天权6號的流片倒计时还有十个月。扣除三个月的后端物理设计和流片准备,我们还有七个月的时间完成全部前端设计的收敛。热功耗攻坚打掉了最大的拦路虎,接下来就是稳步推进——时钟树、漏电电路、调度接口,三个模块的优化方案直接写进羲和架构的正式设计基线。”
林薇已经在安排下一步的工作计划。张京京负责把时钟域设计和影子寄存器方案正式合入rtl主线。赵静负责把预调度接口固化並编写安全审计文档。林薇自己则开始筹备天权6號的第一次完整功能验证。
散会后,章宸单独叫住了林薇。两人走到走廊尽头的窗边,窗外合城產业园的灯火在夜色中铺展开来,追光四期厂房的轮廓清晰可见。
“羲和架构的gpu核心,这次从头到尾都是自研。”章宸说,“天权4號解决了有没有的问题,天权5號在4號基础上做了冗余设计的叠代,天权6號则是第一次真正意义上的架构重构。异构计算这条路走通之后,天权7號的3d堆叠就有了一个坚实的底座。”
林薇看著窗外的灯火,沉默了一会儿,然后说:“自研gpu架构这件事,三年前还写在风险清单里。现在它变成了我们的护城河。”
“三年。”章宸重复了一遍这个词,点了点头。
走廊另一端,章宸的终端震动了一下。他低头看了一眼,是方程从南洋发来的消息:智慧教室试点在新加坡五所学校全部完成部署,首批数据將在两周內回收。同时,李明哲从法兰克福传来消息,欧罗巴安全协定第七条款的b版本已经进入正式表决程序,表决日期定在十天后。火龙联盟在表决前夕向所有欧陆成员国发出了一份新的技术安全评估补充报告,措辞比上一版更为强硬。
挑战不会排队,它们总是同时抵达。章宸收起终端,拍了拍林薇的肩膀:“让团队休息一天。接下来的硬仗还很多。”
他转身朝电梯走去,身后的中央研究院依旧灯火通明。天权6號的功耗曲线在屏幕上稳定运行著,四十六点三瓦——这个数字像一枚钉子,把未来科技在异构计算领域的旗帜钉在了技术高地上。而在这片高地的更远处,更复杂的3d堆叠、更严苛的先进封装、以及即將到来的崑崙基金二期课题,正在夜色中等待破晓。