墨巢书屋 小说推荐 · 最新章节 阅读历史

1976步步生莲免费阅读

第2494章 既然已经走在前面了,就不能再落后

作者:方寸山下 · 原作:《1976步步生莲》 · 分类:都市言情 · 第 2489 章
18px

科技政策局核心职责是,组织制定科技发展战略和方针政策。以及技术合同制试点推广、科技人员相关政策研究等工作。

邓副局长(名字不让发)这次找上曲某人有两件事,一件是受人之托,一件是本职工作。

受人之托是试着询问, “银河”理论性能和实际性能的差距,还有没有进一步优化的空间。

曲卓话说的很明白:已经是现有技术能达到的最优设计了。

虽然指出了几点关键不足,但也特意强调:这不是设计缺陷,是并行计算机系统的共性工程难题。属于技术局限。

既然这样,自然没必要继续追问了。

受人之托的事情问完了,后面自然轮到本职工作了——准备搞人工智能。

先是国际象棋巅峰邀请赛上,“悟空”的惊艳亮相,紧接着是一系列引发轰动的高温超导推演方案,让一度被冷落的人工智能,再次被美西方发达国家重新重视起来。

只是以“悟空”为代表的,依托全新算法体系的人工智能,虽然表现令人惊艳,但对计算机的性能要求,也大大提高了。

吃算力还只是一方面。

主要是以Cray为代表的,采用少数高性能定制向量处理器的传统超算架构,因为核心数量少,多任务并行性能差,即便拥有很高的算力,在人工智能体自训练方面的表现也十分低效。

这就意味着,各大高校、实验室和科技公司,即便对人工智能感兴趣,现有设备也不支持展开相应的研究和探索。

而适合人工智能体开发和训练的商用MIMD架构超算,暂时只有一个“奥丁”。

价格昂贵,还需要排期。

所以,许多有实力的机构,都在自研,或以委托和合作的方式搞MIMD架构超算。

不但能满足自身需求,还能外售获取不菲的利润。

东大的785工程虽然一波三折又折上折,进度一而再的拖延,但紧赶慢赶还是赶上了这一波。

而且,不但性能远超立项时的设计目标,放眼全球,进度还是相当靠前的。

忽略掉理论性能和实际性能差异这点小瑕疵,完全可以毫不心虚的说:已经跻身世界一线顶流水平了。

历时六年,属于自己的超级计算机,总算成功搞出来,在满足既定的气象预报、能源勘测、国防航天等需求之余,要不要参与进人工智能这条赛道,正经引发了一番讨论。

重要性是毫无疑问的,不然美西方一众发达国家,不会短时间全都有所投入。

问题是……贵呀。

不像搞科学计算,可以多家单位共用一台设备。大家通过网络排队轮流用。

搞人工智能,必须要有一套专用设备。

造价不菲就算了,还需要组织一批多个相关领域的稀缺专业人才,专心研究这一个项目。

几番商量之后,决定……还是要搞。

明面上做出决策的原因是:历史已经反复证明,一步落后,就会步步落后。

我们的计算机技术既然已经走在世界第一梯队了,就不能再落后了。

而背地里的驱动力是,大屿山B实验室对“悟空”的应用,让专业人士们看到了更多的,让人惊讶过后,满是憧憬和期待应用方向。

决策确定后,为了少走弯路,吸取之前的一些教训,决定让计算机中心来领衔这项任务。

邓副局长这趟来可园,属于打前站,探一探口风。

没办法,任性就算了,脾气还臭,嘴比脾气更臭……

“曲主任……”邓副局长稍稍酝酿了一下,开口:“你说咱们的这个MIMD架构超级计算机,能不能作为类似于悟空那样的,人工智能体的运行载体?”

“跑人工智能呀……”曲卓稍稍琢磨了一下:“有优势,也有劣势。”

“能具体说说吗?”邓副局长打起精神,集中注意力倾听接下来的话。

“MIMD架构从设计层面,就天然适配人工智能体。”曲卓见邓副局长神色认真,细致的解释:“多处理器支持多条独立推理分支并发推演。

部分节点负责知识库检索、部分负责逻辑推导、部分负责自然语言解析。子任务随时产生、随时销毁。每个处理器独立运行不同程序、独立分支、独立指令流。

银河有1024个处理器,比奥丁多一倍,理论推理和自训练效率,高的不止一倍。”

邓副局长努力记住,追问:“劣势呢?”

“劣势主要有四个方面。”曲卓放缓语气:“首先,就是我刚说的通信链路带宽瓶颈。

虽然1024颗处理器组成10维超立方体,最远节点之间仅需要10次数据转发,网络平均延迟是可控的。但,只是小规模并行推理尚可。

一旦智能体需要全局知识库检索、跨大量节点交换上下文信息,大量小包并发就会挤占通道,出现网络拥塞。”

“稍等。”邓副局长感觉单凭脑子根本记不住,从包里掏出工作笔记和钢笔。

翻到一个空白页,先捡要点把之前听到的技术局限和适配人工智能体的优势记下来,又另起一页。

稍稍回忆了下刚听到的内容,记录下通信链路带宽瓶颈和后面的解释。

凭记忆写完后,抬头看曲卓。

“第二。”曲卓继续:“单芯片本地内存只有2Kb,做科学计算够用,但对人工智能体要加载的庞大数据来说,太小了。

如果加外置内存,每一次读取大容量知识库,都需要通过串行链路向外存取,会加重我刚才说的通讯链路带宽压力,进一步推高延迟。”

稍稍给了邓副局长一些记录的时间,曲卓继续说:“第三,也是我之前提到的,时钟异步的问题。

大规模集群中,不存在全局统一时钟。当多节点需要同步协作推演时,必须额外增加同步握手协议,这会占用,并持续消耗带宽。

第四,动态负载均衡很难。AI智能体推理任务的负载极不稳定,有的分支快速收敛,有的分支持续深度推演。

超立方体构架缺少全局调度单元,容易出现一部分芯片满载、一部分闲置,导致算力利用率波动巨大。

简单的说,就是……空有很高的算力。但在实际使用中,资源无法被高效利用。一千多颗处理器忙的忙死,闲的闲死。

而这种负载不均衡的情况,又会加重温度变化和电压波动。时钟抖动的情况进一步加剧,协作推演时效率更低,带宽消耗更大,还加重网络堵塞。”

邓副局长边记录边消化,虽然对具体原理依旧不甚明了,但通过文字的纸面含义能看出来,四个点劣势不是孤立存在的,而是相互关联相互叠加……