TG首页 › 资讯 › 查看内容

闲置GPU能否成为共享算力?National Compute Grid启动跨供应商资源整合

AI算力市场存在一种供需错位:部分企业和研究团队难以获得合适的GPU资源,另一些设施里的昂贵芯片,却会在训练任务结束或业务负载回落后出现空闲。新建数据中心能够增加供给,但建设周期、电力接入和硬件采购成本,也让行业开始寻找另一条路径——提高已有算力的使用效率。

据HPCwire 10月8日报道,National Compute Grid已启动,计划把分散在不同供应商手中的AI计算资源汇集起来,通过统一平台匹配需求。需要明确的是,这是一项面向美国全国的算力共享倡议,尚不能称为已经建成的全球算力网络。

该项目由AI控股公司Amp负责人Anjney Midha推动,National Compute Labs开发算力网格及其交易平台,云基础设施供应商Vultr则作为创始成员参与并贡献资源。项目的核心平台名为Grid Exchange,目标是让需要短期算力的团队,能够找到其他参与者尚未充分利用的计算容量。

对于初创公司和研究机构,这种模式的吸引力比较直接:一次实验可能只需要几周的额外算力,长期采购或签订大规模云合同未必合算。如果不同供应商的资源可以通过共同入口查询、预订和调度,用户就有机会减少逐家寻找容量、谈判合同的负担。

Vultr在10月7日的公告中表示,Grid Exchange将通过编排层连接不同云平台、站点及芯片架构,长期目标是到2030年汇集2吉瓦容量,覆盖英伟达、AMD和谷歌TPU等计算架构。这里的吉瓦是基础设施规模口径,不能直接换算为统一的AI计算性能。

项目还提出了不同于单纯按GPU小时收费的思路。按照Vultr的说明,网格计划围绕“goodput”定价,强调完成且未受中断影响的有效计算工作。这意味着,平台希望把客户购买的对象,从硬件占用时间进一步转向有效产出。不过,具体如何衡量不同任务的完成量、怎样划分中断责任,仍需要清晰的服务规则。

在开放范围上,项目目前仍处于早期阶段。National Compute官网显示,预览期面向公共部门合作伙伴开放,提供教育、政府和军事机构邮箱的访问入口,其他用户可加入候补名单。因此,“项目启动”并不意味着所有商业客户已经能够随时购买全部资源。

把算力放进同一个市场,与把分散的GPU变成一台超级计算机,是两个不同层次的问题。 前者侧重发现资源和匹配任务,后者还涉及高带宽、低延迟的通信,以及复杂的软件协同。大型模型的紧密同步训练,不能仅凭不同数据中心存在闲置GPU,就实现高效扩展。

从技术角度看,算力网格更容易先在能够独立运行、可拆分或允许排队的任务中体现价值。跨平台部署仍需处理驱动、软件框架、显存容量和数值精度差异;数据迁移则可能带来额外费用与等待时间。涉及企业或科研敏感数据时,平台还必须明确访问权限、存储位置和任务结束后的数据处置方式。

这也决定了算力共享的收益不能只看GPU租价。只有当资源匹配节省的成本,超过适配、迁移和运行管理的开销,闲置容量才会成为用户真正愿意购买的服务。

National Compute Grid提供了一条值得观察的算力供给路径:在继续建设新设施的同时,让已有资源更容易被发现和使用。接下来检验这一模式的关键,将是平台实际可交付的容量、任务完成的稳定性,以及用户获得算力后的总成本。

分享到
发表评论

最新评论0

思聪网微信公众号二维码 微信扫码关注思聪网
返回顶部