AI资讯

AMD推个人超级计算机,本地跑超1T大模型,工作站性能炸裂

智能摘要

工作站。的大型模型本地运行。系统内存。576GB。所有核心算力组件均采用液冷散热。

这台机器把AI拉进了个人桌面,不再只能依赖云端。

单机配置有多狠

9月4日, 在柏林IFA 2026展会上, AMD高级副总裁Jack Huynh正式发布了Halo工作站。这款被定位为“个人超级计算机”的设备核心配置相当夸张, 它搭载了高达2TB系统内存的一颗96核心的锐龙PRO处理器还搭配了两块显卡加速器。

这意味着什麽? 一般个人电脑装128GB内存就算顶配了, Halo直接给到2TB, 是常规配设的十六倍。搭配两款专业级显卡加速器, 当地处理大模型推演的速度将大幅提高, 毋须把任务发到远端的云霄伺服器。

1T参数模型本地运行

目前主流的大语言模型参数动辄几百亿到数千亿, 像GPT-4级别的模型参数量早已冲破万亿量级。以往这类模型只能运行在云端集群内里, 个人用户根本触碰不到。Halo的问世, 打破了这个格局。

AMD明确表示, Halo支持参数量超出1T的大型模型可在本地运行。这对企业的核心数据安全尤为关键, 敏感性数据无需上传至云端, 全流程在本地处置即可。开发者也可快速迭代各类模型, 不再受网络带宽条件以及云端排队时间的诸多时长限制。

未来支持四卡扩展

本次面世的Halo挂载了两块显卡加速器, 不过AMD也剧透后续迭代的版本能够适配四卡配置, 完成扩容升级之后, HBM3E显存的总贮量将拉到576GB, 这个数值几乎超过了时下不少高性能服务器的显存体量。

576GB的HBM3E意味着什么? 意味着规模大很多的模型可以加载进显存, 推理速度不再被显存瓶颈拖累。对于频繁调用大模型做本地分析的企业, 这种扩展性提供了极大的灵活性。

全组件液冷散热

高算力叠加衍生出的高热问题, Halo选用液态散热的配套方式解决。整机每一项算力核心构件均采用液态散热方案的配套设计, 涵盖处理器及显卡加速器。传统风冷模式在高负载工况中难以锁定持续稳定的运行频率, 频繁出现运行降频的异常情况。

液冷散热能够让硬件在长时间高负载运行里保持稳定性能, 不会因为温度过高而限制频率降低输出。对于需要从周一到周日、每天全天候运行的人工智能专业工作站来说, 液冷不只是性能方面的保障, 也能延长硬件的使用时长与生命。

IFA 2026上的焦点

IFA 2026于9月初在柏林举行, AMD选在这个时间窗口发布Halo, 显然瞄准专业用户和AI开发者群体。Jack Huynh亲自登台介绍, 说明AMD对这款产品重视程度很高。

现场展示的Halo工作站外形紧凑, 和传统塔式服务器不一样, 更贴近高端桌面主机的体积。这类设计让它在企业办公室和实验室境地中更利于部署, 不需要专门保护机房。

本地AI时代的机遇

少数几家巨头长期垄断Cloud GPU, 租用成本高且数据隐私存在风险。Halo出现, 为中小企业和个人开发者提供一条新路径。本地算力掌握在自己手里, 不用看云厂商脸色。

当然, 这样一台机器价格很贵,想要购买它的多半是科研机构、从事AI相关业务的公司以及处在金字塔尖段的创作者, 对于绝大多数寻常消费者而言大概率是难以触及的,但对于那些想要每天处理海量数据的团队来说, 它所节省下的时间以及人力成本要比采购价格多得多得多。

贵司当下使用云端GPU抑或是本地部署? 欢迎在评论区聊聊你的AI算力方案。

相关文章