
股票双向投资
智能体规模化落地,CPU 重回 C 位。英特尔与阿里云从记忆、执行、成本、信任入手,拆解 Agent 时代基础设施的难题。
文|赵艳秋
编|牛慧
9 月,杭州国际博览中心人潮涌动。2026 云栖大会英特尔专场上,英特尔数据中心集团副总裁、中国区总经理陈葆立在开场展示了一组数据,把当下人工智能业界严峻的供需问题提出来——今年智能体开始规模化部署,底下的基础设施跟得上吗?
需求一侧,全球约 80% 的企业已在尝试将智能体引入工作流,IDC 预测到 2031 年中国企业使用的智能体将超过 3.5 亿个,计算、存储与执行环境承压;供给一侧,为承接这些需求,有银行预测,中国相关产业需要投入超过 2 万亿元。

如何应对这场考验,成为英特尔与阿里云在本次大会上共同回答的主题。从英特尔展台约 30 个演示,到汇聚双方芯片、软件、存储与云服务专家的专场论坛,讨论围绕真实负载展开:如何保留越来越长的上下文,如何让大量沙箱快速启动,如何降低模型调用成本,又如何让智能体更安全地使用数据。
陈葆立指出,AI 工厂关注的问题正在变化:过去讨论有多少算力、多少 token,如今更关心怎样调度资源,"完成更多的工作"。阿里云智能集团资源总监、首席服务器架构师卓久则强调,这波需求同时推高了 CPU、GPU 以及内存和存储的重要性,需要"从硬件到软件,从 GPU 到 CPU 到存储"的全链条协同。
从定制芯片、存储加速到轻量浏览器,双方展示的合作进展,正在把这些战逐项拆解、联合解决。而这一切的背景,是一个此前很少被讨论的变化——在智能体时代,CPU 重新变得紧俏了。
01
Agent 时代,CPU 重回 C 位
过去三年,AI 基础设施几乎等同于"抢 GPU "。到了 2026 年,故事反转了:CPU 也开始被抢了。
英特尔二季度财报显示,数据中心与 AI 事业部营收同比增长 59%,CEO 陈立武在该季度财报电话会上表示,"在数据中心领域,CPU 需求正在起飞,客户需求正超过公司持续扩大的供应能力"。为此,公司上调了 2026 年资本支出。价格也随之上行。根据媒体报道,本轮服务器 CPU 价格整体涨幅为 10% – 20%,预计紧缺状况至少延续到 2027 年。

需求突然爆发,与 Agent 规模化部署密切相关。陈葆立指出,智能体背后的多层软件创新,记忆管理、命令执行和反复验证,持续增加 CPU 需求。
具体而言,算力结构正在经历三阶段转向:从训练到推理,CPU 与 GPU 之从 1:8,升至 1:4,并在 Agent 时代走向 1:1。"甚至部分场景,CPU 的配比会超过 GPU。"英特尔数据中心集团产品规划部总经理李尔成说。
元股证券:ygzq.hk
算力结构的变化是由 Agent 的工作方式引发的。Agent 是"计划—行动—观察"的循环,一个简单任务可能要转二三十轮,而较为复杂的 AI Coding 任务要循环数百轮。大模型推理主要由 GPU 承担,CPU 则负责智能体编排、状态管理、工具执行、内存层级与安全隔离。CPU 侧若未及时准备数据、创建沙箱或调度请求,GPU 就可能被"饿着"。从 GPU 到 CPU 到存储,需要全链条协同。
CPU 增量因此需要放到整个数据中心看:用量比值上升,主要不是 AI 服务器内部简单调整配比,更多来自新增的一整类纯 CPU Agent 宿主机,承载编排、工具和沙箱,并通过网络调用 GPU 推理服务。
由此形成两条路径:GPU 服务器或存储服务器中的机头,负责主机侧调度、数据与缓存管理;独立的 Agent CPU 服务器,承接智能体及其执行环境。前者侧重提高 GPU 利用率,后者更关注支撑任务持续推进。

评价标准也随之改变。英特尔白皮书提出,优化目标正从 tokens/ 秒,转向 SLA 约束下每美元完成的任务数,即在约定的服务质量与时延内,同样投入能完成多少工作。这呼应了陈葆立开场时的判断:AI 工厂要通过更好的资源调度,"完成更多的工作"。
云栖展台上的 " 四道关 "
在这样的形势下,沿着英特尔展台的演示一路看下来,智能体规模化运行要解决的难题,可归结为"四道关"。
第一关:记忆关——草稿本越写越厚。
Agent 每调用一次工具、接收一轮反馈,上下文就继续增长。KV Cache 像一本保存中间计算结果的"草稿本",下次直接翻看,不必重算。循环越多,草稿本越厚。现场工程师给一组对比:Agent 的上下文已迈向百万 token,折算下来的 KV Cache 可达 TB 级,而 GPU 显存最大不过几百 GB。装不下,"草稿本"上的内容被挤出,下次用只能重算,首 token 响应(TTFT)也拉长,IT 账单加大。
英特尔的解法是让草稿本分层存放:眼下要用的数据留在显存,其余按冷热程度转入内存、SSD 或分布式存储,需要时再取回来——以存换算。搬运途中的压缩和解压,交给至强内置的 QAT(数据保护与压缩加速技术)引擎,不占用 CPU 核心,测试中可无损节省高达 30% 的空间。展台上的 KV Shrink 方案,英特尔测试显示,首 token 响应相比未开启分层存储的原生 vLLM 基线最大提高到 15 倍。

同一思路也被放大到更通用的存储场景:展台另一个演示由 QAT 负责压缩解压、DSA(数据流加速器)负责数据搬运与校验,把这部分开销整体从 CPU 核心上卸下来,KV Cache 只是它承接的数据之一。
第二关:执行关——让成百上千个"工位"及时开工。
Agent 要反复循环,结果又难以预知,因此需要安全隔离的"工位"——沙箱,既限制错误影响范围,又能快速创建、销毁、回滚和恢复。"工位"越多,布置耗时过长,开销就越明显。
展台上的"英特尔 IAA 加速安全沙箱方案",覆盖 Firecracker 与 E2B 两种场景。加速"工位"布置的关键是快照——把准备好的环境或暂停时的运行状态"存档",下次直接恢复。至强内置的 IAA(存内分析加速器)加速压缩与解压,减少了快照体积和 CPU 核心开销。展台数据显示,E2B 场景下,128 个沙箱并发拉起,沙箱创建速度提升 1.40 倍。

李尔成在论坛中也提及,至强"内置了 QAT、DSA、IAA 这样的加速器,对于 Agentic AI 里最重要的沙箱拉起、释放、并发执行有着显著的加速作用"。

第三关——账本关:让贵的模型干更重的活。
识别图片里的文字,不必每次都惊动万亿参数模型。展台上的至强 LLM Router(大模型智能路由)就像一个派活员,比如写代码时,将系统规划交给贵模型,写小模块、跑测试交给小模型。它采用三级级联决策——第一级快速判断决策复杂度;拿不准,交给几百 MB、可放进 CPU 缓存的小模型;再拿不准,由强模型兜底。Router 还内置中英文 PII 脱敏,在请求发往外部模型前处理敏感信息。
十大杠杆配资另一个案例是 PolarDB 库内向量抽取,将原本跑在 GPU 上的 Qwen3.5-2B 挪到 CPU 上,借助至强内置的 AMX 加速器,支持短、长上下文的吞吐稳定端到端提升约 2.5 倍。它展示了特定小模型任务在 CPU 上有优化空间,能直接降低 Agent 的响应延迟和算力成本。
第四关——信任关:Agent 手里握着你的数据。
Agent 读文件、连业务系统,掌握着用户最敏感的那部分资产。阿里云 Confidential Agent 基于英特尔 TDX 机密计算技术,把 Agent 的核心运行时关进一间硬件级隔离的 " 密室 ":内存由 CPU 全程加密,用户对话、长期记忆、Skill 文件与服务凭证都在其中。
现场演示中,用户下一条命令,系统便走一遍远程证明:由 CPU 签发一份无法伪造的报告,逐项说明这是不是经认证的真硬件、内存是否确实加密、开机到内核有无被篡改。确认后再建立加密通道访问 Agent 服务。
另一项展示更为前瞻:蚂蚁 SM4th(后量子签名方案)结合英特尔至强 6+ 原生支持的 SM4 国密新指令,同一算法的签名、验签性能提升 16 — 37 倍,无需专用加速卡。
03
从定制芯片到联合方案
实际上,英特尔与阿里云的合作早已渗透到相关具体层面。这次云栖大会上分别呈现了不同层次上的截面——从芯片规格的联合定义,到软件生态的共同建设,再到端侧算力的协同布局。
最直接的一层是芯片,从通用到定制层层深入。第一步是按需选配,阿里云与英特尔去年已联合推出基于英特尔 ® 至强 ® 6 性能核处理器的第九代 ECS 实例,搭载于磐久服务器,依靠至强 6 性能核核心数、单核性能和内存带宽上的性能,加上高度优化的技术栈,最终算力较上代最高提升 20%,L3 缓存提升 50%,最大睿频 3.9GHz、全核睿频 3.6GHz。
再进一步,是围绕具体负载定制处理器。展台上的 GEM Mountain 基于至强 6 架构,面向智能网卡、冷存储和边缘网络与交换机三类场景,在优化功耗与成本的同时,在至强 6 平台架构上做功能精简,把 TDP 压到百瓦上下,保留双通道内存和服务器级可靠性。

三款 SKU 里,一款明确面向阿里云,采用 16 核设计、TDP 85 — 90W,用于阿里云 MOC 智能网卡。用展台工程师的话说,这款由阿里云提出低功耗需求,英特尔在至强 6 平台上裁剪定制、专门做出来的,"以前是没有这颗芯片的"。 这颗芯片不仅能够满足阿里云的需求定义,也能够应用于冷存储和边缘设备上,负责把虚拟化、网络与存储的管理开销从主 CPU 上接走。
定制还延伸到了存储介质。阿里云自研的 AliSCM 让一类新介质既能被 CPU 当内存直接访问,又能掉电不丢数据;它已在至强 6 平台完成适配,英特尔用内置的 DSA 加速数据搬运,读写性能成倍提升。
在软件与生态共建上,论坛现场,英特尔与阿里云终端智能计算宣布围绕 Agentic Browser 展开合作。

阿里云终端智能计算事业部产品经理蒋佳忆介绍,2026 年二季度浏览器访问的机器流量占比已达 57.5%,首次超过人类。Agent 正在成为浏览器最重要的新用户。但今天的浏览器仍然是为人设计的,实例重、并发高,在登录、验证码和复杂交互面前容易失败。
双方没有另造一个浏览器,因为 Chromium 是 Chrome 的开源底座,真实网站都按它的标准写的,换掉很多页面就打不开了。于是保留兼容性,只把为人准备的那些开销删掉:双方基于官方 Chromium 技术体系,对 Blink、V8 等核心引擎进行轻量化优化,并结合英特尔至强处理器 AVX - 512 指令集,以及 IAA、QAT 等硬件加速器能力,内存开销最多降了三成,省下的内存换成并发,这样,一个 Agent 可以同时开出上百个浏览器办事。
此外,PolarDB 库内 AI、龙蜥社区五年 OS 开源创新也在这一层持续推进。
Agent 不只在云上,双方也展开了端侧协同。第三代酷睿 Ultra(Panther Lake)上运行的 QwenWork 端侧办公智能体,数据不出本地,也省下 token。现场还有千问 AI 眼镜+AI PC 辅助销售方案——门店销售问一句"给客户推荐一台五千元的电脑",眼镜把请求交给本地算力,结合本地知识库与 ERP 给出方案,全程不上云。此外还有 Qwen Book 与 Qwen Box、零售门店 AI 管理方案,以及锐炫 Pro B70 显卡赋能 AIGC。

现有平台的联合优化之外,芯片架构本身也在应对智能体需求。英特尔首席工程师龚海峰介绍了展台展示的下一代至强(代号 Diamond Rapids)时提到,其架构围绕数据搬运、处理与保护展开:例如通过 3D 封装,将缓存放在计算核心下方,让取数据如同"从楼上到楼下",缩短访问路径。
从眼前的软硬件调优,到面向未来的架构演进,真实负载正在提出更具体的要求。双方的联合研发分工也越来越具体:阿里云把云平台和业务现场的负载、瓶颈带进来,英特尔以处理器架构、内置加速器和软件优化能力参与解决,再回到实际场景中验证。从定制芯片到轻量浏览器,合作已经深入数据如何流动、任务如何执行、资源如何分配。
Agent 仍在快速演进,正如卓久在论坛上说,这一年身处浪潮之中,发现 AI 这一波"浪潮越来越大,而且无法阻挡"。今天解决了缓存和沙箱启动开销,明天还会遇到新的并发、成本等方面的挑战。双方合作的长期价值,在于持续把这些问题转化为共同的设计与验证目标,让芯片、软件和云服务随真实需求一起改进。而最终衡量成果的,是企业能否用可承受的成本,让更多智能体可靠地完成工作。
© 本文为数智前线(szqx1991)原创内容
未经授权,禁止转载
进群、转载或商务合作联系后台
文章精选
AI Coding,正在把存储推向前台
WorkBuddy 又有大动作:打通账号体系,让企业管理可控
万小智,让 AI 从网站生成走向企业经营
在云栖大会,看见企业级 Agent 的最终形态
"我和我的个人机器人",等待一个" iPhone 时刻"
万亿商旅市场终局之争:告别差价博弈,智能体重塑差旅价值
缩小 AI 落地剪刀差,为什么需要产业智能体操作系统
台车歪了 5 毫米背后,飞书 + 豆包工作如何让 AI 真干活?
近九成企业用了 AI,为何组织提效却不明显
苹果缺席的那道题,中国厂商先交了卷
从"超级员工"到"超级流程",企业 AI 正在换挡
机器人补上"最后一厘米",触觉的战争打响了
从办公 Agent 到开放平台,WorkBuddy 在赌什么?
千问办公进长安
机场广告之后,京东云的物理 AI 版图要浮出水面了
二十年攒下的数据,为什么喂不饱一个 Agent?
具身 ChatGPT 时刻前夜,自变量押注"最强大脑"
AI 改变钱的流向:预算、自研与最后一公里
OceanBase,走向中国版 Databricks
不甘平庸的李健和一个更敢的荣耀
AI 编程更挣钱,为什么大厂全冲去做 AI 办公
从个人 Agent 到企业级数字分身:组织 AI native 转型的"最后十公里"
历史进程中的浙大

大模型五大"标王"与六边形战士
枪响在 2018:神秘东方力量股票双向投资,为何扎堆杭州
融资融券网提示:本文来自互联网,不代表本网站观点。