520 TFLOPS、50 万卡集群、45% 的端侧增速……刚刚落幕的 WAIC 2026 上,AI 产业的叙事已悄然转向。正在从“能说会道”的大模型阶段迈入“能干活、能创造价值”的智能体时代。
智能体所依赖的多智能体调度、工具调用、长期记忆管理等控制流密集型任务,让 CPU 重新回到系统核心,成为连接模型、工具与记忆的“总指挥”,同时也带来更尖锐的工程命题:如何在上百个并发线程间保持可预测的高性能。
玄铁的答案是“多线程”——资源从动态竞争改为静态分区,单线程性能几乎无损、尾部延迟低而稳定,直击 RL 沙箱、智能体工具调用与灵活调度三大场景。从 3 月与开芯院合作共研香山昆明湖 V3,到同期与开芯院、中兴的多线程研讨会,玄铁正把“源头开源、架构统一、生态合力”变成可验证的技术进展。

范式跃迁
Agentic AI 时代为什么需要 SMT?

达摩院首席科学家孟建熠在 WAIC 2026 发表演讲
过去两年,算力叙事几乎被 GPU 垄断。但当 AI 从"生成内容"跃迁到"自主执行完整任务链"的 Agentic AI 阶段,控制流密集型负载让 CPU 重回系统核心。智能体不再被动应答,而是持续进行任务拆解、工具调用、上下文管理与子智能体编排——全球围绕 Agentic AI 算力底座的竞争已全面展开。
7 月 17 日,世界人工智能大会(WAIC)现场,由国家互联网信息办公室信息化发展局、中国科学院联合主办的“RISC-V 与 AI 融合发展论坛”上,阿里达摩院首席科学家孟建熠认为:在智能体的工作流总延迟中,高达 90.6% 发生在 CPU 端的工具处理环节。这意味着,当智能体任务变得复杂,CPU 的吞吐与响应速度直接决定了整个系统的天花板,单纯堆砌 GPU 算力无法解决工具调用与逻辑协同的瓶颈。SMT(同步多线程)是高性能 CPU 从"单核极致"走向"系统级算力释放"的关键架构能力。

在 x86 和 ARM 主导的服务器 CPU 市场中,SMT 已是数据中心和 AI 推理芯片的标配技术;而对于正在向高性能计算领域突破的 RISC-V 架构而言,SMT 的工程化水平将直接决定下一代 RISC-V 服务器 CPU 能否在单核性能已跻身国际第一梯队的基础上,实现系统级算力的进一步跃升。
特别是在 Agentic AI 时代,智能体工作流对 CPU 多线程并发能力的要求越来越高——多租户 SLA 隔离、异步工具调用、推理与规划并行执行等场景,都需要 SMT 提供底层的硬件级支撑。

这套能力对三类 Agentic AI 场景至关重要。国际主流 CPU 产品(如英伟达 Vera CPU)对 Spatial SMT 的探索,已从侧面验证“确定性多线程”是智能体时代的刚需。
不同的是,玄铁正将这一能力在 RISC-V 开源架构上实现自主可控,并赋予其更灵活的生态适配性。在智能体时代,多线程的“确定性”与“隔离性”,将和绝对吞吐同等重要。
RL 沙箱:每个沙箱是一个独立线程,负责编译代码、运行测试,必须在固定时间窗口内完成,否则会拖慢 GPU 训练周期。空间多线程保证即使上百个线程全开,每个沙箱仍获得可预测的高性能。
智能体工具调用:一次用户请求可能触发多个工具调用(查数据库加执行脚本),这些任务不能因其他租户的请求而变慢。空间多线程提供强隔离,在多租户环境下依然守住 SLA。
灵活调度:运行时可在“1 线程/核(最大化单线程性能)”与“2 线程/核(提升吞吐)”之间动态切换,无需重启。

这一技术判断,正是达摩院玄铁深度参与 RISC-V 开源生态建设、推动 SMT 技术攻关的核心动因。
玄铁从 C910 到 C950,持续推动 RISC-V 架构从嵌入式向高性能方向突破。今年 3 月 24 日,在上海举行的 2026 玄铁 RISC-V 生态大会上,达摩院与开芯院、中科院软件所正式签署战略合作协议,明确将 SMT 列为联合研发的三大关键技术攻关方向之一,同时规划了 RISC-V 高性能软件生态共建与行业标杆应用孵化的合作路线。
目前 SMT 已经走进了实质性的技术协作——达摩院团队深入 KMH-SMT 微架构代码分析并提交了多个 PR 合入 XS-GEM5。
SMT 技术深潜
从微架构代码分析到系统性的性能优化

达摩院玄铁 RISC-V 处理器架构团队高级技术专家郝子轶在 SMT SIG 首期技术沙龙发表演讲
达摩院玄铁 RISC-V 处理器架构团队高级技术专家郝子轶分享了达摩院 SMT 工作组加入香山昆明湖 V3 联合研发以来的技术进展。团队基于 XS-GEM5 性能模拟器快速完成 SPECint2006 切片运行,正推进 SPECint2017 切片准备。在微架构优化层面,团队围绕多个关键组件展开深入分析与实验:
针对 IQ 发射队列分配策略,发现全动态共享存在线程饥饿风险,引入 WM2 水位线保留策略有效缓解 IQ 满载问题;
对 ROB 重排序缓冲区的 dynamic borrowing 机制进行 6 组对照实验,发现 donor 线程判定过于灵敏,建议引入延迟滤波,将 donor 保留条目提升至 64 时获得约 0.5% 性能改善;
Preg 物理寄存器分配初步验证了从全共享向策略化分配转变的价值。

郝子轶同时分析了线程取值截流策略与 store buffer 跨线程反压问题,提出按线程拆分 store buffer 的优化方向。
面向未来,提出 SPECint2006 双线程性能从 20% 向 30% 推进、同步推进 SPECint2017 切片、探索 SMT 向 4/8/16 线程扩展以应对 AI 并发场景、将资源分配策略参数化构建可调优的策略矩阵,以及空间多线程探索的路线图。他强调团队以最大化开源贡献为衡量标准,分析成果必须转化为有效的代码合入,"Talk is cheap, show me the code"。
玄铁联合中兴微电子、开芯院举办的「SMT SIG 首期技术沙龙:AI 时代的多线程架构创新」在近期成功举办,相关视频回顾已上线,欢迎前往玄铁视频号查看。