新闻详情

新闻详情

首页 / 资讯中心 / 详情

AI自主设计Redwood芯片:两周完成,性能提升1.75倍、功耗降低1.9倍!

发布时间:2026/9/2 18:47:37来源:尧图网络
AI自主设计Redwood芯片:两周完成,性能提升1.75倍、功耗降低1.9倍!
突发AI系统自主设计出可量产人工智能芯片Redwood日前由Ebrahim Hussain和Aaditya Subedi领导的定制芯片人工智能研究实验室Architect Labs宣布其人工智能系统根据人工编写的规范生成并完全验证了端到端的、可用于生产的人工智能加速器Redwood。仅由两位人类架构师提供技术规范人工智能系统就在不到两周的时间内完成了芯片的设计和全面验证。它还参与了固件和定制内核的设计并将现代人工智能模型映射到硬件上。最终的加速器目前运行在FPGA平台上对包括Llama和Qwen在内的数十亿参数模型进行推理。Redwood半导体行业重要里程碑据相关人士所说Redwood代表着半导体行业的一个重要里程碑一个人工智能系统自主设计出了一款可运行人工智能模型的量产型人工智能芯片。这种方法在人工智能模型和为其优化的硬件之间建立了一个反馈回路有望将芯片设计速度提升到超越传统开发周期的水平。性能测试Redwood超越传统芯片性能测试结果也表明Redwood不仅仅是概念验证。基于三星的8nm工艺Redwood的吞吐量是NVIDIA Jetson Orin Nano的1.75倍功耗却降低了1.9倍这意味着在相同的AI模型下其每瓦性能提升了3.4倍。传统芯片设计困境与Redwood的创新方法芯片设计可能需要数年时间和数亿美元而专业人才的日益匮乏使得先进半导体研发集中在少数几家大型公司手中。因此人工智能工作负载往往需要适配远在最新型号问世之前设计的硬件。Redwood采取了不同的方法从一开始就将硬件和软件进行协同设计。内核、固件和RTL代码共同开发和优化使芯片能够根据AI工作负载进行定制而不是强迫软件去适应现有的硬件。这形成了一个持续的反馈循环改进的AI模型可以为更好的硬件设计提供信息而更高效的硬件可以实现更好的AI性能从而有可能加速开发周期的两端。行业人士评价Redwood英特尔前工程高级副总裁Sunil Shenoy说道“四十年前我刚入行时芯片设计只需要一两个工程师。从那时起设计的复杂性、耗时和风险都呈指数级增长。即使EDA工具和技术不断进步一个芯片项目仍然需要耗费数年时间和庞大的工程团队。Redwood真正实现了范式转变树立了技术前沿的标杆。Architect Labs正在以我以前难以想象的速度将曾经只有少数巨头才能掌握的能力普及化。他们的方法有望将硬件带回未来。”Kindred Ventures的创始人兼管理合伙人Steve Jang表示“每个计算时代的进步都离不开底层硬件的支持但也受限于谁有能力制造相应的芯片。Redwood芯片的问世初步证明这道门槛可以打破两个人——从一份书面规范和目标AI模型入手——利用Architect Labs的系统在短短几周内就完成了极具竞争力的AI加速器的设计、验证和部署。无论你是前沿研究实验室、机器人制造商还是云运营商为你的产品或平台量身定制芯片的概念如今正逐渐成为现实。”走进Redwood前沿人工智能加速器Redwood是一个端到端的AI推理平台专为需要在严格的功耗限制下实现实时性能的物理AI应用例如机器人、无人机和边缘设备而设计。其核心是一个可扩展的矩阵和向量计算引擎网格这些引擎通过专用的片上网络连接起来。完整的AI推理流程包括注意力机制、键值缓存和即时量化都直接在芯片上运行无需依赖主机处理器。计算引擎、网络、固件和定制内核作为一个统一的系统进行设计和优化使硬件能够紧密匹配现代人工智能工作负载。Redwood还可以扩展到更大的数据中心SoC或作为独立的芯片组运行。关于自主Redwood设计的关键统计数据自主设计和验证100%的RTL、UVM验证环境、形式验证、固件、驱动程序和自定义计算内核均由Architect Labs的AI系统根据人工编写的规范在不到两周的时间内端到端生成而该项目由两名人类架构师参与。达到签核级验证标准硬件零缺陷从单个IP到整个SoC每个模块的代码和功能覆盖率均超过95%验证过程使用了商用EDA工具、Architect Labs专有的形式化验证引擎以及硬件在环验证。从仿真到FPGA平台的首批RTL代码均未发现任何缺陷。在真实硬件上运行真实的AI模型Redwood Nano部署在AMD Versal FPGA上运行频率为250MHz可对包括Qwen在内的开放权重模型执行实时单批次推理。Architect Labs在今年的设计自动化大会DAC上进行了现场硬件演示是展会上为数不多能够展示AI设计的加速器并实时运行模型推理的公司之一。超越当今领先的AI芯片在与NVIDIA Jetson Orin Nano采用相同工艺的三星8纳米工艺平台上Redwood的吞吐量提升了1.75倍功耗降低了1.9倍每瓦性能提升了3.4倍以运行相同模型的Jetson基准测试为基准。这些预测结果基于FPGA的直接测量数据而非仅基于仿真。架构迭代以天为单位而不是以季度为单位对高级规范的任何更改都会导致硬件在48小时内完全重新生成、重新验证和重新部署但受EDA工具运行时间限制的SoC级运行除外。递归式自我改进部署在Redwood上的AI模型以API端点的形式公开发现了加速器本身的计时和内核优化推理成本几乎为零从而闭合了AI和驱动它的硅芯片之间的闭环。一种从根本上革新的硅芯片软件设计方法Architect Labs的AI系统能够并行优化整个计算堆栈从模型和内核到固件和RTL代码而非采用传统芯片设计中常见的顺序、孤立的工作流程。这使得软件和芯片能够在流片过程中进行协同优化设计迭代时间可能从数月缩短至数周。这种方法可以根据效率在软件和硬件之间切换功能例如用专用硬件逻辑替换数千个软件周期或者将调度任务移至编译器。Redwood证明这些权衡取舍现在可以在几天内通过硬件完成设计、验证和测试从而为将该方法扩展到更复杂的芯片奠定了基础。Architect Labs联合创始人兼首席执行官Ebrahim Hussain表示“三十年前像台积电这样的晶圆代工厂让任何拥有设计方案的人都能获得世界一流的制造能力由此催生了以英伟达、博通和苹果等公司为代表的无晶圆厂半导体产业。同样我们正在引领无设计半导体产业的发展像Redwood这样的芯片可以与运行的工作负载共同设计和演进。我们设想拥有密集型工作负载或专用AI模型的软件公司可以获得共同设计的定制芯片而无需组建庞大的设计团队无需在架构上投入十年时间也无需退而求其次使用现成的通用解决方案从而节省性能、功耗和成本。每一项重要的工作负载都值得拥有专属的定制芯片。我们正在构建这样一个未来。”Architect Labs表示公司已将同样的方法应用于财富500强合作伙伴以软件开发的速度共同设计定制芯片并将原本需要数月才能运行的程序压缩到数周内即可完成。Redwood是这项技术首次公开展示其成果。附完整论文翻译现代人工智能工作负载及其运行所需的硬件以不同的时间尺度演进架构定义比量产芯片早数年而目标工作负载的变化却以月为单位。因此设计决策是在高度不确定性下做出的并且要付出双重代价一次是为规避风险而增加的通用性另一次是当新的工作负载难以映射到已冻结的芯片上时。随着摩尔定律的停滞专业化成为每瓦性能的主要来源并要求设计周期与工作负载的节奏保持一致。我们提出了一种端到端的人工智能系统它将软件到芯片的整个堆栈简化为一个单一的优化循环其中硬件和软件在同一目标下进行协同设计和验证。该系统的首个演示是Redwood这是一款专为物理人工智能的单批处理、低功耗、超低延迟推理而构建的前沿人工智能加速器。该系统基于两位人类架构师提供的高级规范在不到两周的时间内自主生成了性能模型、RTL设计、UVM环境、形式化证明、固件和内核且规范以下部分无需人工干预。通过商用EDA工具、我们自主研发的形式化引擎以及硬件在环验证每个模块的覆盖率均达到95%。规范变更在48小时内完成重新验证并部署到硬件。Redwood Nano是其超低功耗FPGA版本可运行Llama和Qwen等数十亿参数模型。在三星8nm工艺Jetson Orin Nano的工艺等级下Redwood的吞吐量提升了1.75倍功耗降低了1.9倍与在相同模型上测得的Jetson基准相比每瓦性能提升了3.4倍。在Redwood上运行的Qwen也助力了下一代Redwood的设计这是迈向递归式自我改进的早期一步。据我们所知这是首个由AI系统端到端设计并运行现代AI模型的、可用于生产环境的AI加速器。一、引言EDA行业目前报告称人工智能(AI)在RTL生成、验证、调试和探索等方面带来了数量级的提升包括将数月的工作量缩短至数天并在设计和验证工作流程中实现高达10倍的生产力提升。然而仅有14%的IC/ASIC项目实现了首芯片流片成功这是近二十年来的最低水平而75%的项目进度落后因为芯片项目面临着日益复杂的设计挑战这些挑战源于异构集成、先进节点物理效应以及日益严格的功耗、性能和面积(PPA)限制。这种差异凸显了任务级生产力声明与整个项目结果之间的严重不匹配AI加速了单个活动但尚未在日益复杂的SoC上展现出明显的端到端项目改进。与此同时公开展示的端到端AI生成设计仍然局限于简单的示例例如玩具RISC - V内核或强化的数值数据通路。几乎没有一项技术在物理硬件上得到验证而物理硬件最终是硬件设计的最终约束。我们认为人工智能在硬件设计中的应用机会并非在于现有流程中的任务加速而在于对整个流程本身进行重新构想。当架构、RTL、验证、固件和内核都基于单一规范生成并针对同一目标进行优化时导致程序延迟的顺序交接环节就会消失软硬件协同设计将成为系统本身的属性而非团队之间的协调过程。为了解决这个问题我们推出了Redwood这是一款前沿的AI加速器由该系统完成端到端的设计、验证、编程和部署。两位架构师在一份高级规范中记录了工作负载和架构约束。基于该规范系统自主生成了性能模型、RTL代码、UVM环境、形式化证明、固件、驱动程序和自定义计算内核。在不到两周的时间内系统从零开始完成了完整的设计每个模块的代码和功能覆盖率均达到95%并在AMD Versal FPGA上部署了Redwood Nano配置。第三周Qwen3 - 0.6B推理上线。在此期间每次架构变更都在48小时内重新生成、重新验证并重新部署到硬件上。Redwood Nano采用与NVIDIA Jetson Orin Nano类似的8纳米级三星工艺进行评估预计其解码吞吐量将提升1.75倍功耗降低1.9倍每瓦性能提升3.4倍与运行相同模型的Jetson基准相比。二、架构Redwood是一款基于tile的空间数据流加速器它使用标准的AXI4内存映射接口AXI - Lite用于控制和配置而支持完整突发传输的宽AXI4用于批量数据传输图1。专用DMA引擎负责所有与外部DRAM之间的数据传输。全局DMA(GDMA)架构在外部存储器和片上西、北、东三个末级SRAM存储体(LLC)之间执行批量内存到内存的传输而边缘DMA引擎则负责在计算架构上进行数据暂存。全局控制区域负责对加速器进行排序并包含全局控制核心(MCU)、全局任务管理器以及一个48位全局定时器(HAC)该定时器会广播到每个tile以进行时间隔离调度。该区域负责启动、协调和清理诸如FlashAttention和GEMM/GEMV等内核。由于内存接口仅限于模块化DMA引擎Redwood可以集成到更大的SoC中也可以封装成独立的芯片。DMA后端可以从AXI4重定向到ACE和CHI等协议而不会影响计算架构。计算架构是一个N × M的网格由相同的tile组成周围环绕着边缘DMA引擎。每个tile都包含一个基于RISC - V的tile控制核心(CRV)和专为Transformer推理而设计的计算引擎。矩阵引擎(CMXM)提供脉动GEMM和矩阵向量(GEMV)数据通路并将数据流直接传输到向量引擎(CVXM)后者提供SIMD、转置和浮点激活单元。宽大的分块暂存存储器最大限度地减少了Redwood内部的数据移动。计算引擎与内核软件协同设计因此它们可以直接映射到主要的Transformer算子——注意力机制、GEMM、归一化和激活——并将FlashAttention和GEMM等内核作为硬件调度任务执行而不是作为通用指令流执行。高带宽、内部设计的、基于信用机制的片上网络(NoC)可承载tile到tile、DMA到tile和tile到DMA的流量。它提供低开销的广播和组播、基于表的流重定向以及逐链路流量控制。A. Tile架构Redwood架构中的每个tile都分为前端(FE)和后端(BE)如图2所示。FE负责控制和编程而BE负责数据传输和计算。将稀疏控制与高带宽数据处理分离使得FE能够在较低的时钟频率下运行并且在某些情况下FE可以在内核执行期间关闭从而实现显著的节能效果。内核软件运行在tile控制核心(CRV)上而核心任务管理器(CTM)则连接CRV和BE功能单元并协调跨多个可配置单元的任务。Tile BE内部的硬件单元是为现代Transformer工作负载协同设计的包括设备端预填充和解码。计算单元包括用于矩阵运算的GEMV和GEMM引擎由阵列化的基于整数的乘加(MAC)单元构建以及用于逐元素运算的多通道SIMD引擎由阵列化的浮点单元(FPU)构建能够处理归约、基于查找表(LUT)的运算等图3。一项优化采用了FlashAttention - 4中的模拟softmax算法该算法重用了现有的SIMD资源来执行原本会占用大量面积的操作。这些功能单元和CRV通过高带宽总线共享对本地512 KB核心内存(CMEM)的访问。本地入口和出口DMA引擎负责将数据移入和移出CMEM。B. 控制机制要使用Redwood tile进行计算首先需要将内核加载到前端指令紧耦合存储器(ITCMinstruction tightly coupled memory)中。然后核心调试、跟踪和控制(CDTCCore Debug, Trace, and Control)单元启动裸机tile控制核心(CRVcontrol core)。CRV等待CDTC向数据紧耦合存储器(DTCMdata tightly coupled memory)传递函数调用然后执行选定的内核函数。内核函数通常会展开为多个MMIO写入操作这些操作会将CTM任务排队以便分发给相应的功能单元。只要内核函数的实现位于ITCM中就可以将多个内核调用排队。整个前端 - 后端协调过程如图4所示。前端(FE)和后端(BE)之间的这种解耦带来了以下优势CRV保持简洁实现了最小的RISC - V规范面积和功耗开销都很低。当添加、更改或移除BE功能单元时CRV解码器保持不变。CRV可以将任务列表交给CTM然后保持空闲状态直到被中断。CTM原生支持使用任务ID跟踪乱序完成情况实现任意任务排序和隔离。硬件跟踪和日志记录到跟踪缓冲区并通过中断传递软件通知。循环遍历队列任务的任意部分以减少重复的CRV写入。CTM任务还可以通过Redwood SoC消息传递结构传输的外部“消息”进行隔离该结构连接所有CTM。跨内核和CTM的系统级消息传递如图5所示。消息机制允许CTM在不涉及CRV或MCU的情况下对控制流进行排序。在图6的典型示例中位于(0,0)的tile向东西DMA引擎发送交错消息它们的CTM会等待“允许”消息才能释放下一个任务。通信也可以反向进行DMA CTM向tile CTM发送信号使其向下游发送数据。消息机制可以配置为“即发即弃”或“基于确认”。编译器使用消息机制来协调预取、双缓冲和乱序计算。通过消息进行显式流量控制减少了对网格中复杂仲裁的需求并将调度移至软件栈中。三、编程模型Redwood采用灵活的编程模型可在同一架构上运行不同的模型和工作负载。全局控制核心(MCU)的程序称为调度程序(DP)而各个单元的程序称为内核。多个DP组成一个“DP集”多个内核组成一个“内核集”从而分摊初始化开销。主机处理器使用Redwood执行操作的流程如下图71.前提条件将DP集从外部存储器加载到MCU的ITCM中。2.前提条件将内核集从外部存储器加载到所有tile的ITCM中。3. 主机处理器将调度ID和操作数写入MCU的DTCM并向MCU发送信号。4. MCU执行由调度ID选择的调度程序。调度程序可以对内部结构网格中的静态路由表进行编程。配置全局任务管理器以执行预取、内存到内存复制和分散/聚集操作。配置DMA引擎任务管理器以将数据移入和移出tile阵列。通过将内核ID和操作数写入tile的DTCM并向tile控制核心发送信号来启动tile内核。DP可以通过轮询状态或依赖tile中断来判断tile阵列何时完成。一个正在运行的DP在其生命周期内可能会启动一个或多个内核。例如FlashAttention会反复启动tile来处理不同的KV块和磁头。5. 当DP完成时MCU会中断主机处理器以指示执行已完成并且预留的输入输出缓冲区可供主机使用。如果整个模型所需的DP或内核集不适合ITCM则主机处理器会在运行时将它们加载到分区中并将它们分组以最大限度地减少交换。四、评估Redwood Nano是Redwood的FPGA配置专为超低功耗、低延迟边缘应用场景而设计和优化。它由一个2 × 2的tile阵列组成每个DMA引擎都连接到一组128位AXI4接口。西侧和北侧接口优先考虑入口读取带宽而东侧接口优先考虑出口写入带宽。Redwood Nano在250 MHz的AMD Versal VPK180 FPGA上进行综合和部署图8。为了评估性能我们在Redwood Nano上运行Qwen3 - 0.6B并将其与NVIDIA Jetson Orin Nano进行比较。图8显示了Redwood Nano在VPK180 FPGA上的布局和实例化层次结构。我们测量了峰值吞吐量和平均吞吐量下的LLM解码性能单位为每秒输出的token数。对于Redwood Nano测量过程包括从主机向FPGA发送提示符、在FPGA上运行Qwen以及将每个输出token返回给主机。NVIDIA Jetson Orin Nano运行的是相同型号的处理器GPU时钟频率为1020 MHz性能测试使用NVIDIA的Jetson WebUI进行。表I列出了基准测试对比结果。A. Redwood顶线峰值解码吞吐量分析我们首先计算峰值理论性能。操作级屋顶线源自Qwen3 - 0.6B解码图。该模型包含28个解码器层隐藏层宽度为1024中间层宽度为307216个查询头8个KV头头维度为128词汇表大小为151,936。每一层中INT8线性形状分别为Q : [2048, 1024]KV : [1024, 1024]O : [1024, 2048]gateup : [3072, 1024]down : [1024, 3072]。矩阵引擎包含四个tile每个tile有64条INT8 MAC通道。将乘法和加法视为两次运算其峰值速率为512位SIMD数据通路每个周期可接受32个BF16或16个INT32操作数峰值速率为 对于每个未融合运算符我们计算算术运算量和总DRAM流量包括所有操作数读取和结果写入。其计算时间、内存时间和可达时间分别为 运算符保持顺序执行因为每个运算符都会消耗前一个运算符的结果。因此完整token的界限为Ttoken ∑Ti。内存和计算资源可能在同一个运算符内重叠但不会跨越运算符边界隐藏任何工作或流量。因此单个解码器层的架构延迟为1.241毫秒表II。28个层共贡献34.76毫秒而嵌入、最终归一化、语言模型头部和argmax操作又贡献了11.26毫秒。完整的词元移动0.627GB的数据需要44.65毫秒的DRAM服务总和以及12.29毫秒的算术服务总和。将每个运算符的根节点时间相加得到内存服务时间是算术服务时间的3.6倍这表明解码过程与内存使用量密切相关正如预期。由于未考虑启动、同步、流水线填充/清空以及主机开销测得的吞吐量仍低于架构上限。如果强制每个运算符内部的内存传输和执行进行串行化则相应的保守上限为每个token 56.94毫秒即每秒17.56个token。通过改进预取、软件调度以及控制路径中的硬件更新仍可通过进一步优化软件和主机开销来降低吞吐量。B. Redwood性能、面积和功耗预测我们估算了采用1 GHz逻辑时钟的配置的架构顶线我们认为考虑到FPGA时序该时钟频率是合理的。顶线模型将吞吐量限制在权重传输路径DRAM → NoC → 边缘DMA → 网状交换机 → 计算中最慢的阶段因此我们计算每个阶段的可持续带宽并取最小值。关键在于DRAM数据速率每引脚3900Mb/s由内存设备决定不会随架构时钟频率而扩展1 GHz时钟频率加速了片上架构、SIMD引擎和MAC阵列。假设带宽与Nvidia Jetson Orin Nano相同则tile入口路径仍然是最窄的阶段因此该设计仍然受限于内存传输吞吐量约为64GB/s。在此场景下架构上限约为95个token/秒这是基于128个生成的token的平均值。相比目前约21个token/秒的上限性能提升主要来自启用三个控制器并提高逻辑时钟频率这使得总的tile入口带宽从16 GB/秒提升至64GB/秒并将计算引擎的数量增加了四倍。在非理想配置下模型的执行并非总能与数据传输重叠。我们对Qwen在FPGA上的执行进行了分析并根据更高的时钟频率、更大的内存带宽以及更少的硬件限制带来的更优任务调度仔细调整了每个步骤。我们最保守的预测表明在不更改软件栈的情况下当前的ASIC设计在128个生成的token上平均可实现约49个token/秒的性能。我们根据三星8纳米工艺与NVIDIA Jetson Orin Nano所用的工艺相当来预测Redwood的面积和功耗。物理面积的估算采用了一种标准的自下而上的门等效(GE)方法该方法针对三星8纳米物理设计规则进行了调整。通过将200万个组合逻辑单元和50万个时序寄存器按其平均相对门尺寸加权将标准单元数量转换为GE单位。它们的和即为原始标准单元面积代表不包含互连间隙的有源硅面积。我们为测试逻辑设计增加了15%的开销。70%的布局利用率则为金属布线、电源轨和去耦电容预留了空间。最后我们为时钟树综合中继器、时序收敛单元和周边结构增加了20%的面积开销。因此Redwood Nano预计在三星8纳米工艺下的NPU模块面积约为2.88平方毫米。我们通过分离动态功耗和静态功耗来估算Redwood的总功耗。核心动态功耗遵循公式Pdyn αCV2而核心静态功耗用Pstat表示。在三星8nm工艺下目标频率为1.0GHz标称核心电压为core 0.75每个tile包含200万个逻辑单元、50万个触发器和512KB SRAM在Qwen3 - 0.6B的平均开关活动下其动态功耗约为0.958 W。静态漏电约为Pstat≈ 0.07 W。加上剩余的SoC和时钟管理组件芯片端总功耗约为Ptotal ≈ 1.335 W。该数值与基于FPGA的测试结果一致并且是上限值因为我们尚未考虑Redwood架构原生支持的积极时钟和电源门控所带来的节能效果。在Jetson上运行相同的应用程序我们实现了每秒28个token的处理速度。Jetson的CPU和GPU核心在启用融合功能后的平均功耗为2.59瓦。为保证公平性上述功耗估算均包含主机和加速器计算但不包括内存控制器和其他外围组件。因此Redwood在采用三星8纳米工艺的同类产品上的性能和功耗预测显示性能提升1.75倍功耗降低1.9倍每瓦性能提升3.4倍同时显著缩短了设计时间和上市时间。表III总结了Redwood Nano与NVIDIA Jetson Orin Nano相比的预计性能、面积和功耗。五、Architect Labs系统在不到两周的时间内整个Redwood系统完成了设计、验证并达到了综合和物理设计就绪状态最终部署为Redwood Nano FPGA配置。该加速器完全从零开始研发没有使用任何预先存在的加速器IP。这不仅得益于我们自主训练模型、构建代理框架和开发AI原生EDA工具更得益于我们对从软件到芯片的硬件设计流程进行了根本性的重新思考。传统的芯片设计生命周期高度顺序化从架构定义到最终流片按阶段推进。在此过程中相关组件会被“冻结”变更要么是临时性的要么是为下一代产品预留的。硬件团队采用流水线式开发模式使得在版本N冻结后相应的团队立即开始版本N 1的开发图9。这使得大型硬件公司能够以9 - 12个月的周期发布新硬件。虽然其吞吐量可能尚可接受但这种顺序方法的延迟使得真正的软硬件(HW - SW)协同设计变得不切实际。在当前的AI环境中当架构定义完成、RTL设计和验证工作启动时新的模型可能会使数月的优化成果付诸东流。因此硬件团队必须预测工作负载的发展方向并添加通用功能作为应对措施。Architect Labs的流程尽可能地自动化和并行化无需“冻结”设计从而实现灵活的架构探索和端到端实现。它基于Architect Labs平台(ALP)构建ALP是我们内部用于端到端芯片设计的平台图10。一旦设计意图被捕获到ALP中自动化流程就会生成RTL、UVM文档、SVA断言、形式化证明和其他工件。在规范以下阶段无需人工干预专家会在整个项目生命周期中维护ALP并根据功能、面积、性能、时序和功耗方面的反馈来调整规范或设计意图。这种自动化流程的一个关键优势在于人和智能体可以并行探索多种架构方案。对于Redwood项目每个架构迭代都在48小时内完成重新生成、重新验证并重新部署到FPGA。从初始规范到最终的RTL代码、验证、固件、自定义内核以及时序收敛整个设计周期耗时两周所有模块的代码和功能覆盖率均达到95%。第三周将目标工作负载即新的AI模型部署到FPGA上完整的为期三周的项目时间表如图11所示。图12显示了AI系统在项目生命周期内的代码库合并提交历史记录。在目标工作负载上线并持续优化Redwood的固件和内核期间AI系统在一天内达到了115次合并提交的峰值。A. 自动化设计验证和覆盖率收敛Redwood的测试平台生成、测试用例开发和覆盖率收敛均已实现完全自动化。传统的“用于验证的AI代理”通常需要工程师通过聊天来自动化测试用例开发和测试平台构建。这种方法仍然需要大量的人工投入并且无法随着芯片复杂性的增加而扩展因此并未显著缩短端到端ASIC开发周期。相比之下Redwood的所有测试平台、测试用例、形式化工件和仿真均由ALP使用AI和编译器方法自动生成无需人工参与设计验证。遵循行业标准验证实践我们采用UVM技术以及现代形式化方法。我们开发了自主研发的形式化引擎的首个版本该引擎能够根据人工编写的规范生成每个验证环境的各个部分。验证流程测量并自动优化了覆盖率和性能指标。每个模块都实现了95%的代码和功能覆盖率。在将第一个从仿真环境发送到FPGA的RTL代码时未发现任何错误。迄今为止我们的验证方法尚未遇到任何在验证环境中遗漏但在实际硬件中发现的错误。随着我们技术的扩展我们预计验证的严谨性将随着可用计算资源的增加而扩展而不仅仅是取决于团队规模和EDA工具许可证的数量。我们期待在未来的公告中分享更多信息。B. 设计与优化由于我们的流程中RTL设计完全自动化系统能够在相同时间内探索比人类团队大一个数量级的微架构搜索空间。以我们的SIMD引擎为例它在多个向量通道上执行降精度浮点和整数运算。虽然单个通道的开发和复制都很简单但诸如reduce、max和min之类的归约操作会跨越所有通道。通过在更长的时间范围内运行更多系统实例我们可以发现大量新的候选方案。在图13和图14所示的示例中我们的AI系统在多天内遍历了性能 - 面积 - 时间搜索空间在保持代码覆盖率和验证严谨性的同时进行设计、验证和优化。以往的自动化微架构探索方法通常仅限于位宽调整或寄存器重排等更改。而在这里生成的RTL候选方案可以采用截然不同的控制路径、数据路径和状态机并能够自由地寻找超越人类认知最优解的解决方案。随着技术的扩展我们预期探索质量将受限于可用计算能力而非人类洞察力随着计算能力的提升系统将能够发现超出最优秀人类设计师认知极限的架构。C. 固件生成和内核优化ALP的一项优势在于它支持在编写任何RTL或验证文档之前对所有系统软件包括固件、内核和性能模型进行协同开发。这使得架构师能够在最终确定实现方案之前做出明智的设计决策。我们的AI系统编写并测试了启动SoC和运行Qwen推理所需的所有固件和内核。根据运行时环境的不同系统软件会根据ALP预测结果、周期精确的RTL仿真或现有的FPGA构建进行测试。我们设计了一个内部定制的仿真环境该环境将FPGA访问复用到数百个并发代理使它们能够运行实验、共享性能结果并在数天内无需人工干预即可迭代。在某些情况下AI系统发现了我们的专家尚未考虑或深入探索的优化和架构改进。该系统还帮助我们发现了下一代Redwood的新硬件特性从而可以对新设计进行多次并行迭代。从RTL和性能模型仿真迁移到我们内部的FPGA环境将优化运行时间从15小时缩短到大约15 - 30分钟。随着人工智能在设计流程中实现更多自动化我们相信基于FPGA的仿真将对加速性能验证和ASIC路线图的制定至关重要。D. 递归式自改进最终我们在Redwood上部署了Qwen3并将其作为我们AI系统中的推理端点。通过重复采样AI模型在其多个操作中发现了多项时间优化和内核优化且推理成本为零。我们认为这是递归式自改进的最早演示之一一个AI系统设计了一个AI加速器在其上部署了一个AI模型并利用该模型改进了下一代加速器。如今能够自主设计硬件的AI系统的能力与能够实际部署在此类硬件上的AI模型的能力之间存在差距如图15所示。随着我们的AI系统不断扩展到更复杂的硬件设计并且我们缩小了这种差距持续的AI驱动的现代硬件改进将成为AI进步的最大驱动力之一。我们认为这是衡量递归式自改进最清晰的指标。六、结论我们展示了Redwood一款由人工智能系统从零开始设计、验证和部署的可编程加速器整个过程耗时不到两周。该系统实现了95%的代码和功能覆盖率Redwood Nano在AMD Versal FPGA上运行Qwen3 - 0.6B算法峰值和平均速度分别为13个token/秒和12.1个token/秒。根据这些FPGA测量结果进行校准后我们基于三星8纳米工艺的预测结果为功耗1.335瓦时速度可达49个token/秒相比我们测量的Jetson Orin Nano基准每瓦性能提升了3.4倍。在传统的顺序芯片设计流程中人工智能辅助并未显著缩短端到端开发时间。我们的人工智能系统采用了一种正交方法以高级规范为真理之源架构、RTL、验证、固件和内核均基于此进行协同设计和优化。这使得架构变更能够在48小时内重新验证并部署到硬件上。未来的工作将着重于弥合内存容量与性能上限之间的差距将Redwood扩展到更大的模型和架构并通过物理设计、流片和芯片后验证来扩展AI系统。我们的最终目标是通过递归式自我改进实现智能的泛滥随着AI模型和可用计算能力的提升系统可以探索和优化更多AI硬件设计从而产生更高效的计算进一步加速下一代AI和硬件的开发。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

现在口碑好的AI写作辅助软件有哪些品牌?选对工具少走弯路 2026/9/2 19:41:46

现在口碑好的AI写作辅助软件有哪些品牌?选对工具少走弯路

每到期末、毕业答辩、课题申报阶段,很多学生都会陷入论文写作的困境:选题无从下手、大纲逻辑混乱、正文撰写耗时费力、参考文献格式错误、查重率居高不下、AIGC检测风险频发、学校排版标准复杂多变。依靠纯人工从零开始撰写、反复修改格式和降重&#xf…

阅读更多 →
谨慎选择!不是每款 AI 都能用来写学术论文,2026 导师信赖工具清单 2026/9/2 19:41:46

谨慎选择!不是每款 AI 都能用来写学术论文,2026 导师信赖工具清单

每年毕业季,无数同学深陷论文难题:开题毫无思路、搭建框架耗费数日、初稿逻辑松散、查重标红泛滥、AI检测超标、格式反复被导师驳回。面对海量的AI工具,不少学生抱着试一试的心态选择通用型大模型,却往往发现其存在诸多致命短板。…

阅读更多 →
物料领取流程详解:如何高效完成物料领取? 2026/9/2 19:41:46

物料领取流程详解:如何高效完成物料领取?

一、为什么要重视物料领取流程物料领取看似只是“领一下东西”,但在生产、仓储、行政等场景中,它往往是连接计划、库存和现场作业的关键环节。流程不清晰,容易出现领错料、重复领用、登记缺失、库存账实不符等问题;流程过于繁琐&a…

阅读更多 →
EBNF可视化解析:让文法结构一目了然 2026/9/2 19:41:46

EBNF可视化解析:让文法结构一目了然

简介:扩展巴科斯范式可视化工具(EBNF Visualizer)是一款面向编译原理学习者、编程语言研究者与工具开发者的开源程序,能够解析 EBNF 规则,将其转化为直观的语法图,辅助理解复杂的文法结构与推导关系。资源包…

阅读更多 →
2026蓝牙耳机选购指南:场景、参数与形态全解析 2026/9/2 19:41:46

2026蓝牙耳机选购指南:场景、参数与形态全解析

写这篇测评之前,先解决一个核心矛盾:2026 年的蓝牙耳机市场已经不是“预算定型号”,而是“场景定技术”。同样的 500 元预算,你可以买到支持 LDAC 高解析的降噪入耳,也可以买到佩戴无感的开放式耳挂,还可以…

阅读更多 →
NexArm ROS分拣沙盘联动OpenClaw:机械臂具身智能闭环实践 2026/9/2 19:38:46

NexArm ROS分拣沙盘联动OpenClaw:机械臂具身智能闭环实践

这次我们来看一套把桌面机械臂、ROS 和 AI 智能体真正串起来的分拣沙盘方案:NexArm ROS 分拣沙盘联动 OpenClaw AI 智能体。这套方案的价值不在硬件多贵,而在“感知 → 决策 → 执行”这条链路完整闭环。视觉负责看,OpenClaw 负责想&#xff…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞