近日,第59届 IEEE/ACM International Symposium on Microarchitecture(MICRO 2026)录用结果揭晓,实验室陈瑶教授、博士生祝新宇(导师郑龙教授)、赵文举(导师廖小飞教授)的3篇论文分别被录用。
陈瑶的论文题目为“HiCAM: Accelerating Parallel Triangle Counting via Bit-Efficient Content-Addressable Memory on FPGA”。针对大规模图分析中三角形计数受不规则内存访问与有限并行性制约,论文提出软硬件协同设计的FPGA overlay加速器HiCAM。HiCAM通过局部性感知元组编码将多个顶点ID压缩打包至与DSP对齐的48位固定宽度条目,并协同设计位高效CAM单元实现压缩域直接关联搜索,无需运行时解压缩;同时采用运行时自适应CAM分组与两级内存通道感知分区,在高度倾斜的真实图分布上动态平衡存储深度与并行性。实验表明,相较先进FPGA基线,HiCAM最高实现10.6倍加速与5.8倍能耗降低;相较优化32核CPU方案最高提升3.8倍速度与9.0倍能效。
祝新宇的论文题目为“RAIL: A Reconfigurable Spatial Accelerator for Linear-Time Sequence Model Inference”。针对线性时间序列模型推理中状态更新层频繁访存、数据局部性差及不同模型计算模式差异大的问题,论文提出可重构空间加速器RAIL。RAIL采用软硬件协同设计,通过可重构脉动阵列支持端到端状态更新计算,并利用融合数据流提升片上数据复用;同时结合多Tile交错流水与轻量级标签驱动的流式向量执行策略,实现计算与数据传输高效重叠,在保证灵活性的同时提高硬件利用率。实验表明,相较NVIDIA H200 GPU,RAIL平均实现2.56倍性能提升,相较LSM专用加速器HLX平均提升1.76倍,并可支持Mamba2、GLA、HGRN2及混合Transformer-LSM等多种模型。
赵文举的论文题目为“SkewQ: Skewness-Aware Cross-Layer Quantization for Efficient LLM Inference via Software-Hardware Co-Design”。量化能够有效降低大语言模型推理中的存储与计算开销,但现有方法在低于4比特时往往会出现明显的精度下降。本文观察到,大语言模型不同层及其权重子结构的量化敏感性呈现出高度偏斜的分布,即少量关键结构主导了模型的主要精度损失。基于这一观察,论文提出SkewQ,通过基于tile的跨层混合精度量化方法,为不同重要性的权重子结构分配不同精度,从而在平均3比特量化配置下保持较小的精度损失。进一步地,论文设计了一种新型的硬件计算范式,从而减少乘法与反量化开销。实验结果显示,SkewQ在生成式推理、判别式推理中相较于主流方法平均加速1.46、1.70倍。
IEEE/ACM International Symposium on Microarchitecture(MICRO)是计算机体系结构领域最具影响力的国际学术会议之一,与ISCA、ASPLOS、HPCA并称为计算机体系结构领域“四大国际顶级会议”,属于中国计算机学会(CCF)推荐A类国际学术会议。本届会议共收到842篇投稿,共录用213篇论文,录用率约为25.3%。
(通讯员:陈瑶、祝新宇、赵文举)