近日,ACM SIGOPS Annual Technical Conference 2026(ATC 2026)会议录用结果揭晓,实验室2023级博士生刘东旭(导师郑龙教授)、2024级博士生曹文彪(导师吴松教授)、明皓(导师华强胜教授)、2025级博士生仇泽宇(导师李钦宾教授)、2026级博士生贾竟一(导师李钦宾教授)的多篇论文被ACM SIGOPS Annual Technical Conference 2026(ATC 2026)会议录用。
刘东旭论文题目为“BMV: Breaking Monolithic Verification for Fast Speculative LLM Inference”。为加快大模型生成文本的速度,投机解码先由轻量模型草拟多个候选,再由目标模型并行验证。但在整体验证中,所有候选都需经过目标模型的全部层,即使某个分支最终被舍弃,也已付出了完整的计算和缓存代价。候选规模越大,这类无效开销越突出,单纯增加候选并不一定能让生成更快。针对这一问题,研究团队提出分阶段验证系统 BMV,将候选筛选提前到目标模型的计算过程中。系统利用中间层信息逐步剪除低置信度分支,让保留分支复用已有计算状态,继续完成后续验证,避免重复执行已计算的模型层。通过共享前缀状态与 KV 缓存,并结合负载反馈和异步调度,BMV 进一步减少重复存储与阶段间等待。中间层判断只决定哪些候选继续计算,最终输出仍由目标模型精确验证,保持其输出分布不变。研究团队在三种模型上开展对话、翻译、数学推理等六类任务测试,参数规模覆盖80亿至700亿。在单张 H200 显卡上,BMV 的推理速度最高达到自回归解码的5.80倍;在700亿参数模型上,较 EAGLE-3 平均提速31%。
曹文彪的论文题目为“IgniteServe: Accelerating LLM Serving Engine Cold Starts via Fine-Grained Parallelization”。弹性是“模型即服务”平台经济性的核心,后端服务能力必须随需求动态伸缩,因此,冷启动效率直接影响平台的弹性扩展能力。现代LLM引擎将编译、CUDA图捕获等稳态优化纳入启动路径。这些昂贵且状态相关的任务通常仍按粗粒度串行方式执行,使冷启动从单纯的模型加载问题转变为围绕异构优化状态的关键路径编排问题。论文提出IgniteServe,其核心洞察是,大量启动串行关系源于实现顺序,而非真实依赖。因此,IgniteServe将初始化建模为状态感知执行图,并将阶段屏障拆分为跨阶段和阶段内的可调度单元,从而实现松耦合任务的重叠执行、子图级编译的并行与复用,以及CUDA图的按需物化。基于真实LLM工作负载的综合评估表明,IgniteServe在保持稳态推理效率的同时显著缩短了冷启动延迟。与基线vLLM以及先进方案ServerlessLLM和Medusa相比,IgniteServe在不同节点状态下将平均启动延迟降低了40.1%–69.3%,同时保持了与vLLM相当的启动后推理性能。
明皓的论文题目为“HybridFaaS: Efficient GPU Serverless via Hybrid Autoscaling”。无服务器计算凭借自动扩缩容与按需计费,为机器学习推理服务提供了灵活的部署方式。然而,现有GPU无服务器系统大多沿用面向CPU的副本扩缩容机制,随着模型规模增长,该扩缩容机制带来的显存压力会导致模型数据频繁地在GPU显存和主存之间换入换出,限制了GPU资源利用率与服务性能。为此,研究人员提出了基于混合自动扩缩容的推理系统HybridFaaS。该系统融合基于副本、流水线并行与张量并行的三种扩缩容方式,根据负载变化、硬件资源及服务时延约束动态调整配置,在减少显存占用的同时兼顾吞吐量与响应速度。随后,为解决混合扩缩容模式下模型放置的搜索空间庞大的问题,系统基于流水线整体性能受最慢阶段制约的特点,优先将处理能力相近的可用 GPU 组合在一起,缩小模型放置的搜索空间,从而能够通过动态规划高效确定并行配置与放置方案。同时,该系统结合负载感知的请求路由与设备级调度,以缓解多模型共享 GPU 时的资源竞争。该系统基于Knative实现,并利用Azure真实负载轨迹,在涵盖语言模型、混合专家模型及视觉模型的场景下进行评测。结果表明,相较于代表性基线系统,HybridFaaS的吞吐量提升74%~97%,P99 尾延迟降至基线的约1/147至1/99,GPU使用成本降低22%~37%。
仇泽宇的论文题目为“Cloudless Tomorrow: A Memory-Centric System for Self-Improving Device-Cloud LLM Agents”。大模型智能体正越来越多地部署在设备端与云端,端侧执行延迟低、对网络依赖小,而云端执行则能为困难的工作流状态提供更强的推理能力。现有的端云协同机制主要基于路由或蒸馏,但路由方法会反复卸载相似的困难状态,却无法提升后续的端侧执行能力;蒸馏方法则需要代价高昂的模型适配。论文提出 WorkflowPage,一个以智能体记忆为中心的系统,它将云端回退转化为可复用的端侧能力。WorkflowPage 既不对每个查询请求进行路由,也不对云侧模型进行蒸馏,而是将云侧模型生成的执行经验以结构化工作流页面的形式迁移到端侧设备上。每个页面将共享同一执行前缀的相关后继状态组织在一起,并将其绑定到可复用的技能上,从而在有限的端侧智能体记忆预算下实现软状态寻址、缺页恢复、拓扑感知预取以及基于效用的淘汰。通过将智能体经验作为页式结构化记忆而非扁平的提示上下文来管理,WorkflowPage 使设备能够逐步吸收云端的任务求解经验,降低对云端的依赖和延迟。
贾竟一的论文题目为“Make Graphs Great Again: Rethinking LLM Agent Architecture via Structure–Semantic Separation”。现有大模型智能体通常采用模型中心的执行方式,每次工具调用或环境交互后重新调用大模型决定后续操作,使大量可重复、可验证的执行过程持续依赖模型推理。针对这一问题,论文提出 Structure–Semantic Separation(结构—语义分离)的智能体架构,将智能体执行划分为三类操作:由大模型结合完整上下文控制的语义性操作、可由运行时证据直接验证和执行的结构性操作,以及仅处理局部不确定性的半结构性操作。通过区分不同操作的模型推理需求,智能体可以将确定性的执行过程交由运行时直接推进,而将大模型能力集中用于需要语义判断的环节。基于这一思想,设计了 MotifAgent,将可复用的工具调用结构编译为可执行的 motif skill,并进一步将运行时结构信息传至模型服务系统,用于结构感知的请求调度和细粒度 KV Cache 管理,实现 Agent Runtime 与 LLM Serving 的协同优化。在 APIBank、TauBench 和 AppWorld 等任务上的实验表明,MotifAgent 在保持任务效果的同时,大模型调用次数最高减少 27%、Token 消耗最高减少 36%,并改善高负载场景下的模型服务效率。
ATC是计算机系统领域的国际顶级学术会议,也是中国计算机学会(CCF)推荐的A类会议。2026年ATC的投稿量为973篇,最终接收了135篇(录用率为13.87%)。
(通讯员:刘东旭、曹文彪、明皓、仇泽宇、贾竟一)