独立基准测评:Subquadratic稀疏自注意力架构的效率与准确性验证
08/20/2026

Transformer注意力机制是当前大语言模型的核心计算组件,同时也是开销最高的性能瓶颈之一。在长上下文场景下,标准全量自注意力机制的计算成本随序列长度呈平方级增长。这一结构性限制使得超长上下文在绝大多数生产环境中难以落地。
Subquadratic公司提出了一种稀疏自注意力(Sparse Self-Attention, SSA)架构,用可学习的稀疏路由替代全量注意力计算,使计算成本随上下文长度线性增长而非平方级增长。
澳鹏以完全独立的第三方身份,对Subquadratic最新模型开展了系统性基准测评,覆盖效率、检索与代码智能三大维度,评估其在生产级上下文窗口下的真实表现。
注意力机制的二次方复杂度并非简单的常数因子问题。在100万token下,稠密注意力的理论计算量是128K的64倍。这意味着,在不修改Transformer架构的前提下,超长上下文对于大多数生产部署而言不具备可行性。
稀疏注意力架构在效率上的优势能否在实测中得到验证?效率提升是否以牺牲模型质量为代价?本次独立测评正是围绕这两个问题展开。
澳鹏全新发布独立基准测评报告《Subquadratic 模型性能与架构测评:由澳鹏执行的第三方独立基准测评》。报告基于四套基准测试,对Subquadratic最新模型的效率、长上下文检索质量及软件工程能力进行了全面评估,包含完整的墙钟耗时数据、浮点运算量验证、逐任务得分明细等。
本书核心内容
- 效率验证:线性扩展是否成立?澳鹏在NVIDIA B200硬件上对比测试了SSA与FlashAttention-2。在100万token下,SSA完成推理需381毫秒,FlashAttention-2需要21.4秒,端到端加速比为56.2倍。浮点运算量方面,SSA为144.9 TFLOP,稠密注意力为9,095.2 TFLOP,运算量降低62.8倍。通过PyTorch性能分析工具(torch.profiler)独立验证,实测值与理论值的误差在全部测试长度下仅为0.7%至3.9%,确认了SSA实际运算量与宣称数值一致。
- 长上下文检索质量:效率是否以准确性为代价?在128K的RULER基准(长上下文检索测评基准)测试中,模型在问答与词汇提取任务上的整体准确率为95.6%,全部单点隐藏信息检索任务均取得满分。多关键词检索的得分呈现业内文献普遍记载的衰减规律,这是所有模型架构共有的挑战。在100万token的MRCR基准(宽跨度上下文多点隐藏信息检索)8个隐藏信息最高难度档位上,模型得分为86.2%。
- 软件工程能力验证 SWE-Bench Verified基准(人工核验软件工程测评基准)使用来自开源Python仓库的真实GitHub问题工单,要求模型生成代码补丁并通过全部测试用例。开启深度思考模式后,模型解决了81.8%的真实GitHub问题,且补丁全部通过原有测试用例。这一结果使Subquadratic跻身SWE-Bench Verified第一性能梯队。
电子书《Subquadratic模型性能与架构测评:由澳鹏执行的第三方独立基准测评》
- 效率验证:墙钟延迟与浮点运算量的完整性能分析工具(profiler)数据
- 检索质量评估:RULER与MRCR基准的全任务得分明细
- 代码能力测试:SWE-Bench Verified问题解决率与配置详情
填写左边下方的表格立即下载报告

沪公网安备31011502401377号