来源:https://docs.pytorch.org/assets/pytorch2-2.pdf
论文名:PyTorch 2: Faster Machine Learning Through Dynamic
Python Bytecode Transformation and Graph Compilation

启发

这种顶会级成果有这么大的影响力,核心在于真实工程约束为目标,系统性整合编译原理、程序分析、编程语言、体系结构、自动调优等多个领域的学术思想,将学术界提出的单点创新(如动态图捕获、算子融合、符号执行、等价性证明、多后端代码生成)转化为一套兼顾通用性、兼容性、性能与正确性的可落地全栈方案。这种 “以问题为中心、跨领域吸收、工程化整合、系统化验证” 的路径,正是工业级高质量研究最关键的范式:不追求单一技巧的新奇,而是用成熟思想解决真实痛点,用严谨工程补齐学术短板,最终做出稳定、通用、可大规模使用的系统级成果。这也为我未来职业发展指明方向,一定要做真正有价值/有影响力的工作.

一、一段话简要总结

PyTorch 2通过TorchDynamo(Python字节码动态改写的JIT前端)与TorchInductor(默认编译后端)实现torch.compile核心能力,在保留PyTorch动态易用性的同时,于NVIDIA A100上实现推理2.27×、训练1.41×几何平均加速,图捕获覆盖率达93%–100%,远超TorchScript等传统方案,兼顾Python灵活性与编译优化性能。


二、思维导图

## **核心组件**
- TorchDynamo:Python字节码JIT、FX图提取、守护机制、图中断
- TorchInductor:循环级IR、算子分解、调度融合、Triton/C++代码生成
## **核心技术**
- 动态字节码改写
- 符号形状与守护
- 内核融合与自动调优
- CUDA Graphs
## **对比方案**
- torch.jit.trace/script
- Lazy Tensors
- torch.fx.symbolic_trace
- ONNX、JAX
## **实验结果**
- 图捕获:93%–100%模型可用
- 性能:推理2.27×、训练1.41×
- 开销:Dynamo<5%,远低于Lazy Tensors
## **优化来源**
- 内核融合(最大贡献)
- 矩阵乘模板
- 参数冻结
- 循环重排

三、详细总结

1. 研究背景与问题

PyTorch为动态命令式(Eager)框架,易用易调试,但难以做跨算子图优化;原有图捕获方案(TorchScript、Lazy Tensors等)存在不健全、覆盖率低、开销大问题,无法兼顾灵活性与性能。

2. 核心方案:两大组件

(1)TorchDynamo(前端)
  • 基于PEP 523帧评估API动态改写Python字节码,无损兼容原生Python语法
  • 提取PyTorch算子为FX图,支持图中断与混合执行,失败优雅回退
  • 用**守护(Guard)**保证编译缓存安全,支持动态形状符号推理
  • 图捕获覆盖率:TorchBench93%、HuggingFace100%、TIMM100%
  • 运行时开销:推理**<5%、训练1%**,远低于Lazy Tensors
(2)TorchInductor(后端)
  • 采用Python优先、逐定义运行的循环级IR,易扩展
  • 支持191种算子分解433种算子下沉,输出GPU为Triton、CPU为C++/OpenMP
  • 调度阶段做算子融合,减少内存访问,是性能提升核心
  • 支持CUDA Graphs降低启动开销,max-autotune自动选最优配置

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

3. 原有方案缺陷对比

方案 核心问题
torch.jit.trace 无法捕获控制流,结果不正确
torch.jit.script 仅支持Python子集,覆盖率≈50%
Lazy Tensors 开销极高(训练+90%),延迟大
torch.fx.symbolic_trace 不健全,丢失副作用

4. 实验结果

  • 测试集:TorchBench(80)、HuggingFace(46)、TIMM(62),共**180+**模型
  • 性能(A100):推理2.27×、训练1.41×几何平均加速
  • 模型兼容性:TorchInductor在三大测试集100%模型可用,优于nvFuser、NNC、TVM等6种后端
  • CPU(Intel Xeon 8275CL):推理1.39×、训练1.35×加速

5. 性能增益来源(消融实验)

按贡献从大到小:

  1. 内核融合+内联(无则降至0.80×)
  2. 矩阵乘模板
  3. 循环/布局重排
  4. 参数冻结(推理)
  5. 模式匹配
  6. CUDA Graphs

6. 结论

PyTorch 2以动态字节码转换+图编译实现Eager模式下的高效优化,保留Python灵活性同时大幅提升性能,成为PyTorch编译体系的标准方案。


四、关键问题与答案

问题1:TorchDynamo相比传统PyTorch图捕获方案的核心优势是什么?

答案:核心优势是兼容完整Python语义、低开销、高覆盖率。它通过动态改写Python字节码实现图提取,不限制Python特性;运行时开销<5%;在真实模型上覆盖率达93%–100%,支持图中断优雅降级,远优于TorchScript(≈50%)、Lazy Tensors(高开销)等方案。

问题2:TorchInductor的性能提升主要来自哪些优化?其中最关键的是哪项?

答案:主要优化包括内核融合/内联、矩阵乘模板、循环重排、参数冻结、CUDA Graphs等。最关键的是内核融合与内联,该优化减少内存读写,消融实验显示去掉后性能从1.91×降至0.80×,是加速的核心来源。

问题3:PyTorch 2在动态形状支持上采用了什么设计思路?

答案:采用符号形状+守护的方案,不捕获条件分支,而是选择一条路径并添加守护保证复用安全;通过元函数推导张量形状,支持0/1特化简化符号计算;对数据依赖的未知形状做图中断,在动态性与编译效率间取得平衡。

五、引用论文分析:

[1] TensorFlow: A system for large-scale machine learning (OSDI 2016)

会议级别:OSDI (USENIX Symposium on Operating Systems Design and Implementation) → CCF A 类顶会,系统领域四大顶会(SOSP/OSDI/NSDI/EuroSys)之一,系统领域顶级中的顶级,录用率常年低于 20%。
影响力:
深度学习框架领域的里程碑式论文,首次提出工业级大规模分布式深度学习系统架构,直接奠定了 TensorFlow 的行业地位。
被引超 2.5 万 +,是 AI 系统领域引用量最高的论文之一,定义了深度学习框架的核心设计范式(计算图、分布式训练、算子抽象)。
对 PyTorch 2.0 的核心影响:TorchDynamo/TorchInductor 的设计,本质上是对 TensorFlow 静态图 + PyTorch 动态图的融合,这篇是静态图框架的源头。

[2] TensorFlow, Large-scale machine learning on heterogeneous systems (Zenodo 2015)

载体级别:Zenodo 预印本 / 技术报告,非顶会顶刊,是 TensorFlow 的早期技术白皮书。
影响力:
是 [1] 的前置技术报告,首次公开 TensorFlow 的核心设计,是 AI 框架领域的经典技术文档,被引超 1.2 万 +。
仅作为补充引用,核心学术价值由 [1] 承载。

[3] Improving subclassing Tensor by propagating subclass instances (PyTorch RFC 2020)

载体级别:PyTorch 官方 RFC(Request for Comments),非学术会议 / 期刊,是 PyTorch 社区的技术提案文档。
影响力:
PyTorch 核心特性的设计文档,解决了 Tensor 子类在框架内的传播问题,是 PyTorch 动态图灵活性的底层支撑。
对 TorchDynamo 的直接影响:TorchDynamo 需要正确处理 Tensor 子类的字节码,这篇是核心设计依据。

[4] TensorFlow Eager: A Multi-Stage, Python-Embedded DSL for Machine Learning (arXiv 2019)

载体级别:arXiv 预印本,未发表顶会顶刊(后续无顶会顶刊版本)。
影响力:
TensorFlow Eager Execution(动态图模式)的核心技术论文,首次提出 “动态图 + 静态图编译” 的混合执行范式,是 PyTorch 2.0 torch.compile 核心思路的直接对标。
被引超 1000+,是动态图编译领域的重要参考,证明了 “动态 Python 前端 + 静态编译后端” 路线的可行性。

[5] Theano: A Python framework for fast computation of mathematical expressions (arXiv 2016)

载体级别:arXiv 预印本,未发表顶会顶刊(Theano 是早期深度学习框架,无顶会顶刊论文)。
影响力:
深度学习框架的开山鼻祖之一,首次提出 “符号计算 + 自动微分 + GPU 加速” 的框架设计,是 TensorFlow、PyTorch 的技术源头。
被引超 1.5 万 +,是深度学习框架领域的奠基性论文,影响了后续所有框架的设计。
对 PyTorch 2.0 的影响:Theano 的符号编译思想,是 TorchInductor 算子编译的底层灵感来源。

[6] Opentuner: an extensible framework for program autotuning (PACT 2014)

会议级别:PACT (International Conference on Parallel Architectures and Compilation) → CCF B 类会议,并行架构与编译领域的重要会议。
影响力:
程序自动调优领域的经典论文,提出了可扩展的自动调优框架,是编译器自动优化的核心工具。
被引超 1500+,对 TorchInductor 的算子自动调优、核函数生成有直接技术参考价值。

[7] Tiramisu: a polyhedral compiler for expressing fast and portable code (CGO 2019)

会议级别:CGO (International Symposium on Code Generation and Optimization) → CCF B 类会议,代码生成与优化领域的核心会议。
影响力:
多面体编译(Polyhedral Compilation)领域的经典论文,提出了面向深度学习的多面体编译器架构,是算子融合、循环优化的核心技术。
被引超 500+,是 TorchInductor 算子融合、循环调度优化的重要技术参考,多面体编译是深度学习编译器的核心技术路线之一。

[8] JAX: composable transformations of Python+NumPy programs (GitHub 2018)

载体级别:GitHub 技术文档 / 预印本,非顶会顶刊,是 JAX 框架的官方技术说明。
影响力:
JAX 框架的核心设计文档,首次提出 “可组合变换(jit/grad/vmap)+ XLA 编译” 的架构,是 PyTorch 2.0 torch.compile 的直接对标竞品。
被引超 3000+,是深度学习编译领域的核心参考,证明了 “Python 前端 + XLA 编译后端” 路线的成功,对 TorchInductor 的设计有重要启发。

[9] PEP 523: adding a frame evaluation API to CPython (Python Enhancement Proposal 2016)

载体级别:Python 官方 PEP(Python Enhancement Proposal),非学术会议 / 期刊,是 CPython 的核心语言特性提案。
影响力:
CPython 字节码执行的核心 API 提案,为 TorchDynamo 的字节码动态修改、图捕获提供了底层技术支撑。
是 TorchDynamo 能实现 “零侵入式字节码捕获” 的关键,没有 PEP 523,TorchDynamo 的设计就无法实现。

[10] Jack Cao. 2022. PyTorch/XLA 2022 Q4 dev update

载体级别:PyTorch 开发者社区技术更新帖(非学术会议 / 期刊)
影响力:PyTorch/XLA 后端的工程进展文档,是 torch.compile 对标 XLA 路线的工程参考,属于工业界技术跟踪资料,无学术顶会属性。

[11] Learning to optimize tensor programs (NeurIPS 2018)

会议级别:NeurIPS (Neural Information Processing Systems) → CCF A 类顶会,AI 领域三大顶会之一,录用率约 20%
影响力:
深度学习编译器领域里程碑式论文(TVM 核心前身工作),首次提出「用机器学习自动优化张量程序」的范式,是深度学习编译从手工优化走向自动优化的转折点。
被引超 6000+,是 TorchInductor 算子自动调优、TVM 等编译器的核心技术源头,对 PyTorch 2.0 编译后端设计有直接启发。

[12] TVM: an automated End-to-End optimizing compiler for deep learning (OSDI 2018)

会议级别:OSDI (USENIX Symposium on Operating Systems Design and Implementation) → CCF A 类顶会,系统领域四大顶会之一,录用率 < 20%
影响力:
深度学习编译器领域标杆性顶会论文,首次提出端到端深度学习编译器栈,奠定了 TVM 行业地位,是 PyTorch 2.0 torch.compile 最核心的对标竞品之一。
被引超 1.2 万 +,定义了深度学习编译器「前端 IR→优化→代码生成」的标准架构,直接影响了 TorchInductor 的设计。

[13] cuDNN: efficient primitives for deep learning (arXiv 2014)

载体级别:arXiv 预印本(无顶会顶刊发表)
影响力:
NVIDIA cuDNN 库的技术白皮书,深度学习 GPU 加速的奠基性工程文档,是所有深度学习框架 GPU 算子的底层依赖。
被引超 1.5 万 +,是 PyTorch 算子加速、TorchInductor 核函数生成的核心参考基准。
[14] TorchBench: a collection of open source benchmarks for PyTorch performance (GitHub 2020)
载体级别:PyTorch 官方开源基准项目(非学术会议 / 期刊)
影响力:
PyTorch 官方性能基准套件,就是你之前分析的实验所用的测试集,是 torch.compile 性能验证的核心工具,工业界影响力极强,是 PyTorch 性能优化的标准测试基准。

[15] OpenMP: an industry standard API for shared-memory programming (Computational Science & Engineering 1998)

期刊级别:Computational Science & Engineering → 计算机工程领域知名期刊(CCF B 类)
影响力:
OpenMP 并行编程标准的创始性论文,共享内存并行编程的行业标准,是 TorchInductor CPU 算子并行优化、多线程调度的底层技术依据,被引超 2 万 +,是并行计算领域的经典奠基文献。

[16] ONNX Runtime developers. 2021. ONNX runtime

载体级别:ONNX Runtime 官方技术文档(非学术会议 / 期刊)
影响力:ONNX 推理优化引擎的官方说明,是 torch.compile 推理后端的对标竞品,工业界部署场景的核心参考。

[17] Zachary DeVito et al. 2018. TorchScript

载体级别:PyTorch 官方技术文档(非学术会议 / 期刊)
影响力:PyTorch 静态图表示的核心技术文档,是 TorchDynamo 图捕获的前身技术,是 PyTorch 从动态图走向编译优化的关键过渡,工业界影响力极强。

[18] Hidet: task-mapping programming paradigm for deep learning tensor programs (ASPLOS 2023)

会议级别:ASPLOS (Architectural Support for Programming Languages and Operating Systems) → CCF A 类顶会,体系结构 / 编译 / 系统领域顶级会议,录用率 < 20%
影响力:
新一代深度学习编译器 Hidet 的顶会论文,提出了任务映射的张量程序编程范式,是 TorchInductor 的直接竞品,代表了深度学习编译领域的前沿方向,被引快速增长中。
与本论文(ASPLOS 2024)同属一个顶会,是同领域的最新研究成果。

[19] TensorIR: an abstraction for automatic tensorized program optimization (arXiv 2022)

载体级别:arXiv 预印本(后续发表于顶会)
影响力:
TVM 新一代张量 IR 的核心技术论文,是深度学习编译器 IR 设计的前沿成果,为 TorchInductor 的 IR 设计提供了重要参考,是张量程序自动优化领域的重要文献。

[20] Getting started with CUDA graphs (NVIDIA 技术博客 2019)

载体级别:NVIDIA 官方技术博客(非学术会议 / 期刊)
影响力:CUDA Graph 技术的官方说明,是 PyTorch CUDA 流、TorchInductor GPU 核函数调度的核心技术依据,工业界 GPU 优化的必备参考。

[21] Array programming with NumPy (Nature 2020)

期刊级别:Nature → 国际顶级综合期刊(影响因子 64.8)
影响力:
NumPy 的权威综述论文,Python 科学计算的核心基础,是 PyTorch 张量设计、TorchDynamo 字节码处理的底层依赖,被引超 1 万 +,是科学计算领域的里程碑式论文。

[22] The state of machine learning frameworks in 2019 (The Gradient 2019)

载体级别:技术媒体综述文章(非学术会议 / 期刊)
影响力:深度学习框架领域的行业综述,梳理了 2019 年 PyTorch/TensorFlow 的格局,是 PyTorch 生态发展的历史参考。

[23] On machine learning and programming languages (JuliaLang 博客 2017)

载体级别:Julia 官方技术博客(非学术会议 / 期刊)
影响力:编程语言与机器学习结合的技术探讨,为 TorchDynamo 处理 Python 动态特性、设计编译前端提供了语言层面的参考。

[24] ISO/IEC 14882:1998: Programming languages — C++ (ISO 标准 1998)

载体级别:ISO 国际标准(非学术会议 / 期刊)
影响力:C++98 国际标准,PyTorch、TorchInductor 底层 C++ 实现的核心依据,是工业级编译器开发的标准规范。

[25] Caffe: Convolutional Architecture for Fast Feature Embedding (arXiv 2014)

载体级别:arXiv 预印本(无顶会顶刊发表)
影响力:
Caffe 深度学习框架的创始论文,深度学习框架领域的奠基性工作,是 PyTorch、TensorFlow 的技术前辈,被引超 1.5 万 +,是计算机视觉深度学习的里程碑。

[26] In-datacenter performance analysis of a tensor processing unit (ISCA 2017)

会议级别:ISCA (International Symposium on Computer Architecture) → CCF A 类顶会,计算机体系结构领域顶级会议,录用率 < 20%
影响力:
Google TPU 的开创性顶会论文,首次公开了 AI 专用加速器的架构设计,是深度学习硬件与编译器协同设计的核心参考,被引超 7000+,是体系结构领域的里程碑。

[27] MLIR: scaling compiler infrastructure for domain specific computation (CGO 2021)

会议级别:CGO (Code Generation and Optimization) → CCF B 类会议,代码生成与优化领域核心会议
影响力:
MLIR(Multi-Level Intermediate Representation)的创始论文,是现代编译器基础设施的核心标准,被 LLVM、PyTorch、TVM 等广泛采用。
TorchInductor 的 IR 设计、算子 lowering 深度依赖 MLIR,是 PyTorch 2.0 编译后端的核心技术基石,被引超 2000+,是编译器领域的里程碑。

[28] SymPy: symbolic computing in Python (PeerJ Computer Science 2017)

期刊级别:PeerJ Computer Science → 开源计算机科学期刊(CCF C 类)
影响力:
SymPy 符号计算库的核心论文,是 TorchDynamo 符号形状推理、TorchInductor 符号优化的底层依赖,为动态形状分析提供了符号计算工具,是 Python 科学计算的核心工具库。

[29] Jinja project (GitHub)

载体级别:开源项目文档(非学术会议 / 期刊)
影响力:Python 模板引擎 Jinja2 的官方项目,PyTorch 代码生成(如 TorchInductor 生成 CUDA/C++ 核函数)的核心工具,是工业级编译器代码生成的常用基础设施。

[30] CUDA Tools (NVIDIA 文档)

载体级别:NVIDIA 官方技术文档(非学术会议 / 期刊)
影响力:CUDA 开发工具链的官方说明,TorchInductor GPU 核函数编译、调试的底层依赖,是 PyTorch GPU 加速的核心工程依据。

[31] ONNX (官方文档)

载体级别:ONNX 官方技术文档(非学术会议 / 期刊)
影响力:开放神经网络交换格式的标准文档,torch.compile 推理后端的对标竞品,是深度学习模型跨框架部署的行业标准。

[32] PyTorch: an imperative, high-performance deep learning library (NeurIPS 2019)

会议级别:NeurIPS (CCF A 类顶会),AI 领域三大顶会之一
影响力:PyTorch 框架的里程碑式顶会论文,首次系统阐述了 PyTorch 动态图、 imperative 编程范式的设计,奠定了 PyTorch 在科研领域的统治地位,被引超 1.5 万 +,是本论文(PyTorch 2.0)的核心技术源头。

[33] Halide: a language and compiler for optimizing parallelism, locality, and recomputation in image processing pipelines (PLDI 2013)

会议级别:PLDI (Programming Language Design and Implementation, CCF A 类顶会),编程语言 / 编译领域顶级会议
影响力:Halide 编译器的创始论文,提出了「算法与调度分离」的编译范式,是深度学习编译器(包括 TorchInductor)算子调度、循环优化的核心技术源头,被引超 6000+,是编译领域的经典奠基文献。

[34] Torch.fx: practical programmable capture and transformation for deep learning in Python (ML Systems 2021)

会议级别:MLSys (Machine Learning and Systems, CCF B 类顶会),AI 系统领域核心会议
影响力:PyTorch FX 图捕获工具的核心论文,是 TorchDynamo 图捕获的直接技术前身,为 PyTorch 动态图转静态计算图提供了可编程接口,是 torch.compile 前端设计的核心依据,被引快速增长中。

[35] Papers with Code (综述博客)

载体级别:技术媒体综述文章(非学术会议 / 期刊)
影响力:AI 领域论文与代码开源的行业综述,反映了 PyTorch 生态的开源文化,是 torch.compile 开源落地的行业背景参考。

[36] nvFuser: a deep-learning compiler for pytorch (博客 2022)

载体级别:NVIDIA 官方技术博客(非学术会议 / 期刊)
影响力:nvFuser 编译器的官方说明,是 torch.compile GPU 后端的直接竞品,为 TorchInductor 的 GPU 算子融合提供了对标参考,是工业界 GPU 编译优化的重要成果。

[37] CNTK: microsoft’s open-source deep-learning toolkit (KDD 2016)

会议级别:KDD (Knowledge Discovery and Data Mining, CCF A 类顶会),数据挖掘领域顶级会议
影响力:微软 CNTK 深度学习框架的顶会论文,是早期深度学习框架的代表,为 PyTorch 等现代框架提供了设计参考,是深度学习框架发展史的重要文献。

[38] Tensor program optimization with probabilistic programs (arXiv 2022)

载体级别:arXiv 预印本(无顶会顶刊发表)
影响力:张量程序概率优化的探索性论文,为 TorchInductor 算子自动调优提供了前沿思路参考。

[39] LazyTensor: combining eager execution with domain-specific compilers (arXiv 2021)

载体级别:arXiv 预印本(无顶会顶刊发表)
影响力:PyTorch 早期「惰性执行 + 编译器」的探索工作,是 torch.compile 技术路线的内部预研成果,为 TorchDynamo/TorchInductor 的设计提供了直接经验。

[40] TorchDynamo Benchmarking Code (GitHub)

载体级别:PyTorch 官方开源基准代码(非学术会议 / 期刊)
影响力:TorchDynamo 性能测试的官方代码,就是本论文实验的核心工具,是 torch.compile 性能验证的工程依据。

[41] TorchInductor Performance Dashboard (PyTorch 博客)

载体级别:PyTorch 官方技术博客(非学术会议 / 期刊)
影响力:TorchInductor 性能监控的官方说明,是 torch.compile 性能优化的工程落地文档。

[42] PyTorch/XLA Team. 2023. PyTorch/XLA (GitHub)

载体级别:PyTorch 官方开源项目(非学术会议 / 期刊)
影响力:PyTorch XLA 编译后端的官方项目,是 torch.compile 的直接对标竞品,为 TorchInductor 的设计提供了 XLA 路线的参考。

[43] CUTLASS (NVIDIA GitHub)

载体级别:NVIDIA 开源项目文档(非学术会议 / 期刊)
影响力:CUDA 线性代数模板库,是 TorchInductor 生成高性能 GPU 核函数的核心依赖,是深度学习 GPU 算子优化的工业级标准工具。

[44] The IREE Authors. 2019. IREE (GitHub)

载体级别:Google 开源项目文档(非学术会议 / 期刊)
影响力:IREE 深度学习编译器的官方项目,是 torch.compile 的跨平台对标竞品,为 TorchInductor 的多后端设计提供了参考。

[45] XLA Team. 2017. XLA - Tensorflow, compiled (Google 博客)

载体级别:Google 官方技术博客(非学术会议 / 期刊)
影响力:XLA 编译器的创始说明,是深度学习静态图编译的核心技术源头,是 torch.compile 编译后端设计的核心对标,被引超 5000+。

[46] Triton: an intermediate language and compiler for neural network computations (MAPL 2019)

会议级别:MAPL (arXiv 预印本,后续发表于 CGO 等会议,CCF B 类)
影响力:OpenAI Triton 编译器的创始论文,提出了面向深度学习的 GPU 编程中间语言,是 TorchInductor 生成 GPU 核函数的核心技术参考,被引超 3000+,是现代 GPU 深度学习编译的里程碑。

[47] Chainer: A Deep Learning Framework for Accelerating the Research Cycle (CoRR 1998)

载体级别:arXiv 预印本(无顶会顶刊发表)
影响力:Chainer 深度学习框架的创始论文,是首个提出「动态图 + 自动微分」的框架,是 PyTorch 动态图设计的直接技术源头,被引超 3000+。

[48] Tensor comprehensions: framework-agnostic high-performance machine learning abstractions (arXiv 2018)

载体级别:arXiv 预印本(无顶会顶刊发表)
影响力:Tensor Comprehensions 编译器的核心论文,提出了自动生成高性能算子的编译技术,是 TorchInductor 算子融合、代码生成的重要参考。

[49] Attention is all you need (NeurIPS 2017)

会议级别:NeurIPS (CCF A 类顶会),AI 领域三大顶会之一
影响力:Transformer 架构的里程碑式顶会论文,彻底改变了 NLP 乃至整个深度学习领域,是现代大语言模型、PyTorch 编译优化的核心应用场景,被引超 10 万 +,是 AI 领域引用量最高的论文之一。

[50] A method for calculating corrected sums of squares and products (Technometrics 1962)

期刊级别:Technometrics(统计学期刊,非计算机顶刊)
影响力:统计计算领域的经典论文,是数值计算、编译器数值优化的早期理论基础。

[51] Unified tensorized instruction compilation and optimization (CGO 2021)

会议级别:CGO (Code Generation and Optimization, CCF B 类顶会),代码生成领域核心会议
影响力:张量指令编译优化的论文,为 TorchInductor 的张量 IR 设计、指令生成提供了技术参考。

[52] PyTorch image models (GitHub)

载体级别:开源项目文档(非学术会议 / 期刊)
影响力:timm 计算机视觉模型库的官方项目,是本论文 TIMM 基准测试的核心模型来源,是 PyTorch CV 生态的核心工具。

[53] Transformers: State-of-the-Art Natural Language Processing (ACL 2020)

会议级别:ACL (Association for Computational Linguistics, CCF A 类顶会),NLP 领域顶级会议
影响力:Transformer 技术的综述顶会论文,是现代 NLP 模型的核心总结,为 torch.compile 优化 NLP 模型提供了应用场景参考。

[54] Bolt: bridging the gap between auto-tuners and hardware-native performance (ML Systems 2022)

会议级别:MLSys (CCF B 类顶会),AI 系统领域核心会议
影响力:Bolt 编译器的论文,提出了自动调优与硬件原生性能结合的思路,为 TorchInductor 算子自动调优提供了参考。

[55] Transcending runtime-memory tradeoffs in checkpointing by being fusion aware (ML Systems 2023)

会议级别:MLSys (CCF B 类顶会)
影响力:深度学习训练 checkpoint 与算子融合结合的论文,为 TorchInductor 训练阶段的内存优化提供了技术参考。

[56] Dietcode: automatic optimization for dynamic tensor programs (ML Systems 2022)

会议级别:MLSys (CCF B 类顶会)
影响力:动态张量程序自动优化的论文,为 TorchDynamo 处理动态形状、动态控制流提供了技术参考。

[57] Ansor: generating high-performance tensor programs for deep learning (OSDI 2020)

会议级别:OSDI (CCF A 类顶会),系统领域四大顶会之一
影响力:Ansor 自动张量程序生成的顶会论文,是 TVM 编译器的核心优化技术,为 TorchInductor 算子自动调优、核函数生成提供了核心对标,被引超 2000+。

[58] AMOS: enabling automatic mapping for tensor computations on spatial accelerators with hardware abstraction (ISCA 2022)

会议级别:ISCA (International Symposium on Computer Architecture, CCF A 类顶会),体系结构领域顶级会议
影响力:AI 加速器自动映射的顶会论文,为 TorchInductor 多硬件后端(GPU/CPU/AI 加速器)的设计提供了体系结构层面的参考。

[59] Roller: fast and efficient tensor compilation for deep learning (OSDI 2022)

会议级别:OSDI (CCF A 类顶会)
影响力:Roller 张量编译器的顶会论文,提出了快速张量编译技术,是 TorchInductor 的直接竞品,代表了深度学习编译领域的前沿方向,被引快速增长中。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐