今日开源技术热点新闻资讯
日期:2026 年 09 月 21 日
核心总览:
今日最值得关注的是 MLIR Vector 方言对 transfer_read/transfer_write 索引符号语义的讨论,社区正征询是否应明确要求索引非负并由 verifier 强制。
与此同时,Triton 新增 lowering pass,将非 warp 的 local gather 降为不可变 local_alloc 加 local_gather,替换原有的 emitGatherInShared 路径。
另一条重要进展是欧洲芯片公司 Openchip 不到两年即完成 BER10 流片,这款面向高性能计算的 64 位 RISC-V 应用处理器支持 Linux,集成向量单元与一致性互连,首次流片便成功启动。
一、PyTorch 生态核心动态
内容摘要:
PyTorch PR #196150 在 compile_on_one_rank 下为张量设备索引引入 rank 相对守卫。原 TENSOR_MATCH 守卫分开记录设备类型与索引,使编译产物被钉死在单一 rank;现改为当前加速器张量用相对索引,设备类型与非当前索引仍精确匹配,Dynamo 遇到非当前加速器输入在 wrap_to_fake_tensor_and_record 直接拒绝。
内容摘要:
PyTorch 的 Dynamo 在 make_fx 前特化 tensor 设备元数据,会把当前加速器索引固化成 guard 或 FX 常量,导致 compile_on_one_rank 下产物按 rank 分裂。该 PR 引入 coor::current_device_index SymInt:fake 实现保持索引 unbacked,guard 校验运行时当前设备,x.device 保留静态加速器类型并在运行时解析索引,torch.device(d) 走恒等路径,索引算子指定 CPU lowering,从而实现设备索引的可移植透传。
内容摘要:
Aventine Labs 提交 PyTorch Core RFC-0036,提出可选的零运行时分配、64 字节缓存对齐 C++20 扁平 arena 内存模式,用于投机解码候选 token 验证与 ExecuTorch 边缘推理,称指针追逐与非对齐结构会导致 CPU 停顿、GPU 空转等待。基准在 x86-64 上 10 亿次操作耗时 0.649 秒(约 15.4 亿 ops/s),堆增量仅 23 KB,现征求 Inductor 与 ExecuTorch 维护者反馈。
二、LLVM/MLIR 最新进展
内容摘要:
MLIR Vector 方言未明确 transfer_read/transfer_write 索引的符号语义。PR #224843 将 generateInBoundsCheck 的 cmpi sgt 改为 cmpi ugt,借补码回绕把负索引判为越界。发帖人质疑该行为依赖隐式假设而非文档语义,征询是否应明确规定索引非负、是否由 verifier/规范化器强制,以及是否推广到其他取索引算子。
内容摘要:
LLVM 现有 cl:: CLI 库有两缺陷:隐式引入依赖库选项、全局状态无法并行运行只能靠进程级并行。新 RFC 提出 constexpr OptionInfo 描述符加 option registry 重写,解析结果存入 option context,附 TableGen 生成器,支持插件动态与运行时注册,目标是逐步迁移后移除旧库。
内容摘要:
LLVM 提出 RFC:改用 TableGen 按库声明命令行选项,每库生成一个 struct,替代 cl::opt 全局变量。原方案 1749 个 cl::opt 启动时构造注册、占用 .bss 产生重定位,且进程级共享导致同进程多 LLVMContext 无法独立配置。新方案复用 llvm/Option 的 TableGen 表示(每选项 24 字节、零动态重定位),以 LLVMContext/MCContext 作注册表,解析仍由 cl 负责,工具行为不变。
内容摘要:
LLVM InstCombine 新增折叠:当 C 为非零常量时,将 llvm.usub.sat(X,C) 结果与其左操作数 X 的比较直接化简,含交换等式形式。该折叠不要求内建函数单次使用,结果被其他指令引用时仅规范化比较而保留内建调用,并用 Alive2 证明等价,修复 #213832。
内容摘要:
修复 MLIR DLTI 合并嵌套数据布局的断言崩溃:原按 TypeID 分组使 i32/i64 等参数化内建类型落入同一 IntegerType 桶,combineOneSpec() 误判为内建方言中断。现显式处理索引、整数、浮点条目,仅在具体类型键匹配时校验兼容性,保留 ABI 对齐嵌套规则并要求 index 位宽一致,同时规避 ABI 对齐为零的除零。
内容摘要:
ClangIR 八月进展报告:自七月新增 2177 次提交,其中 73 次改动 clang/lib/CIR。libcxx 通过率提升 8.3 个百分点至 88.7%,自举率提升 2.7 个百分点至 99.3%。作者补充了 top-issues.md 复现片段,并附上八月简化测试用例。
内容摘要:
llvm-cov 的 gcov 子命令改用 OptTable 解析选项,以支持分组短选项并移除最后一个 cl::Grouping 使用者。迁移后长选项仅接受双横线形式,-gcno、-gcda= 改为 --gcno、–gcda=;–help 只列 gcov 自身选项,未知选项或缺源文件统一报 llvm-cov gcov: error:。
内容摘要:
LLVM AMDGPU 后端在 TargetParser 新增 getLDSEncodingGranule 接口,用专项 feature 建模 LDS 编码粒度,支持按字节查询 GPUKind/subarch,并将程序资源寄存器与 PAL metadata 编码迁移到该接口,移除 AMDGPUBaseInfo 旧函数,修正 RDNA 2 自 GFX10.3 起的占用率 LDS 粒度错误。
三、Triton & TileLang 技术动态
内容摘要:
Triton 新增 lowering pass:非 warp 的 local gather 降为不可变 local_alloc + local_gather,替换 emitGatherInShared。NVIDIA 流水线中置于 reduce_data_duplication 与 reorder_instructions 之间,local_alloc 可提出循环并被 CSE 去重;AMD 只跑 CSE 不提升,Gluon 直接改写,跨 CTA gather 由崩溃改为报错。
内容摘要:
AMD 后端新增 NONE/ALIGN/RANGE 原生张量特化模式:HIP 不再对每个张量参数回调 Python 算 S 位,改经稳定 Torch C ABI 原生计算 D/S,子类才回退 Python;S 反映真实存储上限 INT32_MAX。MI300X 单参数特化 1256.6ns 降至 484.1ns,8 参数端到端启动 25.4us 降至 18.8us。
内容摘要:
TileLang 升级 3rdparty/tvm 以延迟实例化 Z3 求解器:bind 与约束先记入日志,首次真正需要时才建求解器并按序重放,语义不变。原先每次降级创建约 6.7 万个 Z3 求解器、十万次断言,仅约 0.3% 的 analyzer 会回退到 Z3,却占编译耗时四成以上。17 个归约核测试端到端提速 40—60%,tilelang.lower 普遍减半。
内容摘要:
Triton 的 AMD(HIP) 后端此前只对库文件名做哈希,外部库内容变化却文件名不变时无法使编译缓存失效,导致陈旧缓存被误用。该 PR 在 HIPOptions.hash() 中引入外部库内容的 SHA-256 摘要,对齐 NVIDIA 后端已有的内容哈希做法,并补充了相应测试。
内容摘要:
Triton AMD 后端 membar 过滤器原对 async load 与 local_load 间屏障一律否决,方向不敏感。该 PR 改为方向感知:RAW 方向继续否决,因 token 已证明拷贝被等待;WAR 方向不再否决,避免其他线程仍在读取时回填落地。实现利用 Membar 的 op1/op2 顺序,仅在 local_load 为 op2 时否决。
内容摘要:
Triton AMD(gfx950) 为 Gluon 的 gl.amd.cdna3.mfma 和 gl.amd.cdna4.mfma_scaled 新增可选 cd_regclass 参数:“a” 将 MFMA 累加器 C/D 保留在 AGPR,“v” 保留在 VGPR,并在 tt.dot/tt.dot_scaled 记为 amdg.cd_regclass。MFMA lowering 在每 tile 首末 MFMA 前后以空内联汇编加 “=a,0”/“=v,0” 绑定,使 kernel 可按调用粒度控制 MFMA 形式,无需进程级 LLVM 选项。
内容摘要:
TileLang 新增 PassConfig 开关 tl.enable_fp32x2_reduction:SM100+ 上 FP32 sum 与绝对值和归约默认启用打包 FP32x2 累加,#2637 引入后改变累加顺序,此前 #3057 仅支持逐归约 opt-out。该全局开关默认开启,关闭后对 CUDA FP32 这两类归约改用标量累加,优先级高于 enable_fadd2,max/min 归约不受影响;已补文档、代码生成与正确性测试,100 项 CUDA 测试通过。
四、AI 业界重磅新闻
内容摘要:
Linux 7.3-rc4 发布,本周期补丁以 AI/LLM 发现的错误路径清理为主,Linus 称无重大隐患。合并内容含 x86/x86_64 关键修复、XPad 驱动新增多款游戏手柄支持、Btrfs 两个显著 bug,以及一个自 2023 年起存在的静默用户态数据丢失 bug 修复。7.3 正式版预计 10 月发布。
内容摘要:
谷歌AI与经济研究项目新增经济学家:2025诺贝尔经济学奖得主Philippe Aghion任学术顾问,Ajay Agrawal任访问学者,Anu Madgavkar与Daniel Rock任项目总监,聚焦全球AI扩散、劳动力市场变化与企业生产率,将用实时数据支撑ATLAS更新与政策研究。
内容摘要:
Starling 0.5 发布,这款基于 Swift 自研 Wayland 合成器、大量借助 Claude Code 开发的 Linux 桌面新增可选 3D 模式:可步入的 3D 海滨城市场景,应用仍是真实窗口,支持 Alt+Tab 与栏位预览,每个显示器拥有独立场景与相机。该版本还通过 WSL2 + RDP 支持 Windows。