2026-09-30 开源技术热点新闻资讯

今日开源技术热点新闻资讯

:robot: 日期:2026 年 09 月 30 日

:writing_hand: 核心总览:
今日最值得关注的是@banach-space 发起 RFC 讨论是否移除 vector.transfer_read/write 的 in_bounds 属性、改由 masking 处理边界。

与此同时TileLang 合并 PR #3308,新增华为昇腾 950 NPU 原生后端。

另一条重要进展是RISE 的 riscv-runner 合并 PR #119,构建 amd64、arm64、riscv64 三架构 kube-proxy 与 pause 镜像并发布到 GHCR。


一、PyTorch 生态核心动态

内容摘要:
PyTorch 提交 AI 草稿 PR #199087 修复 #197416:torch.compile 下输入突变写回未按用户流屏障排序。AOTAutograd 把输入突变改为 epilogue copy_,该写回排在用户 join 之后,而 CUDA 流等待只覆盖已提交工作,导致调用方读到陈旧输入。修复让屏障携带完整输入位置并由 AOT 描述符合并,写回匹配屏障并置于其前,无法安全重排时显式报错。

内容摘要:
PR #184052 让 aot_export_joint_simple 复用 export 的 CompositeImplicitAutograd 分解表,使后端 AOT 图与 export 保留的功能性 CIA 算子保持一致;覆盖仅限推理追踪(trace_joint=False),联合图保留原始分解保证梯度;并修复 _override_composite_implicit_decomp 退出误删全局规则的问题,修复 #160388。

内容摘要:
MTIA 的 bf16 scan(如 cumsum)此前未像 reduction 那样无条件提升到 fp32 累加,每步按 bf16 舍入,导致所有测试形状对 CPU 参考精度失败且明显慢于 fp32 核。该 PR 让 scan 复用 reduction 的 fp32 提升与末尾窄化,并用 low_precision_fp 统一去重判定,精度与性能问题均解决,fp32 结果不变。

内容摘要:
PyTorch 弹性分布式训练中,大规模并发 rendezvous 状态更新会反复触发 CAS 冲突,执行器重试时无退避,导致后端负载升高、重启进度延迟。该 PR 在 sync() 报告写入失败后加入 0—0.3 秒随机退避,同步点与状态机结构保持不变,以降低冲突压力。


二、LLVM/MLIR 最新进展

内容摘要:
@banach-space 发起 RFC 讨论是否移除 vector.transfer_read/write 的 in_bounds 属性、改由 masking 处理边界。实测发现:25 个树内目标中仅 8 个支持 masked load/store,其余 17 个(AMDGPU/Wasm/SPIR-V 等)退化为逐 lane 分支展开;NEON 上 masked_load 由 7 条指令膨胀到 25 条、7 个分支,SVE 因谓词支持仍为 7 条 0 分支。结论是反对优先移除而非反对移除。

内容摘要:
Victor 提出 RFC 重构 MLIR 多结果 op 折叠 API:引入 OpFoldResults 实现部分折叠,每结果一槽带 in-place 位,替代现行要求全折叠或全空的签名;按 FoldAdaptor 迁移,计划通知后 4 周翻转默认、再 2 周删除旧 API,mehdi_amini 建议用 MLIR_EXPENSIVE_CHECK 检测。

内容摘要:
flang 拟为 fir::LoopVersioning 增加第二个判据:数组段运行时长度等于声明长度时(如 a(1:n) 于 a(N))生成 trip count 为常量 N 的守卫副本。SPEC 527.cam4_r 中此类段有 708 处,内层循环每次调用进入 2052 次,零填充退化为 2052 次小 memset;原型实测总采样下降 5.7%。

内容摘要:
LLDB 的 TypeSystemClang 因强依赖 Clang 而脆弱低效,该 RFC 拟以不依赖 Clang 的新类型系统替换,同时保留 Clang 表达式求值器。新回复提出生成式 DWARF 支持诉求:LLDB 会忽略类型上附带的表达式(如读取 length 字段),而 GDB 正常;LLDB 还默认把 8 位整数按字符格式化,不论其 DWARF 类型是否为 Char。

内容摘要:
RISC-V 后端修复固定长度 VECTOR_DEINTERLEAVE 早期拆分:LMUL=8 触发 stack+vlseg 时保留原始操作数整体连续 spill,再按合法尺寸分块发出 vlseg,避免 extract/concat 开销,修复 #222938;可伸缩向量仍走递归拆分。改 RISCVISelLowering.cpp (+139) 及测试。

内容摘要:
BRay 是基于 BOLT 插桩的实验性追踪方案,在后链接阶段向 ELF 可执行文件与共享库的函数入口、正常返回及尾调用前注入探针,无需源码或特定编译选项,可作为 LLVM XRay 的后链接补充。最新回复认可思路,但质疑其运行时开销偏大,追问作者是否尝试过降开销手段。

内容摘要:
BOLT 社区讨论为无符号表/无静态重定位的 AArch64 与 x86-64 ELF 二进制添加可选的重定位恢复模式,配套实现见 PR #221991。最新回复质疑:该模式面向第三方已 strip 的二进制,若其中含 split function 是否会导致 BOLT 处理失败,需明确保证机制。

内容摘要:
LLVM InstCombine 新增折叠规则:当 C 为非零常量时,把 llvm.usub.sat(X, C) 结果与原左操作数 X 的比较(含交换后的相等形式)直接化简。该变换不要求 intrinsic 单次使用,若结果另有用途则仅规范化比较、保留原 intrinsic,配套 Alive2 证明。修复 #213832。

内容摘要:
为 Zvzip 扩展新增 vpaire.vv/vpairo.vv 成对混洗代价建模,并新建 RISCVVectorUtils.h 共享混洗掩码辅助函数;同时把 isPairEven/isPairOdd 迁入该文件供 TTI 复用,使 TTI 代价与实际 ISel lowering 保持一致,提升 RISC-V 向量化决策准确性。

内容摘要:
AMDGPU 的 PromoteAllocaToVector 此前不向量化同一 alloca 的 gep 经 phi/select 合并的情况,本 PR 让这类 phi/select 也提升为向量:PtrToVectorIndex(原 GepToVectorIndex)新增 Base 字段保存 alloca 及其派生 gep 的 phi/select,calculateVectorIndex 递归 Base 追踪操作数 alloca;跨 getUnderlyingObject 的 phi 循环仍未覆盖,另加 3 个测试并移除旧测试中已提升用例。


三、Triton & TileLang 技术动态

内容摘要:
TileLang 合并 PR #3308,新增华为昇腾 950 NPU 原生后端。该后端提供端到端编译与执行链路:Ascend 方言、硬件相关 lowering、自动调度与同步插入、设备代码生成、Bisheng 编译及 NPU 运行时集成。用户设 target=“ascend” 即可在 TileLang 中编写并运行昇腾 950 高性能 kernel。

内容摘要:
Triton 将 enable_reflect_ftz 默认值改为 False,修复 NVIDIA libdevice 默认把 FP32 次正规输入刷零的问题——此前 tl.sqrt 对正次正规数返回 0、tl.rsqrt 返回无穷。保留 True 作按内核选择刷新的选项,同时改变其他 libdevice 操作的默认行为,并补充 sqrt/rsqrt/exp2 的数值与 PTX 回归测试。

内容摘要:
AMD matmul 原先对所有 HIP 目标默认套用八路 XCD program-ID swizzle,但 RDNA 无该拓扑,置换反而打乱分组瓦片顺序、降低缓存局部性。PR 改为 RDNA3/RDNA4 用单一调度域、CDNA 保持八路,并把 XCD 数一致传入 block-size 启发式。R9700(gfx1201)+ROCm 7.2 的 BF16 GEMM 上,XCD_SWIZZLE 由 8 改 1 后四次形状中位耗时聚合降低约 11%。

内容摘要:
NVIDIA 后端将 arith.remf 降级到 libdevice 的 __nv_fmodf/__nv_fmod,替代此前经 LLVM 内联展开的实现——该实现因 FMA 会把余数 0 的 -0.0 算成 +0.0、丢失符号。新路径支持 NaN/inf/denormal 并保留符号,另增 lit 用例验证。

内容摘要:
Triton 重新落地 #11854:Hopper 及更新架构改用 CUDA 13 ptxas,sm_90 以下仍用旧汇编器,保留 get_ptxas 接口与 ptxas_blackwell 开关。此前被 #11915 回退,本次通过 pre-commit 与 CPU 冒烟测试(覆盖汇编器选择、版本上报、PTX 版本推断与覆盖、后端哈希),但未跑 GPU 实测。

内容摘要:
Triton PR #11805 为 tcgen05.mma 加入填充布局支持,逻辑张量可仅覆盖部分 tile。改动含 TMEM 的 ensureLayoutNotLarger/SmallerThan、泛化 toLinearLayout 与 getReps、支持 MMAv5 填充操作数并收紧 verifier,同时将 Gluon MMAv5 标记为异步。


四、AI 业界重磅新闻

内容摘要:
OpenAI 发布 GPT-6.1 Sol,定位为面向编程、计算机操作与专业工作的「接近 Astra 级」智能,标准 API 输入与输出 token 价格均为 Astra 的五分之一。该模型是 OpenAI 在 9 月 29 日 DevDay 2026 上公布的发布内容之一,主打以更低成本提供接近旗舰的编码与代理能力。

内容摘要:
OpenAI 汇总 2026 年 DevDay 的 20 余项发布,涵盖 GPT-6 Astra、GPT-6.1 Sol、ChatGPT、Codex、API、安全能力及面向开发者的一系列新工具。本次大会重点是把前沿模型能力下沉到开发者工具链,围绕编码、代理与平台 API 展开。

内容摘要:
NVIDIA 发布 TensorRT Model Connect,一个基于 TensorRT 的 C++ 开源模型参考实现集合,以编码代理为核心设计:把 AI 产出当作可验证模块单元、按模型族隔离改动、优先可横向并行的工作,并用可复现 CI 与对抗式验证兜底。截至 2026-07-29 发布,已覆盖 128 个模型族并在 GB300 上测试。

内容摘要:
Gamow Labs 发布 LabBench 基准(2026-09-28):20 个真实湿实验室留出任务,用 20–22 条二元标准比对实验室真实决策,评测智能体能否选对下一步实验。五款前沿智能体平均仅过约两成标准,GPT-6 Astra 与 Claude Opus 5.5 均约 40.8%/40.5%,但 Astra 每题中位 5 分钟、Opus 35 分钟。406 条标准中 182 条无任一智能体通过,需选择或排序的仅 21%,实验设计最佳仅 9%,13 条优先级标准全零通过,说明智能体能解读证据却难做决策。

内容摘要:
NVIDIA 发布 VSS Blueprint 3.3,新增 Build Vision Agent 技能(vss-build-vision-ai)与自适应高效视频采样(EVS)。前者可从单条提示组合多工作流部署,约 30 分钟在双 GPU RTX PRO 6000 Blackwell 上生成可预览实时系统,Kafka/Redis/Elasticsearch 收敛为单实例;后者按帧裁剪未变化视觉 patch 并按活动批次处理 VLM,使告警上下文延迟降 17%、并发实时 VLM 流增 46%,60 分钟视频摘要时间减半、VLM 输入 token 减 80%。

1 个赞