从 CUDA 到 MLX:K-Search 如何将内核优化经验引入 Apple Silicon
扩展后的内核搜索框架 K-Search 引入结构化 CUDA 到 MLX 转译层,能将成熟的 GPU 内核优化经验自动迁移至 Apple Silicon。该系统由 Gemini 3.5 Pro Preview 执行优化推理并生成代码,在真实硬件上闭环迭代。
扩展后的内核搜索框架 K-Search 引入结构化 CUDA 到 MLX 转译层,能将成熟的 GPU 内核优化经验自动迁移至 Apple Silicon。该系统由 Gemini 3.5 Pro Preview 执行优化推理并生成代码,在真实硬件上闭环迭代。
针对大语言模型中潜在交互随规模呈指数增长的分析瓶颈,研究人员提出了 SPEX 与 ProxySPEX 交互归因算法。SPEX 基于信号处理与编码理论将交互搜索转化为稀疏恢复问题,在上下文扩展至数千特征时仍能保持高保真度。ProxySPEX 则进一步利用层级结构特性,以减少约 10x 消融计算量的代价实现了与 SPEX 相当的表现。
Berkeley AI Research 在 NeurIPS 2025 提出一种基于互信息评估与优化成像硬件设计的框架。该方法结合噪声物理模型直接从测量数据估计信息量,在彩色摄影、射电天文学、无透镜成像与显微镜四大领域准确预测下游任务性能。其优化设计在无需特定任务解码器的情况下达到 SOTA 端到端方法水平,且降低了计算与显存开销。