开源科研计算框架 BootLoops 发布,辅助大模型进行精确科学计算
哈佛大学物理学家 Matthew Schwartz 开源了科学计算框架 BootLoops,用于辅助 Claude 等大语言模型执行跨学科的精确计算。团队在三个月内利用该框架跨 18 个领域产出了 36 篇论文初稿,成功求解生态学中 20 年未解的理论方程并分析了 57 亿个基因突变对。Schwartz 指出大模型易误判任务难度且暴力计算倾向明显,研究仍需人类专家严格核查与设定方向。
哈佛大学物理学家 Matthew Schwartz 开源了科学计算框架 BootLoops,用于辅助 Claude 等大语言模型执行跨学科的精确计算。团队在三个月内利用该框架跨 18 个领域产出了 36 篇论文初稿,成功求解生态学中 20 年未解的理论方程并分析了 57 亿个基因突变对。Schwartz 指出大模型易误判任务难度且暴力计算倾向明显,研究仍需人类专家严格核查与设定方向。
GitHub 建议开发者重点提升指挥 AI 智能体、审查模型输出以及专注复杂决策三项核心技能。随着代码编写逐步由 AI 承担,开发者的职责正转向定义任务上下文、协调多智能体协作并把关交付质量。开发者还可借助第二模型(如 GitHub Copilot 的 Rubber Duck 智能体)交叉复核输出,并将精力投入架构权衡与深层技术决策。
NVIDIA 推出开源表格基础模型 Kumo Tabular,支持在无需特征工程与微调的情况下通过单次前向传播完成分类与回归预测。该模型参数量在 28M 至 215M 之间,完全基于因果图生成的合成数据预训练,在 TabArena 等四个表格基准测试中均位居榜首。模型权重与代码库已通过 Hugging Face 和 GitHub 开放,采用 OpenMDW-1.1 许可证允许商用。
推荐理由:模型展示了用上下文学习替代传统表格特征工程与调参的可行路径,对探索结构化数据基础模型的团队很有参考价值。
GitHub 介绍了在 Copilot app 中利用 canvases 构建自定义交互界面的方法。用户无需编写代码或手动设计布局,在 Agent 会话中输入 /create-canvas 技能并用自然语言描述工作流需求,即可生成看板、发布清单或仪表板等右侧面板。
GitHub 团队发文指出单一的对话框界面限制了用户与大语言模型的协作效率,并提出通过 GitHub Copilot 应用内的 Canvas 功能构建定制化交互界面。
GitHub Security Lab 发布并开源了面向 C/C++ 项目的自主模糊测试管道 Fuzzing Taskflow,可通过 LLM 智能体全流程自动完成入口识别、测试桩编写、执行与漏洞排查。
推荐理由:该工具把模糊测试的测试桩编写、覆盖率反馈与崩溃分类解构成由 MCP 工具配合的智能体循环,为代码安全自动化提供了可参考的端到端方案。
微软研究团队在《Nature》发表小分子逆合成预测框架 RetroChimera 并开源代码与权重,该模型可自动化推荐高质量化学合成路线。系统结合了基于 Transformer 的生成模型 R-SMILES 2 与基于图神经网络的模板模型 NeuralLoc,通过学习重排序机制融合两者的互补优势。
推荐理由:通过结合生成模型与图神经网络模板的互补优势,该方法为解决复杂小分子逆合成中的长尾反应预测提供了可复现的集成路径。
GitHub 在最新播客中梳理并回应了 AI 开发中的五个核心争议,指出开发者仍须对生成的代码负责、Skills 与 MCP 是互补协作而非替代关系,且 RAG 仍是注入外部上下文的关键架构。
GitHub 工程团队借助 Copilot CLI 与 Copilot 应用的多智能体协同,由单名核心开发者在数月内将 Copilot agent 运行时从 TypeScript 彻底重写为超 80 万行生产级 Rust 代码。
推荐理由:文章完整公开了单人驱动多智能体舰队重写数十万行核心运行时的协作机制与防退化方案,为大规模智能体工程实践提供了参考路径。
GitHub 市场运营团队展示了如何结合 GitHub Copilot、Actions 与 Issue 表单实现“Marketing ops as code”,完成活动筹备、物料生成、报名名单筛选及会后 CRM 上传的全流程自动化。
推荐理由:文章拆解了将运营手册沉淀为 Markdown 规程并由 Copilot 执行的方案,为非纯研发团队落地智能体工作流提供了可复用的工程化模板。
扩展后的内核搜索框架 K-Search 引入结构化 CUDA 到 MLX 转译层,能将成熟的 GPU 内核优化经验自动迁移至 Apple Silicon。该系统由 Gemini 3.5 Pro Preview 执行优化推理并生成代码,在真实硬件上闭环迭代。
针对大语言模型中潜在交互随规模呈指数增长的分析瓶颈,研究人员提出了 SPEX 与 ProxySPEX 交互归因算法。SPEX 基于信号处理与编码理论将交互搜索转化为稀疏恢复问题,在上下文扩展至数千特征时仍能保持高保真度。ProxySPEX 则进一步利用层级结构特性,以减少约 10x 消融计算量的代价实现了与 SPEX 相当的表现。
Berkeley AI Research 在 NeurIPS 2025 提出一种基于互信息评估与优化成像硬件设计的框架。该方法结合噪声物理模型直接从测量数据估计信息量,在彩色摄影、射电天文学、无透镜成像与显微镜四大领域准确预测下游任务性能。其优化设计在无需特定任务解码器的情况下达到 SOTA 端到端方法水平,且降低了计算与显存开销。