开源工具 BootLoops 支持 AI 模型进行精确科学计算
哈佛大学物理学家 Matthew Schwartz 在 Anthropic 的客座文章中介绍了开源工具 BootLoops,这是一个用于精确科学计算的 harness。
哈佛大学物理学家 Matthew Schwartz 在 Anthropic 的客座文章中介绍了开源工具 BootLoops,这是一个用于精确科学计算的 harness。
MIT 工程师研发出由活体骨骼肌细胞驱动的超薄水下机器人,其左右鳍片由可响应 470 纳米蓝光的小鼠肌肉细胞薄层控制。该机器人在水槽中直线最高速度约为每分钟 4 倍机身长度,旋转速度最高约每分钟 1200 度,且优化后的肌肉薄膜功能维持时间超过 30 天。这项研究旨在解决传统生物混合机器人体积过大的问题,未来或可用于环境监测等任务。
Google 研究者提出了一种名为 RRSI 的方法,旨在防止自改进 AI 智能体在优化过程中记忆其测试任务。该方法通过在优化循环的两端施加约束来实现:限制每次提议的修改量,并使用一个严格的评判器来剔除那些硬编码任务名称或解决方案的修改。
本文探讨了语言模型中的‘逆转诅咒’现象,即模型在单向训练后无法回答反向事实问题。作者用仅 60 行 NumPy 代码构建的极简模型复现了该现象,其反向准确率为 0%,而正向为 100%。实验表明,问题根源在于训练目标仅更新‘主语’词的嵌入,导致‘宾语’词的嵌入从未被训练,从而无法支持反向推理。
Google Research 宣布推出基于可信执行环境的新一代联邦学习系统,首次为联邦学习提供了外部可验证的中心化差分隐私保证。该系统已应用于 Gboard 的英语和日语下一词预测模型,将原本需 1 至 2 个月的模型训练时间大幅缩短,训练瓶颈转为 TEE 资源可用性。核心 TEE 二进制文件和联邦语言框架已在 Apache 2.0 协议下开源。
研究团队开发的ChromAgeNet系统通过分析细胞核三维图像中的DNA空间组织,能以约77%的准确率区分年轻与衰老的小鼠造血干细胞。该系统关注染色质组织复杂度等过去难以量化的结构特征,并能检测表观遗传药物干预引发的结构变化。团队已公开模型与数据,该技术有望用于高通量药物筛选。
一项研究提出从 P-创造力、H-创造力、影响力和可行性四个维度量化评估 LLM 智能体在机器学习任务中的创造力。该方法采用 LLM-as-a-Judge(GPT-5)对解决方案的新颖性进行 0-4 分评分,并以 877-3,747 个 Kaggle 笔记本作为 H-创造力的比较基线。研究旨在分析不同智能体框架如何引导创造性搜索过程,以解释其性能差异。
MIT 吴佳虹教授的研究团队利用强化学习解决交通优化难题,其设计的算法将训练效率提升了最高30倍。该团队还将强化学习应用于生态驾驶优化,证明智能控制车速可减少11%至22%的车辆排放。这项研究展示了强化学习在解决具有实际重要性的交通政策问题上的潜力。
研究显示,在预训练中增强多语言语音模型的语言区分能力,能缩小其与单语模型在语音和词汇任务上的性能差距。在英语/法语 HuBERT 实验中,引入辅助语言分类器等方法后,phone-ABX 错误率从 11.6% 降至 10.4%(单语基线 10.8%),sWUGGY 词汇任务得分从 52.1% 提升至 56.7%(单语 58.5%)。结果表明,语言区分能力对降低多语言学习的额外成本具有因果作用。
Apple 的研究表明,在离散扩散模型中,基于逐位置置信度排序的采样方法无法匹配存在依赖关系的 token 联合分布。在合成任务 ScanAndAdd 上,该方法生成的分布与真实分布的总变差距离是采样噪声底限的 29 倍。研究揭示了逐位置分布与联合分布之间的根本差异。
MetaRubric 通过证据感知的策略优化与响应引导的量规适应交替进行,解决了基于量规的强化学习中的“空洞奖励”问题。该方法要求响应包含足够证据才能获得相应量规标准的分数,并在 PubMedQA 上比静态评判的 GRPO 准确率提升了 6.00 至 20.40 个百分点。
递归自重写(RSR)框架使用 Qwen-3.8-27B 通过多样化的任务轨迹生成更丰富的训练数据,三类任务轨迹联合解决了 759 个终端任务,比最强单轨迹提升 34.3%。
12 个 LLM 智能体在三个领域任务中均表现出对特定来源的显著偏好,即使来源较差的项目仍因来源偏好被选中约三分之二时间;隐藏来源信息可削弱偏好,而将项目重标为偏好来源可提升其被选中率;通过补全缺失信息或使用反偏见提示可有效降低来源偏好。
Skill2Real 提出一种基于智能体的策略框架,通过共享 API 学习可执行技能,利用 Proposer-Verifier-Governor 循环在仿真中诊断与验证更新,保持技能与公共观测及 API 语义一致。
推荐理由:该研究提出通过共享 API 实现零样本仿真到现实的机器人操作技能迁移,验证了框架在真实场景中的有效性。
DeepEvidence 作为新型深度研究智能体,突破传统知识检索,实现科学证据的显式表征与综合。该模型支持跨文献的证据链构建与推理,提升生物医学发现中的信息整合能力。目前未公开开源或API,尚处于研究阶段。
研究发现,在同等时间预算和前沿大语言模型骨干下,复杂的多智能体编排系统相比一个具备读写和bash原语的最小化编码智能体基线,在公开排行榜上并未展现出优势。大规模系统消融实验表明,在编码智能体场景中,复杂的“缰绳”层变得冗余。这表明,围绕强大模型精心设计手工“缰绳”的努力,在当前机器学习工程基准测试中回报甚微。
Hugging Face 推出 SciUtopia,一个基于大语言模型的闭环模拟框架,用于研究学术研究生态系统的动态演化过程。该框架模拟了超过 40,000 名研究人员、8,000 家机构的长期科研行为,生成约 40 万篇论文决策和 120 万条 LLM 生成的同行评审意见。
Ego2Act 是一个用于评估目标导向操作能力的基准,包含 110 个日常任务的 2,640 条视频,要求模型根据初始场景图像和高层目标生成第一视角的手部操作视频。Ego2ActJudge 作为无参考评估流程,比相关基线更贴近人类共识,发现模型常跳过或部分执行步骤,导致目标未达成,并在复杂物体操作和持久世界建模中表现不佳。该基准旨在推动视频模型向物理合理、目标导向的模拟方向发展。
661.6M 参数模型在工具调用任务中得分0.660,而1,109M参数模型(经6B token工具微调)得分0.650,但前者在训练样本上可正确生成工具调用。
微软研究院开发了一套端到端机器学习系统,可为美国本土 66,935 座变电站提供提前 30 至 60 分钟的位置特定空间天气风险预测。该系统结合太阳风观测、AE/Dst 指数预报、地质电导率与电网数据,在 2020-2026 年评估期内对重大事件的检测率达到 76.5%。
Google DeepMind 发布 SynthID Bio,一种用于合成生物学的生物水印技术,可在不损害蛋白质生物功能的前提下,将不可见水印嵌入蛋白质序列与三维结构中。
推荐理由:原文给出了水印技术在生物序列和结构上的实现方式与实验验证结果,读者可据此评估其在生物安全中的实际应用潜力。
自监督预训练使深度学习模型更高效解析复杂中微子探测事件,提升分类、重建精度与数据利用率。该方法可跨不同中微子探测技术实现模型迁移,显著增强多类型探测器的通用分析能力。
该综述首次系统梳理了视频生成模型的后训练与对齐方法,将现有策略分为监督微调、自训练与知识蒸馏、基于偏好与奖励的方法及推理时方法四类。研究指出,视频生成对齐面临时序误差累积、运动-外观耦合等独特挑战,需依赖非重新训练的后训练框架实现可控性提升。当前评估依赖MMLU、SWE-bench等基准,但长时一致性与安全生成仍是开放难题。
Honeycomb 采用 HexMemory 架构,以六维空间与时空平面实现固定大小的场景记忆表示,支持长时视频生成中的持续一致性。该模型通过前馈写入器仅处理新生成片段,结合置信度加权融合与可学习残差修正,保持特征存储量恒定。在 WorldScore 和 RealEstate10K 上验证,生成质量高且重访一致性强,代码已开源。
Hugging Face 发布 SciSlopBench,通过结构、论点和成果六个维度评估 AI 生成论文中的“科学冗余”现象,准确率达 85.9%。该基准包含 390 篇 AI 生成论文及对应的人类撰写论文,发现科学冗余与 ICLR 评分下降及论文被拒相关。研究提出 SciSlopHarness 框架,无需人工参考即可减少 AI 与人类论文间的差距达 63%。
MIT 研究人员指出,算法单一化(algorithmic monoculture)在招聘等场景中未必如部分学者担忧的那样负面,其影响取决于具体细节和算法准确性。他们通过数学证明,算法单一化可能形成信息回音室,限制候选人的多样性,但通过将多个算法整合为“集成系统”可缓解这一问题。研究还提到,算法单一化可能提升候选人的议价能力,甚至促使求职者优化简历以适应系统。
本文提出 Triadic Linear Attention,通过将键、第二个键和值的三元外积写入三维张量状态,从而提升长上下文序列建模能力。该方法在保持参数效率的同时,使状态规模增加 E 倍,仅需添加两个投影。
MemFold 通过策略优化学习紧凑型软内存,用于长上下文个性化任务。该方法将查询条件下的文本记忆压缩为 K 个连续向量,作为读者的内存接口,并在任务结果的组相对奖励和置信度门控的策略蒸馏信号下进行训练。
研究发现预训练 Transformer 模型在上下文引用任务中仅使用少量深度层,13个基础模型平均只能追踪1.4-3.6行引用。通过在早期层添加rank-8 LoRA微调,Qwen3-8B模型在24行引用链任务中的准确率从15.5%提升至99%。该方法还改善了MuSiQue任务表现,代码和交互演示已开源。
推荐理由:研究发现预训练 Transformer 模型在上下文引用任务中存在早期停止思考现象,并提出了一种简单的 LoRA 微调解决方案。
研究发现,On-Policy 后训练范式的泛化优势源于其参数更新方向,并据此提出了 On-Policy 方向约束的监督微调方法 OPSFT。OPSFT 将 SFT 的更新约束在 On-Policy 范式识别出的方向上,从而将后者的强泛化能力转移给 SFT。该方法结合了 On-Policy 的泛化优势与 SFT 的高训练效率及利用高质量轨迹的能力。
MIT 研究人员借助 AI 算法优化了包裹 mRNA 疫苗的脂质纳米颗粒配方,使其耐热性显著提升。新配方疫苗可在室温下稳定储存长达一年,或在 37 摄氏度下储存两个月,并在小鼠体内引发了与 Moderna 类似疫苗同样强的免疫反应。该 AI 算法能基于小数据集进行预测,将配方筛选所需的实验次数和开发时间大幅减少。
神经网络在多任务学习中,尤其在容量受限条件下,自发组织为专用功能模块,其结构与大脑网络高度相似。增量式多任务学习进一步强化了这种模块化特征。该发现为理解人工神经网络与生物脑的共性提供了新视角。
研究团队提出名为 GenFocal 的生成式 AI 框架,用于气候降尺度分析,可从粗粒度预测生成精细尺度的逼真天气数据,改进对复合极端事件(如热浪和热带气旋)的区域风险评估。
一种向量化模拟器和结构化奖励框架使微型机器人导航策略能在分钟级时间内完成训练,并可在不同机器人和环境中直接迁移,无需重新训练。该方法显著缩短了训练时间,提升了跨平台适应性。研究发表于 Nature Machine Intelligence,未明确说明是否开源或提供 API 接口。
PDE-JEPA 提出了一种基于预测性表征学习的参数化偏微分方程(PDE)动力学建模方法,通过掩码潜在预测训练编码器并引入几何投影器对齐潜在轨迹与物理场演化几何。该框架进一步开发了物理结构化的潜在预测器,将动力学分解为参数无关和参数相关的部分,在九个常用 PDE 基准测试中,其在分布内任务平均优于现有最先进方法 33.4%,在未见过的参数外推任务中平均提升 51.4%。项目页面已上线。
Llama3 与 Qwen2.5 在科学、医学和算术任务上进行强到弱知识蒸馏实验,发现 rollout policy 并非决定性因素,token-level KL 方向对性能与输出覆盖影响更显著。
PersonaDose 在 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 上实现渐进式人格特质控制,相比对比激活添加方法,核心特质表达提升 33.2、18.3 和 17.8 点,达到 75 的一致性基线。校准后设置在未见问题上仍保持表达优势,7 个训练特质的平均目标误差为 4.7–6.2 点,28 个目标中有 14–22 个可达到。
X-Tree 从数据中自动提取可复用技能的层次结构,作为训练基础,无需 LLM 调用。在 WebArena、ScienceWorld 和 WebShop 上,该方法在相同数据与预算下,相较标准训练方案提升最高 4.5% 成功率(WebArena)、5.8%(ScienceWorld)和 4.1%(WebShop)。
研究者推出 OpenTumorBoard 基准,包含 611 个患者案例和 19,157 次讨论记录,评估大模型在两种医疗场景下的表现。14 个前沿模型测试显示,最佳模型在临床等效性上仅获 3.43/5 分。该基准将公开发布以支持个性化癌症决策的模型开发。
Vercel 基于 skills.sh 注册表数据发布《智能体技能现状》报告。该注册表在七个月内收录了 100 万个智能体技能,记录了近 2.8 亿次安装。报告分析了技能供需:供应侧以软件工程(约25%)等技术类为主,需求侧则更分散,软件工程(18%)、智能体工作流(15%)、业务运营与写作(各约11%)领先。
推荐理由:报告基于 skills.sh 注册表数据,揭示了技能供需分布、热门类别及生态增长模式,为理解智能体技能市场早期形态提供了量化视角。