跳到正文
今天10月5日周一2 条
10月4日周日
  1. The Decoder43

    NASA 与 IBM 开源月球基础模型,将 17 年轨道器数据转化为月球科学基础

    NASA 与 IBM Research 联合发布了开源的 NASA-IBM 月球基础模型,该模型基于 17 年月球勘测轨道飞行器(LRO)等任务提供的近 200 万个图块数据训练而成。在预测月球极地冰沉积物任务中,该模型将预测误差降低了高达 22%;在粗尺度陨石坑检测任务中,性能也提升了近 19%。该模型旨在帮助科学家更便捷地利用海量观测数据,并可通过少量标注样本适应特定任务。

  2. cnBeta39

    ChromAgeNet:AI通过DNA三维结构破解细胞衰老密码

    研究团队开发的ChromAgeNet系统通过分析细胞核三维图像中的DNA空间组织,能以约77%的准确率区分年轻与衰老的小鼠造血干细胞。该系统关注染色质组织复杂度等过去难以量化的结构特征,并能检测表观遗传药物干预引发的结构变化。团队已公开模型与数据,该技术有望用于高通量药物筛选。

10月1日周四
9月29日周二
  1. Hugging Face · 每日论文55

    研究发现 Transformer 过早停止思考,小规模 LoRA 可修复此问题

    研究发现预训练 Transformer 模型在上下文引用任务中仅使用少量深度层,13个基础模型平均只能追踪1.4-3.6行引用。通过在早期层添加rank-8 LoRA微调,Qwen3-8B模型在24行引用链任务中的准确率从15.5%提升至99%。该方法还改善了MuSiQue任务表现,代码和交互演示已开源。

    推荐理由:研究发现预训练 Transformer 模型在上下文引用任务中存在早期停止思考现象,并提出了一种简单的 LoRA 微调解决方案。

9月24日周四
  1. NVIDIA Blog57

    NVIDIA 联合 Google DeepMind 等机构开源 2800 多种病毒的蛋白复合物结构预测数据集

    NVIDIA 联合 Google DeepMind、EMBL-EBI 等全球研究机构,在 AlphaFold 数据库中开源了超过 2800 种病毒的蛋白复合物 3D 结构预测数据集。

    推荐理由:原文提供了数据集规模、生成方法和开放访问细节,读者可以了解 AI 如何加速病毒蛋白结构预测以应对未来疫情。

9月23日周三
  1. Alignment Forum33

    WorkspaceBench:评估激活到文本工具对模型全局工作区的解读能力

    WorkspaceBench 是一个用于评估激活到文本工具能否准确读取模型“全局工作区”内容的基准,包含 3,356 道题覆盖 27 个评估类别,重点测试模型中间变量的解读能力与幻觉控制。该基准专为 Qwen-3.6-27B 开发,预计适用于更大模型,但可能需要调整以适配较小或较弱模型。基准旨在识别具备多 token 解码能力的 J-lens 工具,已开源。

9月22日周二
  1. IEEE Spectrum · AI67

    Paper2Agent:将科研论文转化为可交互AI智能体的开源工具

    Paper2Agent是一个开源框架,可将学术论文及其代码、数据自动转化为可交互的AI智能体。该系统在无人工干预下,45分钟内生成22个可验证的分析工具,并通过测试代理确保功能正确。

    推荐理由:原文展示了将科研论文自动转化为可交互AI智能体的完整流程,读者可直接复用该方法提升研究可复现性。

9月21日周一
  1. Microsoft Research43

    Microsoft Research 在 Nature 发表逆合成模型 RetroChimera 并开源

    Microsoft Research 在《自然》期刊发表并开源了逆合成模型 RetroChimera。该模型通过集成 Transformer 架构的 R-SMILES 2 与基于图神经网络的 NeuralLoc,并采用学习排序策略,其提出的反应步骤在盲测中获得了博士级化学家的偏好。开源 RetroChimera 旨在帮助研究人员加速新药和先进材料的开发。

9月1日周二
  1. Microsoft Research39

    GigaPath-Flash 与 GigaTIME-Flash:高效病理学基础模型迈向群体规模发现

    Microsoft Research 推出高效病理学基础模型 GigaPath-Flash 和 GigaTIME-Flash,显著降低了计算需求。GigaPath-Flash 参数量为 2200 万,在保持性能的同时将推理成本降至原 GigaPath 的约 1/50。这两个基于 Apache 2.0 协议开源的研究模型旨在支持大规模病理数据分析,推动群体规模的疾病生物学研究。

8月13日周四
  1. The Register · AI/ML37

    OpenWALDO 项目旨在打破专有 AI 训练模型的壁垒

    OpenWALDO 项目由 Gregory Kurtzer 发起,目标是创建一个任何人都可贡献的开源 AI 训练数据集,提升训练数据的透明度。该项目强调当前开源权重模型仍依赖封闭源训练数据,存在潜在风险与资源浪费问题。目前 OpenWALDO 数据集包含 167.3B 个参考 token,但尚未有模型基于此数据集进行训练。

7月31日周五
  1. Amazon Science34

    How controllers from industrial machinery can coordinate multitask machine learning 的中文标题

    Amazon Science 提出 ControlG 框架,借鉴工业控制系统中的 PID 控制器,用于协调图自监督学习中的多任务训练,避免梯度冲突。该方法通过在不同训练阶段分配计算资源给不同目标,提升了节点聚类任务的性能,随机调度在部分基准上优于 AutoSSL、WAS 等方法。ControlG 通过感知、规划和控制三个循环实现动态资源分配,基于帕累托效率理论优化多目标训练过程。

7月29日周三
  1. Together AI63

    Together AI 开源 ThunderAgent,实现 2 倍吞吐的智能体推理系统

    Together AI 开源了智能体推理系统 ThunderAgent,通过将工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。在 8 节点 H100 集群上,相比 SGLang Gateway 实现了 2.39 倍的加速和接近线性的吞吐扩展。该系统与 OpenAI 兼容,只需在客户端添加 `program_id` 字段即可集成现有推理后端。

    推荐理由:开源系统通过将智能体工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。

7月10日周五
  1. Vector Institute67

    AI科学家实现科研全周期自动化

    Vector Institute与Sakana AI、UBC、牛津大学合作发布AI科学家系统,可自主完成从选题到投稿的完整科研流程。该系统v2版本无需人类代码模板,能自动生成实验代码并迭代优化。

    推荐理由:原文揭示了AI系统在科研全流程中的自主能力突破,为评估AI生成论文质量提供了可量化的基准方法。

6月24日周三
4月15日周三
4月13日周一
  1. Together AI57

    Together AI 发布多智能体协作平台 EinsteinArena

    Together AI 发布 EinsteinArena,这是一个供 AI 智能体在开放数学问题上协作、讨论和竞争的平台。该平台已帮助智能体在 11 维 Kissing Number 问题上取得新下界(604),超越了 AlphaEvolve 的 593,并已在多个其他问题上获得 11 项新的 SOTA 结果。平台提供公开排行榜、讨论线程和实时验证 API,旨在研究智能体在真实环境中的协作行为。

    推荐理由:原文展示了平台如何通过多智能体协作解决具体数学难题,读者可以了解其运作机制和已取得的实际成果。

3月17日周二
  1. Together AI61

    Together AI 发布 Mamba-3 状态空间模型

    Together AI 联合多所大学的研究人员发布了 Mamba-3,这是一个以推理效率为主要目标的新状态空间模型。Mamba-3 通过更复杂的循环公式、复数值状态跟踪和 MIMO 变体提升了性能,其 SISO 版本在 1.5B 规模上,所有序列长度的预填充+解码延迟均优于 Mamba-2、Gated DeltaNet 和 Llama-3.2-1B。

    推荐理由:Mamba-3 将设计目标从训练效率转向推理效率,并开源了内核,为关注部署性能的开发者提供了新的架构选择。

3月13日周五
  1. Berkeley AI Research32

    Berkeley AI Research 提出 SPEX 与 ProxySPEX:大规模识别 LLM 中的交互作用

    Berkeley AI Research 提出了 SPEX 和 ProxySPEX 算法,用于大规模识别驱动大语言模型决策的关键交互作用。SPEX 利用稀疏性和低阶性将搜索问题转化为可解的稀疏恢复问题,而 ProxySPEX 则利用层次结构特性,能以约 10 倍更少的消融操作达到与 SPEX 相当的性能。这些框架能高效应用于特征归因、数据归因和模型组件归因,提升模型的可解释性。