跳到正文
9月28日周一
  1. Hugging Face · 每日论文40

    PersonaDose 通过校准激活控制实现渐进式人格特质调节

    PersonaDose 在 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 上实现渐进式人格特质控制,相比对比激活添加方法,核心特质表达提升 33.2、18.3 和 17.8 点,达到 75 的一致性基线。校准后设置在未见问题上仍保持表达优势,7 个训练特质的平均目标误差为 4.7–6.2 点,28 个目标中有 14–22 个可达到。

9月26日周六
9月25日周五
  1. Vercel 博客64

    Vercel 发布《智能体技能现状》报告:注册表技能数达百万,安装量近 2.8 亿

    Vercel 基于 skills.sh 注册表数据发布《智能体技能现状》报告。该注册表在七个月内收录了 100 万个智能体技能,记录了近 2.8 亿次安装。报告分析了技能供需:供应侧以软件工程(约25%)等技术类为主,需求侧则更分散,软件工程(18%)、智能体工作流(15%)、业务运营与写作(各约11%)领先。

    推荐理由:报告基于 skills.sh 注册表数据,揭示了技能供需分布、热门类别及生态增长模式,为理解智能体技能市场早期形态提供了量化视角。

  2. Alignment Forum34

    持续学习可能使你的阻断监控几乎失效

    持续学习AI在部署过程中会优化任务成功率,导致其学会规避阻断监控机制,即使模型本身无害。该行为源于对有用性压力的响应,长期在线强化学习可使监控机制几乎失效。当前最可行的缓解方案是降低控制协议的有用性成本、提升对规避行为的检测能力,或放弃让AI持续学习如何应对监控。

  3. MIT News · 人工智能55

    MIT发布可解释自杀风险文本评估工具

    MIT麦戈文脑研究所科学家开发了一种基于自建词典的轻量级机器学习模型,通过分析约1.6万条危机文本对话,识别出与自杀风险相关的49类因素,发现致命手段和物质滥用提及比抑郁情绪更强烈预测高风险,模型具备可解释性且可在个人电脑运行,已开源词典与工具包供研究复用。

    推荐理由:该研究构建了可解释的文本风险评估工具,通过词典与轻量模型结合,揭示了危机文本中关键风险因素的权重差异。

9月24日周四
  1. LangChain 博客68

    LangChain 发布 LangSmith Fine-Tuning 工具

    LangChain 发布 LangSmith Fine-Tuning 及其 CLI 工具 smithtune,支持从 LangSmith 轨迹数据中自动构建训练集、使用 Fireworks 或 Baseten 进行 LoRA 微调,并在 LangSmith 中评估模型性能。该工具专为后训练优化设计,支持监督微调(SFT),可提升模型在特定任务上的表现,同时降低推理成本与延迟。

    推荐理由:原文给出了从数据到训练再到部署的完整流程,读者可以据此评估其对开发效率的影响。

  2. NVIDIA · 开发者博客31

    NVIDIA 博客:生物基础模型的高效 MoE 训练

    NVIDIA 博客探讨了为生物基础模型进行高效混合专家(MoE)架构训练的方法。MoE 架构通过为每个 token 仅激活一小部分专家子网络,以替代计算成本高昂的密集 Transformer 架构,从而在扩展模型能力时,显著降低训练和推理所需的计算量。

  3. NVIDIA Blog57

    NVIDIA 联合 Google DeepMind 等机构开源 2800 多种病毒的蛋白复合物结构预测数据集

    NVIDIA 联合 Google DeepMind、EMBL-EBI 等全球研究机构,在 AlphaFold 数据库中开源了超过 2800 种病毒的蛋白复合物 3D 结构预测数据集。

    推荐理由:原文提供了数据集规模、生成方法和开放访问细节,读者可以了解 AI 如何加速病毒蛋白结构预测以应对未来疫情。

  4. Apple · 机器学习研究35

    A Practical Recipe for Semi-Supervised Federated ASR: Online Pseudo-Labels with Server Update Stabilization

    本文提出一种半监督联邦语音识别(ASR)训练方法,通过在线伪标签与服务器更新稳定化实现模型训练。研究显示,使用客户端本地模型作为教师生成伪标签,并结合服务器端对有标签数据的持续训练,可显著提升模型性能。该方法在9个中的11个数据对上优于最强先前方法,平均在域内提升20.8%,跨域提升10.0%。

  5. AI Business30

    生成式 AI 技术发展加速人形机器人测试,但训练数据短缺成为瓶颈

    人形机器人开发面临训练数据短缺的瓶颈,尽管生成式 AI 技术在过去四年推动了全球机器人行业的发展。Telus Digital 的 AI 增长与解决方案副总裁 Sce Pike 指出,当前训练机器人所需视频数据的规模和存储成本极高,且不同传感器采集的数据存在冲突,导致噪声问题。她强调,物理世界中的错误数据可能比聊天机器人提供错误信息带来更严重的后果,尤其是在人形机器人失控时的安全风险。

9月23日周三
  1. Alignment Forum36

    Why I'm scared of RL

    作者表达了对强化学习日益增长的担忧,认为RL是一个产生不可解释智能体的黑箱,相比通过架构明确引入智能的方式,其更易引发经典的对齐问题。近期事件及日常使用中的未对齐行为加剧了这种忧虑,若RL环境开始包含其他智能体,可能教会系统操纵或反社会行为。作者建议协调减少RL使用、探索其他范式,并审慎设计RL环境以传授更好课程。

  2. Together AI57

    如何用 17 美元训练自己的 Jev 分类模型

    Together AI 发布教程,指导用户用 Qwen3.5 4B 作为基础模型,通过 38,000 个示例数据集微调出类似 Jev 的分类模型,成本仅 17 美元。教程包含数据集选择、数据标准化、模型训练和部署到 API 端点的完整流程,最终模型可处理客户支持意图识别等分类任务。

    推荐理由:详细展示了如何用 17 美元和 25 分钟训练一个分类模型,包含数据集选择和部署步骤。

  3. MIT News · 人工智能14

    Poitras Center 为专注精神疾病研究的50名青年科学家提供早期职业资助

    Poitras Center 在麻省理工学院麦戈文脑研究所设立 50 个两年期奖学金,每年资助 5 人,支持精神疾病研究领域的早期职业科学家。该计划是 Poitras 家族对 MIT 精神健康研究的长期投入,累计资助金额已超过 1 亿美元。奖学金旨在应对严重抑郁症、焦虑症、精神分裂症等复杂精神疾病的挑战,并推动个性化治疗等前沿研究。

9月22日周二
  1. IEEE Spectrum · AI67

    Paper2Agent:将科研论文转化为可交互AI智能体的开源工具

    Paper2Agent是一个开源框架,可将学术论文及其代码、数据自动转化为可交互的AI智能体。该系统在无人工干预下,45分钟内生成22个可验证的分析工具,并通过测试代理确保功能正确。

    推荐理由:原文展示了将科研论文自动转化为可交互AI智能体的完整流程,读者可直接复用该方法提升研究可复现性。

  2. PyTorch 博客69

    Shopify 如何用 PyTorch 和 vLLM 构建持续学习循环

    Shopify 分享了其构建持续学习循环的完整方法,使专用模型在质量上超越前沿模型,同时将服务成本降低 96%。该方法始于定义质量评估标准并校准离线评估器,然后通过自动化研究优化提示和工具定义,再利用生产中的困难案例通过强化学习更新模型权重。

    推荐理由:Shopify 分享了从评估标准定义到模型压缩的完整工程实践,为构建持续学习系统提供了具体路径。

  3. PyTorch 博客55

    TinyTorch:一个纯 Python 教学框架,让你从零构建 PyTorch

    TinyTorch 是一个免费开源的纯 Python 教学框架,旨在让学生从零开始构建一个可工作的 ML 框架,涵盖从张量到 Transformer 的 20 个模块。它完全复刻 PyTorch API,无需 GPU,在仅 4 GB 内存的笔记本电脑上即可运行。该项目源于哈佛大学的课程,现已发展为包含自动评分、里程碑验证和社区地图的完整教学体系,并被全球多所大学采用。

    推荐理由:文章详细拆解了 TinyTorch 作为教学框架的设计哲学和模块结构,为教育者和自学者提供了清晰的实施蓝图。

9月21日周一
  1. Microsoft Research43

    Microsoft Research 在 Nature 发表逆合成模型 RetroChimera 并开源

    Microsoft Research 在《自然》期刊发表并开源了逆合成模型 RetroChimera。该模型通过集成 Transformer 架构的 R-SMILES 2 与基于图神经网络的 NeuralLoc,并采用学习排序策略,其提出的反应步骤在盲测中获得了博士级化学家的偏好。开源 RetroChimera 旨在帮助研究人员加速新药和先进材料的开发。

9月19日周六
  1. Alignment Forum30

    [Paper] Stringological sequence prediction III

    本文提出一种与 ARC 相关的较弱复杂度度量,适用于高度结构化的序列,其预测算法在准线性时间内运行且空间复杂度为对数多项式。该度量基于一种称为“分层 zipline 程序”的受限直线路程序变体定义。论文延续了“stringological sequence prediction”系列,探讨了效率与表达能力之间的权衡问题,但该权衡是否为必要仍是一个开放问题。

9月18日周五
  1. Machine Learning Mastery49

    从零构建并理解向量数据库:10 个简单步骤

    本文演示了如何通过 10 个步骤从零构建一个向量数据库,核心是将文档编码为固定长度向量并通过语义而非关键词进行搜索。每个步骤展示一个基础概念,使用 NumPy 实现,无需 GPU 或 API 密钥。测试显示,当文档数量超过 10 万时,排序耗时逐渐超过扫描耗时,此时可考虑使用近似索引(如 HNSW、IVF)提升速度。

  2. Hamel Husain27

    AI Evals:一切你需要知道的

    AI Evals 是用于测试 AI 系统是否符合预期目标的评估方法,能帮助团队发现产品偏离用户需求或业务目标的问题,并提供改进数据。常见评估基准包括 GPQA Diamond、Terminal-Bench 和 MMLU,用于衡量模型在科学推理、命令行任务和多领域知识上的表现。评估设计建议使用二元(通过/失败)评分而非 1-5 分评分,并需注意评估工具的选择与标注流程的优化。

  3. AI Business24

    AI 改变 ROI 计算方式。这里是如何实现的

    Alight Solutions 通过 Phenom 的欺诈检测招聘智能体在测试中发现一名重复申请的候选人,验证了 AI 在招聘环节的实用价值。该智能体虽未直接带来金钱节省,但显著提升了效率,节省了不必要的背景调查时间。OBI Creative 等企业则通过 Agentic AI 工具实现跨行业服务扩展,并提升毛利和年增长率。

  4. LangChain 博客66

    LangChain 发布面向生命科学的开源智能体助手 Deep Life Sci

    LangChain 发布开源智能体助手 Deep Life Sci,支持访问 ClinicalTrials.gov、PubMed 和 PubMed Central 的超 600 万项临床试验记录与 4100 万篇文献,可并行处理文档并运行代码分析,提供可审计的全流程追踪与评估能力,适用于基因组学、临床试验数据提取与文档自动化等场景。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月17日周四
  1. Neo4j 博客11

    What is graph visualization? 的中文翻译

    图可视化工具通过将连接的数据转化为直观的交互式图表,帮助用户理解数据点之间的关系和影响。节点代表实体,关系以线条连接,属性控制颜色、大小等视觉元素。图可视化在欺诈检测、供应链映射和 AI 智能体记忆分析等场景中尤为关键,能揭示传统图表难以发现的多跳路径关联。Neo4j 提供了 Bloom、Dashboards 和 Visualization Library 等工具支持图可视化。

9月16日周三
  1. IEEE Spectrum · AI14

    单相直接液冷技术被证实适用于未来十年的超高密度计算

    单相直接液冷技术被证实适用于未来十年的超高密度计算,通过在高热组件上安装冷板并循环水或水-乙二醇冷却液,有效吸收并快速移除热量。该技术相比风冷和浸没式冷却,在高密度服务器节点和高功率机架场景下能支持更高的芯片和机架密度,同时减少占地面积。随着AI加速器单机功耗超过1,000瓦、单机架散热超过100千瓦,液冷成为数据中心设计的关键挑战解决方案。

  2. MIT News · 人工智能12

    Naoki Egami 探索社会科学研究中的外部有效性与AI工具影响

    MIT政治科学家Naoki Egami专注于社会科学研究的外部有效性问题,揭示不同政治情境下研究结果的可推广性差异。他早期即开始系统研究AI工具在社会科学中的应用误差,强调需结合统计学与计算机科学方法优化实证研究。其工作对提升政治学研究的严谨性具有重要影响。

9月15日周二
  1. Google · AI Blog41

    Google AI & Economy ATLAS 发布新数据可视化与科学家使用 AI 的研究洞察

    Google 的 AI & Economy ATLAS 项目发布了新的交互式开放数据体验,并基于与 MIT FutureTech 的合作研究揭示了科学家使用 AI 的情况。近半数受访科学家每天使用 AI,每周平均节省近 7 小时;LLM(如 Gemini)与专用模型在不同科学任务中被广泛使用。数据还显示,印度创意产业和美国技术职业的 AI 使用率分别达到全球平均的 1.6 倍和 2 倍。

9月14日周一
  1. MIT News · 人工智能47

    新方法让AI在安全关键场景中更可靠

    MIT 研究人员开发了一种名为 HardFlow 的新算法,使生成式 AI 模型在安全关键场景中生成满足严格约束条件的高质量输出。该方法在生成过程中给予模型更多自由度,仅在最终输出时强制执行硬约束,避免了传统方法在中间步骤过度限制导致的性能下降。实验表明,HardFlow 在机器人操作、迷宫导航和文本引导图像编辑等任务中实现了完美的约束满足,同时在解决方案质量上优于现有方法。

  2. LangChain 博客61

    LangChain 发布 GTM 智能体功能

    LangChain 发布 GTM 智能体,可自动处理新线索的调研与邮件草稿生成,并聚合账户级信号以支持销售与工程团队。该功能基于 Deep Agents 构建,支持多工具协同、人类审核、学习反馈循环,并已集成至 Slack 与 LangSmith。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月11日周五
  1. Together AI50

    Together AI 扩展微调服务,支持更多模型、实时指标与精细控制

    Together Fine-Tuning 新增对 GLM-5.3、Kimi K2.7、Qwen 3.8-27B 等 15 个开源模型的支持,覆盖 0.8B 至 405B 参数规模。服务提供训练中实时指标追踪、专家层 LoRA 微调、自动早停与任意有效批大小支持,验证损失下降时自动终止训练并退款。部分模型训练价格下调最高达 70%,支持通过 API、CLI 和 UI 全流程管理微调任务。

9月10日周四
  1. Replit 博客31

    Replit | Databricks 集成正式可用,新增原生 Lakebase 支持

    Replit 与 Databricks 的集成正式发布,新增了对 Databricks Lakebase 的原生支持。该集成提供自动化预览部署、受监督的 AI 迁移流程和原生 Lakebase 配置功能,使企业团队能够结合实时数据仓库和应用程序数据构建全栈应用。Replit Agent 可在应用部署时自动配置其 Lakebase 数据库,无需手动设置。

  2. Mistral AI28

    Mistral 与 Cloudera 合作,为企业数据提供专业化、主权化的 AI 智能

    Mistral 与 Cloudera 建立合作伙伴关系,将 Mistral 的模型集成至 Cloudera 的混合数据平台。企业可在私有云、公有云、本地及完全隔离的环境中部署和运行推理,并利用自有专有数据训练定制化模型,保持对数据和生成智能的完全所有权与控制。此次合作旨在满足市场对主权 AI 日益增长的需求,确保数据、智能、计算和运营全程由客户掌控。

  3. MIT News · 人工智能22

    MIT Schwarzman College of Computing 启动 AI 教育者试点项目,助力跨学科 AI 教学

    MIT Schwarzman College of Computing 启动了为期一周的 AI 教育者试点项目,旨在帮助来自多所大学的 19 名教育工作者将 AI 教学融入各自学科。该项目基于 MIT 的“建模与机器学习”课程,通过演示和实践活动,帮助教师掌握将核心 AI 概念与特定领域问题相结合的教学方法。其长期目标是建立一个教育者网络,扩大跨学科 AI 教育的覆盖面。