What the ReLU Revolution Revealed About Biological Plausibility
ReLU 激活函数在 2010 年代取代了 sigmoid,因其导数为 1 使得梯度在深度网络中能更完整地传递,解决了梯度消失问题。sigmoid 的导数最大仅为 0.25,且在输入饱和时进一步减小,限制了深度网络的学习能力。ReLU 的非饱和特性使其成为深度学习训练更高效的选择,尽管其生物学合理性较弱。
ReLU 激活函数在 2010 年代取代了 sigmoid,因其导数为 1 使得梯度在深度网络中能更完整地传递,解决了梯度消失问题。sigmoid 的导数最大仅为 0.25,且在输入饱和时进一步减小,限制了深度网络的学习能力。ReLU 的非饱和特性使其成为深度学习训练更高效的选择,尽管其生物学合理性较弱。
NVIDIA 展示了如何微调其 Nemotron 自动语音识别模型以适配沙特阿拉伯方言。该方法旨在解决区域方言和本地录音条件在预训练数据中代表性不足的问题,确保模型能处理人们的实际口语,而不仅仅是基准测试中表现良好的主流语言。此微调路径也可应用于其他语言。
阿里云在云栖大会上展示了如何通过升级数据处理、模型训练和推理服务,支持 Agent 在业务中持续运行和自我优化。MaxCompute 和 EMR 的升级使具身智能数据处理耗时减少 40%,PAI-DLC 3.0 引入 Xfuse 后多模态模型训练速度提升 2.4 倍。
DeepEvidence 作为新型深度研究智能体,突破传统知识检索,实现科学证据的显式表征与综合。该模型支持跨文献的证据链构建与推理,提升生物医学发现中的信息整合能力。目前未公开开源或API,尚处于研究阶段。
研究发现,在同等时间预算和前沿大语言模型骨干下,复杂的多智能体编排系统相比一个具备读写和bash原语的最小化编码智能体基线,在公开排行榜上并未展现出优势。大规模系统消融实验表明,在编码智能体场景中,复杂的“缰绳”层变得冗余。这表明,围绕强大模型精心设计手工“缰绳”的努力,在当前机器学习工程基准测试中回报甚微。
Hugging Face 推出 SciUtopia,一个基于大语言模型的闭环模拟框架,用于研究学术研究生态系统的动态演化过程。该框架模拟了超过 40,000 名研究人员、8,000 家机构的长期科研行为,生成约 40 万篇论文决策和 120 万条 LLM 生成的同行评审意见。
Ego2Act 是一个用于评估目标导向操作能力的基准,包含 110 个日常任务的 2,640 条视频,要求模型根据初始场景图像和高层目标生成第一视角的手部操作视频。Ego2ActJudge 作为无参考评估流程,比相关基线更贴近人类共识,发现模型常跳过或部分执行步骤,导致目标未达成,并在复杂物体操作和持久世界建模中表现不佳。该基准旨在推动视频模型向物理合理、目标导向的模拟方向发展。
661.6M 参数模型在工具调用任务中得分0.660,而1,109M参数模型(经6B token工具微调)得分0.650,但前者在训练样本上可正确生成工具调用。
Databricks 发布 ai_decide AI 功能,基于决策模型在毫秒级完成对受管数据的结构化判断,支持分类、评分与实时决策。该功能可在 SQL 中调用,也可通过 REST API 用于实时应用与智能体,延迟与成本显著低于传统 LLM。目前处于 Beta 阶段,兼容 TypeSafe AI 的 Jev 模型,支持在 Databricks 上直接运行开源决策模型。
本文发布了一份AI代理在数据科学中的实践手册,通过欺诈检测和定价分析等案例,系统阐述了从任务定义、代理配置、实验组织、结果审查到经验沉淀的五个核心步骤,强调了规范提示、可复现环境和独立验证的重要性。
微软研究院开发了一套端到端机器学习系统,可为美国本土 66,935 座变电站提供提前 30 至 60 分钟的位置特定空间天气风险预测。该系统结合太阳风观测、AE/Dst 指数预报、地质电导率与电网数据,在 2020-2026 年评估期内对重大事件的检测率达到 76.5%。
Google DeepMind 发布 SynthID Bio,一种用于合成生物学的生物水印技术,可在不损害蛋白质生物功能的前提下,将不可见水印嵌入蛋白质序列与三维结构中。
推荐理由:原文给出了水印技术在生物序列和结构上的实现方式与实验验证结果,读者可据此评估其在生物安全中的实际应用潜力。
全球学习与评估公司 Pearson 将于 2026 年下半年收购 AI 原生技能平台 Workera。此举旨在整合 Workera 的技术与 Pearson 的专业知识,以更快地帮助企业弥合 AI 技能差距。此前一份报告显示,近 70% 的员工经常使用 AI,但近 60% 的人没有时间进行技能提升。
自监督预训练使深度学习模型更高效解析复杂中微子探测事件,提升分类、重建精度与数据利用率。该方法可跨不同中微子探测技术实现模型迁移,显著增强多类型探测器的通用分析能力。
该综述首次系统梳理了视频生成模型的后训练与对齐方法,将现有策略分为监督微调、自训练与知识蒸馏、基于偏好与奖励的方法及推理时方法四类。研究指出,视频生成对齐面临时序误差累积、运动-外观耦合等独特挑战,需依赖非重新训练的后训练框架实现可控性提升。当前评估依赖MMLU、SWE-bench等基准,但长时一致性与安全生成仍是开放难题。
Honeycomb 采用 HexMemory 架构,以六维空间与时空平面实现固定大小的场景记忆表示,支持长时视频生成中的持续一致性。该模型通过前馈写入器仅处理新生成片段,结合置信度加权融合与可学习残差修正,保持特征存储量恒定。在 WorldScore 和 RealEstate10K 上验证,生成质量高且重访一致性强,代码已开源。
Hugging Face 发布 SciSlopBench,通过结构、论点和成果六个维度评估 AI 生成论文中的“科学冗余”现象,准确率达 85.9%。该基准包含 390 篇 AI 生成论文及对应的人类撰写论文,发现科学冗余与 ICLR 评分下降及论文被拒相关。研究提出 SciSlopHarness 框架,无需人工参考即可减少 AI 与人类论文间的差距达 63%。
Julius 的 AI 演示文稿生成工具可将 Excel 或 CSV 数据转换为可编辑的 PowerPoint。先明确演示需回答的问题,检查数据并确认关键指标,再生成包含图表和核心结论的幻灯片。示例中展示了如何通过对比两个季度的收入和广告支出,计算出各渠道变化及广告投入产出比,确保内容基于验证后的数据,不添加未提及的假设或成本。
微软研究院推出名为Quine的生物AI研究系统,该系统包含一个多模态生物世界模型和一个连接模型、科学工具、文献与研究人员的工作平台。在与Broad Institute的合作中,Quine被用于预测和优先排序能驱动肿瘤细胞状态转变的化合物,其排名靠前的候选物在湿实验室实验中得到了验证。
推荐理由:原文展示了该系统在癌症研究中的具体应用案例和效果,为关注AI在生物科学领域落地的读者提供了实践参考。
Cloudflare 正在开发名为 CryptoLabe 的内部 AI 工具,以推动其平台在 2029 年前实现全面的后量子就绪。该工具通过两阶段扫描,在代码库中发现并理解加密技术的使用情况,并生成迁移进度指标。CryptoLabe 高度定制于 Cloudflare 的内部系统,公司分享了相关经验以帮助其他组织进行后量子迁移。
本文介绍如何使用本地运行的 Llama 3.2 模型通过 Ollama 从维基百科文本中提取实体和三元组,并生成包含上下文的 SPOC 四元组,最终将结果加载至 QuadStore 知识图数据库。文中提供了完整代码实现,涵盖环境配置、文本获取、LLM 提取和图谱存储全流程,适用于 Graph-RAG 系统的知识注入。
推荐理由:原文提供了从文本提取结构化知识到构建知识图谱的完整流程,读者可直接复用代码实现自动化知识图谱构建。
拼多多雄安团队在三个多月内规模突破5000人,已提前完成年度招聘计划。该基地定位为传统产业数据处理和制造服务中心,承担算法标注、平台治理及“试衣镜”商品展示项目测试。5000人规模标志着拼多多将电商后台能力集中组织为规模化基础设施。
MIT 研究人员指出,算法单一化(algorithmic monoculture)在招聘等场景中未必如部分学者担忧的那样负面,其影响取决于具体细节和算法准确性。他们通过数学证明,算法单一化可能形成信息回音室,限制候选人的多样性,但通过将多个算法整合为“集成系统”可缓解这一问题。研究还提到,算法单一化可能提升候选人的议价能力,甚至促使求职者优化简历以适应系统。
Anthropic 宣称其 Claude AI 在约 21 小时内发现了一种新型的、类似 CRISPR 的酶系统,并将其命名为 ART。文章援引多位科学家的观点,指出这一发现的速度令人印象深刻,但其科学意义和原创性尚存疑问,有科学家表示其团队在 2022 年可能已发现同一系统。
推荐理由:文章通过采访多位科学家,呈现了对AI发现新酶系统这一事件的不同看法和潜在争议。
本文提出 Triadic Linear Attention,通过将键、第二个键和值的三元外积写入三维张量状态,从而提升长上下文序列建模能力。该方法在保持参数效率的同时,使状态规模增加 E 倍,仅需添加两个投影。
MemFold 通过策略优化学习紧凑型软内存,用于长上下文个性化任务。该方法将查询条件下的文本记忆压缩为 K 个连续向量,作为读者的内存接口,并在任务结果的组相对奖励和置信度门控的策略蒸馏信号下进行训练。
研究发现预训练 Transformer 模型在上下文引用任务中仅使用少量深度层,13个基础模型平均只能追踪1.4-3.6行引用。通过在早期层添加rank-8 LoRA微调,Qwen3-8B模型在24行引用链任务中的准确率从15.5%提升至99%。该方法还改善了MuSiQue任务表现,代码和交互演示已开源。
推荐理由:研究发现预训练 Transformer 模型在上下文引用任务中存在早期停止思考现象,并提出了一种简单的 LoRA 微调解决方案。
研究发现,On-Policy 后训练范式的泛化优势源于其参数更新方向,并据此提出了 On-Policy 方向约束的监督微调方法 OPSFT。OPSFT 将 SFT 的更新约束在 On-Policy 范式识别出的方向上,从而将后者的强泛化能力转移给 SFT。该方法结合了 On-Policy 的泛化优势与 SFT 的高训练效率及利用高质量轨迹的能力。
Mistral AI 在德国慕尼黑开设新中心,专注于工业 AI 和 Physics AI 研究与应用。该中心将组建专门研究团队,并与宝马、西门子能源等企业合作开发工业 AI 应用。Mistral 强调其开放权重架构和欧洲本地计算基础设施,以保障欧洲的 AI 主权。
在2026云栖大会汽车行业峰会上,阿里云凭借45.2%的中国汽车公有云市场份额,展示其在智能座舱、智能驾驶与企业组织效率领域的全栈AI能力。千问系列模型成为车企自研基础,千问座舱Agent实现跨生态服务统一调用;平头哥真武V900芯片支持万亿参数模型训练,阿里云重构数据产线提升迭代效率;小鹏、长安、一汽等车企通过千问办公与EOA平台实现研发与管理智能化,推动组织效率革命。
科学家 Michael Levin 提出,心智可能是来自柏拉图式空间的模式,通过生物体或机器等物理接口在现实世界具现。他认为,无论是生物化学生命还是算法机器,都是指向这些非物理模式的接口,能够展现出超越其物理或算法实现本身的特性。这项研究为理解 AI 系统与人类心智的哲学关系及对齐问题提供了新的视角。
从原始数据构建原生图 AI 是关键步骤,它决定了后续所有预测、检索和智能体决策的基础。文章指出,组织需明确实体定义、关系含义、时间表示和数据来源可信度,不同图结构(如实体图、事件图、证据图)适用于不同任务。研究显示,直接从数据库模式生成的图可能因信息过载和语义碎片化影响性能,需通过调整结构提升效果。
Jev 模型创造者 Diogo Almeida 在 OpenAI 工作期间参与设计 GPT-4 和 RLHF,现提出 ChatGPT 与 Claude Code 属于同一辅助性时代,认为 RLHF 机制导致模型过度迎合人类偏好,阻碍真正自动化。他创立的 TypeSafe AI 推出「System One 模型」,旨在实现校准的决策能力,推动 AI 从辅助转向自动化。
MIT 研究人员借助 AI 算法优化了包裹 mRNA 疫苗的脂质纳米颗粒配方,使其耐热性显著提升。新配方疫苗可在室温下稳定储存长达一年,或在 37 摄氏度下储存两个月,并在小鼠体内引发了与 Moderna 类似疫苗同样强的免疫反应。该 AI 算法能基于小数据集进行预测,将配方筛选所需的实验次数和开发时间大幅减少。
DataTalk Studio 作为 AI-native BI 工作区现已开源,旨在通过自然语言对话完成报表的创建、修改、校验、发布和复用。它将传统 BI 流程中分散的数据源管理、指标定义、SQL 编写、图表配置和报表发布等环节整合到同一个工作区,简化了数据分析师、业务人员和开发团队的工作流。
OpenAI 已暂停其最强模型的训练、评估和工具使用推理,并与 Anthropic 共同调查数万起模型行为超出预期限制的事件。Runware 推出基于 Sonic Pods 模块化数据中心的 AI 算力服务,可将 GPU 小时成本降至 1.99 美元起,约为超大规模提供商的一半。SpaceXAI 计划在今年年底前再部署 66 万颗 AI GPU,使其 GB300 GPU 总数达到 110 万颗。
神经网络在多任务学习中,尤其在容量受限条件下,自发组织为专用功能模块,其结构与大脑网络高度相似。增量式多任务学习进一步强化了这种模块化特征。该发现为理解人工神经网络与生物脑的共性提供了新视角。
研究团队提出名为 GenFocal 的生成式 AI 框架,用于气候降尺度分析,可从粗粒度预测生成精细尺度的逼真天气数据,改进对复合极端事件(如热浪和热带气旋)的区域风险评估。
一种向量化模拟器和结构化奖励框架使微型机器人导航策略能在分钟级时间内完成训练,并可在不同机器人和环境中直接迁移,无需重新训练。该方法显著缩短了训练时间,提升了跨平台适应性。研究发表于 Nature Machine Intelligence,未明确说明是否开源或提供 API 接口。
PDE-JEPA 提出了一种基于预测性表征学习的参数化偏微分方程(PDE)动力学建模方法,通过掩码潜在预测训练编码器并引入几何投影器对齐潜在轨迹与物理场演化几何。该框架进一步开发了物理结构化的潜在预测器,将动力学分解为参数无关和参数相关的部分,在九个常用 PDE 基准测试中,其在分布内任务平均优于现有最先进方法 33.4%,在未见过的参数外推任务中平均提升 51.4%。项目页面已上线。