用 Jev 决策模型替代大语言模型以实现低延迟边缘服务编排
Jev 决策模型在边缘服务编排中替代大语言模型,将中位决策延迟降低 22.7-64.5%。其延迟几乎不受输入规模、合同宽度或目录规模影响,在四字段合同中每项正确决策的 API 费用降低 59.7-80.9%,但精确匹配点略有下降。Jev 能准确识别未见过的服务,并在实时准入路径中保持 0.91-0.95 的请求准确率和准时率,而大语言模型在同等负载下低于 0.1。
Jev 决策模型在边缘服务编排中替代大语言模型,将中位决策延迟降低 22.7-64.5%。其延迟几乎不受输入规模、合同宽度或目录规模影响,在四字段合同中每项正确决策的 API 费用降低 59.7-80.9%,但精确匹配点略有下降。Jev 能准确识别未见过的服务,并在实时准入路径中保持 0.91-0.95 的请求准确率和准时率,而大语言模型在同等负载下低于 0.1。
研究者推出 OpenTumorBoard 基准,包含 611 个患者案例和 19,157 次讨论记录,评估大模型在两种医疗场景下的表现。14 个前沿模型测试显示,最佳模型在临床等效性上仅获 3.43/5 分。该基准将公开发布以支持个性化癌症决策的模型开发。
Vercel 基于 skills.sh 注册表数据发布《智能体技能现状》报告。该注册表在七个月内收录了 100 万个智能体技能,记录了近 2.8 亿次安装。报告分析了技能供需:供应侧以软件工程(约25%)等技术类为主,需求侧则更分散,软件工程(18%)、智能体工作流(15%)、业务运营与写作(各约11%)领先。
推荐理由:报告基于 skills.sh 注册表数据,揭示了技能供需分布、热门类别及生态增长模式,为理解智能体技能市场早期形态提供了量化视角。
MIT麦戈文脑研究所科学家开发了一种基于自建词典的轻量级机器学习模型,通过分析约1.6万条危机文本对话,识别出与自杀风险相关的49类因素,发现致命手段和物质滥用提及比抑郁情绪更强烈预测高风险,模型具备可解释性且可在个人电脑运行,已开源词典与工具包供研究复用。
推荐理由:该研究构建了可解释的文本风险评估工具,通过词典与轻量模型结合,揭示了危机文本中关键风险因素的权重差异。
Google 研究团队提出 AI 视频协导演框架,基于 Gemini 和 Veo 构建统一多代理系统,通过全局优化、视觉记忆追踪、自回归生成与闭环质量评估,解决长视频生成中的语义漂移、特征漂移和内容坍缩问题。
推荐理由:原文系统性地提出了多代理框架解决长视频生成中的连贯性问题,提供了可复现的技术路径和基准测试结果。
NVIDIA 博客探讨了为生物基础模型进行高效混合专家(MoE)架构训练的方法。MoE 架构通过为每个 token 仅激活一小部分专家子网络,以替代计算成本高昂的密集 Transformer 架构,从而在扩展模型能力时,显著降低训练和推理所需的计算量。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等全球研究机构,在 AlphaFold 数据库中开源了超过 2800 种病毒的蛋白复合物 3D 结构预测数据集。
推荐理由:原文提供了数据集规模、生成方法和开放访问细节,读者可以了解 AI 如何加速病毒蛋白结构预测以应对未来疫情。
本文提出一种半监督联邦语音识别(ASR)训练方法,通过在线伪标签与服务器更新稳定化实现模型训练。研究显示,使用客户端本地模型作为教师生成伪标签,并结合服务器端对有标签数据的持续训练,可显著提升模型性能。该方法在9个中的11个数据对上优于最强先前方法,平均在域内提升20.8%,跨域提升10.0%。
NVIDIA 发布了专为 3D 计算机断层扫描设计的开源视觉语言模型 NV-Reason-CT Open。该模型旨在支持放射科医生的链式推理,以应对前沿通用模型在体成像上表现不佳、现有开源医疗 AI 模型能力不足的现状。
NVIDIA 与 SGLang 团队合作开发了 SWE-Serve,用于评估 AI 编码智能体生成的补丁在推理服务软件中的实际表现。该基准包含 53 个任务,旨在检查补丁能否在服务器加载真实模型并处理请求的完整服务路径中正常工作,而不仅是通过本地测试。
Anthropic 宣布成立专注于基础生物学研究的生命科学团队,其 AI 模型 Claude 在首项研究中自主发现了一种具有 CRISPR 样重复序列的新型酶系统 ART。
GTR 是一种无需 softmax 的视觉主干模型,结合门控线性注意力、交替空间扫描方向和空间增强的 SwiGLU 模块,用于高效密集预测。GTR-L 在 COCO val2017 上达到 58.9 box AP,使用 RTX 4090 编译后的 FP16 执行时,单批次推理延迟为 1.908 ms。
Microsoft Research 在《自然》期刊发表并开源了逆合成模型 RetroChimera。该模型通过集成 Transformer 架构的 R-SMILES 2 与基于图神经网络的 NeuralLoc,并采用学习排序策略,其提出的反应步骤在盲测中获得了博士级化学家的偏好。开源 RetroChimera 旨在帮助研究人员加速新药和先进材料的开发。
Jev 是 TypeSafe AI 发布的一种新型“System One”模型,用于评估智能体行为,相比传统 LLM 评估器在推理速度和成本上分别提升 200 倍和 400 倍。
MIT团队开发的xvr系统可在约5分钟内完成患者特异性AI模型训练,实现X射线与3D医学扫描的秒级、亚毫米级精准配准。该模型基于物理仿真生成患者专属合成X射线,避免幻觉,性能较现有AI方法提升一个数量级。系统已通过多类患者、身体部位和手术场景验证,有望提升微创手术的安全性与可及性。
MIT政治科学家Naoki Egami专注于社会科学研究的外部有效性问题,揭示不同政治情境下研究结果的可推广性差异。他早期即开始系统研究AI工具在社会科学中的应用误差,强调需结合统计学与计算机科学方法优化实证研究。其工作对提升政治学研究的严谨性具有重要影响。
Google 的 AI & Economy ATLAS 项目发布了新的交互式开放数据体验,并基于与 MIT FutureTech 的合作研究揭示了科学家使用 AI 的情况。近半数受访科学家每天使用 AI,每周平均节省近 7 小时;LLM(如 Gemini)与专用模型在不同科学任务中被广泛使用。数据还显示,印度创意产业和美国技术职业的 AI 使用率分别达到全球平均的 1.6 倍和 2 倍。
MIT 研究人员开发了一种名为 HardFlow 的新算法,使生成式 AI 模型在安全关键场景中生成满足严格约束条件的高质量输出。该方法在生成过程中给予模型更多自由度,仅在最终输出时强制执行硬约束,避免了传统方法在中间步骤过度限制导致的性能下降。实验表明,HardFlow 在机器人操作、迷宫导航和文本引导图像编辑等任务中实现了完美的约束满足,同时在解决方案质量上优于现有方法。
Google Research 提出 ToolGrad,一种基于答案优先的高效工具使用数据集生成方法,通过文本“梯度”迭代构建复杂 API 工作流,生成成本更低且通过率更高。
Amazon Science 发布论文《What fits (into few tokens) doesn't overfit: Compression and generalization in ML research agents》。
Neo4j 发布 Neocarta 语义层,通过在 Neo4j 中构建跨 BigQuery 和 Databricks 的元数据图,使 Text2SQL 代理在 278 张 Census 表和 264 张 Databricks 表的复杂环境中。
推荐理由:原文展示了在大规模、复杂数据环境中,通过图结构语义层显著提升Text2SQL的准确性和成本效益,可直接复用于企业级数据接入场景。
MIT与Motional的研究人员开发了Concept-Wrapper Network (CW-Net),旨在为自动驾驶汽车的机器学习规划器决策提供忠实且可理解的解释。
Microsoft Research 推出高效病理学基础模型 GigaPath-Flash 和 GigaTIME-Flash,显著降低了计算需求。GigaPath-Flash 参数量为 2200 万,在保持性能的同时将推理成本降至原 GigaPath 的约 1/50。这两个基于 Apache 2.0 协议开源的研究模型旨在支持大规模病理数据分析,推动群体规模的疾病生物学研究。
MIT 生物学系开发的 PottsMPNN 机器学习框架,通过整合蛋白质结构稳定性的物理原理,提升了序列生成能力和突变稳定性预测的准确性。该模型降低了对天然序列的依赖,能设计出结构可行且与任何天然蛋白序列都不相似的全新蛋白质。
本文提出一种基于 Ising 模型的依赖感知标签聚合方法,用于评估多个大语言模型作为评判者时输出的相关性,并据此调整综合评分。该方法在三个二分类任务中,相比加权多数投票和均匀多数投票基线,准确率分别提升了 9% 到 14%。该方法适用于无监督场景,从评判者输出中学习模型技能和相似性,无需依赖人工标注的参考标签。
WikiBench 用于评估 OpenWiki 生成和维护代码库文档的效果,通过“阅读代理”判断生成的维基是否有助于回答基于代码库的问题。该基准测试在 Harbor 框架上运行,生成两类问题:覆盖问题和检索问题,并为每个问题提供包含预期事实的 JSON 评分标准。测试结果显示,使用 OpenWiki 0.3.0 与源代码结合时,阅读代理的平均得分最高,且成本低于仅使用源代码的情况。
MIT 研究人员开发了名为 CrysVCD 的框架,能在材料生成过程初期通过约束化学价态规则,显著提升生成材料的稳定性。在《自然·计算科学》发表的论文中,该框架使近 70% 的计算材料生成通过了严格的晶格动力学稳定性测试,并能生成具有特定目标属性(如高导热率)的材料。该方法可与现有及未来的扩散模型或大语言模型结合,将稳定材料的生成效率提升一个数量级,大幅降低筛选过程的计算成本。
MIT 工程师开发了一种名为 η-learning 的机器学习算法,无需依赖历史极端事件数据即可生成未来可能发生的极端天气场景。该方法结合点统计数据和空间地图,能预测如“百年一遇”风暴的持续时间、强度和影响范围等特征。该工具还可应用于机器人导航和金融市场等其他领域,以探索罕见但合理的极端情景。
MIT 研究人员开发了一种新方法,可预测哪些材料最有潜力成为电化学合成氨的催化剂,以加速寻找能使这种低排放方法与哈伯法竞争的材料。该方法通过识别驱动氨生产催化活性的关键物理性质,指导寻找新的、更有效的催化剂化合物。相关开放获取研究成果已发表在《EES Catalysis》期刊上。
MIT CSAIL 的研究团队在《自然·通讯》上发表论文,提出‘归因衰减’现象:当生成模型在大规模数据集上训练时,移除任何单个训练图像或特定艺术家的作品,通常不会改变模型的输出。研究通过构建‘扩散集成’架构,首次实现了对训练数据影响的精确删除验证,而非依赖近似估计。这一发现对生成式 AI 的版权归属、合理使用及模型输出是否构成衍生作品等法律问题提出了新的技术视角。
Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型对连通性、包围、顺序、分离和绳结等拓扑关系的理解能力。测试发现,模型在静态图像识别任务上的表现远优于需要规划与交互的任务,表明其难以在动态场景中维持对拓扑结构的一致性理解。这一差距凸显了在机器人学和交互式环境等需要可靠决策的领域,提升 AI 系统拓扑推理能力的重要性。
MIT CSAIL 与清华大学的研究人员提出了一种名为 GeoPT 的预训练方法,能让模拟模型更高效地学习物理规律。该方法通过 130 万份合成动力学样本进行训练,使模型在达到峰值性能时速度提升 2 倍,所需标注数据减少高达 60%。GeoPT 在模拟风洞、波浪对船体作用及车辆碰撞变形等工业场景中,其速度和准确性均超越了当前最先进的模型。
MIT 研究团队通过 AI 算法设计出新型溶剂 DMFSA,解决了钠金属电池在快速充放电与长期稳定性之间的关键矛盾。该溶剂分子尺寸更小,能加速钠离子传输,同时保持电极稳定性。钠的成本仅为锂的约百分之一,此项进展有望推动低成本、高性能电池的发展。
MIT 等机构的研究发现,AI 辅助虽能提升非专家和初级保健医生诊断皮肤疾病的准确性,但可解释性方法的效果因用户知识水平而异。非专家的诊断改善主要源于对 AI 系统的顺从,尤其易被 LLM 的错误或模糊解释误导;而临床医生则能抵御错误 AI 辅助,且仅提供模型预测(无解释)时表现最佳。研究强调设计 AI 系统需考虑用户差异,并开发能鼓励批判性思维而非过度依赖的可解释性方法。
Amazon Science 提出 ControlG 框架,借鉴工业控制系统中的 PID 控制器,用于协调图自监督学习中的多任务训练,避免梯度冲突。该方法通过在不同训练阶段分配计算资源给不同目标,提升了节点聚类任务的性能,随机调度在部分基准上优于 AutoSSL、WAS 等方法。ControlG 通过感知、规划和控制三个循环实现动态资源分配,基于帕累托效率理论优化多目标训练过程。
MIT 与 Beth Israel 医院的研究团队于 1975 年启动的心电图数据收集与共享项目,最终演变为全球性的生物医学临床数据平台 PhysioNet。该平台现已托管数百个数据库,去年被超过 15,000 篇科学出版物引用,用户覆盖 180 多个国家。其公开的源代码和数据为临床信息学、重症监护及健康机器学习等领域的研究提供了关键资源,并催生了 Health Data Nexus 等类似平台。
伯克利 AI 研究团队扩展了 K-Search 框架,为其增加了 MLX 后端,并开发了一个结构化的 CUDA-to-MLX 翻译层,能够将 NVIDIA CUDA 内核的优化知识自动迁移到 Apple Silicon 上。
推荐理由:研究提出了一种将 NVIDIA CUDA 内核优化知识自动迁移到 Apple MLX 框架的方法,为跨硬件生态的 AI 计算性能优化提供了新思路。
Together AI 开源了智能体推理系统 ThunderAgent,通过将工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。在 8 节点 H100 集群上,相比 SGLang Gateway 实现了 2.39 倍的加速和接近线性的吞吐扩展。该系统与 OpenAI 兼容,只需在客户端添加 `program_id` 字段即可集成现有推理后端。
推荐理由:开源系统通过将智能体工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。
Vector Institute的研究团队提出了“认知萎缩”新概念及配套评测基准Cognitive Atrophy Bench,用于评估AI在情感敏感对话中是否过度承担用户认知工作。
伯克利 AI 研究团队提出 ABBEL 框架,通过将交互历史压缩为自然语言信念状态并进行信念分级监督,以解决长程任务中递归摘要导致的性能下降问题。在 CollabBench 协作编码环境中,基于重构的信念分级将模型与全上下文模型的性能差距缩小了约 50%,并将训练步数减少至 50 步。该方法在保持较低峰值上下文 token 占用(约 601 个 token)的同时,显著提升了学习效率。