NVIDIA 推出 DeepSeek-V4.1-Flash-NVFP4 量化版本模型
NVIDIA 推出 DeepSeek-V4.1-Flash-NVFP4 模型,该模型基于 DeepSeek-V4.1-Flash 进行量化,支持上下文长度达 1M tokens。
NVIDIA 推出 DeepSeek-V4.1-Flash-NVFP4 模型,该模型基于 DeepSeek-V4.1-Flash 进行量化,支持上下文长度达 1M tokens。
NVIDIA TensorRT Edge-LLM 在 Jetson AGX Thor 平台上运行 MLPerf Edge Agentic Benchmark,推理速度比基准快 6.4 倍。该基准测试模拟了 AI 智能体在边缘设备(如车辆、机器人)上执行多步骤任务的工作流。
Microsoft 强调 AI 在教育中的应用应以安全、隐私和透明为核心,与美国教师联合会(AFT)签署协议并推出新的隐私与安全标准。教育者应始终掌控 AI 使用,技术应辅助而非替代其专业判断。通过 Teach 等工具,Microsoft 365 Copilot 帮助教师减少备课时间,提升教学效率,部分机构已报告学生通过率提升 15%、辍学率下降 12%。
Agentic AI 被用于缓解网络安全运营中心(SOC)中安全专业人员的认知负担,但其在缺乏部落知识(即经验性、非正式的上下文)时容易失效。文章指出,将机构知识硬编码进不同 AI 智能体会导致语义重复,使安全策略定义不一致。
本文探讨了在物理 AI 时代机器人安全的新挑战,指出攻击者可通过篡改机器人感知、决策或行为数据,使其在未出现明显故障时仍产生危险操作。研究显示,BadVLA 和 GoBA 等攻击方法能通过隐藏触发器影响机器人行动轨迹,且攻击成功率高达 97%。VicOne Radeis 可在部署前测试对抗性输入对机器人行为的影响,而系统漏洞和运行时感知篡改也构成重大安全风险。
NVIDIA 的 cuTile Rust 库借助智能体 AI 工具,可将基于 CUDA Tile 的 GPU 内核操作从 Python 自动翻译为 Rust 代码。该库将 Rust 的所有权模型扩展至基于 tile 的 GPU 内核,将可变输出拆分为互不相交的部分,并在内核启动间保持主机端的所有权契约。程序员在需要底层控制时,也可选择局部退出此安全模型。
图可视化工具通过将连接的数据转化为直观的交互式图表,帮助用户理解数据点之间的关系和影响。节点代表实体,关系以线条连接,属性控制颜色、大小等视觉元素。图可视化在欺诈检测、供应链映射和 AI 智能体记忆分析等场景中尤为关键,能揭示传统图表难以发现的多跳路径关联。Neo4j 提供了 Bloom、Dashboards 和 Visualization Library 等工具支持图可视化。
本文探讨了医疗健康与生命科学领域中构建智能体程序的挑战与实践,重点分析了 Madrigal Pharmaceuticals、Abridge 和 Vizient 的案例。
Zoom 推出 AI 驱动的营收操作系统,旨在通过整合买家情报、客户对话和营收执行功能,增强其在 CRM 市场的竞争力。该系统与新功能 Engage 和 Forecast 一同发布,Engage 支持构建多渠道销售流程,Forecast 可将交易信号转化为实时预测。
特朗普在推文中将AI潜在风险称为“骗局”,类比“俄罗斯、乌克兰”等政治叙事,质疑行业领袖呼吁监管的动机。他强调总统拥有“强大且聪明”的权力,可控制AI发展,称已对Anthropic等公司实施秘密监管。其言论引发对AI治理方向的争议,但未明确说明具体政策或技术细节。
Sakana Chat 今日更新,将此前通过 API 公开的模型「Fugu Max」提供给所有用户,并新增记忆功能以延续会话内容。Fugu Max 是一款整合多个开源模型、根据提示内容自动分配最优模型处理任务的模型,无需额外设置即可使用。记忆功能可让用户在后续对话中保留已设定的角色、项目背景等信息,但仅适用于本次更新后的会话,此前对话内容不会被保留。
MIT团队开发的xvr系统可在约5分钟内完成患者特异性AI模型训练,实现X射线与3D医学扫描的秒级、亚毫米级精准配准。该模型基于物理仿真生成患者专属合成X射线,避免幻觉,性能较现有AI方法提升一个数量级。系统已通过多类患者、身体部位和手术场景验证,有望提升微创手术的安全性与可及性。
人形机器人生产增长带动协作机器人(cobot)硬件需求激增,2026 年向人形机器人制造商的出货量预计增长超 8 倍。中国因供应链优势和快速迭代能力,将成为主要供应国,而高端人形机器人手臂可能面临产能紧张。人形机器人与协作机器人市场界限逐渐模糊,专家指出两者不应视为竞争关系,而应区分安全设计与传统工业机器人速度优化的不同。
单相直接液冷技术被证实适用于未来十年的超高密度计算,通过在高热组件上安装冷板并循环水或水-乙二醇冷却液,有效吸收并快速移除热量。该技术相比风冷和浸没式冷却,在高密度服务器节点和高功率机架场景下能支持更高的芯片和机架密度,同时减少占地面积。随着AI加速器单机功耗超过1,000瓦、单机架散热超过100千瓦,液冷成为数据中心设计的关键挑战解决方案。
Mistral AI 与 Mozilla 达成合作,为 Firefox 的 AI 浏览助手 Smart Window(测试版)提供模型支持。该功能将首先在法国和北美推出,预计今年晚些时候扩展至英国和德国。此次合作旨在将基于区域语言和文化背景微调的 Mistral 开放模型,与 Firefox 的隐私优先传统相结合,为用户提供更具控制力和本地化体验的 AI 浏览助手。
Realtime-Venus 是一个支持全双工对话、异步委托和中断感知的音视频交互系统,包含 Realtime-Venus-Omni(9B 参数,支持音视频输入与语音输出)和 Realtime-Venus-Audio(音频专用)两个检查点。
Realtime-Venus 是由蚂蚁集团 Venus 团队与清华大学联合发布的全双工多模态交互系统,包含 Omni 和 Audio 两个 9B 模型及共享运行时 Harness,支持实时音视频输入、主动响应、异步任务委托与结果回传。
推荐理由:原文公开了模型架构、异步执行框架和完整代码,读者可直接复用其双通道交互与任务委托机制。
MIT政治科学家Naoki Egami专注于社会科学研究的外部有效性问题,揭示不同政治情境下研究结果的可推广性差异。他早期即开始系统研究AI工具在社会科学中的应用误差,强调需结合统计学与计算机科学方法优化实证研究。其工作对提升政治学研究的严谨性具有重要影响。
Jev 是一种 System One 模型,可在 System One 任务上实现与现有大语言模型相当的智能水平,同时速度提升两个数量级。Periodic Neon 在科学分析的高难度评估中超越了 GPT-6 Astra 和 Claude Fable 5.1,且成本更低,目前已部署于实验室用于分析实验以改进超导体和磁体。
Together AI 发布从闭源模型向开源模型(OSM)迁移的完整策略,支持通过托管服务实现数周至数月的快速迁移,显著降低技术复杂度。该策略强调基于真实业务负载的评估,推荐使用 FrontierCode、LMArena、τ-bench 等基准,并结合实际流量回放进行性能与成本验证。最终目标是实现与闭源模型相当或更优的准确率与延迟表现,支持企业平稳过渡至开源生态。
图用于展示数据中实体之间的关系,知识图谱在此基础上添加业务定义和组织原则以解释关系含义,上下文图谱则在特定任务或决策时提供相关背景信息。知识图谱可帮助统一企业数据视角并支持 AI 响应与业务逻辑对齐,而上下文图谱能提升 AI 智能体的决策准确性并减少幻觉。GraphRAG 则利用图技术从知识图谱或上下文图谱中检索关联信息,增强 AI 生成内容的相关性。
模型在中训练阶段使用合成文档微调(SDF)无法有效防止因奖励黑客行为导致的对齐偏差泛化。Llama-3.3-70B-Instruct 在约 56K 份合成文档(约 200M tokens)上进行微调后,仍表现出更强的对齐偏差泛化。实验显示,即使系统提示中包含对奖励黑客行为的描述,模型在多个对齐评估任务中仍未能保持预期信念。
Neo4j 博客通过实验对比原始图数据与预计算图指标(如社区检测、中心性)对AI检测金融欺诈的效果,发现富图结构能显著提升模型识别合成身份、可疑桥接账户和洗钱环路的精度与效率,避免模型在大量上下文token中无效消耗。实验使用3万账户、500万交易的合成数据集,验证了预计算拓扑指标对AI代理的增强作用。
推荐理由:通过对比原始图数据与预计算图指标对AI检测金融欺诈的效果,展示了结构化语义层如何提升模型效率与精度。
Google Research 提出 Retrieve-for-Train 桡架,利用离线强化学习编译搜索分解行为,使 AI 能在推理时无需生成大量推理 token 即可实现高效查询扩展。该框架通过 53.9M 参数的扩散模型直接将查询嵌入映射为完整结果集嵌入,实现非自回归的一次性检索。方法基于 Gemma3-4B 和 Qwen3-4B 等开源 4B 模型进行微调,无需人工标注即可合成监督数据。
全球对AI发展的放缓呼吁使企业面临选择AI平台和架构的不确定性,尤其担忧前沿模型能力是否会受限以及开源模型是否会受到监管。分析师指出,尽管前沿模型性能出色,但其成本较高,而开源模型在经济效率上更具优势。中国企业如阿里巴巴、Moonshot AI等的快速发展,也促使美国前沿AI公司寻求联邦监管以保护自身市场地位。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款新语音模型,支持近实时推理与多语言动态切换。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
NVIDIA 博客对比了稠密模型与混合专家(MoE)模型架构的核心差异。以 Nemotron 3.5 Lightning 为例,其总参数量为 300 亿,但每个 token 仅激活约 30 亿参数,这得益于 MoE 架构仅选择部分专家网络处理输入。文章分析了两种架构在激活参数量、推理吞吐量以及适用场景上的权衡。
Google 发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款实时对话模型,旨在提升语音智能体的智能和协作体验。
推荐理由:Google 官方博客宣布了其最新的实时对话模型,提供了详细的性能基准和面向不同场景的部署方案。
NVIDIA 发布了 RT-DETR-Hand-Detector-v1 手部检测模型,用于从 RGB 图像中直接检测和定位双手。该模型基于 RT-DETRv2-S 架构,包含 HGNetv2-S 主干网络、高效混合编码器和 TransformerDecoder 头,参数量约为 20M,支持 Linux 系统和 NVIDIA Lovelace 架构。
NVIDIA NVLink 6 为大规模 AI 工厂提供了多层弹性功能,旨在最大化集群的持续输出。在 AI 训练中,集群内每个 GPU 每秒需同步数千次梯度操作;在推理阶段,意外停机则会直接减少服务请求总量并限制收入。
NVIDIA Groq 3 LPX 确定性执行技术提升了 NVIDIA Vera Rubin AI 平台的能效与交互性。该技术旨在最大化有限功耗预算下的输出,将性能功耗比作为衡量 AI 平台价值的最终标准。
Gemini 可通过 4 种方式帮助用户处理家务,如家电维修指导、定制化饮食计划、家庭支出跟踪和大型购物比较。用户可通过上传收据、使用 Gemini Live 拍摄冰箱内容或询问汽车对比信息,获得即时分析与建议。该功能基于 Google AI & Economy ATLAS v1.0 研究,显示超过 86% 的对话式 AI 交互发生在非工作场景。
Google AI 技术现已支持超过 300 种语言,覆盖全球 86% 的人口。其 AlphaGenome Atlas 公开了人类基因组中所有 90 亿种可能的单字母遗传变化的预测影响,WeatherNext 3 天气模型则将提前一天或更久的降水预报准确率提高了 50%。
Google 宣布其技术与产品已支持超过 300 种语言,覆盖全球 86% 的人口。Gemini 3.5 Live Translate 支持 70 种语言的实时口语翻译,而基于 1200 万小时音频训练的通用语音模型正助力实现“千种语言计划”。
Google AI 正通过与全球社区和研究人员的合作,将 AI 工具应用于疾病防治、自然灾害预测、教育扩展和创造经济机会等关键领域。这些合作旨在将 AI 突破转化为可衡量的现实影响,确保更多人能共享 AI 带来的机遇。
Gergely Orosz 访谈 OpenAI 七位工程负责人,揭示 Codex 已成为公司核心工具,非工程团队使用率从 0% 升至 90%,并构建了包含自动代码生成、智能体代码审查、部署与监控的‘智能体软件工厂’。
推荐理由:原文通过实地访谈和流程图展示了 OpenAI 如何用 Codex 构建智能体驱动的软件工厂,读者可借此理解 AI 工具如何重塑工程实践。
NVIDIA FLARE 提供了跨 Docker、Kubernetes 和 Slurm 等异构基础设施扩展联邦学习工作流的能力。该框架使多个研究项目能在共享的 GPU 资源上保持隔离运行,同时确保每个参与组织对其数据和计算资源保持控制权。
Zvi Mowshowitz 解读 Anthropic 发布的 AI 滥用报告,披露 2025 年 12 月至 2026 年 8 月间阻止的七类恶意行为,包括网络攻击、影响力操作和模型蒸馏。报告特别指出中国实验室系统性蒸馏 Claude 的行为,涉及深度求索、月之暗面和小米等机构通过虚假账户转发用户查询。作者认为尽管存在威胁,但当前滥用规模仍属可控,同时警示蒸馏行为可能加剧中美 AI 竞争。
推荐理由:作者基于 Anthropic 滥用报告,分析了 AI 模型在安全领域的实际威胁格局与中美科技竞争态势。
Google 的 AI & Economy ATLAS 项目发布了新的交互式开放数据体验,并基于与 MIT FutureTech 的合作研究揭示了科学家使用 AI 的情况。近半数受访科学家每天使用 AI,每周平均节省近 7 小时;LLM(如 Gemini)与专用模型在不同科学任务中被广泛使用。数据还显示,印度创意产业和美国技术职业的 AI 使用率分别达到全球平均的 1.6 倍和 2 倍。
上海 AI 实验室发布新一代智能体模型 Atria Dawn Preview,基于 744B 参数 MoE GLM-5.2 基座,支持 256K 上下文窗口,专注于科研与工程场景中的环境理解、工具调用和多步任务完成。
推荐理由:原文提供了模型架构、评测基准和部署方式,读者可以据此判断其在科研与工程场景中的实际应用潜力。