智谱发布 GLM-5.3-Flash 多模态大模型
智谱发布 GLM-5.3-Flash,为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数,采用稀疏与线性注意力混合架构及 mHC 技术,支持本地部署于 SGLang、vLLM 等框架,推理成本降低至前代十分之一,性能接近 Claude Opus 4.8 在编码与智能体基准上的表现。
推荐理由:原文提供了模型架构、参数规模、部署框架和基准表现,读者可据此判断其在多模态和推理效率上的实际进展。
智谱发布 GLM-5.3-Flash,为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数,采用稀疏与线性注意力混合架构及 mHC 技术,支持本地部署于 SGLang、vLLM 等框架,推理成本降低至前代十分之一,性能接近 Claude Opus 4.8 在编码与智能体基准上的表现。
推荐理由:原文提供了模型架构、参数规模、部署框架和基准表现,读者可据此判断其在多模态和推理效率上的实际进展。
智谱发布 GLM-5.3-BF16 模型,基于 GLM-5.2 基座通过后训练提升能力,在编码、长链任务和智能体场景中表现显著增强。在 Z.ai Code Bench 上编码能力提升 50%,在 Terminal Bench 3.0、Agents' Last Exam、DeepSWE 等多个公开基准上达到开源模型 SOTA。
推荐理由:原文提供了与前代模型的基准对比和本地部署方案,读者可据此判断其在编码和智能体任务中的实际能力提升与应用适配性。
智谱发布 GLM-5.3-Flash,为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 活跃参数,支持 300,000 token 上下文,采用混合稀疏与线性注意力架构及 mHC 技术,部署框架包括 SGLang、vLLM、TokenSpeed 等,可通过 reasoning_effort 参数控制推理预算,API 服务可在 Z.ai 平台使用。
推荐理由:原文给出了模型参数、架构创新和部署框架,读者可以据此判断其在多模态和长上下文场景下的实际应用潜力。
智谱发布 GLM-5.3 模型,基于 GLM-5.2 的基础模型,通过后训练提升能力,在编码、长链任务和智能体基准上表现显著增强。在 Z.ai Code Bench 上编码能力提升 50%,在 Terminal Bench 3.0、Agents' Last Exam、CyberGym 等多个公开和内部基准中达到开源 SOTA。
推荐理由:原文提供了与多个主流模型的基准对比数据和本地部署方案,读者可据此判断其在编码和智能体任务中的相对位置与可用性。
Ollama 现已支持将 Claude Desktop 配置为第三方网关提供商。开发者可以在 Claude Desktop 中使用 Ollama 托管的开源模型或云端模型,并可在 Anthropic 模型与 Ollama 模型之间轻松切换。Ollama 默认禁用遥测,并执行零数据保留政策。
Anthropic 发起 500 万美元资助计划,支持独立研究评估 AI 对用户福祉的影响。资助将提供直接资金、模型访问和技术支持,用于构建开源评估工具。研究需明确测量标准、纳入临床专家并测试模型在预防和风险之间的平衡。
Google Research 发布了 TimesFM 3.0,这是一个用于时间序列预测的预训练基础模型,包含官方 PyTorch 权重和配置。模型采用 Stacked Mixing Transformer 架构,配备 Variate Attention 和 CPM Iterative RevIN 技术,上下文补丁长度为 32,预测时间跨度为 64。
在多模态图像识别测试中,Gemini 的表现优于 ChatGPT,能准确识别潦草手写文字并指出笔迹特征,而 ChatGPT 则出现转录错误。
Meta 发布 MetaRoCE,这是一种专为 AI 工作负载设计的 RDMA 传输协议,适用于大规模以太网环境。MetaRoCE 通过 Open Compute Project (OCP) 开源了协议规范、参考软件实现和合规测试套件。
推荐理由:Meta 开源了专为 AI 规模设计的 RDMA 传输协议 MetaRoCE,包含规范、参考实现和测试套件,可提升分布式训练和推理效率。
MIT 工程师开发了一种名为 η-learning 的机器学习算法,无需依赖历史极端事件数据即可生成未来可能发生的极端天气场景。该方法结合点统计数据和空间地图,能预测如“百年一遇”风暴的持续时间、强度和影响范围等特征。该工具还可应用于机器人导航和金融市场等其他领域,以探索罕见但合理的极端情景。
Meta发布MTIA 300训练芯片,专为推荐和排序模型训练设计,集成12个800 Gbps RDMA NIC芯片,提供1.2 TB/s I/O带宽,通信与计算分离,通过16个专用消息引擎实现通信卸载,与GPU相比通信时间提升3.9倍。芯片支持HCCL通信库,可编译通信操作为独立子图,实现主机无干预执行,适用于PyTorch框架。
推荐理由:原文详细说明了MTIA 300芯片的通信架构设计和性能提升,读者可据此理解其如何解决推荐模型训练中的通信瓶颈问题。
Mistral 与 HUMAIN 宣布达成一项价值数亿欧元的战略合作,共同推进沙特阿拉伯及中东地区的主权 AI。合作将聚焦于 AI 基础设施、先进模型开发及本地化部署,初期重点包括网络安全和语音领域,并计划开发在阿拉伯语表现强劲的前沿模型。双方还将探索利用 HUMAIN 的数据中心基础设施来满足当地不断增长的计算需求。
研究人员开发了一种系统,利用 OpenAI 的 GPT-4o-mini 模型将自然语言请求如“我迟到了,开快点”转化为对自动驾驶控制系统的参数调整。该系统通过非技术语言向乘客描述行为变化,并在实施前请求确认,使驾驶风格更符合用户偏好。测试显示,系统在模拟环境中能根据提示调整速度和驾驶平滑度,且支持用户后续互动修改。
工程师需要具备适应能力以应对 AI 带来的技术变革,但教育和职场培训往往未明确解释其含义。亚利桑那州立大学教授 Samantha Brunhaver 指出,适应性意味着识别变化并有效应对,且在不同行业中表现形式各异。微软研究员 Jenna Butler 表示,软件工程师正面临代码审查增加等挑战,需学习新工具和智能体管理以保持竞争力。
METR 研究显示,AI 在 2026 年显著加速了网络安全漏洞的发现,对数学研究有轻微加速,但对 AI 研究本身的优化尚无显著影响。SPADE 框架利用 Qwen3-30B 等模型通过自我博弈,自动生成可执行的游戏和工具使用环境,以合成数据训练智能体,在 Reasoning Gym 等基准测试上提升性能。
Canonical 正在资助一项为期三年的博士研究项目,探索是否能用 AI 将数万行 C 代码分解并转换为安全、行为正确且可维护的 Rust 代码。该项目将在布里斯托大学编程语言研究组进行,重点分析现有源代码到源代码翻译工具的不足,例如保留了 C 的不安全操作和复杂习惯用法。
千问发布 Qwen3.8-Flash-Next-FP8 模型,为基于 Qwen3.8-Flash-Next 架构的 FP8 量化版本,支持 262,144 令牌上下文,可扩展至 100 万令牌。
推荐理由:原文公开了新架构的量化模型权重、技术细节和基准结果,读者可据此评估其在长上下文和多模态任务中的效率与性能表现。
Anthropic 宣布将为 Claude 模型生成的文本输出实施水印技术,以识别内容是否由其模型生成。该水印在用户端不可见,仅 Anthropic 能够解码验证。这项技术旨在应对互联网上广泛存在的 LLM 生成文本的识别需求。
这位IEEE高级会员开发AI工具,帮助电商网站简化产品目录设置流程。他目前在密尔沃基的Amla公司担任项目经理,领导AI驱动的数字化转型项目,提升客户销售表现。其周末还从事独立研究,开发AI辅助医疗诊断工具和助残技术。
SOP-Bench 是首个结合真实企业标准操作流程(SOP)与可执行工具的 AI 智能体评测基准,由 Amazon Science 发布。该基准包含 12 个行业领域、2000 多项任务,每项任务均附带工具接口和正确结果,用于验证智能体是否能按实际流程执行。
IBM watsonx Orchestrate 可通过 Model Context Protocol (MCP) 集成 Neo4j 知识图谱和长期记忆功能,实现无需应用代码的原生代理。
一场网络研讨会将展示如何利用专为半导体设计的分析平台和 Agentic AI 加速良率异常的根因分析。该方案能整合计量数据、工具轨迹和化学分析等多领域数据,在数十亿数据点上实现高性能分析,帮助工程师更快地定位问题。
Every 网站通过收集主编 Kate Lee 的 30,000 次历史编辑数据,训练了一个复制编辑智能体,以模拟其编辑风格。该网站同时是一家产品工作室,提供 Cora、Sparkle、Spiral 和 Monologue 等 AI 工具,整合在每月 20 美元的订阅服务中。
Together AI 在 DeepSWE 基准上对比 GLM-5.3 与 Claude Fable 5,两者首试准确率分别为 69.0% 和 69.7%,差距在误差范围内。
推荐理由:在 DeepSWE 基准上,GLM-5.3 与 Claude Fable 5 在首试准确率接近,但前者成本更低、多轮表现更优,且在多数编程语言和任务领域胜出,为开发者提供明确的性价比选择。
Together AI 在 113 项 DeepSWE 任务上对比了 GLM-5.3 (max) 与 GPT-5.6 Sol (max)。GPT-5.6 Sol 在单次尝试准确率(pass@1 72.7% vs 69.0%)、可靠性和速度上保持领先,但每次尝试成本($8.37)是 GLM-5.3($3.99)的两倍多。
推荐理由:原文通过详尽的基准测试和成本分析,为开发者提供了在不同编程语言和任务类型下选择或组合使用这两个模型的决策依据。
Microsoft Copilot Studio 通过 per-user Okta SSO 与 Neo4j 集成,确保每个用户仅能访问其权限范围内的数据。该方案使用 OAuth 2.0 获取 Okta 访问令牌,并将其直接传递给 Neo4j MCP 服务器,由数据库验证权限并映射 Okta 组到 Neo4j 角色。
MIT 研究人员开发了一种新方法,可预测哪些材料最有潜力成为电化学合成氨的催化剂,以加速寻找能使这种低排放方法与哈伯法竞争的材料。该方法通过识别驱动氨生产催化活性的关键物理性质,指导寻找新的、更有效的催化剂化合物。相关开放获取研究成果已发表在《EES Catalysis》期刊上。
The Pulse 报道了 Asana 使用 AI 在两周内完成从 Enzyme 测试框架迁移的案例,AI 显著加速了大规模测试用例重写工作。Airbnb 和 Uber 也有类似经历,表明 AI 在框架迁移中具有显著优势。文章还提到 GitHub 近期宕机事件、Slack 推出 Slack Code、Claude 生成文本将添加水印以及 Uber 开源 SubmitQueue。
Microsoft Research 发布了深度学习密度泛函交换关联泛函 Skala 1.1,其训练数据量是前代版本的 2.5 倍,在 GMTKN55 基准测试的 55 个类别中,有 32 个类别排名第一。Skala 现已集成于 CP2K,并正在整合到 Psi4、FHI-aims、ORCA 和 VASP 等主流电子结构软件中,以扩大其在科学和工业工作流程中的可及性。
Slack 推出 Slack Code 功能,允许 AI 编码智能体在群聊环境中工作。智能体可以创建专用代码频道,团队成员可实时查看其工作、审查代码变更并指导调整。该功能支持 Anthropic 的 Claude、GitHub Copilot 和 OpenAI 的 ChatGPT 等智能体集成,未来将开放 API 支持更多应用场景。
推荐理由:Slack 将 AI 编码智能体引入群聊环境,展示了协作开发的新工作流可能性。
Mistral AI 发布 Agentic Search,这是一种多步骤检索层,让 AI 模型能在复杂文档中导航、阅读和验证信息。它通过五个工具(search、open、navigate、read、grep)在现有索引上工作,无需微调。
Addy Osmani 谈及从 16 岁开发浏览器到成为 Google 工程总监的经历,并分享了他对 AI 工具在软件工程中应用的看法。他指出 AI 协助开发存在“认知放弃”风险,建议工程师理解 LLM 的关键决策以避免问题。他还提到 Google 工程文化近年变化,如高管在周末进行编码,并认为软件工程师的角色将持续重要,因其在代码责任方面不可替代。
Google 发布了 TIPS — g/14 low-res (v1) 模型,该模型包含 1.1B 视觉参数和 389M 文本参数,支持生成与文本嵌入对齐的图像空间特征。模型使用 224 分辨率,图像编码无需 ImageNet 归一化,文本编码支持最大 64 个 token。模型基于 Apache 2.0 协议开源,适用于零样本分类和空间特征可视化任务。
Google 发布了 TIPS — g/14 (v1) 模型,该模型是具有空间感知能力的对比视觉-语言模型,包含 1.1B 视觉参数和 389M 文本参数,支持生成与文本嵌入对齐的图像特征。
图技术通过存储和分析数据之间的连接,使 AI 智能体能直接查询、遍历和推理关联数据,从而将模型幻觉率降低 44%。它构建知识图谱,让智能体在回答问题时能追踪多个实体之间的关系路径,而非仅依赖孤立数据片段。图技术作为企业 AI 的知识层,提供记忆、上下文和推理能力,无需替换现有数据库即可实现更准确、可解释和可治理的 AI 应用。
作者使用大语言模型(LLM)构建个人知识库,显著提升了工作中的研究效率。该方法通过将资料整理为 Markdown 格式的维基,支持持续更新和快速检索。
Replit 推出 Free Mode,用户可使用 OpenAI 的 GPT-5.6 Luna 模型,在每月订阅费用下创建 30 倍内容,日常任务不再消耗积分。新界面支持从简单聊天到复杂构建的无缝切换,提升效率与创作自由度。Pro 用户相比 Core 用户拥有更高的使用上限,复杂任务可切换至 Power Mode 或 Max Mode。
MIT CSAIL 的研究团队在《自然·通讯》上发表论文,提出‘归因衰减’现象:当生成模型在大规模数据集上训练时,移除任何单个训练图像或特定艺术家的作品,通常不会改变模型的输出。研究通过构建‘扩散集成’架构,首次实现了对训练数据影响的精确删除验证,而非依赖近似估计。这一发现对生成式 AI 的版权归属、合理使用及模型输出是否构成衍生作品等法律问题提出了新的技术视角。
2026年多位资深工程领导者在未明确规划下一份工作的情况下选择离职或长期休职,主要因创始人对AI的不切实际期望和过度干预导致工作环境恶化。部分CTO和VPE表示,AI技术被用作裁员工具而非提升工程文化的手段,使得产品质量和战略决策的重要性被削弱。一些初创公司如Ramp、Stripe和Notion被提及为仍能平衡AI与工程质量的例外。
MIT 教授 Eugene Fitzgerald 在新书《The Invisible Engine》中提出,创新是市场应用、技术与实施三者的整合,其核心是企业家承担不确定性并创造市场“惊喜”的过程。他基于在 MIT-Masdar 等大型合作研究项目中的十年实践,区分了旨在培养人才的“利他科学”、围绕目标的“战略研究”以及从研究到经济增长的“基础创新”三种不同的研究投资类型。
最多提供 50 页,更早的内容请使用搜索或主题页。