特斯拉 AI5 芯片内存容量在马斯克发言中两度调整,最终定为 96GB
埃隆·马斯克在社交平台上将特斯拉下一代 AI5 芯片的 LPDDR5 内存容量从原计划的 144GB 先下调至 72GB,随后又上调至 96GB。此次调整旨在确保 Optimus 人形机器人量产所需的芯片供应并降低成本,马斯克称对机器人性能影响预计微乎其微。AI6 芯片的 LPDDR6 内存则从原计划削减约三分之一至 144GB,目前未见再次调整。
埃隆·马斯克在社交平台上将特斯拉下一代 AI5 芯片的 LPDDR5 内存容量从原计划的 144GB 先下调至 72GB,随后又上调至 96GB。此次调整旨在确保 Optimus 人形机器人量产所需的芯片供应并降低成本,马斯克称对机器人性能影响预计微乎其微。AI6 芯片的 LPDDR6 内存则从原计划削减约三分之一至 144GB,目前未见再次调整。
技嘉推出 AI TOP 100 B850 桌面 AI 工作站,其双 AMD Radeon AI PRO R9700 显卡方案提供总计 64GB 显存,可支持高达 2350 亿参数模型的本地推理。
开发者通过定制软件将 iPhone 17 Pro Max 与 M4 Pro MacBook Pro 连接,作为额外计算节点协同运行 Qwen3.8-27B 模型,显著提升了预填充性能。在 16K 上下文窗口下,处理速度从每秒 109 个 Token 提升至 157 个 Token,增幅达 44%。该方案通过 USB-C 接口实现流水线计算,但目前需要专门软件支持,尚不适用于普通用户直接部署。
华擎宣布其 5L 紧凑型台式机 DeskSlim X600 和 B760 正式支持 NVIDIA RTX PRO 4000 Blackwell SFF Edition 与 RTX PRO 2000 Blackwell 专业显卡。该机型配备 PCIe Gen5 ×16 插槽,兼容 200mm 长的半高双槽扩展卡。搭配这些显卡后,它可作为本地 AI 推理、内容创作及图形密集型专业应用的紧凑平台。
作者成功将 Muse Gadget SDK 移植到仅有 321 KB RAM 的 Xteink X3 电子阅读器上,实现了通过 Wi-Fi 连接 Muse AI 并显示待办事项、笔记等内容。
推荐理由:作者分享了在内存极有限的 ESP32-C3 设备上适配 Muse SDK 的具体步骤和内存优化技巧,为其他端侧 AI 项目提供了可参考的工程经验。
微软宣布将系统性地优化 Windows 11 以减少内存占用,以应对内存成本上涨和 8GB 内存设备普及带来的挑战。优化工作覆盖内存管理器、压缩机制及 WinUI 3 等底层架构,旨在让操作系统和应用程序同时减少不必要的消耗。这些调整将逐步体现在未来更新中,为用户提供更多 AI 功能的自主控制选项,以按需加载的方式减少系统负担。
随着 Claude Code 等编码智能体及低代码工具的普及,企业正面临智能体蔓延带来的治理挑战,平均财富 500 强企业到 2028 年预计将使用超过 15 万个 AI 智能体。治理框架已从针对单一智能体的四大支柱(生命周期管理、风险管理、安全与可观测性)演变为需在规模化基础设施上集中执行全局策略。规模化治理的关键在于构建一个统一的控制平面,以集中追踪、权限管理和审计整个智能体集群。
Aleph Alpha 发布了 Kolibri-1,这是一个采用混合专家架构的开源权重英德双语大语言模型。模型总参数量为 781 亿,但每个 token 仅激活 34.6 亿参数,支持长达 1,048,576 token 的上下文,并附带 Apache 2.0 许可证。
AWS 团队开源了 Pizza Bot,这是一个自托管应用,旨在让 AI 智能体在后台运行任务并通过收件箱式界面返回结果。它支持定时或 Webhook 触发的任务,可将工作委派给专用智能体,并在需要时暂停等待人工批准。该工具采用客户端-服务器架构,将智能体状态、线程和日志持久化存储在用户本地文件夹中,数据仅发送至用户配置的模型提供商和明确启用的 MCP 服务器。
推荐理由:原文介绍了这个开源工具的设计理念、核心功能与本地优先架构,读者可以了解它如何管理异步任务流。
马斯克确认正与台积电讨论其 Terafab 芯片制造项目的合作可能,旨在为 Tesla、SpaceX 和 xAI 确保海量定制芯片供应。该项目一期投资 168 亿美元,长期目标年产约 1TW AI 算力,并已计划采用英特尔的 14A 工艺。此举被视为马斯克在推进这一超大规模项目时,为降低风险、确保产能而寻求多元供应商的策略。
ChatGPT for macOS 近期新版本存在高 CPU 占用问题,导致 Mac 温度升高和风扇持续运转。回滚至 9 月 23 日发布的 26.917.62051 版本后,CPU 占用率从约 150% 降至 30%,温度随之下降且风扇停转。用户可通过提供的下载地址获取该历史版本进行替换安装。
FDE(前线部署工程师)已成为AI时代热门岗位,海外年薪中位数约20万美元,国内大厂月薪高达三五万。其核心工作从传统部署转向帮客户梳理业务本体(Ontology)并设计AI应用,沟通需求时间占七成以上。该岗位模式多样,既有大厂推广自家产品的FDE,也有独立接单的“土FDE”,后者业务模式正偏向AI咨询与培训。
NVIDIA IsaacTeleop 框架通过基于图的重定向引擎,将 XR 手部追踪和运动控制器输入转换为仿真及真实机器人的指令。本教程使用 NumPy 构建所有输入,在普通 Colab CPU 上逐步演示了从生成合成手部与控制器数据、编写可实时调参的重定向器,到驱动内置夹爪和 SE(3) 重定向器并构建完整动作图的全过程。
Archestra 发布了开源安全引擎 OpenAPPA,旨在防止由提示词注入或模型幻觉导致的数据泄露。该引擎在 Bench-Corp 和 AgentThreatBench 安全基准测试中实现了 0% 的攻击成功率,任务完成率为 89%。
推荐理由:原文提供了开源安全引擎 OpenAPPA 在两大基准测试中的零攻击成功率数据,并与 Claude Code、Microsoft FIDES 进行了对比。
Simon Willison 主张付费 API 和云服务应将硬性预算上限设为默认功能,以防范因 AI 智能体或代码意外运行导致的高额账单。AWS 已于 9 月推出月度支出限制功能,Google Cloud 也在 7 月推出了名为“Spend Caps”的类似服务。作者希望 AI 智能体能主动推荐提供硬性预算上限的服务商,以保护开发者。
在 Bank of America Private Tech Trailblazers Conference 2026 上,行业专家指出 AI 增长的下一个浪潮在于垂直领域。
DoorDash 的 GenAI Platform 团队分享了其平台构建历程,从 2023 年 4 月启动,专注于为产品工程师提供支持,并优化准确性、延迟和成本。该平台目前拥有超过 5000 名内部用户,每日新增 45 人,其中 40% 为非工程师。团队经历了从服务机器学习工程师到面向所有工程师,再到支持法律、销售等非技术用户的客户转变。
DeepSeek弹性计算团队正在大量招聘资深工程师,其技术报告《DeepSeek弹性计算(DSec):面向大规模Agent训练的沙盒基础设施》披露了相关细节。DSec是支撑DeepSeek-V4系列模型训练、评测和数据预处理的沙盒基础设施,目前一个扩展分片包含约160台服务器,每天服务约300万个沙盒,高峰期同时在线沙盒超过38万个。
IBM 已正式发布其智能体软件开发平台 Bob 的自托管部署选项,支持在企业本地、私有云或隔离网络中运行。客户需自行提供并托管支持的模型,如 NVIDIA Nemotron 或 Poolside Laguna 以实现完全隔离,也可通过混合模式将部分工作负载路由至 Claude、Gemini 或 GPT 等外部模型。该版本还包含针对 Java、IBM i 和 IBM Z 现代化的高级功能包。
Prime Intellect 推出了 Prime Inference,一个为前沿开源模型提供无服务器端点和预留容量服务的推理平台。该平台基于 NVIDIA Dynamo、vLLM、Mooncake 和 FlashInfer 等技术栈构建,支持 OpenAI 兼容 API,并公布了在 GB200 NVL72 硬件上运行 GLM-5.3 的性能基准数据。
决策 AI 模型是一种返回带概率的决策而非生成文本的新模型类别,适用于分类、路由、评分等需要确定性答案的场景。TypeSafe AI 的 Jev 是该领域的代表,定价为每百万输入 token 0.042 美元,输出免费;Fastino Labs 随后推出了竞品 GLiDE 和开源模型 GLiNER2.5-Decide,同时社区也出现了多个开源复现项目。
推荐理由:文章对比了多款决策模型的核心能力、定价和适用场景,为开发者选择工具提供了具体参考。
TypeSafe AI联合创始人兼CEO Diogo Almeida在访谈中阐述了其模型Jev的理念,即AI应作为可靠、可编程的决策内核(System-One)嵌入软件,而非聊天工具。
推荐理由:访谈呈现了TypeSafe创始人关于AI应专注于可靠、可编程决策而非聊天的核心观点,以及他对行业现状的批判。
CrowdStrike 与 CoreWeave 合作,将安全数据与基础设施能力结合,旨在实现机器速度的 AI 原生网络安全防御。双方通过对抗性共同进化,利用攻击数据训练防御模型,并将自动化安全措施集成到持续运行的系统中。CrowdStrike 观察到 2025 年最快的 eCrime 攻击突破时间仅为 27 秒,凸显了快速响应的紧迫性。
亚马逊计划将价值约80亿美元的AI芯片剥离至一家特殊目的载体(SPV),然后通过租赁协议继续使用。这些芯片主要是Nvidia的Grace Blackwell加速器,数量估计在11.4万至13.3万台之间,分布在五个数据中心。此举旨在优化资产负债表结构,改善债务权益比率。
NetApp 通过其混合云工具和 NetApp Console,将存储基础设施的运维操作交由 AI 智能体执行,但由人类设定策略和边界。AI 智能体可实时实施服务质量规则,确保符合边界条件,并生成审计追踪供人类跟进。这一模式强调在数据治理中,需将机器或智能体纳入 RACI 责任分配框架,明确数据所有权和访问权限。
IBM 与 CoreWeave 合作设计了一套针对 AI 智能体工作负载的控制方案,重点解决工作负载隔离问题。双方围绕身份管理和工作负载控制进行了联合工程开发,并利用 CoreWeave Sandboxes 支持在专用基础设施或托管无服务器运行时上的隔离执行。该方案旨在为从模型训练到执行智能体代码的多样化研究负载提供安全且可扩展的基础设施支持。
研究团队将 Helion 集成到 vLLM 的线性后端,以探索其自动调优的高层内核 DSL 如何提升大语言模型推理性能并降低内核实现复杂度。在 NVIDIA Hopper GPU 上,该后端通过逐形状调优与混合调度,在评估的模型中性能超越了 vLLM 默认的 CUTLASS 和 DeepGEMM 后端,部分工作负载的吞吐量提升超过 10%。
Talkdesk 与 NewtonX 的调研显示,98% 的企业已在客户体验中使用 AI,但仅 15% 能结合编排实现端到端需求解决。阻碍自动化的主要因素是合规、系统割裂和遗留基础设施等非模型问题。CXA 领导者自主解决超过 40% 客户问题的可能性是规模化企业的四倍。
Allen Institute for AI (Ai2) 发布了用于高效训练混合专家大语言模型的开发框架 Olmo-core 3。该框架使 MoE 模型能在保持计算效率的同时扩展至万亿参数规模,在 Nvidia B3000 GPU 上对 470 亿参数模型的训练吞吐量达到每秒 52,000 个 token,较 Nvidia Megatron-core 架构提升约 2.7 倍。
OpenAI 为初创公司发布了一份 GPT-6 模型家族的使用指南。该指南涵盖了模型选择、推理力度调整、提示词与技能优化、工具协调以及生产环境工作流准备等关键主题。
MIT Technology Review 报告指出,企业 AI 正从工具转向“智能体化”运营模式,这要求企业同步重构数据架构与运营模式。2026年全球AI投资预计达2.5万亿美元,但多数企业仍未通过AI实现收入增长。报告发现,持续获得回报的企业将流程重构置于模型选择之前,并依赖可组合的、主权可控的数据基础来赋能AI智能体。
AWS 博客介绍了名为 Adjudicated Query 的设计模式,用于在 Amazon Quick 聊天界面中处理大规模、高风险的合规审查。该模式将自然语言查询转换为对确定性规则引擎的固定调用,确保审查的完整性与可验证性,适用于租赁合规、制裁筛查等多个领域。
通过 Amazon Bedrock AgentCore Gateway 可将 Claude Desktop 连接到 Web Search 功能,以获取模型训练截止日期后的实时信息。
使用 Amazon SageMaker AI 多轮强化学习(MTRL)微调 Qwen3.6-27B 模型,构建了一个自主使用 BM25 和向量搜索工具的搜索智能体。
Uber Eats 重构了其搜索流水线,实现了端到端搜索延迟降低 50%。优化涉及检索、特征提取、排序、广告和基础设施等多个层面,其中将主要延迟指标改为 Above-the-Fold 完成时间,并借此提升了超过 200 毫秒。公司目前正在探索端到端微批处理、基于产品的检索和 Zero Pass Ranking 等进一步优化方向。
BetterHelp 首席增长官 Sara Brooks 通过创建 AI Excellence 职能和采用 WRITER 平台,在公司内部构建了 AI 原生营销引擎。团队利用 WRITER 存储品牌资产并生成内容,开发了从策略到创意的端到端智能体化活动流程,并通过 A/B 测试验证了其效果。Sara 本人每日亲自使用 WRITER 工作流,以领导者的亲身实践推动团队采用 AI。
Airbnb 采用“由内而外 AI”策略,内部使用 AI 加速产品开发并赋能客户体验,目前 60% 的代码由 AI 生成,功能交付量年增近 80%。客户支持方面,AI 已能独立解决约一半的工单。公司利用名为 Everest 的内部上下文图谱等技术,将杂货配送等新服务的开发周期从数月缩短至数周。
NVIDIA 发布 DGX Spark 64GB 内存配置,为开发者提供更低成本的本地 AI 开发与部署平台。该配置支持高达 1000 亿参数的模型完全在设备上运行,并可通过 NVIDIA Sync Cluster Assistant 将两台设备集群,将内存扩展至 128GB,在 Qwen 3.8 27B 测试中实现最高 1.7 倍的性能提升。
推荐理由:NVIDIA 为 DGX Spark 推出更低内存配置,降低了本地 AI 开发的门槛,并展示了通过集群扩展性能的具体方法。
Cloudflare Impact 项目已通过超过 750 万美元的积分支持了 30 个非营利组织,利用其开发者服务构建自动化工具。这些组织借助 Workers AI 和 AI Gateway 等服务,在保障安全与隐私的同时,以轻量、无服务器架构低成本地开发和运行应用。
CoreWeave 高级副总裁指出,GPU 的布线与供电配置能导致 AI 延迟产生数个数量级的差异。该公司推出的 CoreWeave Forge 开发层在一个互联环境中运行训练、推理、评估和智能体开发。同时,LlamaIndex 作为一家专注于文档解析与提取的模型构建商,其 75% 的工作负载是推理,并依赖专业云服务来应对突发性需求。