Sakana Chat 更新:全用户可用最新模型 Fugu Max,新增记忆功能
Sakana Chat 今日更新,将此前通过 API 公开的模型「Fugu Max」提供给所有用户,并新增记忆功能以延续会话内容。Fugu Max 是一款整合多个开源模型、根据提示内容自动分配最优模型处理任务的模型,无需额外设置即可使用。记忆功能可让用户在后续对话中保留已设定的角色、项目背景等信息,但仅适用于本次更新后的会话,此前对话内容不会被保留。
Sakana Chat 今日更新,将此前通过 API 公开的模型「Fugu Max」提供给所有用户,并新增记忆功能以延续会话内容。Fugu Max 是一款整合多个开源模型、根据提示内容自动分配最优模型处理任务的模型,无需额外设置即可使用。记忆功能可让用户在后续对话中保留已设定的角色、项目背景等信息,但仅适用于本次更新后的会话,此前对话内容不会被保留。
Mistral AI 与 Mozilla 达成合作,为 Firefox 的 AI 浏览助手 Smart Window(测试版)提供模型支持。该功能将首先在法国和北美推出,预计今年晚些时候扩展至英国和德国。此次合作旨在将基于区域语言和文化背景微调的 Mistral 开放模型,与 Firefox 的隐私优先传统相结合,为用户提供更具控制力和本地化体验的 AI 浏览助手。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款新语音模型,支持近实时推理与多语言动态切换。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google 发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款实时对话模型,旨在提升语音智能体的智能和协作体验。
推荐理由:Google 官方博客宣布了其最新的实时对话模型,提供了详细的性能基准和面向不同场景的部署方案。
NVIDIA NVLink 6 为大规模 AI 工厂提供了多层弹性功能,旨在最大化集群的持续输出。在 AI 训练中,集群内每个 GPU 每秒需同步数千次梯度操作;在推理阶段,意外停机则会直接减少服务请求总量并限制收入。
Google 宣布其技术与产品已支持超过 300 种语言,覆盖全球 86% 的人口。Gemini 3.5 Live Translate 支持 70 种语言的实时口语翻译,而基于 1200 万小时音频训练的通用语音模型正助力实现“千种语言计划”。
LangChain 在 Managed Deep Agents 中推出 Connections 功能,支持管理凭据和按调用者身份识别。连接分为代理所有(agent-owned)和用户所有(user-owned)两种,前者共享凭据用于通用工具如 Tavily 搜索,后者通过 OAuth 实现用户级身份,支持 GitHub、Linear 等服务。
推荐理由:原文给出了连接管理的三种模式和代码调用方式,读者可以据此判断如何在智能体中实现安全的凭据分离与用户身份识别。
Together Fine-Tuning 新增对 GLM-5.3、Kimi K2.7、Qwen 3.8-27B 等 15 个开源模型的支持,覆盖 0.8B 至 405B 参数规模。服务提供训练中实时指标追踪、专家层 LoRA 微调、自动早停与任意有效批大小支持,验证损失下降时自动终止训练并退款。部分模型训练价格下调最高达 70%,支持通过 API、CLI 和 UI 全流程管理微调任务。
Gemini 应用今日上线 Windows 平台,提供键盘快捷键调用、专用工作区和图像视频生成功能。用户可通过 Alt + Space 快速调用 Gemini,Gemini Spark 1 可处理多步骤任务,Gemini Omni 1 支持高质量视频创作,应用运行轻量且不影响 PC 性能。
NVIDIA BioNeMo Inference Runtime (BioIR) 加速了生物分子结构预测模型在 NVIDIA GPU 上的运行。它通过优化的内核和 CUDA Graphs 等技术提升模型推理速度,同时保持了熟悉的 PyTorch 工作流程,适用于蛋白质组规模的高通量预测任务。
Replit 与 Databricks 的集成现已正式发布,支持原生 Lakebase 数据库。该集成允许企业团队在 Replit 上构建应用,并通过 Databricks 管理和提供受控的实时企业数据访问。应用部署时,Replit Agent 自动创建 Lakebase 数据库,无需手动设置,同时支持预览部署和基于角色的访问控制。
Together AI 推出抢占式计算功能,允许用户以标准按需算力价格的一半运行可中断任务,如实验、批量推理和微调。抢占式节点基于 NVIDIA 加速算力,使用未占用资源,可在五分钟后被回收,且无需额外申请替代资源。该功能当前仅支持 Kubernetes 集群,用户可通过控制台、CLI 或 API 设置抢占式算力目标并调度任务。
Google DeepMind 与电影制作团队合作,在短片《Love, Rendered》中利用生成式 AI 技术重现了一对夫妇未曾被记录的初遇记忆。团队结合图像修复模型与表演捕捉模型,将老照片复原并映射了当事人当下的细微神态。该项目展示了 AI 作为艺术媒介的潜力,相关照片修复功能已集成至 Gemini 应用中。
Google Search 为美式橄榄球赛季推出多项新功能,包括实时比赛动态、更详细的球员与联盟统计数据,并支持关联 Yahoo Fantasy 或 Sleeper 账户以获取 AI 定制的阵容建议。实时动态功能目前在美国移动端提供,关联梦幻足球账户功能也仅限美国英语用户。
WRITER 推出 Enterprise Brain,这是一个受管控的通用上下文层,能动态捕获企业的品牌、制度知识、决策逻辑和实时业务数据,供所有团队和智能体实时使用。
WRITER 推出名为 Enterprise Brain 的共享上下文系统,旨在为整个营销和收入组织的 AI 智能体提供公司品牌、客户和市场策略知识。该系统智能捕获团队工作中学到的决策、客户信号以及公司既定的品牌指南、合规要求等两类关键上下文,并将其转化为智能体可用的共享基础。
Weaviate 推出 HFresh,一种基于磁盘的向量索引,旨在通过降低内存使用支持更大规模的数据集。HFresh 借鉴 SPFresh 研究论文理念,采用分区策略并使用 HNSW 作为中心索引,实现高效的查询路由和可控的磁盘 I/O。该索引支持增量再平衡操作,避免了传统索引需要全量重建的问题,适用于对内存敏感且需处理大规模数据的应用场景。
Google DeepMind发布AlphaGenome Atlas,包含对人类基因组中约90亿个单核苷酸变异的分子效应预测,通过AVI评分系统整合AlphaGenome与AlphaMissense模型,支持非编码区和编码区变异的统一评估。该资源已通过网站门户、AlphaGenome API及Google Antigravity技能开放,用于罕见病研究、复杂性状分析和基因调控机制探索。
推荐理由:原文提供了90亿个单核苷酸变异的预测数据和AVI评分系统,可直接用于罕见病研究和复杂性状分析。
NVIDIA 宣布将大力投入 Rust 原生 GPU 编程,并计划在 2027 年及以后持续发展和完善 CUDA Rust 工具链。此举旨在为不断变化的 AI 模型和技术提供从推理引擎到智能体运行时的系统层支持。
Neo4j 发布 @neo4j-labs/nams-ai-provider 工具包,为 Vercel AI SDK 提供基于图数据库的持久化记忆功能,支持三种集成模式:Provider、Middleware 和 Tools,通过单行代码替换即可实现跨会话记忆,记忆内容以实体-关系图结构存储,支持检索、修正和合并实体,且保证在模型调用失败时不影响响应。
推荐理由:原文给出了集成代码示例和三种模式,读者可以据此判断如何在现有 Vercel AI SDK 项目中实现持久化记忆。
Google 的音乐生成模型 Lyria 3.5 已在 Gemini 应用和 Gemini API 中面向全球用户推出。该模型提供更具表现力的人声和更丰富的编曲,用户可在应用内选择流派、人声/器乐风格,并使用新模板快速创作。Lyria 3.5 也通过 Google Flow Music、Google AI Studio 和 Google Vids 提供给艺术家、开发者和技术人员使用。
LangChain 发布对 Model Context Protocol (MCP) 的新版支持,将 MCP 功能整合进主包 langchain.mcp,基于 FastMCP 构建,支持无状态协议、客户端缓存和中断式 elicitation。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
NVIDIA PAIR Virtual Inference Router 可聚合本地网络中多个设备的算力,为 AI 智能体提供统一的推理资源池。该工具支持多智能体协同工作流,能提升复杂任务的完成速度。
Google DeepMind 发布 WeatherNext 3,引入实时卫星数据、每小时更新、5公里分辨率,提升降水预测精度,并集成至 Search、Gemini、Maps 等产品。该模型通过直接学习观测数据,实现更精准的局部天气预测,尤其改善了拉丁美洲、非洲和亚太地区覆盖。
推荐理由:原文给出了实时卫星数据接入、小时级更新和分辨率提升等关键变化,读者可据此评估其对气象服务的影响。
Fly.io 为其 Sprites 服务发布了 MCP 服务器,让 AI 智能体可以通过 MCP 协议动态创建和管理云端计算机。Sprites 是具备持久文件系统和真实网络连接的轻量级云计算机,旨在为 AI 智能体提供安全、可扩展且成本低廉的执行环境。用户可通过指定 URL 在 Claude Desktop 等支持 MCP 的工具中集成此功能,并利用预设的安全护栏控制资源使用。
Microsoft 推出 VibeVoice-ASR-Streaming-1.5B,支持流式语音识别并标注说话人身份,可自定义热词和10种语言。模型基于 microsoft/VibeVoice 项目,提供持续转录功能,适用于多语言场景。该项目采用 MIT 许可证,由微软研究院团队开发,欢迎用户反馈与合作。
Microsoft 推出 VibeVoice-ASR-Streaming-7B,支持流式语音识别并标注说话人身份,可自定义热词及10种语言。模型基于 microsoft/VibeVoice 项目,提供持续转录功能,适用于多语种场景。该项目采用 MIT 许可证,由微软研究院团队开发,欢迎用户反馈与合作。
Google 启动 Fairwind 计划,为政府机构和可信合作伙伴提供其最先进的网络防御能力。该计划首先提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具,帮助防御者自主发现并修复漏洞,在数分钟内生成已验证的、可部署的补丁。全球已有超过 650 家合作伙伴参与该计划。
Google 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,前者在编码与智能体任务中性能显著提升,后者在漏洞检测与自动修复方面达到前沿水平,均以 Flash 级别的速度和成本提供,其中 3.8 Flash Cyber 通过 Fairwind 程序向受信任的防御方开放。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google 在 2026 年 8 月发布了多款 AI 产品,包括面向编程和智能体的高效模型 Gemini 3.7 Flash,以及专为实时转录设计的 Gemini 3.5 Transcribe。同期推出的 Pixel 11 系列设备搭载了 Google Tensor G6 芯片和最新的 Gemini Nano 模型。此外,Gemini 应用的月活用户已超过 10 亿。
Google 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型推出了智能体视频理解功能。该功能通过动态搜索视频片段,将分析成本降低高达 66%,token 消耗减少高达 88%,同时将准确性提升高达 7%。
推荐理由:原文给出了新功能在成本、效率和准确性上的具体提升数据,以及支持的模型和开放入口,读者可以据此评估其对视频分析工作流的影响。
Google Workspace 推出 AI 图像创作与编辑工具 Google Pics,基于 Nano Banana 模型,提供对象分割、图内文字编辑与翻译、协作和多版本生成等功能。未来几周将向 Google AI Pro 和 Ultra 订阅者以及大多数 Workspace 商业客户开放,并将集成到 Slides、Docs 和 Drive 中,用户可在 pics.new 试用。
推荐理由:原文明确了产品定位、核心功能、集成路径和开放范围,读者可以据此判断它如何融入现有工作流。
Anthropic 推出 Enterprise Frontier Safeguards (EFS),允许客户在自有云基础设施中存储数据并控制数据审查流程,以兼顾隐私与安全检测。
NVIDIA 宣布其 BioNeMo NIM 微服务现可在 Claude Science 中运行,用于蛋白质结构预测。该集成使 AI 科学家能够调用专门的模型来辅助科学研究的假设提出与实验规划环节。
NVIDIA Omniverse NuRec 平台旨在帮助开发者将感知软件栈适配到不同车型。该平台通过合成数据生成,能模拟传感器位置、校准、视场、遮挡和车身几何等关键参数的差异。这有助于解决因车型变更导致的感知性能变化问题,加速自动驾驶系统的开发与验证。
JuliaHub 推出了 AI 平台 Dyad 3.0,以帮助工程团队加速开发火箭、热泵和卫星等复杂物理系统。该平台允许工程师上传数据和设计文档,由自主 AI 智能体进行物理模拟、安全分析和质量控制,实现“代理式”硬件设计。其底层编程语言 Julia 拥有超过 100 万用户,采用即时编译技术,旨在为科学家和工程师提供兼具易用性与高性能的编程工具。
Ollama 的 Pro、Max 和 Team 订阅计划现已采用透明的按 token 计费模式,每个计划均包含每月使用额度。Pro 计划每月 20 美元含 60 美元额度,Max 计划每月 100 美元含 300 美元额度,Team 计划每月 500 美元含 1000 美元共享额度。新定价无服务费和数据保留,支持 Claude Code 和 Codex 等流行编程智能体,并提供 API。
NVIDIA TensorRT Model Connect 开源参考实现集合简化了将开源 AI 模型集成到原生应用的过程。该工具通过两条命令,即可将模型从检查点部署到 NVIDIA TensorRT 推理环境,减少了模型特定的转换、预处理和后处理代码需求。
Google 为 Search 中的 AI Mode 新增了航班价格追踪、积分里程显示和酒店直接预订三项旅行功能。航班价格追踪覆盖全球超 180 个国家和地区,酒店预订功能已在美国英语用户中推出,并集成了 Booking.com、Expedia 等多家合作伙伴。
LangChain 本月推出管理深度智能体(Managed Deep Agents)和 LLM 网关(LLM Gateway)的公开测试版,支持一键部署、成本控制和敏感数据处理。Deep Agents v0.7 版本减少 65% 的基础输入 token,同时保持性能。Stripe 和 Apollo 已分别基于 Deep Agents 构建了企业级生产力工具和 AI 助手,显著提升了效率。