Midjourney 更新:新增编辑功能、缩略图预览及其他改进
Midjourney 在 alpha.midjourney.com 推出了编辑模型,支持对图像进行局部修改并保持画质,同时改进了 inpainting 和 outpainting 功能。用户可通过缩略图预览不同风格下的提示词效果,并使用“Live previews”功能实时查看。此外,--tile 参数在 V8.1/8.2 版本中优化,使拼接图像的接缝更不明显。
Midjourney 在 alpha.midjourney.com 推出了编辑模型,支持对图像进行局部修改并保持画质,同时改进了 inpainting 和 outpainting 功能。用户可通过缩略图预览不同风格下的提示词效果,并使用“Live previews”功能实时查看。此外,--tile 参数在 V8.1/8.2 版本中优化,使拼接图像的接缝更不明显。
LangSmith Engine v2 引入红队测试功能,用于主动发现智能体在生产环境中的潜在问题,如幻觉和系统提示违规。该版本可检测更隐蔽的性能问题,如延迟和成本趋势,并在提交修复前自动验证其有效性。目前红队测试功能已向现有 LangSmith 部署用户开放私有测试,支持 SaaS 部署的 Plus 和 Enterprise 计划用户可立即启用。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,通过低延迟视频流与语音同步,实现企业级虚拟代理的近实时视觉交互。该功能支持多语言无缝切换、异步工具调用与持续对话,具备精确唇形同步与自然表情,企业可通过参考图像定制专属动画形象,目前仅对 Gemini Enterprise 用户开放。所有生成内容均嵌入 SynthID 水印以确保可追溯性。
推荐理由:原文给出了功能组合和企业可用性,读者可以据此判断其在交互场景中的部署价值。
LangSmith 现在推出 Trajectories 功能,提供智能体会话的按时间顺序排列的可读视图。该功能可聚合人类、AI 和工具的消息,按首次出现顺序展示,便于调试和评估智能体行为。
LangChain 发布 LangSmith Fine-Tuning 及其 CLI 工具 smithtune,支持从 LangSmith 轨迹数据中自动构建训练集、使用 Fireworks 或 Baseten 进行 LoRA 微调,并在 LangSmith 中评估模型性能。该工具专为后训练优化设计,支持监督微调(SFT),可提升模型在特定任务上的表现,同时降低推理成本与延迟。
推荐理由:原文给出了从数据到训练再到部署的完整流程,读者可以据此评估其对开发效率的影响。
Managed Deep Agents 0.8 新增用户级记忆、身份认证、HTTP 通道和 Slack 文件传输功能,支持更安全的生产环境代理运行。该版本通过 LangSmith Context Hub 提供持久化记忆存储,区分代理级和用户级上下文,防止信息泄露。用户可通过配置访问策略控制记忆使用范围,适用于客服、研究等多场景。
Google 推出 Gemini 3.8 Live with Live Avatar,支持实时视频生成与语音同步,具备自然唇形同步、表情和多语言切换能力,可在对话中异步调用工具,适用于企业客户服务和交互式场景,当前仅在 Gemini Enterprise 中提供。
推荐理由:原文说明了实时视频生成与语音同步、多语言支持和异步工具调用能力,企业用户可据此评估其在客户服务或交互式场景中的应用潜力。
Hyper3D 上线 Agentic Mode,将 Hyper3D Rodin 与 LLM 多模态上下文分析能力整合,实现自主理解输入并选择建模路径。该模式支持从非标准素材中提取主体信息、自动增强细节,并能生成可调整的 Low-poly N-GONS 模型与动画预设。
Hugging Face 发布了 LFM2.5-VL-3B 的 DSpark 草稿模型,推理速度在设备端最高提升 3.13 倍,在 H100 GPU 上最高提升 2.66 倍,参数量增加约 280M,仅占原模型的 8.9%。
Remedy Entertainment 的《CONTROL Resonant》本周在 GeForce NOW 云游戏平台上线。购买 12 个月 GeForce NOW Ultimate 会员至 9 月 27 日可免费获得该游戏,并享受 GeForce RTX 5080 级别的云端性能。此外,GeForce NOW 支持即将登陆 Googlebooks 笔记本电脑,且本周另有九款新游戏加入平台。
Vercel 将其私有的漏洞赏金计划与开源项目赏金计划合并,推出统一的公开 Bug Bounty 计划。该计划通过 HackerOne 平台运行,覆盖 Vercel 平台所有产品及开源项目。安全团队已优化流程以应对 AI 带来的报告量激增,致力于快速响应和透明沟通。
Midjourney 在 alpha.midjourney.com 上发布了最新一轮功能更新,包括样式预览、默认参数设置、创建界面视觉刷新、搜索与归档改进、编辑功能增强、项目组织优化等。用户现在可以在样式侧边栏中启用“实时预览”,并支持在项目流中切换网格或列表视图。韩语功能已于上周在 Alpha 版本上线,现已对所有 midjourney.com 用户开放。
vLLM 提出一种基于语言模型生成过程随机性的文本水印技术,通过双密钥机制在不改变输出分布的前提下实现可检测的溯源信号。该方法利用 Gumbel-max 技巧,在每个生成步骤中使用伪随机函数生成与上下文和候选 token 相关的可复现噪声,确保水印在文本被修改后仍可识别。实验显示,Qwen3.5-27B 在启用双密钥水印后,GSM8K、MBPP 和 IFEval 的性能仅略有下降,误差范围重叠。
Meta 推出 Private Processing 技术,用于 AI 眼镜,确保用户数据在云端处理时对 Meta 不可见。该技术基于可信执行环境(TEE),通过加密存储和不可追踪性增强隐私保护。AI 眼镜需处理大量个人上下文信息,传统云架构无法满足隐私与计算需求,Private Processing 提供了安全的解决方案。
Vercel Connect 新增对 TanStack AI 的支持,允许其构建的智能体通过 OAuth 安全调用 MCP 服务器而无需管理凭证。新的 `@vercel/connect/tanstack-ai` 子路径导出 `connectMCPTransport` 函数,可在每次 MCP 请求前自动附加认证提供者以获取最新 token。
GitHub Copilot 应用重构了 Pull Request 视图,以应对包含 2200 个文件、超百万行更改和 400 多条行内评论的极端大型代码审查场景。新架构将文档高度拆分为确定性的代码几何与动态区块几何两部分,解决了评论内容高度不可预测导致的滚动跳跃问题。通过虚拟化、惰性测量和独立几何管理,确保了即使在超大规模差异和对话下,审查体验依然快速流畅。
Google Beam 宣布将其全球覆盖范围扩展至美国、加拿大、英国、法国、德国和日本六个国家。一项为期八周的内部研究显示,使用 Beam 的 Google 团队感觉彼此联系紧密程度提升了 50%,并减少了 21% 的后续会议需求。Google 还与 Industrious 合作创建首个 Beam 扩展网络,并已获得 Netflix 等首批客户。
OpenAI于9月22日发布GPT-6 Sol和Luna模型,将价格下调50%,其中GPT-6 Sol输入价格为每百万token 2美元,输出为10美元;GPT-6 Luna输入为0.10美元,输出为0.50美元,均低于前代GPT-5.6对应模型。
推荐理由:原文给出了GPT-6 Sol和Luna的定价细节和对比,读者可以据此判断其在企业级应用中的成本优势和竞争定位。
Microsoft Research 的研究表明,将物理 AI 机器人的推理任务从机载 GPU 卸载到边缘或云端,能显著提升任务成功率并延长电池续航。在移动操作任务中,卸载推理使障碍物及时检测率提升30%,并将机器人手臂交接物体的成功率提高了50%。该研究还引入了基于 Kubernetes 的工具集,用于在机器人、边缘和云端之间容器化与编排 AI 工作负载。
Gemini 开始推出连接应用功能,用户可在单一界面管理项目、设计创意资产和规划健身计划。此次更新支持连接 Airtable、Linear、Adobe 等多个领域的工具,涵盖生产力、创意和生活方式类应用。用户可通过设置或在聊天中使用 @ 提及或直接提问来调用这些应用。
Google 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款新语音模型,支持通过自然语言提示创建自定义角色声音、复制语音、多语言生成及双人对话场景控制。
Neo4j 2026.09 版本引入重评分二进制向量搜索,相比 2026.08 版本,检索吞吐量提升约 5 倍,查询延迟也更优。该技术通过使用高度压缩的二进制量化向量进行初步搜索,再用完整精度向量进行重评分,显著降低内存占用。在 768 维 Float32 嵌入向量场景下,相同内存预算下可存储的向量数量约为之前标量量化(8 位)的 4 倍。
Google 的 Gemini 3.8 Flash-Lite TTS 和 Gemini 3.8 Flash TTS 模型现已在 AI Gateway 平台可用。两款模型支持超过 100 种语言的文本转语音,具备长文本叙述、音调语速控制和双人对话功能。开发者可通过 AI SDK 7 或更高版本调用模型 ID 进行语音生成。
Vercel Sandbox 的 Drives 功能已在 Hobby、Pro 和 Enterprise 计划中开放公开测试版。Drives 是一种持久存储,可作为目录挂载到沙盒中,用于保存 AI 智能体的工作区或磁盘记忆,并可跨不同沙盒实例复用。每个沙盒最多可挂载四个 Drives,默认最大容量为 1 TiB,并可配置至 16 TiB。
NVIDIA Confidential Computing 通过内存加密的机密虚拟机与机密 GPU,为处理敏感信息的大语言模型推理工作负载提供可信执行环境。该方案旨在满足个人、企业及受监管场景下对数据与模型上下文隐私保护的需求。
NVIDIA 推出 Topograph,通过拓扑感知调度优化 AI 工厂中 GPU 工作负载的放置。该技术旨在减少因拓扑域碎片化和跨共享链路通信导致的吞吐量下降与作业成本上升问题,从而提升整体系统效率。
vLLM 正在引入一套新的硬件无关层,旨在确保项目在追求前沿 GPU 性能的同时,能继续支持多样化硬件和模型。这套新层遵循可编译、可扩展、隔离和可移植四大设计原则,已在 transformers 后端中提供初步支持。在 NVIDIA H100 GPU 上的测试表明,其 token 吞吐量与原生实现相比差距在 3.4% 以内。
NVIDIA 为游戏开发者推出 DLSS 5,其核心是 DLSS 3D-Guided Neural Rendering 技术和精细控制功能,可帮助开发者添加逼真的光照与材质细节。同时更新的还包括 NVIDIA ACE、RTX Mega Geometry 2.0 以及 RTX Kit,涉及角色 AI、高密度几何体和渲染工作流。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 模型现已在 Vercel AI Gateway 上线。GPT-6 Sol 适用于需要持续调查的复杂编码和智能体工作流,GPT-6 Luna 则是高吞吐量、重复性任务的高性价比选择。相比 GPT-5.6,两者在事实可靠性、沟通直接性和避免误导性代码完成声明方面有所改进。
推荐理由:Vercel AI Gateway 新增了 OpenAI 的两个 GPT-6 变体,并说明了各自在价格、适用场景和可靠性上的定位差异。
vLLM 官方发布 vllm-metal v0.28.0,将 vLLM 的调度器、分页 KV 缓存和 OpenAI 兼容服务移植到 Apple Silicon,通过 MLX 和 Metal 执行。
推荐理由:原文给出了在 Apple Silicon 上并发服务的性能数据和部署方式,读者可以据此判断其在本地推理场景下的可用性与效率提升。
Anthropic 的 Claude Opus 5.5 模型现已在 Vercel AI Gateway 上线,可通过 anthropic/claude-opus-5.5 调用。
推荐理由:原文给出了新模型在 Vercel AI Gateway 上的可用性、核心能力变化和关键 API 变更,读者可以据此判断如何接入和使用。
NVIDIA TensorRT 11.0 引入了多设备推理功能,允许单个 TensorRT 网络利用 NCCL 分布式集合在多个 GPU 上执行,同时保持 TensorRT 的推理优化。该功能旨在解决生成式 AI 对计算和内存日益增长的需求,并已在 NVIDIA Dynamo-Triton 中得到支持。
Vercel Connect 新增了对 Microsoft Teams 的托管连接器支持。该连接器可为组织创建一个 Teams 机器人,供应用和智能体运行,用户可在频道中 @提及或直接发送消息,代码将以机器人身份接收并回复消息。作为 Vercel 托管连接器,Vercel 会在租户中注册 Entra 应用和 Azure Bot 资源,无需存储客户端密钥,管理员完成一次性设置即可。
Meta 开源了 Rebalancer,一个用于解决资源分配问题的通用高性能库,已在其基础设施中使用九年。该库通过分离问题定义、存储、求解和调试等环节,提升可用性与可扩展性,并支持将问题转化为可由本地搜索启发式或混合整数规划求解器处理的表达图。Rebalancer 提供了描述分配问题的 API,支持多种约束和目标,适用于服务器、任务、流量路由等场景。
NVIDIA Earth-2 平台帮助能源、应急管理等天气敏感行业整合来自资产、雷达和卫星的本地观测数据。该平台旨在利用这些实时数据,辅助组织理解和应对跨领域的物理风险。
Cloudflare Python Workers 现已正式发布,成为 Cloudflare 开发者平台的一等支持语言。Python Workers 原生支持所有 Cloudflare 绑定,开发者能以 Pythonic 方式无缝使用 Workers AI、R2、D1 等服务,并可直接运行 FastAPI、Django、Flask 等流行 Web 框架。
Vercel AI Gateway 现已支持通过现有 TypeSafe 客户端或 HTTP API 调用 TypeSafe AI 的 Jev 概率决策模型。Jev 接收状态并输出带有概率的强类型答案,无需解析生成文本。所有调用路径均通过 AI Gateway 计费,并可在使用情况和可观测性面板中与其他模型调用一同查看。
小米的 MiMo V2.6 Pro、MiMo V2.6 Flash 和 MiMo V2.6 Pro UltraSpeed 三款模型现已在 AI Gateway 平台上线。
SpaceXAI 的 Grok 4.7 现已在 Vercel AI Gateway 上提供,模型 ID 为 spacexai/grok-4.7。在 9 月 27 日前使用该模型的请求自动享受 40% 折扣。
推荐理由:原文提供了 Grok 4.7 在 Vercel 平台的具体接入方式和限时折扣,读者可以据此评估其部署成本和使用门槛。
mcp-handler v2.2.0 版本新增了对 WebMCP 标准的实验性支持,允许开发者通过添加脚本标签将现有 MCP 工具暴露给浏览器内的智能体。该功能通过代理调用支持已登录用户的认证工具,无需浏览器端 OAuth 流程。