Together AI 解读推理服务 99.9% 可用性的含义
Together AI 阐述了其实现 99.9% 推理服务可用性所需的多数据中心冗余架构与基础设施所有权。该公司通过持续向两个设施分发实时流量并保有备用容量,以应对整个数据中心故障。其全栈所有权提供了从芯片到 token 的可见性,确保在硬件、网络、存储或软件层出现问题时能统一响应。
Together AI 阐述了其实现 99.9% 推理服务可用性所需的多数据中心冗余架构与基础设施所有权。该公司通过持续向两个设施分发实时流量并保有备用容量,以应对整个数据中心故障。其全栈所有权提供了从芯片到 token 的可见性,确保在硬件、网络、存储或软件层出现问题时能统一响应。
Weave 与 CrowdStrike Falcon AIDR 联合提供追踪、防护和修复 AI 使用的解决方案。该方案可帮助企业确保内部 AI 系统对敏感数据的处理符合规范。工具支持实时监控与响应,适用于企业级 AI 安全管理场景。
Together AI 为其 GPU 集群服务推出了一系列更新,重点提升生产环境中大规模训练和推理任务的可靠性与操作控制。新功能包括被动健康检查、自动节点修复以及基于 Slinky 1.0 重构的 Slurm-on-Kubernetes 2.0 堆栈,能够实时检测硬件故障并推荐修复方案。
公共部门面临复合型人力部署问题,需同时考虑人员技能、资质、位置及调动影响。Neo4j 的图智能平台通过构建知识层连接现有系统,提供统一视角分析人力部署。该平台不替换原有系统,而是基于结构化关系实现跨系统推理,帮助领导者快速回答复杂操作问题。
MIT 的 JARVIS 挑战赛让学生团队在四周内使用 AI 作为主要工程伙伴,设计、制造并测试小型喷气发动机。研究发现,AI 能显著加速安全关键硬件工程,但工程判断仍是决定性因素,而制造环节仍是根本性的速率限制步骤。获胜团队更依赖基础知识和团队合作,而非 AI。
Neo4j 推出 Virtual Graph,允许在 Databricks 和 Snowflake 等云数据平台直接运行 Cypher 查询和图算法,无需数据迁移。
毕马威报告显示,29% 的高管难以理解企业 AI 部署的运营成本,近半数正因成本超出预期价值而重新规划部署。Anthropic、OpenAI 和 GitHub 已从固定订阅费转向基于 token 的用量计费,高德纳预测到 2028 年 AI 编程智能体的全球平均成本将超过开发者薪资。
fal 团队构建了一个完全可控的AI视频生成管线,从3D分镜设计到最终成片,并开源了核心的3DREAL Strong v2 LoRA适配器。
推荐理由:原文详细拆解了从3D分镜到AI生成视频的完整工作流,包括具体的工具链、验证步骤和迭代经验,可供从业者复现或借鉴其方法。
FASHN 为时尚品牌提供规模化生成模特图与虚拟试穿的技术方案。其系统支持企业客户并行处理 500 个并发请求,能一次性处理整个产品目录。该方案旨在解决传统摄影的物流限制,并满足品牌对产品纹理、图案和颜色精确呈现的高要求。
Neo4j 在 HackwithBay 3.0 活动中展示了图数据库在构建自主智能体系统中的高效应用,三支获奖团队均以图结构作为系统可信数据源。VeriGraph 团队通过图数据库将研究论文转化为可执行证据链,使用 RocketRide、Butterbase 和 Daytona 实现了几乎无需胶合代码的集成。
fal 团队通过量化感知蒸馏、时间步蒸馏和内核融合等技术,将 Ideogram v4 在 1K 分辨率下的单图生成时间从 2.75 秒降至 0.44 秒,实现 6 倍加速且无可见质量损失。核心方法包括将模型量化至 FP4 并融合 RMSNorm 等后处理算子、将分类器引导蒸馏为单分支前向,以及通过分布匹配蒸馏将去噪步骤大幅减少。
推荐理由:原文详细拆解了从量化、蒸馏到内核融合的完整技术路径,为追求极致推理性能的团队提供了可复现的工程方案。
Amazon Science 发布 Turnstile,一个用 Rust 编写的代理工具,用于在智能体与模型后端之间捕获生成时的精确 token ID、log probabilities 和 loss mask,确保强化学习训练信号与模型实际经历一致。
Ollama 宣布获得 8800 万美元融资,投资方包括 Benchmark、Theory Ventures 等机构及多位个人投资者。该平台已服务 890 万开发者,并被 85% 的财富 500 强公司使用,提供在本地或云端便捷运行 GLM、Nemotron、DeepSeek、Kimi、MiniMax 等开源模型的解决方案。
fal 团队分享了为 Ideogram V4 的提示词扩展器优化 Qwen3.6 推理性能的实践。他们选择了 Qwen 3.5 35B MoE 模型,通过 PEFT 微调和知识蒸馏来平衡性能与速度。
Neo4j 支持通过 Cypher 实现混合搜索,结合全文、向量和图结构等多种信号进行检索。该方法使用 WRRF(加权倒数排名融合)对多个来源的结果进行重新排序,提升同时出现在多个搜索中的结果权重。混合搜索可应用于支持案例调查,通过技术词汇、语义相似性或图结构关系找到相关案例。
随着 AI 推理成本急剧下降,GPT-4 级别能力的成本已从 2023 年初的每百万 token 约 30 美元降至如今低于 1 美元,部分提供商甚至低于 0.1 美元。这标志着足以胜任大多数知识工作的智能正变得近乎免费,从而催生了数据系统需为 AI 智能体设计、由智能体构成以及由智能体构建的三大新挑战与机遇。
Lilian Weng 在其博客中探讨了智能体部署系统(harness)在实现递归自改进(RSI)中的核心作用,指出当前AI自改进不仅依赖模型权重更新,更依赖于对部署系统、工作流、上下文管理等非参数化组件的优化。
Together AI 在 ICML 2026 展示了涵盖智能体到 GPU 内核的全栈前沿研究成果。其 DSGym 框架包含 1000+ 个跨 10+ 领域的数据科学任务评估套件,ThunderAgent 将智能体推理吞吐量提升最高 3.6 倍。
本文指出“难以评估”是 AI 数据代理设计中的常见问题,用户无法验证输出结果,可能导致信任缺失。改进方案是提供可检查的中间数据和完整分析,如展示 SQL 查询和分布验证。该设计通过分层界面让用户能切换查看简要回答和详细分析过程,增强透明度与可信度。
Ollama 0.31 为 Gemma 4 模型引入了多 token 预测技术,在 Aider polyglot 基准测试中平均 token 生成速度提升近 90%。
Sebastian Raschka 详细介绍了如何使用开源模型(如Qwen3.6 35B-A3B、North Mini Code)和本地推理引擎(如Ollama)搭建本地编码智能体,并对比了Qwen-Code、Codex和Claude Code三种框架在速度、任务完成率和token使用上的表现。文章包含性能基准测试、安全审计建议和跨设备部署方法,提供了可复用的评估脚本和配置示例。
通过 PPO、Weave 和合成遥测技术构建可观察的机器人数据飞轮,记录失败案例并在复杂赛道上重新训练模型,验证模型恢复效果。该方法支持在训练过程中实时监控数据流动,提升模型适应能力。技术方案适用于强化学习场景,强调数据闭环对机器人系统优化的重要性。
Kimi 2.7 可通过 Weave 追踪、分析和评估逐步复杂化的软件工程任务。该模型支持在 W&B 推理平台进行部署和测试,适用于需要详细记录和评估模型行为的开发场景。用户可利用其进行代码生成、调试和性能优化的全流程管理。
Weaviate 1.38 版本正式上线,HFresh 磁盘向量索引和内置 MCP 服务器达到通用可用状态。HFresh 支持 cosine 和 l2-squared 距离度量,通过压缩存储和增量重平衡机制优化大规模数据的内存和延迟表现。MCP 服务器允许 LLM、IDE 和 AI 智能体直接与 Weaviate 交互,且新增运行时配置功能,无需重启集群即可启用或禁用写入权限。
Weights & Biases 团队在其开源 ART 训练库中引入了 ART-Optimized Megatron (AOM),实现了 12 倍更高的训练吞吐量。该优化基于 Megatron-LM 的分布式训练架构,结合 ART 的自动资源调度功能,显著提升了大规模模型训练效率。AOM 适用于需要高吞吐训练的场景,且 ART 训练库为开源,可直接用于实验和部署。
Weave 提供了对 GLM-5.2 推理过程的简易追踪与评估方法,支持开发者通过代码逐步实现。该工具帮助用户更高效地调试和优化 AI 工作流,适用于需要详细记录模型调用行为的场景。GLM-5.2 的推理功能可通过 Weave 的 API 进行集成和测试。
Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,用于评估大模型编写跨 GPU 通信 CUDA 内核的能力。在 87 个真实代码问题中,表现最佳的 GPT-5.5 在单次尝试下仅正确解决 28 个问题,其中仅 22 个快于 PyTorch + NCCL 基线。研究揭示了模型在协调 GPU 间通信、数据分区和选择最优传输机制方面存在根本性困难。
Weaviate 官方发布大规模数据导入与向量化实践指南,涵盖服务器端批处理、错误处理与重试机制、数据类型选择、多模态数据处理(如 PDF、图像、视频)以及使用 blobHash 降低存储成本的方法。
推荐理由:原文提供了大规模数据导入的完整实践指南,包括批处理、错误处理、数据类型选择和多模态处理,读者可直接用于优化现有流程。
本文提供教程,指导用户使用 W&B Inference 在 Python 中运行 Kimi K2.7 Code 模型。正文基于 moonshotai/Kimi-K2-Instruct 模型进行演示,未提及具体参数规模、benchmark 分数或价格等信息。该模型属于月之暗面(Kimi)系列,支持长上下文处理。
本报告介绍了基于 Gemma 3 270M 的紧凑型视觉-语言-动作(VLA)模型的生产级 MLOps 管道构建方法。该模型支持高效的训练与部署流程,适用于需要实时交互的场景。文章提供了可复现的代码结构与部署配置,供开发者参考实现。
Ollama 更新其 MLX 引擎,在 Apple Silicon 上实现了迄今为止的最高性能,支持 NVIDIA 的 NVFP4 量化格式以减少质量损失,并引入快照系统优化 Agent 工作流。新引擎输出速度提升最高达 20%,并允许数据中心优化的模型在桌面端运行。用户可通过下载最新版 Ollama 并使用 `ollama run gemma4:12b-mlx` 命令体验。
推荐理由:Ollama 官方介绍了其 MLX 引擎在 Apple Silicon 上的多项性能优化,包括支持 NVFP4 量化格式和新的快照系统,对本地部署和 Agent 工作流有直接影响。
Replit 推出 Agent 自定义功能,允许用户通过 Skills 和自定义指令让 AI 智能体适配团队开发规范。Skills 是可复用的指令集,按任务触发,可存储在版本控制中并与团队共享。自定义指令则始终生效,用于设定如不提交密钥、使用 TypeScript 严格模式等全局规则。
Replit 与 Databricks 集成新增用户到机器(U2M)连接器功能,支持基于 Unity Catalog 权限自动控制每个用户的数据访问范围。此次更新还开放了公测预览注册,企业团队可在 Replit 构建应用并直接部署至 Databricks,无需额外配置。Replit 提供静态 IP 支持,便于 IT 团队审批并确保与现有网络策略一致。
AWS 推出基于 Graviton5 的 EC2 M9g 和 M9gd 实例,首次搭载形式验证的 Nitro Isolation Engine,确保虚拟机隔离的数学正确性。
AWS 发布基于 Graviton5 的 M9g 和 M9gd 实例,提供更高的计算性能和能效。Graviton5 拥有 192 个核心,比 Graviton4 增加一倍,支持 DDR5-8800 内存和 PCIe gen6 接口,同时采用 3 纳米工艺和改进的分支预测能力,使数据库等真实应用性能提升最高 30%。
Replit 与软件供应链安全公司 Socket 合作推出默认启用的 Package Firewall,在网络层面实时拦截恶意或存在漏洞的软件包安装。该功能自一周前推出以来,每日拦截约 8000 个软件包,有效防范安装时即造成损害的恶意软件。当安装被拦截时,用户会收到明确提示,AI Agent 也能接收到相同信号并建议安全替代方案。
Fly.io 博客介绍了如何通过将智能体的‘大脑’(控制循环)与‘双手’(代码执行环境)分离来构建更安全的智能体。核心方法是让智能体在持久的主机中运行,但将所有有风险的命令发送到独立的、一次性的 Sprite 沙箱中执行。文章以 SpriteDoc 和 Hermes Agent 两个项目为例,展示了这种架构如何实现多用户隔离、凭据安全、成本优化,并支持通过快照恢复来应对破坏性操作。
推荐理由:文章通过两个具体项目案例,展示了如何利用沙箱隔离来构建更安全、可恢复的智能体,为开发者提供了可复用的架构思路。
Ollama 0.30 发布,通过集成 llama.cpp 提升了性能并扩展了对 GGUF 格式模型的兼容性。在 NVIDIA 硬件上,性能提升最高可达 20%;默认启用 Vulkan 支持,使 Ollama 的 GPU 加速能扩展到 AMD 和 Intel 设备。新版本支持更多模型系列,并允许用户通过 Modelfile 直接运行从 Hugging Face 下载的 GGUF 模型文件。
推荐理由:Ollama 0.30 通过集成 llama.cpp 提升了 NVIDIA 硬件性能并扩展了 GGUF 模型支持,为本地部署提供了更广泛的硬件兼容性和更便捷的模型运行方式。
Replit 发布与 Shopify 集成的智能体功能,用户可通过对话描述需求,让 Agent 自动生成定制化店铺前端、创建 Shopify 店铺并添加产品。从第一个提示到接收真实订单大约只需十分钟。用户主要在 Replit 内完成店铺设计、产品管理和运营,只需在 Shopify 进行一次性的账户登录、店铺认领和支付设置。
推荐理由:Replit 与 Shopify 的集成让用户通过对话就能创建并管理完整的电商店铺,降低了从想法到上线的门槛。
NVIDIA Nemotron 3 Ultra 模型已在 Ollama 云服务上线。这是一个 5500 亿参数(每 token 激活 550 亿)的开源模型,专为长流程智能体工作流设计,支持高达 100 万 token 的上下文窗口,并在智能体生产力、指令遵循和长上下文任务上具有领先的准确性和吞吐量。
推荐理由:原文提供了模型的核心参数、设计目标和性能基准,读者可以据此评估其在长流程智能体任务中的适用性。