Together AI 在 NVIDIA GTC 2026 展示其最新研究与产品创新
Together AI 在 NVIDIA GTC 2026 上宣布多项合作与产品更新,旨在支持更开放、智能体化和生产就绪的 AI 系统。其模型库现已集成 NVIDIA Nemotron 3 Super 和 NVIDIA Parakeet TDT 0.6B V3 等模型,并通过 NVIDIA Dynamo 1.0 和 NemoClaw 优化推理性能。
Together AI 在 NVIDIA GTC 2026 上宣布多项合作与产品更新,旨在支持更开放、智能体化和生产就绪的 AI 系统。其模型库现已集成 NVIDIA Nemotron 3 Super 和 NVIDIA Parakeet TDT 0.6B V3 等模型,并通过 NVIDIA Dynamo 1.0 和 NemoClaw 优化推理性能。
Replit 推出与 Databricks 的新连接器,允许用户在 Replit 中直接访问 Databricks 的治理数据、模型和仓库,无需复制敏感数据。通过 Replit Agent,用户可快速构建如3D天气地球仪等数据应用,Databricks Genie 提供自然语言问答与数据溯源能力。该集成使产品经理、分析师等非工程角色能直接构建受控的企业级数据应用,缩短开发周期。
推荐理由:原文展示了Replit与Databricks的集成方式和实际应用案例,读者可以据此判断该连接器如何支持企业级数据应用的快速构建。
Berkeley AI Research 提出了 SPEX 和 ProxySPEX 算法,用于大规模识别驱动大语言模型决策的关键交互作用。SPEX 利用稀疏性和低阶性将搜索问题转化为可解的稀疏恢复问题,而 ProxySPEX 则利用层次结构特性,能以约 10 倍更少的消融操作达到与 SPEX 相当的性能。这些框架能高效应用于特征归因、数据归因和模型组件归因,提升模型的可解释性。
Together AI 推出了一个统一的解决方案,用于在共置的 STT、LLM 和 TTS 基础设施上构建实时语音智能体。该架构将整个语音技术栈保留在同一云上,旨在将端到端延迟降至 500 毫秒以下,并简化部署。平台原生集成了 Cartesia 和 Deepgram 的领先语音模型,为开发者提供了模型选择和配置的灵活性。
推荐理由:Together AI 将语音识别、大模型和语音合成整合在同一集群,为构建实时语音智能体提供了一个低延迟、可灵活选模的解决方案。
Replit 推出 Agent 4,强调在单一环境中实现设计、开发与协作的无缝整合。其四大支柱包括:自由设计(无限画布与UI变体)、快速推进(并行任务与自动拆分)、协同构建(任务流与智能排序)和统一交付(支持Web、移动、幻灯片、动画等多类型产出)。
推荐理由:原文详细说明了 Agent 4 的四大核心能力与协作模式,读者可据此判断其对开发流程的重构潜力。
Replit 推出 Vibe Code 功能,允许用户在代码环境中直接生成动态风格视频,无需依赖外部动画工作室。该功能基于 Gemini 模型构建,支持通过自然语言描述视频内容,生成类似专业工作室制作的动画片段。用户可快速生成初稿并在 Replit 内进行迭代,社区已有超过 1,800 名开发者参与相关项目。
Ruth Heasman 使用 Replit Agent 在一周内开发出 AR 鬼猎游戏 Spookseek AR,该游戏基于 Three.js 构建,通过虚拟球体投影幽灵并实现自定义 Fresnel 风格着色器。她克服了开发版与生产版行为差异带来的性能问题,最终成功提交至 TestFlight。Replit Agent 在开发过程中持续协助,甚至在模型升级后解决了此前无法解决的 bug。
Replit 开发了一套视频渲染引擎,通过注入 JavaScript 虚拟时钟,替换浏览器的 setTimeout、setInterval、requestAnimationFrame 等时间 API,使页面在受控时间流中渲染,实现帧级确定性。
推荐理由:原文详细拆解了浏览器时间虚拟化和视频渲染的工程实现,读者可据此理解如何在无框架约束下实现任意网页的确定性视频生成。
Replit 推出 Pro 计划($100/月),支持最多 15 个开发者、Turbo 模式(速度提升 2 倍)和优先支持。Core 计划价格降至 $20/月(原 $25/月),支持最多 5 人协作,且无需额外订阅。Teams 计划将于 2026 年 3 月 3 日起逐步停用,用户将自动升级至 Pro 且无需额外付费。
针对视频扩散模型长序列处理的 Ulysses 上下文并行方法,通过异步执行和融合投影优化了通信与计算的重叠。在 8 块 B200 GPU 的基准测试中,异步 Ulysses 使预注意力块延迟降低约 23–25%,端到端性能提升约 3%;融合 QKV 投影在 2-4 GPU 配置下将块延迟进一步降低 33-37%。实验表明,重叠是稳健的高规模默认方案,而融合在中低规模下效果最强。
Ollama 0.17 版本支持通过单条命令 `ollama launch openclaw` 快速部署个人 AI 助手 OpenClaw,它能在本地硬件上运行,帮你处理邮件、日历并通过 WhatsApp 等聊天应用执行任务。部署后,用户可以在终端直接与助手对话,并可选择连接 Ollama 云模型以获得完整上下文长度和网络搜索功能,或使用本地模型。
Replit 团队展示了如何通过 Replit Agent、Expo 和新移动工具,让非技术人员独立构建并部署 iOS 应用,如 Dan Kempe 在移动开发竞赛中推出的 Flash News 速度阅读应用。
Replit 与 Databricks 推出集成方案,使企业用户能在 Replit 中编写数据应用代码并直接部署至 Databricks Apps,实现与治理数据的实时连接。
Replit 与 Snowflake 联合演示如何通过自然语言指令构建数据应用,新增预测、钻取分析和 Slack 警报功能。Replit Agent 可生成 SQL、绘制图表并展示预测趋势,无需手动编码。用户可通过提问获取数据答案及对应 SQL,提升非技术人员的使用效率。
Ollama 发布个人 AI 助手 OpenClaw,它作为中央网关,将 WhatsApp、Telegram、Slack 等消息平台与 AI 编程智能体连接起来,并在本地设备上运行以保护隐私。用户可通过 Ollama 启动 OpenClaw 来连接本地或云端模型,建议使用至少 64k token 上下文长度的模型,如 qwen3-coder 或 glm-4.7。
Replit 推出与 Snowflake 的连接器,允许用户通过自然语言提示构建数据应用,无需手动编写代码。连接器提供安全的只读访问,简化了认证和配置流程,支持实时数据更新和 SQL 查询验证。该功能通过两种模式(Build 和 Plan)提升开发效率,用户可一键部署应用并选择私有、密码保护或公开发布。
Replit Agent 在直播中演示了如何用不到两小时从零构建一个私人书签管理器及 Chrome 浏览器扩展,初始构建成本约 5 美元。直播展示了实际调试过程,包括处理认证问题、数据库迁移和性能优化,并通过一次提示词实现了 OpenAI 集成的 AI 内容摘要功能。Replit 团队强调了提示词设计的重要性,并提供了控制开发成本的策略,如使用免费计划、Fast Mode 和 Plan Mode。
Ollama 发布新命令 `ollama launch`,可一键设置并运行 Claude Code、OpenCode 和 Codex 等编码工具,支持本地或云端模型,无需配置环境变量或文件。
推荐理由:Ollama 通过新命令简化了本地或云端模型与主流编码工具的集成流程,无需手动配置环境变量或文件。
Replit Agent 推出决策时引导机制,通过轻量级分类器动态注入短小、情境化的指导指令,仅在必要时干预,提升长轨迹任务的可靠性与代码质量,同时降低上下文负担和成本。该机制避免了静态提示的局限,支持数百种可复用微指令,通过诊断信号和外部咨询两种模式有效应对错误循环和高风险操作。
推荐理由:原文给出了决策时引导机制的设计原理和实际效果,读者可以据此理解它如何提升长轨迹任务的可靠性与成本效率。
OpenAI 的 Codex CLI 现可通过 Ollama 使用开源模型,如 gpt-oss:20b 或 gpt-oss:120b,来读取、修改和执行工作目录中的代码。用户需安装 Codex CLI 并使用 `--oss` 标志启动,默认调用本地 gpt-oss:20b 模型。该集成要求至少 32K token 的上下文窗口,并支持切换至 Ollama Cloud 上的模型。
Fly.io 推出名为 Sprites 的新型 Linux 虚拟机,其创建仅需一两秒,并自带 100GB 持久根文件系统。Sprites 在闲置时会自动休眠以降低成本,其设计放弃了用户容器镜像,并采用 S3 兼容对象存储作为存储根。
Fly.io 发布名为 Sprites 的新产品,这是一种可快速创建(1-2秒)、持久化、支持即时快照与恢复的云计算机,旨在替代传统的只读沙箱。作者认为,像 Claude 这样的 AI 智能体需要的是完整的计算机环境,而非每次任务后销毁的沙箱,以便保留状态、避免重复构建环境,并支持更长的交互周期。
推荐理由:作者从自家产品出发,提出了AI智能体开发需要持久化、可快速恢复的完整计算机环境,而非传统只读沙箱的观点。
Litestream VFS 允许 SQLite 通过 VFS 插件接口直接从 S3 等对象存储 URL 读取数据,无需下载整个数据库。它利用 LTX 文件格式的压缩特性,支持通过 `PRAGMA litestream_time` 指令进行任意时间点的即时恢复查询。该插件与现有 SQLite 库兼容,保持了 Litestream 无需修改应用即可使用的特点。
Vector 研究人员在 NeurIPS 2025 会议上提交了 80 篇论文,涵盖下一代基础模型、扩散生成系统、强化学习突破和隐私保护联邦方法等多个领域。其中提出 ActiveVOI 框架,用于开放世界智能体的主动知识获取,显著优于现有基于大语言模型和视觉语言模型的规划方法。另一项研究引入连续时间流图蒸馏方法,通过自引导和对抗微调提升性能,适用于不同步数的生成任务。
本文提出构建产品评估的三步法:标注小数据集、对齐大语言模型评估器、运行实验与评估框架。建议从二元通过/失败标签开始,以提高标注一致性并简化对齐过程。优先收集50-100个失败案例,可通过较小模型生成或主动学习识别潜在失败样本。
作者认为理解 AI 智能体的最佳方式是亲手构建一个,并展示了使用 OpenAI Responses API 从零开始实现一个具备工具调用能力的智能体的核心代码。文章指出智能体的核心是管理上下文数组和工具调用循环,其设计自由度很高,实现子智能体、上下文工程等复杂功能在代码层面可能非常简单。作者鼓励开发者通过实践来形成自己对这项技术的判断。
推荐理由:作者通过亲手构建一个简单智能体的代码示例,展示了其核心机制和设计自由度,为读者提供了可复现的实践起点。
Ollama v0.12.6 在 NVIDIA DGX Spark 上对多个开源大模型进行了性能测试。测试使用最新固件 580.95.05,覆盖了包括 gpt-oss、Gemma3、Llama3.1、DeepSeek-R1 和 Qwen3 在内的多种模型及量化版本,并公布了其预填充和解码的 token 处理速度。
NVIDIA DGX Spark 与 Ollama 合作,确保大语言模型能在该硬件上开箱即用地高效运行。