Weaviate v1.37 如何让 BM25 分词器成为可观察的多语言搜索组件
Weaviate v1.37 将分词器作为可观察的多语言搜索组件,提升混合搜索质量。BM25 的搜索效果高度依赖分词器的准确性,错误分词会导致关键词匹配失效。该版本支持多种分词方法(如 WORD、LOWERCASE、WHITESPACE、FIELD)和语言特定分词器(如 kagome_ja、gse_ch),并提供字符折叠功能以解决多语言搜索中的重音不匹配问题。
Weaviate v1.37 将分词器作为可观察的多语言搜索组件,提升混合搜索质量。BM25 的搜索效果高度依赖分词器的准确性,错误分词会导致关键词匹配失效。该版本支持多种分词方法(如 WORD、LOWERCASE、WHITESPACE、FIELD)和语言特定分词器(如 kagome_ja、gse_ch),并提供字符折叠功能以解决多语言搜索中的重音不匹配问题。
DeepSeek-V4 通过压缩 KV 缓存的 token 维度来支持百万 token 上下文,但这将压力转移到了推理系统。模型采用混合注意力设计,包括压缩稀疏注意力、重度压缩注意力和滑动窗口注意力,这要求推理引擎同时管理三种具有不同大小和生命周期的缓存对象。文章基于在 NVIDIA HGX B200 上的早期部署经验,分析了缓存策略、前缀复用和不同工作负载下的性能权衡。
推荐理由:文章从推理系统角度剖析了 DeepSeek-V4 百万 token 上下文窗口的实现挑战,为开发者评估其实际部署成本提供了具体的技术视角。
自适应并行推理让推理模型能自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们。这种方法旨在解决顺序推理因探索路径线性增长而导致的延迟增加、计算密集和上下文窗口受限问题。研究分析了从固定并行到自适应控制的各种方法,指出让模型根据问题自适应决策是提升并行化效果的关键。
开发者借助 Goose CLI 智能体和 Together 的 dedicated containers skill,可在几分钟内将 HuggingFace 上新发布的模型(如 Netflix 的 void-model)部署到 Together 的 Dedicated Container Inference 基础设施上。
Replit 推出 Security Center 2.0,支持批量识别和处理所有项目中的关键和高严重性漏洞,优先查看已发布且公开的项目数量。用户可从首页或设置进入,通过依赖项扫描生成软件物料清单(SBOM)。企业用户可通过“Run Scan”获取 SBOM,用于安全与合规团队评估新披露的 CVE 影响。
检索质量是影响大语言模型输出可靠性的关键因素,当检索失败时,模型会生成看似合理但缺乏事实依据的内容。研究发现,在 HaluEval、TruthfulQA 和 FaithDial 等基准测试中,检索层问题始终是幻觉产生的主要来源。五种常见的检索失败模式包括检索漂移、上下文截断、过时索引污染、低相关性 top-k 检索和智能体间误通信,这些问题在多智能体系统中尤为隐蔽且难以检测。
Together AI 在 NVIDIA GTC 2026 上深入探讨了生产环境中 AI 推理的挑战与优化策略,指出推理成本占生产系统全生命周期成本的 80-90%,是决定 AI 原生公司单位经济效益的关键。
Together AI 在发现 Copy Fail 漏洞后,立即在其 AI 基础设施中禁用了易受攻击的 algif_aead 内核模块以缓解风险。该漏洞允许本地无权限用户篡改系统文件,在共享内核的多租户 AI 环境中构成跨租户风险。公司采取了无需重启的快速缓解措施,并计划在稳定后逐步部署内核补丁,同时默认关闭非必需的内核接口以增强平台安全。
Replit 推出 App Monitoring 功能,可第一时间通过邮件通知用户应用宕机情况。Replit Agent 现在能读取应用日志和只读访问生产数据库,用于诊断故障原因。用户还可通过 Analytics 查看历史运行状态并关联请求量、流量峰值等信号。
Together AI 宣布其 AI Native Cloud 平台上线 DeepSeek-V4 Pro 模型,提供 Serverless Inference 和 Dedicated Endpoints 两种部署方式。
推荐理由:原文给出了模型在平台上的部署细节、定价模式和推理模式选择,读者可以据此判断它如何适配不同复杂度的长上下文任务。
Together AI 平台已上线 NVIDIA Nemotron 3 Nano Omni 模型。该模型是一个 300 亿参数的开源多模态模型,采用混合 Mamba-Transformer MoE 架构,支持视频、图像、音频和语言的统一推理,上下文窗口达 256K token。
Together AI 推出的 distribution-aware speculative decoding (DAS) 框架将 RL 后训练中的 rollout 阶段速度提升了最高 50%,且不影响模型输出质量。该框架包含自适应后缀树草稿器和长度感知调度策略,在 DeepSeek-R1-Distill-Qwen-7B 的数学推理任务中实现了超过 50% 的 rollout 时间缩减。
Weaviate v1.37 发布,新增内置 MCP Server、可扩展分词器、基于 MMR 的多样性搜索(Diversity Search)和查询分析(Query Profiling)等预览功能。
Replit 推出 Auto-Protect 功能,自动检测项目依赖中的关键 CVE 漏洞并准备补丁。用户通过邮件链接可一键审查并应用补丁,随后重新发布应用即可完成修复。该功能需管理员在账户设置中手动启用,并可自定义触发修复和邮件通知的漏洞最低严重级别。
Replit 推出 Security Agent,可在一小时内完成应用的全面安全审查。该工具采用可定制的威胁建模计划,并结合 Semgrep 和 HoundDog.ai 提高检测准确性。用户可在项目 Security 面板选择“Run Scan with Agent”启动扫描,生成的风险报告支持并行修复和主分支回补。
Replit 通过纵深防御策略保障其平台各层安全,从开发沙箱到生产部署均采用隔离与验证机制。平台默认限制应用间的数据访问,仅允许通过 Connectors 明确授权;使用 Determinate Nix 管理依赖,确保软件供应链无已知漏洞版本。开发与生产环境数据完全分离,支持每日备份与只读 Git 历史记录,防止意外修改生产数据。
Together AI 提出了面向 AI 原生团队的多租户 GPU 集群设计模式,旨在实现资源池化的经济效益,同时避免团队间的干扰。该架构在共享基础设施层之上,为每个租户提供完全隔离的虚拟环境,包括专用 GPU 节点、存储和自选的编排层。系统通过配额分配、冲突预防的提前预订以及容量感知调度来管理资源,并支持按需自动溢出,确保生产速度不受基础设施流程阻碍。
Replit Agent 4 可直接从现有项目生成利益相关者演示文稿、实时仪表盘和动画,无需切换工具。所有输出共享相同的设计系统,确保字体、颜色和内容一致。实时数据应用替代静态导出,消除分析师请求队列的延迟,使产品发布资产能与产品同步生成。
AI Native Cloud 是为 AI 原生公司构建的专用云平台,旨在解决从预训练、微调、评估到大规模推理的完整 AI 生命周期挑战。它通过垂直整合的 AI 全栈、将前沿研究成果快速产品化的能力,以及支持指数级增长的生态系统,帮助企业在模型质量、延迟、成本和可靠性方面保持竞争优势。
Replit Agent 4 通过将原型作为工作流的核心,实现需求文档、领导汇报和工程交接的自动同步。产品负责人在迭代原型时,相关材料会实时更新,无需手动协调。集成 Glean 和 Atlassian 的 MCP 接口可自动引入用户研究并生成 Jira 任务,减少人工操作。
Together AI 的研究论文展示了如何利用 LLM 优化数据库查询执行计划。其 DBPlanBench 框架将 Apache DataFusion 的物理执行计划序列化后交由 LLM 分析,通过生成 JSON Patch 进行局部调整,而非重写整个计划。
项目经理通过 vibe coding 在 90 分钟内生成、比较并确定产品方向,减少与设计团队的交接时间。Replit 的 Infinite Canvas 支持在应用内直接对比多个设计,修改后一键进入生产环境,缩小设计与代码间的差距。设计团队仍需参与可访问性审查、品牌对齐和生产质量优化,但重点转向精修阶段。
Together AI 的 kernels 团队通过开发 FlashAttention 和 ThunderKittens 等核心软件,将 Transformer 注意力计算速度提升了 2-3 倍。
产品经理可通过 Replit Agent 4 在同一 Workspace 中直接生成可交互原型,无需设计与工程阶段的重复实现。该工具通过清晰的提示词描述行为,使工程师能从生产环境接收已测试的原型作为可构建起点。AI 集成工作流减少了传统流程中多个翻译环节,缩短了原型开发周期并提升反馈效率。
Together AI 开源了 Aurora,这是一个基于强化学习的开源框架,能够从实时推理轨迹中学习并异步更新推测解码器中的草稿模型。该框架将推测解码从静态的一次性设置转变为动态、自我改进的飞轮,在实验中,相比训练良好但静态的草稿模型,Aurora 在 Qwen3 和 Llama3 等模型上实现了额外 1.25 倍的加速。
Ollama 发布 0.19 预览版,在 Apple Silicon 设备上集成 Apple 的 MLX 机器学习框架,以利用其统一内存架构提升性能。新版本支持 NVIDIA 的 NVFP4 量化格式以保持模型精度,并改进了缓存机制,使 Claude Code 等智能体任务响应更快。预览版已针对 Qwen3.5-35B-A3B 模型进行加速,并提供了启动命令。
推荐理由:预览版基于 MLX 框架,并支持 NVFP4 量化格式,为在 Apple Silicon 上运行大模型提供了新的性能基准和部署选项。
一项研究发现,采用精心设计的“分而治之”框架,Llama-3-70B 或 Qwen-72B 等较弱模型在长上下文任务上的表现可以匹配甚至超越 GPT-4o 的单次处理模式。该框架通过规划器、并行工作器和聚合管理器分解任务,有效降低了因上下文过长导致的模型混淆、任务依赖和聚合噪声。这种方法在问答、检索和摘要等任务中更具成本效益和速度优势,但高度依赖跨块上下文的任务仍适合使用单次处理的强大模型。
Replit 发布 Agent 4,新增并行任务系统可自动解决 90% 的合并冲突,通过微虚拟机实现即时分支,引入 Infinite Canvas 实现设计与工程同环境协作,并提供实时协作可见性,支持团队成员查看彼此任务进度。CEO Amjad Masad 表示 Agent 4 实现从想法到产品的一站式开发,FireCrown Media 使用该工具年节省超 100 万美元。
Replit 团队通过直播展示了 Agent 4 的开发过程和实际应用,包括 Manny Bernabe 演示的 Taste 应用和 Raymmar Tirado 展示的 Replitopolis 3D 城市项目。
fal 推出 MCP Server,让 Claude、Cursor 等 AI 助手能直接搜索、运行和串联 fal 平台上的 1000 多个生成模型。该服务器提供 9 个工具,涵盖模型发现、执行和文件上传,用户只需配置 API 密钥即可在对话中完成图像生成、视频制作、语音合成等复杂工作流。服务本身免费,按标准 fal 定价支付模型调用费用。
推荐理由:通过 MCP 协议将上千个生成模型直接接入 Claude、Cursor 等 AI 助手,简化了多模态创作的工作流。
Replit Agent 4 对设计、协作、构建和规划四大核心模块进行升级,推出无限设计画布支持所有 artifact 类型,改用共享项目协作模式并由 Agent 协助合并,实现规划与构建并行。旧项目仍可使用,新功能如多应用构建和并行任务执行在新项目中可用。
推荐理由:原文详细对比了 Agent 3 与 Agent 4 的核心功能变化,包括设计画布、协作模式和构建流程,读者可据此判断新版本对开发效率的实际提升。
Together AI 联合多所大学的研究人员发布了 Mamba-3,这是一个以推理效率为主要目标的新状态空间模型。Mamba-3 通过更复杂的循环公式、复数值状态跟踪和 MIMO 变体提升了性能,其 SISO 版本在 1.5B 规模上,所有序列长度的预填充+解码延迟均优于 Mamba-2、Gated DeltaNet 和 Llama-3.2-1B。
推荐理由:Mamba-3 将设计目标从训练效率转向推理效率,并开源了内核,为关注部署性能的开发者提供了新的架构选择。
Together AI 在 NVIDIA GTC 2026 上宣布多项合作与产品更新,旨在支持更开放、智能体化和生产就绪的 AI 系统。其模型库现已集成 NVIDIA Nemotron 3 Super 和 NVIDIA Parakeet TDT 0.6B V3 等模型,并通过 NVIDIA Dynamo 1.0 和 NemoClaw 优化推理性能。
Replit 推出与 Databricks 的新连接器,允许用户在 Replit 中直接访问 Databricks 的治理数据、模型和仓库,无需复制敏感数据。通过 Replit Agent,用户可快速构建如3D天气地球仪等数据应用,Databricks Genie 提供自然语言问答与数据溯源能力。该集成使产品经理、分析师等非工程角色能直接构建受控的企业级数据应用,缩短开发周期。
推荐理由:原文展示了Replit与Databricks的集成方式和实际应用案例,读者可以据此判断该连接器如何支持企业级数据应用的快速构建。
Berkeley AI Research 提出了 SPEX 和 ProxySPEX 算法,用于大规模识别驱动大语言模型决策的关键交互作用。SPEX 利用稀疏性和低阶性将搜索问题转化为可解的稀疏恢复问题,而 ProxySPEX 则利用层次结构特性,能以约 10 倍更少的消融操作达到与 SPEX 相当的性能。这些框架能高效应用于特征归因、数据归因和模型组件归因,提升模型的可解释性。
Together AI 推出了一个统一的解决方案,用于在共置的 STT、LLM 和 TTS 基础设施上构建实时语音智能体。该架构将整个语音技术栈保留在同一云上,旨在将端到端延迟降至 500 毫秒以下,并简化部署。平台原生集成了 Cartesia 和 Deepgram 的领先语音模型,为开发者提供了模型选择和配置的灵活性。
推荐理由:Together AI 将语音识别、大模型和语音合成整合在同一集群,为构建实时语音智能体提供了一个低延迟、可灵活选模的解决方案。
Replit 推出 Agent 4,强调在单一环境中实现设计、开发与协作的无缝整合。其四大支柱包括:自由设计(无限画布与UI变体)、快速推进(并行任务与自动拆分)、协同构建(任务流与智能排序)和统一交付(支持Web、移动、幻灯片、动画等多类型产出)。
推荐理由:原文详细说明了 Agent 4 的四大核心能力与协作模式,读者可据此判断其对开发流程的重构潜力。
Replit 推出 Vibe Code 功能,允许用户在代码环境中直接生成动态风格视频,无需依赖外部动画工作室。该功能基于 Gemini 模型构建,支持通过自然语言描述视频内容,生成类似专业工作室制作的动画片段。用户可快速生成初稿并在 Replit 内进行迭代,社区已有超过 1,800 名开发者参与相关项目。
Ruth Heasman 使用 Replit Agent 在一周内开发出 AR 鬼猎游戏 Spookseek AR,该游戏基于 Three.js 构建,通过虚拟球体投影幽灵并实现自定义 Fresnel 风格着色器。她克服了开发版与生产版行为差异带来的性能问题,最终成功提交至 TestFlight。Replit Agent 在开发过程中持续协助,甚至在模型升级后解决了此前无法解决的 bug。
Replit 开发了一套视频渲染引擎,通过注入 JavaScript 虚拟时钟,替换浏览器的 setTimeout、setInterval、requestAnimationFrame 等时间 API,使页面在受控时间流中渲染,实现帧级确定性。
推荐理由:原文详细拆解了浏览器时间虚拟化和视频渲染的工程实现,读者可据此理解如何在无框架约束下实现任意网页的确定性视频生成。