Neo4j 中使用 Cypher 实现混合搜索:结合全文、向量与图结构
Neo4j 支持通过 Cypher 实现混合搜索,结合全文、向量和图结构等多种信号进行检索。该方法使用 WRRF(加权倒数排名融合)对多个来源的结果进行重新排序,提升同时出现在多个搜索中的结果权重。混合搜索可应用于支持案例调查,通过技术词汇、语义相似性或图结构关系找到相关案例。
Neo4j 支持通过 Cypher 实现混合搜索,结合全文、向量和图结构等多种信号进行检索。该方法使用 WRRF(加权倒数排名融合)对多个来源的结果进行重新排序,提升同时出现在多个搜索中的结果权重。混合搜索可应用于支持案例调查,通过技术词汇、语义相似性或图结构关系找到相关案例。
随着 AI 推理成本急剧下降,GPT-4 级别能力的成本已从 2023 年初的每百万 token 约 30 美元降至如今低于 1 美元,部分提供商甚至低于 0.1 美元。这标志着足以胜任大多数知识工作的智能正变得近乎免费,从而催生了数据系统需为 AI 智能体设计、由智能体构成以及由智能体构建的三大新挑战与机遇。
Together AI 在 ICML 2026 展示了涵盖智能体到 GPU 内核的全栈前沿研究成果。其 DSGym 框架包含 1000+ 个跨 10+ 领域的数据科学任务评估套件,ThunderAgent 将智能体推理吞吐量提升最高 3.6 倍。
Ollama 0.31 为 Gemma 4 模型引入了多 token 预测技术,在 Aider polyglot 基准测试中平均 token 生成速度提升近 90%。
通过 PPO、Weave 和合成遥测技术构建可观察的机器人数据飞轮,记录失败案例并在复杂赛道上重新训练模型,验证模型恢复效果。该方法支持在训练过程中实时监控数据流动,提升模型适应能力。技术方案适用于强化学习场景,强调数据闭环对机器人系统优化的重要性。
Kimi 2.7 可通过 Weave 追踪、分析和评估逐步复杂化的软件工程任务。该模型支持在 W&B 推理平台进行部署和测试,适用于需要详细记录和评估模型行为的开发场景。用户可利用其进行代码生成、调试和性能优化的全流程管理。
Weaviate 1.38 版本正式上线,HFresh 磁盘向量索引和内置 MCP 服务器达到通用可用状态。HFresh 支持 cosine 和 l2-squared 距离度量,通过压缩存储和增量重平衡机制优化大规模数据的内存和延迟表现。MCP 服务器允许 LLM、IDE 和 AI 智能体直接与 Weaviate 交互,且新增运行时配置功能,无需重启集群即可启用或禁用写入权限。
Weights & Biases 团队在其开源 ART 训练库中引入了 ART-Optimized Megatron (AOM),实现了 12 倍更高的训练吞吐量。该优化基于 Megatron-LM 的分布式训练架构,结合 ART 的自动资源调度功能,显著提升了大规模模型训练效率。AOM 适用于需要高吞吐训练的场景,且 ART 训练库为开源,可直接用于实验和部署。
Weave 提供了对 GLM-5.2 推理过程的简易追踪与评估方法,支持开发者通过代码逐步实现。该工具帮助用户更高效地调试和优化 AI 工作流,适用于需要详细记录模型调用行为的场景。GLM-5.2 的推理功能可通过 Weave 的 API 进行集成和测试。
Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,用于评估大模型编写跨 GPU 通信 CUDA 内核的能力。在 87 个真实代码问题中,表现最佳的 GPT-5.5 在单次尝试下仅正确解决 28 个问题,其中仅 22 个快于 PyTorch + NCCL 基线。研究揭示了模型在协调 GPU 间通信、数据分区和选择最优传输机制方面存在根本性困难。
Weaviate 官方发布大规模数据导入与向量化实践指南,涵盖服务器端批处理、错误处理与重试机制、数据类型选择、多模态数据处理(如 PDF、图像、视频)以及使用 blobHash 降低存储成本的方法。
推荐理由:原文提供了大规模数据导入的完整实践指南,包括批处理、错误处理、数据类型选择和多模态处理,读者可直接用于优化现有流程。
本文提供教程,指导用户使用 W&B Inference 在 Python 中运行 Kimi K2.7 Code 模型。正文基于 moonshotai/Kimi-K2-Instruct 模型进行演示,未提及具体参数规模、benchmark 分数或价格等信息。该模型属于月之暗面(Kimi)系列,支持长上下文处理。
Weaviate Cloud 全产品套件现已开放免费试用,包括 Database、Query Agent 和 Engram。免费试用无需信用卡且无时间限制,可直接用于构建原型。当项目规模扩大后,用户可无缝升级至按需付费集群,无需迁移或重构现有架构。
本报告介绍了基于 Gemma 3 270M 的紧凑型视觉-语言-动作(VLA)模型的生产级 MLOps 管道构建方法。该模型支持高效的训练与部署流程,适用于需要实时交互的场景。文章提供了可复现的代码结构与部署配置,供开发者参考实现。
Ollama 更新其 MLX 引擎,在 Apple Silicon 上实现了迄今为止的最高性能,支持 NVIDIA 的 NVFP4 量化格式以减少质量损失,并引入快照系统优化 Agent 工作流。新引擎输出速度提升最高达 20%,并允许数据中心优化的模型在桌面端运行。用户可通过下载最新版 Ollama 并使用 `ollama run gemma4:12b-mlx` 命令体验。
推荐理由:Ollama 官方介绍了其 MLX 引擎在 Apple Silicon 上的多项性能优化,包括支持 NVFP4 量化格式和新的快照系统,对本地部署和 Agent 工作流有直接影响。
Replit 推出 Agent 自定义功能,允许用户通过 Skills 和自定义指令让 AI 智能体适配团队开发规范。Skills 是可复用的指令集,按任务触发,可存储在版本控制中并与团队共享。自定义指令则始终生效,用于设定如不提交密钥、使用 TypeScript 严格模式等全局规则。
Replit 与 Databricks 集成新增用户到机器(U2M)连接器功能,支持基于 Unity Catalog 权限自动控制每个用户的数据访问范围。此次更新还开放了公测预览注册,企业团队可在 Replit 构建应用并直接部署至 Databricks,无需额外配置。Replit 提供静态 IP 支持,便于 IT 团队审批并确保与现有网络策略一致。
AWS 推出基于 Graviton5 的 EC2 M9g 和 M9gd 实例,首次搭载形式验证的 Nitro Isolation Engine,确保虚拟机隔离的数学正确性。
AWS 发布基于 Graviton5 的 M9g 和 M9gd 实例,提供更高的计算性能和能效。Graviton5 拥有 192 个核心,比 Graviton4 增加一倍,支持 DDR5-8800 内存和 PCIe gen6 接口,同时采用 3 纳米工艺和改进的分支预测能力,使数据库等真实应用性能提升最高 30%。
Replit 与软件供应链安全公司 Socket 合作推出默认启用的 Package Firewall,在网络层面实时拦截恶意或存在漏洞的软件包安装。该功能自一周前推出以来,每日拦截约 8000 个软件包,有效防范安装时即造成损害的恶意软件。当安装被拦截时,用户会收到明确提示,AI Agent 也能接收到相同信号并建议安全替代方案。
Fly.io 博客介绍了如何通过将智能体的‘大脑’(控制循环)与‘双手’(代码执行环境)分离来构建更安全的智能体。核心方法是让智能体在持久的主机中运行,但将所有有风险的命令发送到独立的、一次性的 Sprite 沙箱中执行。文章以 SpriteDoc 和 Hermes Agent 两个项目为例,展示了这种架构如何实现多用户隔离、凭据安全、成本优化,并支持通过快照恢复来应对破坏性操作。
推荐理由:文章通过两个具体项目案例,展示了如何利用沙箱隔离来构建更安全、可恢复的智能体,为开发者提供了可复用的架构思路。
Ollama 0.30 发布,通过集成 llama.cpp 提升了性能并扩展了对 GGUF 格式模型的兼容性。在 NVIDIA 硬件上,性能提升最高可达 20%;默认启用 Vulkan 支持,使 Ollama 的 GPU 加速能扩展到 AMD 和 Intel 设备。新版本支持更多模型系列,并允许用户通过 Modelfile 直接运行从 Hugging Face 下载的 GGUF 模型文件。
推荐理由:Ollama 0.30 通过集成 llama.cpp 提升了 NVIDIA 硬件性能并扩展了 GGUF 模型支持,为本地部署提供了更广泛的硬件兼容性和更便捷的模型运行方式。
Replit 发布与 Shopify 集成的智能体功能,用户可通过对话描述需求,让 Agent 自动生成定制化店铺前端、创建 Shopify 店铺并添加产品。从第一个提示到接收真实订单大约只需十分钟。用户主要在 Replit 内完成店铺设计、产品管理和运营,只需在 Shopify 进行一次性的账户登录、店铺认领和支付设置。
推荐理由:Replit 与 Shopify 的集成让用户通过对话就能创建并管理完整的电商店铺,降低了从想法到上线的门槛。
NVIDIA Nemotron 3 Ultra 模型已在 Ollama 云服务上线。这是一个 5500 亿参数(每 token 激活 550 亿)的开源模型,专为长流程智能体工作流设计,支持高达 100 万 token 的上下文窗口,并在智能体生产力、指令遵循和长上下文任务上具有领先的准确性和吞吐量。
推荐理由:原文提供了模型的核心参数、设计目标和性能基准,读者可以据此评估其在长流程智能体任务中的适用性。
Replit 推出 SEO Agent,可扫描并优化已发布应用的搜索引擎可见性,生成可操作的修复建议。该工具集成在 Growth 面板中,支持监控流量和长期排名优化。同时 Replit Agent 默认配置已升级,新增语义元素、预填充元标签及 robots.txt 和 sitemap.xml 自动生成功能。
W&B Weave 推出可观测性与持续改进功能,提升生产环境中智能体的质量管理。该更新支持实时监控与迭代优化,适用于各类 AI 智能体的部署与维护。功能已上线,适用于需要稳定运行的生产级 Agent 应用。
通过结合 CoreWeave 和 NVIDIA Cosmos 3,团队能够利用大规模合成数据和计算资源构建机器人数据飞轮。该方案为机器人开发提供了持续的数据生成与训练能力,支持高效模型迭代。NVIDIA Cosmos 3 与 CoreWeave 的合作增强了数据处理和算力调度的灵活性。
Together AI 作为 MiniMax M3 的优选云合作伙伴,分享了其针对该模型新特性的推理优化方案。M3 具备 100 万 token 上下文、原生多模态和稀疏注意力架构,Together AI 通过 KV 块主序稀疏注意力、与分页注意力的集成、解码索引评分优化以及网关预处理多模态输入等方法,在代理式流量下将推理性能提升了 81% 至 125%。
推荐理由:Together AI 分享了其针对 MiniMax M3 模型稀疏注意力等新特性的推理优化细节,包括 KV 块重排、分页注意力集成和网关预处理。
May 2026 产品更新包括 CoreWeave Sandboxes 的发布、模型功能的改进以及 iOS 应用的更新。新增的 CoreWeave Sandboxes 提供了更便捷的模型测试环境,模型更新优化了推理效率和可用性,iOS 应用增加了对多模态输入的支持。这些改进提升了用户体验并扩展了产品功能的适用场景。
Microsoft Fabric 与 Replit 合作推出集成方案,允许企业团队通过 AI 助力开发直接构建并部署应用到 Fabric 平台,实现从数据到生产应用的快速转化。Rayfin SDK 和 CLI 提供自动化的生产级后端架构,包括数据模型、认证和访问策略,无需手动搭建基础设施。该集成使业务团队能减少设置时间,专注于解决问题,同时 IT 团队可维持集中治理与合规。
Together AI 分享了其构建低延迟、高吞吐语音转文本(ASR)服务栈的工程优化细节,以支持 NVIDIA Parakeet-TDT 0.6B v3 和 OpenAI Whisper Large v3 等模型。
推荐理由:原文详细拆解了从模型编译到运行时优化的全链路工程实践,为构建低延迟语音AI服务提供了具体的技术路径参考。
OpenJarvis v1.0 发布,这是一个用于在自有硬件上运行个人 AI 智能体的开源框架,现已原生支持 Ollama。该框架由斯坦福大学的 Hazy Research 和 Scaling Intelligence 实验室开发,默认采用本地优先模式,模型在本地运行,云端为可选。安装脚本可自动检测现有 Ollama 安装,并预设了多个开箱即用的智能体预设,如晨间简报、跨文件研究和本地代码助手。
推荐理由:OpenJarvis 作为本地优先的 AI 智能体框架,其 v1.0 版本原生支持 Ollama,为希望将 AI 工作流本地化的开发者提供了开箱即用的选项。
Weaviate Cloud 现在支持为用户分配更细粒度的角色,新增 Editor 和 Viewer 角色,与原有的 Owner 和 Admin 角色共同构成四类权限体系。用户可通过控制台的 Organization 设置页面直接管理角色分配,权限变更立即生效。该功能适用于需要精细化控制资源访问权限的团队或企业用户。
Replit Enterprise 现在支持组织直接通过官网自助购买并立即配置 SSO 和 SCIM。用户可选择年度信用额度,获得默认不限量席位,支付后即刻进入新工作区。此流程简化了企业采购流程,同时提供 SOC 2 合规和企业专属连接器等安全功能。
fal 宣布与 Amazon Web Services (AWS) 达成战略合作,以支持其不断增长的生成式媒体生态系统。fal 平台目前拥有超过 250 万开发者,并为 Amazon MGM Studios、Canva 和 Adobe 等客户处理图像、视频、音频和 3D 的生产工作负载。
健康AI实施工具包 2.0 是 Vector Institute 发布的全面指南,用于指导医疗系统在实际部署中负责任地管理整个AI生命周期。该工具包包含三个核心支柱:战略AI治理、偏见缓解与公平性、以及安大略省医院的现实验证案例。工具包新增了持续监控、模型漂移检测和部署后验证等策略,以应对医疗AI在实际应用中可能带来的风险。
Together AI 推出首个针对高并发编码智能体工作负载的推理基准测试,模拟 45k 至 200k token 的长上下文输入和平均 450 token 的生成任务。
Together AI 与 Pearl Research Labs 合作推出基于 Pearl Network 协议的 Gemma-4-31B-it-pearl 模型推理端点,其价格享受超过 25% 的折扣。
Weaviate v1.37 将分词器作为可观察的多语言搜索组件,提升混合搜索质量。BM25 的搜索效果高度依赖分词器的准确性,错误分词会导致关键词匹配失效。该版本支持多种分词方法(如 WORD、LOWERCASE、WHITESPACE、FIELD)和语言特定分词器(如 kagome_ja、gse_ch),并提供字符折叠功能以解决多语言搜索中的重音不匹配问题。
DeepSeek-V4 通过压缩 KV 缓存的 token 维度来支持百万 token 上下文,但这将压力转移到了推理系统。模型采用混合注意力设计,包括压缩稀疏注意力、重度压缩注意力和滑动窗口注意力,这要求推理引擎同时管理三种具有不同大小和生命周期的缓存对象。文章基于在 NVIDIA HGX B200 上的早期部署经验,分析了缓存策略、前缀复用和不同工作负载下的性能权衡。
推荐理由:文章从推理系统角度剖析了 DeepSeek-V4 百万 token 上下文窗口的实现挑战,为开发者评估其实际部署成本提供了具体的技术视角。