跳到正文
  1. SemiAnalysis67

    SemiAnalysis发布中国数据中心模型:揭示AI基础设施扩张与结构性矛盾

    SemiAnalysis发布中国数据中心模型,基于1000+设施的建筑级数据,指出中国数据中心市场容量超24GW,其中AI驱动的批发需求与传统零售机房并存,形成高空置率与AI算力短缺并存的结构性矛盾。

    推荐理由:原文基于建筑级数据构建中国数据中心模型,揭示了AI驱动的基础设施扩张与传统零售机房并存的结构性矛盾。

  1. Neo4j 博客64

    Neo4j 发布 Neocarta 语义层,降低 Text2SQL token 消耗最高达 81%

    Neo4j 发布 Neocarta 语义层,通过在 Neo4j 中构建跨 BigQuery 和 Databricks 的元数据图,使 Text2SQL 代理在 278 张 Census 表和 264 张 Databricks 表的复杂环境中。

    推荐理由:原文展示了在大规模、复杂数据环境中,通过图结构语义层显著提升Text2SQL的准确性和成本效益,可直接复用于企业级数据接入场景。

  1. IEEE Spectrum · AI61

    巴基斯坦司法系统试点JudgeGPT提升案件处理效率

    巴基斯坦对1,559名试用法官开展JudgeGPT试点,该工具基于GPT-4与12.8万份判例及943部法规构建,结合RAG技术辅助法律检索与判决起草。研究显示,经系统培训的法官所在辖区案件解决率提升6.3%,且判决质量未下降,每投入1美元可节省约38.50美元司法成本。培训显著提升工具使用频率与持续性,但仍有约五分之一的法官存在过度依赖AI现象。

    推荐理由:原文通过实证研究呈现了AI工具在司法系统中的实际应用效果,为公共部门AI落地提供了可参考的评估框架。

  1. Berkeley AI Research57

    伯克利研究:K-Search 通过 CUDA 到 MLX 的翻译层将内核优化知识迁移至 Apple Silicon

    伯克利 AI 研究团队扩展了 K-Search 框架,为其增加了 MLX 后端,并开发了一个结构化的 CUDA-to-MLX 翻译层,能够将 NVIDIA CUDA 内核的优化知识自动迁移到 Apple Silicon 上。

    推荐理由:研究提出了一种将 NVIDIA CUDA 内核优化知识自动迁移到 Apple MLX 框架的方法,为跨硬件生态的 AI 计算性能优化提供了新思路。

  2. Together AI63

    Together AI 开源 ThunderAgent,实现 2 倍吞吐的智能体推理系统

    Together AI 开源了智能体推理系统 ThunderAgent,通过将工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。在 8 节点 H100 集群上,相比 SGLang Gateway 实现了 2.39 倍的加速和接近线性的吞吐扩展。该系统与 OpenAI 兼容,只需在客户端添加 `program_id` 字段即可集成现有推理后端。

    推荐理由:开源系统通过将智能体工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。

  1. Together AI62

    Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,前沿模型表现不佳

    Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,用于评估大模型编写跨 GPU 通信 CUDA 内核的能力。在 87 个真实代码问题中,表现最佳的 GPT-5.5 在单次尝试下仅正确解决 28 个问题,其中仅 22 个快于 PyTorch + NCCL 基线。研究揭示了模型在协调 GPU 间通信、数据分区和选择最优传输机制方面存在根本性困难。

  1. Together AI61

    Together AI 发布 Mamba-3 状态空间模型

    Together AI 联合多所大学的研究人员发布了 Mamba-3,这是一个以推理效率为主要目标的新状态空间模型。Mamba-3 通过更复杂的循环公式、复数值状态跟踪和 MIMO 变体提升了性能,其 SISO 版本在 1.5B 规模上,所有序列长度的预填充+解码延迟均优于 Mamba-2、Gated DeltaNet 和 Llama-3.2-1B。

    推荐理由:Mamba-3 将设计目标从训练效率转向推理效率,并开源了内核,为关注部署性能的开发者提供了新的架构选择。

已经到底了