跳到正文
7月29日周三
  1. Berkeley AI Research57

    伯克利研究:K-Search 通过 CUDA 到 MLX 的翻译层将内核优化知识迁移至 Apple Silicon

    伯克利 AI 研究团队扩展了 K-Search 框架,为其增加了 MLX 后端,并开发了一个结构化的 CUDA-to-MLX 翻译层,能够将 NVIDIA CUDA 内核的优化知识自动迁移到 Apple Silicon 上。

    推荐理由:研究提出了一种将 NVIDIA CUDA 内核优化知识自动迁移到 Apple MLX 框架的方法,为跨硬件生态的 AI 计算性能优化提供了新思路。

7月23日周四
  1. Together AI37

    Together AI 推出面向生产环境的开源权重模型推理平台

    Together AI 推出专为生产环境设计的开源权重模型推理平台 Together Dedicated Model Inference。该平台每月处理超 400 万亿 tokens 的经验,可为用户提供对模型、性能、成本和功能的完全控制,并实现部署启动速度提升约 4 倍。企业可部署来自 Together 模型平台或自带的开源权重及微调模型,并选择经过优化的硬件配置。

7月10日周五
  1. fal 博客64

    fal 博客:无损实现亚秒级 Ideogram v4 图像生成的技术路径

    fal 团队通过量化感知蒸馏、时间步蒸馏和内核融合等技术,将 Ideogram v4 在 1K 分辨率下的单图生成时间从 2.75 秒降至 0.44 秒,实现 6 倍加速且无可见质量损失。核心方法包括将模型量化至 FP4 并融合 RMSNorm 等后处理算子、将分类器引导蒸馏为单分支前向,以及通过分布匹配蒸馏将去噪步骤大幅减少。

    推荐理由:原文详细拆解了从量化、蒸馏到内核融合的完整技术路径,为追求极致推理性能的团队提供了可复现的工程方案。

7月9日周四
7月3日周五
  1. Vector Institute35

    Vector Institute 研究人员在 ICML 2026 推进生成式 AI、负责任 AI 与科学发现

    Vector Institute 研究人员在第 33届国际机器学习大会(ICML 2026)上展示了73篇被接收论文,涵盖强化学习、后训练、生成式AI、视频生成、多模态系统及AI治理等多个前沿领域。其中11篇被选为焦点论文,创下该研究所在ICML的最佳纪录。研究工作还涉及科学发现应用,包括基因组学、量子化学和材料建模。

7月1日周三
  1. Berkeley AI Research17

    2026 BAIR 毕业生成果展示

    伯克利人工智能研究实验室(BAIR)庆祝其2026届博士毕业生在人工智能与机器学习前沿领域取得的成就。毕业生研究方向涵盖机器人、大语言模型与推理、计算机视觉、生成模型、AI安全、人机交互及AI在科学与医疗等领域的应用。多位毕业生将前往学术界、工业研究实验室及创业公司继续其职业生涯。

6月30日周二
6月23日周二
  1. Together AI62

    Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,前沿模型表现不佳

    Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,用于评估大模型编写跨 GPU 通信 CUDA 内核的能力。在 87 个真实代码问题中,表现最佳的 GPT-5.5 在单次尝试下仅正确解决 28 个问题,其中仅 22 个快于 PyTorch + NCCL 基线。研究揭示了模型在协调 GPU 间通信、数据分区和选择最优传输机制方面存在根本性困难。

6月17日周三
  1. Together AI57

    Together AI 评测:Kimi K2.7 Code 与 Claude Fable 5 生成落地页的成本与质量对比

    Together AI 对比了 Kimi K2.7 Code 与 Claude Fable 5 生成 12 个落地页的成本和质量。实验显示,Kimi K2.7 Code 的平均成本比 Fable 5 低约 94%,在结合定制设计灵感 MCP 服务器后,其输出质量与 Fable 5 相近。所有生成的页面、成本细目和 GPT-5.5 的评分结果都发布在 OVSC 网站上。

    推荐理由:原文通过具体实验和成本对比,展示了开源模型在特定工作流中结合定制化工具的实际效益。

6月11日周四
  1. Ollama 博客58

    Ollama 发布 MLX 引擎更新,在 Apple Silicon 上实现最高性能

    Ollama 更新其 MLX 引擎,在 Apple Silicon 上实现了迄今为止的最高性能,支持 NVIDIA 的 NVFP4 量化格式以减少质量损失,并引入快照系统优化 Agent 工作流。新引擎输出速度提升最高达 20%,并允许数据中心优化的模型在桌面端运行。用户可通过下载最新版 Ollama 并使用 `ollama run gemma4:12b-mlx` 命令体验。

    推荐理由:Ollama 官方介绍了其 MLX 引擎在 Apple Silicon 上的多项性能优化,包括支持 NVFP4 量化格式和新的快照系统,对本地部署和 Agent 工作流有直接影响。

6月10日周三
  1. Replit 博客47

    Replit 推出 Package Firewall,每日拦截 8000 多个恶意软件包

    Replit 与软件供应链安全公司 Socket 合作推出默认启用的 Package Firewall,在网络层面实时拦截恶意或存在漏洞的软件包安装。该功能自一周前推出以来,每日拦截约 8000 个软件包,有效防范安装时即造成损害的恶意软件。当安装被拦截时,用户会收到明确提示,AI Agent 也能接收到相同信号并建议安全替代方案。

5月15日周五
4月30日周四
  1. Together AI34

    Together AI 与 Adaption 合作,在 Adaptive Data 中集成 Together Fine-Tuning

    Together AI 与 Adaption 合作,将 Together Fine-Tuning 集成到 Adaptive Data 平台中。Adaption 平台能帮助团队分析数据集结构、优化训练数据,早期部署平均提升数据质量 82%。用户可在 Adaption 中优化数据集后,直接启动 Together Fine-Tuning 进行微调,并部署到 Together AI 的高性能推理服务上。

3月30日周一
  1. Ollama 博客67

    Ollama 0.19 预览版发布,在 Apple Silicon 上集成 MLX 框架

    Ollama 发布 0.19 预览版,在 Apple Silicon 设备上集成 Apple 的 MLX 机器学习框架,以利用其统一内存架构提升性能。新版本支持 NVIDIA 的 NVFP4 量化格式以保持模型精度,并改进了缓存机制,使 Claude Code 等智能体任务响应更快。预览版已针对 Qwen3.5-35B-A3B 模型进行加速,并提供了启动命令。

    推荐理由:预览版基于 MLX 框架,并支持 NVFP4 量化格式,为在 Apple Silicon 上运行大模型提供了新的性能基准和部署选项。

3月25日周三
2月25日周三
2月23日周一
  1. Vector Institute20

    Vector Institute Demo Day:如何帮助加拿大初创企业将创新想法转化为商业现实

    Vector Institute 在 Demo Day 上协助12家加拿大AI初创企业向四位专家评委展示产品,并与近30位风投机构代表对接。该活动是其FastLane项目的一部分,该项目已助力超过250家初创企业加速AI商业化进程,且Vector不以股权换取支持。参与者表示,Vector提供的结构化培训和行业资源对接,显著提升了初创企业在融资和展示中的准备水平。

2月16日周一
  1. Ollama 博客60

    Ollama 为 Claude Code 新增子智能体和联网搜索功能

    Ollama 宣布为 Claude Code 新增子智能体和联网搜索功能,无需 MCP 服务器或 API 密钥即可使用。子智能体可并行执行文件搜索、代码探索和研究等任务,部分模型(如 minimax-m2.5、glm-5、kimi-k2.5)会自动触发,也可通过指令强制创建。联网搜索功能已集成至 Anthropic 兼容层,模型需要最新信息时会自动处理搜索并返回结果。

    推荐理由:Ollama 为 Claude Code 增加了子智能体和联网搜索功能,无需额外配置,这直接提升了复杂任务的并行处理能力。

1月15日周四
  1. Ollama 博客32

    OpenAI Codex 可通过 Ollama 使用开源模型

    OpenAI 的 Codex CLI 现可通过 Ollama 使用开源模型,如 gpt-oss:20b 或 gpt-oss:120b,来读取、修改和执行工作目录中的代码。用户需安装 Codex CLI 并使用 `--oss` 标志启动,默认调用本地 gpt-oss:20b 模型。该集成要求至少 32K token 的上下文窗口,并支持切换至 Ollama Cloud 上的模型。

10月28日周二
  1. Ollama 博客52

    MiniMax M2 模型在 Ollama 云平台上线

    MiniMax M2 模型已在 Ollama 云平台上线,该模型专为编码和智能体工作流设计。根据 Artificial Analysis 的基准测试,其综合得分在全球开源模型中排名第一,在数学、科学、指令遵循、编码和智能体工具使用方面表现出高度竞争力。

10月16日周四