伯克利研究:K-Search 通过 CUDA 到 MLX 的翻译层将内核优化知识迁移至 Apple Silicon
伯克利 AI 研究团队扩展了 K-Search 框架,为其增加了 MLX 后端,并开发了一个结构化的 CUDA-to-MLX 翻译层,能够将 NVIDIA CUDA 内核的优化知识自动迁移到 Apple Silicon 上。
推荐理由:研究提出了一种将 NVIDIA CUDA 内核优化知识自动迁移到 Apple MLX 框架的方法,为跨硬件生态的 AI 计算性能优化提供了新思路。
伯克利 AI 研究团队扩展了 K-Search 框架,为其增加了 MLX 后端,并开发了一个结构化的 CUDA-to-MLX 翻译层,能够将 NVIDIA CUDA 内核的优化知识自动迁移到 Apple Silicon 上。
推荐理由:研究提出了一种将 NVIDIA CUDA 内核优化知识自动迁移到 Apple MLX 框架的方法,为跨硬件生态的 AI 计算性能优化提供了新思路。
Together AI 推出专为生产环境设计的开源权重模型推理平台 Together Dedicated Model Inference。该平台每月处理超 400 万亿 tokens 的经验,可为用户提供对模型、性能、成本和功能的完全控制,并实现部署启动速度提升约 4 倍。企业可部署来自 Together 模型平台或自带的开源权重及微调模型,并选择经过优化的硬件配置。
fal 团队通过量化感知蒸馏、时间步蒸馏和内核融合等技术,将 Ideogram v4 在 1K 分辨率下的单图生成时间从 2.75 秒降至 0.44 秒,实现 6 倍加速且无可见质量损失。核心方法包括将模型量化至 FP4 并融合 RMSNorm 等后处理算子、将分类器引导蒸馏为单分支前向,以及通过分布匹配蒸馏将去噪步骤大幅减少。
推荐理由:原文详细拆解了从量化、蒸馏到内核融合的完整技术路径,为追求极致推理性能的团队提供了可复现的工程方案。
Ollama 宣布获得 8800 万美元融资,投资方包括 Benchmark、Theory Ventures 等机构及多位个人投资者。该平台已服务 890 万开发者,并被 85% 的财富 500 强公司使用,提供在本地或云端便捷运行 GLM、Nemotron、DeepSeek、Kimi、MiniMax 等开源模型的解决方案。
Vector Institute 研究人员在第 33届国际机器学习大会(ICML 2026)上展示了73篇被接收论文,涵盖强化学习、后训练、生成式AI、视频生成、多模态系统及AI治理等多个前沿领域。其中11篇被选为焦点论文,创下该研究所在ICML的最佳纪录。研究工作还涉及科学发现应用,包括基因组学、量子化学和材料建模。
伯克利人工智能研究实验室(BAIR)庆祝其2026届博士毕业生在人工智能与机器学习前沿领域取得的成就。毕业生研究方向涵盖机器人、大语言模型与推理、计算机视觉、生成模型、AI安全、人机交互及AI在科学与医疗等领域的应用。多位毕业生将前往学术界、工业研究实验室及创业公司继续其职业生涯。
Together AI 宣布完成 8 亿美元的 C 轮融资,投资方包括 Aramco Ventures、NVIDIA 等。该公司还获得了超过 500 MW 计算容量的承诺,以支持其未来几年的计算增长。其平台为开源模型提供推理服务,客户如 Decagon 在使用后推理成本降低了六倍。
Together AI 在 ICML 2026 展示了涵盖智能体到 GPU 内核的全栈前沿研究成果。其 DSGym 框架包含 1000+ 个跨 10+ 领域的数据科学任务评估套件,ThunderAgent 将智能体推理吞吐量提升最高 3.6 倍。
Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,用于评估大模型编写跨 GPU 通信 CUDA 内核的能力。在 87 个真实代码问题中,表现最佳的 GPT-5.5 在单次尝试下仅正确解决 28 个问题,其中仅 22 个快于 PyTorch + NCCL 基线。研究揭示了模型在协调 GPU 间通信、数据分区和选择最优传输机制方面存在根本性困难。
Together AI 对比了 Kimi K2.7 Code 与 Claude Fable 5 生成 12 个落地页的成本和质量。实验显示,Kimi K2.7 Code 的平均成本比 Fable 5 低约 94%,在结合定制设计灵感 MCP 服务器后,其输出质量与 Fable 5 相近。所有生成的页面、成本细目和 GPT-5.5 的评分结果都发布在 OVSC 网站上。
推荐理由:原文通过具体实验和成本对比,展示了开源模型在特定工作流中结合定制化工具的实际效益。
Ollama 更新其 MLX 引擎,在 Apple Silicon 上实现了迄今为止的最高性能,支持 NVIDIA 的 NVFP4 量化格式以减少质量损失,并引入快照系统优化 Agent 工作流。新引擎输出速度提升最高达 20%,并允许数据中心优化的模型在桌面端运行。用户可通过下载最新版 Ollama 并使用 `ollama run gemma4:12b-mlx` 命令体验。
推荐理由:Ollama 官方介绍了其 MLX 引擎在 Apple Silicon 上的多项性能优化,包括支持 NVFP4 量化格式和新的快照系统,对本地部署和 Agent 工作流有直接影响。
Replit 与软件供应链安全公司 Socket 合作推出默认启用的 Package Firewall,在网络层面实时拦截恶意或存在漏洞的软件包安装。该功能自一周前推出以来,每日拦截约 8000 个软件包,有效防范安装时即造成损害的恶意软件。当安装被拦截时,用户会收到明确提示,AI Agent 也能接收到相同信号并建议安全替代方案。
Together AI 与 Pearl Research Labs 合作推出基于 Pearl Network 协议的 Gemma-4-31B-it-pearl 模型推理端点,其价格享受超过 25% 的折扣。
Together AI 与 Adaption 合作,将 Together Fine-Tuning 集成到 Adaptive Data 平台中。Adaption 平台能帮助团队分析数据集结构、优化训练数据,早期部署平均提升数据质量 82%。用户可在 Adaption 中优化数据集后,直接启动 Together Fine-Tuning 进行微调,并部署到 Together AI 的高性能推理服务上。
Ollama 发布 0.19 预览版,在 Apple Silicon 设备上集成 Apple 的 MLX 机器学习框架,以利用其统一内存架构提升性能。新版本支持 NVIDIA 的 NVFP4 量化格式以保持模型精度,并改进了缓存机制,使 Claude Code 等智能体任务响应更快。预览版已针对 Qwen3.5-35B-A3B 模型进行加速,并提供了启动命令。
推荐理由:预览版基于 MLX 框架,并支持 NVFP4 量化格式,为在 Apple Silicon 上运行大模型提供了新的性能基准和部署选项。
Inworld TTS-1.5 Max 文本转语音模型已在 fal 平台上线,专注于低延迟语音生成、更高的表现力和多语言支持。该模型首次音频生成时间低于约 250 毫秒,支持 15 种语言,定价约为每分钟 0.01 美元。
Replit 推出 Pro 计划($100/月),支持最多 15 个开发者、Turbo 模式(速度提升 2 倍)和优先支持。Core 计划价格降至 $20/月(原 $25/月),支持最多 5 人协作,且无需额外订阅。Teams 计划将于 2026 年 3 月 3 日起逐步停用,用户将自动升级至 Pro 且无需额外付费。
Vector Institute 在 Demo Day 上协助12家加拿大AI初创企业向四位专家评委展示产品,并与近30位风投机构代表对接。该活动是其FastLane项目的一部分,该项目已助力超过250家初创企业加速AI商业化进程,且Vector不以股权换取支持。参与者表示,Vector提供的结构化培训和行业资源对接,显著提升了初创企业在融资和展示中的准备水平。
Ollama 宣布为 Claude Code 新增子智能体和联网搜索功能,无需 MCP 服务器或 API 密钥即可使用。子智能体可并行执行文件搜索、代码探索和研究等任务,部分模型(如 minimax-m2.5、glm-5、kimi-k2.5)会自动触发,也可通过指令强制创建。联网搜索功能已集成至 Anthropic 兼容层,模型需要最新信息时会自动处理搜索并返回结果。
推荐理由:Ollama 为 Claude Code 增加了子智能体和联网搜索功能,无需额外配置,这直接提升了复杂任务的并行处理能力。
OpenAI 的 Codex CLI 现可通过 Ollama 使用开源模型,如 gpt-oss:20b 或 gpt-oss:120b,来读取、修改和执行工作目录中的代码。用户需安装 Codex CLI 并使用 `--oss` 标志启动,默认调用本地 gpt-oss:20b 模型。该集成要求至少 32K token 的上下文窗口,并支持切换至 Ollama Cloud 上的模型。
MiniMax M2 模型已在 Ollama 云平台上线,该模型专为编码和智能体工作流设计。根据 Artificial Analysis 的基准测试,其综合得分在全球开源模型中排名第一,在数学、科学、指令遵循、编码和智能体工具使用方面表现出高度竞争力。
Ollama 云服务上线了 GLM-4.6 和 Qwen3-Coder-480B 两款编码模型,并更新了 Qwen3-Coder-30B 以提供更快的工具调用。这些模型可通过 VS Code、Zed 和 Droid 等常用工具集成使用,拥有 16384 token 的上下文长度,并支持通过 Ollama 云 API 直接访问。