Berkeley AI Research 提出基于信息论的成像系统设计与评估框架
Berkeley AI Research 在 NeurIPS 2025 论文中提出一个直接评估和优化成像系统信息内容的新框架。该信息度量统一了分辨率、噪声和光谱灵敏度等传统分离的质量指标,能准确预测彩色摄影、射电天文、无透镜成像和显微镜四个领域的系统性能。优化该指标产生的设计与最先进的端到端方法性能相当,但所需内存和计算量更少,且无需特定任务的解码器设计。
Berkeley AI Research 在 NeurIPS 2025 论文中提出一个直接评估和优化成像系统信息内容的新框架。该信息度量统一了分辨率、噪声和光谱灵敏度等传统分离的质量指标,能准确预测彩色摄影、射电天文、无透镜成像和显微镜四个领域的系统性能。优化该指标产生的设计与最先进的端到端方法性能相当,但所需内存和计算量更少,且无需特定任务的解码器设计。
Fly.io 发布名为 Sprites 的新产品,这是一种可快速创建(1-2秒)、持久化、支持即时快照与恢复的云计算机,旨在替代传统的只读沙箱。作者认为,像 Claude 这样的 AI 智能体需要的是完整的计算机环境,而非每次任务后销毁的沙箱,以便保留状态、避免重复构建环境,并支持更长的交互周期。
推荐理由:作者从自家产品出发,提出了AI智能体开发需要持久化、可快速恢复的完整计算机环境,而非传统只读沙箱的观点。
月之暗面发布 Kimi K2.5,一个开源的原生多模态智能体模型,基于 Kimi-K2-Base 连续预训练,支持视觉与语言理解、即时与思考模式、以及智能体群集执行。
推荐理由:原文提供了模型架构、评测基准和部署方式,读者可以据此判断其在多模态智能体方向的技术定位和应用潜力。
OpenAI 推出 Circuit-Sparsity 模型的 HuggingFace 实现,用于演示 Gao 等人 2025 年论文中的定性结果(如括号计数和变量绑定)。该模型包含加载本地转换后的 HF 模型和 tokenizer 的代码,并支持运行小型生成任务。项目采用 Apache License 2.0 开源授权。
Litestream VFS 允许 SQLite 通过 VFS 插件接口直接从 S3 等对象存储 URL 读取数据,无需下载整个数据库。它利用 LTX 文件格式的压缩特性,支持通过 `PRAGMA litestream_time` 指令进行任意时间点的即时恢复查询。该插件与现有 SQLite 库兼容,保持了 Litestream 无需修改应用即可使用的特点。
Vector 研究人员在 NeurIPS 2025 会议上提交了 80 篇论文,涵盖下一代基础模型、扩散生成系统、强化学习突破和隐私保护联邦方法等多个领域。其中提出 ActiveVOI 框架,用于开放世界智能体的主动知识获取,显著优于现有基于大语言模型和视觉语言模型的规划方法。另一项研究引入连续时间流图蒸馏方法,通过自引导和对抗微调提升性能,适用于不同步数的生成任务。
安大略省 AI 生态系统预计到 2035 年将为加拿大创造 1220 亿美元累计实际 GDP,占全国 2980 亿美元 AI 驱动经济增长的大部分。该省过去五年 AI 相关就业贡献了 420 亿至 520 亿美元实际 GDP,每份 AI 工作年均创造 199,000 美元经济价值。
Vector Institute 2025 机器学习安全与隐私研讨会揭示了当前 AI 安全方法的关键突破与隐患。Ruth Urner 提出容忍对抗学习理论,使对抗鲁棒性从指数复杂度降至线性复杂度。
作者认为理解 AI 智能体的最佳方式是亲手构建一个,并展示了使用 OpenAI Responses API 从零开始实现一个具备工具调用能力的智能体的核心代码。文章指出智能体的核心是管理上下文数组和工具调用循环,其设计自由度很高,实现子智能体、上下文工程等复杂功能在代码层面可能非常简单。作者鼓励开发者通过实践来形成自己对这项技术的判断。
推荐理由:作者通过亲手构建一个简单智能体的代码示例,展示了其核心机制和设计自由度,为读者提供了可复现的实践起点。
月之暗面发布 Kimi-K2-Thinking 模型,为开源思考模型最新版本,具备 256k 上下文窗口、INT4 量化和 1T 参数 MoE 架构,支持多步推理与工具调用,在 HLE、AIME25、BrowseComp 等基准上表现领先。
推荐理由:原文提供了模型架构、量化方式、基准评测和部署接口,读者可据此判断其在长链推理和工具调用上的实际能力边界。
Ollama 宣布与 OpenAI 及非营利组织 ROOST 合作,将开源安全推理模型 gpt-oss-safeguard 提供给用户,用于安全分类任务。该模型提供 20B 和 120B 两个版本,采用 Apache 2.0 许可,核心功能包括根据用户书面策略进行推理、提供完整的推理过程以及可配置的推理强度。
MiniMax M2 模型已在 Ollama 云平台上线,该模型专为编码和智能体工作流设计。根据 Artificial Analysis 的基准测试,其综合得分在全球开源模型中排名第一,在数学、科学、指令遵循、编码和智能体工具使用方面表现出高度竞争力。
Ollama v0.12.6 在 NVIDIA DGX Spark 上对多个开源大模型进行了性能测试。测试使用最新固件 580.95.05,覆盖了包括 gpt-oss、Gemma3、Llama3.1、DeepSeek-R1 和 Qwen3 在内的多种模型及量化版本,并公布了其预填充和解码的 token 处理速度。
Ollama 云服务上线了 GLM-4.6 和 Qwen3-Coder-480B 两款编码模型,并更新了 Qwen3-Coder-30B 以提供更快的工具调用。这些模型可通过 VS Code、Zed 和 Droid 等常用工具集成使用,拥有 16384 token 的上下文长度,并支持通过 Ollama 云 API 直接访问。
Qwen3-VL 现已在 Ollama 云端可用,本地版本即将推出。该模型具备视觉智能体、长上下文视频理解、高级空间感知、增强的多模态推理与视觉识别等能力。用户可通过 Ollama 的 CLI、API 及 JavaScript/Python 库免费使用云端模型,并支持 OpenAI 兼容的 API 端点。
推荐理由:Ollama 官方博客列出了 Qwen3-VL 在视觉智能体、长上下文、空间感知等方面的具体能力,并提供了详细的接入方式。
NVIDIA DGX Spark 与 Ollama 合作,确保大语言模型能在该硬件上开箱即用地高效运行。