ARC-AGI-3 发布:首个全交互式智能体基准
ARC-AGI-3 发布,包含数百个由人类游戏设计师手工设计的交互式环境和数千个游戏关卡,要求 AI 智能体在无指令、无规则、无目标的情况下自主探索并学习。人类得分 100%,前沿 AI 得分 0.51%。
推荐理由:ARC-AGI-3 是首个全交互式智能体基准,要求 AI 在无指令无规则环境中自主探索,其设计可作为衡量前沿智能体能力的新标准。
ARC-AGI-3 发布,包含数百个由人类游戏设计师手工设计的交互式环境和数千个游戏关卡,要求 AI 智能体在无指令、无规则、无目标的情况下自主探索并学习。人类得分 100%,前沿 AI 得分 0.51%。
推荐理由:ARC-AGI-3 是首个全交互式智能体基准,要求 AI 在无指令无规则环境中自主探索,其设计可作为衡量前沿智能体能力的新标准。
Inworld TTS-1.5 Max 文本转语音模型已在 fal 平台上线,专注于低延迟语音生成、更高的表现力和多语言支持。该模型首次音频生成时间低于约 250 毫秒,支持 15 种语言,定价约为每分钟 0.01 美元。
Replit 发布 Agent 4,新增并行任务系统可自动解决 90% 的合并冲突,通过微虚拟机实现即时分支,引入 Infinite Canvas 实现设计与工程同环境协作,并提供实时协作可见性,支持团队成员查看彼此任务进度。CEO Amjad Masad 表示 Agent 4 实现从想法到产品的一站式开发,FireCrown Media 使用该工具年节省超 100 万美元。
Replit 团队通过直播展示了 Agent 4 的开发过程和实际应用,包括 Manny Bernabe 演示的 Taste 应用和 Raymmar Tirado 展示的 Replitopolis 3D 城市项目。
fal 推出 MCP Server,让 Claude、Cursor 等 AI 助手能直接搜索、运行和串联 fal 平台上的 1000 多个生成模型。该服务器提供 9 个工具,涵盖模型发现、执行和文件上传,用户只需配置 API 密钥即可在对话中完成图像生成、视频制作、语音合成等复杂工作流。服务本身免费,按标准 fal 定价支付模型调用费用。
推荐理由:通过 MCP 协议将上千个生成模型直接接入 Claude、Cursor 等 AI 助手,简化了多模态创作的工作流。
Replit Agent 4 对设计、协作、构建和规划四大核心模块进行升级,推出无限设计画布支持所有 artifact 类型,改用共享项目协作模式并由 Agent 协助合并,实现规划与构建并行。旧项目仍可使用,新功能如多应用构建和并行任务执行在新项目中可用。
推荐理由:原文详细对比了 Agent 3 与 Agent 4 的核心功能变化,包括设计画布、协作模式和构建流程,读者可据此判断新版本对开发效率的实际提升。
Together AI 扩展其微调服务,新增了对工具调用、推理和视觉语言模型的原生支持。服务升级了训练栈,可更高效地处理 100B+ 参数模型,吞吐量提升最高达 6 倍,并支持最大 100GB 的数据集。
推荐理由:Together AI 的微调服务新增了对工具调用、推理和视觉模型的支持,并提升了大规模模型训练的效率。
Together AI 联合多所大学的研究人员发布了 Mamba-3,这是一个以推理效率为主要目标的新状态空间模型。Mamba-3 通过更复杂的循环公式、复数值状态跟踪和 MIMO 变体提升了性能,其 SISO 版本在 1.5B 规模上,所有序列长度的预填充+解码延迟均优于 Mamba-2、Gated DeltaNet 和 Llama-3.2-1B。
推荐理由:Mamba-3 将设计目标从训练效率转向推理效率,并开源了内核,为关注部署性能的开发者提供了新的架构选择。
Together AI 在 NVIDIA GTC 2026 上宣布多项合作与产品更新,旨在支持更开放、智能体化和生产就绪的 AI 系统。其模型库现已集成 NVIDIA Nemotron 3 Super 和 NVIDIA Parakeet TDT 0.6B V3 等模型,并通过 NVIDIA Dynamo 1.0 和 NemoClaw 优化推理性能。
Replit 推出与 Databricks 的新连接器,允许用户在 Replit 中直接访问 Databricks 的治理数据、模型和仓库,无需复制敏感数据。通过 Replit Agent,用户可快速构建如3D天气地球仪等数据应用,Databricks Genie 提供自然语言问答与数据溯源能力。该集成使产品经理、分析师等非工程角色能直接构建受控的企业级数据应用,缩短开发周期。
推荐理由:原文展示了Replit与Databricks的集成方式和实际应用案例,读者可以据此判断该连接器如何支持企业级数据应用的快速构建。
Berkeley AI Research 提出了 SPEX 和 ProxySPEX 算法,用于大规模识别驱动大语言模型决策的关键交互作用。SPEX 利用稀疏性和低阶性将搜索问题转化为可解的稀疏恢复问题,而 ProxySPEX 则利用层次结构特性,能以约 10 倍更少的消融操作达到与 SPEX 相当的性能。这些框架能高效应用于特征归因、数据归因和模型组件归因,提升模型的可解释性。
Together AI 推出了一个统一的解决方案,用于在共置的 STT、LLM 和 TTS 基础设施上构建实时语音智能体。该架构将整个语音技术栈保留在同一云上,旨在将端到端延迟降至 500 毫秒以下,并简化部署。平台原生集成了 Cartesia 和 Deepgram 的领先语音模型,为开发者提供了模型选择和配置的灵活性。
推荐理由:Together AI 将语音识别、大模型和语音合成整合在同一集群,为构建实时语音智能体提供了一个低延迟、可灵活选模的解决方案。
Mistral Small 4 家族新增开源代码智能体 Leanstral-119B A6B,支持 Lean 4 证明助手和多模态输入,上下文窗口达 256k tokens。模型采用 MoE 架构,含 128 个专家,每 token 激活 4 个,参数量 119B,推荐使用 vLLM 部署以实现生产级推理。该模型遵循 Apache 2.0 协议,支持中文等 11 种语言,并提供高推理效率设置。
Replit 推出 Agent 4,速度比 Agent 3 快 10 倍,旨在将人类创造力置于开发流程的核心。Agent 4 支持实时设计、统一项目输出、团队协作任务管理和多 Agent 并行操作,适用于教育、企业及个人创作场景。Replit 近期获得多轮融资,计划加速全球扩张并深化与 Google、Microsoft 等企业的合作。
Replit 推出 Agent 4,强调在单一环境中实现设计、开发与协作的无缝整合。其四大支柱包括:自由设计(无限画布与UI变体)、快速推进(并行任务与自动拆分)、协同构建(任务流与智能排序)和统一交付(支持Web、移动、幻灯片、动画等多类型产出)。
推荐理由:原文详细说明了 Agent 4 的四大核心能力与协作模式,读者可据此判断其对开发流程的重构潜力。
Replit 推出 Vibe Code 功能,允许用户在代码环境中直接生成动态风格视频,无需依赖外部动画工作室。该功能基于 Gemini 模型构建,支持通过自然语言描述视频内容,生成类似专业工作室制作的动画片段。用户可快速生成初稿并在 Replit 内进行迭代,社区已有超过 1,800 名开发者参与相关项目。
HeyGen 的模型已登陆 fal 平台,提供视频智能体 API、Avatar IV API、视频翻译和 Avatar Video 等核心功能。用户可通过 Video Agent API 输入提示词或 URL,一键生成包含脚本、素材和剪辑的完整视频。Avatar IV API 能将单张照片转换为具备自然表情和手势的说话头像,无需专业工作室。
Ruth Heasman 使用 Replit Agent 在一周内开发出 AR 鬼猎游戏 Spookseek AR,该游戏基于 Three.js 构建,通过虚拟球体投影幽灵并实现自定义 Fresnel 风格着色器。她克服了开发版与生产版行为差异带来的性能问题,最终成功提交至 TestFlight。Replit Agent 在开发过程中持续协助,甚至在模型升级后解决了此前无法解决的 bug。
Replit 开发了一套视频渲染引擎,通过注入 JavaScript 虚拟时钟,替换浏览器的 setTimeout、setInterval、requestAnimationFrame 等时间 API,使页面在受控时间流中渲染,实现帧级确定性。
推荐理由:原文详细拆解了浏览器时间虚拟化和视频渲染的工程实现,读者可据此理解如何在无框架约束下实现任意网页的确定性视频生成。
Vector Institute 2026 海报展示会呈现了 60 个研究项目,涵盖医疗健康、AI 安全与基础模型创新三大主题。其中近 20% 的研究聚焦医疗 AI,包括语音控制手术导航、癌症检测和医学影像技术。加拿大在 AI 领域的领导地位通过政府支持与产业合作得以体现,研究强调负责任的 AI 发展与技术落地。
本文是基于独立测试的 Seedream 5.0 Lite 图像生成模型提示词指南。核心发现是该模型在生成前会进行多步推理,并能处理复杂场景、文本渲染、HEX 颜色控制和多语言提示。
推荐理由:文章基于大量测试,将复杂的图像生成技巧提炼为可复用的结构化公式和具体示例。
Vector 研究人员开发了 CRISPNAM-FG,一种可解释的深度生存模型,用于预测糖尿病患者出院后足部并发症的风险,并提供完整的决策透明度。该模型结合了 Fine-Gray 竞争风险框架与神经可加模型,实现高预测性能与特征级可解释性。
Replit 推出 Pro 计划($100/月),支持最多 15 个开发者、Turbo 模式(速度提升 2 倍)和优先支持。Core 计划价格降至 $20/月(原 $25/月),支持最多 5 人协作,且无需额外订阅。Teams 计划将于 2026 年 3 月 3 日起逐步停用,用户将自动升级至 Pro 且无需额外付费。
针对视频扩散模型长序列处理的 Ulysses 上下文并行方法,通过异步执行和融合投影优化了通信与计算的重叠。在 8 块 B200 GPU 的基准测试中,异步 Ulysses 使预注意力块延迟降低约 23–25%,端到端性能提升约 3%;融合 QKV 投影在 2-4 GPU 配置下将块延迟进一步降低 33-37%。实验表明,重叠是稳健的高规模默认方案,而融合在中低规模下效果最强。
Vector Institute 在 Demo Day 上协助12家加拿大AI初创企业向四位专家评委展示产品,并与近30位风投机构代表对接。该活动是其FastLane项目的一部分,该项目已助力超过250家初创企业加速AI商业化进程,且Vector不以股权换取支持。参与者表示,Vector提供的结构化培训和行业资源对接,显著提升了初创企业在融资和展示中的准备水平。
Ollama 0.17 版本支持通过单条命令 `ollama launch openclaw` 快速部署个人 AI 助手 OpenClaw,它能在本地硬件上运行,帮你处理邮件、日历并通过 WhatsApp 等聊天应用执行任务。部署后,用户可以在终端直接与助手对话,并可选择连接 Ollama 云模型以获得完整上下文长度和网络搜索功能,或使用本地模型。
Replit 团队展示了如何通过 Replit Agent、Expo 和新移动工具,让非技术人员独立构建并部署 iOS 应用,如 Dan Kempe 在移动开发竞赛中推出的 Flash News 速度阅读应用。
Replit 与 Databricks 推出集成方案,使企业用户能在 Replit 中编写数据应用代码并直接部署至 Databricks Apps,实现与治理数据的实时连接。
Ollama 宣布为 Claude Code 新增子智能体和联网搜索功能,无需 MCP 服务器或 API 密钥即可使用。子智能体可并行执行文件搜索、代码探索和研究等任务,部分模型(如 minimax-m2.5、glm-5、kimi-k2.5)会自动触发,也可通过指令强制创建。联网搜索功能已集成至 Anthropic 兼容层,模型需要最新信息时会自动处理搜索并返回结果。
推荐理由:Ollama 为 Claude Code 增加了子智能体和联网搜索功能,无需额外配置,这直接提升了复杂任务的并行处理能力。
Replit 与 Snowflake 联合演示如何通过自然语言指令构建数据应用,新增预测、钻取分析和 Slack 警报功能。Replit Agent 可生成 SQL、绘制图表并展示预测趋势,无需手动编码。用户可通过提问获取数据答案及对应 SQL,提升非技术人员的使用效率。
Ollama 发布个人 AI 助手 OpenClaw,它作为中央网关,将 WhatsApp、Telegram、Slack 等消息平台与 AI 编程智能体连接起来,并在本地设备上运行以保护隐私。用户可通过 Ollama 启动 OpenClaw 来连接本地或云端模型,建议使用至少 64k token 上下文长度的模型,如 qwen3-coder 或 glm-4.7。
Replit 推出与 Snowflake 的连接器,允许用户通过自然语言提示构建数据应用,无需手动编写代码。连接器提供安全的只读访问,简化了认证和配置流程,支持实时数据更新和 SQL 查询验证。该功能通过两种模式(Build 和 Plan)提升开发效率,用户可一键部署应用并选择私有、密码保护或公开发布。
Replit Agent 在直播中演示了如何用不到两小时从零构建一个私人书签管理器及 Chrome 浏览器扩展,初始构建成本约 5 美元。直播展示了实际调试过程,包括处理认证问题、数据库迁移和性能优化,并通过一次提示词实现了 OpenAI 集成的 AI 内容摘要功能。Replit 团队强调了提示词设计的重要性,并提供了控制开发成本的策略,如使用免费计划、Fast Mode 和 Plan Mode。
Ollama 发布新命令 `ollama launch`,可一键设置并运行 Claude Code、OpenCode 和 Codex 等编码工具,支持本地或云端模型,无需配置环境变量或文件。
推荐理由:Ollama 通过新命令简化了本地或云端模型与主流编码工具的集成流程,无需手动配置环境变量或文件。
Vector Institute 的工作坊探讨了科学家如何帮助企业在数据稀缺条件下构建实际可用的 AI,重点介绍了使用 GPT-4o-mini 和对比学习技术构建 AION-1 基础模型,实现图像与文本的语义对齐,从而支持零样本搜索。
Replit Agent 推出决策时引导机制,通过轻量级分类器动态注入短小、情境化的指导指令,仅在必要时干预,提升长轨迹任务的可靠性与代码质量,同时降低上下文负担和成本。该机制避免了静态提示的局限,支持数百种可复用微指令,通过诊断信号和外部咨询两种模式有效应对错误循环和高风险操作。
推荐理由:原文给出了决策时引导机制的设计原理和实际效果,读者可以据此理解它如何提升长轨迹任务的可靠性与成本效率。
Ollama 在 macOS 平台新增实验性图像生成功能,支持运行 x/z-image-turbo 和 x/flux2-klein 等模型。
Ollama v0.14.0 及更高版本现已兼容 Anthropic Messages API,使得 Claude Code 等工具能够使用开源模型。用户可以在本地机器上运行 Claude Code 并连接本地模型,或通过 ollama.com 连接云端模型。官方提供了环境变量配置、安装命令和代码示例,并推荐了适用于编码场景的本地和云端模型。
推荐理由:Ollama 通过兼容 Anthropic API 将 Claude Code 的智能体能力扩展到开源模型,为本地和云端开发提供了新的工具调用选项。
OpenAI 的 Codex CLI 现可通过 Ollama 使用开源模型,如 gpt-oss:20b 或 gpt-oss:120b,来读取、修改和执行工作目录中的代码。用户需安装 Codex CLI 并使用 `--oss` 标志启动,默认调用本地 gpt-oss:20b 模型。该集成要求至少 32K token 的上下文窗口,并支持切换至 Ollama Cloud 上的模型。
Fly.io 推出名为 Sprites 的新型 Linux 虚拟机,其创建仅需一两秒,并自带 100GB 持久根文件系统。Sprites 在闲置时会自动休眠以降低成本,其设计放弃了用户容器镜像,并采用 S3 兼容对象存储作为存储根。