跳到正文

技术方向

部署工程 最新动态

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

77 条精选近 30 天 38 条共收录 355 条

更新

部署工程的精选

今天10月5日周一第 1–20 条
  1. Hacker News · AI67

    在 Xteink X3 电子阅读器上运行 Muse AI

    作者成功将 Muse Gadget SDK 移植到仅有 321 KB RAM 的 Xteink X3 电子阅读器上,实现了通过 Wi-Fi 连接 Muse AI 并显示待办事项、笔记等内容。

    推荐理由:作者分享了在内存极有限的 ESP32-C3 设备上适配 Muse SDK 的具体步骤和内存优化技巧,为其他端侧 AI 项目提供了可参考的工程经验。

10月4日周日
  1. InfoQ · AI/ML60

    AWS 团队开源 AI 智能体后台任务管理工具 Pizza Bot

    AWS 团队开源了 Pizza Bot,这是一个自托管应用,旨在让 AI 智能体在后台运行任务并通过收件箱式界面返回结果。它支持定时或 Webhook 触发的任务,可将工作委派给专用智能体,并在需要时暂停等待人工批准。该工具采用客户端-服务器架构,将智能体状态、线程和日志持久化存储在用户本地文件夹中,数据仅发送至用户配置的模型提供商和明确启用的 MCP 服务器。

    推荐理由:原文介绍了这个开源工具的设计理念、核心功能与本地优先架构,读者可以了解它如何管理异步任务流。

  2. InfoQ · AI/ML69

    Archestra 开源安全引擎 OpenAPPA,在两大基准测试中实现 0% 攻击成功率

    Archestra 发布了开源安全引擎 OpenAPPA,旨在防止由提示词注入或模型幻觉导致的数据泄露。该引擎在 Bench-Corp 和 AgentThreatBench 安全基准测试中实现了 0% 的攻击成功率,任务完成率为 89%。

    推荐理由:原文提供了开源安全引擎 OpenAPPA 在两大基准测试中的零攻击成功率数据,并与 Claude Code、Microsoft FIDES 进行了对比。

10月3日周六
  1. MarkTechPost64

    决策 AI 模型解析:TypeSafe Jev 与 Fastino GLiDE、GLiNER2.5-Decide 及开源竞品对比

    决策 AI 模型是一种返回带概率的决策而非生成文本的新模型类别,适用于分类、路由、评分等需要确定性答案的场景。TypeSafe AI 的 Jev 是该领域的代表,定价为每百万输入 token 0.042 美元,输出免费;Fastino Labs 随后推出了竞品 GLiDE 和开源模型 GLiNER2.5-Decide,同时社区也出现了多个开源复现项目。

    推荐理由:文章对比了多款决策模型的核心能力、定价和适用场景,为开发者选择工具提供了具体参考。

10月2日周五
  1. NVIDIA Blog58

    NVIDIA 推出 64GB 内存版 DGX Spark 本地 AI 开发平台

    NVIDIA 发布 DGX Spark 64GB 内存配置,为开发者提供更低成本的本地 AI 开发与部署平台。该配置支持高达 1000 亿参数的模型完全在设备上运行,并可通过 NVIDIA Sync Cluster Assistant 将两台设备集群,将内存扩展至 128GB,在 Qwen 3.8 27B 测试中实现最高 1.7 倍的性能提升。

    推荐理由:NVIDIA 为 DGX Spark 推出更低内存配置,降低了本地 AI 开发的门槛,并展示了通过集群扩展性能的具体方法。

  2. InfoQ · AI/ML72

    OpenAI DevDay 2026 发布多项开发者产品更新

    OpenAI 在 DevDay 2026 上宣布了一系列产品和开发者更新。GPT-6.1 Sol 模型在多项评测中接近 GPT-6 Astra,但输入/输出 token 价格仅为后者的五分之一。

    推荐理由:原文详细列举了多项产品更新及其开发者接口,读者可以据此评估 OpenAI 平台向持续智能体工作流的转变。

10月1日周四
  1. Cloudflare · AI69

    Cloudflare 发布开源决策模型 Clef 及 RL 微调平台

    Cloudflare 发布其训练的开源决策模型 Clef 和 Clef-flash,并推出新的强化学习微调平台。Clef 模型在 Jev Decision Index 基准测试中领先,支持 64k 上下文窗口和视觉编码,并托管于 Workers AI 以降低延迟。模型已在 Hugging Face 以 Apache 2.0 许可证开源。

    推荐理由:原文提供了决策模型的具体能力、基准测试结果和微调平台细节,读者可以据此评估它如何提升智能体工作流的效率和确定性。

  2. Cloudflare · AI59

    Cloudflare Workers AI 接入 EuroLLM 和 Apertus 两个欧洲开源模型

    Cloudflare 宣布其 Workers AI 平台接入两个欧洲开源大模型 EuroLLM 和 Apertus,并开放访问申请。EuroLLM 支持 35 种语言,包括所有 24 种欧盟官方语言;Apertus 在超过 1500 种语言的 15 万亿 token 上训练,其架构、权重、训练数据和方法均已公开。

    推荐理由:原文介绍了两个欧洲开源模型接入其平台,并提供了具体的技术细节和申请入口,读者可以据此评估其多语言能力和合规设计。

  3. Cloudflare · AI60

    Cloudflare OS 开放全托管部署候补名单并更新功能

    Cloudflare OS 宣布开放全托管部署的候补名单,用户可通过仪表板快速启动组织专属的智能体工作空间。本次更新新增了连接 GitHub 仓库进行代码操作、改进 Google Workspace 集成以处理邮件和文档,以及支持将工作成果导出为 Excel、PDF 等多种格式的功能。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  4. InfoQ · AI/ML74

    TypeSafe AI 发布决策模型 Jev,返回带概率的结构化答案

    TypeSafe AI 发布了名为 Jev 的决策模型,它不生成文本,而是返回带有概率分布和置信度的结构化答案,供软件直接调用。输入成本为每百万 token 0.042美元,输出免费,上下文窗口为 32k token,端到端延迟在 70ms 到 500ms 之间。

    推荐理由:原文提供了定价、性能对比和早期采用案例,读者可以据此评估它是否适合替代现有分类或路由任务。

  5. Latent Space70

    Latent Space 访谈:OpenAI 产品负责人谈计算机使用智能体的进展与未来

    Latent Space 播客采访了 OpenAI 计算机使用智能体产品负责人 Ari Weinstein 和 API 产品负责人 Nikunj Handa。Ari 解释了计算机使用智能体相比几个月前已‘180度不同’,现在更擅长调试和从失败中恢复,结合了截图、无障碍数据、DOM、Playwright 和生成代码等多种模态,并讨论了从‘比普通人快’到‘超人级’性能的路径。

    推荐理由:访谈提供了 OpenAI 产品负责人对计算机使用智能体进展的内部视角,包括其能力变化、技术栈演进和未来方向。

9月30日周三
  1. Cloudflare · AI65

    Cloudflare AI Gateway 推出 Auto Router 公开测试版以降低 AI 成本

    Cloudflare 在 AI Gateway 中发布 Auto Router 公开测试版,通过自动将请求路由到性价比更高的模型来帮助组织降低 AI 成本。内部测试显示,相比仅使用 OpenAI Sol 和 Anthropic Claude Opus 等前沿模型,Auto Router 可节省高达 30% 的成本。

    推荐理由:Cloudflare 通过其 AI Gateway 推出自动路由功能,旨在为组织在内部部署 AI 时提供成本控制方案。

  2. Cloudflare · AI55

    Cloudflare 推出 Pay Per Use 测试版,为 AI 使用内容付费

    Cloudflare 推出 Pay Per Use 测试版,允许内容发布者向已识别的 AI 公司授权内容,并根据实际使用情况(如被 AI 搜索引用、智能体报告引用)获得报酬。AI 公司定义付费用途和价格,发布者选择接受哪些报价,Cloudflare 负责处理注册、使用记录、计费和支付。该机制旨在为 AI 驱动的网络构建一个经济层,让内容在被他人产品使用时也能产生可持续收入。

    推荐理由:原文详细描述了新机制的运作流程和商业逻辑,为内容创作者和AI公司提供了一种新的合作框架参考。

  3. Cloudflare · AI62

    Cloudflare 发布 Monetization Gateway 测试版,支持 AI 智能体按需付费

    Cloudflare 发布 Monetization Gateway 测试版,允许网站、API、MCP 工具或数据集的拥有者向访问的 AI 智能体按次收费。该网关使用 HTTP 402 状态码,通过 Base 区块链上的 USDC 稳定币进行支付结算,无需重定向到结账页面或调用单独的支付 API。

    推荐理由:原文展示了如何通过 HTTP 402 状态码和稳定币支付,让网站、API 和 MCP 工具直接向 AI 智能体收费,并给出了四个实际用例。

  4. Cloudflare · AI63

    Cloudflare 发布应对 AI 智能体流量的系列产品与工具

    Cloudflare 发布一系列产品与工具,帮助网站应对 AI 智能体流量超过人类流量带来的挑战。超过一半的互联网流量已非人类,导致网站收入下降而成本上升。Cloudflare 推出了 AI Crawl Control、Web Bot Auth、Disallow AI Training 等工具,让网站能识别、区分并控制不同 AI 流量。

    推荐理由:原文详细阐述了非人类流量成为主流后网站面临的收入困境,并给出了 Cloudflare 提供的身份验证、流量控制和付费结算等具体解决方案。

  5. Cloudflare · AI65

    Cloudflare Containers 重构以支持可扩展的智能体沙盒

    Cloudflare 宣布重构其 Containers 服务,以更好地支持 AI 智能体工作负载。主要更新包括引入新的 durable_object 调度策略,允许在运行时选择沙盒镜像和实例类型,使容器启动速度提升 6 倍以上,并新增了文件系统快照功能。这些改进旨在让智能体能够按需创建、暂停和恢复工作空间,满足编码助手、评估和强化学习等场景的需求。

    推荐理由:Cloudflare Containers 针对 AI 智能体工作负载进行了架构重构,提供了更快的启动速度和运行时配置能力。

  6. 爱范儿72

    OpenAI 发布 GPT-6.1 Sol 与智能体助理 dots

    OpenAI 在 DevDay 2026 上发布 GPT-6.1 Sol 模型,以五分之一价格实现接近 Astra 的性能,同时推出 24 小时在线的智能体助理 dots,支持操作 4000 个应用并具备权限控制,ChatGPT Space 实现协作编辑功能,Pro 会员额度减半但新增 Pro 500 高端套餐支持 UltraFast 模式。

    推荐理由:原文给出了新模型、智能体功能和套餐额度调整的完整信息,读者可据此评估其对企业工作流的影响。