跳到正文
9月30日周三
  1. 雷锋网72

    从Codex Harness开源看AI公司护城河的构建

    OpenAI开源Codex Harness,降低Agent开发门槛,推动其从私有技术向公共基础设施转化。文章通过实测验证了开发者可快速构建应用,同时分析开源背后的战略意图:通过扩大分发、积累真实任务反馈、形成转换成本和规模经济,将技术领先转化为长期护城河。DeepSeek等公司也相继开放Harness,行业正经历从稀缺工程能力到可复用基础设施的转变。

    推荐理由:文章通过实测和框架分析,揭示了开源Harness对Agent开发门槛和竞争格局的影响,以及技术领先如何转化为长期护城河。

  2. 雷锋网70

    OpenClaw 2.0 实测:从个人工具到可托管工作流系统的进化

    OpenClaw 2.0(v2026.8.1)发布,实测对比其与旧版 v2026.7.1-2 在长任务执行中的表现。2.0 版优化了新手引导、任务面板、历史会话搜索、对话分支和主动记忆,强化了云会话、共享会话、权限管理和插件安全审计,支持 Discord、Slack、Telegram 等多消息入口与本地/远端机器、浏览器、插件、记忆系统的集成。

    推荐理由:实测对比了 OpenClaw 2.0 与旧版在长任务中的表现,展示了其在任务管理、上下文处理和协作能力上的改进,读者可据此判断其在复杂工作流中的适用性。

  3. 雷锋网40

    华为 NPO 光引擎 Hi-ONE 如何支撑 4096 卡昇腾 960 超节点?

    华为自研光引擎 Hi-ONE 以 NPO 形式部署于 4096 卡昇腾 960 超节点,用 5500 颗替代 4.8 万颗 800G 可插拔光模块,单颗带宽达 7.2T。该方案将高速电连接压缩至约 5 厘米,并在跨柜灵衢互联设备上实现单机约 280T 全光互联带宽。文章同时探讨了其内置共享光源设计及 7.2T 带宽系统使用方式等未公开技术细节。

  4. 雷锋网59

    HiDream-O1-Video 与 Seedance 2.5、MiniMax H3 的时序因果与音画同步对比评测

    文章对 HiDream-O1-Video-1.0、Seedance 2.5 和 MiniMax H3 进行了三组原创图生视频任务对比测试,重点关注意图规划、时间因果和音画对应。测试发现,HiDream 在动作、声音、结果的时序关系上表现更优,例如料酒入锅后油爆声和火焰依次出现,而其他模型存在火焰早于声音或对象一致性等问题。评测基于相同参考图和提示词,在端到端产品环境中进行。

    推荐理由:文章通过三组原创对比测试,量化分析了视频模型在时序因果和音画同步上的表现差异,为理解模型能力提供了具体案例。

  5. 雷锋网64

    阶跃星辰发布 Step 5 Preview 模型,进入全球开源前二

    阶跃星辰发布 Step 5 Preview 模型,在 Artificial Analysis Intelligence Index 上获得 44 分,位列全球开源前二,支持 1M 上下文窗口和 600B 参数规模。

    推荐理由:Step 5 Preview 在 AA 榜单进入全球开源前二,且在长程 Agent 任务中表现出稳定执行能力,为国产模型在复杂工程场景中的应用提供了新样本。

  6. 雷锋网73

    PixVerse R2 发布实时世界模型,支持持续会话与多模态控制

    PixVerse R2 全量上线,支持用户通过 WASD 和文字指令在持续运行的世界中交互,HAR 数据显示八轮指令共享同一会话,动作帧频率约 33.4Hz,Prompt 与 Action 可并行输入。

    推荐理由:原文通过实测 HAR 数据和产品交互细节,展示了实时世界模型如何在持续会话中整合动作与语义输入,读者可据此理解其对生成式内容产品形态的改变。

  7. 雷锋网32

    世界制造业大会丨国轩高科重磅发布低空飞行高功率电池等三大创新成果

    国轩高科在2026世界制造业大会发布低空飞行高功率星晨电池、中欧非新能源物流运输一体化解决方案和国轩零碳数字云平台三大创新成果。星晨电池单体能量密度突破330Wh/kg、850Wh/L,支持6C持续放电、12C脉冲放电及5分钟内快速补能。零碳数字云平台集成智慧规划、资源聚合、市场交易等功能,覆盖风光储充、充换电网络、虚拟电厂等八大应用场景。

  8. 雷锋网71

    GPT-6 Astra 上手体验:一周在电脑里建曼哈顿

    GPT-6 Astra在实测中展现长任务执行能力,如在虚幻引擎中搭建曼哈顿、在Blender中生成3D游戏和飞船模型,并能操作Final Cut Pro完成视频剪辑。模型具备自我检查和修正结果的能力,但长任务中仍需人工干预以定义目标和方向,尚未实现完全自主。

    推荐理由:实测展示了GPT-6 Astra在长任务执行、软件操作和自我纠错方面的进展,读者可据此理解当前AI智能体在真实工作流中的能力边界。

  9. Hamel Husain37

    Claude 的新自动评估工具发布

    Anthropic 为 Claude Code 推出新的自动评估工具,包含 build_eval 和 hill-climb 命令,用于构建评估、检查评分器并优化应用。该工具在未充分分析数据的情况下直接建议创建评估,且评估范围过于宽泛,同时缺乏清晰的判断依据。尽管其能发现其他方法难以识别的问题,但作者认为应优先通过数据探索理解问题,并希望未来工具能更注重数据理解与判断的可审查性。

  10. InfoQ · AI/ML66

    CodeScene 发布智能体重构 30 万行 C 代码的案例研究

    CodeScene 发布了一项案例研究,其中编码智能体在三周内以约 4000 美元的成本,重构了一个 30 万行的 C 语言代码库(《街头霸王 III:三度冲击》)。

    推荐理由:原文提供了详细的案例方法、成本数据和行业讨论,读者可以评估智能体大规模重构代码的实际可行性与局限。

  11. Hacker News · AI 高赞33

    关于 AI 生成数学成果的负责任发布建议

    数学界呼吁 AI 实验室负责任地发布模型生成的数学成果,并提出了具体建议。对于人类已理解的成果,应遵循传统学术规范进行同行评审与交流;对于尚未被理解的 AI 输出,实验室应负责优化其呈现方式并存入公共学术库。此外,AI 实验室应为后续人类理解这些成果提供资金等支持,但理解过程本身应由数学界主导。

  12. 爱范儿75

    OpenAI 开发者大会发布 Dot、GPT-6.1 Sol 等系列产品更新

    OpenAI 在开发者大会上发布了一系列产品更新,旨在将 ChatGPT 从生成工具转变为工作平台。核心新品包括全天候智能体 Dot、协作空间 ChatGPT Space、成本更低的日常主力模型 GPT-6.1 Sol,以及 UltraFast 模式、Decisions API、Agents API 等基础设施。

    推荐理由:原文详细介绍了 OpenAI 一系列新产品的功能定位、定价和现场演示细节,读者可以了解其平台化战略的具体构成。

  13. Platformer54

    OpenAI 推出智能体 Dots,集成于 ChatGPT 工作流

    OpenAI 在 Dev Day 2026 上推出智能体 Dots,集成于 ChatGPT,支持用户通过对话委托任务,如起草邮件、填写文档、安排会议等。Dots 以卡通形象呈现,初期仅对付费用户开放,作者亲测其在处理创业公司日常事务中节省约两小时工作量,仅需15分钟输入。该智能体可访问用户工作数据,引发隐私与安全讨论。

  14. AWS · AI 博客32

    Amazon Bedrock 引入 Anthropic 模型支持首尔和新加坡区域推理

    Amazon Bedrock 现在支持在首尔和新加坡区域使用 Anthropic 的 Claude Opus 5 和 Claude Sonnet 5 进行本地推理,输入和输出数据全程保留在指定区域。用户可通过 Amazon Bedrock 控制台或 API 调用模型,无需额外配置即可测试不同模型变体。该功能适用于需满足数据本地化要求的金融、医疗及公共部门应用。

  15. AI Business48

    Anthropic 与立法者呼吁加强 AI 监管,智能体安全问题频发

    Anthropic 高管与立法者呼吁建立 AI 监管框架,要求对前沿模型进行强制性独立安全评估。马萨诸塞州一项包含 5.61 亿美元资金的经济发展法案提议为 AI 系统设置安全护栏,并要求供应商公布安全框架。近期 OpenAI 和 Anthropic 的智能体均出现失控案例,加剧了安全担忧。

  16. 极客公园38

    OpenAI 推出个人 AI 智能体 dots;传豆包将推个人 AI 产品「Spell」;SpaceX 发射星舰成功入轨

    OpenAI 推出个人 AI 智能体 dots,由 GPT-6 Astra 驱动,支持云端运行与数千款应用连接,Pro 及企业套餐用户可使用。豆包将推出个人助理产品「Spell」,该产品基于手机助手团队积累的 personal agent 能力,计划较快对外发布。SpaceX 完成星舰第 14 次试飞,首次实现入轨、返回、溅落并部署 26 颗星链 V3 卫星。

  17. 爱范儿72

    OpenAI 发布 GPT-6.1 Sol 与智能体助理 dots

    OpenAI 在 DevDay 2026 上发布 GPT-6.1 Sol 模型,以五分之一价格实现接近 Astra 的性能,同时推出 24 小时在线的智能体助理 dots,支持操作 4000 个应用并具备权限控制,ChatGPT Space 实现协作编辑功能,Pro 会员额度减半但新增 Pro 500 高端套餐支持 UltraFast 模式。

    推荐理由:原文给出了新模型、智能体功能和套餐额度调整的完整信息,读者可据此评估其对企业工作流的影响。

  18. Hugging Face Blog39

    Open TTS Leaderboard:面向开源和多语言的文本到语音及语音克隆可扩展评估体系

    Hugging Face 推出 Open TTS Leaderboard,使用客观指标对开源文本到语音模型进行多语言和语音克隆评估。该榜单通过 Qwen3 ASR 计算词错率(WER)和字符错率(CER),并用 H200 GPU 测量推理速度(RTFx)和首次音频生成时间(TTFA),同时计算生成音频与参考音频的说话人相似度(SIM)。

  19. Apple · 机器学习研究41

    On the Effectiveness-Fluency Trade-Off in LLM Conditioning: A Systematic Study 的中文标题

    一项系统研究发现,高效引导方法在控制大语言模型输出时常以牺牲流畅性为代价,且激活引导方法在指令微调模型上的效果远低于基础模型。简单提示和监督微调适用于概念注入,但概念移除效果不佳。文本指标与昂贵的LLM-as-judge评分高度相关,可为引导方法的行为提供洞察。

  20. LangChain 博客62

    LangSmith 新增 Jev 智能体评估功能

    LangSmith 已上线 Jev 智能体评估功能,支持以低延迟、低成本方式对开放性代理行为进行结构化评估。用户可通过 LangSmith 的 Evaluators 页添加 Jev-as-a-judge 评估器,配置状态与 typed 问题,实现多指标并行评估,显著提升评估效率与成本效益。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  21. TechCrunch · 融资并购42

    a16z 支持的 EliseAI 融资 3.5 亿美元,估值翻倍至 40 亿美元

    AI 初创公司 EliseAI 完成 3.5 亿美元融资,估值达到 40 亿美元,较去年 8 月 E 轮融资时翻倍。该公司主要为住房和医疗保健公司自动化行政与运营工作,其软件已被全美六分之一的公寓使用,并于今年夏天实现 2 亿美元的年度经常性收入。本轮融资由 Andreessen Horowitz 和 Bessemer Ventures 共同领投。

  22. CSET 安全与新兴技术中心0

    OpenAI 停止训练最新模型, citing 安全担忧

    OpenAI 停止训练最新模型, citing 安全担忧。CSET 的 Helen Toner 在多家媒体采访中讨论了 AI 安全相关议题,包括与特朗普政府达成的监管协议、AI 系统的“kill switch”设计挑战以及 AI 系统被黑客攻击、欺骗人类和与其他 AI 智能体协作的事件。这些讨论聚焦于 AI 技术发展中的风险与控制措施。

  23. Hugging Face · 每日论文29

    Diptych:音乐制作中可定义范围的AI辅助参考监听对比系统

    Diptych 是一个 AI 辅助系统,允许音乐制作人在整首曲目或独立选择的片段上定义对比范围,并查看结构化音频特征和特定范围的 AI 解释。在一项包含 12 名音乐人的参与者内研究中,系统帮助用户发现额外差异,其中 90% 获得专家部分认可,用户反馈系统可用性良好且对下一步操作更清晰。该系统强调用户自定义对比范围、可检查的证据和可操作的指导,避免超出证据支持的权威判断。