AI 日报 · 2026 年 10 月 8 日 · 星期四
SI信息茧房
OpenAI 发布数学领域AI研究成果,涵盖准黎曼猜想等722个难题
OpenAI 在GitHub发布由内部前沿模型生成的722篇数学手稿,涵盖372个悬而未决的顶级数学难题,包括准黎曼猜想、霍奇猜想、马勒猜想等重大突破,并提供Lean形式化验证与推理过程。平均每次证明消耗约3小时ChatGPT Pro算力。OpenAI表示将资助相关研讨会并持续改进发布规范,以促进科学透明与开放。
- OpenAI 公开数学研究进展与代码库Hacker News · AI
- OpenAI 在 GitHub 发布 372 个 AI 生成的数学证明The Decoder
- OpenAI发布722篇数学论文解决500个难题中的90个,包含准黎曼假设Latent Space
产品发布/更新
Anthropic 发布 Claude Haiku 5.5,大幅降价并提升性能
Anthropic 发布 Claude Haiku 5.5,为迄今最快最便宜的小模型,支持可调推理级别,适用于摘要、数据库查询等高并发任务。相比 Haiku 4.5,平均成本降低 75%,10万 token 以内请求降价达 90%。
- AWS 推出 Claude Haiku 5.5 模型AWS · AI 博客
- Claude Haiku 5.5 发布:新定价与推理能力更新Simon Willison
OpenAI ChatGPT 升级 GPT-6 模型并推出智能用户界面
OpenAI 宣布在 ChatGPT 中面向所有用户推出 GPT-6 系列模型及智能用户界面,此前 GPT-6 Astra、Sol 和 Luna 仅限 ChatGPT Work 和 Codex 使用。智能界面支持文本、图像和交互元素的灵活组合,可包含图表、按钮、表单等,示例中展示通过互动式视觉效果学习打麻将。
Google 推出 Playground 平台,通过提示词生成可玩游戏,与 Unity 合作推进专业功能
Google 推出 Playground 平台,用户可通过文本提示词生成可玩游戏,无需编码,支持修改物理规则、角色和场景。平台基于 Gemini、Nano Banana 和 Lyria 模型,运行于浏览器,支持手机和笔记本使用。
OpenAI发布Dots:可持久运行的AI智能体
OpenAI在DevDay 2026上发布Dots,一种基于GPT-6 Astra的持续运行AI智能体,可连接超4000个应用,在用户关闭设备后继续工作。Dots通过ChatGPT、Slack或Teams等渠道交互,支持语音,能主动完成如发票生成、代码测试等任务,但需用户设定明确目标与权限边界。
Google 公开 SynthID 检测器,称超 1800 亿媒体文件已携带水印
Google 将 SynthID 检测器公开,支持检测来自 Gemini、Veo、Lyria 等模型生成的图像、视频和音频文件,格式包括 JPG、PNG、MP4、MP3。
行业动态
疑似腾讯AI智能体舰队抓取阿里高德地图数据,研究人员发现绕过防护技术
研究人员发现一个疑似使用腾讯Hy模型的AI智能体舰队,通过Tencent Cloud和hysandbox-ats代理,在一周内从阿里高德地图抓取数据,单日峰值达1,810次URL扫描。
论文研究
Microsoft Research发布Agent Lightning v1.0:3500行轻量级智能体强化学习框架
Microsoft Research Asia发布Agent Lightning v1.0,一个约3500行代码的轻量级智能体强化学习框架,支持真实代理框架直接参与训练,无需重写代理逻辑。
研究人员在开源模型中植入后门以窃取编码代理中的凭证
研究人员通过在Qwen2.5-7B-Instruct模型中注入少量中毒训练样本,构建了一个隐蔽后门,该后门在触发词(如'bonsoir, Elliot')出现时会调用远程shell payload窃取项目中的.env文件。
Hugging Face发布Nemotron在IOI 2026和IMO 2026中获金牌水平的研究
Hugging Face基于Nemotron 3模型,通过监督微调、强化学习和反馈驱动推理,构建系统在IOI 2026中获得535.4/600分(超过金牌线361.12),在IMO 2026中获得30/42分(超过金牌线29)。系统采用生成-验证-优化循环,使用高质量领域数据和可复用的微调配方。相关模型、数据集、推理流程和基准已开源至Hugging Face。
Arize 对 Jev、Kev、Liquid d1 等八种决策模型进行基准评测
Arize 对 Jev、Kev、Liquid d1、Clef 27B 等八种决策模型在幻觉检测、LLM 评估和智能体路由任务中进行基准评测,对比了它们在准确率、延迟、成本和对问题表述敏感度方面的表现。评测分为云端和本地两个赛区,最终 Jev 和 Kev 在各自赛区胜出,但整体性能接近,选择取决于部署方式和对问题表述的敏感度。
技巧与观点
构建自己的后训练管道:从SFT到PPO的完整实践
本文详解如何构建经典ChatGPT后训练管道,使用Qwen2.5-1.5B作为基础模型,依次实现SFT、奖励模型训练和PPO阶段。SFT阶段采用torchtune库,配置LoRA微调和YAML参数;奖励模型基于TRL的RewardTrainer,从SFT检查点启动,训练1个epoch;PPO阶段使用ByteDance的verl框架,配置YAML文件协调四模型并行训练。
快讯
- 微软与Nvidia发布Surface Laptop Ultra及RTX Spark芯片Tom's Hardware
- Claude与GPT跨界进入视频创作,专业视频模型护城河面临挑战钛媒体
- 德州为何让数据中心等待:电网压力与审批暂停的深层原因a16z News
- 作者实测五款 AI 编程助手一个月:Cursor、Copilot、Claude Code、Windsurf 与 Replit Agent 的真实表现KDnuggets
- Nous Research 获 9000 万美元融资,推进 Hermes AI 智能体企业版The Next Web
- Biohub联合Meta、Google DeepMind等投入18亿美元构建AI生物学数据基础设施The Next Web
- NanoMuse 发布开源多设备 AI 智能体,支持手机、电脑和自托管Hacker News · AI
- 微软Copilot将获得对Windows系统和本地文件的更多控制权The Verge · AI
- 研究揭示工具使用智能体在证据到行动链条中的失败模式Hugging Face · 每日论文
- AgentCompile 发布:AI 智能体重复任务编译,减少 58% LLM 调用Hacker News · AI