跳到正文
2026 年 10 月 8 日 · 星期四每天 08:00 出刊

AI 日报 · 2026 年 10 月 8 日 · 星期四

SI信息茧房

第 3 期082026 年 10 月星期四
12件大事14个来源3件一手发布约 5 分钟读完
头条

OpenAI 发布数学领域AI研究成果,涵盖准黎曼猜想等722个难题

OpenAI 在GitHub发布由内部前沿模型生成的722篇数学手稿,涵盖372个悬而未决的顶级数学难题,包括准黎曼猜想、霍奇猜想、马勒猜想等重大突破,并提供Lean形式化验证与推理过程。平均每次证明消耗约3小时ChatGPT Pro算力。OpenAI表示将资助相关研讨会并持续改进发布规范,以促进科学透明与开放。

cnBeta另有 7 家信源报道原文
01

产品发布/更新

IT之家另有 4 家信源报道

OpenAI ChatGPT 升级 GPT-6 模型并推出智能用户界面

OpenAI 宣布在 ChatGPT 中面向所有用户推出 GPT-6 系列模型及智能用户界面,此前 GPT-6 Astra、Sol 和 Luna 仅限 ChatGPT Work 和 Codex 使用。智能界面支持文本、图像和交互元素的灵活组合,可包含图表、按钮、表单等,示例中展示通过互动式视觉效果学习打麻将。

KDnuggets另有 2 家信源报道

OpenAI发布Dots:可持久运行的AI智能体

OpenAI在DevDay 2026上发布Dots,一种基于GPT-6 Astra的持续运行AI智能体,可连接超4000个应用,在用户关闭设备后继续工作。Dots通过ChatGPT、Slack或Teams等渠道交互,支持语音,能主动完成如发票生成、代码测试等任务,但需用户设定明确目标与权限边界。

02

行业动态

03

论文研究

Hugging Face Blog一手

Hugging Face发布Nemotron在IOI 2026和IMO 2026中获金牌水平的研究

Hugging Face基于Nemotron 3模型,通过监督微调、强化学习和反馈驱动推理,构建系统在IOI 2026中获得535.4/600分(超过金牌线361.12),在IMO 2026中获得30/42分(超过金牌线29)。系统采用生成-验证-优化循环,使用高质量领域数据和可复用的微调配方。相关模型、数据集、推理流程和基准已开源至Hugging Face。

Arize 博客一手

Arize 对 Jev、Kev、Liquid d1 等八种决策模型进行基准评测

Arize 对 Jev、Kev、Liquid d1、Clef 27B 等八种决策模型在幻觉检测、LLM 评估和智能体路由任务中进行基准评测,对比了它们在准确率、延迟、成本和对问题表述敏感度方面的表现。评测分为云端和本地两个赛区,最终 Jev 和 Kev 在各自赛区胜出,但整体性能接近,选择取决于部署方式和对问题表述的敏感度。

04

技巧与观点

O'Reilly Radar

构建自己的后训练管道:从SFT到PPO的完整实践

本文详解如何构建经典ChatGPT后训练管道,使用Qwen2.5-1.5B作为基础模型,依次实现SFT、奖励模型训练和PPO阶段。SFT阶段采用torchtune库,配置LoRA微调和YAML参数;奖励模型基于TRL的RewardTrainer,从SFT检查点启动,训练1个epoch;PPO阶段使用ByteDance的verl框架,配置YAML文件协调四模型并行训练。

05

快讯

(本期完)

SI信息茧房 日报由编辑系统根据公开来源自动编辑,每条均附原文 · 日报合订本