跳到正文

公司与模型

Microsoft / Copilot 最新动态

微软的 AI 布局:Copilot 全家桶、Azure AI 基础设施与 OpenAI 合作关系的持续追踪。

6 条精选近 30 天 6 条共收录 63 条

更新

Microsoft / Copilot的精选

今天10月6日周二第 1–6 条
  1. GitHub Blog · AI & ML56

    GitHub 发布 ReviewBench:AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放基准,基于 103.9M 个真实拉取请求构建,包含 219 个公开 PR,覆盖 19 种语言,采用多源黄金集和统一评分标准,支持按严重性、类别和精度-召回偏好切片评估。

    推荐理由:原文构建了面向 AI 代码审查的基准评测体系,提供了可复现的评估方法和公开数据集,有助于推动该领域标准化。

10月4日周日
  1. cnBeta60

    KAIST 与微软研发“神经价值对齐”AI 系统,通过脑电波判断意图

    KAIST 与微软的研究团队开发了名为“神经价值对齐”的 AI 系统,利用脑电图监测用户大脑的预测误差信号,以判断 AI 是否理解或执行了用户的真实意图。系统分析奖励预测误差和状态预测误差两类神经信号,能区分错误发生在目标还是执行层面。

    推荐理由:原文介绍了利用脑电信号解决人机意图对齐模糊性的具体方法,为理解下一代交互式智能系统提供了技术视角。

  2. Hugging Face Blog62

    Microsoft 与 Hugging Face 发布智能体评测基准 ThinkingBox

    Microsoft 与 Hugging Face 联合发布智能体评测基准 ThinkingBox,通过检查数据库最终状态和副作用而非工具调用来评估智能体。该研究在 507 个有状态工作流上对 12 个 LLM 模型进行了 20 次重复测试,发现模型的一次性成功率(pass@1)与始终正确率(20/20)之间存在巨大差距。

    推荐理由:该研究通过检查数据库最终状态而非工具调用来评估智能体,揭示了模型一次性成功与可靠执行之间的显著差距。

9月29日周二
  1. Microsoft Research54

    微软研究院推出生物AI研究系统Quine

    微软研究院推出名为Quine的生物AI研究系统,该系统包含一个多模态生物世界模型和一个连接模型、科学工具、文献与研究人员的工作平台。在与Broad Institute的合作中,Quine被用于预测和优先排序能驱动肿瘤细胞状态转变的化合物,其排名靠前的候选物在湿实验室实验中得到了验证。

    推荐理由:原文展示了该系统在癌症研究中的具体应用案例和效果,为关注AI在生物科学领域落地的读者提供了实践参考。

9月25日周五
  1. Microsoft 官方博客67

    Microsoft 推出新版 Copilot,新增 Home、Code 和 Autopilot 功能

    Microsoft 推出新版 Copilot,新增 Home、Code 和 Autopilot 三大功能。Home 整合 Chat 与 Cowork,集成 Word、Excel、PowerPoint 实时协作;Code 允许非开发者用自然语言构建应用,基于 GitHub Copilot 技术运行于安全沙箱;Autopilot 是持续工作的智能体,可自主执行任务并跨应用协作。

    推荐理由:原文给出了新功能模块的定位、能力边界和开放路径,读者可以据此判断它会怎样改变现有工作流。

9月17日周四
  1. Microsoft 新模型60

    Microsoft 发布 FrogNano-4B-2609 模型:基于 Qwen3.5-4B 的紧凑型代码智能体

    Microsoft 发布 FrogNano-4B-2609 模型,基于 Qwen/Qwen3.5-4B 架构,通过强化学习在约 1,500 个合成软件工程任务上训练,专用于仓库级代码智能体任务。

    推荐理由:原文详细说明了模型架构、训练方法、基准表现和使用限制,读者可据此判断其在代码智能体领域的定位与适用边界。