跳到正文

内容形态

评测基准 最新动态

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

45 条精选近 30 天 30 条共收录 159 条

更新

评测基准的精选

今天10月6日周二第 1–20 条
  1. GitHub Blog · AI & ML56

    GitHub 发布 ReviewBench:AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放基准,基于 103.9M 个真实拉取请求构建,包含 219 个公开 PR,覆盖 19 种语言,采用多源黄金集和统一评分标准,支持按严重性、类别和精度-召回偏好切片评估。

    推荐理由:原文构建了面向 AI 代码审查的基准评测体系,提供了可复现的评估方法和公开数据集,有助于推动该领域标准化。

10月5日周一
  1. Solidot60

    研究发现AI聊天机器人在政治倾向提示下会成为意识形态回音室

    巴西UNICAMP研究人员测试21个模型在不同政治倾向提示下的回应,发现多数模型会向提示倾向靠拢,形成‘意识形态变色龙’效应。Llama 3.1 8B和DeepSeek V3.2偏移最小,GPT-5 Nano和Gemma 3 27B偏移最大。研究提出‘变色龙指数’衡量模型偏移程度,警告用户可能误将迎合性回应视为中立评估,加剧社会极化。

    推荐理由:研究揭示了主流模型在政治倾向提示下表现出显著偏移,读者可据此理解AI在意识形态敏感场景中的潜在风险。

  2. MarkTechPost73

    GPT-6 Astra、GPT-6.1 Sol、Gemini 4 Argon 与 Claude Fable 5.1:如何根据任务选择前沿模型

    文章对比了 OpenAI、Google DeepMind 和 Anthropic 在 30 天内发布的四款前沿模型。GPT-6.1 Sol 在 DeepSWE v1.1 等基准上表现接近 GPT-6 Astra,但价格仅为五分之一。

    推荐理由:原文对比了四款前沿模型在价格、访问规则和不同任务上的表现差异,为读者选择模型提供了具体的工作负载匹配建议。

10月4日周日
  1. The Decoder61

    研究称中国 AI 模型在敏感话题上复述官方立场或拒绝回答

    Aleph Alpha 的一项研究显示,中国 AI 模型在回答政治敏感问题时经常遵循官方路线。该研究测试了 Qwen、DeepSeek 和 Kimi 模型,覆盖了 967 个手动挑选的禁忌话题,其自有评分系统仅将 17% 至 41% 的回答评为平衡。研究还发现,这种亲中倾向可能出现在不提及中国的问题回答中,并可能通过训练数据影响其他模型。

  2. 钛媒体59

    StartLux 开源决策模型 StartLux-Decision,在多项基准测试中超越 Jev

    StartLux 开源了决策模型 StartLux-Decision,并一次性发布了 0.8B、2B、4B、9B、27B 五个参数版本。在 Decision Index 0.2.1 评测中,其 27B 版本得分 63.88,在 38 项基准中有 31 项高于 Jev 1.13;在另一套七项评测中平均准确率达 91.82%。

    推荐理由:原文提供了详细的基准测试对比和多种规格的量化版本,读者可以评估其在不同部署场景下的适用性。

  3. Hugging Face Blog62

    Microsoft 与 Hugging Face 发布智能体评测基准 ThinkingBox

    Microsoft 与 Hugging Face 联合发布智能体评测基准 ThinkingBox,通过检查数据库最终状态和副作用而非工具调用来评估智能体。该研究在 507 个有状态工作流上对 12 个 LLM 模型进行了 20 次重复测试,发现模型的一次性成功率(pass@1)与始终正确率(20/20)之间存在巨大差距。

    推荐理由:该研究通过检查数据库最终状态而非工具调用来评估智能体,揭示了模型一次性成功与可靠执行之间的显著差距。

10月3日周六
  1. MarkTechPost64

    决策 AI 模型解析:TypeSafe Jev 与 Fastino GLiDE、GLiNER2.5-Decide 及开源竞品对比

    决策 AI 模型是一种返回带概率的决策而非生成文本的新模型类别,适用于分类、路由、评分等需要确定性答案的场景。TypeSafe AI 的 Jev 是该领域的代表,定价为每百万输入 token 0.042 美元,输出免费;Fastino Labs 随后推出了竞品 GLiDE 和开源模型 GLiNER2.5-Decide,同时社区也出现了多个开源复现项目。

    推荐理由:文章对比了多款决策模型的核心能力、定价和适用场景,为开发者选择工具提供了具体参考。

10月2日周五
  1. Arize 博客65

    Claude 的智能体爬坡循环:从生产日志开始

    Arize 分析了 Anthropic 发布的 Claude hillclimb 方法,强调从生产日志构建评估集、混合代码和 LLM 评估器、优化成本与质量平衡,并通过 Arize AX 实现团队可复用的持续优化循环。

    推荐理由:原文结合生产日志和评估循环,展示了如何让智能体优化从个人实验转向团队可复现的持续流程。

10月1日周四
  1. Latent Space73

    Google DeepMind 发布 Gemini 4 Argon 模型,输出上限达 100 万 token

    Google DeepMind 发布了 Gemini 4 Argon 模型,专注于编码、企业知识工作和网络防御,并提供了 100 万 token 的输出上限。模型在 19 项可信基准测试中的 13 项取得领先,标准定价为每 100 万输入/输出 token 4/20 美元,目前通过 Fairwind 项目向政府用户和可信网络防御者提供有限预览。

    推荐理由:原文汇集了 Gemini 4 Argon 的发布详情、基准测试、定价和初步评测,读者可以了解其定位、能力与当前市场竞品的对比。

  2. 爱范儿64

    Gemini 4 Argon 正式发布,写作与长文本能力突出

    Gemini 4 Argon 正式发布,官方称其在写作、知识和长文本能力上领先,输出上限达 100 万 token,幻觉率降至 15%,API 定价为输入 2 美元/百万 token、输出 10 美元/百万 token。

    推荐理由:原文提供了 Gemini 4 Argon 的能力分布、输出上限和定价,读者可以据此判断其在写作与长文本任务中的相对优势和适用场景。

9月30日周三
  1. 雷锋网62

    实测 Qwen3.8-Flash 与 GLM-5.3-Flash:谁更懂办公工作流?

    雷峰网实测 Qwen3.8-Flash 与 GLM-5.3-Flash 在开发个人工作台任务中的表现,前者更侧重个人工作流设计,强调优先级、截止日期和知识沉淀;后者更偏向工程系统交付,结构完整、模块清晰。

    推荐理由:实测对比了两款 Flash 模型在办公场景下的能力差异,读者可据此判断它们在真实工作流中的适用方向。

  2. 雷锋网70

    OpenClaw 2.0 实测:从个人工具到可托管工作流系统的进化

    OpenClaw 2.0(v2026.8.1)发布,实测对比其与旧版 v2026.7.1-2 在长任务执行中的表现。2.0 版优化了新手引导、任务面板、历史会话搜索、对话分支和主动记忆,强化了云会话、共享会话、权限管理和插件安全审计,支持 Discord、Slack、Telegram 等多消息入口与本地/远端机器、浏览器、插件、记忆系统的集成。

    推荐理由:实测对比了 OpenClaw 2.0 与旧版在长任务中的表现,展示了其在任务管理、上下文处理和协作能力上的改进,读者可据此判断其在复杂工作流中的适用性。

  3. 雷锋网59

    HiDream-O1-Video 与 Seedance 2.5、MiniMax H3 的时序因果与音画同步对比评测

    文章对 HiDream-O1-Video-1.0、Seedance 2.5 和 MiniMax H3 进行了三组原创图生视频任务对比测试,重点关注意图规划、时间因果和音画对应。测试发现,HiDream 在动作、声音、结果的时序关系上表现更优,例如料酒入锅后油爆声和火焰依次出现,而其他模型存在火焰早于声音或对象一致性等问题。评测基于相同参考图和提示词,在端到端产品环境中进行。

    推荐理由:文章通过三组原创对比测试,量化分析了视频模型在时序因果和音画同步上的表现差异,为理解模型能力提供了具体案例。

  4. 雷锋网64

    阶跃星辰发布 Step 5 Preview 模型,进入全球开源前二

    阶跃星辰发布 Step 5 Preview 模型,在 Artificial Analysis Intelligence Index 上获得 44 分,位列全球开源前二,支持 1M 上下文窗口和 600B 参数规模。

    推荐理由:Step 5 Preview 在 AA 榜单进入全球开源前二,且在长程 Agent 任务中表现出稳定执行能力,为国产模型在复杂工程场景中的应用提供了新样本。

  5. 雷锋网71

    GPT-6 Astra 上手体验:一周在电脑里建曼哈顿

    GPT-6 Astra在实测中展现长任务执行能力,如在虚幻引擎中搭建曼哈顿、在Blender中生成3D游戏和飞船模型,并能操作Final Cut Pro完成视频剪辑。模型具备自我检查和修正结果的能力,但长任务中仍需人工干预以定义目标和方向,尚未实现完全自主。

    推荐理由:实测展示了GPT-6 Astra在长任务执行、软件操作和自我纠错方面的进展,读者可据此理解当前AI智能体在真实工作流中的能力边界。

  6. InfoQ · AI/ML66

    CodeScene 发布智能体重构 30 万行 C 代码的案例研究

    CodeScene 发布了一项案例研究,其中编码智能体在三周内以约 4000 美元的成本,重构了一个 30 万行的 C 语言代码库(《街头霸王 III:三度冲击》)。

    推荐理由:原文提供了详细的案例方法、成本数据和行业讨论,读者可以评估智能体大规模重构代码的实际可行性与局限。

  7. LangChain 博客62

    LangSmith 新增 Jev 智能体评估功能

    LangSmith 已上线 Jev 智能体评估功能,支持以低延迟、低成本方式对开放性代理行为进行结构化评估。用户可通过 LangSmith 的 Evaluators 页添加 Jev-as-a-judge 评估器,配置状态与 typed 问题,实现多指标并行评估,显著提升评估效率与成本效益。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月29日周二
  1. Arize 博客58

    Anthropic 称已修复 Claude 写作风格,作者通过实测评估验证

    作者 Jim Bennett 通过构建 20 个固定写作任务数据集,对 Claude Opus 5 和 Opus 5.5 进行双轮实验,人工标注 153 个风格问题,构建评估器并迭代优化,发现 Opus 5.5 的 em dash 几乎消失(从 12.9 降至 0.05/千词),其他风格问题减少约 50%,但部分新习惯出现,如更多加粗列表和三段式结构。

    推荐理由:作者通过构建数据集、实验、人工标注和评估器,验证了 Claude 5.5 写作风格改进的实际效果,提供了可复用的评估方法框架。