跳到正文

技术方向

AI 编码 最新动态

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

46 条精选近 30 天 19 条共收录 120 条

更新

精选归档 · 第 2 页

8月27日周四第 21–40 条
  1. 面壁 MiniCPM 新模型58

    面壁 MiniCPM5-2B 模型发布

    面壁 MiniCPM5-2B 模型发布,为2B参数量级的密集Transformer模型,支持131,072上下文长度,适用于本地部署和资源受限场景。模型在2B规模中达到开源SOTA,平均分53.9,优于多个4B模型,在代码、数学、长上下文、工具调用和智能体任务中表现突出。

    推荐理由:原文给出了模型参数、训练数据、评测基准和多芯片部署方案,读者可以据此判断它在2B规模模型中的性能定位和本地部署可行性。

8月25日周二
  1. The Pragmatic Engineer65

    Ramp 构建内部智能体 Inspect 的实践与架构

    Ramp 开发了名为 Inspect 的内部智能体,用于在远程沙箱环境中执行编码、调试、代码审查等任务。该系统基于 Cloudflare Durable Objects 和 Modal 沙箱,支持快速启动(<5秒)和跨功能协作,已覆盖75%的合并PR。Inspect 通过集成内部数据源与工具链,实现对前后端变更的自动验证,并作为平台支撑超过200个上层智能体,如自动修复、监控告警和数据分析代理。

    推荐理由:原文详细展示了内部智能体 Inspect 的构建逻辑与实际应用场景,读者可借鉴其架构设计与落地路径。

  2. 智谱 GLM 新模型77

    智谱 GLM-5.3-BF16 模型发布,强化编码与智能体能力

    智谱发布 GLM-5.3-BF16 模型,基于 GLM-5.2 基座通过后训练提升能力,在编码、长链任务和智能体场景中表现显著增强。在 Z.ai Code Bench 上编码能力提升 50%,在 Terminal Bench 3.0、Agents' Last Exam、DeepSWE 等多个公开基准上达到开源模型 SOTA。

    推荐理由:原文提供了与前代模型的基准对比和本地部署方案,读者可据此判断其在编码和智能体任务中的实际能力提升与应用适配性。

  3. 智谱 GLM 新模型67

    智谱发布 GLM-5.3-Flash 多模态大模型

    智谱发布 GLM-5.3-Flash,为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 活跃参数,支持 300,000 token 上下文,采用混合稀疏与线性注意力架构及 mHC 技术,部署框架包括 SGLang、vLLM、TokenSpeed 等,可通过 reasoning_effort 参数控制推理预算,API 服务可在 Z.ai 平台使用。

    推荐理由:原文给出了模型参数、架构创新和部署框架,读者可以据此判断其在多模态和长上下文场景下的实际应用潜力。

  4. 智谱 GLM 新模型64

    智谱 GLM-5.3 发布:开源大模型在编码与智能体任务中取得显著提升

    智谱发布 GLM-5.3 模型,基于 GLM-5.2 的基础模型,通过后训练提升能力,在编码、长链任务和智能体基准上表现显著增强。在 Z.ai Code Bench 上编码能力提升 50%,在 Terminal Bench 3.0、Agents' Last Exam、CyberGym 等多个公开和内部基准中达到开源 SOTA。

    推荐理由:原文提供了与多个主流模型的基准对比数据和本地部署方案,读者可据此判断其在编码和智能体任务中的相对位置与可用性。

8月21日周五
  1. Together AI65

    GLM-5.3 与 GPT-5.6 Sol 在 DeepSWE 上的成本、编码与路由策略对比

    Together AI 在 113 项 DeepSWE 任务上对比了 GLM-5.3 (max) 与 GPT-5.6 Sol (max)。GPT-5.6 Sol 在单次尝试准确率(pass@1 72.7% vs 69.0%)、可靠性和速度上保持领先,但每次尝试成本($8.37)是 GLM-5.3($3.99)的两倍多。

    推荐理由:原文通过详尽的基准测试和成本分析,为开发者提供了在不同编程语言和任务类型下选择或组合使用这两个模型的决策依据。

8月20日周四
  1. The Register · AI/ML62

    Slack 推出 Slack Code 功能,将 AI 编码智能体引入群聊

    Slack 推出 Slack Code 功能,允许 AI 编码智能体在群聊环境中工作。智能体可以创建专用代码频道,团队成员可实时查看其工作、审查代码变更并指导调整。该功能支持 Anthropic 的 Claude、GitHub Copilot 和 OpenAI 的 ChatGPT 等智能体集成,未来将开放 API 支持更多应用场景。

    推荐理由:Slack 将 AI 编码智能体引入群聊环境,展示了协作开发的新工作流可能性。

8月17日周一
  1. Together AI72

    Together AI 评测:DeepSeek V4 Pro 0813 与 Claude Fable 5 在 DeepSWE 上的成本与性能对比

    Together AI 在软件工程基准 DeepSWE 上对比了 DeepSeek V4 Pro 0813 与 Claude Fable 5。Claude Fable 5 单次尝试准确率更高(69.7% vs 62.8%),但成本是前者的 90 倍(每次尝试 $21.63 vs $0.24)。

    推荐理由:原文通过详细的成本、准确率和任务类型对比,为开发者选择模型提供了具体的决策依据。

8月1日周六
  1. Together AI72

    月之暗面发布 Kimi K3:2.8万亿参数开源模型,支持1M上下文与多模态

    月之暗面发布 Kimi K3,2.8万亿参数开源模型,为首个3万亿参数级开源模型,支持1M上下文、多模态输入和动态工具加载。Together AI 提供 API 接入,支持 OpenAI 兼容调用,推理深度可调,定价按 token 计费,缓存命中输入价为每百万 token 0.30 美元。模型在 DeepSWE、BrowseComp 等基准上表现领先,支持结构化输出、流式响应和保留思考历史。

    推荐理由:原文提供了模型参数、架构创新、API 使用方式和定价,读者可据此判断其在长上下文、推理和多模态任务中的实际部署潜力。

7月17日周五
  1. Replit 博客71

    Replit 揭示 AI 智能体如何构建‘自动驾驶公司’

    Replit 官方分享其内部 AI 智能体系统如何改变公司运作:工程团队代码产出提升 5.8 倍,评审延迟持平,质量指标改善;智能体参与代码审查、事故调查、数据查询、销售支持、客服响应等,实现跨职能自动化;员工未被替代,而是被‘升职’为决策者;系统已扩展至全公司,支持自服务分析、客户触达和文档生成;Replit 正推动将此模式开放给用户。

    推荐理由:Replit 描述了内部 AI 智能体系统如何重塑工作流,从工程到销售、支持等全职能提升效率,且未牺牲质量或增加瓶颈。

6月23日周二
  1. Together AI62

    Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,前沿模型表现不佳

    Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,用于评估大模型编写跨 GPU 通信 CUDA 内核的能力。在 87 个真实代码问题中,表现最佳的 GPT-5.5 在单次尝试下仅正确解决 28 个问题,其中仅 22 个快于 PyTorch + NCCL 基线。研究揭示了模型在协调 GPU 间通信、数据分区和选择最优传输机制方面存在根本性困难。

6月22日周一
  1. Interconnects68

    GLM-5.2 是开放智能体模型的重要突破

    Z.ai 发布 GLM-5.2 模型,该模型在社区评测中表现优异,尤其在编码代理场景中与 OpenAI 和 Anthropic 的最新模型竞争,成为首个在实际使用中感觉‘正确’的开放权重通用智能体模型。

    推荐理由:原文基于实测和社区反馈,指出GLM-5.2在编码代理场景中达到与闭源模型相当的水平,对开放模型生态构成实质性影响。

6月17日周三
  1. Together AI57

    Together AI 评测:Kimi K2.7 Code 与 Claude Fable 5 生成落地页的成本与质量对比

    Together AI 对比了 Kimi K2.7 Code 与 Claude Fable 5 生成 12 个落地页的成本和质量。实验显示,Kimi K2.7 Code 的平均成本比 Fable 5 低约 94%,在结合定制设计灵感 MCP 服务器后,其输出质量与 Fable 5 相近。所有生成的页面、成本细目和 GPT-5.5 的评分结果都发布在 OVSC 网站上。

    推荐理由:原文通过具体实验和成本对比,展示了开源模型在特定工作流中结合定制化工具的实际效益。

6月16日周二
  1. 智谱 GLM 新模型65

    智谱发布GLM-5.2大模型,支持1M上下文与多能力增强

    智谱发布GLM-5.2大模型,支持1M-token上下文,提升编码与推理能力,引入IndexShare架构降低计算开销,采用MIT开源许可。模型在HLE、AIME、SWE-bench等基准上表现领先,支持SGLang、vLLM等框架本地部署,提供API服务。

    推荐理由:原文提供了1M上下文、架构优化和开源许可等关键信息,读者可据此判断其在长上下文任务中的实际可用性与部署潜力。

6月11日周四
  1. 月之暗面 Kimi 新模型73

    月之暗面 Kimi-K2.7-Code 模型发布

    月之暗面发布 Kimi-K2.7-Code,一款基于 Kimi K2.6 的编码专用智能体模型,采用 MoE 架构,参数量 1T,激活参数 32B,上下文长度 256K,支持图像与视频输入。

    推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长程编程任务和智能体场景中的实际能力与适用性。

6月9日周二
  1. Amazon Science63

    Amazon Science 发布论文:弥合智能体系统中的意图与执行差距

    Amazon Science 发布论文《Dissecting model behavior through agent trajectories》,提出智能体性能瓶颈在于模型意图与执行之间的差距,即意图-执行间隙。

    推荐理由:原文系统分析了智能体系统中模型意图与执行之间的差距,并提出可复用的轻量级框架SSA,读者可据此理解如何设计更鲁棒的智能体执行系统。

5月21日周四
  1. Weaviate 博客54

    使用 Weaviate MCP 构建代码助手:RAG over Code & Docs

    Weaviate 博客发布教程,介绍如何利用内置 MCP 服务器构建代码助手,通过 RAG 技术检索代码和文档,支持 Claude Code、Cursor 和 VS Code 连接,提供从部署、数据分块、索引到客户端配置的完整步骤。

    推荐理由:原文提供了从部署到连接多个客户端的完整步骤,读者可直接复用以构建基于 Weaviate 的代码助手。

4月24日周五
  1. One Useful Thing68

    Ethan Mollick实测GPT-5.5:模型、应用与工具链的协同进化

    Ethan Mollick基于早期访问体验,评测GPT-5.5在编码、多模态生成和学术写作上的表现。他指出GPT-5.5 Pro在构建3D模拟、生成带文本的图像、撰写学术论文和设计桌游等方面能力显著提升,完成速度从33分钟缩短至20分钟。

    推荐理由:作者通过实测对比展示了GPT-5.5在编码、多模态生成和学术写作上的能力跃迁,读者可据此理解当前AI能力边界与实际应用潜力。

4月14日周二
  1. 月之暗面 Kimi 新模型73

    月之暗面发布 Kimi-K2.6 多模态智能体模型

    月之暗面发布 Kimi-K2.6,一个开源的原生多模态智能体模型,支持长上下文编码、编码驱动设计、智能体集群协作和主动自主执行。模型采用 MoE 架构,总参数 1T,激活参数 32B,上下文长度 256K,支持图像和视频输入。

    推荐理由:原文提供了模型架构、评测数据和部署方式,读者可以据此判断其在长上下文编码、智能体协作和多模态能力上的实际表现与适用场景。

3月31日周二
  1. Mistral 新模型71

    Mistral 发布 Mistral-Medium-3.5-128B 多模态大模型

    Mistral 发布新模型 Mistral-Medium-3.5-128B,为首个旗舰合并模型,具备 128B 参数、256k 上下文窗口,支持文本与图像输入、推理、编码及智能体功能。

    推荐理由:原文给出了模型架构、能力变化和开源入口,读者可以据此判断它在多模态和智能体任务中的实际应用潜力。