跳到正文

技术方向

AI 编码 最新动态

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

57 条精选近 30 天 21 条共收录 153 条

更新

精选归档 · 第 3 页

6月16日周二第 41–57 条
  1. 智谱 GLM 新模型65

    智谱发布GLM-5.2大模型,支持1M上下文与多能力增强

    智谱发布GLM-5.2大模型,支持1M-token上下文,提升编码与推理能力,引入IndexShare架构降低计算开销,采用MIT开源许可。模型在HLE、AIME、SWE-bench等基准上表现领先,支持SGLang、vLLM等框架本地部署,提供API服务。

    推荐理由:原文提供了1M上下文、架构优化和开源许可等关键信息,读者可据此判断其在长上下文任务中的实际可用性与部署潜力。

6月13日周六
  1. 月之暗面 Kimi 新模型75

    月之暗面发布 Kimi K3 大模型,支持 100 万 token 上下文与原生多模态

    月之暗面发布 Kimi K3 大模型,参数量 2.8T,支持 100 万 token 上下文窗口,具备原生多模态和智能体能力,采用 KDA 和 AttnRes 架构,开源权重并提供 API 接入。模型在 GPQA Diamond、DeepSWE、FrontierSWE 等多个基准上取得领先成绩,支持 MXFP4 量化,推荐在 vLLM、SGLang 等引擎上部署。

    推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长上下文、多模态和智能体任务中的实际能力边界。

6月11日周四
  1. 月之暗面 Kimi 新模型73

    月之暗面 Kimi-K2.7-Code 模型发布

    月之暗面发布 Kimi-K2.7-Code,一款基于 Kimi K2.6 的编码专用智能体模型,采用 MoE 架构,参数量 1T,激活参数 32B,上下文长度 256K,支持图像与视频输入。

    推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长程编程任务和智能体场景中的实际能力与适用性。

6月9日周二
  1. Amazon Science63

    Amazon Science 发布论文:弥合智能体系统中的意图与执行差距

    Amazon Science 发布论文《Dissecting model behavior through agent trajectories》,提出智能体性能瓶颈在于模型意图与执行之间的差距,即意图-执行间隙。

    推荐理由:原文系统分析了智能体系统中模型意图与执行之间的差距,并提出可复用的轻量级框架SSA,读者可据此理解如何设计更鲁棒的智能体执行系统。

5月21日周四
  1. Weaviate 博客54

    使用 Weaviate MCP 构建代码助手:RAG over Code & Docs

    Weaviate 博客发布教程,介绍如何利用内置 MCP 服务器构建代码助手,通过 RAG 技术检索代码和文档,支持 Claude Code、Cursor 和 VS Code 连接,提供从部署、数据分块、索引到客户端配置的完整步骤。

    推荐理由:原文提供了从部署到连接多个客户端的完整步骤,读者可直接复用以构建基于 Weaviate 的代码助手。

4月24日周五
  1. One Useful Thing68

    Ethan Mollick实测GPT-5.5:模型、应用与工具链的协同进化

    Ethan Mollick基于早期访问体验,评测GPT-5.5在编码、多模态生成和学术写作上的表现。他指出GPT-5.5 Pro在构建3D模拟、生成带文本的图像、撰写学术论文和设计桌游等方面能力显著提升,完成速度从33分钟缩短至20分钟。

    推荐理由:作者通过实测对比展示了GPT-5.5在编码、多模态生成和学术写作上的能力跃迁,读者可据此理解当前AI能力边界与实际应用潜力。

4月14日周二
  1. 月之暗面 Kimi 新模型73

    月之暗面发布 Kimi-K2.6 多模态智能体模型

    月之暗面发布 Kimi-K2.6,一个开源的原生多模态智能体模型,支持长上下文编码、编码驱动设计、智能体集群协作和主动自主执行。模型采用 MoE 架构,总参数 1T,激活参数 32B,上下文长度 256K,支持图像和视频输入。

    推荐理由:原文提供了模型架构、评测数据和部署方式,读者可以据此判断其在长上下文编码、智能体协作和多模态能力上的实际表现与适用场景。

4月9日周四
  1. MiniMax 新模型71

    MiniMax 发布自进化模型 MiniMax-M2.7

    MiniMax 发布新模型 MiniMax-M2.7,支持模型自进化、复杂技能构建与多智能体协作,具备强工程能力,在 SWE-Pro、VIBE-Pro、GDPval-AA 等多个基准上表现优异,开源权重可于 HuggingFace 获取,推荐使用 SGLang、vLLM 或 Transformers 部署。

    推荐理由:模型支持自进化机制和多智能体协作,读者可依据其在多个工程与多模态基准上的表现评估其在复杂任务中的实际能力。

3月31日周二
  1. Mistral 新模型71

    Mistral 发布 Mistral-Medium-3.5-128B 多模态大模型

    Mistral 发布新模型 Mistral-Medium-3.5-128B,为首个旗舰合并模型,具备 128B 参数、256k 上下文窗口,支持文本与图像输入、推理、编码及智能体功能。

    推荐理由:原文给出了模型架构、能力变化和开源入口,读者可以据此判断它在多模态和智能体任务中的实际应用潜力。

3月20日周五
  1. Replit 博客61

    Replit Agent 4 发布:设计画布、协作模式与构建流程全面升级

    Replit Agent 4 对设计、协作、构建和规划四大核心模块进行升级,推出无限设计画布支持所有 artifact 类型,改用共享项目协作模式并由 Agent 协助合并,实现规划与构建并行。旧项目仍可使用,新功能如多应用构建和并行任务执行在新项目中可用。

    推荐理由:原文详细对比了 Agent 3 与 Agent 4 的核心功能变化,包括设计画布、协作模式和构建流程,读者可据此判断新版本对开发效率的实际提升。

3月11日周三
  1. Replit 博客64

    Replit 推出 Agent 4:专为创意构建的智能体

    Replit 推出 Agent 4,强调在单一环境中实现设计、开发与协作的无缝整合。其四大支柱包括:自由设计(无限画布与UI变体)、快速推进(并行任务与自动拆分)、协同构建(任务流与智能排序)和统一交付(支持Web、移动、幻灯片、动画等多类型产出)。

    推荐理由:原文详细说明了 Agent 4 的四大核心能力与协作模式,读者可据此判断其对开发流程的重构潜力。

2月12日周四
  1. Andrej Karpathy71

    Andrej Karpathy发布200行Python实现的microGPT教程

    Andrej Karpathy发布名为microGPT的教学项目,仅用200行无依赖Python代码实现了完整的GPT训练和推理流程。该项目包含数据集处理、Tokenizer、自动微分引擎、GPT-2类似架构、Adam优化器等核心组件,并附有逐步构建指南。代码已在GitHub Gist和Colab笔记本开源,训练后能生成类似训练数据的虚构人名。

    推荐理由:作者用200行Python代码完整实现了GPT训练和推理流程,适合希望理解Transformer底层原理的开发者。

1月23日周五
1月21日周三
  1. Replit 博客54

    Replit Agent 推出决策时引导机制

    Replit Agent 推出决策时引导机制,通过轻量级分类器动态注入短小、情境化的指导指令,仅在必要时干预,提升长轨迹任务的可靠性与代码质量,同时降低上下文负担和成本。该机制避免了静态提示的局限,支持数百种可复用微指令,通过诊断信号和外部咨询两种模式有效应对错误循环和高风险操作。

    推荐理由:原文给出了决策时引导机制的设计原理和实际效果,读者可以据此理解它如何提升长轨迹任务的可靠性与成本效率。

1月16日周五
  1. Ollama 博客64

    Ollama v0.14.0 兼容 Anthropic API,支持 Claude Code 使用开源模型

    Ollama v0.14.0 及更高版本现已兼容 Anthropic Messages API,使得 Claude Code 等工具能够使用开源模型。用户可以在本地机器上运行 Claude Code 并连接本地模型,或通过 ollama.com 连接云端模型。官方提供了环境变量配置、安装命令和代码示例,并推荐了适用于编码场景的本地和云端模型。

    推荐理由:Ollama 通过兼容 Anthropic API 将 Claude Code 的智能体能力扩展到开源模型,为本地和云端开发提供了新的工具调用选项。

1月8日周四
  1. One Useful Thing60

    Claude Code 的工作流程与技能系统实践

    作者使用 Claude Code 实现了一个无需人工干预的创业项目,AI 自主工作一小时十四分钟,生成网站并部署,展示了其通过技能系统和子代理管理上下文的能力。该工具支持创建子代理、加载技能、调用浏览器等操作,用户可通过命令行或桌面版使用,适合编程相关或非编程用户探索。

    推荐理由:作者展示了 Claude Code 的自主工作流程和技能系统,读者可以据此理解当前 AI 工具如何通过代理机制和上下文管理实现复杂任务。

11月19日周三
  1. One Useful Thing70

    Google 推出 Gemini 3.0 及智能体工具 Antigravity

    Google 发布 Gemini 3.0 模型及配套智能体工具 Antigravity,作者实测其能自主构建交互游戏、分析旧数据并撰写学术论文,通过代码执行和多工具调用完成复杂任务,展现从聊天机器人向数字协作者的转变。

    推荐理由:作者通过实测展示了 Gemini 3 在智能体能力、代码执行和自主研究方面的进展,读者可据此理解其作为数字协作者的潜力与边界。