Weights & Biases· Mostafa Ibrahim·· 2026-05-12AI 评分42
评估 DeepSeek V4 和 GPT-5.5 在长上下文编码任务中的表现
Evaluating DeepSeek V4 and GPT-5.5 on long-context coding
AI 导读
GPT-5.5 在长上下文编码任务中以 50.7% 的正确率领先 DeepSeek V4 的 26.0%。测试基于 25 道编程题的 CodeContests 数据集,每道题独立评分。结果通过 Weights & Biases Weave 进行了记录和分析。
来源:Weights & Biases · wandb.ai