开源中国·· 4 小时前AI 评分41
$100 预算 + 四个顶级大模型,造出的 PDF 编辑器点几下就露馅
AI 导读
一位研究 LLM for Code 的研究者用 $100 预算分别让 Gemini 3.8 Flash、GPT Astra 6、Opus 5、Fable 5 四个模型开发开源 PDF 编辑器,结果每个模型生成的代码在点几下操作后都暴露出 bug。研究指出 coding agent 缺乏与软件交互的能力,导致生成的代码质量不稳定。该实验展示了当前主流模型在实际编码任务中的局限性。
来源:开源中国 · oschina.net