跳到正文
One Useful Thing· Ethan Mollick·· 2025-11-12AI 评分38

给你的 AI 一次面试:如何通过“氛围”评估其能力

Giving your AI a Job Interview

AI 导读

本文通过模拟“面试”方式测试多个 AI 模型在不同任务中的表现,发现它们在处理特定场景时存在明显差异。Claude 4.5 Sonnet 在写作任务中表现突出,Gemini 2.5 Pro 在计数任务中出现误差,GPT-5 Thinking 风格多变但有时影响连贯性,而 Kimi K2 Thinking 也有类似问题。这种基于“氛围”的测试方式虽具主观性,但能揭示标准化基准难以捕捉的模型特性。

来源:One Useful Thing · oneusefulthing.org