跳到正文
美团 LongCat 新模型·· 2026-05-22AI 评分30

美团 LongCat 发布 WBench 评估模型权重

meituan-longcat/WBench-weights

AI 导读

美团 LongCat 提供 WBench 评估模型权重,用于多轮交互视频世界模型的综合测试。该基准涵盖视频质量、场景遵循、交互一致性、逻辑一致性及物理合理性五个维度,包含 289 个测试用例和 1,058 次交互轮次。权重可通过 Hugging Face CLI 下载,仅限学术研究和评估用途。

来源:美团 LongCat 新模型 · huggingface.co