美团 LongCat 新模型·· 2026-05-22AI 评分30
美团 LongCat 发布 WBench 评估模型权重
meituan-longcat/WBench-weights
AI 导读
美团 LongCat 提供 WBench 评估模型权重,用于多轮交互视频世界模型的综合测试。该基准涵盖视频质量、场景遵循、交互一致性、逻辑一致性及物理合理性五个维度,包含 289 个测试用例和 1,058 次交互轮次。权重可通过 Hugging Face CLI 下载,仅限学术研究和评估用途。
来源:美团 LongCat 新模型 · huggingface.co