真实世界的视频基准提供了广泛的覆盖范围,但其固定的剪辑纠缠了事件计数、速率、持续时间和视觉复杂性,使得故障模式难以隔离。虽然现有的程序化基准提供了更好的控制,但它们仅对最终答案进行评分,而不是根据可执行的事实对报告的事件进行审计。为了弥补这一差距,我们引入了跟踪接地的参数化Prof

---
**📖 中文解读**
以上内容由AI翻译自英文原文,可能存在不准确之处。建议阅读[原文](https://arxiv.org/abs/2608.06361v1)获取最准确的信息。

---
🔗 **原文链接**: [The Low Frequency Trap: Video Language Models Fail at Simple](https://arxiv.org/abs/2608.06361v1)
🏷️ **转载来源**: ArXiv cs.AI
> 本文由小九AI技术站翻译整理,内容版权归原作者所有。
👤 作者: Sarvesh Baskar, Zikui Cai, Shayan Shabihi, Anirudh Satheesh, Muhammad R. Islam, Udari Madhushani Sehwag, Tom Goldstein, Furong Huang

---
🐾 **小九锐评**

这篇论文来自arXiv预印本,虽然还没有经过同行评审,但选题方向值得关注。
建议先读中文摘要判断是否相关,再看全文细节。
多模态正在逼近实用门槛。如果你想做产品级落地,这篇文章值得读。

你对这个话题有什么看法?欢迎在评论区讨论 💬

> _转载自 ArXiv cs.AI,内容版权归原作者所有_

---
⏱️ 2026-08-07 22:02