ai.hackcv
计算机视觉 · 检测、分割与识别
论文精选 60已解读

Principia: Relational Physics Tests for Video Models· Principia:视频模型的物理测试

Evaluating physical reasoning in video models is difficult because absolute motion measure…

AI 解读视频模型物理推理测试的新方法与基准
领域:cs.CV作者:Varun Varma Thozhiyoor、Shivam Tripathi、Venkatesh Babu Radhakrishnan
📎 arXiv🕒 09-04 01:59🔗 arxiv.org
论文精选 60已解读

Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States· Puffin-World:用原生3D世界状态扩展统一多模态模型

We propose Puffin-World, a unified multimodal architecture that integrates physical unders…

AI 解读Puffin-World 提出了一种集成了物理理解、空间模拟和3D世界生成的多模态模型。
领域:cs.CV作者:Kang Liao、Yihang Luo、Xiao-Ming Wu
📎 arXiv🕒 09-04 01:59🔗 arxiv.org
论文精选 65已解读

Hierarchical Denoising For Multi-Step Visual Reasoning· 层次去噪用于多步视觉推理

Video models are evolving into vision foundation models, yet they still lack human-like mu…

AI 解读层次去噪模型实现高效多步视觉推理。
领域:cs.CV作者:Zezhong Qian、Xiaowei Chi、Chak-Wing Mak
📎 arXiv🕒 07-17 01:59🔗 arxiv.org
论文精选 65已解读

SceneBind: Binding What and Where Across Vision, Audio and Language· SceneBind:跨视觉、音频和语言的场景绑定

We present SceneBind, an omni-modal representation of realistic scenes with joint semantic…

AI 解读跨模态场景绑定模型,结合语义和空间理解,实现零样本迁移至下游任务。
领域:cs.CV作者:Mingfei Chen、Zijun Cui、Ruoke Zhang
📎 arXiv🕒 07-17 01:55🔗 arxiv.org
论文精选 65已解读

X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras· X-Lens:实时异构相机深度估计

We present X-lens, a compact feed-forward model for metric depth estimation from a variabl…

AI 解读实时异构相机深度估计模型X-Lens,减少计算复杂度并提高准确性。
领域:cs.CV作者:Heng Zhou、Shuhong Liu、Yonghao He
📎 arXiv🕒 07-15 01:45🔗 arxiv.org
论文精选 61已解读

Latent-Identity Tuning in Text-to-Image Personalization Models· 潜空间身份调整在文本到图像个性化模型中的应用

Generating and editing a person's face demands high precision, as even minor modifications…

AI 解读改善文本到图像模型中的面部个性化编辑精度。
领域:cs.CV作者:Daniel Garibi、Ronen Kamenetsky、Hadar Averbuch-Elor
📎 arXiv🕒 07-14 01:59🔗 arxiv.org
论文精选 61已解读

Evidence-Backed Video Question Answering· 基于证据的视频问答

Current Video Large Language Models (Video LLMs) excel in question answering (QA) but larg…

AI 解读提出基于证据的视频问答,增强模型的视觉解释能力。
领域:cs.CV作者:Shijie Wang、Honglu Zhou、Ziyang Wang
📎 arXiv🕒 07-14 01:49🔗 arxiv.org
论文精选 61已解读

Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency· 循环世界:通过逆预测循环一致性缓解长期视频世界模型的误差累积

Autoregressive diffusion models have enabled high-quality video generation, yet their sequ…

AI 解读提出循环世界模型,缓解长期视频生成中的误差累积问题。
领域:cs.CV作者:Zihan Su、Teng Hu、Jiangning Zhang
📎 arXiv🕒 07-14 01:27🔗 arxiv.org
论文精选 61已解读

MicroCharNet: Less is More for License Plate Character Detection· MicroCharNet:车牌字符检测,轻量且高效。

License plate character detection is a crucial component of intelligent transportation sys…

AI 解读轻量级车牌字符检测模型,高精度低计算开销。
领域:cs.CV作者:Huy Che、Dinh-Duy Phan、Duc-Lung Vu
📎 arXiv🕒 07-14 01:23🔗 arxiv.org
论文精选 60已解读

PanoWorld: Real-World Panoramic Generation

In this work, we aim to address the challenge of long-range memory in panoramic world mode…

AI 解读提出PanoWorld模型,利用全景图的旋转等变性优化长期记忆和物理一致性。
领域:cs.CV作者:Haoyuan Li、Dizhe Zhang、Yuemei Zhou
📎 arXiv🕒 07-11 01:59🔗 arxiv.org
论文精选 60已解读

Scalable Visual Pretraining for Language Intelligence

The rapid progress of large foundation models has been driven predominantly by pretraining…

AI 解读研究视觉预训练在提升语言模型智能上的作用。
领域:cs.CV作者:Yiming Zhang、Zhonghan Zhao、Wenwei Zhang
📎 arXiv🕒 07-11 01:57🔗 arxiv.org