ai.hackcv
论文精选 82arXiv

InSituMeasure: Probing Situated Measurement Grounding in Industrial Scenes with Multimodal Large Language Models· InSituMeasure: 工业场景中多模态大模型的量表读数评估

For trained operators, gauge reading requires little specialized knowledge, low cognitive effort, and high repeatability. Yet Multimodal Large Language Models (MLLMs) remain unreliable in continuous-valued measurement despite strong results on general multimodal benchmarks. Existing benchmarks expose this weakness but isolate measurement from realistic, knowledge-grounded settings, with limited situated context, specialized instruments, real-world noise, and matched diagnostic annotations, reducing realism and constraining root-cause analysis. We introduce InSituMeasure to evaluate situated measurement grounding. It contains 2,922 real industrial monitoring scenes across eight functional categories of professional engineering instruments, with dense gauge-attribute annotations and noise ta

领域:cs.AI作者:Chao Shen、Xinyuan Li、Yunfan Zhou
相关推荐

本站内容由 LLM 精选聚合,原文版权归 arXiv 所有 · 摘录仅供参考