Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs
Xueying Jiang, Wenhao Li, Quanhao Qian, Deli Zhao et autres
3D localization in Multimodal Large Language Models (MLLMs), including 3D object detection and 3D visual grounding, is fundamentally limited by camera intrinsic ambiguity: the same image admits different 3D scenes under different cameras. Existing MLLMs either ignore camera parameters and overfit to …