Visual TL;DR. VLMs use RGB leads to RGB loses data. RGB loses data problem PRISM-VL approach. PRISM-VL approach leads to RAW-derived Meas.-XYZ. PRISM-VL approach leads to Camera-conditioned grounding. Camera-conditioned grounding leads to Exposure-Bracketed Supervision. PRISM-VL approach enables Improved performance. Improved performance leads to Quantifiable gains.
- VLMs use RGB: standard vision-language models process post-image signal processing RGB images
- RGB loses data: preprocessing discards crucial sensor evidence through clipping, suppression, or quantization
- PRISM-VL approach: grounds vision-language models in raw camera measurements, not just RGB
- RAW-derived Meas.-XYZ: directly incorporates raw sensor data inputs for improved grounding
- Camera-conditioned grounding: a key innovation for better understanding of sensor data
- Exposure-Bracketed Supervision: transfers supervision from RGB proxies to raw measurement domain observations
- Improved performance: significantly improves performance on challenging visual tasks
- Quantifiable gains: demonstrates measurable improvements in challenging scenarios
Visual TL;DR
