
Knowledge Density, Not Task Format, Key to Multimodal Scaling
Researchers find that the primary bottleneck in scaling multimodal large language models (MLLMs) is knowledge density in training data, not task format. Task-specific supervision like Visual Question Answering (VQA) adds little incremental semantic information beyond image captions.