arXiv NLP
techCenter
VFA: Empowering Multilingual MLLMs via Vision-Free Adaptationtranslating…
1 min readUnknownarXiv Press Group
arXiv:2608.26155v1 Announce Type: new
Abstract: Multimodal large language models have advanced rapidly, yet most remain English-centric, as scaling multilingual multimodal instruction tuning is limited by the scarcity and high cost of high-quality non-English image-text…