Um modelo multimodal pode, por exemplo, receber uma foto e uma pergunta em texto sobre ela, e responder em texto — combinando os dois tipos de entrada numa única resposta coerente.
Isso abre casos de uso como descrever uma imagem, ler um gráfico, ou analisar um print de tela de um erro de código.