Return to Article Details Dual Text-guided Cross-attention for Global–local Visual Fusion in Vietnamese Visual Question Answering Download PDF