Transformer-based visual object tracking via fine-coarse concatenated attention and cross concatenated MLP

Transformer-based visual object tracking via fine-coarse concatenated attention and cross concatenated MLP | Litlas