framework
active
framework:t5T5
Encoder-decoder architecture used as backbone for Multimodal-CoT; available in Base (200M) and Large (700M) variants.
Neighborhood — ranked by edge-count
Frameworks (2)
framework
- Multimodal-CoTimplementsA two-stage framework that separates rationale generation and answer inference by incorporating vision and language modalities.
- FLAN-AlpacaimplementsT5 model fine-tuned on Stanford Alpaca data; used to initialize Multimodal-CoT model weights.