framework
active
framework:t5

T5

Encoder-decoder architecture used as backbone for Multimodal-CoT; available in Base (200M) and Large (700M) variants.

Neighborhood — ranked by edge-count

Frameworks (2)

framework
  • Multimodal-CoT
    implements
    A two-stage framework that separates rationale generation and answer inference by incorporating vision and language modalities.
  • FLAN-Alpaca
    implements
    T5 model fine-tuned on Stanford Alpaca data; used to initialize Multimodal-CoT model weights.