framework
active
framework:multimodal-cot

Multimodal-CoT

A two-stage framework that separates rationale generation and answer inference by incorporating vision and language modalities.

Neighborhood — ranked by edge-count

Thinkers (1)

thinker

Methods (2)

method
  • gated fusion
    implements
    Multimodal fusion technique combining language and vision representations via learnable gating parameters.
  • Vision feature extraction model used to extract patch-level features from images in Multimodal-CoT.

Claims (1)

claim

Frameworks (3)

framework
  • A prompting technique that elicits intermediate reasoning steps before final answer inference in language models.
  • T5
    implements
    Encoder-decoder architecture used as backbone for Multimodal-CoT; available in Base (200M) and Large (700M) variants.
  • Architectural design principle that decouples rationale generation (stage 1) from answer inference (stage 2) in Multimodal-CoT.

Findings (3)

finding

Datasets (2)

dataset
  • A-OKVQA
    about
    Knowledge-based visual question answering benchmark with 25k questions requiring commonsense and world knowledge.
  • Large-scale multimodal science question dataset with 21k questions, annotated lectures and explanations across 3 subjects and 26 topics.

Artifacts (1)

artifact
  • mm-cot
    about
    Publicly released code repository for Multimodal-CoT implementation.

Related by similarity (8)

cosine ≥ 0.65 · no typed edge

Entities in the same semantic neighborhood but without a typed relation to this one — candidates for new edges or unrecognized duplicates.

  • CoT Promptingmethod0.747
    Chain-of-thought prompting baseline used for comparison in creative writing and other tasks
  • Empirical finding from creative writing experiments showing VS variants achieve higher diversity without sacrificing quality
  • Multilayer Perceptronframework0.731
  • VS-CoTmethod0.717
    A VS variant that adds chain-of-thought reasoning before generating the distribution of responses with probabilities
  • Technique used to demonstrate that the self-prior captures visual–proprioceptive associations by recovering visual appearance from proprioception alone
  • n-dimensional association model can express binding mechanisms for multimethods by letting values range over methods of arity n and applying appropriate α and β transformations.
  • CoT Monitormethod0.699
    Named method for monitoring chain-of-thought text to detect when the model signals its answer, compared against activation probes
  • A prompting baseline that elicits N responses across N sequential conversation turns