A Llama-3.2 Vision-based reasoning model, trained on a dataset containing reasoning stages. These stages are then used with beam search during inference.