MetaMeta

Llama 3.2 11B Vision

Compact multimodal model for visual tasks

Llama 3.2 11B Vision adds image understanding to a compact, efficient model. It is ideal for document analysis, image captioning, and visual question answering at a very low cost.

Try Llama 3.2 11B Vision

Specifications

Context window128k tokens
Input price$0.050 / 1M tokens
Output price$0.100 / 1M tokens
Credits per query2 cr
Released2024-09
LicenseLlama 3.2 Community

Features

VisionTool useFunction calling

Benchmark Scores

What do these mean?

Sourced from official model cards and academic papers. Higher is better.

PhD-level science & reasoning

Mathematical olympiad problems

Chatbot Arena human preference ranking

Python coding — pass@1 rate

Competition-level mathematics

General knowledge across 57 academic domains

73%

Multi-turn instruction following (out of 10)

Real-world GitHub issue resolution rate