Meta model benchmarks.

Compare Meta models across answer quality, coding, complex tasks, speed, price, and context size.

Meta

Quality

Highest overall scores

  1. 1Meta: Muse Spark 1.153.2
  2. 2Meta: Llama 3.3 70B Instruct0
  3. 3Meta: Muse Glimmer 30B0

Response speed

Fastest output in this sample

  1. 1Meta: Llama 3.3 70B Instruct177 t/s
  2. 2Meta: Muse Spark 1.1138 t/s
  3. 3Meta: Muse Glimmer 30B88 t/s

Input price

Lowest price per 1M tokens

  1. 1Meta: Llama 3.3 70B Instruct$0.10/1M
  2. 2Meta: Muse Glimmer 30B$0.35/1M
  3. 3Meta: Muse Spark 1.1$1.25/1M

Highlights

Quality

Overall capability · Higher is better

Speed

Output tokens per second · Higher is better

Input price

USD per 1M tokens · Lower is better

Quality benchmarks

Compare Meta model capability.

Performance and price

Compare practical tradeoffs.

All Meta models.

3 models in the current catalogue.

Meta technical benchmarks.

Compare named evaluation records available for Meta models. Missing results remain blank rather than being estimated.

BenchmarkAreaMuse Spark 1.1Llama 3.3 70B InstructMuse Glimmer 30BSource
Intelligence IndexoverallQuality53.2——OpenRouter / artificial-analysis
Coding Indexcoding71.311.9—OpenRouter / artificial-analysis
Agentic Indexagentic39.7——OpenRouter / artificial-analysis
GPQAGPQA Diamond89.849.8—OpenRouter model benchmarks
Humanity's Last ExamHLE46.23.6—OpenRouter model benchmarks
AA-LCRAA-LCR81.315.7—OpenRouter model benchmarks
GDPval-AAGDPval-AA43.70—OpenRouter model benchmarks
CritPtCritPt15.10—OpenRouter model benchmarks
SciCodeSciCode58.226—OpenRouter model benchmarks
AA-Omniscience AccuracyAA-Omniscience Accuracy5219—OpenRouter model benchmarks
AA-Omniscience Non-Hallucination RateAA-Omniscience Non-Hallucination Rate509.8—OpenRouter model benchmarks
IFBenchIFBench—47.1—OpenRouter model benchmarks
τ²-Bench Telecomτ²-Bench Telecom—26.6—OpenRouter model benchmarks
Terminal-Bench HardTerminal-Bench Hard—3—OpenRouter model benchmarks