Skip to content
llmprice

Llama 3.1 8B Instruct

Updated Sep 11, 2026

llama131k context131k max outputreleased Jul 23, 2024Open weightsReasoningTool calling
Cheapest input
$0.02
Cheapest output
$0.025
Official
output per 1M tokens
Providers
15
offering this model
Spread
18.0×
max / min output

Offers

Metered per-token prices. Cheapest input and output are highlighted; marks a context-tier surcharge.

Provider1M input1M output1M cache read1M cache writeContext
Inferenceopen$0.025Cheapest$0.02516k
Kilo GatewayopenCheapest$0.02$0.04131k
Helicone$0.02$0.0516k
Abacusopen$0.02$0.05128k
NovitaAIopen$0.02$0.0516k
OpenRouteropen$0.05$0.08$0.025131k
Hugging Faceopen$0.06$0.06131k
NanoGPTopen$0.0544$0.085$0.0272131k
Cortecsopen$0.167$0.167128k
DigitalOceanopen$0.198$0.198131k
Pioneeropen$0.2$0.2$0.2$0.2128k
Amazon Bedrockopen$0.22$0.22128k
Amazon Bedrockusopen$0.22$0.22128k
Vercel AI Gateway$0.22$0.22128k
Neonopen$0.15$0.45131k
Nvidiafreefreefree16k

Other llama models