Qual modelo raciocina melhor? Qual custa menos para usar? Explore os números, mude os critérios e encontre o que faz sentido para a sua tarefa.
12 modelos no recorte LiveBench7 áreas de avaliaçãoConsulta: Fontes e licenças ↗
01 / DESEMPENHO EM TAREFAS
Inteligência, sob um critério.
Resultados na mesma edição do LiveBench. A ordem vale para esta seleção de modelos e para a área escolhida.
LiveBench · Geral
Nota em pontos · escala de 0 a 100
↑ Maior é melhor
050,00100,00
Claude Fable 5.1Esforço max
83,41 pontos
Claude Opus 5.5Esforço max
83,22 pontos
GPT-6 AstraEsforço max
82,16 pontos
Muse Spark 1.3Esforço xhigh
81,59 pontos
DeepSeek V4.1 FlashEsforço max
81,11 pontos
GPT-6 SolEsforço max
79,25 pontos
Kimi K3Esforço não informado
79,19 pontos
Qwen 3.8 MaxEsforço não informado
78,46 pontos
Grok 4.7 xHighEsforço xhigh
77,40 pontos
GLM-5.3Esforço não informado
76,14 pontos
Gemini 3.8 Flash HighEsforço high
75,83 pontos
GPT-6 LunaEsforço max
72,03 pontos
Nenhum modelo nesta seleção. Limpe a busca ou escolha outro desenvolvedor.
Fonte: LiveBench, edição 25/06/2026. Consulta em 28/09/2026. Seleção, tradução e gráficos: Limiar IA, sob CC BY-SA 4.0. Eixo iniciado em zero.
As tarefas do benchmark são em inglês. A interface foi traduzida; os resultados não são um teste de português brasileiro. Diferenças pequenas não comprovam superioridade estatística.
02 / NA HORA DE USAR
Compare o custo das APIs.
Uma segunda amostra, por modelo e provedor. Preços e observações de tráfego têm condições próprias e não herdam a configuração do LiveBench.
Preços consultados em (São Paulo). São tarifas de uso via API, em dólares. Não correspondem à assinatura mensal dos aplicativos de chat.
Este retrato de preços tem mais de 24 horas. Tarifas e condições podem ter mudado; confira os links da fonte antes de contratar.
Quanto custa o seu volume?
Custo total em US$
1.000 chamadas · 3.000 tokens de entrada + 1.000 de saída por chamada
↓ Menor é melhor
040,0080,00
DeepSeek V4.1 FlashDeepSeek
1,05 dólares para o volume informado
DeepSeek V3.2SiliconFlow
1,20 dólares para o volume informado
Gemini 3.8 FlashGoogle AI Studio
6,00 dólares para o volume informado
Gemini 3.1 Pro PreviewGoogle AI Studio
18,00 dólares para o volume informado
GPT-5.4OpenAI
22,50 dólares para o volume informado
Claude Sonnet 4.6Anthropic
24,00 dólares para o volume informado
Claude Opus 5.5Anthropic
32,00 dólares para o volume informado
GPT-6 AstraOpenAI
80,00 dólares para o volume informado
Nenhum modelo nesta seleção. Limpe a busca ou escolha outro desenvolvedor.
Cálculo Limiar IA com tarifas de entrada e saída da API do OpenRouter. Sem cache, lote, ferramentas, imagens, impostos ou taxas adicionais. É uma estimativa de tokens, não um custo medido por tarefa bem-sucedida.
Velocidade e latência: a consulta à fonte não retornou medições para esta amostra. Os campos estão identificados como indisponíveis na tabela; os preços não permitem deduzir a rapidez de um modelo.
03 / CONFIRA OS NÚMEROS
Os dados por trás dos gráficos.
Notas, configurações, preços e links diretos para verificar a origem. Os mesmos filtros se aplicam às tabelas.
LiveBench: geral e sete áreas
Edição 2026-06-25 · 12 modelos selecionados · notas de 0 a 100 · consulta 28/09/2026
Modelo / configuração
Geral
Raciocínio
Programação
Programação com agentes
Matemática
Análise de dados
Linguagem
Seguimento de instruções
Claude Fable 5.1Anthropic · Esforço maxID LiveBench: claude-fable-5-1-max-effort
83,41
91,69
86,38
66,06
97,01
80,28
89,50
72,99
Claude Opus 5.5Anthropic · Esforço maxID LiveBench: claude-opus-5-5-max-effort
A edição identifica o conjunto de tarefas; não é a data de execução de cada modelo. A fonte não informa essas datas individuais. Seleção e adaptação dos resultados: CC BY-SA 4.0.
APIs: preços, provedores e medições disponíveis
Fonte: OpenRouter · preços por 1 milhão de tokens · horários de preços e medições em cada linha · valores ausentes não são zero.
Modelo / provedor
Entrada US$/milhão
Saída US$/milhão
Geração tokens/s
Primeiro token segundos
Custo simulado US$ / volume total
GPT-6 AstraOpenAI · Tarifa-base de texto; esforço do tráfego não informadoopenai/gpt-6-astra-20260903A tarifa aumenta acima de 272.000 tokens de entrada. Quantização não informada.Preço: (São Paulo).
10,00
50,00
Não disponível
Não disponível
US$ 80,00
GPT-5.4OpenAI · Tarifa-base de texto; esforço do tráfego não informadoopenai/gpt-5.4-20260305A tarifa aumenta acima de 272.000 tokens de entrada. Quantização não informada.Preço: (São Paulo).
2,50
15,00
Não disponível
Não disponível
US$ 22,50
Claude Opus 5.5Anthropic · Tarifa-base de texto; esforço do tráfego não informadoanthropic/claude-opus-5.5-20260921Quantização não informada.Preço: (São Paulo).
4,00
20,00
Não disponível
Não disponível
US$ 32,00
Claude Sonnet 4.6Anthropic · Tarifa-base de texto; esforço do tráfego não informadoanthropic/claude-4.6-sonnet-20260217Quantização não informada.Preço: (São Paulo).
3,00
15,00
Não disponível
Não disponível
US$ 24,00
Gemini 3.8 FlashGoogle AI Studio · Tarifa-base de texto; esforço do tráfego não informadogoogle/gemini-3.8-flash-20260902Quantização não informada. Preço retornado pela API; não reaplicamos o campo de desconto.Preço: (São Paulo).
0,75
3,75
Não disponível
Não disponível
US$ 6,00
Gemini 3.1 Pro PreviewGoogle AI Studio · Tarifa-base de texto; esforço do tráfego não informadogoogle/gemini-3.1-pro-preview-20260219A tarifa aumenta acima de 200.000 tokens de entrada. Quantização não informada.Preço: (São Paulo).
2,00
12,00
Não disponível
Não disponível
US$ 18,00
DeepSeek V4.1 FlashDeepSeek · Tarifa-base de texto; esforço do tráfego não informadodeepseek/deepseek-v4.1-flash-20260910Quantização não informada. Tarifa-base; há faixas de horário com preço dobrado.Preço: (São Paulo).
0,15
0,60
Não disponível
Não disponível
US$ 1,05
DeepSeek V3.2SiliconFlow · Tarifa-base de texto; esforço do tráfego não informadodeepseek/deepseek-v3.2-20251201Quantização FP8.Preço: (São Paulo).
0,259
0,42
Não disponível
Não disponível
US$ 1,20
A amostra de APIs é independente da amostra LiveBench. Não combinamos a nota de um esforço máximo com uma velocidade de configuração desconhecida em um índice de “custo-benefício”.
O contexto também faz parte do número.
O que significa a nota?
O LiveBench avalia tarefas com resultados verificáveis. Calculamos a média das tarefas de cada área e, depois, a média das sete áreas, com pesos iguais. As 23 tarefas não têm todas o mesmo peso na nota geral.
Os valores vão de 0 a 100 pontos. Não são QI nem uma medida universal de inteligência. A tabela não fornece intervalos de confiança e não mede qualidade em português, segurança ou confiabilidade em produção.
Selecionamos 12 modelos de diferentes desenvolvedores com todas as tarefas disponíveis na mesma edição. É uma amostra editorial; não é uma lista dos 12 melhores de todo o mercado.
Preservamos os IDs e o esforço declarado. Quando não há configuração explícita, indicamos isso. “Max” no nome Qwen 3.8 Max identifica a família, não um esforço confirmado.
Não executamos estes benchmarks: apresentamos resultados da fonte e cálculos reproduzíveis sobre eles.
Como ler velocidade e custo?
Geração é a quantidade de tokens de saída por segundo. Latência é o tempo até o primeiro token. As estatísticas de tráfego do OpenRouter, quando disponíveis, refletem uma janela de 30 minutos, com cargas e esforços que podem variar.
Os preços correspondem ao provedor indicado em cada linha. A simulação usa as tarifas-base consultadas, sem cache ou lote. Tokens de raciocínio cobrados como saída entram uma única vez no campo de saída. Limites de contexto e preços de faixas maiores devem ser conferidos na fonte.
Velocidade observada não equivale a um teste controlado com os mesmos prompts. Não medimos latência a partir do Brasil.
Fontes, licença e atualização
Resultados: CSV oficial do LiveBench, edição 2026-06-25, consultado em 28/09/2026. Seleção, tradução, cálculo das médias e gráficos adaptados por Limiar IA, sob CC BY-SA 4.0. Essa licença se aplica à adaptação LiveBench, não aos dados de outras fontes. LiveBench não endossa o Limiar IA.
Tarifas: OpenRouter Models API, consultada em 28/09/2026, 08:49 (São Paulo). Uso conforme os termos do OpenRouter. Os dados de API não são apresentados como uma base de licença aberta.
Esta página mostra um retrato datado, sem atualização em tempo real. As fontes entram na revisão editorial diária; uma nova publicação só muda a data quando houver nova consulta válida. Preços e medições disponíveis recebem avisos separados após 24 horas. Falhas preservam os últimos valores e suas datas.