BENCHMARKSNúmeros oficiais, com fonte e sem maquiagem.

O NexusIDE escolhe o modelo certo para cada tarefa. Estes são os resultados que os próprios fabricantes publicaram e que o Nexus usa nessa escolha: 38 modelos, cada um com a fonte primária.

Tabela de benchmarks

Números oficiais dos fabricantes, coletados em 28 de setembro de 2026. Traço (—) significa que o fabricante não publicou o número.
ModeloFonte
Gemini 4 ArgonGoogle77,9%——fonte ↗
Muse Spark 1.3Meta75,4%88,8%—fonte ↗
GPT-6.1 SolOpenAI75,2%——fonte ↗
Claude Opus 5.5Anthropic74,2%——fonte ↗
DeepSeek V4.1 FlashDeepSeek74,2%90,6%—fonte ↗
GPT-6 AstraOpenAI74,1%——fonte ↗
Gemini 3.8 FlashGoogle73,7%89,4%—fonte ↗
SWE-2Cognition73%92,8%—fonte ↗
GPT-5.6 SolOpenAI72,7%88,8%—fonte ↗
MiMo V2.6 ProXiaomi71,9%89,9%—fonte ↗
Claude Sonnet 5.5Anthropic71%——fonte ↗
Grok 4.7xAI71%——fonte ↗
Claude Fable 5Anthropic69,7%84,3%95%fonte ↗
GPT-5.6 TerraOpenAI69,6%87,4%—fonte ↗
Claude Opus 5Anthropic68,8%—96%fonte ↗
GPT-6 SolOpenAI68,8%——fonte ↗
MiMo V2.6 FlashXiaomi67,9%87,6%—fonte ↗
Kimi K3Moonshot AI67,5%88,3%—fonte ↗
Claude Fable 5.1Anthropic67,4%——fonte ↗
GPT-5.6 LunaOpenAI67,2%84,7%—fonte ↗
GLM-5.3Z.ai66,9%88,2%—fonte ↗
GPT-6 LunaOpenAI66,6%——fonte ↗
Grok 4.6xAI65,9%——fonte ↗
Gemini 3.7 FlashGoogle65,3%85,8%—fonte ↗
GLM-5.3 FlashZ.ai63,4%84,3%—fonte ↗
DeepSeek V4 ProDeepSeek62,7%87,9%—fonte ↗
Claude Opus 4.8Anthropic59%82,7%88,6%fonte ↗
Grok 4.5xAI53%83,3%—fonte ↗
Gemini 3.6 FlashGoogle49%78%—fonte ↗
GLM-5.2Z.ai46,2%81%—fonte ↗
Claude Haiku 4.5Anthropic——73,3%fonte ↗
Claude Sonnet 5Anthropic—80,4%85,2%fonte ↗
GLM-4.5 AirZ.ai——57,6%fonte ↗
GLM-4.7Z.ai——73,8%fonte ↗
GLM-4.7 FlashZ.ai——59,2%fonte ↗
LongCat 2.0Meituan—70,8%—fonte ↗
MiniMax M2.7MiniMax—51,1%79,9%fonte ↗
MiniMax M3MiniMax—66%80,5%fonte ↗

COMO O NEXUS USAO número ajuda. A tarefa decide.

  1. A tarefa escolhe o modelo.

    O roteador lê o pedido (tamanho, especialidade e risco) e escolhe entre os modelos das CLIs que você conectou, com as suas próprias contas.

  2. Qualidade pesa mais que a ordem da lista.

    A nota de qualidade vem destes números. Modelo sem número publicado recebe uma nota neutra, nunca uma nota inventada.

  3. Barato escreve, caro revisa.

    Tarefa de rotina vai para modelos rápidos e baratos. Revisão e tarefa crítica vão para os modelos de topo.

EM CONSTRUÇÃORadar da comunidade.

O que os números dos fabricantes não mostram é como cada modelo se comporta no dia a dia: a velocidade, o tempo até a primeira resposta e a taxa de falha. A ideia é medir isso com quem usa o Nexus.

Ainda não existe e não tem data. Hoje o Nexus não coleta nada para isso. Quando existir, o aviso aparece aqui.

Veja o Nexus escolher por você.