BENCHMARKSNúmeros oficiais, com fonte e sem maquiagem.
O NexusIDE escolhe o modelo certo para cada tarefa. Estes são os resultados que os próprios fabricantes publicaram e que o Nexus usa nessa escolha: 38 modelos, cada um com a fonte primária.
Tabela de benchmarks
| Modelo | Fonte | |||
|---|---|---|---|---|
| Gemini 4 ArgonGoogle | 77,9% | — | — | fonte ↗ |
| Muse Spark 1.3Meta | 75,4% | 88,8% | — | fonte ↗ |
| GPT-6.1 SolOpenAI | 75,2% | — | — | fonte ↗ |
| Claude Opus 5.5Anthropic | 74,2% | — | — | fonte ↗ |
| DeepSeek V4.1 FlashDeepSeek | 74,2% | 90,6% | — | fonte ↗ |
| GPT-6 AstraOpenAI | 74,1% | — | — | fonte ↗ |
| Gemini 3.8 FlashGoogle | 73,7% | 89,4% | — | fonte ↗ |
| SWE-2Cognition | 73% | 92,8% | — | fonte ↗ |
| GPT-5.6 SolOpenAI | 72,7% | 88,8% | — | fonte ↗ |
| MiMo V2.6 ProXiaomi | 71,9% | 89,9% | — | fonte ↗ |
| Claude Sonnet 5.5Anthropic | 71% | — | — | fonte ↗ |
| Grok 4.7xAI | 71% | — | — | fonte ↗ |
| Claude Fable 5Anthropic | 69,7% | 84,3% | 95% | fonte ↗ |
| GPT-5.6 TerraOpenAI | 69,6% | 87,4% | — | fonte ↗ |
| Claude Opus 5Anthropic | 68,8% | — | 96% | fonte ↗ |
| GPT-6 SolOpenAI | 68,8% | — | — | fonte ↗ |
| MiMo V2.6 FlashXiaomi | 67,9% | 87,6% | — | fonte ↗ |
| Kimi K3Moonshot AI | 67,5% | 88,3% | — | fonte ↗ |
| Claude Fable 5.1Anthropic | 67,4% | — | — | fonte ↗ |
| GPT-5.6 LunaOpenAI | 67,2% | 84,7% | — | fonte ↗ |
| GLM-5.3Z.ai | 66,9% | 88,2% | — | fonte ↗ |
| GPT-6 LunaOpenAI | 66,6% | — | — | fonte ↗ |
| Grok 4.6xAI | 65,9% | — | — | fonte ↗ |
| Gemini 3.7 FlashGoogle | 65,3% | 85,8% | — | fonte ↗ |
| GLM-5.3 FlashZ.ai | 63,4% | 84,3% | — | fonte ↗ |
| DeepSeek V4 ProDeepSeek | 62,7% | 87,9% | — | fonte ↗ |
| Claude Opus 4.8Anthropic | 59% | 82,7% | 88,6% | fonte ↗ |
| Grok 4.5xAI | 53% | 83,3% | — | fonte ↗ |
| Gemini 3.6 FlashGoogle | 49% | 78% | — | fonte ↗ |
| GLM-5.2Z.ai | 46,2% | 81% | — | fonte ↗ |
| Claude Haiku 4.5Anthropic | — | — | 73,3% | fonte ↗ |
| Claude Sonnet 5Anthropic | — | 80,4% | 85,2% | fonte ↗ |
| GLM-4.5 AirZ.ai | — | — | 57,6% | fonte ↗ |
| GLM-4.7Z.ai | — | — | 73,8% | fonte ↗ |
| GLM-4.7 FlashZ.ai | — | — | 59,2% | fonte ↗ |
| LongCat 2.0Meituan | — | 70,8% | — | fonte ↗ |
| MiniMax M2.7MiniMax | — | 51,1% | 79,9% | fonte ↗ |
| MiniMax M3MiniMax | — | 66% | 80,5% | fonte ↗ |
- Claude Mythos 5.1 é o mesmo modelo que Claude Fable 5.1, servido mais rápido, segundo o fabricante.
- Grok 4.7 Build Fast é o mesmo modelo que Grok 4.7, servido mais rápido, segundo o fabricante.
- MiniMax M2.7 Highspeed é o mesmo modelo que MiniMax M2.7, servido mais rápido, segundo o fabricante.
- MiniMax M3.1 Flash Preview ainda não tem número próprio publicado: fica de fora da tabela.
COMO O NEXUS USAO número ajuda. A tarefa decide.
A tarefa escolhe o modelo.
O roteador lê o pedido (tamanho, especialidade e risco) e escolhe entre os modelos das CLIs que você conectou, com as suas próprias contas.
Qualidade pesa mais que a ordem da lista.
A nota de qualidade vem destes números. Modelo sem número publicado recebe uma nota neutra, nunca uma nota inventada.
Barato escreve, caro revisa.
Tarefa de rotina vai para modelos rápidos e baratos. Revisão e tarefa crítica vão para os modelos de topo.
EM CONSTRUÇÃORadar da comunidade.
O que os números dos fabricantes não mostram é como cada modelo se comporta no dia a dia: a velocidade, o tempo até a primeira resposta e a taxa de falha. A ideia é medir isso com quem usa o Nexus.
- Só com a sua permissão. Nada é enviado por padrão.
- Apenas medidas (tokens por segundo, tempo até a primeira resposta, falhas). Nunca o conteúdo de um prompt, de um código ou de uma conversa.
- Sem identificador. Só publicamos um modelo quando há medidas suficientes, e a página mostra quantas existem.
Ainda não existe e não tem data. Hoje o Nexus não coleta nada para isso. Quando existir, o aviso aparece aqui.