A SpaceXAI lançou o Grok 4.7 a 21 de setembro de 2026 para programação assistida por agentes e trabalho que exige várias etapas. O modelo está disponível através da API do fabricante, do Grok Build e do Cursor. A GitHub anunciou também a chegada gradual ao Copilot. O preço base por token não mudou face ao Grok 4.6, mas isso não garante que uma tarefa concluída custe o mesmo.

Os resultados publicados pela entidade independente Artificial Analysis mostram progressos em trabalhos prolongados, acompanhados por um consumo muito superior de tokens de saída e por diferenças entre provas. Para uma equipa que pretenda substituir o modelo anterior, interessa apurar o custo de cada resultado aprovado, e não apenas comparar a tabela de preços.

As novidades confirmadas no lançamento

No anúncio oficial, a SpaceXAI descreve um modelo base maior do que o do Grok 4.6 e um período mais longo de aprendizagem por reforço, orientado para tarefas difíceis. A empresa afirma ainda que o Grok 4.7 verifica melhor o próprio trabalho e foi preparado para utilizar o seu ambiente de agentes. São explicações e alegações do fabricante; a divulgação do produto não constitui, por si só, uma avaliação independente da qualidade ou da segurança.

As notas de lançamento de 21 de setembro confirmam o identificador `grok-4.7`, uma janela de contexto de 500 mil tokens, entrada de texto e imagem e saída de texto. Existem quatro níveis de esforço de raciocínio: low, medium, high e xhigh, sendo high o valor predefinido. Na Responses API, `reasoning.encrypted_content` é sempre devolvido. As aplicações que prolongam uma conversa devem reenviar esses elementos sem alterações no pedido seguinte.

A disponibilização nas ferramentas de desenvolvimento será gradual. Segundo a GitHub, o modelo está a chegar a vários ambientes Copilot, incluindo o agente de programação na nuvem, e os administradores empresariais podem controlar o acesso através das políticas de modelos. O anúncio não significa, portanto, que todos os utilizadores já o encontrem nas suas contas.

O que mostram os testes feitos fora do fabricante

A Artificial Analysis testou o Grok 4.7 com o nível de raciocínio xhigh e atribuiu-lhe 46 pontos no índice geral, mais dois do que ao Grok 4.6. No índice dedicado a agentes de programação, a pontuação passou de 47 para 56 quando ambas as versões foram executadas no Grok Build. Houve também melhorias em algumas provas de trabalho profissional prolongado.

Estes números exigem contexto. O teste de programação mede o conjunto formado pelo modelo e pelo ambiente onde o agente executa as tarefas; não isola todos os efeitos do modelo. Nas restantes provas, as diferenças foram menores e surgiram recuos, incluindo numa avaliação de recuperação de informação em contextos extensos e noutra de automatização. Comparar resultados obtidos com xhigh com os de uma versão anterior em high, sem assinalar a diferença, também pode induzir em erro.

As tabelas da SpaceXAI destacam vantagens de desempenho e de custo em certas tarefas de programação. São resultados comunicados pelo fornecedor. As medições do Cursor também não são independentes do ecossistema comercial em que o modelo foi desenvolvido. A avaliação exterior sustenta melhorias específicas, mas não demonstra que todos os projectos ou tarefas de segurança beneficiem da mudança.

O mesmo preço unitário pode resultar numa despesa maior

De acordo com a tabela da API xAI, os pedidos com menos de 200 mil tokens de entrada custam 2 dólares por milhão de tokens de entrada, 50 cêntimos por milhão de tokens lidos da cache e 6 dólares por milhão de tokens de saída. Acima daquele limiar, os valores duplicam para 4, 1 e 12 dólares. A variante Fast, com um preço superior, existe no Cursor e no Grok Build, mas não na API pública do fabricante.

O Cursor aplica um limiar diferente: a janela normal vai até 256 mil tokens e a opção de contexto extenso permite chegar aos 500 mil. Quando a entrada ultrapassa 256 mil tokens, todo o pedido normal é cobrado ao dobro do preço de referência. Com a variante Fast e contexto extenso, a tarifa chega ao triplo do preço padrão. Usar o limiar da API xAI para estimar uma factura no Cursor produziria um cálculo incorrecto.

Há ainda o consumo efetivo. Nos ensaios da Artificial Analysis, cada tarefa com o Grok 4.7 em xhigh gerou cerca de 81 mil tokens de saída, contra aproximadamente 38 mil no Grok 4.6 também em xhigh. O volume mais do que duplicou, embora a tarifa base de saída se tenha mantido. Este número não permite, isoladamente, determinar o custo de uma tarefa bem-sucedida: é preciso contar também as entradas, a cache, as tentativas falhadas e a percentagem de trabalhos aprovados.

Quanto custa, afinal, entregar um trabalho aceite?

A análise da Aipolix parte de uma diferença simples: os fornecedores cobram pela utilização do modelo, mas as equipas precisam de resultados que possam aceitar. Antes de testar, convém definir uma tarefa concluída de forma verificável. Pode ser uma alteração de código que passa os testes previstos ou um documento que cumpre todos os critérios de entrega. Só depois faz sentido comparar os modelos, mantendo iguais as tarefas, as ferramentas, as versões do código e as regras de repetição.

A medição deve incluir resultados aceites, tempo gasto na revisão humana, duração total, tokens utilizados, utilização da cache e gastos associados às tentativas sem sucesso. A documentação de contabilização da xAI disponibiliza `usage.cost_in_usd_ticks`, que indica o valor realmente cobrado por pedido, incluindo descontos e utilização de ferramentas no servidor. Não é um acumulado de toda a conversa: os valores de cada pedido têm de ser somados.

Se dois modelos cobrarem o mesmo por token e um deles gerar o dobro da saída, terá de compensar esse consumo com mais resultados aprovados, menos repetições ou menos trabalho de correção. O inverso também é possível: uma única tentativa bem-sucedida pode sair mais barata do que várias tentativas falhadas de um modelo aparentemente económico. A resposta depende dos dados de cada organização.

Como decidir se vale a pena mudar

O Grok 4.7 é um lançamento concreto, com funcionalidades documentadas e melhorias confirmadas por uma entidade exterior em alguns trabalhos com agentes. As alegações abrangentes do fabricante sobre segurança, rapidez e superioridade continuam, porém, a exigir atribuição. Os preços diferentes entre plataformas e a variação do consumo de tokens tornam a comparação menos imediata.

O caminho mais fiável passa por um ensaio delimitado com o nível de raciocínio que será realmente usado, tarefas e ferramentas constantes e um conjunto representativo de pedidos longos. É igualmente necessário verificar as permissões de acesso ao modelo no Copilot e manter a versão anterior como alternativa. A expansão deve depender da qualidade do trabalho aprovado e do custo total, não de uma posição isolada numa classificação.

Sources
- https://x.ai/news/grok-4-7
- https://docs.x.ai/developers/release-notes
- https://artificialanalysis.ai/articles/benchmarking-grok-4-7
- https://prod.cursor.com/docs/models/grok-4-7
- https://docs.x.ai/developers/cost-tracking
- https://github.blog/changelog/2026-09-21-grok-4-7-is-now-available-in-github-copilot/