Fundamentos e ferramentas de IA

Se tivesse que escolher apenas uma IA para programar: a escolha de quem usa há 1 ano

Uma das perguntas mais frequentes nas comunidades de desenvolvedores hoje é: "Qual devo usar, Claude Code ou Codex?" Eu assino o Claude há cerca de um ano e o Codex há mais de seis meses, usando ambos diariamente, e também testei o recém-lançado Claude Fable 5 e o GPT-5.6 Sol…

8 min de leitura
Imagem de capa de Se tivesse que escolher apenas uma IA para programar: a escolha de quem usa há 1 ano

Conclusão de um desenvolvedor que usou Claude por 1 ano e Codex por 6 meses

Uma das perguntas mais frequentes nas comunidades de desenvolvedores hoje é: “Qual devo usar, Claude Code ou Codex?” Eu assino o Claude há cerca de um ano e o Codex há mais de seis meses, usando ambos diariamente, e também testei o recém-lançado Claude Fable 5 e o GPT-5.6 Sol. Antes de me estabelecer nesses dois, também passei pelo Cursor e pelo Kiro. O Cursor foi realmente ótimo no começo, mas acabei migrando naturalmente porque o Claude era bom demais. O Kiro é uma ferramenta competente, mas, por ser mais nichada, ainda não tem um ecossistema tão bem desenvolvido de skills e plugins. Além disso, como eu acabaria usando modelos Claude dentro do próprio Kiro, não vi muito sentido em passar por ele. Neste artigo, vou organizar as diferenças que percebi na prática junto com dados mais objetivos, como pesquisas da comunidade, benchmarks e issues do GitHub.

A diferença de personalidade entre os dois agentes, na minha experiência

Em uma frase, é isto: Claude parece um desenvolvedor sênior que se sai bem em praticamente tudo, enquanto Codex lembra um colega de equipe econômico nas palavras, mas preciso.

Claude Code é relativamente rápido e preciso. Ele entende bem o código-base e lê o contexto com facilidade, captando a intenção mesmo quando a instrução é ambígua. Às vezes, porém, comete erros. É aquele estilo sênior que avança com confiança, mas pode deixar passar algum detalhe. Como muita gente o utiliza, o rico ecossistema ao redor, com skills e plugins, também é uma vantagem importante. Quando você procura o workflow de que precisa, alguém provavelmente já o criou.

Codex não escreve código tão rápido e de forma tão direta quanto Claude. Em compensação, é preciso. Ele pensa por mais tempo, e os resultados que entrega tendem a ter menos brechas.

O interessante é que essa não é apenas uma impressão minha. Em uma pesquisa no Reddit com mais de 500 participantes, 65% preferiram Codex para o uso diário, mas, em uma revisão de código às cegas, 67% avaliaram o código do Claude como mais limpo. Nas comunidades internacionais, também são comuns avaliações como “Claude é forte em edição precisa, enquanto Codex é forte em refatorações amplas” e “Codex é mais lento, mas mais meticuloso em tarefas complexas”. Isso coincide quase exatamente com a minha experiência.

Claude Fable 5: os pontos que incomodavam foram praticamente resolvidos

Lançado em junho de 2026, o Claude Fable 5 me satisfez bastante. Os pontos fracos do Claude anterior — isto é, ser “rápido, mas errar às vezes” — foram quase totalmente resolvidos.

Os números confirmam isso. O Fable 5 marcou 95% no SWE-bench Verified e 80,3% no SWE-bench Pro. O modelo líder anterior, Opus 4.8, tinha 69,2% no SWE-bench Pro, portanto houve um avanço de mais de 11 pontos percentuais. No FrontierCode Diamond, de alta dificuldade, alcançou 29,3%, mais que o dobro dos 13,4% do Opus. A Stripe afirmou ter concluído em um único dia, usando o Fable 5, a migração de um código-base Ruby com 50 milhões de linhas — um trabalho que levaria mais de dois meses manualmente. É claro que também há críticas de que esses benchmarks usam scaffolding próprio da Anthropic, e não um harness neutro; por isso, é mais adequado enxergar os números como uma tendência do que como uma medida absoluta.

GPT-5.6 Sol: uma falha grave com tokens, mas ainda assim excelente

O GPT-5.6 Sol, lançado pela OpenAI em 9 de julho, também é um modelo excepcional. Ele estabeleceu um novo recorde, com 80 pontos no Coding Agent Index da Artificial Analysis. Porém, logo após o lançamento, começaram a surgir muitos relatos de que “o limite de uso se esgota em uma velocidade absurda”. Eu também passei por isso e, ao investigar de verdade, encontrei indícios bastante concretos.

  • Na issue #32250 do repositório do Codex no GitHub, um assinante Pro executou uma tarefa curta com GPT-5.6 Sol Medium e viu o saldo do limite de 5 horas cair de 87% para 76% — uma perda de 11 pontos percentuais de uma só vez. Depois, até cada pergunta de acompanhamento trivial, sem chamadas de ferramentas, consumia cerca de 1 ponto percentual. O limite se esgotou mais rapidamente do que com o GPT-5.5 xhigh que o mesmo usuário utilizava.
  • A issue #31860 confirmou que o app Codex estava usando o contexto do Sol limitado a 372K tokens, cerca de 35% da especificação de 1,05M de tokens. Quando o contexto chegava a 90%, ocorria uma compactação antecipada, e levantou-se a possibilidade de que esse reprocessamento acelerasse ainda mais o consumo de tokens.
Limite de uso que perdeu 11 pontos percentuais em uma única tarefa curta
Limite de uso que perdeu 11 pontos percentuais em uma única tarefa curta

No fim, a própria OpenAI reconheceu que “tornou fácil demais usar a configuração de maior poder computacional sem comunicar adequadamente seu impacto” e resetou o rate limit duas vezes em 24 horas. Segundo a explicação de um representante da OpenAI, o Medium do 5.6 Sol não está no mesmo nível do Medium do 5.5; o padrão é Sol Low, e xhigh deve ser reservado para problemas realmente difíceis. Em outras palavras, parece mais um problema de UX, em que uma configuração de alto custo computacional passou a ser usada como padrão, combinado com um bug no app, do que uma ineficiência do modelo por token. A OpenAI afirma, de fato, que o max reasoning do Sol reduziu os tokens de saída em 54% em comparação com modelos concorrentes.

Foi uma falha grave, mas, apesar disso, o modelo em si é extremamente competente. Quando você entende as configurações, a precisão dos resultados continua sendo de nível máximo.

Já não há motivo para insistir especificamente no Claude

Até alguns meses atrás, havia um clima de que “para programar, era Claude sem discussão”. Hoje, não vejo mais assim. Os dois são excelentes. No Terminal-Bench 2.1, a combinação com Codex CLI lidera com 83,4%, enquanto no SWE-bench Pro o Fable 5 está na frente com 80,3%. Vivemos uma época em que o primeiro lugar varia conforme o benchmark.

Por isso, minha conclusão é que o melhor é usar os dois. Mas, se eu tivesse que escolher apenas um, escolheria o Codex. Eu já uso bastante o ChatGPT, e a geração de imagens também está incluída na mesma assinatura. Não estou falando de escolher olhando apenas para um agente de programação, mas para a utilidade total da assinatura.

No fim, será que todos não acabarão usando os dois?

Quero acrescentar mais uma perspectiva. O consumo de tokens dos modelos recentes está crescendo vertiginosamente. Há análises indicando que a IA agêntica consome até 1.000 vezes mais tokens do que o uso tradicional de chatbots. A Forbes e a TechCrunch chamaram esse fenômeno de “Tokenpocalypse” e relataram um forte aumento no número de usuários que esgotam seus limites de assinatura mais rápido do que esperavam. Na prática, o principal motivo pelo qual as pessoas assinam o Codex adicionalmente nas comunidades é: “o limite do Claude acaba rápido”.

Se o limite de uma única assinatura já não for suficiente, acho que todos acabarão naturalmente convergindo para o uso simultâneo de duas assinaturas.

Usar os dois agentes juntos também melhora o desempenho

Usar os dois não se resume a uma questão de limites. Quando experimentei orquestração de IA, o desempenho foi melhor ao fazer agentes diferentes interagirem entre si do que ao conectar dois agentes iguais.

Isso também é respaldado por pesquisas. O estudo X-MAS (arXiv 2505.16997) relatou que, em sistemas multiagentes, atribuir LLMs diferentes a papéis distintos aumenta a precisão em 8–47% em comparação com combinações homogêneas. Outro estudo (arXiv 2602.03794) concluiu que dois agentes diversos podem igualar ou superar 16 agentes do mesmo tipo.

Na minha experiência, a combinação que funcionou melhor foi esta: pedir ao Claude para executar o trabalho e fazer o Codex revisar o resultado. É uma estrutura em que um sênior rápido e ousado produz o resultado, e um revisor cuidadoso e preciso elimina os problemas. Como suas personalidades são diferentes, eles identificam bem os pontos cegos um do outro.

Estrutura colaborativa em que Claude escreve o código e Codex o revisa
Estrutura colaborativa em que Claude escreve o código e Codex o revisa

Resumo

  • Claude tem um estilo sênior, rápido e preciso; Codex é mais lento, mas preciso. A avaliação da comunidade é a mesma.
  • O Fable 5 resolveu o ponto fraco do Claude — erros ocasionais —, e o GPT-5.6 Sol continua excelente apesar dos problemas com tokens.
  • Já não há motivo para insistir no Claude. Os dois são de nível máximo, e o melhor é usar ambos.
  • Se tivesse que escolher apenas um, eu escolheria o Codex, pela utilidade da assinatura que também inclui ChatGPT e geração de imagens.
  • Dado o crescimento explosivo do consumo de tokens, será que todos não acabarão usando os dois?
  • Na orquestração, a resposta está na combinação de agentes diferentes. A combinação que melhor funcionou foi Claude criando e Codex revisando.

Materiais de referência