Os resets do Codex foram puro marketing. O problema era real
A OpenAI repôs os limites do Codex cinco vezes em dez dias e apresentou cada uma como celebração. Foi marketing, e o Sol gastava mesmo a quota depressa demais.
Nesta página
- A OpenAI removeu os banked resets?
- Os resets foram uma manobra de marketing
- Porque é que o Sol gastava tão depressa os limites do Codex?
- Os outros passos que tornaram o problema difícil de ver
- A mesma quota pode render menos trabalho?
- Como os resets apagaram a medição
- Alguma coisa disto era dirigida ao Claude?
- O que resolveria mesmo a questão
A OpenAI repôs os limites de utilização do Codex cinco vezes entre 12 e 21 de julho de 2026, uma por cada marco de utilizadores. Foi uma manobra de marketing, e a empresa nunca fingiu o contrário. Na mesma quinzena caiu o limite de cinco horas e a janela de contexto do Sol encolheu, o que tornou difícil ver um problema real: o Sol gastava os limites mais depressa do que o previsto [1].
Escrevo isto a 10 de agosto de 2026, na manhã em que muitos utilizadores do Codex abriram a aplicação e deram pela falta dos seus banked resets, ou seja, as reposições de limite que ficam guardadas e cujo momento de uso você escolhe. A publicação mais lida no r/codex diz que a OpenAI os retirou [2]. Essa é a pergunta mais pequena desta história, e respondo-lhe primeiro, porque errar aqui desacreditaria tudo o que vem depois.
Há aqui três coisas reais e documentadas em separado: os resets foram uma manobra de marketing, o problema de consumo do Sol era real e a OpenAI acabou por admiti-lo, e a ofensiva contra o Claude também era real. Não consigo provar que a manobra tenha sido pensada para tapar o problema, e não vou fingir que as provas chegam a esse ponto. O que o registo mostra é o efeito. A manobra funcionou como cortina de fumo, porque, quando o problema foi finalmente admitido, quase ninguém tinha uma semana limpa com que o medir.
A OpenAI removeu os banked resets?
Nada do que a OpenAI publicou diz isso. O centro de ajuda continua a explicar como se utiliza um [3], os termos do programa de referências continuam a contemplá-los e prometem aviso antes de qualquer alteração a uma promoção [4], e nenhum funcionário da OpenAI se pronunciou em público a 9 ou 10 de agosto. O que existe é um tópico no Reddit cujos relatos apontam em várias direções ao mesmo tempo.
O autor da publicação original tinha dois banked resets, com data para 12 e 13 de agosto, e escreveu que a opção para os usar tinha desaparecido da interface. Nem atualizar a aplicação nem sair da conta e voltar a entrar os fizeram aparecer, o que o levou a concluir que a OpenAI estava a aplicar a alteração por fases [2]. Uma resposta relata uma perda maior, com conversa com o apoio ao cliente incluída: «Tiraram-me 3. Tinha 2 guardados que expiravam a 11 de agosto e 1 a 12. Cheguei a contactar o apoio, e o agente confirmou que não me restava nenhum na conta» [5].
Mais abaixo no mesmo tópico, porém, o padrão desfaz-se. Outros utilizadores continuavam com os seus [6]. Alguns viam o reset mas recebiam um erro ao tentar aplicá-lo, o que é uma falha diferente de uma remoção [7]. Um utilizador perdeu o reset numa conta, recuperou-o ao sair e voltar a entrar, e depois foi ver uma segunda conta, onde encontrou o pormenor mais útil do tópico: a conta que tinha perdido o banked reset também tinha levado um reset global a 100% nessa manhã, com nova data semanal, enquanto a conta que não recebeu reset global manteve o seu [8]. Outros contaram que os seus voltaram sem terem feito nada [9], e um tópico publicado quatro minutos antes do principal descreve um painel incapaz de carregar os créditos, em vez de mostrar zero [10].
Tudo isto aconteceu em cerca de três horas. A retirada deliberada de um benefício pago não costuma reverter-se sozinha nalgumas contas enquanto um agente de apoio diz a outro cliente, numa frase que um utilizador citou, «não podemos divulgar por que motivo adicionamos ou removemos resets» [11]. A explicação alternativa mais repetida também não sobrevive a um olhar ao relógio: a página de estado da OpenAI regista nessa manhã um incidente do ChatGPT com o título «Increased errors for some ChatGPT users», aberto às 07:21 UTC e resolvido às 08:09 UTC [12]. A primeira destas publicações saiu às 08:44 UTC [10], cerca de 35 minutos depois de o incidente ter sido dado como resolvido, e os relatos continuaram a chegar para lá das 11:00. O aviso fechou antes de os relatos começarem e nunca menciona resets nem limites de utilização, por isso não os explica.
O que mudaria a conclusão é fácil de enunciar: uma entrada no changelog, uma alteração no centro de ajuda, ou os 30 dias de aviso que os termos das referências prometem antes de a OpenAI modificar ou encerrar uma promoção [4]. Enquanto nada disso aparecer, a descrição rigorosa é mais estreita do que o título. A 10 de agosto os banked resets falharam em muitas contas, e alguns voltaram.
Os resets foram uma manobra de marketing
Nunca foram apresentados como outra coisa, e é essa a parte que se esquece quando se discute se um reset é generoso. A 7 de abril de 2026, Sam Altman escreveu: «Para celebrar os 3 milhões de utilizadores semanais do Codex, estamos a repor os limites de utilização. Vamos fazê-lo a cada milhão de utilizadores até chegarmos aos 10 milhões» [13]. Dois dias depois, Tibo já tratava essa promessa como uma despesa corrente: «Ao ritmo de crescimento atual do Codex, vamos dever-vos outro reset em menos de duas semanas» [14]. O reset dos quatro milhões chegou a 21 de abril [15].
O mecanismo de acumulação apareceu a 11 de junho, e o changelog da OpenAI descreve-o como angariação de utilizadores, sem grandes rodeios: «Adicionada a acumulação de reposições do limite de utilização para utilizadores Plus e Pro, com um reset gratuito no lançamento e convites de referência para ganhar mais durante a promoção em curso» [16]. A oferta de referências decorreu de 11 a 24 de junho e pagava aos dois lados: você convida até três pessoas e, assim que uma delas envia a primeira mensagem no Codex, as duas contas recebem um banked reset [17]. A OpenAI estava a comprar utilizadores novos com inferência em vez de descontos, o que sai mais barato a uma empresa dona da sua capacidade e passa por mais generoso do que um cupão.
Depois chegou julho. O GPT-5.6 foi lançado a 9 de julho com o Sol como modelo principal [18], o ChatGPT Work saiu ao mesmo tempo, e o contador de marcos avançou depressa o suficiente para disparar cinco resets em dez dias: seis milhões a 12 de julho [19], sete milhões a 13 [20], oito milhões a 14 [21], nove milhões a 16 [22] e dez milhões a 21 [23]. Há um pormenor que conta quando se lê esta subida: a partir dos seis milhões o número passou a somar o Codex e o ChatGPT Work, e o ChatGPT Work tinha três dias de vida quando saiu a publicação dos seis milhões, por isso o número que justificava cada reset mudou discretamente aquilo que estava a contar.
-
A promessa
Altman: um reset de utilização por cada milhão de utilizadores do Codex, até dez milhões.
-
Resets acumuláveis
Os banked resets chegam como prémio de referência para Plus e Pro.
-
GPT-5.6 Sol
O Sol passa a modelo principal dentro do Codex.
-
Cinco resets em dez dias
Cai o limite de cinco horas e seguem-se os marcos dos seis aos dez milhões.
-
A admissão
O Sol gastava os limites mais depressa do que o esperado; a utilização vai durar mais 18%.
-
Os banked resets falham
Relatos de resets desaparecidos, alguns repostos em poucas horas.
Porque é que o Sol gastava tão depressa os limites do Codex?
Porque o custo de uma tarefa no Codex depende da quantidade de trabalho que o modelo faz, e não da tarifa que cobra por token. O Sol e o GPT-5.5 cobram exatamente os mesmos créditos por token [17], por isso mudar para o Sol parece gratuito na tabela de preços. Só que o Sol trabalha mais tempo, chama mais ferramentas e lê partes maiores do repositório, e cada um desses turnos é faturado.
Tibo confirmou o efeito a 29 de julho: «Nas últimas semanas, muitos de vocês disseram-nos que o Sol estava a consumir os vossos limites do Codex mais depressa do que o esperado». E acrescentou que «alguns problemas só se tornam claros quando as pessoas usam o modelo à escala real. Devíamos ter reconhecido isto mais cedo e ter sido mais frontais» [1].
A própria tabela de preços explica porque é que ninguém podia ter previsto isto olhando só para as tarifas. O Sol e o GPT-5.5 custam ambos 125 créditos por milhão de tokens de entrada, 12,5 para entrada em cache e 750 para saída [17]. Tarifas idênticas, e a mesma página admite que não é pela tarifa que se planeia: «A escolha do modelo, o contexto, o raciocínio, o uso de ferramentas, a recuperação de informação e a cache influenciam todos o consumo, por isso o comprimento do prompt por si só não é uma estimativa fiável» e, mais abaixo, «tarefas que parecem semelhantes podem consumir quantidades diferentes da sua quota» [17]. O valor de referência que a própria OpenAI dá para uma única mensagem abrange quase uma ordem de grandeza: «a utilização do GPT-5.6 ronda em média os 5 a 40 créditos por mensagem» [17].
O comportamento do Sol fica no extremo caro desse intervalo, que é justamente aquilo com que eu já tinha esbarrado. Num artigo anterior sobre o excesso de engenharia do Sol descrevi um modelo que continua a trabalhar depois de a tarefa estar resolvida, e que ainda delega em subagentes, uma prática que a própria documentação da OpenAI assinala como cara: «Os fluxos com subagentes consomem mais tokens do que execuções equivalentes com um único agente» [24]. Um modelo que faz mais trabalho por instrução sai mais caro por instrução, mesmo que a tarifa por token nunca se mexa.
Os outros passos que tornaram o problema difícil de ver
Nas mesmas duas semanas chegaram mais quatro alterações, e cada uma retirou uma forma de dar por aquilo que estava a acontecer.
A primeira foi o limite de cinco horas. Três dias depois de o Sol sair, Tibo anunciou a mudança juntamente com o marco dos seis milhões: «A remover temporariamente a restrição do limite de utilização de 5 horas para todos os planos Plus, Business e Pro» [19]. Essa janela é o que impede que uma quota semanal seja gasta numa tarde. Levantá-la na semana do lançamento faz o produto parecer sem travões e, ao mesmo tempo, permite que um modelo que consome mais por tarefa esvazie uma reserva semanal numa fração de semana. A 14 de julho, Tibo ainda apresentava o levantamento do limite como uma vantagem, dizendo aos utilizadores que podiam «explorar os limites do GPT-5.6 Sol e descobrir até onde conseguem ser ambiciosos» [21]. O limite voltou a 29 de julho, na mesma mensagem das correções [1], e hoje a página de preços da OpenAI volta a documentá-lo, com uma reserva quanto ao limite semanal: «Os limites de utilização das mensagens locais e das conversas na nuvem partilham uma janela de cinco horas. Podem aplicar-se limites semanais adicionais» [17].
A segunda foi a janela de contexto, e a forma como foi anunciada é o exemplo mais claro deste artigo. A 13 de julho, Tibo publicou uma atualização para os utilizadores do Codex e do ChatGPT Work que abre com «Nada de nerfs, só coisas boas!» e que, mais abaixo, explica isto: «Reparámos que, ao mudar o limite de tamanho do contexto no produto para 372k no GPT-5.6 Sol, face aos 272k do GPT-5.5, estava a ser cobrada mais utilização do que o pretendido. Voltámos aos 272k e vamos trabalhar para reintroduzir os 372k nos próximos dias» [25]. Um corte na memória de trabalho do produto chegou assim sob um título que negava qualquer corte. Uma questão aberta no GitHub a 21 de julho põe os números lado a lado: 372.000 tokens brutos e 353.400 efetivos no lançamento, contra 272.000 brutos e 258.400 efetivos no perfil servido desde então [26]. São menos 95.000 tokens utilizáveis, cerca de 27%. O regresso prometido nunca chegou. O changelog da OpenAI registou os 272.000 como correção a 18 de julho [16], nada o alterou desde então, e o mesmo modelo continua a aceitar 1.050.000 tokens pela API [27].
Menos contexto não é apenas um número mais pequeno numa ficha técnica. Uma janela mais curta faz com que um tópico longo no Codex seja compactado mais cedo, portanto o modelo volta a ler ficheiros que já tinha lido e a reconstruir decisões que já tinha tomado, e cada um desses turnos é faturado. A alteração que reduziu a utilização cobrada por conversa pode assim aumentar o número de conversas que um trabalho exige.
A terceira e a quarta alterações são mais silenciosas, e já descrevi as duas: a tabela de preços não se mexeu e o número do crescimento passou a contar dois produtos precisamente quando os resets ficaram mais rápidos. Nenhuma das quatro é um escândalo por si só. Juntas, deixaram quem olhava para o painel de utilização, para a lista de preços e para as publicações dos marcos sem nenhum instrumento capaz de mostrar a mudança.
- mais de duração na utilização típica do Sol
- 18 %
- previsão da OpenAI depois das correções de julho
- tokens de contexto no Codex
- 272.000
- desceu dos 372.000 a 13 de julho
- tokens de contexto pela API
- 1.050.000
- mesmo modelo, produto diferente
- créditos por mensagem
- 5-40
- intervalo médio da própria OpenAI para o GPT-5.6
Estes quatro números descrevem todos a mesma diferença. O modelo da API e o modelo da subscrição são o mesmo modelo, mas a versão da subscrição trabalha com cerca de um quarto do contexto e é faturada contra uma quota cujo custo por mensagem a própria OpenAI só consegue indicar como intervalo.
A mesma quota pode render menos trabalho?
Pode, e o desmentido da OpenAI é mais estreito do que parece à primeira leitura. A 30 de julho, a empresa escreveu que «os preços das subscrições e os orçamentos de quota do ChatGPT e do Codex mantêm-se inalterados» [28], e Tibo tinha sido ainda mais direto na véspera: «não reduzimos a utilização em nenhum plano de subscrição» [1]. As duas frases descrevem o tamanho da quota. Nenhuma descreve o que essa quota compra, que era precisamente aquilo de que os utilizadores se queixavam.
Os 18% resolvem a questão, porque quem os fornece é a própria OpenAI. Da mesma mensagem de 29 de julho: «esperamos que a vossa utilização dure cerca de 18% mais no uso típico do Sol» [1]. Se um conjunto de correções faz uma quota inalterada durar mais 18%, então antes dessas correções essa mesma quota comprava menos trabalho. Ninguém mexeu no número do plano e os utilizadores perderam alguma coisa à mesma. As duas afirmações são verdadeiras ao mesmo tempo, e é isso que torna o desmentido tão escorregadio.
Um exemplo pequeno torna o efeito concreto. Imagine que uma quota semanal cobre 100 tarefas com o GPT-5.5 e que a mesma tarefa custa mais metade dos créditos com o Sol: a quota passa a cobrir cerca de 67. Uma melhoria de 18% leva-a para cerca de 79. Os números são inventados e o que importa aqui é só a proporção, mas mostram porque é que «não reduzimos a sua quota» e «rendo menos por semana» podem ser verdade ao mesmo tempo, e porque é que discutir a primeira frase não resolve nada quanto à segunda.
Há um conjunto de números que costuma ser puxado para esta discussão e que diz respeito a outra coisa. A OpenAI comunicou que o trabalho do próprio Sol sobre os kernels «ajudou a reduzir em 20% o custo total de servir o modelo» e que as suas experiências «aumentaram em mais de 15% a eficiência da geração de tokens» [28]. Esses são os custos da OpenAI, não a quota de quem paga. O mesmo anúncio passou de facto poupanças aos clientes, ao baixar 80% o preço de API do Luna e 20% o do Terra e ao fazer os dois modelos consumirem menos créditos no Codex, mas «o preço do Sol mantém-se inalterado» [28]. Três percentagens, três assuntos diferentes, e só os 18% dizem respeito ao que recebe quem usa o Sol.
Como os resets apagaram a medição
É aqui que a campanha e o problema se encontram, e é a parte que mais me custa deixar passar. Um reset não enche apenas o depósito, também apaga a leitura do contador. Para demonstrar que uma semana com o Sol rende menos do que uma semana com o GPT-5.5 é preciso um período de faturação completo com início conhecido, uma só versão do modelo, um nível de esforço estável e nenhum reforço pelo meio. Entre 12 e 21 de julho, quase ninguém teve um período assim.
É por isso que as provas do Reddit daquelas semanas são tão insatisfatórias de ler. Os tópicos enchem-se de «queimei 40% em três horas» ao lado de «gastei 2% num dia inteiro», e nada permite alinhar os dois casos: versões diferentes do modelo, níveis de esforço diferentes, repositórios diferentes, estados de cache diferentes, e um reset a cair a meio de metade deles. Os relatos foram suficientemente coerentes para a OpenAI agir sobre eles [1]. Nunca foram suficientemente precisos para quantificar o que tinha mudado, e os resets são grande parte do motivo.
Os resets criaram também um motivo para andar depressa. Quando é anunciado um reset global para daí a poucas horas, gastar o que resta passa a ser a decisão racional, e a campanha andava a um ritmo que tornava isso um acontecimento regular. Isso é útil para as métricas que uma campanha de crescimento vigia, e é destrutivo para quem tenta observar o seu próprio consumo normal.
Os dois tipos de reset também não valem o mesmo, e é daí que vem o nervosismo de 10 de agosto. Um reset global é aplicado pela OpenAI a todas as contas elegíveis no momento que a OpenAI escolhe, por isso o seu valor depende inteiramente do que você tiver gasto até ali. Um banked reset é usado pelo utilizador, e é por isso que vale mais e que também se pode desperdiçar. Um utilizador descreveu exatamente esse caso: chegou aos 10%, com reset semanal previsto para 11 de agosto, usou o último banked reset, a OpenAI repôs toda a gente nesse mesmo dia, e o seu reset semanal seguinte passou para 15 de agosto [29].
| Propriedade | Reset global | Banked reset |
|---|---|---|
| Quem o desencadeia | OpenAI | Você |
| Momento | Anunciado com minutos ou horas de antecedência | Quando você quiser |
| Expira se não for usado | Não se aplica | 30 dias depois de ser atribuído |
| Adia a data do reset semanal cerca de sete dias | Não documentado | Sim |
| Pode ficar sem valor por causa do outro tipo | Não | Sim |
Alguma coisa disto era dirigida ao Claude?
Era, e a OpenAI quase não escondeu essa parte. O calendário dos resets segue os marcos de utilizadores da própria OpenAI e é dois meses anterior ao Claude Fable 5, por isso a campanha não foi construída como resposta à Anthropic. A comparação está explícita noutro sítio: no material que a OpenAI publicou à volta do Sol e num reset anunciado como resposta direta a uma discussão pública.
A coincidência tentadora não se aguenta. A Anthropic lançou o Fable 5 a 9 de junho de 2026 [30] e a OpenAI lançou a acumulação de resets a 11 de junho, dois dias depois [16]. Ninguém desenha e constrói um programa de referências em 48 horas. A Anthropic suspendeu o acesso ao Fable 5 logo no dia seguinte, ao abrigo de uma diretiva norte-americana de controlo de exportações, e reabriu-o em todo o mundo a 1 de julho, com o modelo a contar até metade dos limites semanais nos planos Pro, Max, Team e alguns Enterprise até 7 de julho [31]. A campanha de resets decorreu antes, durante e depois de tudo isso.
É na página de lançamento do Sol que a intenção competitiva é inconfundível. O Claude Fable 5 aparece pelo nome tabela após tabela, e o texto escolhe bem os momentos: «O GPT-5.6 Sol com raciocínio máximo estabelece um novo recorde em 80, 2,8 pontos acima do Fable 5, usando menos de metade dos tokens de saída, demorando menos de metade do tempo e custando cerca de um terço menos» [18]. A mesma página traz uma linha que o texto nunca comenta: no SWE-Bench Pro, o Fable 5 fica nos 80,0% contra 64,6% do Sol [18]. Escolher qual é o benchmark que encabeça o anúncio é comportamento normal num lançamento. Ao leitor só faz falta saber de que tabela saiu o título.
O reset de 8 de agosto é o caso mais claro de um reset usado como gesto competitivo. Um utilizador afirmou que a Anthropic lhe tinha suspendido a conta por correr o Sol dentro do Claude Code, e Boris Cherny, da Anthropic, respondeu que ali ninguém é banido por usar o harness deles com outros modelos, aproveitando a ocasião para atirar um convite de emprego a Tibo [32]. Tibo respondeu citando essa mensagem e repondo os limites a toda a gente: «Exatamente, o GPT-5.6 Sol é excelente e pode usar-se praticamente em qualquer lado, incluindo no harness do CC. Para celebrar isso, e também o facto de eu não ir a lado nenhum… repus os limites de utilização de todos os utilizadores pagos do ChatGPT Work e do Codex» [33]. Minutos depois, um utilizador disse-lhe que o gesto era vazio, porque o reset semanal já tinha acontecido na véspera: «A esta altura isto é só para inglês ver» [34]. Tibo pegou na expressão e ficou com ela: «Na segunda-feira faço outro reset para inglês ver» [35]. Quando quem conduz a campanha adota a palavra do seu crítico, a questão do marketing fica arrumada.
A Anthropic nunca respondeu publicamente à comparação. O que fez, a 18 de julho, foi subir 50% os limites semanais do Claude Code até 19 de agosto, sem nomear a OpenAI uma única vez [36].
O que resolveria mesmo a questão
Uma medição que ninguém publicou: um plano, uma versão do modelo, um nível de esforço, um repositório, o mesmo conjunto de tarefas, ao longo de dois períodos semanais completos e sem um único reset pelo meio. Enquanto essa medição faltar, os números da OpenAI e a experiência dos seus utilizadores podem estar ambos certos, porque descrevem grandezas diferentes. Não é um sítio confortável para deixar uma discussão, mas é onde as provas acabam, e o motivo por que acabam ali é a própria campanha.
Portanto, digo-o desta maneira. A manobra de marketing era real, o problema de utilização era real e o confronto com a Anthropic era real, e cada uma destas três coisas está documentada pela própria OpenAI. O que não lhe posso mostrar é a decisão de usar a primeira para tapar a segunda. O que lhe posso mostrar é que foi isso que acabou por acontecer: o Codex passou de três para dez milhões de utilizadores em quinze semanas, as queixas mais ruidosas foram respondidas com um reforço gratuito em vez de um número, e a semana limpa de dados que teria resolvido a discussão nunca existiu.
Duas notas práticas, já que as datas de expiração daquele tópico do Reddit estão a dois dias. Faça uma captura de ecrã do painel de utilização, com o número de resets e a data de expiração, porque esse painel é servido do lado da OpenAI e é o único registo que você tem. E não use um banked reset num dia em que já tenha sido anunciado um reset global. O centro de ajuda é explícito: usar um banked reset completo move a sua data de reposição semanal para cerca de sete dias depois [3], por isso gastá-lo umas horas antes de um reforço gratuito custa-lhe a única coisa que o tornava valioso, que é escolher o momento.
Fontes
- On Sol using Codex limits faster than expected
- Open AI removes banked usage resets from Codex
- Using Codex with your ChatGPT plan
- ChatGPT Desktop Referral Promotions
- Comment reporting three removed banked resets and a support check
- Comment reporting an intact banked reset
- Confirmed reset bug
- Comment comparing a globally reset account with a second account
- Comment reporting both banked resets returning unprompted
- Banked usage limit reset credits not showing on ChatGPT web or desktop
- Comment quoting an OpenAI support reply
- Increased errors for some ChatGPT users
- On resetting usage limits at three million weekly Codex users
- On owing users another reset at the current growth pace
- On four million Codex users and another rate limit reset
- ChatGPT & Codex changelog
- Pricing
- GPT-5.6: Frontier intelligence that scales with your ambition
- On six million users and temporarily removing the five hour limit
- On seven million users and a banked reset for everyone
- On eight million users and another reset
- On nine million users and another reset
- On ten million users and another reset
- Subagents
- On reverting the Sol context size limit to 272k
- Restore GPT-5.6 Sol's 372k Codex context window, or provide an opt-in setting
- GPT-5.6 Sol
- Advancing the price-performance frontier with GPT-5.6
- OpenAI Screwed me on my resets
- Claude Fable 5 and Claude Mythos 5
- Redeploying Claude Fable 5
- On bans, harnesses and hiring
- On Sol in the Claude Code harness and a reset for all paid users
- On the reset being performative
- On doing another performative reset on Monday
- On keeping Claude Code weekly limits 50% higher