Bug no OpenAI Codex gera gravações excessivas em SSDs e levanta alerta sobre desgaste de hardware
- Cyber Security Brazil
- 4 de jul.
- 4 min de leitura

A OpenAI está trabalhando para corrigir uma falha no Codex que tem causado um volume excessivo de gravações em SSDs de usuários. O problema está ligado a uma implementação de logs locais baseada em SQLite, que passou a armazenar dados de diagnóstico em uma intensidade muito maior do que o previsto, gerando preocupação sobre desgaste prematuro de unidades de armazenamento.
SSDs possuem vida útil limitada, normalmente medida em TBW, sigla para terabytes written, ou terabytes gravados. Esse indicador estima quanto uma unidade pode receber de dados ao longo de sua operação antes de apresentar maior risco de degradação, queda de desempenho ou falhas. O valor varia conforme modelo, capacidade e fabricante, mas gravações constantes e desnecessárias podem consumir rapidamente parte dessa margem.
O alerta ganhou força após a abertura de um relatório de bug no repositório do agente de programação Codex. O título do issue já indicava a gravidade do comportamento observado: os logs de feedback em SQLite poderiam escrever cerca de 640 TB por ano e consumir rapidamente a resistência de SSDs.
O desenvolvedor Rui Fan, integrante do comitê de gerenciamento do projeto Apache Flink, relatou que, após cerca de 21 dias de uptime, o SSD principal de sua máquina havia registrado aproximadamente 37 TB de dados gravados. Verificações em nível de processo e arquivo indicaram que os logs SQLite do Codex eram o principal responsável pela escrita contínua.
Ao projetar esse ritmo para um ano, o volume chegaria a cerca de 640 TB. Em um SSD de 1 TB, isso representaria aproximadamente 640 gravações completas da unidade em 12 meses. Como alguns SSDs de consumo possuem garantia de resistência em torno de 600 TBW, esse comportamento poderia consumir praticamente toda a endurance coberta pela garantia em menos de um ano.
O problema não significa necessariamente que todos os usuários sofrerão o mesmo impacto. A escala do desgaste depende de fatores como frequência de uso do Codex, modelo do SSD, capacidade da unidade, configuração do ambiente, tempo de atividade e volume real de logs gerados. Ainda assim, o caso expõe um risco operacional relevante em ferramentas de IA executadas localmente em máquinas de desenvolvimento.
Outro desenvolvedor que participou da discussão afirmou que o próprio Codex analisou o uso de disco e estimou que o bug teria consumido US$ 38,64 em valor proporcional da vida útil de um SSD Samsung 990 NVMe de 2 TB. O mesmo usuário citou uma estimativa gerada pelo Codex segundo a qual a regressão poderia ter causado um consumo de endurance equivalente a alguns milhões de dólares entre usuários durante o período de março a junho.
Essa estimativa parte de uma conta econômica simples: o custo por terabyte gravado é calculado com base no preço do SSD dividido pela resistência nominal em TBW. Assim, quanto mais dados são escritos sem necessidade, maior é a parcela proporcional da vida útil consumida. Em um exemplo citado no texto original, um SSD de 1 TB avaliado em US$ 200 e com resistência de 600 TBW teria custo estimado de US$ 0,333 por terabyte gravado. Nesse cenário, os 37 TB registrados por Rui Fan representariam cerca de US$ 12,33 em desgaste proporcional.
Unidades maiores e mais caras, com ratings de TBW superiores, podem apresentar custo menor por terabyte escrito. Um SSD de 2 TB com resistência de 1.200 TBW, por exemplo, dilui melhor o impacto de cada gravação. Mesmo assim, o ponto central permanece: uma ferramenta de software não deveria gerar escrita contínua desnecessária a ponto de afetar a durabilidade de hardware dos usuários.
A falha está relacionada a logs diagnósticos locais, não diretamente à telemetria enviada à OpenAI. Em dezembro de 2025, desenvolvedores do Codex anunciaram planos para adicionar telemetria por padrão ao Codex CLI, exceto onde a prática fosse proibida por lei. O caso atual, porém, envolve registros armazenados no próprio dispositivo do usuário, criados para auxiliar engenheiros da empresa na investigação de problemas.
Esses logs permanecem localmente, a menos que sejam incluídos pelo usuário em um relatório de feedback. Ainda assim, por serem gerados em grande volume, acabaram produzindo atividade intensa de disco. Segundo a OpenAI, os registros tinham finalidade diagnóstica, mas dados de alto volume foram armazenados de uma forma que criou muito mais I/O do que o antecipado.
Um porta-voz da empresa confirmou que os engenheiros estão cientes do problema e trabalham em correções. Pull requests recentes no projeto indicam esforços para ajustar o comportamento dos logs e reduzir o volume de gravações. Apesar disso, usuários continuaram registrando problemas, o que sugere que a mitigação ainda exige validação adicional em diferentes ambientes.
A origem do comportamento parece estar associada a mudanças feitas em fevereiro para gravar logs SQLite do app-server no nível TRACE. Esse nível é muito mais detalhado do que níveis como ERROR, que registram apenas falhas mais graves. Em ferramentas distribuídas amplamente, manter logs em nível muito verboso pode causar impactos em desempenho, armazenamento, privacidade e durabilidade de dispositivos.
O caso também chama atenção porque a própria série de commits relacionada teria sido revisada pelo Codex, possivelmente executando GPT-5.3. Isso torna o episódio particularmente simbólico: uma ferramenta de IA usada para apoiar revisão de código não teria identificado adequadamente uma decisão de engenharia capaz de gerar desgaste significativo em hardware.
Para desenvolvedores, o incidente reforça a necessidade de monitorar o comportamento operacional de ferramentas de IA instaladas localmente. Agentes de programação podem executar processos persistentes, indexar projetos, observar arquivos, analisar código, manter estados locais e registrar diagnósticos continuamente. Mesmo sem intenção maliciosa, decisões inadequadas de logging podem gerar custos reais.
Em ambientes corporativos, o problema também tem implicações práticas. Máquinas de desenvolvimento e runners de CI já lidam com cargas intensas de I/O, builds, testes, containers, cache de dependências e ferramentas de análise. Um agente que grava dados continuamente pode afetar a confiabilidade desses endpoints, aumentar custos de suporte e reduzir a vida útil de equipamentos.
A recomendação para usuários do Codex é aplicar atualizações assim que correções forem disponibilizadas, monitorar o volume de escrita em disco e revisar diretórios de logs associados à ferramenta. Também é prudente observar processos com atividade contínua de I/O e avaliar configurações de logging até que o problema seja resolvido de forma definitiva.
O episódio mostra que ferramentas de IA para desenvolvimento precisam ser avaliadas não apenas pela produtividade que entregam, mas também pelo impacto sobre o sistema do usuário. Consumo de CPU, memória, rede, armazenamento e operações de escrita em disco passam a fazer parte da análise de segurança, governança e confiabilidade desses agentes.


