Rust atropela Ruby, Go e Elixir em teste com IA, mas benchmark vira alvo de críticas

O criador do Ruby on Rails, David Heinemeier Hansson (DHH), provocou um debate entre desenvolvedores após publicar um experimento no qual agentes de inteligência artificial reescreveram e otimizaram o aplicativo de chat Campfire em Rust, Go e Elixir. Os resultados foram comparados com a implementação original desenvolvida em Ruby on Rails.
O teste foi divulgado semanas depois de DHH defender, durante a Rails World 2026, que os avanços da IA reduziram drasticamente a necessidade de desenvolvedores escreverem código manualmente.
Segundo DHH, cada reimplementação levou apenas algumas horas. Ele não revelou quais serviços ou modelos de IA foram utilizados, mas afirmou que o processo foi facilitado pelo tamanho relativamente compacto do código original do Campfire, escrito principalmente em Ruby.
Os números publicados chamaram atenção. No teste para servir uma página de sala do aplicativo, a implementação em Rust alcançou 36.260 requisições por segundo. Go registrou 3.860, Elixir chegou a 722 e Ruby on Rails ficou em 241 requisições por segundo.
Rust também terminou à frente nos outros quatro workloads avaliados, incluindo operações como pesquisar e publicar mensagens. A publicação e o gráfico compartilhados por DHH ultrapassaram 900 mil visualizações.
Para o criador do Rails, os resultados indicariam que reescrever aplicações em Rust — especialmente com agentes de IA realizando grande parte do trabalho — pode proporcionar ganhos expressivos de desempenho. DHH reconheceu, porém, que velocidade de execução não é o único critério para escolher uma linguagem.
Rust, por exemplo, pode apresentar tempos de compilação elevados e uma curva de aprendizado mais difícil. O próprio Rails surgiu em 2003, enquanto DHH desenvolvia o Basecamp, com a proposta de aproveitar Ruby para simplificar o desenvolvimento e aumentar a produtividade, mesmo sacrificando parte do desempenho.
A comparação, entretanto, rapidamente recebeu críticas de desenvolvedores que questionaram a metodologia utilizada. Parte da comunidade apontou que a implementação em Rust teria recebido muito mais trabalho de otimização após a geração inicial do código, enquanto as versões em Go e Elixir teriam permanecido próximas das primeiras respostas produzidas pelos agentes.
A engenheira do Google Jaana Dogan questionou publicamente os resultados, sugerindo que os números deveriam imediatamente levantar dúvidas sobre o que realmente estava sendo medido.
A reação da comunidade Elixir foi ainda mais prática. Desenvolvedores revisaram e reescreveram partes da implementação usada no experimento e conseguiram tornar seu desempenho comparável ao de Rust. Em alguns workloads, a versão otimizada em Elixir chegou a superar Rust, mesmo após otimizações adicionais feitas por terceiros no código Rust.
Defensores de Go levantaram críticas semelhantes. O argumento é que o benchmark não estaria comparando apenas as características das linguagens, mas também diferentes níveis de esforço aplicados a cada implementação. Em outras palavras, parte da vantagem observada poderia refletir quanto cada versão foi otimizada, e não exclusivamente o desempenho de Rust.
DHH respondeu que agentes avançados deveriam ser capazes de encontrar as otimizações necessárias por conta própria. Para ele, se os agentes não conseguem identificar os mecanismos necessários para tornar uma implementação em Elixir mais rápida, isso também seria relevante na avaliação de um cenário em que a IA assume parcela crescente da programação.
A controvérsia não invalida o argumento de que agentes de IA podem acelerar significativamente processos de reescrita e otimização de software. O experimento, porém, também evidencia uma limitação importante: código produzido por IA e benchmarks gerados a partir dele ainda dependem de metodologia consistente, revisão humana e condições equivalentes para que comparações de desempenho sejam confiáveis.



