---
title: "Por que contar passos deve ser tendência como métrica para expor a memória dos agentes de IA"
author: "Ricardo Pupo Larguesa"
date: "2026-06-16 12:18:00-03"
category: "Opinião"
url: "http://scale.press/portal/aintuicao/post/2026/06/16/por-que-contar-passos-deve-ser-tendencia-como-metrica-para-expor-a-memoria-dos-agentes-de-ia/md"
---

## Resumo
- Xiaomi MiMo Code mantém performance além de 200 passos enquanto Claude Code decai.
- Endurance gap mostra que falha de agentes vem de memória fraca, não de inteligência básica.
- Medir quantidade de passos expõe qualidade real de harnesses em tarefas longas.
- Benchmarks futuros devem adotar essa métrica para refletir uso em produção.
- Equipes ganham critério prático para rejeitar agentes que degradam rápido.

---

Xiaomi divulgou que seu MiMo Code supera Claude Code quando a tarefa exige mais de 200 passos. O dado chama atenção porque expõe uma fraqueza recorrente em coding agents: eles começam bem e depois se perdem.

## O que o endurance gap realmente mede

O problema não é só acerto ou erro na primeira tentativa. É a capacidade do agente de sustentar raciocínio ao longo de muitas iterações sem degradar. Quando o número de passos cresce, a qualidade cai porque a memória de trabalho do harness não acompanha. Em projetos reais na [T2S](https://t2s.com.br), já vi agentes promissores falharem exatamente nesse ponto: a primeira correção funciona, a segunda introduce regressão, a terceira ignora contexto anterior.

## Por que passos viram métrica útil

Benchmarks tradicionais focam em acurácia final ou tempo. Eles mascaram o custo de iterações longas. Contar passos força o agente a demonstrar persistência e qualidade de memória ao mesmo tempo. Isso é mais próximo do que acontece em produção, onde uma tarefa de refatoração pode exigir dezenas de interações com o código-base. Quem mede só sucesso final continua comprando ilusão de autonomia.

## O que muda na prática

Equipes que avaliam agentes agora têm critério concreto para decidir entre modelos ou frameworks. Se o harness perde coerência depois de 50 passos, ele não serve para fluxos reais de manutenção ou migração. Isso também pressiona fornecedores a investirem em mecanismos de compressão de contexto e recuperação seletiva, em vez de só aumentar janela de tokens. O resultado é menos retrabalho humano e menos surpresas em produção.

Link para o artigo original: [https://thenewstack.io/coding-agent-endurance-gap/](https://thenewstack.io/coding-agent-endurance-gap/)

Conecte-se comigo em [https://linktr.ee/ricardo.pupo](https://linktr.ee/ricardo.pupo). Meu livro Engenharia de Prompt para Devs está em [https://www.casadocodigo.com.br/products/livro-engenharia-de-prompt](https://www.casadocodigo.com.br/products/livro-engenharia-de-prompt).