Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

iTechGuides is reader-supported. When you buy through links on our site, we may earn an affiliate commission. As an Amazon Associate I earn from qualifying purchases. Learn more

Um agente de programação que recebe uma edição pequena costuma agir como se recebesse uma tarefa complexa: lê muitos arquivos, monta um contexto amplo e gasta tokens antes de mexer em uma linha. Um artigo de Junjie Yin e Xinyu Feng, listado pela Microsoft Research como publicação de julho de 2026, propõe um caminho diferente. O método se chama E3 (Estimate, Execute, Expand): estimar um ponto de partida, tentar a execução mínima viável e ampliar o escopo somente quando a verificação mostrar que a primeira tentativa não bastou. Em um benchmark controlado, os autores relatam a mesma taxa de sucesso da linha de base mais forte com custo, tokens e arquivos inspecionados bem menores. Esses números pertencem àquele ambiente de teste, e o restante deste texto explica por quê.

O que significa “stage 3 na fatura”

A expressão é uma metáfora editorial para esforço que se acumula sem necessidade. Ela não é uma categoria de cobrança, um plano tarifário, um estágio de maturidade ou uma etapa técnica do artigo. O que se paga a mais, nesse cenário, são tokens, tempo de execução e arquivos lidos por um agente que pensou mais do que a tarefa exigia.

O problema que o artigo descreve

Agentes de programação costumam tratar cada pedido com o mesmo repertório, independentemente da dificuldade real. Antes de agir, eles podem abrir muitos arquivos, carregar contexto extenso e gerar várias tentativas. Em tarefas simples, boa parte desse trabalho não altera o resultado. O título original do artigo faz a pergunta diretamente: “Do AI agents know when a task is simple?”. Em português, a versão equivalente seria “Agentes de IA sabem quando uma tarefa é simples?”.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

A hipótese central é que o esforço deveria acompanhar a dificuldade estimada. Gastar mais contexto não garante ganho proporcional em uma tarefa simples, e a ampliação só se justifica quando há evidência de que o caminho inicial falhou.

Como funciona o E3

O nome reúne as três fases do método. Elas formam um ciclo que começa estreito e só se abre quando a verificação exige.

1. Estimate: definir o ponto de partida

O agente estima onde começar a execução, com base no escopo aparente da tarefa. A proposta não é abrir contexto amplo por precaução automática. O ponto inicial é deliberadamente pequeno.

2. Execute: tentar o caminho mínimo viável

Nessa fase, o agente tenta resolver a tarefa com o mínimo de leitura e de tentativas que ainda pode ser verificado. Se a verificação passar, o trabalho termina ali.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

3. Expand: ampliar só quando a verificação falha

Quando a verificação indica que a primeira tentativa não bastou, o escopo cresce: mais arquivos, mais contexto e nova tentativa. A expansão é motivada por evidência concreta, e não por reflexo.

O que os números medem

Os resultados principais vêm do MSE-Bench, um benchmark determinístico com 121 tarefas de edição em simulador de capacidades controladas. As percentagens abaixo são comparações dentro desse benchmark, e não estimativas de economia na fatura de um sistema qualquer.

Métrica Resultado relatado pelos autores Escopo da medição
Taxa de sucesso Igual à da linha de base mais forte (100%) MSE-Bench, 121 tarefas em simulador; relatado pelos autores, 2026
Custo 85% menor Mesmo benchmark; o resumo não detalha a definição exata de custo
Tokens consumidos 91% menor Mesmo benchmark
Arquivos inspecionados 92% menor Mesmo benchmark

A leitura correta é que a eficiência só conta quando a tarefa continua correta. Por isso o sucesso aparece como primeira coluna: economizar tokens sem resolver o problema não é ganho.

O teste com um agente real

Além do simulador, o artigo descreve um teste complementar chamado LLM-Case. Nele, um agente baseado em GPT-4o edita uma biblioteca de código aberto, e os patches são verificados pela suíte de testes do próprio projeto. Segundo os autores, a leitura excessiva foi mais moderada nesse caso real do que no simulador, e o E3 foi a política mais enxuta e mais rápida, com sucesso comparável ao das demais.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

Esse teste amplia a evidência, mas continua sendo um caso específico: um modelo, uma biblioteca e um conjunto de testes. Ele não mede a programação assistida como um todo.

Independent reader supportYour contribution helps us test, update, and keep practical guides available for everyone.Support on Ko-Fi

Limites da evidência

  • Os autores descrevem a pesquisa como uma investigação controlada de redundância de execução. Na formulação deles: “We frame this as a controlled probe of execution redundancy, not a measurement of any deployed agent.”
  • O resultado mais forte vem de um simulador com 121 edições determinísticas. Ambientes reais têm ambiguidades, dependências e testes que um benchmark não reproduz.
  • O teste com modelo real usa um único agente e uma única biblioteca de código aberto. Os próprios autores indicam que o efeito foi mais moderado nesse caso.
  • Os resultados não permitem prever a economia de uma equipe ou de uma tarefa empresarial específica.
  • O resumo não é suficiente para reconstruir todos os detalhes de cálculo ou as condições experimentais.

Como avaliar o esforço do seu próprio agente

Se você quer testar a ideia em um fluxo próprio, compare pelo menos estes eixos, sempre com as mesmas tarefas e a mesma definição de custo:

  • Taxa de sucesso, verificada pela suíte de testes ou por critério objetivo;
  • Custo, com a fórmula escrita antes do experimento;
  • Tokens consumidos por tarefa;
  • Arquivos ou contexto inspecionados;
  • Latência até a verificação passar;
  • Comportamento quando a estimativa inicial falha, incluindo quantas expansões ocorreram e quanto custaram.

O último eixo é o que separa uma política de escopo progressivo de uma simples redução de contexto. Um agente que economiza nas tarefas fáceis, mas falha silenciosamente nas difíceis, não está usando o método de forma adequada.

Fontes e disponibilidade

O artigo é de Junjie Yin e Xinyu Feng, e a Microsoft Research o lista como publicação de julho de 2026. Os autores também disponibilizam código e recursos de benchmark em repositório próprio. O resumo consultado não descreve um produto comercial ou uma implementação pronta para uso, e não há evidência de que o E3 esteja incorporado a algum agente comercial.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

Product prices and availability are accurate as of the date/time indicated and are subject to change. Any price and availability information displayed on Amazon at the time of purchase will apply.