Ferramentas para Devs

AMAP-ML cria ferramenta para manter agentes em tarefas longas

Projeto usa contexto novo, estado verificado e auditoria para levar agentes por aplicativos e terminal sem perder o progresso.

Quem deixa Claude Code ou Codex trabalhando por horas pode perder o progresso quando uma etapa falha ou o contexto cresce demais. O LongHorizon-Harness é uma ferramenta de código aberto que retoma tarefas longas com estado verificado e auditoria independente. A AMAP-ML criou o projeto em 2026-08-04. O repositório já tem 202 estrelas e atende equipes que usam agentes em aplicativos de desktop, navegador e linha de comando.

Manager, Executor e Auditor dividem a tarefa

O LongHorizon-Harness roda sobre agentes existentes. Ele não treina um modelo novo nem substitui Claude Code, Codex ou OpenClaw; organiza a execução, guarda o estado e verifica os resultados.

A arquitetura separa três funções. O Manager mantém o objetivo original, o progresso confirmado e o próximo passo. O Executor começa cada rodada com um contexto novo e trabalha em uma tarefa delimitada. O Auditor examina arquivos, interfaces, logs e testes no ambiente real.

O sistema só grava no estado persistente o resultado que passa pela verificação independente. Se uma ação falhar, o contexto for renovado ou o artefato não passar na inspeção, o sistema preserva o que já foi validado e retoma o restante.

Essa divisão reduz a dependência de um único histórico crescente. O agente não precisa carregar toda a tarefa em cada rodada. Ele recebe uma etapa, produz evidências e deixa o Auditor decidir se o resultado entra no estado confiável.

O projeto trabalha com Claude, GPT, Qwen e outros modelos expostos pelo backend escolhido. Claude Code, Codex CLI, OpenClaw e implementações próprias de AgentAdapter entram como backends. Manager, Executor e Auditor podem usar modelos diferentes.

O ambiente também pode ser local, ssh://user@host:port ou docker://container. A linguagem do projeto é Python. A licença é MIT.

A interface gráfica depende de um servidor MCP externo

O fluxo atravessa aplicativos gráficos e terminal. Um agente pode navegar no navegador, editar documentos, operar planilhas e usar software de design; depois, pode executar comandos, modificar código, instalar dependências e validar arquivos no terminal.

O LongHorizon-Harness não inclui uma implementação própria de computer use. Para controlar a interface gráfica, a equipe precisa conectar um servidor MCP externo compatível. Sem essa camada, o projeto não fornece sozinho os cliques, a digitação e a navegação na tela.

A adoção começa pela instalação do projeto e pela escolha do backend. O README informa instalação por um comando e integração com Claude Code, Codex e OpenClaw. Depois, a equipe configura o ambiente de execução e define os modelos ou adaptadores de cada papel.

Quem usa Claude Code pode configurar LH_HARNESS_CLAUDECODE_MCP_CONFIG e LH_HARNESS_CLAUDECODE_ADD_DIRS. A primeira variável informa a configuração do MCP; a segunda adiciona diretórios. Quando nenhuma configuração existe, o adaptador do Claude Code não acrescenta argumentos MCP.

Na primeira execução, o sistema cria rodadas com contexto novo e passa cada resultado pelo Auditor. O usuário deve esperar progresso registrado por evidências, não apenas uma resposta final do modelo. A tarefa pode começar no navegador, seguir para o terminal, produzir um artefato em um aplicativo e voltar ao terminal para depuração.

O projeto ainda tem pouca história para sustentar conclusões sobre estabilidade. O repositório AMAP-ML/LongHorizon-Harness foi criado em 2026-08-04 e registra idade de 0 dias. O último commit ocorreu em 2026-08-04, a versão mais recente é a v0.1.0, lançada na mesma data, e não há issues abertas.

As 202 estrelas e os 18 forks mostram interesse inicial, mas não comprovam maturidade operacional. A licença MIT permite usar, modificar e redistribuir o código conforme seus termos. A ferramenta não serve para quem procura um modelo novo ou um agente independente; ela coordena sistemas existentes e exige um MCP externo para automação gráfica.

Fontes

PythonMITFerramentas para DevsTrendshift
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.