Harness realista
Executa o prompt verdadeiro com ferramentas stubadas, registrando decisões sem criar tickets, pedidos ou efeitos externos.
Avaliação de agentes
Um método e conjunto de templates para testar agentes com cenários, rubricas, juízes, torneios e múltiplas execuções antes de publicar uma mudança.
Por que existe
Os cenários descrevem uma única responsabilidade observável e os stubs devolvem contexto canônico sem tocar produção. Depois, juízes aplicam a mesma rubrica aos transcritos e o scorecard reúne resultados por dimensão. O torneio só é útil porque qualquer candidato também precisa preservar comportamentos que já funcionavam. A etapa final é cirúrgica: levar para o prompt real apenas a alteração que sobreviveu ao conjunto completo.
Para quem foi feito
Times que mantêm prompts de produção
Builders de agentes com ferramentas e políticas
Projetos que precisam impedir regressões comportamentais
O que entrega
Executa o prompt verdadeiro com ferramentas stubadas, registrando decisões sem criar tickets, pedidos ou efeitos externos.
Cada cenário define must e must_not; violações críticas limitam a pontuação mesmo quando a resposta soa convincente.
Alternativas atacam fraquezas por ângulos diferentes e são julgadas contra a suíte completa.
Baseline e candidato rodam várias vezes por caso para que variância não seja confundida com melhoria.
Como consumir
Congele prompt, cenários, stubs e scorecard para criar um baseline reproduzível.
Gere mudanças específicas para a fraqueza mais importante, não uma reescrita total intuitiva.
Compare candidatos em múltiplas rodadas e verifique dimensões que não deveriam mudar.
Aplique apenas a menor alteração que a evidência sustentou e mantenha o teste como regressão.
git clone https://github.com/luisroquette/ai-gym.gitLimites honestos
Próximo projeto
Coesa Auditoria
